Foundations · ICLR 2013
Efficient Estimation of Word Representations in Vector Space
단어를 조밀 벡터로 배워 의미 유추(왕−남자+여자≈여왕)를 가능하게 한 임베딩.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
단어를 좌표(벡터)로 바꾸되, 비슷한 맥락에서 쓰이는 단어끼리 가깝게 놓습니다. 그러면 좌표 뺄셈·덧셈이 의미로 통합니다 — “왕 − 남자 + 여자 ≈ 여왕”.
무엇을 제안했나
- CBOW / Skip-Gram — 주변 단어로 가운데 단어를 맞추거나(그 반대), 그 과정에서 좋은 벡터가 학습됨.
- Negative Sampling — 전체 어휘 대신 “틀린 단어 몇 개”만 대비해 학습을 수십 배 빠르게.
그래서 무엇이 달라졌나
- 단어를 조밀한 의미 벡터로 표현하는 방식이 표준이 됨 — 이후 모든 NLP 모델의 입력 표현.
- “임베딩(embedding)”이라는 개념을 대중화.
더 공부할 가치가 있을까?
- 기초용 — NLP 입문이나 임베딩 개념을 잡는 데 좋습니다.
- 다음 단계 — 요즘 주류는 문맥에 따라 벡터가 바뀌는 BERT식 문맥 임베딩입니다.
3. 배경: 단어의 수치 표현
원-핫은 |V|차원·희소이고, 단어끼리 직교라 의미 관계가 없습니다. 분포 가설(Firth): 같은 문맥의 단어는 의미가 비슷하다.
One-Hot vs 임베딩
원-핫은 직교·희소. 임베딩은 조밀하고 비슷한 단어가 가깝습니다 (설명용 2D).
0|V|=5원-핫은 |V|차원·희소. Word2Vec은 보통 100~300차원 조밀 벡터.
분포 가설 · 문맥 윈도우
“You shall know a word by the company it keeps” — 같은 문맥의 단어는 의미가 비슷합니다.
riceI, ate, with, kimchi논문 설정 예: 윈도우 5, 구글 뉴스 ~1000억 단어.
4. CBOW와 Skip-Gram
CBOW vs Skip-Gram
같은 윈도우라도 학습 쌍 개수가 다릅니다. Skip은 문맥마다 1쌍 → 더 느림.
(rice → I)(rice → ate)(rice → with)(rice → kimchi)~2c (=4)17K w/s72.6%논문 표: NNLM 33.4% / 1.8K w/s 대비 큰 폭 개선.
5. 효율적 학습 기법
Negative Sampling
비용 O(W) vs 1+k. 아래는 토이 내적으로 σ(v·v) — 긍정↑·부정↓를 한 스텝 흉내냅니다.
~100,000~616667×0.7050.4630.4630.3540.5740.5221.005Hierarchical Softmax는 O(log W). 서브샘플링은 고빈도 단어를 확률적으로 드롭.
Hierarchical Softmax: 어휘를 허프만 트리로 두어 소프트맥스를 O(W)→O(log W)로 줄입니다.
6. 학습된 임베딩의 특성
벡터 산술 유추
A−B+C ≈ D. 주황=관계 B→A, 초록=같은 관계를 C에 적용 → 별(결과).
king−man+womanqueen ✓0.014점선은 계산 결과와 목표 D의 거리입니다.
| Model | Analogy accuracy |
|---|---|
| CBOW | 61.0% |
| Skip-Gram | 72.6% |
| Neural Net LM | 55.9% |
7. 실험 결과
구글 뉴스 ~1000억 단어, 어휘 100만, 차원 300, 윈도우 5.
| Model | Accuracy | Speed |
|---|---|---|
| NNLM | 33.4% | 1.8K w/s |
| RNN LM | 32.9% | 2.4K w/s |
| CBOW | 61.0% | 163K w/s |
| Skip-Gram | 72.6% | 17K w/s |
8. 영향 및 발전
임베딩 계보
Word2Vec → GloVe → FastText → ELMo → LLM 토큰 임베딩.
조밀 벡터 + 문맥 예측. CBOW / Skip-Gram.
| Concept | Idea |
|---|---|
| Distributional hyp. | Same context ⇒ similar meaning |
| Skip-Gram | Center → context |
| CBOW | Context → center |
| Negative Sampling | 1 positive + k negatives |
| Embedding dim | Often 100–300 (LLM origin) |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. 분포 가설(distributional hypothesis)이란?
2. CBOW와 Skip-gram의 차이는?
3. Negative sampling이 해결하는 문제는?
4. 서브샘플링(subsampling of frequent words)이 하는 일은?
5. 이 보여주는 것은?