LLM Evolution · arXiv 2023 2023

LLaMA: Open and Efficient Foundation Language Models

공개 데이터 + 소형·과학습 — 13B가 GPT-3(175B)를 많은 벤치에서 능가.

Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, et al. · Meta AI

llamaopen-sourceropeswiglurmsnorm

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

비싼 독점 재료 없이 마트에서 살 수 있는 재료(공개 데이터) 만으로, 작지만 오래 끓인 요리가 훨씬 큰 유명 레스토랑 요리(GPT-3 175B)를 이깁니다.

무엇을 제안했나

  • 공개 데이터만 사용(CommonCrawl·위키·GitHub·arXiv 등), 재현 가능.
  • Chinchilla식 작은 N + 많은 토큰 + 효율 부품(RoPE 위치 임베딩, SwiGLU, RMSNorm).

그래서 무엇이 달라졌나

  • LLaMA-13B 가 다수 벤치에서 175B GPT-3 를 능가 — 작아서 한 대의 GPU에서도 돌릴 만함.
  • 오픈 LLM 생태계의 기원 — Alpaca·Vicuna·Llama 2/3, 그리고 수많은 파인튜닝.

더 공부할 가치가 있을까?

  • 오픈 LLM을 쓰거나 파인튜닝한다면 필수 — 지금 대부분의 오픈 모델이 이 계보입니다.
  • 먼저 볼 것 — Chinchilla(이 논문의 학습량 근거).

3. 동기

2023초 GPT-3/4·PaLM·Gopher·Chinchilla는 가중치 비공개. 연구·자체 학습·로컬 배포가 막혀 있었습니다.

LLaMA의 목표

닫힌 거인들 사이에서 연 세 가지. 목표를 고르세요.

비공개 가중치
GPT-3/4PaLMGopherChinchilla
공개 데이터

CommonCrawl·C4·Wiki·GitHub 등만 — 라이선스 부담을 줄임.

공개 데이터 · 추론 효율 · 연구 공개.

4. 아키텍처

베이스는 Transformer 디코더(GPT 계열). GPT-2/3 대비 세 가지 핵심 변경.

RMSNorm(x)=xRMS(x)γ,RMS(x)=1H∑ixi2\mathrm{RMSNorm}(x)=\frac{x}{\mathrm{RMS}(x)}\gamma,\quad \mathrm{RMS}(x)=\sqrt{\frac{1}{H}\sum_i x_i^2}
Pre-RMSNorm — 평균 없이 RMS만 (계산 ~30%↓)
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
SwiGLU(x)=Swish(xW+b)⊙(xV+c),Swish(x)=xσ(x)\mathrm{SwiGLU}(x)=\mathrm{Swish}(xW+b)\odot(xV+c),\quad \mathrm{Swish}(x)=x\sigma(x)
ReLU→SwiGLU · FFN 너비 ≈⅔×4d로 파라미터 유지
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명
fq,k(xm,m)=Rmxmf_{q,k}(x_m, m) = R_m x_m
RoPE — 회전으로 상대 위치 · 긴 컨텍스트 외삽
RoPE (회전 위치)수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

디코더 세 가지 변경

GPT 계열 위에 올린 표준 레시피. 항목을 고르세요.

Pre-RMSNorm
  • Post-LN → Pre-LN 위치 + LayerNorm → RMSNorm
  • 평균 제거 없이 RMS만 · 계산 ~30% 절감, 성능 유사
Pre-RMSNorm · SwiGLU · RoPE.

5. 학습 데이터

공개 데이터 믹스

토큰 비중·에폭. 소스를 클릭하세요.

비중67%
에폭1.10
D≈1.0–1.4T
CommonCrawl

에폭은 1.4T 기준(논문 Table 1). 학습: 7B·13B ≈1.0T, 33B·65B ≈1.4T. Wiki·Books는 반복↑.

공개 코퍼스만 · 7B·13B ≈1.0T, 33B·65B ≈1.4T.

6. 모델 크기

모델 스펙

크기를 고르면 레이어·차원·토큰이 보입니다.

레이어32
은닉4096
헤드32
ctx2048
D1.0T
D / N~143×

논문 Table 2: 7B·13B = 1.0T, 33B·65B = 1.4T. Chinchilla ~20× 대비 과학습(특히 7B·13B).

7B→65B · ctx 2048 · 33B/65B는 1.4T.

7. 실험 결과

벤치마크

상식·코드·수학을 전환하세요.

Zero-shot · BoolQ / PIQA / HellaSwag / WinoGrande

GPT-3 175B
60.5%
LLaMA-13B
78.1%
LLaMA-65B
85.3%

논문 Table 3 (0-shot). 13B가 GPT-3를 대부분에서 능가(PIQA만 소폭 낮음).

상식 추론 · 코드 · 수학.

8. 생태계 · 유산

파생 생태계

타임라인 노드를 고르세요.

LLaMA · 2023.02

7B–65B · 공개 데이터 · 연구 라이선스. 생태계의 뿌리.

Dolly 2.0은 Pythia 기반(노트) — LLaMA 직계는 아님.

Alpaca · Vicuna · Llama 2/3.

유산

  • 연구·로컬 배포(llama.cpp, Ollama) 촉발
  • LoRA / QLoRA 파인튜닝의 실질 기반
  • GPT-3 대비 ~10× 작은 13B로 유사 성능(논문) → 추론 비용 절감
  • Vicuna → LLaVA 멀티모달 백본

후속

  • Llama 2: 70B · 상업 라이선스 · RLHF Chat · ctx 4096
  • Llama 3: 8B/70B · 15T tok · vocab 128K · ctx 8192
  • Mistral 등도 같은 오픈·효율 계열
IdeaRole
RMSNormPre-norm · no mean · cheaper
SwiGLUGated FFN vs ReLU
RoPERelative position via rotation
Overtraining1.0–1.4T tokens on small N
Open weightsPublic data · research release

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. LLaMA의 목표는?

  2. 2. LLaMA가 표준 Transformer에서 바꾼 것은?

  3. 3. LLaMA와 Chinchilla 스케일링의 관계는?

  4. 4. LLaMA의 대표적 결과는?

  5. 5. LLaMA가 생태계에 미친 영향은?