Prompting & Reasoning · NeurIPS 2022 2022

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

중간 추론 단계를 쓰게 하면 거대 모델의 수학·상식·기호 추론이 급상승.

Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, et al. · Google Research / Google Brain

cotpromptingreasoningemergentself-consistency

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

어려운 수학 문제에서 “답만 써” 라고 하면 틀리는데, “풀이 과정을 써 봐” 라고 하면 맞힙니다. 큰 모델일수록 이 효과가 극적입니다.

무엇을 제안했나

  • Chain-of-Thought 프롬프팅 — few-shot 예시에 중간 추론 단계를 함께 넣어, 모델이 답 전에 단계를 쓰게 유도.
  • 재학습·파인튜닝 없음. 프롬프트만 바꿈.

그래서 무엇이 달라졌나

  • 산수·상식·기호 추론 정확도가 크게 상승(예: GSM8K 초등 수학이 몇 배).
  • 이 능력은 약 100B+ 규모에서 창발 — 작은 모델에선 거의 효과 없음.

더 공부할 가치가 있을까?

  • LLM 추론·프롬프팅에 관심 있다면 매우 유용 — self-consistency, ReAct, tree-of-thought 등 후속의 출발점.
  • 먼저 볼 것 — few-shot 자체인 GPT-3.

3. 배경 · 문제

LLM은 단순 QA에는 강하지만 다단계 추론(수학 문장제·상식 종합·기호 연쇄)에서 자주 실패. 모델만 키워도 이런 태스크의 스케일링은 평평한 경우가 많았습니다.

다단계 추론의 벽

태스크와 풀이 방식을 바꿔 보세요.

Q→
A?
수학 문장제

사과 5개 −3 +2 → 직접 답하면 실수 빈발.

다단계 산술·상식·기호 연쇄에서 오류가 잦음. 크기만 키워도 스케일 곡선이 평평할 수 있음.

직접 답 vs 단계적 사고.

4. Chain-of-Thought

프롬프트 스타일

세 가지 프롬프트를 비교하세요.

Few-shot CoT
Q: parking … 15 … +17 … −10 … ?
A: start 15. +17 → 32. −10 → 22. Answer: 22
Q: [new problem]
A: [reason … Answer: …]

예시가 추론 경로를 보여 줌 → 모델이 같은 형식으로 전개.

표준 · Few-shot CoT · Zero-Shot CoT.

Zero-Shot CoT (Kojima et al., 2022): 예시 없이 Let's think step by step만 붙여도 효과.

5. 실험 결과

벤치: GSM8K·SVAMP·ASDiv·AQuA (수학), CommonsenseQA·StrategyQA (상식), Last Letter·Coin Flip (기호). 모델: GPT-3 175B, PaLM 540B, LaMDA 137B 등.

GSM8K

표준 vs CoT 비교 · 또는 Self-Consistency.

GPT-3 175B*
표준
15.6%
CoT
46.9%
PaLM 540B
표준
17.9%
CoT
56.9%

논문 Table 1 (계산기 없음). *text-davinci-002. 노트 표의 GPT-3 표준 17.9는 PaLM 표준과 혼동 — 실제 15.6.

GSM8K Table 1: 표준 vs CoT (+ SC 후속).

창발: 스케일 × CoT

크기 구간을 고르세요 (도식).

극적인 향상

GPT-3 175B 15.6→46.9, PaLM 540B 17.9→56.9 (Table 1).

막대 높이는 상대 이득 도식 — 절대 정확도 아님.

창발: 소형은 해로울 수 · 이득은 큰 스케일에서.

6. Self-Consistency (후속)

Wei et al. CoT의 확장 — Wang et al. (2022). 같은 문제에 여러 CoT 경로를 샘플하고 최종 답만 다수결.

a^=arg⁡max⁡a∑i=1m1[ai=a]\hat{a} = \arg\max_{a} \sum_{i=1}^{m} \mathbf{1}[a_i = a]
경로 다수결 (Wang et al., 2022)
Self-Consistency 다수결수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

Self-Consistency

경로 수를 늘리면 다수결이 바뀝니다 (도식).

15+17=32 −10→ 22
15−10=5 +17→ 22
17−10=7 +15→ 22
15+17−5→ 27
10+17−15→ 12
a = 223/5
a = 271/5
a = 121/5
â = 22 (다수결)

PaLM 540B GSM8K: CoT 56.9% → SC 74.4% (Wang et al.). 도식 경로입니다.

경로 샘플 → 다수결.

7. 왜 작동 · 유산

왜 · 다음에 뭐가

작동 이유와 후속 연구를 골라 보세요.

왜 작동하나

후속

계산 할당

중간 토큰 생성이 추가 계산 예산처럼 작동.

Tree of Thoughts · 2023

트리로 여러 경로 탐색

계산 할당 · 분해 · ToT/ReAct 등.

유산

  • 프롬프트 엔지니어링을 추론으로 끌어올린 핵심 논문
  • 재학습 없이 추론 유도 → API/로컬 LLM 실무 표준
  • 창발적 능력·스케일링 논의의 촉매
  • GPT-4·Gemini 등도 CoT식 중간 사고를 내장/유도
  • Constitutional AI는 선호 라벨에 “Let’s think step-by-step” CoT를 씀

범위 주의

  • Zero-Shot CoT는 Kojima et al. (2022)
  • Self-Consistency는 Wang et al. (2022) 후속
IdeaRole
CoTReasoning steps before the answer
Few-shot CoTExemplars with worked steps
Zero-Shot CoT“Let’s think step by step” (Kojima)
Self-ConsistencyMajority vote over paths (Wang)
EmergenceClear gains mainly at large scale

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. Chain-of-Thought 프롬프팅이란?

  2. 2. CoT가 특히 이득을 주는 태스크는?

  3. 3. CoT의 창발(emergence)에 대한 관찰은?

  4. 4. Self-Consistency(후속 기법)는 무엇을 하나?

  5. 5. CoT가 작동하는 이유에 대한 유력한 설명은?