Prompting & Reasoning · NeurIPS 2022 2022
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
중간 추론 단계를 쓰게 하면 거대 모델의 수학·상식·기호 추론이 급상승.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
어려운 수학 문제에서 “답만 써” 라고 하면 틀리는데, “풀이 과정을 써 봐” 라고 하면 맞힙니다. 큰 모델일수록 이 효과가 극적입니다.
무엇을 제안했나
- Chain-of-Thought 프롬프팅 — few-shot 예시에 중간 추론 단계를 함께 넣어, 모델이 답 전에 단계를 쓰게 유도.
- 재학습·파인튜닝 없음. 프롬프트만 바꿈.
그래서 무엇이 달라졌나
- 산수·상식·기호 추론 정확도가 크게 상승(예: GSM8K 초등 수학이 몇 배).
- 이 능력은 약 100B+ 규모에서 창발 — 작은 모델에선 거의 효과 없음.
더 공부할 가치가 있을까?
- LLM 추론·프롬프팅에 관심 있다면 매우 유용 — self-consistency, ReAct, tree-of-thought 등 후속의 출발점.
- 먼저 볼 것 — few-shot 자체인 GPT-3.
3. 배경 · 문제
LLM은 단순 QA에는 강하지만 다단계 추론(수학 문장제·상식 종합·기호 연쇄)에서 자주 실패. 모델만 키워도 이런 태스크의 스케일링은 평평한 경우가 많았습니다.
다단계 추론의 벽
태스크와 풀이 방식을 바꿔 보세요.
사과 5개 −3 +2 → 직접 답하면 실수 빈발.
다단계 산술·상식·기호 연쇄에서 오류가 잦음. 크기만 키워도 스케일 곡선이 평평할 수 있음.
4. Chain-of-Thought
프롬프트 스타일
세 가지 프롬프트를 비교하세요.
Q: parking … 15 … +17 … −10 … ? A: start 15. +17 → 32. −10 → 22. Answer: 22 Q: [new problem] A: [reason … Answer: …]
예시가 추론 경로를 보여 줌 → 모델이 같은 형식으로 전개.
Zero-Shot CoT (Kojima et al., 2022): 예시 없이 Let's think step by step만 붙여도 효과.
5. 실험 결과
벤치: GSM8K·SVAMP·ASDiv·AQuA (수학), CommonsenseQA·StrategyQA (상식), Last Letter·Coin Flip (기호). 모델: GPT-3 175B, PaLM 540B, LaMDA 137B 등.
GSM8K
표준 vs CoT 비교 · 또는 Self-Consistency.
논문 Table 1 (계산기 없음). *text-davinci-002. 노트 표의 GPT-3 표준 17.9는 PaLM 표준과 혼동 — 실제 15.6.
창발: 스케일 × CoT
크기 구간을 고르세요 (도식).
GPT-3 175B 15.6→46.9, PaLM 540B 17.9→56.9 (Table 1).
막대 높이는 상대 이득 도식 — 절대 정확도 아님.
6. Self-Consistency (후속)
Wei et al. CoT의 확장 — Wang et al. (2022). 같은 문제에 여러 CoT 경로를 샘플하고 최종 답만 다수결.
Self-Consistency
경로 수를 늘리면 다수결이 바뀝니다 (도식).
PaLM 540B GSM8K: CoT 56.9% → SC 74.4% (Wang et al.). 도식 경로입니다.
7. 왜 작동 · 유산
왜 · 다음에 뭐가
작동 이유와 후속 연구를 골라 보세요.
왜 작동하나
후속
중간 토큰 생성이 추가 계산 예산처럼 작동.
Tree of Thoughts · 2023트리로 여러 경로 탐색
유산
- 프롬프트 엔지니어링을 추론으로 끌어올린 핵심 논문
- 재학습 없이 추론 유도 → API/로컬 LLM 실무 표준
- 창발적 능력·스케일링 논의의 촉매
- GPT-4·Gemini 등도 CoT식 중간 사고를 내장/유도
- Constitutional AI는 선호 라벨에 “Let’s think step-by-step” CoT를 씀
범위 주의
- Zero-Shot CoT는 Kojima et al. (2022)
- Self-Consistency는 Wang et al. (2022) 후속
| Idea | Role |
|---|---|
| CoT | Reasoning steps before the answer |
| Few-shot CoT | Exemplars with worked steps |
| Zero-Shot CoT | “Let’s think step by step” (Kojima) |
| Self-Consistency | Majority vote over paths (Wang) |
| Emergence | Clear gains mainly at large scale |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. Chain-of-Thought 프롬프팅이란?
2. CoT가 특히 이득을 주는 태스크는?
3. CoT의 창발(emergence)에 대한 관찰은?
4. Self-Consistency(후속 기법)는 무엇을 하나?
5. CoT가 작동하는 이유에 대한 유력한 설명은?