LLM Evolution · JMLR 2020 2020
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer — T5
모든 NLP를 text→text로 통일 · C4 · span 마스킹 · 11B로 다수 SOTA.
1. 핵심 요약
2. 왜 중요한가 — 쉬운 설명
30초 비유
번역·요약·분류·질문답변을 전부 “글을 넣으면 글이 나온다” 는 하나의 형식으로 통일합니다. 태스크는 문장 앞에 붙이는 이름표(prefix) 로만 구분합니다 — "translate English to German: ...".
무엇을 제안했나
- Text-to-Text 프레이밍 — 모든 NLP 태스크를 입력 문자열 → 출력 문자열로.
- C4 정제 웹 코퍼스 + span corruption(연속 토큰 덩어리를 가리고 복원) 사전학습.
- 아키텍처·목표·데이터를 바꿔 가며 한 대규모 비교 실험.
그래서 무엇이 달라졌나
더 공부할 가치가 있을까?
- NLP를 통합 관점에서 보고 싶다면 — 인코더-디코더가 어디에 유리한지 감이 옵니다.
- 바쁘면 핵심 아이디어(“모든 걸 text→text로”)만 기억해도 충분합니다.
3. 배경 · 파편화
2018–19 전이학습은 태스크마다 헤드가 달랐습니다: 분류([CLS]+softmax), 생성(LM), 번역(enc–dec), 추출 QA(span start/end).
파편화 → 통일
예전 태스크 헤드를 고른 뒤, T5의 한 형식을 보세요.
prefix: input → output text
T5는 헤드를 바꾸지 않고 prefix만 바꿉니다 — 한 체크포인트·한 학습 루프.
4. Text-to-Text
Prefix로 태스크 지정
태스크를 고르면 입·출력이 바뀝니다.
translate English to German: The house is wonderful.
Das Haus ist wunderbar.
논문식 prefix (sst2·translate·summarize·question). 분류 헤드 대신 토큰 생성.
5. 아키텍처 · Span
완전한 인코더–디코더 Transformer + 상대 위치. 사전학습은 토큰 MLM 대신 span corruption.
아키텍처 bake-off
세 스택을 비교하세요 (상대 이득 도식).
선택: 완전한 인코더 + 자기회귀 디코더 · 상대 위치. 생성·이해 모두에 균형.
목표: span(평균 길이 3)이 i.i.d. 마스킹과 비슷·소폭↑. 상대 위치 임베딩 사용. 막대는 도식.
Span corruption
단계를 따라 마스킹을 보세요.
The [X] on [Y]
마스킹된 span → sentinel ([X], [Y]).
논문: 평균 span 길이 3, ~15% 토큰 오염. 토큰 MLM보다 타깃이 짧아 학습이 효율적.
6. C4 · 모델 크기
C4 (Colossal Clean Crawled Corpus): Common Crawl → ~750GB 정제 영문. 비문·코드·짧은 문장·욕설 필터. 이후 수많은 LM의 공개 웹 코퍼스 선구자.
모델 스펙
크기를 고르세요. 3B/11B는 깊이 같고 폭(FFN·헤드)이 다름.
데이터: C4 ~750GB. 스케일업할수록 GLUE/SuperGLUE·생성 태스크가 꾸준히↑ (Table 14).
7. 실험 · 유산
체계적 비교: 아키텍처 · 사전학습 목표 · 데이터 · 파인튜닝. 결론 — enc–dec · span corruption(소폭·효율) · 더 많은 데이터+큰 모델.
결과 · 유산
SuperGLUE / GLUE / 유산을 전환하세요.
SuperGLUE test · T5-11B (Table 14)
Table 14: 88.9 ≈ 인간 89.8(거의 근접 — 노트 ‘초월’은 과장). 노트 90.3은 GLUE. Prior avg=RoBERTa 84.6. CB Acc 93.9.
결과 정리
- SuperGLUE 88.9 (이전 84.6) — 인간 89.8에 거의 근접(초월은 아님)
- GLUE 90.3 — 노트 표의 ‘평균 90.3’은 이쪽
유산
- 통합 프레임워크 → FLAN · InstructGPT · 지시형 LLM의 ‘한 형식’
- C4 공개 → 후속 오픈 웹 코퍼스에 영향
- FLAN-T5: 지시 튜닝과 결합
| Idea | Role |
|---|---|
| Text-to-Text | Every NLP task as string→string |
| Prefix | Task name in the input text |
| Span corruption | Mask contiguous spans |
| C4 | ~750GB cleaned Common Crawl |
| Enc–Dec | Wins bake-off for generation |
이해도 점검
보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.
1. T5의 Text-to-Text 프레임이란?
2. T5의 아키텍처는?
3. T5의 사전학습 목표는?
4. C4 데이터셋이란?
5. T5 연구의 결론은?