LLM Evolution · JMLR 2020 2020

Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer — T5

모든 NLP를 text→text로 통일 · C4 · span 마스킹 · 11B로 다수 SOTA.

Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, et al. · Google

t5text-to-textc4span-corruptiontransfer

1. 핵심 요약

2. 왜 중요한가 — 쉬운 설명

30초 비유

번역·요약·분류·질문답변을 전부 “글을 넣으면 글이 나온다” 는 하나의 형식으로 통일합니다. 태스크는 문장 앞에 붙이는 이름표(prefix) 로만 구분합니다 — "translate English to German: ...".

무엇을 제안했나

  • Text-to-Text 프레이밍 — 모든 NLP 태스크를 입력 문자열 → 출력 문자열로.
  • C4 정제 웹 코퍼스 + span corruption(연속 토큰 덩어리를 가리고 복원) 사전학습.
  • 아키텍처·목표·데이터를 바꿔 가며 한 대규모 비교 실험.

그래서 무엇이 달라졌나

  • BERT식·GPT-2식 설정을 하나의 seq2seq로 묶어 공정 비교.
  • 11B 모델이 2019년 다수 NLP 벤치 SOTA. 이후 지시 튜닝(FLAN-T5)의 토대.

더 공부할 가치가 있을까?

  • NLP를 통합 관점에서 보고 싶다면 — 인코더-디코더가 어디에 유리한지 감이 옵니다.
  • 바쁘면 핵심 아이디어(“모든 걸 text→text로”)만 기억해도 충분합니다.

3. 배경 · 파편화

2018–19 전이학습은 태스크마다 헤드가 달랐습니다: 분류([CLS]+softmax), 생성(LM), 번역(enc–dec), 추출 QA(span start/end).

파편화 → 통일

예전 태스크 헤드를 고른 뒤, T5의 한 형식을 보세요.

→
Text-to-Text

prefix: input → output text

분류 · [CLS] + softmax

T5는 헤드를 바꾸지 않고 prefix만 바꿉니다 — 한 체크포인트·한 학습 루프.

파편화된 헤드 → 하나의 text-to-text.

4. Text-to-Text

output=T5(prefix:  input)\mathrm{output} = \mathrm{T5}(\texttt{prefix}:\;\mathrm{input})
태스크는 prefix 문자열로 지정
Text-to-Text수식 상세 →
기호를 클릭하면 의미를 볼 수 있습니다
단계별 설명

Prefix로 태스크 지정

태스크를 고르면 입·출력이 바뀝니다.

input
translate English to German: The house is wonderful.
→
output
Das Haus ist wunderbar.

논문식 prefix (sst2·translate·summarize·question). 분류 헤드 대신 토큰 생성.

번역 · 감성 · 요약 · QA prefix.

5. 아키텍처 · Span

완전한 인코더–디코더 Transformer + 상대 위치. 사전학습은 토큰 MLM 대신 span corruption.

아키텍처 bake-off

세 스택을 비교하세요 (상대 이득 도식).

Enc–Dec · T5 default

선택: 완전한 인코더 + 자기회귀 디코더 · 상대 위치. 생성·이해 모두에 균형.

목표: span(평균 길이 3)이 i.i.d. 마스킹과 비슷·소폭↑. 상대 위치 임베딩 사용. 막대는 도식.

인코더만 / 디코더만 / enc–dec 비교.

Span corruption

단계를 따라 마스킹을 보세요.

The [X] on [Y]

마스킹된 span → sentinel ([X], [Y]).

논문: 평균 span 길이 3, ~15% 토큰 오염. 토큰 MLM보다 타깃이 짧아 학습이 효율적.

연속 span → sentinel 토큰.

6. C4 · 모델 크기

C4 (Colossal Clean Crawled Corpus): Common Crawl → ~750GB 정제 영문. 비문·코드·짧은 문장·욕설 필터. 이후 수많은 LM의 공개 웹 코퍼스 선구자.

모델 스펙

크기를 고르세요. 3B/11B는 깊이 같고 폭(FFN·헤드)이 다름.

N11B
인코더24
디코더24

데이터: C4 ~750GB. 스케일업할수록 GLUE/SuperGLUE·생성 태스크가 꾸준히↑ (Table 14).

Small→11B · 레이어 대칭 enc/dec.

7. 실험 · 유산

체계적 비교: 아키텍처 · 사전학습 목표 · 데이터 · 파인튜닝. 결론 — enc–dec · span corruption(소폭·효율) · 더 많은 데이터+큰 모델.

결과 · 유산

SuperGLUE / GLUE / 유산을 전환하세요.

SuperGLUE test · T5-11B (Table 14)

BoolQ
91.2
CB (F1)
96.8
COPA
94.8
Avg (SGLUE)
88.9
Prior avg
84.6
Human
89.8

Table 14: 88.9 ≈ 인간 89.8(거의 근접 — 노트 ‘초월’은 과장). 노트 90.3은 GLUE. Prior avg=RoBERTa 84.6. CB Acc 93.9.

SuperGLUE 88.9 ≈ 인간 89.8 · GLUE 90.3.

결과 정리

  • SuperGLUE 88.9 (이전 84.6) — 인간 89.8에 거의 근접(초월은 아님)
  • GLUE 90.3 — 노트 표의 ‘평균 90.3’은 이쪽

유산

  • 통합 프레임워크 → FLAN · InstructGPT · 지시형 LLM의 ‘한 형식’
  • C4 공개 → 후속 오픈 웹 코퍼스에 영향
  • FLAN-T5: 지시 튜닝과 결합
IdeaRole
Text-to-TextEvery NLP task as string→string
PrefixTask name in the input text
Span corruptionMask contiguous spans
C4~750GB cleaned Common Crawl
Enc–DecWins bake-off for generation

이해도 점검

보기를 골라 정답과 해설을 확인하세요. 채점은 이 페이지 안에서만 이뤄집니다.

0 / 5 정답
  1. 1. T5의 Text-to-Text 프레임이란?

  2. 2. T5의 아키텍처는?

  3. 3. T5의 사전학습 목표는?

  4. 4. C4 데이터셋이란?

  5. 5. T5 연구의 결론은?