Paper Understanding
Papers
Concepts
Formulas
KO
EN
overtraining
Overtraining
학습 최적보다 많은 토큰으로 더 작은 모델을 학습 — 추론/서빙 비용을 줄이기 위함.
관련 수식
Chinchilla 규칙 (~20 tok/param)
관련 논문
chinchilla
llama