AI는 자기 추론에서 어떻게 다시 학습하는가 — Stanford CS329A Part 6 Train-Time Scaling

시리즈: 자가 개선 AI 에이전트 — 6/9

이전 편: Part 5 — AI 에이전트의 능력과 신뢰성은 다르다

강의: Stanford CS329A | Train-Time Scaling

원본 영상: https://www.youtube.com/watch?v=7xr620o0sGM

시리즈 번호 안내: “Part 6”는 이 시리즈에서 사용하는 9편 영상 아카이브 순서를 따른다.

English version

1. Test-time scaling이 더 많이 생각하게 한다면, Train-time scaling은 모델 자체를 바꾼다

앞선 편들은 inference 시점에서 agent가 더 많은 계산을 쓰는 방법을 다뤘다. 여러 답을 생성하고, tool을 사용하고, verifier로 고르고, 어려운 문제에 더 많은 compute를 쓰는 방식이다.

Train-time scaling은 그 다음 단계를 닫는다.

Inference에서 성공한 trajectory를 버리지 않고 다시 training signal로 사용한다.

구조는 다음과 같다.

생성 → 검증 → 선별 → weight update → 다시 생성

즉 train-time scaling은 단순히 “더 오래 reasoning한다”는 개념이 아니다.

성공한 reasoning을 다음 세대의 output distribution에 지속적으로 반영하는 과정이다.

강의는 이 구조를 세 연구로 설명한다.

  1. STaR — 모델이 스스로 만든 성공 reasoning을 학습 데이터로 부트스트랩한다.
  2. DeepSeekMath / GRPO — 별도 critic 없이 같은 질문의 여러 답을 상대 비교해 RL을 수행한다.
  3. DAPO — long-CoT RL에서 exploration collapse, zero-gradient batch, length pathology를 안정화한다.

이번 편의 핵심 결론은 다음이다.

Self-improvement가 지속적인 변화가 되려면, 성공한 reasoning을 inference에서 고르는 데서 끝내지 않고 training data 또는 RL update로 다시 넣어야 한다.

2. STaR는 ‘좋은 rationale을 누가 만들 것인가’라는 문제에서 시작한다

Reasoning model은 step-by-step rationale에서 이점을 얻지만, 고품질 rationale dataset을 인간이 대규모로 만드는 것은 비싸다.

STaR — Self-Taught Reasoner — 는 이를 bootstrap loop로 해결한다.

소량의 rationale example을 받은 모델이 더 큰 문제 세트에 대해 reasoning을 생성한다.

최종 답이 맞은 경우 그 reasoning trace를 training data로 사용할 수 있다.

그리고 그 성공 trace로 model을 fine-tune한 뒤 같은 과정을 반복한다.

구조는 다음과 같다.

소량의 rationale → reasoning 생성 → 성공 trace 선별 → fine-tune → 반복

핵심은 모델이 만든 모든 reasoning을 믿는 것이 아니다.

이미 성공한 출력 가운데 학습에 사용할 수 있는 trace를 모델 스스로 늘려 간다는 데 있다.

3. Hint를 이용한 rationalization은 실패 문제까지 training data로 바꾼다

STaR는 처음에 틀린 문제도 바로 버리지 않는다.

모델이 풀지 못한 문제에 correct answer를 hint로 제공하고, “왜 이 답이 나오는지” rationale을 다시 생성하게 한다.

그 rationale이 최종 정답으로 이어지면 hint를 제거한 상태로 training data에 넣을 수 있다.

이 메커니즘은 강력하지만 동시에 위험하다.

정답을 이미 알고 있는 모델은 실제로 독립적으로 발견하지 못했을 reasoning을 그럴듯하게 사후 구성할 수 있다.

그래서:

final answer가 맞다 ≠ reasoning process가 맞다

Part 3의 문제와 다시 연결된다.

Self-improvement의 품질은 결국 verifier가 무엇을 인정하느냐에 달려 있다.

4. STaR가 ‘무한 자가학습’을 증명한 것은 아니다

STaR를 가장 강하게 해석하면 모델이 자기 출력을 이용해 어떤 지식이든 스스로 만들어 낼 수 있다고 볼 수 있다.

원 연구는 그런 결론을 뒷받침하지 않는다.

STaR는 base model과 주어진 supervision을 이용해 이미 도달 가능한 reasoning pattern을 추출하고 강화하는 방법으로 보는 편이 안전하다.

여전히 필요한 것은:

  • 충분히 capable한 base model,
  • 정답이 알려진 문제,
  • output을 판정할 verifier,
  • 성공 rationale을 실제로 생성할 수 있는 초기 능력

이다.

이 경계는 DeepSeekMath에서 더 선명해진다.

5. DeepSeekMath는 RL 이전의 base model과 data가 여전히 중요하다는 것을 보여준다

강의 관련 기록에는 중요한 수치 혼동이 있다.

DeepSeekMath 7B의 51.7%는 AIME가 아니라 MATH benchmark 결과다.

검증된 DeepSeekMath 논문은 DeepSeek-Coder-Base-v1.5 7B에서 출발해 Common Crawl에서 수집한 120B math-related token과 natural-language/code 데이터를 계속 pretraining했다고 설명한다.

즉 RL stage는 빈 모델에서 시작하지 않는다.

이미 code pretraining, 수학 web data, instruction tuning으로 상당한 capability가 만들어진 뒤 GRPO가 output distribution을 바꾼다.

따라서 이번 강의를:

RL이 pretraining을 대체한다

라고 읽으면 안 된다.

더 정확한 구조는:

pretraining이 reachable capability를 만들고, post-training이 그 capability를 얼마나 안정적으로 선택하고 표현하는지를 바꾼다

에 가깝다.

6. GRPO는 critic 대신 같은 그룹 안의 상대 비교를 사용한다

PPO 계열 RL에서는 value model, 즉 critic이 expected return을 추정해 advantage 계산에 사용된다.

LLM scale에서는 이 critic 자체가 큰 memory/compute 부담이 될 수 있다.

GRPO — Group Relative Policy Optimization — 는 baseline을 바꾼다.

하나의 prompt에서 여러 output을 생성하고 각각 reward를 계산한다.

그 뒤 별도 critic에게 “이 답이 예상보다 얼마나 좋았는가?”를 묻는 대신, 같은 prompt에서 나온 다른 답들의 reward와 비교한다.

단순화하면 group-relative advantage는 다음과 같다.

advantage ≈ (reward − group mean) / group standard deviation

그룹 평균보다 좋은 답은 강화되고, 낮은 답은 억제된다.

핵심 architecture 변화는 이 group statistics가 baseline 역할을 하기 때문에 별도의 learned value model이 필요 없어진다는 점이다.

7. DeepSeekMath의 성능 향상보다 Pass@K와 Maj@K가 더 중요한 이유

DeepSeekMath의 RL stage는 실제 성능을 개선했다.

MATH에서 instruction model의 약 46.8%가 GRPO 기반 RL 이후 51.7%로 올라간다.

64개 sample을 이용한 self-consistency에서는 60.9%를 보고한다.

하지만 더 중요한 분석은 Maj@K와 Pass@K 비교다.

  • Maj@K: K개 sample의 다수결 답이 맞는가?
  • Pass@K: K개 중 하나라도 정답이 존재하는가?

논문에서는 RL 후 Maj@K는 더 뚜렷하게 개선되지만, K가 커질수록 Pass@K의 변화는 훨씬 작다.

저자들은 이를 해당 실험 조건에서 RL이 완전히 새로운 problem-solving frontier를 크게 넓히기보다, 모델이 이미 생성할 수 있었던 correct response의 확률을 높이는 현상으로 해석한다.

이 차이는 중요하다.

RL이 완전히 새로운 지식을 만들었다는 증거가 없어도, 이미 가능한 정답을 훨씬 자주 출력하게 만드는 것만으로 실제 utility는 크게 상승할 수 있다.

8. Train-time scaling의 핵심 자원은 compute만이 아니라 ‘유효한 학습 신호’다

Train-time scaling을 단순히 GPU를 더 많이 쓰는 것으로 이해하면 핵심을 놓친다.

중요한 것은 closed loop에서 얼마나 유용한 learning signal을 만들 수 있는가다.

필요한 조건은 대략 네 가지다.

  1. 여러 trajectory를 생성할 수 있는 exploration
  2. 좋은 output과 나쁜 output을 구분하는 reward/verifier
  3. 그 차이를 효율적으로 weight에 반영하는 update rule
  4. policy가 너무 빨리 collapse하지 않도록 하는 training stability

DAPO는 네 번째 문제를 정면으로 다룬다.

9. 강의 관련 DAPO source ID는 잘못돼 있다

강의 관련 source metadata에는 DAPO가 arXiv 2501.12345로 기록돼 있다.

검증된 실제 논문은:

DAPO: An Open-Source LLM Reinforcement Learning System at Scale — arXiv:2503.14476

이다.

2025년 3월 공개됐고 이후 NeurIPS 2025에 게재됐다.

이번 Part 6는 DAPO의 세부 algorithm과 ablation을 핵심 근거로 쓰기 때문에 이 source correction은 단순 typo가 아니다.

공개 글에는 2503.14476만 사용한다.

10. DAPO는 reasoning RL이 algorithm 하나가 아니라 systems problem이라는 것을 보여준다

Naive GRPO를 long-CoT training에 그대로 확대하면 자동으로 안정적인 learning이 일어나는 것이 아니다.

DAPO는 다음 문제를 다룬다.

  • entropy가 급격히 내려가 exploration이 사라지는 문제
  • 한 prompt의 sample이 모두 정답 또는 모두 오답이라 relative gradient가 사라지는 문제
  • 긴 response가 loss에서 비정상적으로 취급되는 문제
  • truncation 때문에 reward noise가 커지는 문제

논문은 네 가지 핵심 technique을 제안한다.

Clip-Higher

Upper clipping range를 더 넓게 허용해 low-probability exploration token의 확률이 올라갈 여지를 만든다.

목표는 policy가 너무 빨리 deterministic해지는 entropy collapse를 완화하는 것이다.

Dynamic Sampling

한 prompt의 sample이 전부 맞거나 전부 틀리면 group-relative advantage가 0이 될 수 있다.

DAPO는 이런 zero-gradient prompt를 filtering하고, 성공과 실패가 함께 존재해 실제 비교 신호가 있는 prompt로 batch를 채운다.

Token-Level Policy Gradient Loss

기존 sample-level reduction은 long-CoT에서 각 token의 contribution을 비정상적으로 만들 수 있다.

DAPO는 token-level loss로 바꿔 긴 reasoning trajectory에서도 gradient contribution을 더 적절히 유지한다.

Overlong Reward Shaping

Maximum length를 넘어서 truncate된 response에 일괄 penalty를 주면, reasoning 자체는 타당한데 단지 길다는 이유만으로 noise가 생길 수 있다.

DAPO는 length-aware soft punishment를 사용해 이 reward noise를 줄인다.

11. DAPO ablation은 각각의 안정화 기법이 왜 필요한지 보여준다

Qwen2.5-32B의 AIME 2024 결과에서 논문은 다음 progressive ablation을 보고한다.

  • Naive GRPO: 30
  • + Overlong Filtering: 36
  • + Clip-Higher: 38
  • + Soft Overlong Punishment: 41
  • + Token-level Loss: 42
  • + Dynamic Sampling: 50

최종 DAPO는 AIME 2024 50점에 도달한다.

여기서 주의할 점이 있다.

이 수치는 DeepSeekMath의 51.7%와 직접 비교하면 안 된다.

DAPO의 50은 AIME 2024, DeepSeekMath의 51.7은 MATH benchmark다.

기존 기록에서 이 두 수치가 같은 benchmark처럼 연결된 부분은 이 글에서 분리했다.

12. 이 모든 방법의 숨은 전제는 Verifiability다

STaR, GRPO, DAPO는 서로 다른 algorithm처럼 보이지만 공통된 의존성이 있다.

좋은 reward signal이 필요하다.

수학은 final answer를 자동 검증하기 쉽다.

코드는 unit test, compiler, execution environment를 이용할 수 있다.

하지만 다음 영역은 훨씬 어렵다.

  • 전략
  • 외교
  • nuanced writing
  • open-ended research judgment
  • 미학
  • 가치 판단

여기서는 reward model 자체가 또 하나의 불완전한 judge일 수 있다.

그래서 일반화 가능한 원칙은 이것이다.

Train-time scaling은 correctness를 싸게 검증할 수 있는 영역에서 가장 강하고, ‘무엇이 더 좋은가’ 자체가 모호한 영역에서 가장 어렵다.

13. SFT와 RL은 단순한 승자독식 관계가 아니다

고품질 example이 충분하면 SFT는 여전히 매우 효율적이다.

RL은 특히 다음 조건에서 매력적이다.

  • candidate solution을 많이 생성할 수 있고
  • correctness를 자동으로 검증할 수 있으며
  • 가능한 trajectory 공간이 너무 커서 인간이 전부 label하기 어려울 때

하지만 RL도 RL 이전에 구축된 model capability와 data distribution에 의존한다.

따라서 “RL 비중을 더 늘리면 항상 더 좋다”는 결론은 근거가 없다.

14. 가장 강한 반론: 모델이 task가 아니라 reward를 학습하는 것 아닌가?

Self-improvement loop 전체에는 reward hacking 위험이 있다.

Reward function이 불완전하면 모델은 의도한 objective가 아니라 proxy를 최적화할 수 있다.

Exploration이 collapse하면 policy는 자신 있게 좁아질 수 있다.

모든 rollout이 실패하면 group-relative RL에는 방향성이 거의 없다.

Verifier가 표면적 pattern을 승인하면 model은 그 pattern을 학습한다.

DAPO 논문 자체가 이 반론을 뒷받침한다.

논문의 상당 부분은 새로운 reasoning task를 발명하는 것이 아니라, training dynamics가 무너지지 않도록 entropy, sampling, sequence length, reward noise를 제어하는 데 쓰인다.

그래서 가장 방어 가능한 결론은 다음이다.

RL은 base model이 좋은 trajectory를 생성할 수 있고, verifier가 그것을 식별할 수 있으며, optimization이 충분한 exploration을 보존할 때 그 좋은 trajectory의 확률을 집중시킬 수 있다.

15. 이 글이 주장하지 않는 것

  • RL이 pretraining을 대체할 수 있다고 주장하지 않았다.
  • STaR의 rationale이 항상 실제 causal reasoning이라고 주장하지 않았다.
  • GRPO가 모든 domain에서 PPO보다 우월하다고 주장하지 않았다.
  • DeepSeekMath의 51.7% MATH와 DAPO의 AIME 50을 직접 비교 가능한 숫자라고 주장하지 않았다.
  • Benchmark 향상이 무제한의 새로운 지식 창출을 의미한다고 주장하지 않았다.
  • Verifiable reward RL이 subjective domain에도 그대로 적용된다고 주장하지 않았다.
  • Reasoning token이 길수록 reasoning quality가 자동으로 좋아진다고 주장하지 않았다.

16. Part 6의 실제 결론

Part 2는 inference-time compute를 늘려 더 많은 가능성을 탐색하는 방법을 보여줬다.

Part 3와 Part 4는 verifier와 feedback의 품질이 그 탐색을 유용하게 만드는 조건임을 보여줬다.

Part 6는 그 loop를 닫는다.

Candidate trajectory를 만들고 평가할 수 있다면, 성공 trajectory를 다음 generation의 behavior에 다시 반영할 수 있다.

STaR는 self-generated rationale을 이용한다.

DeepSeekMath는 group-relative RL을 이용한다.

DAPO는 long reasoning에 RL을 확대할 때 exploration과 reward signal, response length가 얼마나 쉽게 무너지는지를 보여준다.

더 깊은 변화는 이것이다.

Self-improving system은 더 좋은 답을 한 번 찾는 데서 끝나지 않는다. 그 탐색의 증거를 내일의 답을 생성할 확률분포로 바꾼다.

Part 7은 이 training loop에서 한 단계 더 나아가 Self-Improvement and Deep Research Agents로 이동한다.

Claim Map

Speaker / Course Claim

  • Train-time scaling은 성공 reasoning을 model learning으로 되돌린다.
  • STaR, GRPO, DAPO는 점점 더 scalable한 self-improvement loop를 보여준다.
  • Math/code처럼 검증 가능한 task가 RL-based self-improvement에 특히 유리하다.

Verified Fact

  • STaR는 arXiv:2203.14465이며 model-generated reasoning을 생성·선별·rationalize·fine-tune하는 iterative loop를 사용한다.
  • DeepSeekMath는 arXiv:2402.03300이고 DeepSeek-Coder-Base-v1.5 7B에 120B math-related token을 추가 학습하고 GRPO를 제안하며 MATH 51.7%, 64-sample self-consistency 60.9%를 보고한다.
  • DeepSeekMath의 실험에서는 RL 후 Maj@K 개선이 Pass@K보다 더 뚜렷하다.
  • DAPO는 arXiv:2503.14476이며 Clip-Higher, Dynamic Sampling, Token-Level Policy Gradient Loss, Overlong Reward Shaping을 제안하고 Qwen2.5-32B에서 AIME 2024 50점을 보고한다.

Editorial Interpretation

  • Train-time scaling은 verified search outcome을 미래 output probability의 지속적 변화로 변환하는 시스템으로 이해하는 것이 유용하다.
  • Self-improvement의 실질적 ceiling은 base-model reachability, verifier quality, exploration stability가 함께 결정한다.

강의 지도

  • 00:00–00:16 — Train-time scaling, inference/training compute, verifiability
  • 00:16–00:41 — STaR와 rationale bootstrapping
  • 00:41–00:53 — DeepSeekMath와 GRPO
  • 00:53–01:06 — DAPO와 large-scale RL stabilization
  • 01:06–01:12 — SFT vs RL, open questions

주요 1차 출처