시리즈: 자가 개선 AI 에이전트 — 이 9편 영상 아카이브의 Part 9/9
이전 편: Part 8 — Agentic Evaluations and Long-Horizon Tasks
강의: Stanford CS329A | Future Research Areas
원본 영상: https://www.youtube.com/watch?v=z3q9aQUsgRs
1. 마지막 질문은 더 이상 “어떻게 한 모델을 더 강하게 만들 것인가?”가 아니다
이 9편 영상 아카이브는 test-time search, verification, tool use, train-time learning, deep research, long-horizon evaluation을 따라 자가 개선 에이전트의 여러 층을 살펴봤다.
Part 9에서는 질문이 한 단계 올라간다.
한 benchmark에서 더 높은 점수를 받는 모델을 만드는 것만으로는 부족하다.
중요한 것은 스스로 개선하는 loop가:
- reasoning diversity를 잃지 않고,
- reward signal을 오염시키지 않고,
- 배울 만한 새로운 task를 계속 만들어내고,
- 실제 hardware와 energy 제약 안에서 작동할 수 있느냐이다.
이를 네 가지 연구 병목으로 정리할 수 있다.
- Diversity: self-generated training이 같은 reasoning pattern으로 수렴하지 않는가?
- Verification: 그럴듯한 오류와 실제 개선을 구분할 수 있는가?
- Curriculum: 현재 능력의 경계에 있는 다음 task를 스스로 만들 수 있는가?
- Efficiency: 그렇게 만들어진 지능을 현실적인 compute와 energy budget 안에서 제공할 수 있는가?
핵심 논지는 다음이다.
Self-improvement는 하나의 알고리즘이 아니다. Generator, verifier, curriculum, compute substrate가 함께 개선되어야 하는 시스템이다.
2. 첫 번째 병목: self-training이 필요한 diversity를 스스로 파괴할 수 있다
Self-generated data는 인간이 만든 데이터에 대한 의존도를 줄일 수 있다.
하지만 같은 모델이 자기 output을 반복해서 학습하면 diminishing return과 reasoning diversity 감소가 발생할 수 있다.
이 문제에 대한 한 접근이 Multiagent Finetuning이다.
검증된 논문은 “Multiagent Finetuning: Self Improvement with Diverse Reasoning Chains” (arXiv:2501.05707)이다.
같은 base model에서 시작한 여러 agent를 독립적으로 specialization하고, agent 간 interaction에서 만들어진 서로 다른 data로 각각을 fine-tuning한다.
핵심은 “agent 수를 늘리면 무조건 좋아진다”가 아니다.
중요한 것은 독립된 specialization이 한 모델을 자기 output으로 반복 학습할 때보다 여러 reasoning distribution을 더 오래 유지한다는 점이다.
Self-improvement에는 novelty가 필요하다.
Candidate가 모두 비슷해지면 verifier가 고를 수 있는 의미 있는 search space 자체가 줄어든다.
3. Diversity는 error를 구분할 수 있을 때만 가치가 있다
Reasoning이 복잡해지면 두 번째 병목이 나타난다.
최종 답을 자동 채점할 수 있는 task에서는 outcome reward가 강력하다.
하지만 proof, plan, research synthesis처럼 중간 reasoning의 정당성이 중요한 task에서는 final answer만 맞았다고 충분하지 않다.
그래서 verification도 함께 확장돼야 한다.
DeepSeekMath-V2가 좋은 사례다.
현재 1차 출처는 arXiv:2511.22570, “DeepSeekMath-V2: Towards Self-Verifiable Mathematical Reasoning”이다.
출발점은 간단하다.
Correct answer가 correct proof를 보장하지 않는다.
DeepSeekMath-V2는 theorem proving을 평가하는 LLM-based verifier를 학습하고, 그 verifier를 proof generator의 reward model로 사용한다.
Generator가 더 강해지면 verification compute도 늘려 새롭게 등장하는 hard-to-verify proof를 자동으로 labeling하고 verifier를 다시 개선한다.
공식 공개 결과는 scaled test-time compute에서:
- IMO 2025 gold-level
- CMO 2024 gold-level
- Putnam 2024 118/120
을 보고한다.
점수보다 더 중요한 원리는 다음이다.
Self-improving generator가 강해질수록 기존 verifier가 본 적 없는 사례를 생성한다. 따라서 verifier도 generator와 함께 개선되어야 한다.
4. Verifier 자체가 새로운 reward-hacking 표면이 된다
여기서 recursive problem이 생긴다.
System이 verifier 점수를 최대화하도록 최적화되면 generator는 verifier의 약점을 이용하는 방법을 배울 수 있다.
즉 stronger generator가 stronger self-improvement loop를 자동으로 의미하지 않는다.
Verifier 자체를 감사하는 구조가 필요해진다.
성숙한 self-improvement system에서는 질문이 다음처럼 이어진다.
- Candidate solution이 맞는가?
- Verifier의 비판이 맞는가?
- Reward가 우리가 실제 원하는 task를 측정하는가?
- Model이 task를 배운 것인가, evaluator를 공략하는 법을 배운 것인가?
시리즈 전체에서 반복되는 pattern이다.
병목은 generation에서 selection으로, 다시 selector의 reliability로 이동한다.
5. 세 번째 병목: 인간이 더 이상 최고의 ‘다음 문제’를 공급하지 못하면 어떻게 되는가?
Strong generator와 verifier가 있어도 학습할 만한 problem이 필요하다.
현재 많은 RL pipeline은 human-curated dataset이나 미리 정한 task collection에 의존한다.
Model이 그 distribution보다 강해지면 추가 training은 반복적이거나 지나치게 쉬워질 수 있다.
강의에서 설명하는 mechanism은 Absolute Zero: Reinforced Self-play Reasoning with Zero Data (arXiv:2505.03335)의 구조와 강하게 일치한다.
Absolute Zero는 하나의 model을 두 역할로 사용한다.
- Proposer: 새로운 reasoning task를 만든다.
- Solver: 그 task를 푼다.
Environment는 executable code로 task와 answer를 검증한다.
세 reasoning mode를 사용한다.
- Deduction: program + input → output
- Abduction: program + output → valid input
- Induction: input-output examples → program
Proposer는 learnability에 따라 reward를 받는다.
너무 쉬운 문제만 생성하지도 않고, 전혀 풀 수 없는 문제만 생성하지도 않도록 현재 solver에게 학습 신호를 줄 수 있는 task를 만들어야 한다.
그 결과 solver의 변화에 맞춰 curriculum도 함께 변한다.
6. “Zero data”보다 중요한 것은 ‘다음 학습 task가 어디서 오는가’다
Zero data라는 표현은 문자 그대로 받아들이면 오해할 수 있다.
Absolute Zero도 pretrained base model에서 시작하며, task와 answer가 valid한지 판정하기 위해 Python execution environment에 의존한다.
핵심 기여는 prior knowledge가 전혀 없는 학습이 아니다.
중요한 변화는 다음 training task의 공급원이다.
고정된 human-curated problem set에서 문제를 가져오는 대신 model이 자신의 다음 curriculum frontier를 만드는 데 직접 참여한다.
Environment도 단순 evaluator 이상의 역할을 한다.
- objective feedback을 제공하고,
- open-ended task generation을 현실에 묶어 두는 constraint가 된다.
Code와 math에서는 execution이라는 hard verifier를 사용할 수 있어 강력하다.
하지만 cheap deterministic checker가 없는 open-ended domain에서는 훨씬 어려워진다.
7. 가장 강한 반론: self-play는 현실이 쉽게 검증되는 영역에서 가장 잘 작동한다
Self-improvement narrative의 가장 중요한 한계다.
Code는 실행할 수 있다.
많은 수학 문제는 채점할 수 있다.
Game은 규칙이 명확하다.
하지만 경제적으로 중요한 많은 task에는 cheap ground-truth verifier가 없다.
예를 들면:
- strategy
- management
- scientific hypothesis generation
- policy analysis
- product design
- negotiation
- medical judgment
- long-term organizational decision
같은 문제다.
이런 영역에서는 답의 quality가 며칠, 몇 달, 몇 년 뒤에야 드러날 수 있다.
따라서 self-improvement loop에는 비대칭이 생긴다.
Generation은 verification보다 훨씬 빠르게 싸질 수 있다.
System은 candidate reasoning을 엄청나게 많이 만들 수 있지만, 그중 무엇을 다음 training data로 사용해야 하는지는 여전히 비싸게 확인해야 한다.
그래서 verifier bottleneck은 일시적인 implementation issue가 아닐 수 있다.
Open-ended self-improvement의 근본적 한계 중 하나일 가능성이 있다.
8. 네 번째 병목: intelligence는 결국 물리적 hardware에서 실행된다
강의 후반부는 learning loop에서 systems efficiency로 이동한다.
Smarter agent는 더 많은 inference compute, memory, energy를 요구할 수 있다.
Intelligence per Watt는 그래서 중요한 질문을 던진다.
전력 1단위당 실제 task performance를 얼마나 얻는가?
검증된 논문은 arXiv:2511.07885, “Intelligence per Watt: Measuring Intelligence Efficiency of Local AI”다.
이 연구는:
- 20+ local language models
- 8 hardware accelerators
- 100만 real-world single-turn chat/reasoning queries
를 평가한다.
IPW는 task accuracy를 power로 나눈 지표다.
연구 결과는 “모든 것을 local로 옮겨라”보다 훨씬 미묘하다.
9. Local AI는 빠르게 발전하지만 동일 workload에서는 cloud accelerator가 여전히 더 효율적이다
논문은 사용 가능한 local-model set을 기준으로 88.7%의 sampled single-turn query를 올바르게 처리할 수 있었다고 보고한다.
2023→2025:
- local query coverage: 23.2% → 71.3%
- Intelligence per watt: 5.3× 개선
그리고 decomposition은 대략:
- 더 나은 model: 3.1×
- 더 나은 accelerator: 1.7×
이다.
즉 정확히 “hardware 50% + algorithm 50%”라고 표현하는 것은 적절하지 않다.
같은 model을 실행할 때 local accelerator의 IPW는 cloud accelerator보다 최소 1.4× 낮다.
따라서 결론은 “노트북이 datacenter보다 효율적이다”가 아니다.
더 중요한 것은 architecture다.
쉬운 query는 local로 처리하고, 어려운 query만 cloud로 escalation하는 hybrid system이 가능하다.
효율의 핵심은 하나의 substrate를 선택하는 것이 아니라, 적절한 task를 적절한 model과 hardware에 routing하는 것이다.
10. Self-improvement와 efficiency는 서로 다른 층의 같은 systems problem이다
Multiagent training과 energy-efficient inference는 얼핏 전혀 다른 연구 주제로 보인다.
하지만 둘 다 resource allocation 문제다.
Self-improving system은 계속해서 allocation decision을 해야 한다.
- 어떤 reasoning candidate에 compute를 더 쓸 것인가?
- 어떤 verifier가 검증할 것인가?
- 어떤 task를 다음 training data로 선택할 것인가?
- 어떤 model이 user request를 처리할 것인가?
- 어떤 hardware에서 실행할 것인가?
- 언제 local에서 frontier model로 escalation할 것인가?
공통 문제는 단순한 intelligence가 아니다.
Scarce resource를 선택적으로 사용하는 능력이다.
Compute, verification effort, data, memory, energy, human attention에는 모두 opportunity cost가 있다.
성숙한 self-improving agent는 reasoning 방법뿐 아니라 언제 reasoning effort를 더 쓰는 것이 가치 있는지도 배워야 한다.
11. Continual learning은 아직 해결되지 않은 연결고리다
강의는 마지막에 또 하나의 질문을 남긴다.
External memory와 retrieval이 continual weight update를 대체할 수 있는가?
Factual recall에는 retrieval만으로 충분한 경우가 많다.
하지만 강의는 새로운 reasoning pattern, domain adaptation, cross-embodiment skill transfer에는 underlying model 또는 policy update가 필요할 수 있다고 주장한다.
이 부분은 보편적으로 확정된 법칙이 아니라 열린 연구 방향으로 다루는 것이 안전하다.
External memory, in-context adaptation, tool use, parameter-efficient update, full continual learning은 서로 다른 design point다.
실제 open problem은 무엇을 model 밖에 저장하고 무엇을 model 자체의 weight에 반영해야 하는지, 그리고 그 과정에서 catastrophic forgetting을 어떻게 막을지다.
12. 이 글이 주장하지 않는 것
- Multiagent fine-tuning이 unlimited self-improvement를 보장한다고 주장하지 않는다.
- Stronger verifier가 reward hacking을 완전히 제거한다고 주장하지 않는다.
- Self-generated task가 pretrained knowledge나 external environment의 필요를 없앤다고 주장하지 않는다.
- Code 기반 self-play가 open-ended real-world domain에 그대로 적용된다고 주장하지 않는다.
- Local hardware가 동일 workload에서 datacenter accelerator보다 효율적이라고 주장하지 않는다.
- External memory와 continual weight update가 서로 배타적이라고 주장하지 않는다.
- 이 9편 영상 아카이브가 Stanford CS329A 공식 전체 강의 일정과 동일하다고 주장하지 않는다.
13. Part 9의 실제 결론
이번 시리즈에서 가장 중요한 이동은 model-centric improvement에서 loop-centric improvement로의 이동이다.
유용한 self-improving system에는 최소 네 능력이 연결되어야 한다.
1. 다양한 가능성을 생성한다
Reasoning pattern이 한 방향으로 collapse하지 않게 한다.
2. 점점 더 어려운 output을 검증한다
Generator가 evaluator보다 빠르게 강해지는 것을 막는다.
3. 다음에 배울 가치가 있는 problem을 만든다
Curriculum을 현재 capability frontier 근처에 유지한다.
4. Compute와 energy를 선택적으로 배분한다
각 task에 적절한 model, verifier, hardware를 선택한다.
이 네 loop는 서로 의존한다.
Verification 없는 generation은 noise를 늘린다.
새로운 task 없는 verification은 stagnation에 빠진다.
Diversity 없는 task generation은 repetition이 된다.
Efficiency 없는 capability는 deployment가 어렵다.
그래서 이 9편 시리즈의 마지막 결론은 다음이다.
Self-improving agent의 미래는 한 모델이 영원히 자기 자신을 가르치는 구조가 아니다. 무엇을 생성하고, 무엇을 믿고, 무엇을 다음에 연습하며, 어디에 compute를 써야 하는지를 함께 학습하는 coordinated system이다.
Claim Map
강의에서 제시된 주장
- repeated single-model self-training은 diversity collapse에 부딪힐 수 있다
- generator가 강해질수록 verification도 함께 강해져야 한다
- self-generated curriculum은 human task curation 의존도를 줄일 수 있다
- continual learning과 efficient inference는 주요 future research area다
이 글에서 독립적으로 검증한 사실
- Multiagent Finetuning: arXiv:2501.05707
- DeepSeekMath-V2: arXiv:2511.22570
- Absolute Zero: arXiv:2505.03335
- Intelligence per Watt: arXiv:2511.07885
- Intelligence per Watt는 20+ local LM, 8 accelerators, 1M real-world query를 평가했다
- local-model set은 sampled single-turn query의 88.7%를 처리했다
- IPW는 2023~2025에 5.3× 향상했고, 약 3.1× model + 1.7× accelerator 개선으로 분해된다
- 동일 model 비교에서 local accelerator는 cloud accelerator보다 최소 1.4× 낮은 IPW를 기록했다
편집적 해석
- future self-improvement의 핵심은 generation, verification, curriculum, compute allocation의 coordination이다
- AI에 더 많은 reasoning을 위임할수록 verification economics의 중요성은 줄지 않고 오히려 커질 수 있다
강의 지도
- 00:00–00:15 — self-improvement bottleneck과 multiagent diversity
- 00:15–00:23 — verification과 self-verifiable mathematical reasoning
- 00:23–00:34 — autonomous task proposer-solver loop
- 00:40–00:52 — intelligence per watt와 local/cloud inference
- 00:52–01:08 — continual learning, memory, closing research questions
주요 1차 출처
- Stanford CS329A Part 9 video: https://www.youtube.com/watch?v=z3q9aQUsgRs
- Stanford CS329A: https://cs329a.stanford.edu/
- Multiagent Finetuning: https://arxiv.org/abs/2501.05707
- DeepSeekMath-V2: https://arxiv.org/abs/2511.22570
- Absolute Zero: https://arxiv.org/abs/2505.03335
- Intelligence per Watt: https://arxiv.org/abs/2511.07885