시리즈: 자가 개선 AI 에이전트 — 3/9
이전 편: Part 2 — Test-Time Compute의 핵심은 ‘더 많이’가 아니라 ‘어디에 쓸 것인가’다
강의: Stanford CS329A | Robust Verification
Part 2의 마지막에는 피할 수 없는 제약이 남았다. Test-time compute로 수많은 후보 답안을 만들어도, 그중 무엇이 실제 정답인지 가려내지 못하면 추가 연산은 성능으로 연결되지 않는다.
Part 3는 바로 그 문제를 본론으로 가져온다.
강의는 검증 연구의 발전을 네 단계로 따라간다. 완성된 답안을 채점하는 outcome verifier, 중간 reasoning step을 보는 process reward model, 인간 라벨 없이 process supervision을 만드는 방식, 그리고 여러 개의 불완전한 검증자를 결합하는 weak-verifier ensemble이다.
이 모든 연구 아래에는 하나의 어려운 질문이 있다.
정답을 판정하는 verifier 자체가 틀릴 수 있다면 어떻게 할 것인가?
이 문제는 단순한 reranking 문제보다 더 중요하다. Verifier score가 search나 reinforcement learning의 방향을 결정하기 시작하면 verifier의 오류는 단순한 오판이 아니라 학습 신호가 된다. 잘못된 verifier는 시스템에게 “진짜로 맞는 답”이 아니라 “verifier에게 맞아 보이는 답”을 더 잘 만들도록 가르칠 수 있다.
1. 첫 번째 단계: 답을 생성하는 모델과 평가하는 모델을 분리한다
강의는 OpenAI의 2021년 논문 Training Verifiers to Solve Math Word Problems에서 시작한다.
이 연구는 8,500개의 초등 수학 문장형 문제로 구성된 GSM8K를 소개했고, 다단계 reasoning에서 LLM이 얼마나 쉽게 오류를 누적하는지 분석했다.
핵심 아이디어는 generation과 verification을 분리하는 것이다.
- Generator를 풀이 데이터에 fine-tuning한다.
- 한 문제에 여러 candidate solution을 생성한다.
- 최종 답이 맞는지 기준으로 candidate를 라벨링한다.
- 별도의 verifier가 candidate solution의 정답 가능성을 학습한다.
- Test-time에는 여러 답을 만들고 verifier score가 가장 높은 답을 선택한다.
논문은 verification이 단순 fine-tuning baseline보다 추가 데이터에 더 잘 scale한다고 보고했다. 원 실험에서는 6B 모델에 verification을 붙인 시스템이 해당 GSM8K 조건에서 175B fine-tuned generator와 비슷한 수준까지 올라갔다.
이 결과는 이 시리즈 전체에서 반복되는 하나의 패턴을 일찍 보여줬다.
성능을 올리는 방법은 generator 파라미터를 늘리는 것만이 아니다.
2. Outcome verification에는 숨어 있는 허점이 있다
초기 verifier는 주로 최종 답을 기준으로 학습한다.
문제는 reasoning 과정이 틀렸는데 마지막 숫자만 우연히 맞을 수 있다는 것이다. Cobbe 등의 논문도 final-answer labeling이 flawed reasoning을 가진 false positive를 포함할 수 있음을 명시한다.
즉 verifier는 다음 둘을 구분하지 못할 수 있다.
- 올바른 reasoning으로 정답에 도달한 풀이
- 중간 오류가 있었지만 우연히 마지막 답만 맞은 풀이
단순 reranking에서는 어느 정도 감수할 수 있는 문제일 수 있다. 하지만 self-improvement에서는 훨씬 위험하다.
잘못된 trajectory가 정답 label을 받으면 RL은 그 reasoning pattern 자체의 확률을 높일 수 있기 때문이다.
핵심 문제는 명확하다.
도착지만 검사하는 verifier는 경로가 망가졌는지 놓칠 수 있다.
3. Search를 더 크게 만들수록 verifier의 약점도 더 잘 찾게 된다
강의는 candidate pool이 커질 때 생기는 또 하나의 문제를 강조한다.
Verifier가 상당히 정확하지만 완벽하지 않다고 하자. Sample 수가 적을 때는 verifier가 가장 높은 점수를 준 답이 실제로 좋은 답일 가능성이 높다.
하지만 sample 수를 계속 늘리면 상황이 달라진다.
시스템은 수백·수천 개의 후보를 만들면서 verifier가 우연히 높은 점수를 줄 수 있는 미묘한 오답도 더 많이 생산한다. 결국 search 자체가 verifier의 blind spot을 찾는 과정처럼 작동할 수 있다.
GSM8K 초기 verifier 실험에서도 candidate 수를 무한히 늘린다고 정확도가 계속 상승하지는 않았다. 강의는 큰 sample count에서 peak 이후 하락하는 구간을 설명한다.
정확한 최적 sample 수보다 더 중요한 구조적 교훈은 이것이다.
Search는 불완전한 evaluator에게 적대적으로 작동할 수 있다.
후대에 reward hacking, specification gaming, evaluator exploitation이라고 부르는 문제와 같은 구조다.
4. Process supervision은 ‘무엇을 검증하는가’를 바꾼다
다음 단계는 OpenAI의 2023년 논문 Let’s Verify Step by Step이다.
Outcome supervision이 최종 결과에만 feedback을 준다면, process supervision은 중간 reasoning step마다 feedback을 준다.
연구진은 MATH 데이터셋의 해당 실험에서 process supervision이 outcome supervision보다 유의미하게 우수했다고 보고했고, 최고의 process reward model을 학습하기 위해 사용한 80만 개의 step-level human feedback label을 PRM800K로 공개했다.
차이는 간단하다.
- Outcome supervision: 마지막 답이 맞는가?
- Process supervision: 중간 단계 각각이 타당한가?
풀이 중간에 오류가 발생하면 process verifier는 최종 답이 나올 때까지 기다리지 않고 그 trajectory를 감점할 수 있다.
그래서 process supervision은 단순 reranking뿐 아니라 beam search, tree search, revision, reinforcement learning에도 더 직접적으로 연결될 수 있다.
5. Process supervision은 강하지만 비용이 비싸다
Step-level label은 공짜가 아니다.
하나의 solution에 여러 reasoning step이 있고, 각각을 사람이 판정해야 한다면 annotation cost가 빠르게 증가한다.
Let’s Verify Step by Step은 그래서 active learning도 실험한다. 무작위로 sample을 라벨링하기보다 현재 verifier가 헷갈릴 가능성이 높은 convincing wrong solution에 human attention을 집중하는 방식이다.
통제된 synthetic experiment에서 연구진은 active learning이 uniform sampling보다 약 2.6배 높은 data efficiency를 보였다고 보고했다.
이 수치를 “human annotation 비용이 언제나 2.6배 줄어든다”로 일반화하면 안 된다. 더 안전한 의미는, 어려운 example을 선택적으로 라벨링하면 process supervision에 필요한 feedback budget을 더 효율적으로 쓸 수 있다는 것이다.
그리고 다음 질문이 생긴다.
사람이 모든 step을 직접 라벨링하지 않고도 process supervision을 만들 수 있는가?
6. Math-Shepherd는 process label 자체를 자동화하려 한다
ACL 2024의 Math-Shepherd는 이 병목을 직접 겨냥한다.
Math-Shepherd는 human annotation에 전적으로 의존하지 않고 자동으로 구성한 process-wise supervision data를 이용해 각 reasoning step에 reward를 부여한다.
핵심 아이디어는 rollout이다.
어떤 intermediate step에서 출발해 이후 풀이를 여러 번 끝까지 생성한다. 그 continuation들이 최종 정답에 얼마나 자주 도달하는지를 보면, 현재 step이 유망한지에 대한 proxy signal을 만들 수 있다.
이 signal은 두 가지 용도로 사용된다.
- Verification: 여러 candidate output을 reranking한다.
- Reinforcement Learning: step-level reward로 generator 자체를 개선한다.
원 논문은 Mistral-7B에 process RL을 적용했을 때 GSM8K가 77.9%에서 84.1%, MATH가 28.6%에서 33.0%로 향상됐다고 보고한다.
여기에 Math-Shepherd verification을 추가하면 논문이 보고한 정확도는 각각 89.1%와 43.5%까지 올라갔다.
중요한 의미는 “이제 인간이 필요 없다”가 아니다.
최종 정답을 객관적으로 판정할 수 있는 domain에서는 rollout 구조를 이용해 중간 feedback의 일부를 자동 생성할 수 있다는 것이다.
7. 자동 process supervision도 결국 ground truth에 기대고 있다
Math-Shepherd가 작동하는 이유를 보면 한계도 분명해진다.
수학 문제에는 최종 정답이 있다. Rollout이 성공했는지 실패했는지 비교할 수 있다.
하지만 전략, 정책, 과학적 해석, 장문 글쓰기처럼 명확한 정답지가 없는 domain에서는 같은 방법을 그대로 쓰기 어렵다.
즉 human step labeling을 줄였다고 해서 verification 문제가 사라진 것은 아니다.
검증의 부담이 step-level human label에서 신뢰할 수 있는 final-outcome signal로 이동했을 뿐이다.
8. 마지막 전환: 완벽한 verifier를 기다리지 말고 불완전한 verifier를 결합한다
강의 후반부의 마지막 연구는 Stanford 연구진이 참여한 2025년 논문 Shrinking the Generation-Verification Gap with Weak Verifiers다.
원 논문에서 프레임워크의 이름은 Weaver다.
출발점은 현실적이다. 많은 실제 문제에서는 perfect verifier가 없다. 대신 reward model, LM judge, 다양한 scorer처럼 각각 불완전하지만 어느 정도 유용한 verifier는 여러 개 존재한다.
Weaver는 이들을 결합한다.
- 여러 weak verifier에서 score를 받고,
- 서로 다른 score format을 normalize하고,
- 품질이 낮은 verifier를 걸러내고,
- weak supervision으로 verifier별 신뢰도를 추정하고,
- 가중된 aggregate score로 candidate를 선택한다.
핵심은 단순 majority voting이 아니다.
더 신뢰할 수 있는 verifier에는 더 큰 weight를 줘야 한다.
9. Weak supervision은 대규모 정답 label 없이 verifier의 신뢰도를 추정하려 한다
보통 weighted ensemble을 만들려면 정답 label이 필요하다. 어떤 judge가 더 정확한지 알아야 하기 때문이다.
Weaver는 weak supervision을 이용해 이 의존성을 줄이려 한다.
Verifier들의 agreement와 disagreement 패턴, dataset statistics를 이용해 각 verifier의 reliability를 추정하고 이를 하나의 score로 합친다.
하지만 여기에도 가정이 있다.
여러 verifier가 서로 충분히 다른 방식으로 틀려야 한다.
만약 모든 verifier가 같은 foundation model family에서 파생되고 같은 데이터와 같은 bias를 공유한다면, ensemble은 매우 높은 confidence로 똑같이 틀릴 수 있다.
따라서 verifier diversity에서 중요한 것은 모델 이름의 다양성이 아니라 error structure의 다양성이다.
10. Weaver의 원 논문 결과는 상당히 강하다
원 논문을 대조하는 과정에서 강의 관련 이름과 metadata 일부가 실제 논문과 다르다는 점을 확인했다.
원 논문의 framework는 Weaver이고 arXiv ID는 2506.18203이다.
논문이 보고한 실험에서 Llama 3.3 70B Instruct를 generator로 사용하고 70B 이하 judge/reward model ensemble을 verifier로 사용한 Weaver는 평가된 reasoning·math task 평균에서 87.7%를 기록했다.
저자들은 이를 해당 benchmark mix에서 o3-mini-level accuracy라고 설명한다.
이 결과를 “Weaver가 모든 문제에서 o3-mini와 같다”로 확대해서는 안 된다. Benchmark와 candidate generation setup이 정해진 조건에서 나온 결과다.
하지만 하나는 명확하다.
generator가 이미 만들어낼 수 있는 정답과 실제 시스템이 선택할 수 있는 정답 사이의 gap을 verifier architecture가 크게 줄일 수 있다.
11. 그런데 verifier ensemble 자체가 너무 비싸다
여러 개의 대형 judge와 reward model을 candidate마다 실행하면 verification cost가 급증한다.
Weaver는 그래서 distillation을 추가한다.
전체 verifier ensemble이 만든 combined score를 teacher signal로 사용하고, 훨씬 작은 400M cross-encoder가 그 score를 모방하도록 학습한다.
논문의 revision과 figure에 따라 retention 숫자의 표현은 약간 다르지만, 안전하게 요약하면 distilled verifier는 ensemble 성능의 약 98% 수준을 유지하면서 해당 실험에서 verification compute를 최대 99.97%까지 줄였다.
이 결과는 중요한 시스템 설계 아이디어를 보여준다.
개발 단계에서는 여러 verifier의 집단 판단을 사용하고, deployment 단계에서는 그 판단을 작은 verifier 하나로 압축할 수 있다.
12. Distillation은 정확성을 새로 만들어내지 않는다
하지만 compression 자체가 truth를 만들어내지는 않는다.
Teacher ensemble이 공통된 blind spot을 갖고 있다면 student verifier는 그 blind spot도 충실하게 학습할 수 있다.
Part 3 전체에서 같은 패턴이 반복된다.
- Outcome verifier는 flawed reasoning을 positive로 볼 수 있다.
- Process verifier는 비싸고 reward hacking을 받을 수 있다.
- Rollout supervision은 ground-truth final answer에 의존한다.
- Weak-verifier ensemble은 independent error signal이 필요하다.
- Distilled verifier는 teacher의 장점과 한계를 함께 상속한다.
따라서 robust verification은 하나의 알고리즘 이름이 아니다.
Search pressure가 커져도 feedback channel의 가정이 무너지지 않도록 설계하는 전체 시스템 문제다.
13. 가장 강한 반론: verification은 alignment 문제를 한 단계 아래로 옮긴 것뿐 아닌가?
가장 근본적인 반론은 이것이다.
Generator를 믿을 수 없어서 verifier를 만든다. Verifier도 믿을 수 없어서 process verifier, ensemble, meta-verifier를 만든다.
그렇다면 verifier는 누가 검증하는가?
모든 domain에 통하는 답은 없다.
Formal math, code execution, theorem prover처럼 외부 세계가 hard signal을 줄 수 있는 경우에는 비교적 강한 verifier를 만들 수 있다.
반면 open-ended reasoning에서는 evaluator quality 자체가 시스템의 epistemic limit이 될 수 있다.
그래서 “verification을 더 많이 한다”와 “truth에 더 가까워진다”는 같은 말이 아니다.
더 방어 가능한 결론은 다음이다.
Verification은 supervising 대상보다 feedback channel이 더 어렵게 해킹될 때 self-improvement를 실제로 강화한다.
14. 이 글이 주장하지 않는 것
- Process reward model이 모든 상황에서 outcome reward model을 완전히 대체해야 한다고 주장하지 않았다.
- Automatic process supervision이 trustworthy final outcome 없이도 작동한다고 주장하지 않았다.
- 모든 weak verifier가 같은 failure mode를 공유해도 ensemble이 신뢰할 수 있다고 주장하지 않았다.
- 수학 verification의 성과가 subjective domain에 그대로 이전된다고 주장하지 않았다.
- 작은 distilled verifier가 싸다는 이유로 teacher ensemble보다 더 정확해진다고 주장하지 않았다.
- Reward hacking이 해결됐다고 주장하지 않았다. 오히려 stronger optimization은 verifier weakness를 더 잘 찾을 수 있다.
15. Part 3의 실제 결론
이번 강의의 연구 계보는 feedback channel을 점점 더 정교하게 만드는 과정으로 볼 수 있다.
- Outcome Verifier: 완성된 solution을 rank한다.
- Process Verifier: reasoning step을 검사한다.
- Automatic Process Supervision: rollout으로 step signal을 만든다.
- Weak-Verifier Ensemble: 여러 불완전한 judge를 결합한다.
- Distillation: 비싼 verification을 작은 deployment model로 압축한다.
모든 단계는 verification을 더 scalable하게 만든다.
하지만 어떤 단계도 verifier를 infallible하게 만들지는 않는다.
이 점이 self-improving agent에서 verification이 중요한 이유다. Verifier가 search나 learning을 통제하는 순간 verifier의 오류는 단순한 실수가 아니라 optimization direction이 된다.
따라서 핵심 질문은 “AI가 자기 답을 평가할 수 있는가?”가 아니다.
Generator가 verifier를 점점 더 잘 공략하게 될수록, feedback mechanism도 계속 신뢰할 수 있는가?
Part 4에서는 model-based judgment를 넘어 실제 환경에서 오는 feedback으로 이동한다. 도구 사용, code execution, environment feedback은 어떻게 verifier보다 더 강한 학습 신호가 될 수 있는가?
Claim map
- Speaker / Course Claim: repeated sampling이 드러낸 핵심 병목은 verification이며, process supervision·automatic process supervision·weak-verifier ensemble은 scalable verification으로 가는 서로 다른 단계다.
- Verified Fact: GSM8K는 8.5K math word problem으로 구성된다. Cobbe et al.은 여러 candidate를 verifier로 ranking하는 방식이 fine-tuning-only baseline보다 data scaling에서 강하다고 보고했다. Lightman et al.은 cited MATH setting에서 process supervision이 outcome supervision보다 우수했고 PRM800K의 800,000 step-level label을 공개했다. Math-Shepherd는 automatic process supervision과 process RL을 사용하고 Mistral-7B에서 본문에 제시한 성능 향상을 보고했다. Weaver는 여러 weak verifier를 결합하며 Llama 3.3 70B generator 조건에서 87.7% 평균 정확도를 보고하고, ensemble을 400M cross-encoder로 distill한다.
- Editorial Interpretation: “verification은 supervising 대상보다 더 어렵게 해킹돼야 하는 feedback channel이다”라는 문장은 이번 글의 종합적 해석이다.
강의 지도
- 00:00–00:21 — GSM8K와 outcome verifier
- 00:21–00:38 — process supervision과 PRM800K
- 00:38–00:52 — Math-Shepherd와 automatic step supervision
- 00:52–01:07 — weak-verifier ensemble과 distillation
- 01:07–01:13 — verifier의 한계와 향후 연구
주요 1차 출처
- Stanford CS329A — Part 3 | Robust Verification
- Stanford CS329A — Self-Improving AI Agents
- Training Verifiers to Solve Math Word Problems
- Let’s Verify Step by Step
- Math-Shepherd: Verify and Reinforce LLMs Step-by-Step without Human Annotations
- Shrinking the Generation-Verification Gap with Weak Verifiers