시리즈: 자가 개선 AI 에이전트 — 5/9
이전 편: Part 4 — AI 에이전트의 피드백은 어디서 와야 하는가
강의: Stanford CS329A | Agent Evaluation
앞선 강의들은 agent가 어떻게 search하고, verify하고, tool을 사용하고, feedback에서 학습하는지를 다뤘다.
Part 5는 질문을 바꾼다.
그 agent를 실제 업무에 맡겨도 될 만큼 잘 작동하는지 어떻게 평가할 것인가?
겉으로는 benchmark 문제처럼 보인다. 하지만 강의가 다루는 범위는 훨씬 넓다.
Model이 짧은 시험 문제에서 높은 점수를 받아도, 한 시간짜리 workflow를 끝까지 유지하지 못할 수 있다. 조직 안에서 암묵적으로 공유되는 맥락을 이해하지 못할 수 있다. 정답 문장 하나가 아니라 실제 전문가가 사용할 산출물을 만들어야 할 때 무너질 수도 있다. 문헌을 많이 검색하면서도 핵심 논문을 놓치거나 인용과 주장이 맞지 않을 수도 있다.
그래서 강의는 세 가지 평가 체계를 연결한다.
- METR: agent가 어느 정도 길이의 task까지 특정 reliability로 완수하는가?
- GDPval: 최종 deliverable이 실제 전문가의 산출물과 경쟁할 수 있는가?
- DeepScholarBench: 최신 연구를 검색·종합·인용하면서 claim을 검증 가능하게 유지할 수 있는가?
세 평가가 함께 보여주는 핵심은 단순하다.
Capability, reliability, economic usefulness는 서로 다른 변수다.
1. 기존 benchmark는 실제 agent 업무보다 너무 짧다
MMLU, GSM8K 같은 전통적인 평가나 짧은 coding benchmark는 여전히 유용하다.
하지만 대부분 하나의 닫힌 문제를 푸는 능력을 본다.
실제 agent 업무는 다르다.
계획을 세우고, 여러 tool을 사용하고, 파일을 조사하고, 실패에서 복구하고, 여러 step에 걸쳐 state를 유지하고, 첫 번째 전략이 잘못됐다는 사실을 알아차리고, 마지막에는 사람이 실제로 사용할 artifact를 만들어야 할 수 있다.
Trajectory가 길어질수록 작은 error가 누적될 기회도 늘어난다.
그래서 agent evaluation에는 isolated prompt accuracy뿐 아니라 duration과 reliability가 필요하다.
2. METR는 인간 전문가가 걸리는 시간으로 task 난이도를 표현한다
METR의 time-horizon 연구는 agent 성능을 사람이 이해하기 쉬운 단위로 바꾼다.
“benchmark X에서 72점” 대신 다음을 묻는다.
이 task를 인간 전문가가 완료하는 데 얼마나 오래 걸리며, 그 정도 난이도의 task에서 agent가 50% 확률로 성공하는 지점은 어디인가?
이것이 50% task-completion time horizon이다.
여기서 흔한 오해가 있다.
50% horizon이 1시간이라는 말은 AI가 실제로 1시간 동안 자율 실행한다는 뜻이 아니다. 인간 전문가가 약 1시간 걸리는 난이도의 task를 모델이 절반 정도의 확률로 성공한다는 의미다.
METR의 초기 연구에서는 frontier agent의 50% horizon이 여러 해 동안 대략 지수적으로 증가했고, 역사적 doubling time이 약 7개월로 추정됐다.
3. 강의의 59분은 역사적 snapshot이지 2026년 현재 frontier 수치가 아니다
강의에서는 Claude 3.7 Sonnet의 50% time horizon을 약 1시간으로 제시한다.
이는 METR의 2025년 Claude 3.7 평가와 대체로 일치한다. 당시 setup에 따라 약 55~59분 수준의 추정치가 보고됐다.
하지만 이 숫자를 2026년 현재 frontier capability로 읽으면 안 된다.
METR는 신규 모델과 task suite를 추가하면서 time-horizon 페이지를 계속 갱신하고 있다. 2026년에는 통계 fitting 방식에 대한 수정도 있었고, 특히 80% horizon 같은 고신뢰도 추정치에 영향을 주는 methodological correction이 공개됐다.
따라서 공개 글에서 보존해야 할 것은 고정 숫자보다 결과의 구조다.
Frontier agent가 처리할 수 있는 task의 길이는 늘고 있지만, 높은 reliability로 위임 가능한 horizon은 그보다 훨씬 짧다.
4. Reliability 기준을 올리면 결과가 크게 달라진다
50% success는 capability trend를 관찰하기에는 유용하다.
하지만 실제 deployment에서는 절반 실패가 받아들여지기 어렵다.
한 시간짜리 일을 agent에게 맡겼는데 절반은 사람이 다시 검사하거나 처음부터 해야 한다면 “한 시간 업무 자동화”라고 부르기 어렵다.
강의는 2025년 METR snapshot에서 50% 기준과 80% 기준 사이의 horizon이 급격히 줄어드는 모습을 보여준다.
정확한 역사적 숫자는 model과 methodology에 따라 달라지고, 2026년 METR 방법론 수정도 있었기 때문에 영구적인 상수처럼 사용할 수 없다.
그러나 실무적 의미는 변하지 않는다.
“가끔 성공한다”의 frontier와 “안심하고 위임할 수 있다”의 frontier는 크게 다르다.
5. 장기 task는 한 번의 대형 실패보다 작은 error 누적으로 무너진다
강의는 long-horizon agent의 대표 failure mode를 다음과 같이 정리한다.
- 잘못된 planning
- 잘못된 tool 선택
- reasoning 또는 계산 오류
- task가 끝났다고 너무 일찍 판단하는 premature completion
- 같은 실패를 반복하는 loop
각각의 error는 짧은 task라면 복구 가능할 수 있다.
문제는 긴 workflow에는 수많은 decision point가 존재한다는 것이다.
각 step이 조금씩 불안정하면 전체 trajectory가 완벽하게 성공할 확률은 task 길이가 늘수록 빠르게 떨어질 수 있다.
짧은 benchmark 점수와 long-horizon autonomy가 동시에 높지 않을 수 있는 이유다.
6. ‘Low-context contractor’ 비유는 agent의 다른 약점을 설명한다
강의는 낯선 codebase에 들어온 agent를 조직 맥락이 거의 없는 외부 계약자에 비유한다.
Maintainer는 architecture, naming convention, 과거 결정, 숨은 dependency, 위험한 파일, 조직 내부의 암묵지를 알고 있다.
Agent는 현재 context에 명시된 것부터 다시 탐색해야 한다.
이 비유의 구체적 속도 배율을 모든 업무에 일반화할 수는 없다. 공개 글에서는 이를 lecturer framing으로 취급한다.
중요한 논점은 technical capability와 situational context가 다른 능력이라는 것이다.
코딩 실력이 뛰어나도 조직을 모르면, 숙련자가 이미 알고 있는 맥락을 재발견하는 데 대부분의 compute를 소비할 수 있다.
7. GDPval은 ‘완료했는가’가 아니라 ‘전문가 결과물과 경쟁하는가’를 묻는다
METR가 인간 completion time을 이용해 task difficulty를 표현한다면, OpenAI의 GDPval은 model deliverable을 실제 industry professional의 결과물과 비교한다.
GDPval v1은 미국의 주요 9개 산업에서 선정된 44개 직업의 1,320개 전문 task를 포함한다. 공개 gold subset은 220개다.
Task는 해당 분야에서 평균 14년 이상의 경력을 가진 전문가들이 만들고 검토했다.
평가 대상도 단순 text answer가 아니다.
Document, spreadsheet, slide, diagram, multimedia, engineering artifact 등 실제 업무 결과물에 가깝다.
그래서 professional quality는 factual correctness만으로 결정되지 않는다.
Formatting, aesthetics, completeness, file handling, instruction following, domain convention, reference file 통합까지 모두 중요해진다.
8. GDPval의 개선 속도는 METR time horizon과 다른 모양이다
OpenAI는 GDPval에서 frontier model performance가 시간에 따라 대략 linear trend로 개선됐다고 보고한다.
초기 공개 gold set에서 가장 강했던 Claude Opus 4.1은 전문가 결과물과 비교했을 때 47.6%의 task에서 human deliverable과 같거나 더 낫다는 평가를 받았다.
Model별 강점도 달랐다. Claude Opus 4.1은 document formatting, slide layout 같은 aesthetics와 file-heavy deliverable에서 강했고, GPT-5는 instruction following과 calculation 같은 accuracy 측면에서 강점을 보였다.
METR와 GDPval의 결과 모양이 다른 것은 모순이 아니다.
- METR: 어느 정도 난이도의 task를 끝까지 성공하는가?
- GDPval: 최종 산출물이 숙련 전문가의 결과물과 경쟁하는가?
더 긴 workflow를 유지할 수 있다는 사실이 professional-quality deliverable을 자동으로 보장하지는 않는다.
9. GDPval도 context 문제를 그대로 드러낸다
GDPval 공식 설명에는 중요한 한계가 적혀 있다.
첫 버전은 one-shot evaluation이다.
실제 전문가는 업무를 하면서 clarification을 요청하고, 조직 맥락을 축적하고, 우선순위를 조정하고, feedback을 받고, 여러 draft를 수정한다.
GDPval v1은 이 전체 workflow를 아직 모두 담지 못한다.
이 한계는 강의의 underspecification 논의와 정확히 연결된다.
인간은 불완전한 지시에서 조직 경험과 암묵지를 이용해 빠진 맥락을 추정한다.
Agent는 명시적으로 주어진 context에 훨씬 더 의존한다.
OpenAI의 GDPval 실험도 richer context와 추가 reasoning effort가 model performance를 개선한다고 보고한다.
10. 그래서 agent evaluation에는 ‘context acquisition’ 자체가 들어가야 한다
현실적인 agent는 모든 relevant fact가 첫 prompt에 완벽히 들어 있기를 요구하면 안 된다.
불확실성을 알아차리고, 필요한 정보를 질문하고, artifact를 조사하고, tool을 통해 맥락을 복구하고, 자기 이해를 수정할 수 있어야 한다.
이 점에서 세 benchmark를 넘어서는 하나의 평가 원칙을 도출할 수 있다.
Agent는 이미 제공된 context를 얼마나 잘 따르는지만이 아니라, 부족한 context를 얼마나 잘 획득하는지도 평가해야 한다.
Software, research, administration처럼 tacit institutional knowledge가 중요한 영역일수록 더 그렇다.
11. DeepScholarBench는 deep research의 ‘검증 가능성’을 묻는다
세 번째 평가 체계는 generative research synthesis를 위한 live benchmark인 DeepScholar-Bench다.
Task는 매우 현실적이다.
최근 연구 논문 하나를 기준으로 관련 문헌을 직접 검색하고, 중요한 prior work를 골라내고, 결과를 종합하고, citation을 붙여 related-work section을 작성한다.
평가는 크게 세 축으로 나뉜다.
- Knowledge Synthesis: 중요한 아이디어를 빠뜨리지 않고 구조화했는가?
- Retrieval Quality: 관련성뿐 아니라 실제로 중요한 논문을 찾았는가?
- Verifiability: 본문의 claim을 citation이 실제로 뒷받침하는가?
유려한 문장을 만드는 것보다 훨씬 가혹한 평가다.
겉보기에는 완벽한 literature review를 작성하면서도 핵심 논문을 빠뜨리거나, 실제 source와 맞지 않는 citation을 붙일 수 있기 때문이다.
12. DeepScholarBench는 benchmark의 노후화 문제도 줄이려 한다
Static benchmark에는 contamination 문제가 있다.
문제와 정답이 공개된 뒤 시간이 지나면 미래 model의 training data에 들어갈 가능성이 생긴다.
DeepScholar-Bench는 최근의 high-quality arXiv paper에서 query를 만들고, 지속적으로 새로운 dataset을 만들 수 있는 pipeline을 제공한다.
완벽한 contamination 방지는 아니지만 frozen exam보다 live research task에 가까운 구조다.
DeepResearch system을 평가할 때 검색 대상 문헌 자체가 계속 변하기 때문에 중요한 설계다.
13. 강의의 ‘19% 벽’에는 version note가 필요하다
강의에서는 current deep-research system들이 전체 benchmark에서 19%를 넘지 못했다는 강한 숫자를 사용한다.
원 논문의 version history를 보면 이 표현에는 주의가 필요하다.
초기 arXiv/Hugging Face version은 실제로 “no system exceeding 19% across all metrics”라고 보고한다.
하지만 이후 OpenReview/ICLR revision은 aggregation을 다르게 표현하며 어떤 system도 metric들의 geometric mean 31%를 넘지 못했다고 보고한다.
Benchmark version, evaluated models, metric definition, aggregation이 바뀔 수 있기 때문에 두 headline number를 같은 수치처럼 취급해서는 안 된다.
그럼에도 지속되는 결론은 같다.
현재 deep-research system은 retrieval, synthesis, citation verification을 동시에 높은 수준으로 수행하는 데서 여전히 크게 부족하다.
14. DeepScholarBench의 source ID도 바로잡아야 한다
강의 관련 source metadata에는 DeepScholarBench가 arXiv 2502.04357로 기록돼 있다.
실제 논문은 arXiv:2508.20033이다.
공개 본문에서는 verified paper ID를 사용하고, 강의가 사용한 benchmark snapshot과 이후 revision을 분리한다.
Agent evaluation 글에서 citation verification의 중요성을 설명하면서 잘못된 citation을 그대로 재사용할 수는 없기 때문이다.
15. 세 benchmark는 서로 다른 bottleneck을 보여준다
METR — temporal reliability
Task가 길어져도 성공 trajectory를 유지하는가?
GDPval — professional deliverable quality
최종 결과물이 실제 숙련 전문가의 결과물과 경쟁할 수 있는가?
DeepScholarBench — epistemic reliability
올바른 evidence를 찾고, 종합하고, 각 claim을 실제 source와 일치시킬 수 있는가?
세 능력은 서로 대체되지 않는다.
오랫동안 작업하면서 형편없는 artifact를 만들 수 있다. 매우 세련된 artifact를 만들면서 source를 잘못 이해할 수 있다. 훌륭한 자료를 검색하고도 multi-hour workflow를 끝내지 못할 수 있다.
16. 가장 강한 반론: 이런 benchmark도 결국 workplace를 단순화한 것 아닌가?
그렇다.
이 평가들도 controlled environment다.
조직 정치, 변하는 우선순위, 권한 문제, contradictory stakeholder, access restriction, 장기 책임, deployment 후 subtle error의 복구 비용까지 실제 workplace 전체를 담지는 않는다.
GDPval은 첫 version이 one-shot이라고 명시한다. METR current time-horizon suite는 software task에 집중돼 있다. DeepScholar-Bench는 research synthesis라는 특정한 task family를 평가한다.
따라서 이 benchmark가 “real-world autonomy 전체”를 측정한다고 결론 내리면 과장이다.
더 정확한 표현은 다음과 같다.
현실 업무에 가까워질수록 evaluation 자체가 하나의 systems-design problem이 된다.
17. 이 글이 주장하지 않는 것
- 50% time horizon이 실제 clock time 동안 agent를 안전하게 방치할 수 있다는 뜻이라고 주장하지 않았다.
- 역사적 7개월 doubling trend가 앞으로 영원히 지속된다고 주장하지 않았다.
- GDPval의 약 50% 결과가 전문직의 절반을 이미 자동화할 수 있다는 뜻이라고 주장하지 않았다.
- 실제 전문 업무가 one-shot deliverable로 완전히 표현된다고 주장하지 않았다.
- 유려한 research prose가 reliable retrieval이나 citation accuracy를 보장한다고 주장하지 않았다.
- 하나의 benchmark가 전체 agent reliability를 대표할 수 있다고 주장하지 않았다.
18. Part 5의 실제 결론
이 시리즈의 흐름이 여기서 더 선명해진다.
Part 2~4는 search, verification, tool use, feedback을 개선하는 방법을 다뤘다.
Part 5는 그 개선이 긴 task와 실제 deliverable에서도 유지되는지 묻는다.
결론은 혼합적이다.
Agent가 더 길고 복잡한 workflow를 처리하는 능력은 분명히 개선되고 있다.
하지만 세 gap이 남아 있다.
- Reliability Gap: 가끔 성공할 수 있는 task보다 안정적으로 위임 가능한 task가 훨씬 짧다.
- Context Gap: prompt에 쓰인 정보는 숙련자가 가진 암묵지보다 훨씬 적다.
- Verification Gap: polished output이라도 evidence selection, citation support, professional usability가 부족할 수 있다.
그래서 progress를 더 엄격하게 정의해야 한다.
Agent가 task를 풀 수 있다는 이유만으로 deployment-ready인 것은 아니다. 올바른 task를 이해하고, 필요한 context를 확보하고, 요구 reliability로 완수하며, 결과의 품질을 검증할 수 있어야 한다.
Part 6에서는 다시 evaluation에서 learning으로 이동한다. 자가 생성 경험과 reinforcement learning을 이용해 train-time compute를 확장하면 capability 자체는 어떻게 변하는가?
Claim map
- Speaker / Course Claim: agent evaluation은 short-turn benchmark를 넘어 time horizon, economic deliverable quality, verifiable research synthesis로 이동해야 하며 long task에서는 error compounding과 context deficit이 핵심 병목이다.
- Verified Fact: METR는 human-expert task duration을 이용해 50%/80% task-completion time horizon을 정의하고 초기 연구에서 50% horizon의 역사적 약 7개월 doubling을 보고했다. GDPval은 9개 산업, 44개 직업, 1,320개 task와 220개 gold subset으로 구성되며 model performance가 대략 linear하게 개선됐다고 보고한다. Claude Opus 4.1은 초기 gold-set 평가에서 expert deliverable 대비 wins+ties 47.6%를 기록했다. DeepScholar-Bench는 knowledge synthesis, retrieval quality, verifiability를 평가하는 live arXiv 기반 benchmark이며 실제 arXiv ID는 2508.20033이다.
- Editorial Interpretation: “Capability, reliability, economic usefulness는 서로 다른 변수다”라는 문장은 이번 글의 중심적 종합 해석이다.
강의 지도
- 00:00–00:28 — agent evaluation, METR time horizon, reliability, low-context work
- 00:28–00:52 — GDPval과 expert-quality economic task
- 00:52–01:08 — DeepScholarBench와 verifiable research synthesis
- 01:08–01:15 — long-tail reliability와 미래 autonomous agent
주요 1차 출처
- Stanford CS329A — Part 5 | Agent Evaluation
- Stanford CS329A — Self-Improving AI Agents
- METR — Task-Completion Time Horizons of Frontier AI Models
- METR — Measuring AI Ability to Complete Long Software Tasks
- OpenAI — GDPval
- DeepScholar-Bench: A Live Benchmark and Automated Evaluation for Generative Research Synthesis