자가 개선 AI 에이전트는 하나의 모델이 아니다 — 핵심은 피드백 루프다

English version

이 시리즈의 앞선 글들은 일론 머스크의 2017년과 2022년 대담을 다시 읽으며 거대한 기술 서사 안에서 비전, 기술 메커니즘, 시간표를 분리해 봤다. 이번 편은 방향을 바꾼다. 창업자의 미래 전망이 아니라 더 기술적인 질문에서 시작한다. AI 에이전트가 실제로 스스로 개선되려면 어떤 메커니즘이 필요한가?

Stanford CS329A를 바탕으로 한 9편의 강의 묶음을 관통하는 답은 하나의 거대한 모델이 아니다. 테스트 타임 연산, 검증자, 도구 사용, 강화학습, 탐색, 에이전트 평가를 연결하는 닫힌 피드백 루프다.

에이전트는 여러 후보를 만들고, 그중 무엇이 나은지 검증하고, 외부 환경에서 행동해 결과를 관찰하고, 성공한 궤적을 다시 학습에 넣고, 더 길고 어려운 과제에서 신뢰성을 시험한다. 이 관점에서 ‘자가 개선 AI’는 단일 모델의 속성이라기보다 출력을 증거로 바꾸고 그 증거를 다시 더 나은 행동으로 환류시키는 시스템 구조에 가깝다.

이 강의 묶음의 핵심은 기술 목록이 아니라 하나의 루프다

Stanford의 공식 CS329A 소개는 테스트 타임 연산, 검증자, 도구·검색, 강화학습, 탐색, 다단계 계획, 강건한 평가를 하나의 강좌 안에서 다룬다.

이들을 따로 보면 최신 AI 기법의 목록처럼 보인다. 하지만 시스템 관점에서 보면 각 기술은 같은 루프의 서로 다른 실패 지점을 보완한다.

  • 생성과 탐색은 모델의 출력 공간 안에서 쓸 만한 해답을 발견할 확률을 높인다.
  • 검증은 그럴듯한 오답과 실제로 유용한 후보를 가르려 한다.
  • 도구와 환경은 모델의 자기 확신이 아니라 외부 세계에서 피드백을 가져온다.
  • 학습 루프는 성공한 추론·행동 궤적을 다음 학습 신호로 바꾼다.
  • 평가는 이런 개선이 더 길고 덜 구조화된 현실 과제에서도 유지되는지 확인한다.

이 글의 편집적 결론은 단순하다. 자가 개선 에이전트에는 탐색하는 능력과, 그 탐색이 실제로 도움이 됐는지 판별하는 능력이 모두 필요하다. 둘 중 하나가 없으면 루프가 닫히지 않는다.

1단계: 한 번의 답보다 여러 번의 시도가 잠재 능력을 더 많이 드러낼 수 있다

Stanford의 Azalia Mirhoseini가 공저한 2024년 논문 Large Language Monkeys는 반복 샘플링을 추론 시점 스케일링의 한 형태로 분석했다. 여러 과제와 모델에서 샘플 수가 늘어날수록 적어도 하나의 정답을 생성할 확률, 즉 coverage가 계속 증가했다.

SWE-bench Lite에서는 DeepSeek-Coder-V2-Instruct가 한 번의 샘플로 15.9%의 이슈를 해결했지만, 250개 샘플을 사용했을 때 56%까지 올라갔다고 보고했다. 핵심은 모든 문제를 수백 번 풀어야 한다는 것이 아니다. 모델의 첫 번째 답이 그 모델이 만들어낼 수 있는 최선의 답을 대표하지 않을 수 있다는 점이다.

그러나 같은 논문은 바로 다음 병목도 보여준다. 자동 검증이 어려운 영역에서는 다수결이나 보상모델을 이용한 선택 성능이 수백 개 샘플 이후 정체된다. 더 많이 생성해도 좋은 답을 식별하지 못하면 성능은 더 이상 올라가지 않는다.

2단계: 탐색을 개선으로 바꾸는 것은 검증이다

그래서 CS329A 강의들은 검증자에 많은 비중을 둔다.

OpenAI의 2023년 연구 Let’s Verify Step by Step은 수학 문제에서 최종 정답만 평가하는 방식과 중간 추론 단계별로 피드백을 주는 방식을 비교했다. 해당 실험 범위에서는 과정 감독이 결과 감독보다 더 신뢰할 수 있는 보상모델을 만들었고, 연구진은 80만 개의 단계별 인간 피드백이 포함된 PRM800K를 공개했다.

이 결과를 모든 분야에 일반화할 수는 없다. 수학은 정오 판정이 비교적 명확하고, 해당 연구 역시 MATH 데이터셋이라는 구체적 환경을 다룬다. 그러나 더 넓게 적용할 수 있는 공학적 원리는 있다. 최종 결과가 틀렸다는 사실만 아는 것보다 어느 단계에서 잘못됐는지 알 수 있을 때 피드백의 정보량이 커진다.

따라서 자가 개선 시스템에서 가장 어려운 질문은 “얼마나 많이 생성할 수 있는가?”가 아니라 “생성자보다 쉽게 속지 않는 검증 신호를 만들 수 있는가?”에 가깝다.

3단계: 도구는 피드백 루프를 모델 바깥으로 확장한다

검증자는 반드시 또 다른 언어모델일 필요가 없다. 외부 환경 자체가 검증 신호를 줄 수 있다.

ReAct 프레임워크는 추론과 행동을 번갈아 수행하게 한다. 모델이 생각만 이어가는 것이 아니라 외부 지식원이나 환경에 행동을 취하고, 돌아온 관찰을 바탕으로 계획을 수정한다.

코드는 특히 유리한 영역이다. 프로그램은 컴파일되거나 실패한다. 테스트는 통과하거나 실패한다. 생성된 코드와 기준 구현의 출력이 같은지도 비교할 수 있다. 이런 신호가 실제 유용성을 완벽히 보장하지는 않지만, 모델이 자기 글을 보고 “맞는 것 같다”고 판단하는 것보다는 훨씬 구체적이다.

코딩 에이전트가 에이전틱 AI의 대표 실험장이 된 이유 중 하나가 여기에 있다. 환경이 모델에게 답을 돌려줄 수 있기 때문이다.

4단계: 성공한 궤적을 다시 학습에 넣을 때 루프가 닫힌다

탐색과 검증은 현재 실행의 품질을 높인다. 자가 개선은 그 성공 경험이 다음 학습에 들어갈 때 더 강해진다.

Stanford의 STaR 연구는 초기 형태의 자기 학습 루프를 보여줬다. 모델이 풀이 과정을 만들고, 정답에 도달한 풀이를 학습 데이터로 사용하고, 실패한 문제에는 정답을 힌트로 주어 다시 설명을 생성한 뒤, 성공한 추론을 이용해 재학습하는 과정을 반복했다.

이후에는 강화학습이 이 구조를 더 직접적으로 확장했다. DeepSeekMath는 별도의 가치모델 부담을 줄이면서 수학 추론을 개선하기 위한 GRPO(Group Relative Policy Optimization)를 제안했다. DAPO 연구는 대규모 추론 강화학습 시스템을 공개하고 Qwen2.5-32B 기반으로 AIME 2024에서 50점을 보고했다.

구현은 서로 다르지만 반복되는 구조는 같다.

  1. 후보 행동이나 추론을 생성하고,
  2. 어떤 피드백 신호로 평가하고,
  3. 더 나은 궤적을 선택하거나 학습하고,
  4. 다시 반복한다.

이 지점부터 ‘자가 개선’은 단순한 프롬프트 수정이 아니라 학습 플라이휠에 가까워진다.

5단계: 평가는 시스템이 자기 점수에 스스로 속지 않게 한다

닫힌 루프라고 해서 자동으로 올바른 방향으로 개선되는 것은 아니다. 평가 기준 자체가 잘못돼 있다면 시스템은 잘못된 행동을 더 잘하는 방향으로 학습할 수 있다.

이 문제는 에이전트가 더 긴 과제를 수행할수록 중요해진다. METR은 사람이 수행하는 데 걸리는 시간을 기준으로 과제 난이도를 보정하고, AI 에이전트가 특정 신뢰도에서 어느 정도 난이도의 과제를 완료할 수 있는지를 ‘time horizon’으로 측정한다. 역사적 측정에서는 50% 성공률 기준 시간 지평이 약 7개월마다 두 배씩 증가하는 추세가 관찰됐다.

하지만 METR은 이 지표의 한계도 명시한다. 현재 과제군은 소프트웨어 엔지니어링, 머신러닝, 사이버보안에 크게 집중돼 있다. 또한 time horizon은 “AI가 그 시간 동안 혼자 일한다”는 뜻이 아니라, 특정 신뢰도에서 성공할 수 있는 과제의 인간 기준 난이도를 나타낸다. 신뢰도 기준을 높이면 결과도 훨씬 엄격해진다.

이 점은 자가 개선 서사에 중요한 제동을 건다. 어려운 과제를 가끔 성공하는 능력과, 비슷한 과제를 반복해서 믿고 맡길 수 있는 능력은 다르다.

가장 강한 반론: 결국 더 강한 기본 모델이 필요한 것 아닌가

그렇다. 이 글의 ‘닫힌 루프’ 관점을 “이제 모델 스케일링은 중요하지 않다”는 주장으로 읽으면 잘못이다.

모든 루프는 생성자에서 시작한다. 기본 모델이 강할수록 더 나은 후보를 만들고, 도구를 더 정확히 사용하고, 강화학습이 출발할 초기 분포도 좋아질 수 있다. 반복 샘플링 역시 기본 분포 안에 발견할 만한 정답이 있어야 의미가 있다.

또한 도메인 격차가 크다. 수학과 코드는 비교적 값싼 검증기를 만들 수 있지만, 전략 판단, 과학적 해석, 정책 분석, 창작처럼 정답이 열린 영역에서는 평가자가 또 다른 불완전한 모델이나 인간일 수밖에 없다. 이 경우 재귀적 개선은 느려지고 보상 해킹에도 더 취약해진다.

따라서 더 방어 가능한 결론은 좁다. 강한 모델은 필요하지만, 지속적인 자가 개선을 만들려면 모델 바깥에 신뢰할 수 있는 피드백 구조가 필요하다.

9편의 강의가 에이전트를 보는 방식을 어떻게 바꾸는가

가장 유용한 변화는 “어떤 모델이 가장 똑똑한가?” 대신 “이 시스템은 어디서 교정 정보를 얻는가?”를 묻는 것이다.

에이전트 워크플로우를 볼 때 다음 다섯 질문이 더 진단적이다.

  1. 탐색은 어디서 일어나는가? 여러 후보를 만들고, 검색하고, 분기하고, 수정할 수 있는가?
  2. 누가 결과를 검증하는가? 실행 가능한 테스트인가, 인간인가, 학습된 검증자인가, 아니면 자기평가뿐인가?
  3. 외부 환경에서 행동할 수 있는가? 도구, 파일, API, 실험으로부터 실제 관찰을 받는가?
  4. 성공한 행동이 다음 학습 신호가 되는가? 아니면 매 실행이 처음부터 다시 시작되는가?
  5. 과제가 길어질수록 신뢰성을 어떻게 측정하는가? 실제 완료를 평가하는가, 그럴듯한 중간 산출물만 평가하는가?

이 질문들은 시스템의 실제 구조를 드러낸다. 동시에 인상적인 데모가 왜 곧바로 믿고 맡길 수 있는 자율 시스템을 의미하지 않는지도 보여준다.

미래 비전에서 공학 메커니즘으로

이 시리즈의 앞선 글들은 거대한 기술 비전을 실제 메커니즘과 분리해 읽었다. Stanford CS329A는 그 렌즈를 반대로 돌릴 수 있게 한다. 이번에는 메커니즘부터 시작한다.

지속적으로 스스로 개선하는 AI 에이전트라는 비전은 넓다. 반면 공학 경로는 더 구체적이다. 여러 해답을 탐색하고, 검증하고, 외부 환경에서 행동하고, 성공한 결과를 다시 학습하고, 더 어려운 과제에서도 신뢰성이 유지되는지 측정한다.

이 루프가 자율 지능의 완성을 보장하는 것은 아니다. 다만 ‘자가 개선’이 실제로 일어나고 있는지, 아니면 단지 더 많은 출력을 만들고 있는지를 구분하는 실용적인 프레임을 제공한다.

Evidence map

  • Speaker / course framing: Stanford CS329A는 자가 개선 에이전트를 테스트 타임 스케일링, 검증자, 도구 사용, 강화학습, 탐색, 계획, 평가의 결합으로 다룬다.
  • Verified facts: 반복 샘플링은 정답 coverage를 높일 수 있고, 해당 MATH 실험에서는 과정 감독이 결과 감독보다 우수했으며, ReAct는 추론과 행동을 교차하고, STaR는 성공한 생성 추론으로 자기학습을 수행하며, DeepSeekMath는 GRPO를 제안했고, METR은 신뢰도 조건이 붙은 task horizon으로 에이전트 능력을 측정한다.
  • Editorial interpretation: 이 글의 ‘닫힌 피드백 루프’는 9편의 강의와 인용 연구를 종합한 편집적 해석이다. 단일 논문의 직접 인용도 아니고, 모든 에이전트가 하나의 보편적 구조를 따른다는 주장도 아니다.

시리즈 목차

  1. Part 1 — AI 발전의 중심은 왜 ‘더 큰 모델’에서 확장되고 있는가
  2. Part 2 — Test-Time Compute의 핵심은 ‘어디에 쓸 것인가’다
  3. Part 3 — Verifier도 틀릴 수 있다
  4. Part 4 — AI 에이전트의 피드백은 어디서 와야 하는가
  5. Part 5 — AI 에이전트의 능력과 신뢰성은 다르다
  6. Part 6 — AI는 자기 추론에서 어떻게 다시 학습하는가
  7. Part 7 — 탐색만 늘린다고 AI가 똑똑해지는 것은 아니다
  8. Part 8 — 오래 일할 수 있는 AI와 믿고 맡길 수 있는 AI는 다르다
  9. Part 9 — 자가 개선 AI의 다음 병목은 모델이 아니라 ‘루프’다

주요 1차 출처