AI 에이전트의 피드백은 어디서 와야 하는가 — Stanford CS329A Part 4

시리즈: 자가 개선 AI 에이전트 — 4/9
이전 편: Part 3 — Verifier도 틀릴 수 있다
강의: Stanford CS329A | Learning from Feedback with Tools/Code

English version

Part 3의 결론은 불편했다. Model-based verifier를 붙이면 search와 learning을 개선할 수 있지만, verifier 자체도 틀릴 수 있다.

Part 4에서는 feedback의 출처를 바꾼다.

또 다른 모델에게 “이 답이 맞아 보이는가?”를 묻는 대신, agent가 자기 바깥의 무언가와 상호작용한다. 검색 환경, 코드 실행기, unit test, 혹은 인간이 작성한 원칙을 기준으로 작동하는 AI judge가 feedback을 돌려준다.

ReAct, RLEF, Constitutional AI는 서로 전혀 다른 문제를 다루지만 하나의 공통된 시스템 원칙으로 수렴한다.

Self-improvement는 feedback이 모델 내부의 자기 믿음보다 더 외부 제약에 접지될수록 신뢰성이 높아진다.

1. ReAct: 세상이 답을 돌려줄 때 reasoning의 역할이 달라진다

ReAct: Synergizing Reasoning and Acting in Language Models는 순수한 Chain of Thought의 한계에서 출발한다.

LLM은 내부 representation만으로도 긴 reasoning을 생성할 수 있다. 하지만 그 reasoning이 최신 사실이나 현재 environment state에 자동으로 접지되는 것은 아니다.

처음 가정이 틀리면 긴 CoT는 오류를 줄이는 대신 오류를 더 멀리 전파할 수도 있다.

ReAct는 세 가지 요소를 번갈아 사용한다.

  • Thought: 다음에 무엇을 해야 하는가?
  • Action: tool을 호출하거나 environment와 상호작용한다.
  • Observation: 외부 결과를 받는다.

그 Observation이 다음 Thought를 바꾼다.

즉 reasoning이 닫힌 내부 독백이 아니라, 외부 세계에 어떤 질문을 던질지 결정하고 그 답을 해석하는 control layer가 된다.

2. ReAct는 CoT와 Act-only의 중간이 아니다

ReAct 논문은 reasoning-only와 acting-only 양쪽의 한계를 구분한다.

Pure CoT는 외부 증거가 필요한 상황에서도 내부 지식에 의존해 hallucination을 일으킬 수 있다. 반대로 Act-only agent는 tool을 호출할 수 있지만, 계획을 수정하거나 예외를 처리하기 위한 explicit reasoning trace가 약하다.

ReAct는 두 기능을 interleave한다.

원 논문은 HotpotQA, FEVER, ALFWorld, WebShop에서 실험했다. ALFWorld와 WebShop에서는 ReAct가 imitation/RL baseline보다 각각 34, 10 percentage point 높은 success rate를 보고했다. HotpotQA와 FEVER에서는 Wikipedia API interaction을 통해 hallucination과 error propagation을 줄였고, ReAct와 CoT self-consistency를 결합한 hybrid가 단일 방식보다 더 좋은 결과를 보였다.

3. Tool use의 핵심은 retrieval이 아니라 feedback loop다

Tool use를 단순히 “검색해서 문맥을 추가한다”라고 설명하면 ReAct의 핵심을 놓친다.

ReAct에서는 tool call 결과가 agent의 다음 행동을 바꾼다.

reason → act → observe → update → 다시 act

중요한 것은 외부 정보가 prompt에 들어온다는 사실이 아니다.

Observation 이후 policy가 바뀔 수 있다는 것이다.

이 구조부터 language model은 environment-grounded agent에 가까워진다.

4. 하지만 외부 환경도 틀릴 수 있다

External feedback이라고 해서 자동으로 truth가 되는 것은 아니다.

검색 결과가 오래됐을 수 있다. API가 실패할 수 있다. 웹 문서가 잘못됐을 수 있다. Sensor가 noisy할 수도 있다.

그래서 “grounded”와 “correct”는 같은 말이 아니다.

더 정확한 결론은 다음이다.

외부 상호작용은 model self-belief의 닫힌 고리를 깨뜨릴 수 있지만, environment가 유용한 signal을 제공할 때만 그렇다.

실제 tool-using agent에는 retry, fallback, source cross-check, confidence handling이 필요한 이유다.

5. Code는 검색보다 더 강한 feedback을 제공할 수 있다

두 번째 핵심 논문은 RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning이다.

Code domain에는 특별한 장점이 있다. 실행하면 행동의 결과가 나온다.

  • compile되는가?
  • runtime error가 나는가?
  • timeout이 발생하는가?
  • test를 통과하는가?
  • 수정 후 결과가 좋아졌는가?

이 signal들은 모델이 자연어로 “내 코드는 맞다”고 설명하는 것보다 훨씬 falsifiable하다.

RLEF는 여러 독립 sample을 뽑는 대신, execution feedback을 여러 turn에 걸쳐 실제로 활용하는 policy를 학습시킨다.

6. RLEF의 핵심은 iterative repair다

RLEF는 competitive programming task를 이용해 다음 질문을 다룬다.

모델이 첫 번째 코드에서 실패했을 때 execution feedback을 보고 다음 코드에 그 오류를 반영할 수 있는가?

구조는 단순하다.

code 생성 → 실행 → 실패 관찰 → 수정 → 다시 실행

원 논문은 8B와 70B 모델에서 state-of-the-art 결과를 보고했고, independent sampling 대비 필요한 sample 수를 한 order of magnitude 줄였다고 설명한다.

핵심은 benchmark 기록보다 구조다.

모델이 실패를 각각 독립된 sample로 버리는 것이 아니라, error signal을 다음 행동의 정보로 사용하는 법을 학습한다.

7. Execution feedback이 LM critique보다 강한 이유

LLM은 틀린 코드에 대해 그럴듯한 critique를 만들고도 실제 bug를 놓칠 수 있다.

Compiler error, failing unit test, timeout은 다르다.

그 signal은 코드를 작성한 동일한 language model이 아니라 execution environment에서 나온다.

그래서 더 강한 grounding을 제공한다.

Feedback이 완벽한 설명일 필요도 없다.

다음 행동을 제약할 수 있으면 된다.

Binary pass/fail조차 여러 turn의 repair loop와 결합하면 유용한 학습 신호가 될 수 있다.

8. Test도 해킹될 수 있다

Execution feedback은 객관적으로 보이지만 evaluator가 불완전하면 문제가 생긴다.

Visible test가 부족하면 모델은 test에만 맞는 코드를 만들 수 있다. Benchmark harness에 빈틈이 있다면 의도한 문제 대신 evaluator를 공략할 수 있다.

강의가 public feedback과 held-out evaluation을 구분하는 이유도 여기에 있다.

일반 원칙은 다음과 같다.

행동을 개선하는 데 쓰는 feedback과 generalization을 인증하는 signal을 완전히 동일하게 두면 reward hacking 위험이 커진다.

Public/private test 구분은 이 원칙을 구현하는 하나의 방법으로 이해하는 것이 안전하다.

9. RLEF 출처는 원 논문 기준으로 교정해야 한다

원 논문을 대조하는 과정에서 강의 관련 RLEF metadata가 실제 논문과 다르다는 점을 확인했다.

강의 관련 source metadata에는 arXiv 2402.04616으로 기록돼 있지만, 실제 RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning은 arXiv:2410.02089다.

공개 글에는 검증된 원 논문 ID와 scope만 사용한다.

이런 source mismatch는 단순 typo로 끝나지 않을 수 있다. 다른 논문의 method나 result가 잘못 연결될 위험이 있기 때문이다.

10. Constitutional AI는 세 번째 feedback 유형을 만든다

세 번째 연구는 Anthropic의 Constitutional AI: Harmlessness from AI Feedback이다.

이 방식은 compiler나 search engine에 의존하지 않는다.

인간이 원하는 행동 원칙을 written constitution으로 제공하고, AI가 그 원칙을 이용해 자기 출력물을 critique하고 revise한다.

원 논문은 두 단계로 구성된다.

Supervised phase

초기 response를 만들고, constitution principle에 따라 self-critique를 생성하고, 그 critique에 맞춰 revised response를 만든 뒤 이 데이터를 이용해 model을 fine-tune한다.

Reinforcement-learning phase

AI model이 두 candidate response를 constitution 기준으로 비교해 preference를 만들고, 이 AI preference로 preference model을 학습한 다음 reinforcement learning을 수행한다. 이것이 RLAIF다.

즉 인간의 역할이 “수많은 output에 label 달기”에서 “상위 원칙을 정의하기”로 이동한다.

11. Constitutional AI도 externalized feedback이지만 objective feedback은 아니다

여기서 code execution과 Constitutional AI를 같은 종류의 verifier로 보면 안 된다.

Compiler나 unit test는 비교적 hard signal을 줄 수 있다.

Constitution은 normative rule이다. 여전히 해석이 필요하다.

AI judge가 principle을 잘못 적용하거나, 일관성 없이 판정하거나, judge model 자체의 bias를 반영할 수 있다.

따라서 Part 4의 세 feedback source는 하나의 spectrum으로 볼 수 있다.

  • Environment feedback: 모델 밖의 사실과 상태
  • Execution feedback: code/test에서 나오는 machine-checkable behavior
  • Constitutional feedback: 인간 원칙에 의해 제약된 model judgment

세 방식 모두 unconstrained self-critique보다 구조화돼 있지만 objectivity 수준은 다르다.

12. 세 논문의 공통 architecture는 같다

ReAct는 factual grounding, RLEF는 code generation, Constitutional AI는 harmlessness를 다룬다.

하지만 시스템 구조는 놀랄 만큼 비슷하다.

  1. model이 answer 또는 action을 만든다.
  2. 외부 process가 그것을 평가하거나 변화시킨다.
  3. 결과가 feedback으로 돌아온다.
  4. model이 다음 output을 바꾼다.
  5. 이 loop가 반복되거나 training signal로 distill된다.

그래서 Part 4가 self-improving agent 강의의 핵심에 놓인다.

개선은 “reflection을 많이 한다”에서 오는 것이 아니다.

모델이 같은 형태로 이미 가지고 있지 않았던 정보를 feedback channel이 새로 공급하기 때문에 가능해진다.

13. 가장 강한 반론: external feedback도 결국 새로운 reward hacking target 아닌가?

그렇다. Agent는 우리의 의도를 직접 최적화하지 않는다. 우리가 제공한 signal을 최적화한다.

Search API가 noisy하면 잘못된 source를 과신할 수 있다. Unit test가 불완전하면 test에만 맞출 수 있다. Constitution이 모호하면 AI judge가 좋아하는 표면적 패턴만 학습할 수 있다.

그래서 feedback을 model 밖으로 옮기는 것만으로는 충분하지 않다.

Feedback channel 자체가 exploitation을 견딜 수 있어야 한다.

가장 방어 가능한 결론은 다음이다.

External feedback은 model의 내부 self-evaluation보다 더 informative하고, 더 falsifiable하며, 더 어렵게 해킹될 때 self-improvement를 실제로 강화한다.

14. 이 글이 주장하지 않는 것

  • ReAct가 모든 task에서 pure CoT보다 무조건 우수하다고 주장하지 않았다.
  • Tool use가 자동으로 truth를 보장한다고 주장하지 않았다.
  • RLEF가 software engineer를 대체하거나 임의의 대규모 repository를 해결한다고 주장하지 않았다.
  • Execution feedback이 incomplete test에서 reward hacking에 면역이라고 주장하지 않았다.
  • Constitutional AI가 human input을 완전히 제거한다고 주장하지 않았다. 인간은 여전히 principles를 정의한다.
  • RLAIF가 normative judgment를 objective ground truth로 바꾼다고 주장하지 않았다.
  • 세 feedback 방식 중 하나만으로 모든 agent task를 해결할 수 있다고 주장하지 않았다.

15. Part 4의 실제 결론

Part 2와 Part 3는 더 잘 search하고 더 잘 verify하는 방법을 다뤘다.

Part 4는 더 근본적인 질문으로 이동한다.

교정 신호는 어디서 오는가?

세 가지 답이 있다.

  1. ReAct: environment가 답을 돌려주게 한다.
  2. RLEF: artifact를 실제 실행하고 behavior를 feedback으로 사용한다.
  3. Constitutional AI: 인간이 작성한 원칙을 scalable AI feedback으로 바꾼다.

세 방식의 객관성, 비용, failure mode는 다르다.

하지만 공통점은 language model 하나가 생성·비평·판정을 모두 담당하는 닫힌 고리에서 벗어난다는 것이다.

이것이 language model에서 agent로 넘어가는 더 중요한 변화다.

시스템의 성능은 model 자체뿐 아니라 model을 둘러싼 feedback channel에 의해 결정된다.

Part 5에서는 feedback mechanism에서 evaluation으로 이동한다. Agent가 act하고 observe할 수 있다면, 더 긴 task에서 capability·reliability·usefulness를 어떻게 측정해야 하는가?

Claim map

  • Speaker / Course Claim: tool interaction, execution feedback, constitutional feedback은 language model 주변에 self-improvement loop를 만드는 세 가지 주요 feedback source다.
  • Verified Fact: ReAct는 reasoning trace와 action을 interleave하고 HotpotQA, FEVER, ALFWorld, WebShop에서 강한 결과를 보고했다. RLEF의 실제 arXiv는 2410.02089이며 8B/70B competitive-programming model에서 strong results와 sample requirement의 order-of-magnitude 감소를 보고한다. Constitutional AI는 supervised critique/revision phase와 RLAIF phase를 사용하며 human oversight를 written principles 형태로 제공한다.
  • Editorial Interpretation: “feedback quality는 signal이 얼마나 external하고 falsifiable하며 hard-to-game한가에 좌우된다”는 문장은 이번 글의 종합적 해석이다.

강의 지도

  • 00:00–00:28 — ReAct, tool use, grounding, environment feedback
  • 00:28–00:46 — execution feedback과 iterative code repair
  • 00:46–01:01 — Constitutional AI, critique/revision, RLAIF
  • 01:01–01:11 — feedback loop, agent architecture, open questions

주요 1차 출처