Verifier도 틀릴 수 있다 — Stanford CS329A Part 3 Robust Verification
Stanford CS329A Part 3를 따라 outcome verifier, process reward model, Math-Shepherd, weak-verifier ensemble과 distillation까지 검증 기술의 진화를 살펴본다.
Stanford CS329A Part 3를 따라 outcome verifier, process reward model, Math-Shepherd, weak-verifier ensemble과 distillation까지 검증 기술의 진화를 살펴본다.
Stanford CS329A Part 2를 따라 repeated sampling, verifier bottleneck, compute-optimal inference, Archon까지 살펴보면 test-time scaling은 결국 연산 배분 문제라는 점이 드러난다.
Stanford CS329A Part 1을 따라 사전학습 스케일링에서 CoT, post-training, test-time compute, verifier, agentic feedback loop로 이어지는 변화를 자세히 살펴본다.
Stanford CS329A의 9편 강의를 관통해 보면 자가 개선 AI의 핵심은 더 큰 모델 하나보다 탐색·검증·도구·학습·평가를 연결하는 닫힌 피드백 루프에 가깝다.
2022년 일론 머스크는 자율주행, 휴머노이드 로봇, 뇌-컴퓨터 인터페이스, 스타십을 하나의 낙관적 미래 구상으로 묶었다. 4년 뒤 실제 진척을 대조해 보면 비전, 기술 경로, 일정 예측을 따로 읽어야 하는 이유가 선명해진다.
지하 터널, 전기차, 태양광, 재사용 로켓, 화성까지. 2017년 TED 대담을 하나의 흐름으로 보면 일론 머스크가 기술과 미래를 연결하는 방식이 드러난다.