AI는 자기 추론에서 어떻게 다시 학습하는가 — Stanford CS329A Part 6 Train-Time Scaling
Stanford CS329A Part 6를 따라 STaR, DeepSeekMath/GRPO, DAPO를 연결한다. 검증된 reasoning이 어떻게 지속적인 train-time improvement로 바뀌는지 살펴본다.
Stanford CS329A Part 6를 따라 STaR, DeepSeekMath/GRPO, DAPO를 연결한다. 검증된 reasoning이 어떻게 지속적인 train-time improvement로 바뀌는지 살펴본다.
Stanford CS329A Part 5의 METR, GDPval, DeepScholarBench를 통해 agent capability와 reliability, context, 전문가 수준 산출물 품질이 왜 별개인지 살펴본다.
Stanford CS329A Part 4를 따라 ReAct, 코드 실행 피드백, Constitutional AI를 하나의 질문으로 연결한다. Self-improving agent는 어떤 교정 신호를 믿어야 하는가?
Stanford CS329A Part 3를 따라 outcome verifier, process reward model, Math-Shepherd, weak-verifier ensemble과 distillation까지 검증 기술의 진화를 살펴본다.
Stanford CS329A Part 2를 따라 repeated sampling, verifier bottleneck, compute-optimal inference, Archon까지 살펴보면 test-time scaling은 결국 연산 배분 문제라는 점이 드러난다.
Stanford CS329A Part 1을 따라 사전학습 스케일링에서 CoT, post-training, test-time compute, verifier, agentic feedback loop로 이어지는 변화를 자세히 살펴본다.
Stanford CS329A의 9편 강의를 관통해 보면 자가 개선 AI의 핵심은 더 큰 모델 하나보다 탐색·검증·도구·학습·평가를 연결하는 닫힌 피드백 루프에 가깝다.
2022년 일론 머스크는 자율주행, 휴머노이드 로봇, 뇌-컴퓨터 인터페이스, 스타십을 하나의 낙관적 미래 구상으로 묶었다. 4년 뒤 실제 진척을 대조해 보면 비전, 기술 경로, 일정 예측을 따로 읽어야 하는 이유가 선명해진다.
지하 터널, 전기차, 태양광, 재사용 로켓, 화성까지. 2017년 TED 대담을 하나의 흐름으로 보면 일론 머스크가 기술과 미래를 연결하는 방식이 드러난다.
AI 데이터센터의 전력 문제는 발전량만의 문제가 아니다. 필요한 전력을 얼마나 빨리 연결할지, 그리고 신규 전력망 비용과 위험을 누가 부담할지가 새로운 핵심 쟁점이 되고 있다.