English version: When AI Makes Work Cheaper, the Bottleneck Moves
AI를 설명하는 가장 흔한 문장은 “더 적은 사람으로 더 많은 일을 할 수 있게 됐다”는 것이다. 실제로 코딩, 문서 작성, 분석, 반복 입력 같은 업무에서 그 변화는 이미 보인다.
하지만 생산성이 올라간다는 말만으로는 중요한 부분을 놓치기 쉽다.
한 단계가 빨라진다고 전체 시스템이 같은 속도로 빨라지는 것은 아니다.
코드를 훨씬 빨리 만들 수 있어도 제품 출시가 그대로 빨라지지 않을 수 있다. 행정 신청을 자동화해도 검증과 책임의 문제가 사라지지는 않는다. AI 연구를 더 강한 AI가 도와준다고 해도, 그 AI를 어떻게 평가하고 감독할 것인지는 별개의 문제로 남는다.
서로 다른 세 대화를 연결해 보면 하나의 질문이 나온다.
AI가 어떤 일을 싸게 만들었을 때, 그다음에는 무엇이 새롭게 비싸지는가?
이 질문은 “AI가 인간을 대체할까?”보다 지금의 조직과 사업을 이해하는 데 더 유용할 수 있다.
코딩이 싸지면 ‘무엇을 만들 것인가’가 더 중요해진다
Y Combinator의 2026년 대담 The State of Startups in 2026은 최근 스타트업 환경에서 몇 가지 변화를 관찰한다.
YC는 자신들이 만나는 기업 가운데 solo founder가 늘고 있으며, 작은 팀이 이전보다 큰 문제를 시도하고 있다고 말한다. 또 순수 소프트웨어에서 로보틱스, 제조, 방산, 반도체·포토닉스, 전력과 컴퓨팅 인프라 같은 물리적 산업으로 창업 분야가 넓어지는 흐름을 강조한다.
YC의 설명에서 AI가 하는 일은 공장이나 로봇을 대신 만들어주는 것이 아니다. 하드웨어 기업을 만들 때 따라붙던 소프트웨어 작업의 일부를 더 적은 인력으로 처리할 수 있게 한다는 것이다.
제어 프로그램, 내부 도구, 데이터 분석, 프로토타입, 업무 자동화에 필요한 비용이 줄어들면 작은 팀도 과거보다 복잡한 사업을 시작할 여지가 커진다.
여기서 YC가 도달하는 결론은 역설적이다.
만드는 방법이 쉬워질수록 무엇을 만들어야 하는지 아는 능력이 중요해진다.
고객이 실제로 돈을 지불하는 문제가 무엇인지, 어떤 요구가 단순한 불편인지 구조적인 문제인지, 보기에는 쉬워도 실제 운영에서는 어려운 일이 무엇인지는 코드 생성만으로 얻기 어렵다.
다만 이 주장은 반드시 범위를 제한해서 읽어야 한다. YC가 보는 기업은 전 세계 기업의 평균이 아니라 고성장 기술 스타트업이라는 매우 선택된 표본이다. “AI 때문에 모든 창업이 쉬워졌다”는 결론으로 확대할 수는 없다.
연구에서도 ‘코드 생산’과 ‘실제 출시’는 다르게 움직인다
AI 코딩 도구가 개발 생산성을 실제로 높이는지에 대한 연구 결과는 한 방향으로만 나오지 않는다.
2026년 Management Science에 발표된 세 개의 현장 무작위 실험은 Microsoft, Accenture, Fortune 100 기업의 소프트웨어 개발자 4,867명을 분석했다. 세 실험을 합친 결과 AI 코딩 도구를 사용한 개발자는 완료한 작업 수가 평균 약 26% 증가했다.
즉 특정 환경에서는 AI가 실제 생산성을 끌어올릴 수 있다는 근거가 있다.
하지만 “코드를 더 많이 만든다”와 “실제 소프트웨어를 더 많이 출시한다”는 같은 말이 아니다.
2026년 9월 개정판 NBER Working Paper 35275는 50만 명이 넘는 GitHub 개발자의 AI 사용과 활동 데이터를 분석했다. 연구진은 새로운 AI 코딩 도구가 commits를 크게 늘리는 현상을 관찰했지만, 효과는 projects와 실제 releases 단계로 갈수록 크게 줄었다고 보고했다.
가장 강한 autonomous coding agent의 경우 연구에서 누적 commit 증가는 240%였지만, project 수에서는 80%, 실제 release에서는 30% 수준으로 줄었다.
이 패턴은 단순하다.
코드 작성이 빨라져도 검토, 통합, 테스트, 아키텍처, 의사결정 같은 다른 작업이 같은 속도로 빨라지지 않으면 그 작업들이 새로운 병목이 된다.
한 조직의 생산성은 가장 빠른 단계가 아니라 서로 연결된 여러 단계의 조합으로 결정된다.
그렇다고 “AI가 코딩을 싸게 만들었다”고 단정할 수도 없다
여기에는 강한 반론이 있다.
METR가 2025년에 진행한 무작위 실험에서는 자신이 익숙한 대규모 open-source repository에서 실제 업무를 수행한 숙련 개발자 16명이 AI 도구를 사용할 때 오히려 작업 시간이 19% 늘었다.
흥미로운 점은 참가자들이 실제 결과와 반대로 AI가 자신을 더 빠르게 만들었다고 느꼈다는 것이다.
이 결과는 AI가 개발자에게 도움이 되지 않는다는 뜻이 아니다. METR 역시 해당 실험이 특정 시점의 도구, 특정 개발자, 특정 repository와 작업에 대한 결과라고 명확히 제한한다.
2026년 후속 실험에서는 최신 도구의 효과를 다시 측정하려 했지만, AI 없이 작업하기를 거부하는 개발자가 늘어나는 등 selection effect가 커져 정확한 생산성 효과를 추정하기 어려워졌다고 보고했다.
따라서 더 정확한 결론은 이것이다.
AI 생산성은 균일하지 않다.
누가 사용하는지, 어떤 작업인지, 코드베이스를 얼마나 잘 아는지, 어떤 도구를 쓰는지, 그리고 무엇을 “성과”라고 측정하는지에 따라 효과가 달라진다.
행정에서도 비용은 없어지기보다 다른 곳으로 이동한다
이 패턴은 소프트웨어 밖에서도 볼 수 있다.
저널리스트 Annie Lowrey는 Conversations with Tyler에서 정부 서비스를 이용하기 위해 시민이 쓰는 시간을 “Time Tax”라고 부른다.
세금 신고, 복지 신청, 전화 대기, 자격 증명, 같은 정보를 여러 기관에 반복 제출하는 일은 직접 돈을 내는 행위가 아니다. 하지만 시민의 시간을 소비한다는 점에서는 분명한 비용이다.
Lowrey의 문제 제기는 “모든 행정 절차를 없애자”는 것이 아니다.
Tyler Cowen은 중요한 반론을 제기한다. 어떤 절차는 사기와 부정수급을 막기 위해 필요하고, 어떤 공공서비스는 한정된 자원을 배분하기 위해 screening이나 rationing이 필요할 수 있다.
그러면 질문이 달라진다.
검증이라는 비용을 누가 부담해야 하는가?
현재는 시민이 시간을 들여 반복적으로 자신의 자격을 입증한다. 그러나 정부가 이미 가지고 있는 데이터를 활용하고, 신청 단계는 단순화하면서 사후 감사를 강화하거나, 자동화가 반복 입력을 대신한다면 비용의 일부를 시민에게서 시스템으로 옮길 수 있다.
여기에서도 비용은 사라지지 않는다.
위치가 바뀐다.
AI가 더 강해질수록 평가와 감독은 더 중요해진다
Noam Brown과 Dwarkesh Patel의 2026년 대담은 같은 문제를 AI 연구 자체에 적용한다.
Brown은 multi-agent systems와 수학 추론의 발전이 AI 연구 자동화를 이전보다 현실적인 연구 주제로 만들고 있다고 본다. 여러 AI agent가 동시에 서로 다른 접근을 시도하고 결과를 결합할 수 있다면 연구와 코딩의 일부를 병렬화할 수 있기 때문이다.
그러나 AI가 더 많은 연구를 수행하게 되는 순간 다른 제약이 커진다.
그 AI를 누가 평가할 것인가?
Brown은 모델이 평가 환경에서 잘 행동한다고 해서 실제 배포 환경에서도 같은 방식으로 행동한다고 보장할 수 없다고 지적한다. 새로운 능력이 나타날수록 기존 평가가 실제 행동을 제대로 대표하지 못할 가능성도 커진다.
chain-of-thought를 관찰하는 것도 완전한 해법은 아니다. 보이는 사고과정을 직접 처벌하는 방식으로 학습시키면 모델이 잘못된 목표를 버리는 대신 관찰하기 어려운 방식으로 숨기는 법을 학습할 가능성을 우려한다.
능력이 빨라질수록 평가와 감독도 같은 속도로 발전해야 한다.
그렇지 않으면 성능 향상이 새로운 운영 병목을 만든다.
세 사례를 하나의 법칙으로 만들면 안 된다
여기서 가장 조심해야 할 부분이 있다.
스타트업의 개발 병목, 정부 행정의 시간비용, 고도 AI의 평가 문제는 서로 다른 현상이다.
이를 “모든 효율화는 반드시 다른 비용을 만든다”는 보편 법칙으로 만들면 과잉 해석이다.
AI가 어떤 업무를 자동화하면서 실제로 전체 비용을 크게 줄이는 경우도 많다. 기술 발전으로 과거의 병목이 거의 사라진 사례도 충분히 있다.
따라서 이 글의 주장은 법칙이 아니라 분석 방법에 가깝다.
어떤 기술이 놀라운 생산성 향상을 보여줄 때 다음 질문까지 같이 묻는 것이다.
- 정확히 어떤 단계가 빨라졌는가?
- 전체 결과도 같은 비율로 좋아졌는가?
- 그렇지 않다면 어느 단계에서 효과가 줄어드는가?
- 새로 중요해진 인간의 판단·검증·통합 작업은 무엇인가?
- 그 병목도 자동화된다면 다음 제약은 어디로 이동하는가?
AI 시대에 더 유용한 질문
AI를 도입할 때 조직은 흔히 “얼마나 많은 일을 자동화할 수 있는가?”를 먼저 묻는다.
그 질문만으로는 부족하다.
코딩 시간이 절반으로 줄어도 고객이 무엇을 원하는지 결정하는 시간이 그대로라면 문제선정이 상대적으로 더 중요해진다.
행정 입력이 자동화되어도 누가 혜택을 받아야 하는지 판단하는 규칙이 복잡하다면 검증이 병목으로 남는다.
AI 연구가 빨라져도 모델을 평가하는 방법이 따라오지 못한다면 감독이 병목이 된다.
그래서 AI 시대의 더 좋은 질문은 이것일 수 있다.
“AI가 이 일을 싸게 만들면, 우리 시스템에서는 무엇이 다음으로 가장 비싸지는가?”
AI의 가치는 단순히 더 많은 결과물을 만드는 데 있지 않다.
새로운 속도에 맞춰 다음 병목을 얼마나 빨리 발견하고 다시 설계하느냐에 있다.
Primary Sources
- Y Combinator — The State of Startups in 2026
- Annie Lowrey — Annie Lowrey on the Time Tax, Fraud, and Rationing by Paperwork
- Noam Brown — Agent swarms, alignment, & recursive self-improvement
- Cui et al. — The Effects of Generative AI on High-Skilled Work
- Demirer, Musolff & Yang — Writing Code vs. Shipping Code
- METR — Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity
- METR — We are Changing our Developer Productivity Experiment Design
이 글에서 근거를 사용하는 방식
이 글은 서로 다른 원문과 별도의 실증 연구를 하나의 질문 아래 연결해 읽되, 서로 다른 종류의 근거를 하나의 데이터처럼 취급하지 않는다.
YC, Lowrey, Brown의 발언은 각 인물의 견해로 구분하고, 개발자 생산성 관련 수치는 독립 연구 결과로 다룬다. “AI가 병목을 없애기보다 이동시킬 수 있다”는 결론은 여러 자료를 연결한 해석이다.