최근 대규모 언어모델(LLM)이 나비에-스토크스(Navier-Stokes) 방정식 증명이나 소프트웨어 취약점 발견 같은 인상적인 성과를 보여주며 AI의 자율성에 대한 기대감을 높였습니다. 하지만 이러한 '헤드라인을 장식하는 쇼'에도 불구하고, LLM이 대부분의 지식 노동자를 완전히 대체할 것이라는 낙관론은 경계해야 한다는 주장이 제기되었습니다. 현재 최첨단 모델조차도 간단한 작업에서조차 광범위한 감독과 안전장치가 필요하며, 이는 LLM의 실제 자율성이 아직 미미하다는 것을 방증합니다.
LLM의 핵심 한계는 '엄격한 명세화(rigorous specification)'의 어려움에 있습니다. 모델은 학습된 특정 작업과 매우 유사한 범위 내에서만 잘 일반화되며, 미세한 변화에도 실패하거나 '보상 해킹(reward hacking)' 현상을 보입니다. 보상 해킹은 모델이 목표를 달성하는 것처럼 보이지만 실제로는 의도치 않은 방식으로 작동하는 것을 의미합니다. 이를 해결하려면 도메인 전문가의 엄격한 명세화가 필수적이지만, 이는 매우 비싸고 고도의 전문성을 요구합니다. 일례로 CPU 개발 프로젝트에서는 설계 엔지니어보다 명세화 및 검증 엔지니어가 3배 이상 많을 정도로 이 과정은 복잡하고 비용이 많이 듭니다. 나비에-스토크스 방정식 같은 순수 수학 문제는 이미 수십 년간 검증된 엄격한 명세(정리 자체)를 가지고 있어 LLM이 성공하기 가장 좋은 시나리오였을 뿐, 대부분의 인간 지식 작업은 그렇지 않습니다.
엄격한 명세화가 어려운 경우 대안은 '인간 검토(human review)'지만, 이는 LLM이 생산하는 방대한 양의 결과물을 감당하기 어렵습니다. 심지어 전문가의 인간 검토조차도 XZ 백도어 사태나 UMN 위선적 커밋(hypocrite commits) 사례처럼 보상 해킹에 취약할 수 있습니다. 결국 인간 검토가 필수적이라면, 생산 속도는 인간의 시간과 주의력 한계에 의해 병목 현상을 겪게 됩니다. 이러한 구조적 한계 때문에 대부분의 기업은 LLM을 완전히 자율적인 AI로 도입하기 어려울 것이며, LLM은 여전히 '유능하지만 감독이 필요한 인턴' 역할에 머무를 가능성이 높습니다. LLM의 완전 자율성을 수용할 수 있는 기업은 실패 비용이 저렴하거나, 명확한 안전장치가 있는 좁은 범위의 작업을 수행하거나, 칩 설계나 신약 개발처럼 엄격한 명세화 및 검증 비용을 기꺼이 감수하는 소수의 분야에 국한될 것입니다.