최근 Fable 5와 GPT-5.6 Sol 등 최신 AI 모델들이 NP-난해(NP-hard) 문제 중 하나인 미공개 광섬유망 최적화 문제 해결 능력을 시험했습니다. 30분간 문제 풀이를 진행한 결과, Fable 5가 가장 안정적인 성능을 보였으며, 특히 일반 모드에서 뛰어난 안정성을 입증했습니다. 반면, AI 모델의 목표 지향적 탐색을 돕는 /goal 기능은 흥미로운 결과를 보여주었습니다.
이번 실험은 2018년 공학 해커톤에 출제되었던 KIRO 광섬유망 최적화 문제를 사용했습니다. 이 문제는 Grenoble, Nice, Paris 세 도시의 방향성 거리 행렬을 기반으로 총 케이블 길이를 최소화하는 것이 목표입니다. 루프와 분기를 포함한 복잡한 네트워크 구성과 여러 구조적 제약 조건 때문에 탐색 공간이 약 10^1223에 달할 정도로 방대합니다. Fable 5와 GPT-5.6 Sol은 각각 일반 모드와 /goal 모드로 30분씩 여러 차례 실행되었으며, Claude 계열의 Opus 4.8, Sonnet 5와 GPT 계열의 Terra, Luna 모델도 함께 비교되었습니다.
실험 결과, /goal 기능은 6회 비교 중 4회에서 개별 승리를 거두었지만, 드물게 발생하는 큰 성능 저하로 인해 Fable 5와 GPT-5.6 Sol 모두 평균 점수가 악화되었습니다. Fable 5의 일반 모드는 평균 32,386점으로 가장 안정적인 결과를 보였고, /goal 모드에서는 전체 최고 기록인 31,934점을 달성하기도 했습니다. 이는 /goal이 단순히 더 오래 작업하게 하는 것을 넘어 제어 루프와 탐색 경로를 변경하여, 좋은 전략뿐만 아니라 잘못된 전략도 지속시킬 수 있음을 의미합니다. 즉, 어려운 최적화 문제에서는 반복 횟수보다 반복하는 전략의 품질이 훨씬 더 중요하다는 결론을 내릴 수 있습니다.
이러한 결과는 AI 모델이 복잡한 문제 해결에 있어 단순히 목표를 부여하는 것만으로는 충분하지 않다는 점을 시사합니다. 특히 탐색 공간이 넓고 제약 조건이 많은 최적화 문제에서는, 모델이 효과적인 탐색 전략을 수립하고 유지하는 능력이 핵심입니다. 이번 연구는 AI 모델의 한계와 가능성을 동시에 보여주며, 향후 더 정교하고 지능적인 문제 해결 전략 개발의 필요성을 강조합니다. 또한, 컨텍스트 압축(context compression)과 같은 내부 작동 방식이 장기적인 작업 성능에 미치는 영향에 대한 논의도 활발해질 것으로 보입니다.