최신 인공지능(AI) 모델들이 디지털 캔버스 위에서 '모나리자'를 그리는 흥미로운 실험이 진행되었습니다. GPT-5.6 Sol, Claude Fable 5, Grok 4.5, Gemini 3.6 Flash 등 네 가지 선두 모델들이 동일한 색연필 도구 세트를 가지고 그림을 그리는 과정을 분석한 결과, 각 모델의 독특한 접근 방식과 성능 차이가 명확히 드러났습니다.
이번 실험은 AI 모델에 빈 캔버스와 색연필 도구를 제공하고, 모델 스스로 색상, 붓 너비, 압력을 설정하며 선을 긋고, 번지게 하고, 지우는 등 실제 그림을 그리는 과정을 모방하도록 설계되었습니다. 모델은 'view_canvas' 기능을 통해 자신의 작업을 확인하고 수정하며, 목표 이미지(모나리자, 별이 빛나는 밤)를 재현하거나 텍스트 프롬프트에 따라 그림을 그렸습니다. 총 28개의 그림을 통해 도구 사용 방식, 비용, 최종 결과물, 그리고 모델이 스스로 작업을 개선하는 능력이 평가되었습니다. 특히 GPT-5.6 Sol은 다른 모델들이 개별적으로 색상, 붓, 압력을 설정하는 것과 달리, 모든 설정을 'draw' 호출 한 번에 처리하는 독특한 방식을 사용해 효율성 면에서 두각을 나타냈습니다.
이러한 실험은 단순히 AI의 예술적 능력을 평가하는 것을 넘어, 대규모 언어모델(LLM)의 실제적인 문제 해결 능력과 비용 효율성을 보여주는 중요한 지표가 됩니다. 특히 GPT-5.6 Sol은 평균 6.2분, 3.4M 토큰, 약 7.74달러의 비용으로 가장 높은 품질의 그림을 그려내며 효율성 측면에서도 뛰어난 성능을 보였습니다. 반면 Claude Fable 5는 평균 12.5분, 14.6M 토큰, 약 160.58달러로 가장 높은 비용을 지불했음에도 불구하고 상대적으로 낮은 품질의 결과물을 보여주었습니다. 이는 최신 AI 모델들이 복잡하고 개방형 작업에서 얼마나 다양한 전략을 구사하며, 어떤 모델이 특정 유형의 작업에 더 적합한지를 이해하는 데 도움을 줍니다. 또한, 이러한 실험은 오픈소스 모델과 최전선 모델 간의 성능 격차를 명확히 보여주며, AI 기술의 발전 방향을 가늠하는 데 중요한 통찰을 제공합니다.