일론 머스크의 xAI가 개발한 대규모 언어모델(LLM) 그록 4.6이 인공지능 분석 기업 아티피셜 애널리시스(Artificial Analysis)의 지능 지수(AAII)에서 61점을 기록하며 비용 효율성 측면에서 선두권에 진입했습니다. 이는 GPT-5.6 Sol과 동점이며, 클로드 오푸스 5(Claude Opus 5)와 페이블 5(Fable 5)에 이어 최상위권에 해당하는 점수입니다. 한 달 만에 4.5 버전보다 5점 상승하며 기술적 진보를 입증했습니다.
그록 4.6의 가장 큰 강점은 에이전트(Agent) 성능과 가격 경쟁력에 있습니다. 에이전트 작업에서 엘로(Elo) 점수 1753을 기록하며 클로드 오푸스 5 다음으로 높은 순위를 차지했고, 큐웬 3.8 맥스(Qwen 3.8 Max) 및 페이블 5와 신뢰 구간이 겹칠 정도로 우수합니다. 특히 도구를 사용하며 여러 단계를 수행하는 복잡한 작업에서 두드러진 능력을 보입니다. 가격 면에서는 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로, GPT-5.6 Sol(입력 5달러/출력 30달러)이나 클로드 오푸스 5(입력 5달러/출력 25달러)보다 훨씬 저렴합니다. 장시간 지식 작업 벤치마크인 AA-Briefcase에서도 페이블 5급 성능을 내면서 클로드 오푸스 5보다 훨씬 적은 턴과 입력 토큰으로 작업을 완료해 토큰 효율성 또한 뛰어납니다.
이러한 그록 4.6의 발전은 대규모 언어모델 시장의 경쟁 구도를 더욱 흥미롭게 만들고 있습니다. 최고 점수 자체는 클로드 오푸스 5가 앞서지만, 그록 4.6은 GPT-5.6 Sol급의 종합 성능과 선두권 에이전트 성능, 그리고 낮은 가격을 결합하여 '지능 대비 비용 파레토 효율(Pareto frontier)'의 최전선에 올랐다는 평가를 받습니다. 이는 단순히 성능이 좋은 모델을 넘어, 실제 비즈니스 환경에서 비용 효율적인 AI 솔루션을 찾는 기업들에게 매력적인 대안이 될 수 있음을 의미합니다. 특히 복잡한 에이전트 작업을 저렴하게 수행할 수 있다는 점은 다양한 자동화 및 서비스 개발 분야에서 새로운 기회를 창출할 잠재력이 있습니다.