스페이스XAI(SpaceXAI)의 최신 대규모 언어모델(LLM) 그록 4.6(Grok 4.6)이 인공분석 지능 지수(Artificial Analysis Intelligence Index)에서 61점을 획득하며, GPT-5.6 솔(Sol)과 동급의 최전선 모델로 평가받고 있습니다. 이 모델은 특히 에이전트(agentic) 작업에서 강력한 성능을 발휘하면서도, 경쟁사 모델 대비 훨씬 낮은 비용을 제시하여 업계의 이목을 집중시키고 있습니다.
그록 4.6은 이전 버전인 그록 4.5보다 한 달 만에 지능 지수에서 5점 상승했으며, 그록 4.3 대비 23점이나 올랐습니다. 이를 통해 스페이스XAI는 오픈AI(OpenAI)와 함께 지능 최전선에 다시 합류했으며, 앤트로픽(Anthropic) 다음으로 높은 순위를 기록했습니다. 그록 4.6은 클로드 오푸스 5(Claude Opus 5)와 클로드 페이블 5(Claude Fable 5)에 이어 3위를 차지했지만, GDPval-AA v2 엘로(Elo) 점수 1753점을 기록하며 에이전트 성능에서는 클로드 오푸스 5 다음으로 높은 성과를 보였습니다. 또한, 𝜏³-뱅킹(Banking)에서 50.7%, 터미널-벤치 v2.1(Terminal-Bench v2.1)에서 88.4%를 기록하며 다중 턴 고객 서비스 및 터미널 기반 소프트웨어 작업에서도 선두 모델들과 어깨를 나란히 했습니다. 특히, 100만 토큰당 입력 2달러, 출력 6달러로 책정된 가격은 클로드 오푸스 5(입력 5달러/출력 25달러)나 GPT-5.6 솔(입력 5달러/출력 30달러)보다 60% 이상 저렴하여, 작업당 비용 효율성 측면에서 파레토 최전선에 위치합니다.
그록 4.6의 등장은 고성능 AI 모델의 접근성을 크게 높일 수 있다는 점에서 중요한 의미를 가집니다. 특히 에이전트 기반 작업에서 뛰어난 성능을 저렴한 비용으로 제공함으로써, 기업들이 AI를 활용한 자동화 및 서비스 개선에 더 적극적으로 나설 수 있는 기회를 제공합니다. 긴 컨텍스트(context)를 처리하는 장기 지식 작업(long-horizon knowledge work) 벤치마크인 AA-브리프케이스(AA-Briefcase)에서도 그록 4.6은 클로드 페이블 5 수준의 성능을 보였으며, 클로드 오푸스 5 대비 절반의 턴(turn)과 1/4의 입력 토큰으로 작업을 완료하는 효율성을 보여주었습니다. 이는 추론(inference) 중심의 워크로드에서 비용 우위를 확보할 수 있음을 의미하며, AI 기술의 상업적 활용 범위를 넓히는 데 기여할 것으로 기대됩니다.
