최근 한 연구에서 단돈 67센트라는 놀랍도록 적은 비용으로 인공 일반 지능(AGI) 벤치마크인 ARC-AGI-1 퍼즐의 44%를 해결하는 데 성공했습니다. 이는 RTX 5090 GPU에서 1.5시간 동안 소형 트랜스포머(Transformer) 모델을 처음부터 학습시켜 얻은 결과로, 기존 대규모 언어모델(LLM) 중심의 고비용 연구 방식에 대한 대안을 제시하며 AI 연구 커뮤니티에 큰 반향을 일으키고 있습니다.
이 연구는 입력 및 출력 격자를 토큰화하고, 과제별 임베딩, 3D RoPE(Rotary Position Embedding), 그리고 색상 및 이면체 변환 증강 기법을 결합하여 여러 퍼즐을 동시에 학습했습니다. 특히 SwiGLU, RMSNorm, 8개 계층, NorMuon, 가변 길이 FlashAttention과 같은 최신 아키텍처 요소를 도입하고, 손실 함수를 출력 토큰에만 적용하여 효율성을 극대화했습니다. 3D RoPE와 과제별 임베딩을 제거했을 때 점수가 크게 하락한 것으로 보아, 이 두 가지 표현 방식이 성능 향상에 결정적인 역할을 했음을 알 수 있습니다. 연구팀은 이와 같은 접근 방식을 통해 검증 손실은 나빠졌지만 실제 점수는 높아지는 현상을 관찰했는데, 이는 소규모 데이터에서 최저 검증 손실만을 추구하는 방식의 한계를 보여주는 흥미로운 결과입니다.
이번 성과는 표본 효율성(sample efficiency) 개선이라는 AI 연구의 핵심 과제를 저비용으로 해결할 수 있음을 입증했다는 점에서 큰 의미를 가집니다. 기존 LLM 기반 접근법이 방대한 데이터와 막대한 계산 자원을 요구하는 것과 달리, 이 연구는 제한된 자원으로도 복잡한 추상 추론 문제를 해결할 수 있는 가능성을 보여주었습니다. 이는 컴퓨팅 자원이 부족한 연구자나 소규모 팀도 AGI 연구에 기여할 수 있는 문을 열어주며, AI 기술 발전의 민주화를 촉진할 수 있습니다. 또한, 이 연구는 ARC(Abstract Reasoning Corpus) 벤치마크가 유동 지능(fluid intelligence)을 시험하는 데 적합하며, 합성 데이터나 사전 학습 없이 순수한 트랜스포머 체계만으로도 상당한 잠재력을 발휘할 수 있음을 시사합니다. 향후 연구에서는 PoPE(Position-only Position Embedding) 같은 새로운 위치 임베딩이나 추가적인 아키텍처 현대화를 통해 65% 이상의 성능 달성도 가능할 것으로 전망됩니다.