새로운 멀티모달 대규모 언어모델(LLM)인 피스티스(Pistis) 모델군이 공개되며 AI 커뮤니티의 주목을 받고 있습니다. 270억 개 및 90억 개 파라미터 규모로 개발된 이 모델들은 큐웬(Qwen) 3.6과 3.5를 기반으로 하며, 특히 'IDRL(Interleaved Distillation and Reinforcement Learning)'이라는 혁신적인 후처리 학습 프레임워크를 통해 기존 모델의 한계를 뛰어넘는 성능을 보여줍니다. 이는 멀티모달 데이터에 대한 깊이 있는 추론(reasoning)과 에이전트(agentic) 기능을 강화하는 데 중점을 둡니다.
피스티스 모델 개발팀은 먼저 대규모 멀티모달 지도 미세조정(SFT)을 통해 강력한 기반을 다졌습니다. 이 위에 IDRL이라는 새로운 학습 패러다임을 적용했는데, 이는 온-폴리시 증류(on-policy distillation)와 강화 학습(reinforcement learning)을 단일 학습 루프 내에서 긴밀하게 통합하는 방식입니다. 두 가지 목표를 독립적으로 최적화하거나 정적인 손실 함수로 결합하는 대신, 번갈아 가며 최적화함으로써 더 효과적인 지식 전달, 안정적인 최적화, 그리고 장기적인 에이전트 궤적에 대한 정확한 크레딧 할당이 가능해졌습니다. 이 프레임워크는 두 가지 특화된 변형 모델을 생성하는데, '피스티스-씽킹(Pistis-Thinking)'은 깊이 있는 멀티모달 추론을 강화하고, '피스티스-에이전틱(Pistis-Agentic)'은 에이전트 궤적 데이터를 추가하여 장기 계획, 반복 추론 및 도구 사용 능력을 지원합니다. 특히 피스티스-에이전틱은 멀티모달 검색(multimodal search)에서 뛰어난 성능을 보입니다.
피스티스 모델군은 단순히 모델 파라미터(model parameter)를 최적화하는 것을 넘어, '피스티스-오토-하네싱(Pistis-Auto-Harnessing, PAH)'이라는 시스템 수준의 방법론도 함께 제시했습니다. PAH는 에이전트의 추론 하네스(inference harness)를 반복적인 최적화를 통해 자동으로 개선하는 기술로, 모델 파라미터를 업데이트하거나 상호작용 예산(interaction budget)을 늘리지 않고도 모델 성능을 향상시킬 수 있다는 점에서 주목할 만합니다. 이러한 접근 방식은 대규모 언어모델이 실제 환경에서 더욱 효율적이고 강력하게 작동할 수 있는 가능성을 열어주며, 복잡한 문제 해결 능력과 자율적인 의사결정 능력을 필요로 하는 다양한 AI 응용 분야에 큰 영향을 미칠 것으로 기대됩니다.
