Strands Labs가 텍스트 생성 대신 특정 선택지 중 하나를 고르거나 수치 점수를 매기는 소형 오픈소스 의사결정 모델인 Strands Decider 2B를 공개했습니다. 이 20억 매개변수 모델은 로컬 CPU나 GPU에서 빠르게 실행되도록 설계되어, 개발자들이 에이전트 AI 실험을 신속하게 진행할 수 있도록 돕습니다. 각 결정에 대한 신뢰도 점수를 제공하며, 동일한 프롬프트에 대해 여러 질문을 효율적으로 처리할 수 있는 것이 특징입니다.
Strands Decider 2B는 Qwen3.5-2B 모델의 텍스트 생성 헤드(LM head)를 선택지별 점수를 계산하는 포인터 헤드(pointer head)로 교체한 구조를 가집니다. 이를 통해 출력의 유연성을 줄이는 대신, 동일한 크기의 다른 모델보다 더 빠르고 높은 성능을 달성합니다. JevBench 공개 세트 평가에서 20억 매개변수급 모델 중 3위를 기록했으며, 로컬 Nvidia RTX 3090 환경에서 결정 지연 시간 중앙값은 약 115ms로 매우 빠릅니다. 코드, 가중치뿐만 아니라 학습 데이터와 학습 스크립트까지 모두 공개되어 있어, 개발자들이 모델을 직접 활용하거나 개선할 수 있습니다.
이러한 의사결정 모델은 대규모 언어모델(LLM)의 높은 비용과 지연 시간 문제를 해결하는 데 중요한 역할을 할 수 있습니다. 복잡한 추론이 필요한 작업은 LLM에 맡기고, 모델 라우팅, 도구 선택, 가드레일(guardrail) 등 반복적이고 쉬운 결정은 Strands Decider 2B와 같은 소형 모델로 처리하는 하이브리드 에이전트(hybrid agent) 접근 방식이 가능해집니다. 이를 통해 전체 시스템의 효율성을 높이고 운영 비용을 절감할 수 있으며, 각 결정에 대한 신뢰도 점수를 제공하여 에이전트의 안정성을 향상시키는 데 기여할 것으로 기대됩니다.