yozm.tech
피드로 돌아가기
PlatumAI 재작성

AI 성능 1위 모티프, 정부 독파모 사업 평가에 이의 제기

AI 성능 지표에서 가장 높은 점수를 받은 모티프테크놀로지스가 정부의 '독자 AI 파운데이션 모델(독파모)' 사업 2차 평가에서 탈락하자 공식 이의를 제기했습니다. 모티프는 평가 항목별 상세 점수, 배점 산식, 전문가 및 사용자 평가의 판단 근거 공개를 요구하며 평가 투명성 문제를 제기했습니다. 과기정통부는 15일 이내 검토하겠다고 밝혔습니다.

6일 전·2026.08.27·읽기 3·조상래

모티프테크놀로지스가 정부의 '독자 AI 파운데이션 모델(독파모)' 사업 2차 단계평가 결과에 공식적으로 이의를 제기했습니다. 모티프는 글로벌 AI 종합 성능 지표인 AAII(Artificial Analysis Index)에서 참여 모델 중 가장 높은 점수를 받았음에도 불구하고, 종합 평가에서는 최하위로 탈락했기 때문입니다. 이에 모티프는 평가 항목별 세부 점수, 배점 산식, 전문가 및 사용자 평가의 판단 근거를 투명하게 공개해 줄 것을 요구했습니다.

독파모는 정부가 국내 기업의 대규모 AI 기반 모델 개발을 지원하는 사업으로, 과학기술정보통신부(과기정통부)와 정보통신산업진흥원(NIPA)이 주관합니다. 2차 단계평가에서는 업스테이지, SK텔레콤, LG AI연구원 세 팀이 다음 단계로 진출했으며, 모티프테크놀로지스는 탈락했습니다. 평가는 벤치마크(40점), 전문가 평가(35점), 사용자 평가(25점)로 구성된 100점 만점 체계였습니다. 특히 벤치마크 40점은 글로벌 평가지표 AAII(25점)와 한국지능정보사회진흥원(NIA) 벤치마크(15점)로 나뉘었습니다. 모티프는 자체 모델 '모티프 3'가 AAII에서 47점을 기록하며 업스테이지(37점), SK텔레콤(35점), LG AI연구원(31점)보다 높은 점수를 받았음에도 종합 점수에서는 최하위를 기록해 탈락했다고 밝혔습니다. 과기정통부는 모티프의 기술력은 뛰어났으나, 사용성 및 활용성 부분에서 상대적으로 낮은 평가를 받았다고 설명했습니다.

모티프는 평가 결과 자체는 받아들이지만, 벤치마크 성능과 다른 평가 항목의 결과가 크게 엇갈린 이유를 업계가 납득할 수 있도록 설명해야 한다는 입장입니다. 특히 AAII 원점수를 25점 만점으로 환산하는 방식이 실제 성능 차이를 충분히 반영하지 못한다고 지적했습니다. 또한, 전문가 평가에서 AAII 점수가 가장 낮았던 LG AI연구원이 1위를 차지한 것에 대해 개발 전략, 기술, 성과, 계획 등 항목에서 어떤 판단이 내려졌는지 근거를 공개하라고 요구했습니다. 사용자 평가의 경우, 대기업과 스타트업 모델을 일반 사용자가 평가할 때 브랜드 인지도나 선입견이 영향을 미칠 수 있으므로 블라인드 평가 적용 여부와 방식에 대한 설명을 요청했습니다.

정부는 독파모 사업이 단순히 벤치마크 성능만으로 국가대표 모델을 선발하는 것이 아니라 서비스 목표와 실제 사용자의 평가도 중요한 요소라고 강조했습니다. 또한, 평가 기준은 참여 기업들과 협의를 거쳐 마련되었다고 밝혔습니다. 이번 이의 제기를 계기로 과기정통부는 평가 절차와 형식상 부당함이 있었는지 검토하고, 업체별 세부 점수 공개 범위와 3차 평가제도 개편 방향에 대한 논의를 진행할 예정입니다. 모티프는 이번 이의 제기가 재선정을 요구하는 것이 아니며, 이의 제기 결과와 무관하게 3차 평가에는 참여하지 않겠다고 밝혔습니다. 이는 파운데이션 모델의 가치가 특정 챗봇의 사용성보다는 여러 영역으로 확장 가능한 기반 성능에 있다고 보기 때문입니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
3점인가

평가 투명성 문제는 지속적으로 제기되지만, 이를 해결하는 사업 기회는 1인 창업자가 진입하기에 장벽이 높습니다.

문제 / 미충족 수요

정부 지원 사업의 평가 기준 및 과정의 투명성 부족으로 인해 참여 기업들이 결과에 대한 신뢰를 갖기 어렵습니다.

한국 시장
국내 있음정부 지원 사업이 많아 평가의 공정성 및 투명성 요구가 지속적으로 제기되는 상황입니다.
수익 모델

컨설팅/자문 서비스, 감사/검증 서비스 · 돈 내는 주체: 정부 부처, 공공기관, 대기업 (평가 기준 수립 및 검증 의뢰)

1인 실현 가능성
2/5

평가 기준 수립 및 자문은 전문성과 경험이 필요하며, 공공기관과의 네트워크 구축이 중요하여 1인 창업자가 진입하기 쉽지 않습니다.

진입 지점 (Wedge)

정부 및 공공기관의 AI/SW 사업 평가 기준 및 방법론 수립 자문 서비스

이번 주 첫 실험

정부 및 공공기관의 AI/SW 사업 평가 관련 공개된 자료들을 수집하고 분석하여 문제점과 개선점을 도출하는 보고서 작성

Original source
이 글은 Platum의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기