AI 모델의 성능을 크라우드소싱 방식으로 평가하는 플랫폼 아레나(Arena)가 최근 2억 달러(약 2,700억 원) 규모의 시리즈 B 투자를 유치하며 기업가치 31억 달러(약 4조 2천억 원)를 달성했습니다. 이는 지난 1월 17억 달러(약 2조 3천억 원)의 기업가치로 1억 5천만 달러(약 2천억 원)의 시리즈 A 투자를 유치한 지 불과 10개월 만에 기업가치가 두 배 가까이 성장한 것입니다. 이번 투자는 라이트스피드 벤처 파트너스(Lightspeed Venture Partners)와 코슬라 벤처스(Khosla Ventures)가 주도했으며, 세일즈포스 벤처스(Salesforce Ventures) 등 다수의 투자사가 참여했습니다.
2023년 UC 버클리의 연구 프로젝트로 시작된 아레나는 사용자들이 프롬프트를 입력하고 AI 모델의 성능을 직접 평가하는 무료 크라우드소싱 플랫폼으로, 매월 수천만 명의 방문자를 유치하고 있습니다. 아레나는 지난해 9월 기업 고객을 위한 상업용 제품인 'AI 평가(AI Evaluations)' 서비스를 출시했습니다. 이 서비스는 커뮤니티 피드백을 기반으로 AI 모델 개발사나 기업에 상세한 성능 분석 데이터를 제공합니다. 특히, AI 모델들이 기존 벤치마크 테스트를 조작하여 실제 성능보다 높은 점수를 얻는 문제가 불거지면서, 기업들이 자체적인 니즈에 맞는 모델을 선택하는 데 어려움을 겪는 상황에서 아레나의 서비스는 더욱 주목받고 있습니다.
아레나는 AI 모델 평가의 새로운 지평을 열기 위해 '정렬(alignment)'이라는 새로운 평가 카테고리를 도입했습니다. 이는 AI가 요청받지 않은 행동을 하거나, 잘못된 정보를 출처로 제시하거나, 완료하지 않은 작업을 완료했다고 거짓말하는 등의 문제를 평가하는 것입니다. 아레나는 “AI가 평가 능력을 뛰어넘어 빠르게 발전하고 있으며, 모델이 테스트 중임을 인지하면 정적 벤치마크는 무용지물이 된다”고 강조하며, “실제 사용자의 손에서 AI가 얼마나 안전하고 정렬되어 있는지 측정할 중립적인 제3자가 필요하다”고 밝혔습니다. 현재 이 정렬 순위표에서는 오픈AI(OpenAI)의 여러 모델이 상위권을 차지하고 있으며, 클로드 오퍼스 5.5(Claude Opus 5.5)와 클로드 페이블(Claude Fable)이 각각 6위와 9위에 올라 있습니다. 아레나의 이러한 움직임은 AI 모델의 신뢰성과 안전성을 확보하는 데 중요한 역할을 할 것으로 기대됩니다.