yozm.tech
피드로 돌아가기
TechCrunchHOTAI 재작성

AI 벤치마킹의 새 표준, 발스(Vals) 4천만 달러 투자 유치

AI 모델의 성능 검증이 중요해지면서, 기존 벤치마킹 시스템의 한계를 지적하며 등장한 스타트업 발스(Vals)가 앤드리슨 호로비츠(Andreessen Horowitz) 주도로 4천만 달러(약 550억 원) 규모의 시리즈 A 투자를 유치했습니다. 발스는 공개되지 않는 실제 산업별 복합 과제 기반의 평가 방식으로 모델의 실제 역량과 잠재적 위험을 측정하며, AI 신뢰성 확보의 새로운 기준으로 자리매김하고 있습니다.

4시간 전·2026.09.19·읽기 2·Lucas Ropek

AI 모델의 급증과 함께 성능 검증의 중요성이 커지는 가운데, 기존 벤치마킹 시스템의 한계를 극복하려는 스타트업 발스(Vals)가 앤드리슨 호로비츠(Andreessen Horowitz) 주도로 4천만 달러(약 550억 원) 규모의 시리즈 A 투자를 유치하며 주목받고 있습니다. 발스는 기업들이 AI 모델의 실제 역량을 정확히 파악하고, 잠재적 위험까지 측정할 수 있는 새로운 평가 방식을 제시하며 AI 신뢰성 확보에 기여하고 있습니다.

2024년 설립된 발스는 팰런티어(Palantir) 인턴십과 스탠퍼드(Stanford) AI 연구소 경험을 가진 25세 공동 창업자 라얀 크리슈난(Rayan Krishnan)의 문제의식에서 출발했습니다. 그는 빠르게 발전하는 AI 모델에 비해 학계 벤치마크가 뒤처지고, 기업들이 공개된 테스트에 맞춰 모델을 훈련시켜 '부정행위'를 할 수 있다는 점을 지적했습니다. 발스는 이러한 문제를 해결하기 위해 특정 테스트 자료를 공개하지 않고, 법률, 금융, 코딩 등 실제 산업별 복합 과제를 통해 AI 모델의 실질적인 업무 수행 능력과 인간 수준의 결과물 생성 여부를 평가합니다. 또한, 긍정적 결과뿐 아니라 모델이 오작동했을 때 발생할 수 있는 부정적 영향까지 분석하며, 재귀적 자기 개선(recursive self-improvement), 정신 건강, 사이버 보안, 심지어 무력 충돌법 적용 능력 등 독특한 영역까지 평가 범위를 확장하고 있습니다.

기업들은 발스에 비용을 지불하고 자사 모델을 테스트하며, 이를 통해 모델 개선점을 찾고 신뢰도를 높이고 있습니다. 이는 마치 학생들이 SAT 시험에 응시하는 것과 유사한 수익 모델입니다. 발스는 지난 한 해 동안 매출이 8배 성장했으며, 직원 수도 8명에서 25명으로 세 배 이상 늘어나는 등 빠르게 성장하고 있습니다. 연방 기관에 모델 평가를 제공하는 프로그램도 시작했습니다. 크리슈난은 AI 기업들이 상장하고 경제의 핵심 동력으로 자리 잡으면서, 발스와 같은 독립적이고 신뢰할 수 있는 벤치마크가 기업의 비즈니스 성장과 대중의 신뢰를 확보하는 데 필수적인 요소가 될 것이라고 강조했습니다. 이는 AI 모델이 단순한 기술을 넘어 사회 전반에 깊이 통합될 미래에 그 중요성이 더욱 커질 것임을 시사합니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
3/10
약한 신호
3점인가

AI 벤치마킹은 중요한 영역이지만, 고품질 데이터셋 구축과 평가 시스템 개발에 상당한 전문성과 자원이 필요하며, 1인 창업자가 시장에 진입하기에는 진입 장벽이 높습니다.

문제 / 미충족 수요

AI 모델의 성능을 객관적이고 신뢰할 수 있게 평가할 수 있는 표준화된 벤치마킹 시스템이 부족하며, 특히 실제 산업 적용 시의 복합적 역량과 잠재적 위험을 측정하는 데 한계가 있습니다.

한국 시장
국내 미진출 — 기회한국어 AI 모델의 성능 평가에 대한 수요는 있으나, 발스처럼 실제 산업별 복합 과제 기반의 독립적인 벤치마킹 서비스는 아직 미미합니다.
수익 모델

B2B SaaS 구독 (AI 모델 평가 서비스), API 종량제 · 돈 내는 주체: AI 모델을 개발하거나 도입하려는 기업, AI 모델의 성능을 검증하려는 정부 기관 및 연구소

1인 실현 가능성
2/5

고품질의 산업별 벤치마킹 데이터셋 구축과 평가 시스템 개발에는 전문성과 리소스가 필요하며, 특히 다양한 산업 도메인으로 확장하려면 상당한 노력이 요구됩니다.

진입 지점 (Wedge)

특정 산업(예: 법률, 금융, 의료)의 AI 모델에 특화된 한국어 벤치마킹 데이터셋 및 평가 프레임워크를 구축하고, 이를 기반으로 소규모 AI 개발팀이나 기업에 맞춤형 평가 서비스를 제공합니다.

이번 주 첫 실험

특정 한국어 산업 도메인(예: 법률 문서 요약, 의료 상담 챗봇)에서 AI 모델이 수행해야 할 복합 과제 목록을 10개 이상 정의하고, 각 과제에 대한 평가 기준을 구체화하는 문서를 작성합니다.

Original source
이 글은 TechCrunch의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기