구글 딥마인드가 인공지능(AI) 모델 '제미니 3.8 플래시'와 '제미니 3.8 플래시 사이버'를 새롭게 선보였습니다. 이 모델들은 불과 6주 만에 세 번째 플래시(Flash) 버전으로, 이전 3.7 플래시와 동일한 속도와 저렴한 비용을 유지하면서도 추론 및 코딩 능력에서 상당한 개선을 이루어냈습니다. 특히, 자율 에이전트 워크플로우와 사이버 보안 분야에서 차세대 지능을 제공하는 데 초점을 맞추고 있습니다.
제미니 3.8 플래시는 소프트웨어 엔지니어링, 에이전트 작업, 전문 분야의 복잡한 다단계 추론에서 3.7 플래시 대비 크게 향상된 성능을 보여줍니다. 'DeepSWE v1.1' 벤치마크에서 대부분의 고비용 최첨단 모델들을 능가하며 복잡한 엔지니어링 문제를 자율적으로 해결합니다. 또한, 금융 및 법률 분야의 전문 에이전트 벤치마크에서도 뛰어난 성과를 보였으며, STEM, 인문학, 전문 분야의 다단계 추론 능력을 평가하는 'HLE-Verified'에서는 54.9%를 달성했습니다. 이러한 성능 향상은 모델이 복잡한 작업을 수행할 때 더 많은 추론 단계를 실행하고 도구를 반복적으로 호출하는 '더 열심히 일하는' 설계 덕분입니다. 한편, 제미니 3.8 플래시 사이버는 '페어윈드 프로그램(Fairwind Program)'을 통해 신뢰할 수 있는 보안 전문가들에게 제공되며, 취약점 탐지 및 자동 패치 분야에서 최첨단 성능을 자랑합니다. 사이버짐(CyberGym) 벤치마크에서 기존 모델과 대규모 최첨단 모델을 뛰어넘는 자율 취약점 발견 능력을 입증했으며, 구글 내부 코드 보안에도 활용되어 크롬(Chrome)의 취약점에 대해 기존 상용 모델보다 2.6배 더 많은 정확한 패치를 생성하는 등 실제 환경에서도 효과를 보이고 있습니다.
이번 제미니 3.8 플래시 모델들의 출시는 AI가 복잡한 소프트웨어 개발 및 사이버 보안과 같은 전문 영역에서 인간의 역량을 보완하고 확장하는 중요한 전환점을 제시합니다. 특히, 저렴한 비용으로 최첨단 성능을 제공함으로써 더 많은 개발자와 기업이 AI 에이전트를 활용한 자동화된 워크플로우를 구축하고, 사이버 위협에 더욱 효과적으로 대응할 수 있는 기반을 마련할 것으로 기대됩니다. 이는 AI 기술이 단순히 정보 제공을 넘어, 실제 문제 해결과 생산성 향상에 직접적으로 기여하는 방향으로 발전하고 있음을 보여주는 사례입니다.