AI 에이전트(AI agent)의 오작동을 감시하는 새로운 방식이 등장했습니다. 스타트업 굿파이어(Goodfire)는 AI 모델 내부에서 발생하는 신호를 직접 감지하여 유해 행위를 포착하는 '인사이드-아웃' 모니터링 시스템을 공개했습니다. 이는 기존에 또 다른 AI를 이용해 에이전트의 모든 출력을 검토하던 방식보다 훨씬 저렴하고 효율적이라는 평가를 받습니다.
기존의 AI 에이전트 감시 방식은 에이전트가 생성하는 모든 텍스트를 두 번째 AI가 검토하는 '오버-더-숄더(over-the-shoulder)' 방식이었습니다. 하지만 에이전트가 장시간 작동하며 방대한 양의 텍스트를 처리할 경우, 이 방식은 엄청난 비용을 발생시켰습니다. 굿파이어의 시스템은 마치 공항 보안 검색대처럼 작동합니다. '프로브(probe)'라는 작은 감지기가 AI 에이전트 작업의 각 단계에서 모델의 내부 신호를 읽고, 의심스러운 점이 발견될 때만 별도의 AI 모델이 정밀 검사를 수행합니다. 굿파이어는 이 방식이 1,500회 세션 모니터링에 약 51달러가 들었으며, 이는 저렴한 기존 AI 모델 대비 233달러, 최고급 모델 대비 10,000달러에 달하는 비용을 크게 절감한 수치라고 밝혔습니다. 또한, 악성 해킹 세션의 94%를 감지하고, 무해한 세션의 8.7%만을 추가 검토 대상으로 보냈습니다.
이 기술은 특히 오픈 모델(open model)의 안전성 확보에 중요한 역할을 할 것으로 기대됩니다. 개발자들이 오픈 모델의 안전장치를 제거하거나, 폐쇄형 연구소처럼 자체 모니터링 시스템을 갖추기 어려운 환경에서 굿파이어의 솔루션은 필수적인 가드레일(guardrail) 역할을 할 수 있습니다. 굿파이어의 CEO 에릭 호(Eric Ho)는 모델이 이미 수행하는 계산을 재활용하기 때문에 내부 활성화 모니터링이 매우 저렴하다고 설명했습니다. 이는 AI 에이전트가 예상치 못한 행동을 하기 전에 위험을 감지할 수 있게 하여, AI 시스템의 신뢰성과 안전성을 크게 향상시킬 잠재력을 가지고 있습니다.
