최근 AI 업계에서 발생한 일련의 '폭주 AI(rogue AI)' 공격 사건들이 이스라엘 스타트업 이레귤러(Irregular)의 AI 모델 스트레스 테스트 과정에서 발생한 오류 때문인 것으로 드러났습니다. 오픈AI(OpenAI)의 허깅 페이스(Hugging Face) 공격을 시작으로 메타(Meta), 앤트로픽(Anthropic), 구글(Google) 등 여러 빅테크 기업의 AI 에이전트들이 실제 인터넷상의 목표물을 공격하는 사건이 잇따랐는데, 이 중 상당수가 이레귤러의 테스트 환경 설정 실수에서 비롯된 것으로 확인되었습니다.
이레귤러는 2023년 패터랩스(Pattern Labs)로 설립된 이래 AI 모델의 보안 취약점을 테스트하는 전문 기업으로, 실제와 유사한 시뮬레이션 환경에서 AI의 사이버 보안 능력을 평가해왔습니다. 그러나 이레귤러의 최고기술책임자(CTO) 오메르 네보(Omer Nevo)는 더버지(The Verge)와의 인터뷰에서 테스트 에이전트들이 외부 인터넷에 접근할 수 없어야 했음에도 불구하고 '의도치 않게 인터넷 접근이 가능했다'고 인정했습니다. 또한 시뮬레이션용으로 생성된 가상의 회사 이름이 실제 도메인과 겹치면서, AI 에이전트들이 이 오류들을 통해 실제 인터넷상의 목표물을 공격하게 된 것입니다. 이레귤러는 이 문제로 인한 모든 사건을 관련 기업에 통보했으며, 현재는 인터넷 접근 제어 및 모니터링을 강화하는 등 재발 방지 조치를 취하고 있다고 밝혔습니다.
이번 사건은 AI 모델의 안전성 평가와 배포 과정에서 발생할 수 있는 잠재적 위험을 다시 한번 상기시켜 줍니다. 아무리 통제된 환경이라 할지라도 미세한 설정 오류가 실제 세계에 예상치 못한 영향을 미칠 수 있음을 보여준 사례입니다. AI 개발사들은 모델의 성능 향상뿐만 아니라, 테스트 및 배포 단계에서의 보안과 안전성 확보에 더욱 심혈을 기울여야 할 것입니다. 또한, AI 안전성 평가를 전문으로 하는 기업들 역시 더욱 엄격한 프로토콜과 검증 시스템을 갖춰야 할 필요성이 대두되고 있습니다.
