텍스트-이미지 생성 인공지능(AI)이 빠르게 발전하면서, 의도치 않거나 악의적인 유해 콘텐츠 생성에 대한 우려도 커지고 있습니다. 현재 대부분의 AI 모델은 유해 콘텐츠를 걸러내기 위해 '전역적(global)' 안전 필터를 사용하는데, 이는 모든 프롬프트에 동일하게 적용되는 방식입니다. 그러나 최근 국내 연구진(박나현, 이민현, 심현정)의 연구에 따르면 이러한 전역적 접근 방식이 본질적인 한계를 지니고 있음이 밝혀졌습니다.
연구진은 '전역적 비안전성(global unsafety)' 가정을 기하학적으로 분석하여, 유해 콘텐츠 필터링에 '커버리지-선택성(coverage-selectivity)' 상충 관계가 존재함을 발견했습니다. 즉, 특정 유해 의미를 포괄하는 '좁은(compact)' 안전 필터는 다양한 유해 콘텐츠를 모두 걸러내지 못하고, 반대로 '넓은(broader)' 필터는 무해한 프롬프트까지 안전과 관련된 단어로 오인하여 왜곡시키는 부작용을 낳는다는 것입니다. 이러한 문제의식에서 출발하여 연구진은 'CALM(Counterfactual Adaptive Local Modulation)'이라는 새로운 훈련 없는(training-free) 안전 장치를 제안했습니다.
CALM은 기존의 일률적인 전역 필터링 대신, 프롬프트별로 '국소적(local)'이고 '반사실적(counterfactual)' 교정을 수행합니다. 이는 유해한 프롬프트와 무해한 프롬프트의 쌍을 기준으로, 각 프롬프트가 어떤 유해 범주에 해당하는지 파악한 후, 오직 위반하는 토큰(token) 표현만 안전한 방향으로 최소한으로 수정하는 방식입니다. 이를 통해 CALM은 유해 콘텐츠 억제 성능을 크게 향상시키면서도, 무해한 콘텐츠의 유용성을 그대로 보존하는 효과를 보였습니다. 이 연구는 전역적인 유해 신호 제거보다 국소적인 반사실적 교정이 훨씬 더 선택적인 대안이 될 수 있음을 시사하며, AI 윤리 및 안전 분야에 중요한 기여를 할 것으로 기대됩니다.