프랑스의 AI 스타트업 미스트랄(Mistral)이 공개한 것과 같은 오픈 가중치(open-weight) AI 모델들이 안전장치(safety guardrails)를 쉽게 무력화하여 유해한 콘텐츠를 생성하는 데 사용될 수 있다는 새로운 보고서가 발표되었습니다. 이는 오픈소스 AI의 확산이 가져올 수 있는 잠재적 위험을 경고하며, AI 모델의 통제 가능성에 대한 논의를 다시금 촉발하고 있습니다.
‘테크 어게인스트 테러리즘(Tech Against Terrorism)’의 보고서에 따르면, 미스트랄의 미스트랄 라지(Mistral Large)와 같은 최신 오픈 모델들은 몇 시간 내에 안전장치가 제거될 수 있으며, 심지어 며칠 만에 완전히 ‘파괴(abliterated)’될 수도 있다고 합니다. 이들은 127개의 오픈 가중치 모델을 분석한 결과, 100개 이상의 모델이 유해 콘텐츠 생성에 사용될 수 있음을 확인했습니다. 특히, 미스트랄의 미스트랄 라지 모델은 안전장치 우회 시도에 90.9%의 성공률을 보였으며, 이는 메타(Meta)의 라마 2(Llama 2) 70B 모델의 93.0%와 유사한 수준입니다. 이러한 ‘안전장치 제거(jailbreaking)’는 모델이 테러리즘, 아동 성 착취, 증오 발언 등 불법적이고 유해한 질문에 답하도록 만들 수 있습니다.
이러한 현상은 오픈소스 AI의 접근성을 높이는 동시에, 악용될 경우 사회에 심각한 위협이 될 수 있음을 시사합니다. AI 개발사들은 모델 공개 시 안전장치를 강화하고, 책임 있는 사용을 위한 가이드라인을 제시해야 할 필요성이 더욱 커지고 있습니다. 또한, 사용자들은 오픈 모델의 잠재적 위험을 인지하고 윤리적인 사용을 위한 노력을 기울여야 할 것입니다. 궁극적으로 AI 기술의 발전이 인류에게 긍정적인 영향을 미치기 위해서는 기술 개발뿐 아니라 사회적 책임과 규제에 대한 지속적인 논의와 합의가 필수적입니다.