최근 Qwen3.8-27B 모델의 안전 정렬(safety alignment) 기능이 제거된 변형 모델인 ‘Qwen3.8-27B-Uncensored-MLX’가 애플 실리콘(Apple Silicon) 환경에 최적화되어 공개되었습니다. 이 모델은 기존 Qwen3.8-27B가 거부하던 유해하거나 불법적인 요청에도 응답하도록 설계되었으며, AI 안전성 연구와 거부 메커니즘(refusal mechanism) 분석을 위한 도구로 활용될 예정입니다.
orcarouter가 개발한 이 모델은 Qwen3.8-27B의 잔여 스트림(Residual Stream)에서 안전 정렬의 거부 방향을 제거하는 'Abliteration' 기술을 적용했습니다. 이를 통해 악성코드, 익스플로잇(Exploit), 무기, 사기 등 위험하거나 불법적인 요청에도 응답할 수 있게 되었으며, 허위 정보나 편향적 답변을 생성할 가능성도 있습니다. 특히 비전(Vision) 및 도구 호출(Tool Calling) 기능까지 유지되어 이미지 이해와 에이전트(Agent) 작업에서도 위험 범위가 확장될 수 있습니다. 애플 실리콘용 MLX(Apple’s MLX framework)에 맞춰 2, 4, 6, 8비트 양자화를 제공하며, 4비트 버전은 약 15GB로 24GB 램을 가진 맥에서 실행 가능합니다. 2비트 버전은 8.7GB로 16GB 맥에서도 구동되지만, 생성 품질 저하가 심해 실제 사용보다는 극단적 압축 보관용으로만 권장됩니다.
이 모델은 일반 사용자나 상업적 배포를 위한 것이 아니라, AI 안전성, 해석 가능성, 거부 메커니즘 연구 및 레드 팀(Red Teaming) 활동을 위한 연구용 도구입니다. 개발팀은 모델 사용자가 생성 결과와 사용 방식에 대한 책임을 직접 부담해야 하며, 배포 시에는 별도의 중재(Moderation) 및 안전 계층을 직접 구성해야 한다고 강조했습니다. 이는 AI 모델의 잠재적 위험성을 이해하고 통제하기 위한 중요한 연구 방향을 제시하며, AI의 안전한 발전을 위한 학계와 연구 커뮤니티의 노력을 보여주는 사례로 평가됩니다.