최근 arXiv에 발표된 연구에 따르면, 인공지능(AI) 분야의 핵심 모델인 트랜스포머(Transformer)의 피드포워드 네트워크(FFN)가 새로운 형태의 모델 추출 공격에 취약하다는 사실이 드러났습니다. 이 연구는 모델의 파라미터나 기울기(gradient)에 직접 접근하지 않고도, 선택된 입력에 대한 출력(raw-output) 정보만을 이용해 FFN의 숨겨진 내부 구조를 복구할 수 있음을 보여줍니다. 이는 AI 모델의 보안과 지적 재산권 보호에 중요한 시사점을 던집니다.
연구팀은 GELU 또는 SiLU 활성화 함수를 사용하는 두 계층 FFN에서 '2차 누출 채널(second-order leakage channel)'을 활용했습니다. 입력 헤시안(Hessian) 행렬이 FFN 입력 가중치에 의해 유도되는 숨겨진 대칭 랭크-1(rank-one) 인자들의 혼합을 형성한다는 점을 이용한 것입니다. CIFAR-10 비전 트랜스포머(Vision Transformer)에 대한 실험 결과, 단 16개의 투영된 헤시안(8193번의 블랙박스 쿼리)만으로 숨겨진 FFN 방향을 0.94 이상의 평균 코사인 유사도(cosine alignment)로 복구할 수 있었습니다. 이는 모델의 내부 작동 방식을 외부에서 상당 부분 유추할 수 있음을 의미합니다.
이러한 모델 추출 기술은 AI 모델의 지적 재산권 침해와 보안 위협으로 이어질 수 있습니다. 특히, 블랙박스 형태로 서비스되는 고성능 AI 모델의 경우, 내부 구조가 노출되면 경쟁사가 이를 모방하거나 악용할 가능성이 있습니다. 연구진은 복구된 구조가 기능적 추출(functional extraction)도 지원하며, 원래 모델과 93% 이상의 높은 정확도 일치율을 보이는 대체 모델을 만들 수 있다고 밝혔습니다. 이는 AI 서비스 제공자들이 모델 보안에 대한 새로운 접근 방식을 고민해야 할 시점임을 시사합니다.