확산 모델(diffusion model)이 이미지를 생성할 때, 보상 후 학습(reward post-training)을 거치면 특정 고품질 이미지에만 집중하여 다양성이 떨어지는 '모드 붕괴(mode collapse)' 현상이 발생합니다. 이는 사용자가 원하는 다양한 결과물 대신, 몇 가지 보상에 유리한 결과만 반복적으로 생성하게 만드는 문제였습니다. 최근 발표된 ReNFT 기술은 이러한 모드 붕괴를 모델 내부에서 해결하여, 생성 다양성을 크게 높이면서도 기존에 학습된 보상 성능을 거의 그대로 유지하는 혁신적인 접근법을 제시합니다.
ReNFT는 '내부 확률 질량 재조정(Internal Probability-Mass Recalibration)'이라는 방식으로 작동합니다. 연구팀은 온라인 후 학습(online post-training)이 새로운 시각적 콘텐츠를 학습하기보다 사전 학습(pretraining)에서 물려받은 능력에 대한 확률 질량을 재할당한다는 점에 주목했습니다. 즉, 모드 붕괴는 특정 모드가 '억제'된 것이지 '삭제'된 것이 아니므로, 모델 내부에서 복구할 수 있다고 본 것입니다. ReNFT는 먼저 '안티-허브(anti-hub)' 프롬프트(prompt)를 통해 프롬프트와 무관한 편향을 노출시키고, 두 가지 정책 기반 혼합 경로(policy-dominated mixed routes)를 사용하여 동일한 프롬프트와 초기 노이즈(noise)에서 일치하는 반사실적 제안(counterfactual proposals)을 생성합니다. 이후 보상 순위 지정과 적응형 뒤집기 가드(adaptive flipping guard)를 통해 '끌어당기기(pull)' 및 '밀어내기(push)' 역할을 할당하고, 공동-쌍형 NFT 업데이트(joint-and-paired NFT update)를 통해 복구를 실행합니다.
이 기술은 기존의 외부 신호(external signals)나 인터페이스(interfaces)를 활용하는 방식, 즉 지각적 목표(perceptual objectives)로 보상을 증강하거나 참조 정규화(reference regularization)를 조정하고 텍스트 인코더(text encoder)를 수정하는 방식과는 다른 내부적 해결책을 제시합니다. ReNFT는 PickScore에서 98.9%, GenEval에서 99.0%의 보상 성능을 유지하면서 DreamSim-Div 다양성 지표를 각각 58.8%, 55.0% 향상시키는 뛰어난 결과를 보여주었습니다. 이는 확산 모델의 실제 적용 가능성을 넓히고, 사용자들이 더욱 풍부하고 다양한 고품질 이미지를 얻을 수 있게 할 중요한 진전으로 평가됩니다.