yozm.tech
피드로 돌아가기
arXiv (cs.LG)HOTAI 재작성

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration

확산 모델(diffusion model)의 보상 후 학습(reward post-training) 과정에서 발생하는 '모드 붕괴(mode collapse)' 현상을 해결하는 새로운 기술, ReNFT가 발표되었습니다. 이 기술은 생성 다양성을 해치지 않으면서도 모델이 학습한 보상 성능을 유지하는 것이 특징입니다. 기존 외부 신호 활용 방식과 달리, 모델 내부에서 확률 질량(probability mass)을 재조정하여 문제를 해결합니다.

7시간 전·2026.09.02·읽기 1·Yuchen Bao, Chao Wen, Haowei Wang, Ruoxin Chen, Donghao Luo, Jiahui Zhan, Wenjian Huang, Shen Chen, Yiting Wang, Taiping Yao, Chengjie Wang, Shouhong Ding, Jianguo Zhang

확산 모델(diffusion model)이 이미지를 생성할 때, 보상 후 학습(reward post-training)을 거치면 특정 고품질 이미지에만 집중하여 다양성이 떨어지는 '모드 붕괴(mode collapse)' 현상이 발생합니다. 이는 사용자가 원하는 다양한 결과물 대신, 몇 가지 보상에 유리한 결과만 반복적으로 생성하게 만드는 문제였습니다. 최근 발표된 ReNFT 기술은 이러한 모드 붕괴를 모델 내부에서 해결하여, 생성 다양성을 크게 높이면서도 기존에 학습된 보상 성능을 거의 그대로 유지하는 혁신적인 접근법을 제시합니다.

ReNFT는 '내부 확률 질량 재조정(Internal Probability-Mass Recalibration)'이라는 방식으로 작동합니다. 연구팀은 온라인 후 학습(online post-training)이 새로운 시각적 콘텐츠를 학습하기보다 사전 학습(pretraining)에서 물려받은 능력에 대한 확률 질량을 재할당한다는 점에 주목했습니다. 즉, 모드 붕괴는 특정 모드가 '억제'된 것이지 '삭제'된 것이 아니므로, 모델 내부에서 복구할 수 있다고 본 것입니다. ReNFT는 먼저 '안티-허브(anti-hub)' 프롬프트(prompt)를 통해 프롬프트와 무관한 편향을 노출시키고, 두 가지 정책 기반 혼합 경로(policy-dominated mixed routes)를 사용하여 동일한 프롬프트와 초기 노이즈(noise)에서 일치하는 반사실적 제안(counterfactual proposals)을 생성합니다. 이후 보상 순위 지정과 적응형 뒤집기 가드(adaptive flipping guard)를 통해 '끌어당기기(pull)' 및 '밀어내기(push)' 역할을 할당하고, 공동-쌍형 NFT 업데이트(joint-and-paired NFT update)를 통해 복구를 실행합니다.

이 기술은 기존의 외부 신호(external signals)나 인터페이스(interfaces)를 활용하는 방식, 즉 지각적 목표(perceptual objectives)로 보상을 증강하거나 참조 정규화(reference regularization)를 조정하고 텍스트 인코더(text encoder)를 수정하는 방식과는 다른 내부적 해결책을 제시합니다. ReNFT는 PickScore에서 98.9%, GenEval에서 99.0%의 보상 성능을 유지하면서 DreamSim-Div 다양성 지표를 각각 58.8%, 55.0% 향상시키는 뛰어난 결과를 보여주었습니다. 이는 확산 모델의 실제 적용 가능성을 넓히고, 사용자들이 더욱 풍부하고 다양한 고품질 이미지를 얻을 수 있게 할 중요한 진전으로 평가됩니다.

1인 창업자를 위한 기회 분석
AI 분석 · 참고용이며 검증이 필요합니다
4/10
보통
4점인가

기존 확산 모델의 명확한 문제(모드 붕괴)를 해결하는 기술이지만, 1인 창업자가 직접 모델을 구현하고 상용화하기에는 기술적 난이도와 자원 요구량이 높습니다.

문제 / 미충족 수요

확산 모델의 보상 후 학습은 이미지 품질을 높이지만, 생성되는 이미지의 다양성을 크게 떨어뜨리는 '모드 붕괴' 문제를 야기합니다.

한국 시장
국내 불명확산 모델 활용이 증가함에 따라 고품질과 다양성을 동시에 요구하는 니즈가 커지고 있으나, 이 기술의 국내 상용화 사례는 아직 불확실합니다.
수익 모델

B2B API 서비스, 모델 미세조정 컨설팅 · 돈 내는 주체: 확산 모델을 활용하여 다양한 고품질 이미지를 생성해야 하는 기업(예: 게임 개발사, 광고 대행사, 디자인 스튜디오)

1인 실현 가능성
2/5

핵심 기술 이해와 구현에 높은 전문성이 요구되며, 모델 학습 및 운영에 상당한 컴퓨팅 자원이 필요할 수 있습니다.

진입 지점 (Wedge)

특정 산업(예: 게임, 광고)에 특화된 고품질/고다양성 이미지 생성 확산 모델 미세조정 서비스 제공

이번 주 첫 실험

ReNFT 논문 구현 가능성 및 난이도 분석, 오픈소스 구현체 탐색 또는 자체 PoC(개념 증명) 계획 수립.

Original source
이 글은 arXiv (cs.LG)의 기사를 yozm.tech가 한국어로 재작성한 버전입니다.
원문 보기