최근 공개된 연구 논문에 따르면, 단백질 확산 모델의 생성 정확도를 획기적으로 개선하는 새로운 알고리즘 '스펙트럼 피드백(Spectral Feedback)'이 개발되었습니다. 기존의 이산 확산 모델(discrete diffusion model) 정렬(alignment) 방식은 주로 역과정(reverse process)을 조작하거나 중간 단계에서 유리한 시퀀스를 선택하는 데 집중했습니다. 이러한 방식은 추론(inference)을 일방향 프로세스로 간주하여, 모델이 한 번 선택한 바람직하지 않은 토큰(token)을 다시 검토하고 수정할 수 있는 메커니즘이 부족하다는 한계가 있었습니다.
스펙트럼 피드백은 이러한 한계를 극복하기 위해 피드백 루프(feedback loop) 내에서 편집 위치(edit-position)를 선택하는 알고리즘입니다. 이는 모델이 스스로 생성한 결과물에서 잘못된 부분을 반복적으로 수정할 수 있도록 합니다. 이 접근 방식은 이산 확산 모델의 마스크(mask) 구조를 활용하여 토큰을 다시 마스킹하고 재샘플링(re-sampling)하는데, 이는 이미지 편집 방법에서 노이즈가 있는 잠재 변수(latent)를 다시 도입하고 역과정을 재실행하는 것과 유사합니다. 연구팀은 편집 효과가 상호 의존적이기 때문에 편집 위치를 선택하는 것이 어렵다는 점을 지적하며, 단백질 역접힘(protein inverse folding)을 위한 편집 세트(edit-set) 가치 함수(value function)가 희소 푸리에 표현(sparse Fourier representations)을 따른다는 것을 경험적으로 발견했습니다. 이 구조 덕분에 스펙트럼 피드백은 편집 위치 선택을 위한 가치 함수를 효율적으로 학습하고 최적화할 수 있습니다.
이 알고리즘은 모델에 구애받지 않아 사전 학습된(pretrained), 테스트 시점 정렬(test-time aligned), 미세 조정된(fine-tuned) 확산 모델 모두에 적용 가능하며, 기본 생성 프로세스를 수정하지 않고도 정렬 성능을 향상시킵니다. 단백질 안정성 보상 오라클(reward oracle)을 사용한 역접힘 적용 결과, 사전 학습된 모델에서는 안정적인 단백질 생성률이 32.3% 증가했으며, Best-of-10 모델에서는 24.8%, 최첨단 강화 학습(RL) 미세 조정 확산 모델에서는 5.8% 증가하는 등 인상적인 개선 효과를 보였습니다. 이는 단백질 설계 및 약물 발견과 같은 분야에서 확산 모델의 실용성을 크게 높일 잠재력을 가지고 있습니다.
