새로운 CUDA 커널인 FLUXNATION이 FLUX.1 기반 이미지 생성 속도를 크게 향상시켜 주목받고 있습니다. 이 커널은 기존 ComfyUI의 표준 SingleStreamBlock 구현을 C++/CUDA 기반의 맞춤형 엔진으로 완전히 교체하여 불필요한 오버헤드를 제거했습니다. 이를 통해 RTX 4090 환경에서 1024x1024 해상도 이미지 20단계 생성 시간을 기존 13~14초에서 9.3초로 약 1.5배 단축하는 놀라운 성능을 보여주었습니다.
FLUXNATION은 세 가지 핵심 기술을 통합하여 이러한 성능을 달성했습니다. 첫째, FP8 퓨즈드 CUDA 커널은 ComfyUI의 SingleStreamBlock 포워드 패스를 단일 `torch.ops` 호출로 대체하며, 변조(Modulation), L1 GEMM, QKV 분할, RoPE, L2 GEMM 등 복잡한 연산을 하나의 커널로 묶어 처리합니다. 둘째, 신경 형태학적 스파이크 어텐션(Spike Attention)은 텐서의 특정 블록만 선택적으로 계산하는 블록-희소(block-sparse) 방식을 사용합니다. 특히 20단계 중 10단계 이후부터는 어텐션 블록을 점수화하여 상위 45%만 계산함으로써 어텐션 연산(FLOPs)을 약 90% 절감합니다. 셋째, 스텝 캐싱(Step Caching)은 스파이크 어텐션 계산과 캐시된 결과 재생을 번갈아 수행하여, 매번 어텐션 연산을 다시 할 필요 없이 이전 결과를 재활용함으로써 효율성을 극대화합니다.
이러한 기술적 진보는 ComfyUI를 활용하는 이미지 생성 사용자들에게 상당한 이점을 제공합니다. 특히 고해상도 이미지를 빠르게 반복적으로 생성해야 하는 디자이너, 아티스트, 개발자들에게 작업 효율성을 크게 높여줄 것입니다. 또한, FLUXNATION은 품질 저하 없이 속도 향상을 이루어냈다는 점에서 주목할 만합니다. 이는 이미지 생성 워크플로우를 최적화하려는 사용자들에게 매력적인 선택지가 될 것이며, 향후 다양한 AI 이미지 생성 모델의 성능 개선에도 영감을 줄 수 있습니다.