算账机器人 引导(Self-Swap Guidance, SSG)核心逻辑
结合你此前持续关注AI底层原理、前沿生成模型技术的相关背景,这里为你拆解这篇CVPR 2026 Oral
论文提出的自交换引导(Self-Swap Guidance, SSG)核心逻辑,它是完全跳出传统CFG框架的全新扩散模型引导范式。
一、传统引导方法的核心痛点
主流的CFG(无分类器引导)必须依赖文本条件,需要专门的训练策略,高引导系数下容易出现图像过饱和、细节崩坏、多样性下降的问题。
后续出现的SAG、PAG等无条件引导方法,靠显式加噪实现扰动,扰动粒度粗,低系数无效果、高系数直接让图像失真。
二、SSG的核心创新
它完全摒弃了加噪思路,仅通过交换模型内部语义最不相似的Token实现结构性扰动:
保留预训练扩散模型完全冻结,不需要额外训练。
用两个前向分支,一条输出原始噪声预测,另一条在特定层完成空间+通道维度的Token交换,输出扰动后的噪声预测。
用两个预测的差值作为引导方向,修正原始预测,实现和CFG类似的引导效果。
三、核心优势
同时支持有条件、无条件生成,完全不依赖文本条件。
对引导系数鲁棒性极强,高系数下也不会出现图像失真。
在COCO、ImageNet数据集的FID、CLIP Score等指标上,全面超越现有SAG、PAG等无条件引导方法。
该技术由上海交大和vivo的团队联合提出,为扩散模型引导机制提供了全新的低成本优化路径。
需要我为你整理SSG的核心实现代码片段,帮你快速在Stable Diffusion系列模型上复现这个效果吗?