EPFL等攻克单步图像生成难题,扩散模型从多步推理迈向一步到位新时代

首页 / AI资讯 / AI绘画

0:00
0:00
1x
定时

打开Midjourney或FLUX生成一张图片时很少有人注意到这些工具在幕后思考了许多步。扩散模型可能需要走上二十步甚至五十步才能画出一张图,每一步都在修正上一步的结果。这个过程虽然准确但速度就慢了。瑞士洛桑联邦理工学院与法国Valeo.ai及索邦大学联合开展的研究彻底改变了这个局面。

研究团队在7月2日以预印本形式发布的名为表征分布匹配及其改进版本iRDM的方法,首次实现了单步生成质量超越四步模型的里程碑。这项以arXiv编号2607.02375发表的研究为AI图像生成开辟了一条全新的技术路线,有望大幅降低AI绘画的推理成本和时间延迟。论文上线后已被多位计算机视觉领域的研究者在社交媒体上引用和讨论。

从多步烹饪到一步到位的范式转变

要理解这项研究的突破之处首先要明白AI是如何评判一张图好不好的。在AI的世界里判断一张图片的质量本质上是在比较两组图片的分布,也就是看生成的图片整体上长得像不像真实照片。现有主流扩散模型的方法是让AI学习一个如何把噪声一步步变成图片的过程,就像教它按照一份详细菜谱一步一步烹饪。这样做很可靠但必须按顺序走完所有步骤,推理速度因此受限。

而RDM的思路完全不同。它直接告诉AI你画出的一批图和真实图片在某种特征空间里的分布要一样。这就像不教厨师菜谱而是告诉他你做的菜尝起来闻起来看起来都得和米其林餐厅出品的一样。只要满足这个最终标准过程怎么走都行。这种方式天然就能实现一步生成,因为约束的是最终结果的分布而不是中间过程。更关键的是iRDM版本引入的迭代优化机制,虽然每张图的生成只需一步,但模型可以通过一个轻量级的修正器对生成结果进行微调。

单步生成优于多步的历史性突破

研究团队在标准图像生成基准上进行了严格的对比测试。结果显示RDM方法的单步生成质量不仅显著优于传统扩散模型在相同步数下的表现,更令人惊讶的是其单步生成的图像质量已经超越了传统四步扩散模型。这意味着在图像生成的时间质量权衡曲线上RDM将整个曲线向上推移了一大截。对于实际应用而言这意味着用户不需要在高画质和快速出图之间做取舍。

这种效率提升对移动端和实时交互场景的价值尤为突出。在手机上使用AI绘画功能时输入提示词后图像几乎瞬间出现,而且质量与桌面端经过数十步推理生成的图像没有差别。这将极大降低AI绘画的使用门槛让实时交互式创作成为可能。从产业角度看单步生成将显著降低AI绘画的API成本。对于日均调用量10万次以上的电商图片生成场景每月可节省数十万元的推理成本。这种量级的成本优势将直接推动更多企业将AI图像生成融入核心业务流程。

技术融合与产业协同的新机遇

iRDM的技术路线与当前主流扩散模型并不冲突,两者可以实现优势互补。需要极致速度的场景使用单步模式,对质量有极致要求的场景使用多步模式,模型可以在两种模式间灵活切换根据具体任务需求动态调整推理深度。这种灵活性正是iRDM相比纯单步或纯多步方案的独特优势。从学术影响力来看这项研究为图像生成领域开辟了一条新的技术路径,未来几个月内预计将引发更多团队跟进探索,推动单步生成技术的快速成熟。

从商业应用的角度来看单步生成技术的经济价值令人期待。目前主流AI图像生成API每张图的推理成本约为0.01到0.05美元,其中GPU算力成本占比超过60%。如果单步生成能够将推理步数从30步压缩到1步,理论上推理成本可以降低90%以上。对于日均图片生成量超过100万张的大型电商平台或广告公司,这意味着每年可节省数百万美元的AI基础设施支出。这种量级的成本优化将彻底改变AI图像生成的应用场景和商业模式,让更多中小型企业也能负担得起高质量的AI图像生成能力。从学术到产业EPFL团队正在与多家企业洽谈技术授权合作,加速单步生成技术的产业化落地。预计未来一到两年内消费者将在主流AI绘画平台上体验到单步生成技术带来的效率革命。从更长远的技术演进角度来看单步生成技术的突破为实时AI视频生成铺平了道路。当每帧图像都可以在极短时间内完成生成时,AI驱动的实时视频渲染和交互式内容创作将成为可能。这将开启一个全新的应用场景,从虚拟直播间的实时背景生成到在线教育中的动态内容展示,单步生成技术的价值将不再局限于静态图片领域。

来源:搜狐新闻 发布时间:2026-07-31