AI视频生成进入2026年下半年,画面质量已经不是短板,缺的始终是声音。10月6日,俄罗斯Kandinsky实验室给出了自己的答案:开源视频生成模型Kandinsky 6.0 Video,在一段五秒的视频里同步生成画面与44千赫兹采样率的音频,脚步声、环境音、说话口型对得上时间轴,代码与权重以MIT许可完全开放,商用没有任何门槛。
技术核心是一个被称为双流交叉Transformer的设计。视频流与音频流各自拥有独立的生成通道,两者通过交叉注意力机制在生成过程中持续交换信息,而不是先出画面再后期配音。论文同步公开在预印本平台,团队还披露了分阶段的音视频联合训练策略,让模型先学会各自的模态规律,再逐步对齐时间轴上的一一对应关系。人评结果显示,其音画同步表现超过了自家的5.0版本,与市面上领先的音视频一体生成模型处于同一竞争水平。
产品形态覆盖了两档规模与三种用法。30亿参数的轻量版面向消费级显卡与快速迭代场景,290亿参数的完整版承担高质量输出,均支持文本生成视频与图片生成视频两种入口,另配全高清超分模块负责把成片拉到更高分辨率。对创作者来说,五秒的时长限制了单镜头叙事,但作为素材引擎,声音与画面一次生成直接可用,省掉了配乐、拟音、对口型三道工序,这对短视频工坊的实际意义远大于参数表。
这步棋在开源版图上的分量值得单说。过去一年,音画同步生成能力长期是少数闭源旗舰的护城河,开源阵营的主流视频模型大多停留在无声画面阶段,创作者需要拼接多个工具补齐声音链路。Kandinsky 6.0 Video以MIT许可开放后,任何一个团队都可以下载权重、本地部署、商用产出,音频轨与视频轨同步生成的技术路径首次完全公开。团队规模阵容庞大,论文署名作者超过百人,展现了国家级算力项目式的研究组织方式。
对国内的视频生成生态,这个开源节点的影响是双向的。一方面,本地化部署与二次训练的成本进一步降低,做行业垂直微调的团队多了一个扎实基座,教育、电商、文旅等场景的定制需求可以直接在开源权重上迭代;另一方面,闭源产品的差异化压力也在加大,当同步音视频从独门绝技变成社区标配,商业模型的卖点必须转向更长时程、更复杂的多镜头叙事与更强的风格控制。开源社区版本迭代的速度历来惊人,从权重发布到各种加速量化版本涌现,往往只需要数周时间,这次大概率也不会例外。
把镜头拉远,音视频同步生成正在成为视频模型的分水岭能力。影视级应用需要角色开口说话时口型精确、情绪对味,广告与短剧需要环境声与剪辑点严丝合缝,这些需求都在把声音从后期工序前移进生成环节。MIT许可的开放意味着这条技术路线的工程细节可以被全行业检验与复用,竞争的焦点会从能不能出声,快速推进到声音好不好听、口型准不准、长视频里声音是否连续一致。
对创作者与企业用户的建议很实际:五秒加开源的组合最适合先跑通工作流验证,把音画同步素材嵌入现有剪辑管线测试真实产能提升,再决定是否投入定制训练。无声的AI视频是素材,有声音的AI视频才开始像作品。当开源社区人手一份会说话的模型,视频行业的分工边界将再一次被重画。
音视频同步生成的最大挑战,往往不在模型结构而在训练数据。互联网上天然对齐的音画素材其实相当有限:带清晰人声口型的视频、有现场环境音的画面,大多被版权、隐私与质量三道筛子过滤殆尽。团队选择分阶段训练策略,某种意义上也是对数据现实的妥协,先用海量单模态素材把两条通路各自练扎实,再用精选的对齐数据完成最后的咬合校准。这条路径对后来者的启示很直接:谁掌握了大规模高质量音画对齐数据,谁就握住了这条赛道最稀缺的生产资料。
评测口径也是绕不开的话题。人评显示其与领先模型处于同一水平,但五秒时长下的音画对齐,与长视频里持续稳定的声画一致,难度完全不在一个量级。节奏拖长之后的声音漂移、口型累积误差、环境音与场景切换的衔接,都是公开演示里最难藏拙的部分,这些考题留给了整个开源社区一起答卷。
对具体使用者的价值,可以用一道简单的算术题说明。传统流程里,一段成片要经历画面生成、配乐挑选、音效铺设、口型对齐四道工序,前两道靠素材库,后两道靠人工与专业工具,一个五秒镜头的音画包装动辄半天;而现在一次生成直接拿到带完整声音层的成片,剩下的只是挑选与微调。对以量取胜的短视频与广告素材场景,这种产能跃迁直接改写成本结构。
当然,落地仍有边界要认清。开源权重本地部署需要相当的显存与工程能力,30亿参数轻量版是普通团队的现实起点;生成的音频在多人对话与复杂配乐上仍有提升空间;商用虽无许可障碍,但音色与风格涉及第三方权益的内容仍需自查。建议的姿势是先在现有剪辑管线里做小规模嵌入测试,验证音画同步素材的真实产能收益,再决定投入多少资源做定制微调。无声的AI视频是素材,有声音的AI视频才开始像作品,这句判断在开源权重普及之后,会变成全行业的常识。