这个国庆长假,视频生成赛道出现了两条并行的风景线。一条是国产视频模型的密集发力,长假期间新品与新功能接连上线,渲染产能被形容为芯片冒烟;另一条则更值得玩味:一批不靠视频模型的创作者,用通用大模型写代码渲染出了成片的短片,科普动画、创意短片与音乐MV在海外社交平台接连刷屏,一种被称为VibeVideo的创作范式悄然成型。10月8日前后,36氪等媒体开始讨论这个新变量:当通用大模型跨界做视频,专业视频模型的护城河还牢吗?
先解释这个新词的运行逻辑。VibeVideo的玩法是让通用大模型直接生成代码来渲染视频:创作者用自然语言描述画面、节奏与转场,模型写出的程序负责逐帧绘制、合成动效与配乐对齐,全程不经过任何一个视频生成模型的推理管线。它的优势路径与扩散模型完全不同:画面是程序化计算的,天然帧率稳定、几何精确、文字清晰,特别适合数据可视化、科普演示与风格化动画这类结构化内容。
范式的走红速度超出预期。据36氪报道,Claude新模型发布后短短数日,社交平台上就涌现出大量用这套方法制作的科普动画与创意短片,多条内容播放量爆发,甚至带火了一种共识:写代码的模型也能当动画师。国庆长假期间,国内视频模型密集冲刺新版本的同时,这股来自通用模型的侧翼攻势同步升温,两条技术路线的创作者在社交平台上互相围观、彼此较劲。对个人创作者而言,这条路线的门槛是一次对话,成本是几次模型调用的费用,与按秒计费的视频模型形成鲜明对比。
当然,边界也很清楚。VibeVideo擅长的是程序化、几何化、可描述规律的画面,一旦涉及真实感人物、复杂光影与自然物理,代码路线的表达力就远逊于扩散模型。它是视频创作光谱上的新物种,而不是替代者。
通用大模型渗透视频生产的第二条路径更具工业气质。据报道,GPT-6的智能体玩法被开发者用来做AI导演:先让模型在三维空间里搭建白模预演分镜,规划机位、走位与节奏,确认后把分镜参数交给专业视频模型渲染成片。这条流水线里,通用模型负责理解创意、拆解镜头与统筹流程,视频模型退居渲染引擎的位置。
这套分工暗合影视工业的传统流程:真人剧组也是先出分镜与动态预演,再进实拍与后期。AI导演的价值在于把前期准备从数天压缩到数小时,创意迭代可以推翻重来而几乎零成本。对广告与短剧团队来说,前期环节的效率提升直接改写了项目排期表。更值得注意的是,这种编排能力并不绑定单一渲染引擎,分镜参数稍作适配就能对接不同厂商的视频模型,通用模型由此掌握了流程入口的话语权。
两条路径叠加起来,通用大模型实际上正在从外侧包抄:一个抢走结构化内容的成片环节,一个抢走专业生产的前期环节。专业视频模型引以为傲的生成质量,在价值链中的议价位置被悄悄挪动了。
专业阵营的应对思路已经清晰:向创作上游补齐工作台与智能体工具,把自己从生成引擎升级为创作平台。国庆前后,多家厂商的新动作都指向这个方向,有的上线多镜头工作台支持分镜管理,有的开放智能体接口让外部编排工具可以调度生成能力,有的把参考图、角色一致性与音频对齐做成一站式管线。竞争的焦点从单条视频的质量比拼,转向谁能让创作者留下来完成全流程。
36氪的判断很直白:未来的胜负手不在于谁的参数更高,而在于谁能更深地融入真实的创作生产流程,成为创作者离不开的生产工具。这句话的另一层含义是,生成质量差距收敛之后,工作流黏性、素材资产沉淀与团队协作能力,才是留住专业用户的护城河。
资本层面的动作也在配合。可灵的上市筹备与国庆期间的版本冲刺,显示头部玩家在用资金与产品节奏双重加码;而通用大模型厂商同样在向多模态纵深推进,两条技术路线的边界正在快速模糊,格局远未定型。
回到最初的问题:专业视频模型的护城河还稳吗?答案大概率是分场景的。真实感叙事内容,广告大片、剧集、需要人物表演与复杂运镜的作品,扩散模型路线在可见的未来仍不可替代,物理世界的质感不是代码能穷举的。但结构化内容市场,图表动画、知识科普、信息可视化,VibeVideo的性价比优势已经确立,这部分需求会被通用模型大量截流。
更可能的中长期格局是融合而非替代:通用模型做创意理解与流程编排,专业模型做高质量渲染,两者通过智能体接口组合成新管线。事实上通用大模型厂商也在自建视频生成能力,专业厂商也在接入大模型做编排,双向奔赴之后,边界本身就不再是护城河。
对创作者而言,这轮范式之争的最大红利是选择权的扩大:同一支片子可以拆解成不同环节,交给成本与质量最匹配的工具。对行业而言,视频生产正在复制编程行业的剧本,当写代码能出片、对话能出分镜,内容产能的稀缺性溢价将加速消失,比拼的重心全面转向创意与审美。长假里芯片冒烟的视频模型们,真正的对手已经不只是彼此。