国产视频模型的迭代速度还在加快。10月7日,生数科技正式发布下一代旗舰模型Vidu Q4 Preview的首个公开预览版,这款以表演力为核心卖点的模型,在人物演出、镜头调度与视觉特效三条线上同时升级,首发定价压到了每秒0.014美元起。
Q4 Preview的核心叙事是让画面里的人真正会演戏。官方把升级点拆成三层。第一层是表演协调:面部表情、情绪传达、肢体动作与声音四个维度被联合建模,从一次安静的回眸到完整的动作戏,角色表演的细腻度与情绪幅度都有可见提升,一位参与测试的视频创作者反馈,即使在没有台词的停顿里,角色的眼神与表情也足以传递情绪。第二层是镜头控制:追逐、打斗这类高速运动场景中,镜头被设计为更连贯地跟随动作,剪辑点与画面动作的配合更利落。第三层是特效融合:爆炸、烟火、粒子等效果的物理感增强,火焰的光会照亮周围建筑,烟尘随坍塌结构扩散,成片观感接近实拍。
规格端同样有硬指标:输出覆盖540P到4K,4K模式配备十比特色深,可以进入专业后期工作流;文生与图生视频时长最长16秒,支持音视频同步输出与自动镜头切换。有测试者特别提到帧内文字渲染,Q4对中文文字的呈现水平已经接近人工后期合成的效果,这对广告与片头类需求是实打实的能力。
从首批测试反馈看,Q4在广告类内容的完成度提升尤其明显:产品特写、口播开场、促销字幕这些过去需要反复抽卡的镜头,一次通过率明显改善。对以量取胜的电商与信息流团队,这意味着单位成片成本的大幅下移。
Q4 Preview在创作控制上的最大亮点,是参考体系的扩展。图生视频之外,新增的参考生视频模式允许一次传入最多15张参考图与最多3条参考音频:图片用来钉死角色长相、服装、道具、产品与环境,音频用来锁定角色的音色与情感表达方式。这意味着创作者可以在一套参考配置下连续生产多支镜头,主角的脸不变、衣服不变、声音不变,跨镜头的一致性由参考体系兜底。
参考音频的加入让配音环节也纳入了统一管理:角色的声音、语气、情绪基调用几段参考音频钉住,后续镜头无需重新配音或调音,口型与声音的匹配由模型同步完成,多语种投放时尤其省事。
这套设计直指AI视频生产最深的需求痛点。批量内容生产最怕的就是镜头之间角色变脸,过去靠提示词反复描述与多次抽卡碰运气,现在把一致性交给参考输入,前期配置一次,后期镜头随便加。官方在产品页给出的典型场景也很清晰:广告团队对比创意概念与开场方案、电商团队为不同产品与受众做变体、影视团队在正式投入前测试表演、分镜与节奏。
定价是这次发布最锋利的部分。首发价格每秒0.014美元起步,随分辨率上行至4K档每秒0.39美元;图生视频与参考生视频在11月30日前享受七折。官方算了一笔账:在输出规格与计费条件相当的前提下,同等预算下Q4的产出量最高可达五倍。
为什么强调产出量?生数科技联合创始人兼首席执行官罗一航在发布说明里给出的解释很直白:一个能用的镜头往往要尝试不止一次,调整表情、比较机位、测试开场,都是成本。高级视频模型应该在精选演示之外证明自己,效率上的每一次提升,最终都应该转化为创作者多试一条、多拍一版的自由。这段话点破了视频模型竞争的新阶段:拼完画质拼价格,拼完价格拼试错自由度,谁让创作者敢多抽卡,谁就赢得工作流。
横向比价更直观:以主流定价的竞品做参照,同规格下生成同长度视频的费用,Q4的首发价大约只是行业平均水平的几分之一。定价下探叠加折扣期,独立创作者与小工作室第一次能用可承受的成本试水叙事类项目,这对整个内容供给端都是增量。产能与稳定性的考验也随需求同步放大,官方对促销期排队情况的应对值得关注。
把Q4 Preview放回Vidu的产品脉络里,可以看到一条清晰的升级线:此前的Q3版本以原生音视频一体生成立足,Q4则把重心移向表演与控制精度。生数科技脱胎于清华大学人工智能实验室,其公开融资信息显示自2026年2月以来累计融资接近60亿元人民币,是国产视频模型阵营里资本储备最厚的玩家之一。
行业格局层面,国内视频生成第一梯队的产品各有侧重,有的押注长镜头与物理仿真,有的深耕动漫与短剧风格,Q4选择在表演一致性上建立差异化,瞄准的是叙事类内容这个价值最高也最难啃的场景。海外方面,通用旗舰与垂类定制模型的分野也在加深。对用户来说,多一个强力选项总是好事;对行业来说,价格战与能力战同步升级,视频生成的单位成本曲线正以肉眼可见的速度下移,内容生产的形态正在被重新定价。
对内容团队,给两条落地建议:一是把参考体系用足,前期多花时间配置角色、服装与声音参考,后期每个镜头都在这套资产上迭代,一致性收益会随镜头数累积;二是分层生产,粗剪与方案测试用低分辨率档跑,定稿后再上4K,预算利用率最高。工具的差距正在缩小,工作流设计的差距才是下一阶段拉开成片质量的关键变量。