数字人产业的技术竞赛正在悄然换挡。从早年比拼拟真度、追求外观像真人的上半场,到如今考验交互能力、聚焦落地价值的下半场,中国数字人产业正经历从展示型向实用型的深刻转向。在2026世界人工智能大会期间,多家企业展示了数字人技术的最新突破,一个共同趋势浮出水面:谁能在真实场景中站稳脚跟,谁就能在数字人下半场占据主动。
沙利文最新报告数据显示,中国数字人赛道年复合增长率达到52%,约为全球增速的1.5到2倍,亚太已成为全球最大的增量市场。但行业高速增长的表象下,落地难仍是共性痛点。多数数字人仍停留在照本宣科的展示阶段,能输出不能互动,能录制短视频却撑不住长时直播。实时交互能力已经成为制约产业规模化落地的核心瓶颈。这背后的原因并不复杂。数字人在实验室环境下的表现往往相当出色,但一旦进入真实的生产环境,网络延迟、多模态对齐、长时间稳定运行等问题就会集中暴露。能把数字人从Demo变成7乘24小时在线的生产力工具,需要的是工程化能力而非模型能力的堆砌。从行业统计数据来看,2026年上半年中国数字人相关企业的注册量同比增长超过65%,但能够实现持续商业运营的比例不足20%。这个数据说明技术门槛虽然降低了,但工程化落地能力才是真正决定成败的关键。能够支撑数字人长时间稳定运行的背后,是复杂的系统工程,包括算力调度、模型优化、网络保障和多模态对齐等多方面的协同才能实现。
在WAIC腾讯AI应用创新论坛上,虎牙发布了自研实时多模态数字人基础模型VAM 1.0。基于DiT架构打造的VAM 1.0,核心特点是全链路实时生成。仅需输入一张静态照片,即可生成能实时说话、聆听、反应的数字人形象,无需预渲染和录播素材,每一帧均为在线实时生成。在技术指标上,VAM 1.0的表现相当亮眼。在同等推理集群条件下,模型可实现36.4帧/秒的生成速度,首帧延迟仅1.3秒,在帧率、响应速度、稳定性和算力效率等指标上处于行业第一梯队。虎牙CEO黄俊洪在演讲中特别强调了VAM的交互特性。模型原生覆盖静默、聆听、说话三种对话状态,用户发言时数字人同步做出注视、点头等反馈,用户停顿可自然接话,被打断时能即时响应,支持弹幕和语音双通道驱动交互。黄俊洪直言,大多数模型只学过怎么说,没学过怎么听。虎牙泡在直播间十几年,观众不会等你说完再发弹幕,是场景倒逼出了技术。VAM 1.0目前已在虎牙平台落地多个核心业务场景,包括生成无模板限制的唱跳互动内容、承载狼人杀等陪伴式互动游戏、作为真人主播的数字分身承接弹幕互动、填补深夜时段的内容供给缺口等。这种从直播场景中生长出来的实时数字人技术,天然具备其他厂商难以复制的交互数据优势和场景理解深度。
科大讯飞展台上的AI主播小百惠从媒体播报场景中生长出来,今年已能与真人主持同台对话。商汤的数字人产品也完成了迭代升级。百度一镜则展现了AI数字人在内容生产领域的工业化能力。通过编剧、导演、剪辑三个AI智能体和80多个技能组件,一镜把一条播客、带货视频的生产做成了一条流水线。在WAIC的各个展馆,数字人正在以不同形态出现在不同岗位上。有的在做导览讲解,有的在直播间带货,有的在会议系统中扮演虚拟主持人。腾讯副总裁林松涛在大会上的观察一针见血:模型能力的差距在收窄,但工程化的差距在拉开。真实场景是AI价值的第一现场,终端是AI普及的最后一公里。从本次WAIC的数字人展示来看,各家厂商的模型能力正在趋同,但工程化的差距反而在扩大,谁能够把数字人稳定可靠地部署到真实业务场景中,谁就能获得市场竞争的先发优势。
深度观察WAIC上的数字人展示,一个清晰的分化正在发生。手里只有技术的公司,是"拿着技术找场景"。而有高频交互场景的公司,则是"在场景里长技术"。虎牙的VAM背后是十几年的直播间,弹幕、连麦、打赏构成了真实的交互现场。京东的言犀数字人背后是多年电商供应链的积累。科大讯飞的小百惠则是从媒体播报的场景中一路迭代出来。这种分化意味着数字人赛道的竞争正在进入新的阶段。模型能力的门槛会越来越低,但场景积累的门槛会越来越高。下半场属于那些在真实场景中反复打磨产品的公司,而不是在发布会上展示精美Demo的公司。商汤CEO徐立在WAIC上的发言点出了这个趋势的核心:未来的核心计费维度应当是任务完成的价格。AI的衡量单位要从Token转向Task,从卖算力转向卖结果。当数字人能够真正完成任务而不是仅仅展示形象时,产业价值才能被真正释放。从用户端来看,消费者对数字人的接受度也在快速提升。据调研数据显示,超过六成的受访者表示能够接受数字人主播进行商品介绍和推荐,近四成用户曾在数字人直播间完成购买。用户习惯的养成,正在为数字人产业的规模化落地提供市场基础。