7月30日,科大讯飞智能交互数字人平台升级发布会在北京举行。据智东西7月30日报道,科大讯飞首次发布超拟人数字人实时生成技术并升级交互服务数字人、营销数字人、培训数字人等产品方案,同时上线数字人生态共建计划进一步推动数字人技术在企业场景中的规模化应用。一块屏幕里走出的数字人不仅能走动带路、实时讲解,还能无缝切换多国语言,按需更换自己的外形和声音,直接把沉浸式交互效果拉满。
传统数字人往往只待在屏幕里,科大讯飞这次令人眼前一亮的升级便是移动数字人,直接自带自动引路、躲障避行、声源追踪、多模态感知全套能力,配合透明屏就实现虚实同步的沉浸式视觉观感。这样一来一台设备就能包揽展厅、门店、展馆、展会里带路、讲解、一对一接待等各种任务,让数字人真正从屏幕里走到现实场景中。
过去制作高质量数字人通常需要约2小时的真人视频采集及长周期模型训练。企业不仅需要投入专业拍摄设备,还要花费大量时间进行面部捕捉数据的后处理。如今仅需一张照片即可实时生成数字人并开展自然交互。新一代数字人可呈现更加自然的表情、动作和口型,并支持取物、喝水、唱歌、跳舞等复杂动作。现场演示中实时生成的数字人不仅拥有自然真实的面部微表情,肢体动作也流畅连贯几乎看不出与真人录播的差异。
这得益于星火语音大模型、垂直领域知识库、人设自定义和长期记忆等多重技术能力的融合支撑。数字人拥有了长期记忆能力,在与企业客户的持续交互中能记住之前对话的内容和上下文,长时间连续对话不会出现逻辑断裂。在客服和营销场景中这种越聊越了解你的能力是提升用户满意度和转化率的核心竞争力。一位测试用户表示数字人在连续对话超过20分钟后仍能保持对上下文的准确理解就像一个真正记得你的人工助理。
讯飞同步发布了环形麦、多麦阵列及首款即插即用多模态一体机等硬件产品,并推出覆盖移动数字人、交互导游机、数据调度大屏等1加X多终端部署方案。移动数字人融合360度声源定位、人脸识别、唇形识别等多模态能力,可实现主动识别交流对象、自主避障、边走边讲解等功能。目前讯飞数字人已支持英法泰等37种语言,并落地肯尼亚运营商展厅、阿布扎比海关移民局、泰国曼谷国际机场等海外场景。
在营销场景讯飞推出了覆盖数字代言人、内容生产、矩阵运营的一体化解决方案。已为泸州老窖打造AI数字品鉴师泸麟儿服务超过3000万会员。发布会上还联合洽洽推出休闲零售行业首个数字代言人洽可儿探索品牌数字化传播新模式。这场发布会折射出整个数字人行业的转向:数字人不再只是锦上添花的营销工具,而是逐步成为企业与用户交互的新一代通用入口。弗若斯特沙利文数据显示中国AI数字人市场规模2030年将从2025年的54.4亿元增长到153.4亿元。
针对企业人才培养场景讯飞发布了讯飞智聘数字人、讯飞培训数字人、星火陪练数字人三大产品,覆盖选才、育才、成才全流程。其中星火陪练数字人已覆盖汽车、保险、客服、餐饮等多个行业,每年完成超过1000万次实战陪练。发布会还宣布开放数字人核心能力并上线首个数字人高教实操课程。讯飞在数字人赛道的差异化竞争优势在于行业定制化和软硬件一体化能力。在金融、政务、教育等对安全性和可靠性要求极高的垂直行业,讯飞的企业级数字人解决方案具备更高的市场认可度。从行业发展趋势看数字人赛道正在从比拼技术指标转向比拼场景落地能力。过去一年大量数字人公司通过技术演示获得了市场关注,但真正实现规模化商业收入的仍然是少数。科大讯飞凭借在语音交互、大模型和企业级服务方面的综合能力正在成为数字人赛道最有力的竞争者之一。从行业发展趋势看数字人赛道正在从比拼技术指标转向比拼场景落地能力。过去一年大量数字人公司通过技术演示获得了市场关注,但真正实现规模化商业收入的仍然是少数。科大讯飞凭借在语音交互、大模型和企业级服务方面的综合能力正在成为数字人赛道最有力的竞争者之一。
展望未来数字人技术的发展方向将聚焦于三个核心能力:一是实时性和自然度的进一步提升,让数字人在微表情和肢体语言上达到与真人无异的水平;二是长期记忆和个性化能力的增强,使数字人能够更好地理解和服务特定用户;三是跨场景的泛化能力,让一个数字人能够在不同平台上保持一致的形象和知识体系。科大讯飞此次发布的技术在这三个方向上均取得了实质性进展。随着星火大模型能力的持续迭代和数字人硬件产品线的完善,讯飞有望在千亿规模的企业级数字人市场中占据重要一席,进一步巩固其在AI语音和数字人领域的技术领先地位。发布会现场多家企业客户当场表达了合作意向,预示着讯飞数字人产品的商业化前景十分乐观。