蚂蚁百灵发布Ling-3.0-Flash混合推理模型,124B参数对标万亿旗舰专注Agent执行

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

在竞相追逐万亿参数的大模型竞赛中,蚂蚁百灵选择了一条截然不同的路。7月24日,蚂蚁集团旗下百灵大模型正式对外发布新一代原生混合推理模型Ling3.0Flash。该模型总参数量124B,单Token激活参数仅5.1B,官方宣称其在基础推理、指令遵循、长文本处理等核心指标上对标甚至超越参数规模达其两到三倍的行业领先模型。截至7月27日模型已在OpenRouter上线,限时免费一周,期满后正式开源权重。

这一发布在国产大模型竞争中的独特意义不于又多了一个模型,而在于蚂蚁把以小博大的智效比路线推到了新拐点。Ling3.0Flash的总参数约为其上一代旗舰Ring2.6的12.4%,激活参数仅为8.1%,却宣称实现全方位能力对标甚至超越。这意味着企业可以用约十二分之一的激活算力获得接近旗舰模型的体验。随着推理成本成为大模型商业化的核心瓶颈,这种效率优先的设计思路正在获得越来越多的关注。

专为Agent工作流设计的规划执行分离架构

Ling3.0Flash最核心的产品定位是担任AI工作流中的高速执行节点。百灵团队在官方文档中明确该模型不是要取代超大参数规模的通用推理模型,而是完成AI工作流中规划执行分离范式里的执行环节。这一思路的场景感非常强。在企业Agent的典型工作流中,一个复杂任务通常被拆解为规划、推理、执行、验证四个环节。规划与推理需要模型具备深度思考能力,适合由超大参数模型承担。但执行环节比如从数据库中检索信息、调用API发送请求、格式化输出结果需要的是快速、准确、低成本。在这些场景中5.1B激活参数量意味着极低的延迟和极小的显存占用。

模型支持思考模式与非思考模式两种推理形态,可根据任务复杂度自主判断是否需要深度思考。简单问答直接快速响应,复杂推理任务则切换到多步推导。蚂蚁团队在路由算法上进行了针对性优化,确保专家间的负载高度均衡且路由决策的延迟极低。在长文本处理方面Ling3.0Flash采用优化的注意力机制,在保证128K上下文窗口的前提下显著降低了KV缓存的显存占用。

效率竞赛成为大模型行业新主线

企业内部测试显示Ling3.0Flash表现出极高的指令遵循准确率和低幻觉率,特别是对于复杂多步指令,模型能够保持一致的执行质量而不偏离原始意图。这对于需要长时间自主运行的Agent来说是最关键的能力要求。从更深层的产业趋势来看Ling3.0Flash的发布具有标志性意义。它证明了在Agent执行层这一高频调用场景中,124B参数的模型完全可以承担旗舰模型的大部分工作负载。

当推理成本降低到一定程度,企业将不再需要在能力和成本之间做痛苦取舍。当前大部分头部企业的资源集中在参数规模竞赛上,万亿参数的旗舰模型层出不穷。但在实际企业应用中绝大多数任务并不需要调动万亿参数的重型武器。轻量化、高效率、低成本的中型模型在Agent执行层等高频场景中具备天然优势。蚂蚁百灵这条以小博大的技术路线为大模型行业的健康发展提供了重要的参照样本。这场从参数竞赛到效率竞赛的转向对于整个行业的可持续发展是一个积极的信号。

对AI应用商业化的重要启示

Ling3.0Flash的发布对大模型行业的商业化路径提供了重要启示。当前大模型行业面临的最大挑战之一是推理成本过高,导致许多有潜力的AI应用无法实现盈亏平衡。蚂蚁的实践表明通过架构优化和效率提升,完全可以在保持模型能力的同时大幅压缩推理成本。这对于推动AI技术在企业中的规模化落地具有里程碑意义。当推理成本降低到一定程度,企业将不再需要在能力和成本之间做痛苦取舍,AI技术在企业级的真正普及将指日可待。

从市场反响来看Ling3.0Flash在OpenRouter上线后获得了开发者的积极反馈。多数测试者认为其响应速度大大快于同级别模型,而推理质量并未出现明显下降。百灵团队透露该模型的API定价将显著低于同等能力的旗舰模型,预计将吸引大量对成本敏感的AI应用开发者。在金融、电商、客服等对实时性要求较高的垂直行业中,Ling3.0Flash的高效执行能力将使其成为Agent工作流的首选执行模型。这种从参数竞赛到效率竞赛的范式转换,正在定义大模型行业的下一个竞争维度。对于开发者而言Ling3.0Flash的开源策略意味着他们可以在自己的项目中免费使用和微调这一高效的推理模型,这将进一步加速Agent应用的创新和普及。蚂蚁集团表示将会持续投入资源迭代Ling系列模型。

来源:腾讯云开发者社区 发布时间:2026-07-31