10月2日,多名开发者注意到月之暗面API平台后台的模型注册表中出现了kimi-k3-1的标识,并且可以通过接口进行探测与调用。几乎同一时间,月之暗面官方开放平台挂出了K3.1的预告页,明确标注该版本支持100万token上下文窗口,并提供三档推理强度供用户选择。业内普遍预计这个版本将在10月内正式发布。上一代Kimi K3拥有2.8万亿总参数、1040亿激活参数,今年7月发布并开放权重,10月1日刚完成与OpenAI编程工具Codex企业通道的对接,新版本此时浮出水面,节奏衔接得相当紧凑。
这次曝光的路径与以往大模型发布前的谍照颇为相似。开发者先是在API平台的模型列表里看到未公开的标识,随后尝试用接口探测,发现模型可以返回响应,说明权重已经部署到线上环境,只是尚未对外官宣。官方随即将预告页挂出,等于半公开确认了新版本的存在。这种先被开发者发现、再顺势预告的做法,在国产模型厂商中越来越常见,既省去了造势成本,也借开发者社区完成了第一轮传播。
从预告信息看,100万token上下文是最核心的卖点。这个量级意味着一次可以读入数百页文档、一整个中型代码仓库的关键文件,或者数小时的会议转录。对编程场景尤其关键:开发者可以直接把整个项目丢给模型,让它自行建立文件之间的引用关系,而不是像过去那样人工裁剪上下文分多轮提问。上下文窗口的扩大背后是注意力机制与显存调度的持续优化,能在这个长度上保持稳定的检索与推理质量,工程难度并不低。值得注意的是,上下文长度只是门槛的一半,窗口内的检索准确率与长文档之间的交叉引用能力,才是决定这类功能能不能用在生产环境的关键,这也将是K3.1发布后开发者测试的第一重点。
K3.1预告中另一个值得注意的设计是Low、High、Max三档推理强度,由用户按任务复杂度自行选择。这个思路的出发点是成本与质量的权衡:简单任务用低档位,推理链路短、响应快、费用低;复杂任务切换到高档位,让模型进行更长的思考过程,换取更高的准确率。三档之间共享同一套模型权重,区别在于推理时允许的思考预算不同。
这个设计正在成为国产模型的标配。此前已有同类产品采用类似的档位划分,海外厂商也在旗舰模型中引入了思考预算的调节机制。背后的商业逻辑很直接:推理档位让同一个模型可以覆盖从日常问答到深度研究的价格带,用户不必在不同模型之间迁移,平台也能用统一的权重服务分层需求。对企业客户来说,档位可调还意味着预算可控,批处理场景用低档位压成本,关键环节再切换高档位,单位任务成本可以显著下降。对模型厂商来说,档位设计还有一层隐性收益:同一套权重服务多档需求,训练与维护成本不用翻倍,边际成本远低于为不同场景分别维护多个模型,这也是档位机制能快速普及的经济基础。
Kimi K3自7月发布开放权重以来,生态进展值得关注。它在多项公开评测中保持了开源模型第一梯队的位置,被多家海外企业纳入内部测试清单,英伟达掌门人曾公开表态美国企业可以使用中国开源模型。10月1日完成的与Codex企业通道对接,让K3可以进入OpenAI编程工具的企业工作流,这在国产模型中并不多见,说明其API兼容性与稳定性已经通过了第三方平台的验证。
对月之暗面自身来说,K3.1的发布还承担着资本市场的期待。公司此前完成大额融资,估值达到数百亿美元量级,并传出备战港股上市的消息。在开源模型竞赛中保持旗舰产品的更新节奏,是支撑估值叙事的关键一环。开源与商业化并行是国产大模型的主流路线,开放权重换取开发者生态,API与企业服务贡献收入,两条腿的平衡决定一家公司能走多远,月之暗面在这条路上的每一步都备受同行关注。长文本与可选推理档位这两项能力,恰好对应企业客户最关心的两个问题:能不能处理真实业务里的长文档,能不能把推理成本压到可接受的范围。
把视野拉开,100万上下文正在成为国产开源模型争夺开发者的标配配置。过去一个多月里,多家厂商先后把百万级上下文作为新版本的标配能力,长文本从少数旗舰的专属卖点变成了第一梯队的入场券。竞争的重心也随之转移:窗口大小不再是差异点,窗口内的检索精度、多文档之间的冲突处理、长会话中的指令遗忘控制,才是真正的分水岭。
对用户而言,这轮军备赛的实际收益正在显现。法律、金融、医疗等文档密集行业,过去需要专门搭建检索管道才能处理的任务,现在可以直接依赖模型的长上下文能力完成初筛。当然,长上下文不等于长记忆,会话结束之后模型并不会保留状态,生产环境里仍然需要外部存储配合。但从能用办好一件事的角度看,模型在一个任务内可以吞下的信息量,确实已经跨过了多数真实业务的门槛。接下来值得观察的是档位与上下文的组合定价,如果低档位长上下文的单位成本能压到足够低,长文档批处理将成为新的高频场景,模型厂商的推理收入结构也会随之改变。K3.1正式发布后的实测表现,值得开发者重点关注。