Anthropic发布Opus 5.5,能力追平顶级模型成本降四成

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

当地时间9月22日,Anthropic发布Claude Opus 5.5,这是其新5.5家族的首款模型。官方称它在大多数任务上的表现达到旗舰模型Fable 5.1的水平,运行成本比上一代Opus 5下降约40%,输出速度提升超过30%。值得注意的是,这是公司首席执行官达里奥·阿莫代伊公开呼吁放缓前沿开发节奏之后推出的第一款新模型,性能提升、成本下降与外部安全测试被同步推进。

降价四成是怎么算出来的

按官方公布的价目表,Claude Opus 5.5每百万词元输入4美元、输出20美元,上一代Opus 5分别是5美元与25美元,单价降幅约20%。缓存读取从0.50美元降到0.20美元,降幅60%;缓存写入从6.25美元降到5美元。公司还提供Fast模式,价格为每百万输入8美元、输出40美元,速度最高提升2.5倍。

单价只降两成,运行成本却降四成,差额来自每个任务消耗的词元更少。官方说明,Opus 5.5所需的推理算力低于Opus 5,在典型负载下单价与用量两个因素叠加,才得到40%的整体降幅。对以智能体与编程为主的长任务而言,缓存读取占成本的大部分,这一项降60%对总成本的影响比输入单价更大。

模型默认支持100万词元上下文与12.8万词元输出,采用始终开启的自适应思考机制,思考无法被显式关闭,深度通过effort参数调节。可用渠道包括Claude API、Amazon Bedrock、AWS上的Claude Platform、Google Cloud与Microsoft Foundry。公司同时提高了Pro、Max、Team与按席位计费的企业版五小时用量上限,并给订阅用户一次可自行保存、自选时机使用的限速重置机会。

编程基准上的具体数字

早期测试者给出了一组可对照的数据。有测试者用它审计并修复了一个20万行的代码库,耗时不到三小时,而Opus 5完成同类工作要超过20小时且消耗2.5倍词元;另一位测试者在不到一天内完成了一个68万行的代码迁移,这类工作量按常规工程团队排期需要数周。

官方内部测试用HAProxy做了迁移对照:把这款广泛使用的负载均衡软件从C语言重写为Rust,Opus 5.5与Fable 5.1的版本都通过了HAProxy自身的绝大多数回归测试,但前者耗时9.5小时,后者12小时,成本低51%。这说明差距主要体现在效率而非正确率上。

第三方与官方榜单的对照同样清晰。在FrontierCode v1.1主集上,Opus 5.5在默认中等effort下得分54.6%,高于所有对照模型,超过GPT-6 Astra的最高分53.3%,而每个任务的成本约为其五分之一。在Terminal-Bench 4.0上,它以约四成成本匹配Astra;在CursorBench 4.0上得分52.5%,比GPT-5.6 Sol的最高分41.7%高11分,成本约为三分之一。另有一个网页提速任务,它尝试40次成功39次,而Opus 5的改动幅度更小,还改变了应用的原有行为。

安全测试放在发布之前

这款模型在发布前接受了外部评估机构的测试,包括Frontier Design与METR。官方称这是其发布流程中的固定环节,目的是让独立机构在模型面向公众之前接触并检验它,而不是事后补做说明。

在自动化行为审计这一覆盖数千个模拟场景的对齐测试中,Opus 5.5是官方测试过的表现最强的模型。官方给出的对比是:它比Opus 5更不容易采取难以逆转的行动,更不容易越出给定的边界,对提示注入的抵抗力也更强。在一项专门评测中,它试图突破隔离边界的概率比Opus 5与Claude Mythos 5.1低约85%。

由于在生物学与网络安全两个领域的能力与Mythos 5.1相当,Opus 5.5沿用了此前只用于最强模型的保障措施。已通过审核的机构可以申请生命科学验证计划,把该模型用于生物学研究;网络安全验证计划的适用范围也将在未来几周扩大。这套分级思路,是能力越强、可及范围越受约束的具体落地。

把外部评估前置到发布流程里,需要付出时间成本。测试机构必须在模型公开之前拿到访问权限,完成数千个模拟场景的检验,再把结论反馈给厂商。这种安排会让发布节奏受制于第三方排期,但换来的是可被引用的独立记录,而不是只有厂商自述的能力说明。

降价与安全叙事同时出现意味着什么

把这次发布放回当天的行业节奏里看,信号更清楚。在Opus 5.5发布约90分钟后,OpenAI也推出了GPT-6家族的中端与低价版本,并宣布API价格较上一代促销价下调50%。两家前沿实验室在同一天把竞争主轴从谁的模型更强,转向完成同样一份工作要花多少钱。

这与阿莫代伊此前呼吁放缓的姿态并不矛盾,但需要重新理解。放缓指的更多是发布前的评估强度与保障措施的覆盖范围,而不是停止迭代。把成本效率与外部测试同时作为发布的一部分,是这家公司给出的实践版本:模型照常更新,但把独立验证前置,把能力分级与访问权限绑定。

对应用侧来说,最直接的变化是长任务的成本结构。当旗舰能力下沉到原来中端的价位,过去因为调用昂贵前沿模型而不敢常态化的多步智能体工作流,开始具备经济可行性。公司已表示Sonnet 5.5与Haiku 5.5将在未来几周跟进,如果同样的降幅在更低档位复现,智能体应用的规模上限会被再一次推高。

需要留意的是基准的解释力正在下降。官方自己也承认,在当前的绝对水平上,榜单分差已经不再是判断真实差距的可靠依据,实际使用中的差距比分数显示得更窄。对采购方来说,更有参考价值的可能不是某一项基准的第一名,而是同一任务在不同价位档位上的单位成本,以及外部测试报告的完整程度。

素材来源:Anthropic官方博客、每日经济新闻、Channel NewsAsia、Releasebot 发布时间:2026-09-24