三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

时间:2026-09-23人气: 作者: 佚名

梦晨 听雨 发自 凹非寺

量子位 | 公众号

最新旗舰Opus 5.5跑分登顶!

在代码、知识工作、计算机操作等多项基准测试中拿下第一的同时,输出速度也比Opus 5快了30%以上。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图1)

这暂停得好好的前沿,怎么不到两周又被推进了。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图2)

那CEO Dario 发表的“放缓前沿”公开信算什么?

算他能发。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图3)

这届模型开始拿代码当画笔

目前看到比较新颖的测试是用纯代码生成图像,SVG鹈鹕骑自行车已经被刷爆了,这次是更复杂的渲染。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图4)

类似的能力可以扩展成用纯js代码生成渲染视频。

多项跑分登顶,API价格打8折

他们说任务成本降4成,但API价格并没有直接打6折。

Opus 5.5的输入、输出价格分别是每百万Token 4美元和20美元,相比Opus 5下降20%。

再加上完成同一任务需要的步骤和Token更少,测算,典型任务的总成本可以下降40%。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图5)

真正下狠手的是缓存读取价。这一项从Opus 5的每百万Token 0.50美元,直接降到0.20美元,砍了60%。

做Agent编程的都知道,长对话和大型代码任务需要反复读取上下文,缓存读取经常占据成本的大头。相比账面上的API单价,这一刀可能更有实际体感。

另外还有一个Fast mode,输出速度最高可达标准模式的2.5倍,价格也翻倍至每百万输入Token 8美元、输出Token 40美元,适合对延迟特别敏感的场景。

订阅用户也加量了,Pro、Max、Team和按席位收费的企业版,五小时使用限额都会提高;还提供了一次可以暂存、由用户自行选择时间使用的rate limit reset。

具体看跑分,目前最新鲜的榜就是-Bench 4.0了,衡量模型处理复杂命令行任务的能力。

Opus 5.5拿下66.4%,上一代Opus 5是52.3%,的GPT-6 Astra是57.9%,自家的Fable 5.1是55.8%。

已经明显拉开差距。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图6)

在另一项编程基准 v1.1上,Opus 5.5以54.4%超过GPT-6 Astra的53.3%,差距就没那么明显了。

而且推理开中档效果反而更好。

Opus 5.5在默认,也就是中档设置下,反而跑出了54.6%,超过表中其他模型的最高成绩,也略高于自己开到最高档时的54.4%。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图7)

到了这个能力水平,0.2个百分点基本已经落在波动范围里。

自己也承认,跑分差距越来越难准确反映真实使用体验,他们内部使用时,Opus 5.5和Fable 5.1的差距就没有榜单看起来这么大。

另一项 4.0,测的是来自真实会话的多文件模糊任务。

最高下,Opus 5.5拿到57.8%,比Fable 5.1的51.8%高6分,比GPT-5.6 Sol的41.7%高16.1分。

如果看性价比,Opus 5.5在默认中档设置下得分52.5%,依然领先GPT-5.6 Sol的最高成绩约11分,单项任务成本只有后者的三分之一左右。

Opus 5.5特别强调在大规模代码库级别的任务上有明显提升。

早期测试者曾用它迁移68万行代码,不到一天完成。换成人类工程团队,预计至少需要数周。

还有一位测试者用它审计并修复一个20万行代码库,耗时不到3小时。同样的任务,Opus 5花了超过20小时,使用的Token数量还是它的2.5倍。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图8)

在一项内部测试中,让Opus 5.5和Fable 5.1分别将从C语言重写成Rust。是一款被广泛使用的Web流量负载均衡软件。

两个版本都通过了自身几乎全部回归测试,但Opus 5.5只用了9.5小时,Fable 5.1用了12小时,前者的成本低了51%。

还让模型优化一个Web应用所有页面的加载速度。Opus 5.5在40次测试中成功了39次;Opus 5虽然也缩短了加载时间,但改进幅度更小,还改变了应用原本的行为。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图9)

知识工作方面同样值得关注。

在覆盖44个职业的真实工作能力评估-AA v2.1中,Opus 5.5得分1846 Elo,Fable 5.1是1735,Opus 5是1708。

在默认设置下,Opus 5.5的得分就超过了GPT-6 Astra在最高下的表现,单项任务成本大约只有后者的五分之一。

投资公司 反馈,Opus 5.5在最低设置下,就基本完成了他们的量化研究评测任务。

把调高后,它还发现评测指令里的分钟索引存在一个off-by-one错误,并主动修正。

模型甚至特意备注:这样处理是正确的,但可能会导致自己被评分器扣分。

称,此前测试过的所有模型,都没有发现并处理这个问题。

还有个明显变化在于:Opus 5.5说话的方式变了。

以前Opus 5虽然也能找到答案,但很快就会钻进代码块、时间线和区间定义里,用户需要自己从大量技术细节中提炼结论。

Opus 5.5会先把最重要的信息摆出来,再解释原因。

官网展示了一个系统Bug的对比。Opus 5找到问题后,马上开始解释代码改动和时间区间;Opus 5.5开头就把账算清楚了:

额外减少的9.92美元来自一个Bug,免费层调整只占1.50美元。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图10)

随后它才说明,究竟是哪次代码重构把每个月最后一天的大部分用量漏掉了。

一位早期测试者的评价是:

It the way I do(它写东西的方式跟我一样)。

还特意强调,表达清楚不只是文风升级。模型把关键信息放在前面、减少术语和特异性表达,人类检查其结论和操作过程也会更加容易,这本身就是一项安全收益。

和Fable一个级别的笼子

能力往前冲,安全笼子也跟着加厚了。

Opus 5.5是首款同时搭载Fable 5.1同级网络安全、生物安全和反蒸馏护栏的Opus模型。触发相关限制后,系统会透明地回退到其他模型处理。

发布之前,它还接受了METR和 两家外部机构的评估。

这也是对“放缓前沿”的解释:模型照常研发和发布,但要给安全对齐和外部审查留出时间。

在内部覆盖近2000个模拟场景的自动化行为审计中,Opus 5.5在几乎所有失调行为指标上,都拿到了近期模型中的最好成绩。

在一项专门测试模型越过安全边界倾向的新评估中,Opus 5.5尝试规避边界的频率,比Opus 5和 5.1低了约85%。

仅有的几次尝试也都属于低严重性事件,而且由模型自行上报。

不过同时承认,他们观察到Opus 5.5经常怀疑自己正在接受评估。

一旦模型知道“这是一场考试”,测试中的表现能否代表真实部署环境,就要打上一个问号。称,目前仍然没有办法在发布前可靠地发现所有潜在问题。

在更实际的Agent防护上,Opus 5.5还配备了三层措施。

它会在执行前检查每一个操作;运行环境放在安全团队可以审计的开源沙箱中;代码审查功能则会在代码合并前检查漏洞。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图11)

面对提示注入攻击,Opus 5.5在测试的编程、工具调用、计算机操作和网页浏览等场景中,都追平或超过了Opus 5。

这么厚的笼子,也和它在高风险领域的能力有关。

在生物学领域,Opus 5.5已经在多个方向追平甚至超过 5.1,因此使用了与Fable 5.1相同的生物安全护栏。

在与Dyno 合作开展的长期分子预测和设计评估中,Opus 5.5取得了进一步提升。参与红队测试的专家认为,其科学新颖性与他们测试过的最强模型相当。

经过审核的学术实验室、初创公司和制药企业,可以通过新推出的Life ,申请适用于生物研发工作的更宽松权限。

网络安全也是一样。

由于Opus 5.5的网络安全能力很强,普通用户提交的大多数网络安全任务会被自动转交给Opus 4.8。经过认证的网络安全从业者,则可以通过即将扩展的Cyber 申请使用Opus 5.5。

反蒸馏措施也直接上到了Fable 5.1的级别。

Opus 5.5搭载了 机制,限制API用户编辑此前生成的思考上下文,防止攻击者借此批量提取模型的推理能力。

这项限制适用于2026年8月31日及以后创建的API账户。

与此同时,Opus 5.5不再允许关闭模式,输出文本中也加入了水印。

这种水印不会直接显示在文本里,也没有添加隐藏字符。它通过调整模型在多个意思相近的词语之间如何选择,留下可供专用检测工具识别的统计模式,普通读者看不出区别。

OMT:Haiku终于更新了

在、Opus和Fable都已经进入5系列之后,家的“小杯”还停留在Haiku 4.5。

这次终于有准信了。

Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折(图12)

宣布, 5.5和Haiku 5.5都将在未来几周内推出,同样会获得性能、效率和安全方面的升级。

也就是说,Opus 5.5只是5.5系列的第一款。

这边刚刚一口气端出GPT-6 Astra和GPT-5.6 Sol,那边紧接着发布Opus 5.5,还预告后面有两款新模型排队。

前沿确实没有停,大家都在忙着踩油门啊~

参考链接: