资讯详情

资讯详情

Claude Opus 5.5 发布,任务成本降低 40%:重构生产级 Agent 能效比

Anthropic 发布 Claude 5.5 家族首款模型Claude Opus 5.5。这次更新最有分量的地方是性能、价格和执行效率同时改善。按照官方公布的结果Opus 5.5 在多数工作中达到 Claude Fable 5.1 的水平典型工作负载成本比 Opus 5 降低约40%输出生成速度提升超过30%。对已经在使用 Agent 的团队Opus 5.5 值得优先评估。它直接改善了长任务中最贵的几件事包括重复读取上下文、反复调用工具以及做了修改却迟迟交不出结果。官方发布说明如果你需要在工作流中接入API自由切换全球200大模型魔芋提供合规保障、财务开票、企业级网关、技术支持与定制服务助力更高效地管理应用AI能力。Konjac AI — Unified AI API for China Global LLMsThe Konjac AI Large Model Aggregation Platform (Large Model Gateway Platform) specializes in delivering high-performance, low-cost AI model services across multiple categories, empowering developers and enterprises to focus on product innovation.https://www.konjac.ai/sign-up?affqBX9一、缓存降价 60%长任务的成本优势最直接先把价格摆出来。以下均为每百万 Token 的价格。计费项目Opus 5.5Opus 5降幅常规输入4 美元5 美元20%输出生成20 美元25 美元20%缓存写入5 美元6.25 美元20%缓存读取0.20 美元0.50 美元60%这张表里最值得关注的是缓存读取。代码 Agent 经常围绕同一个项目持续工作系统提示词、工具定义和已有上下文会被重复使用。缓存读取价格从 0.50 美元降到 0.20 美元直接降低了这部分开销。Opus 5.5 同时减少了完成任务所需的 Token。单价下降加上用量减少最终形成官方所说的典型工作负载成本降低约 40%。这个数字对应默认设置下的官方测试。本次降价对高频、多轮、长上下文任务尤其有吸引力。单次问答只享受到一部分价格变化持续运行的 Agent 则能同时受益于缓存降价和执行步骤减少。官方价格与效率说明对于追求速度的用户Fast Mode 提供最高 2.5 倍速度输入和输出分别为每百万 Token 8 美元、40 美元。它是一项明确的付费加速选项适合紧急排障和需要快速反馈的交互任务。二、编程成绩明显领先低成本完成任务更有说服力官方公布的主要成绩如下。评测基准Opus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 SolTerminal-Bench 4.066.4%55.8%52.3%57.9%37.3%FrontierCode v1.1 主集54.4%50.3%48.0%53.3%47.5%CursorBench 4.057.8%51.8%46.6%未列出41.7%GDPval-AA v2.11846 Elo1735 Elo1708 Elo1542 Elo1588 EloAutomationBench40.0%31.4%26.9%41.4%28.8%Humanity’s Last Exam带工具67.7%65.6%63.6%57.2%未列出数据来自官方发布页。Opus 5.5 默认采用自适应思考和 max effortTerminal-Bench 4.0 采用 xhighGPT-6 Astra 在该项采用 high。部分任务包含安全机制触发后的模型回退。从这组成绩可以得出三个判断。第一编程是 Opus 5.5 最突出的优势。相比 Opus 5Terminal-Bench 提高了 14.1 个百分点CursorBench 提高了 11.2 个百分点。对于需要调用工具、跨文件修改和连续执行的代码任务这是一轮明显升级。第二知识工作能力同步提升。GDPval-AA 的成绩从 1708 Elo 升至 1846 Elo在表列模型中居首。Opus 5.5 的竞争力已经覆盖编程之外的专业工作。第三业务自动化仍有强劲对手。AutomationBench 上GPT-6 Astra 以 41.4% 高于 Opus 5.5 的 40.0%。Opus 5.5 的优势集中在编程和知识工作不能把这份成绩表概括成所有场景通吃。官方评测数据更能影响采购和部署决定的是同等任务下的成本对照。测试场景Opus 5.5 的表现单任务成本对照Terminal-Bench 4.0默认档位超过 max effort 的 Opus 5约为 Opus 5 的1/5Terminal-Bench 4.0达到 GPT-6 Astra 的表现水平约为 Astra 的40%FrontierCode默认档位超过 GPT-6 Astra约为 Astra 的1/5CursorBench默认档位比 GPT-5.6 Sol 高约 11 个百分点约为 Sol 的1/3这些结果让中等推理档位成为值得优先采用的起点。新模型用更低成本交出更好的结果团队就有理由重新调整配置减少对最高推理档位的依赖。三、长任务少花十几个小时比回答快一点更有价值工程案例进一步解释了效率提升发生在哪里。任务Opus 5.5对照模型主要变化审查并修复约 20 万行代码不到3 小时Opus 5 超过 20 小时Opus 5 消耗的 Token 为其2.5 倍将 HAProxy 从 C 改写为 Rust9.5 小时Fable 5.1 为 12 小时任务成本降低51%德勤代码审查low effort 发现72%的已知缺陷Opus 5 在 high effort 下发现 56%缺陷发现率提高16 个百分点误报和输出量更少前两项分别来自官方披露的早期用户测试与内部测试第三项来自发布页引用的德勤反馈。HAProxy 的两份改写结果都通过了几乎全部原有回归测试。官方工程案例与客户反馈这组案例里最有意义的变化是任务更快结束了。输出速度提高 30%能缩短等待答案的时间。代码库审查从超过 20 小时缩短到不到 3 小时则直接改变了任务安排。原本要跨天等待的工作有机会在同一个工作日内进入人工检查。德勤的结果也说明投入更多推理资源并不天然意味着效果更好。Opus 5.5 在低档位下发现更多缺陷同时减少误报这比单纯增加输出长度实用得多。对于代码审查、代码库迁移和长时间排障Opus 5.5 已经给出了足够强的升级理由。这些场景恰好最容易积累工具调用、重复尝试和人工接手成本。四、沟通方式改善开发者接手更轻松Opus 5.5 还调整了回答方式把重要信息放到前面减少行话和冗长说明。官方展示的计费 Bug 示例很直观。Opus 5 先指出代码回归再展开区间判断。Opus 5.5 在开头就说明免费层调整只解释了 1.50 美元的收入下降另外 9.92 美元来自一次计费重构。这次修改漏算了当月最后一天的大部分使用量。随后它再解释具体原因。统计截止时间被错误地设为当月最后一天零点导致当天后续事件没有进入账单。官方沟通示例先讲影响再讲原因更适合工程协作。开发者可以先判断问题的严重程度再检查代码细节。长任务结束后也更容易看清模型改了什么、问题解决到哪一步。这项变化看起来没有跑分抢眼却能减少每天反复阅读和追问的时间。Agent 做得越多交代清楚工作结果就越重要。五、安全改善有实测依据接入规则需要同步更新安全方面最明确的数据是在一项隔离边界评测中Opus 5.5 尝试绕过边界的频率比 Opus 5 或 Claude Mythos 5.1 低约85%。这是特定评测的结果不能直接换算成生产环境的风险降幅。对于接入方还有两项实际变化。项目官方公布的变化对接入方的影响特定领域保护措施多数网络安全任务会转交 Opus 4.8生物研究有验证准入安排专业应用需要确认实际使用权限Preserved thinking限制通过修改历史上下文提取模型推理适用于规定日期之后创建的 API 账号会编辑历史消息的集成需要检查兼容性这些措施体现了 Anthropic 对模型执行行为和能力访问的进一步约束。原稿中的“全面封堵蒸馏”“推理全过程可审计”没有充分依据不宜作为产品能力宣传。官方安全与接入说明我的判断是Opus 5.5 最值得优先进入编程 Agent 的主力模型评估名单。它的升级理由很具体终端任务成绩提高、长任务耗时缩短、缓存读取降价而且较低推理档位已经能拿出有竞争力的结果。已经在使用 Opus 5 的团队可以先拿代码审查、跨文件修改和长任务排障做迁移对照。验收时记录成功率、完成时间和单任务费用。这三项数据足以决定它能替换多少现有工作。
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →