Anthropic 发布了新一代中型模型 Claude Sonnet 5,重点不再只是提升对话表现,而是把可自主执行任务的 Agent 能力推向更低价格区间。随着 OpenAI 和 Google 近月持续强化同类产品,模型竞争正转向成本、稳定性和少人工干预下的执行能力。
7月起成为默认模型
Anthropic 表示,自周二起,Claude Sonnet 5 将成为免费版和 Pro 版的默认模型,并向所有订阅层级开放。公司将其定位为一款接近高阶模型 Opus 4.8 表现、但成本更低的产品。
按发布时定价,Sonnet 5 在 8 月 31 日前的价格为每百万输入 token 2 美元、每百万输出 token 10 美元。此后,输入价格将上调至每百万 3 美元,输出价格维持不变。
- 8 月 31 日前:输入 2 美元/百万 token
- 9 月起:输入 3 美元/百万 token
- 输出价格:10 美元/百万 token
从定价对比看,Sonnet 5 低于 Anthropic 自家的 Opus 4.8,也低于 OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro,但仍高于 Gemini 3.5 Flash。
Agent任务表现提升
Anthropic 称,Sonnet 5 相比今年 2 月发布的 Sonnet 4.6,在推理、工具调用、软件编程和知识型任务上均有提升。公司给出的基准测试显示,该模型在 Agent 编程项目上的得分为 63.2%,高于 Sonnet 4.6 的 58.1%,接近 Opus 4.8 的 69.2%。
在知识工作测试中,Sonnet 5 的表现甚至略高于 Opus 4.8。后者此前更多被用于处理高难度任务,例如复杂判断和深度研究。
Anthropic 认为,这意味着开发者可以在成本和性能之间做更细的取舍。对于不需要最高精度、但希望稳定执行多步骤任务的场景,Sonnet 5 将成为更便宜的选择。
安全性同步加强
除了性能,Anthropic 也把安全表现作为这次发布重点。公司称,Sonnet 5 在不当协助、欺骗行为、提示注入攻击应对以及恶意请求拒绝方面,均优于上一代模型。其幻觉率和迎合式回答的发生率也有所下降。
不过,Anthropic 也提到,Sonnet 5 在处理失配行为风险方面,仍未达到 Opus 4.8 和 Claude Mythos Preview 的水平。公司同时表示,这款模型执行危险网络安全任务的能力明显低于当前 Opus 系列,因此更适合在 Agent 场景中大规模部署。
部分测试用户也给出了正面反馈。Zapier 工程师表示,Sonnet 5 已能完成此前容易中途停下的多步骤自动化任务;另一家 AI 产品公司 Lovable 则称,该模型在拒绝不安全请求时表现更稳定。
