Claude Sonnet 5 入门:实用指南

coding入门7 分钟阅读2026/7/23

我之前遇到了个麻烦。我们团队跑了大量的自主编程智能体——主要是用来重构遗留服务和生成样板化的 API 集成代码——但我们碰壁了。Opus 4.8 干活确实漂亮,可按我们的跑量,成本简直在疯狂吞噬预算。Sonnet 4.6 倒是便宜,但在多步骤任务上总是掉链子,不是忘了工具的输出结果,就是重构改到一半直接摆烂。

所以,当 Claude Sonnet 5 在 6 月 30 号发布,号称是“迄今为止最具 Agent 能力的 Sonnet”,且性能逼近 Opus 4.8 时,我是持怀疑态度的,但实在没辙了,还是立马试了一把。经过一周的摸爬滚打——迁移服务、跑研究型 Agent、把各种边角情况都测了个遍——以下是我的真实体验。

上手指南:迁移路上的坑

先说好消息:如果你已经在用 Claude API,切换起来非常简单,只要把模型 ID 改成 claude-sonnet-5 就行。完全是无缝升级。但有三个破坏性更新打了我个措手不及,要是不留意,你前一百个请求全都会返回 400 错误。

1. 自适应思考默认开启。 你再也不需要显式地去开启扩展思考(extended thinking)了。Sonnet 5 会自己判断一个任务需要多少推理。这对 Agent 工作来说太棒了,但这也就意味着,你的 token 用量跟 Sonnet 4.6 比起来会不一样。

2. 手动开启扩展思考会触发 400 错误。 我硬是浪费了尴尬的一个小时去 debug,为啥我原来配的 thinking 参数会报错。如果你还像用 4.6 那样手动强制开启扩展思考,API 会直接拒绝。现在模型自己会处理这事儿——别去干涉它。

3. 非默认的采样参数会触发 400 错误。 如果你之前调 Sonnet 4.6 的时候传了 top_ptop_k,或者微调了 temperature,赶紧把这些都删掉。Sonnet 5 不认这些了。这玩意儿直接搞挂了我一半的现有流水线配置。

现在一个能正常跑的请求长这样:

import anthropic

client = anthropic.Anthropic()

response = client.messages.create(
    model="claude-sonnet-5",
    max_tokens=128000,
    messages=[
        {"role": "user", "content": "将此身份验证模块重构为使用 JWT 而不是 session cookie。这是当前的代码:..."}
    ]
)

干干净净,没有采样参数,没有思考配置。直接就能跑。

定价:优惠期很重要

目前,Sonnet 5 正在实行入门优惠价:输入 $2 / 百万 token,输出 $10 / 百万 token,一直持续到 2026 年 8 月 31 日。之后就会涨到输入 $3 / 输出 $15。这还是比 Opus 便宜,但差距明显缩小了。

就我的使用场景而言——装满代码库的大上下文窗口加上长输出——入门优惠价大概比我用 Opus 4.8 便宜 60%。8 月份之后,大概就只便宜 40% 了。为了这 Agent 能力依然很值,但具体划不划算,还得看你的工作量。

真正的考验:Agent 编程工作流

跑分上说 Sonnet 5 在编程和工具调用上几乎追平了 Opus 4.8。但跑分终归是跑分。我想看看它处理我真实代码库那一地鸡毛时表现如何。

我设了个测试:重构一个 2000 行的 Python 支付处理服务。这个任务需要读取多个文件、理解现有架构、编写新模块、更新整个项目的 import 语句,还要跑测试确保没改坏。

用 Sonnet 4.6 的时候,这任务基本在第 4 或第 5 步就挂了。模型要么忘了已经读过的文件内容,要么建议导入根本不存在的模块。而用 Sonnet 5,它一口气把整个任务跑完了。你能明显感觉到自适应思考在起作用——可以看到模型在写代码前会先停顿一下,推演架构决策,然后在做简单修改时,又切回更快速、更下意识的模式。

Sonnet 5 真正大放异彩的地方,是多步骤工作流中的工具调用。我给了它终端和浏览器的权限,然后它:

  1. 读取了现有的支付模块
  2. 通过浏览器查阅 Stripe API 文档,找到我们需要的具体端点
  3. 创建了一个新的 JWT 工具模块
  4. 重写了身份验证中间件
  5. 更新了 12 个文件中的所有 import 语句
  6. 跑了测试套件,发现 2 个报错
  7. 自己把报错修好了
  8. 再次跑测试——全部通过

这种自主循环以前非得上 Opus 不可。现在用 Sonnet 的价格就能跑,这绝对是个实质性的转变。

努力程度:一个隐藏的调节杠杆

有个功能没得到足够关注,那就是“努力程度”(effort levels)。Sonnet 5 支持不同的努力程度设置,控制它在任务上投入多少算力。如果是快速查找或简单格式化,你可以调低它,获取又快又便宜的回复。如果是复杂推理,你就可以调高。

在我的测试中,默认的自适应模式大约 80% 的情况下自己就能搞定。但如果遇到我知道需要深度推理的任务——比如 debug 异步代码里的竞态条件——我就会显式调高努力程度。而如果是批量任务,比如给 50 个函数生成 docstring,我就会调低来省 token。

它不太擅长的地方

说点实在的。Sonnet 5 不是 Opus 4.8。它很接近,但差距还在。

复杂的网络安全任务: Anthropic 明确指出,Sonnet 5 在“执行网络安全任务的能力上远低于” Opus 模型。实际体验下来,我发现这意味着它在复杂的安全审计上比较吃力。识别常见漏洞没问题,但 Opus 能抓到的隐蔽攻击向量,它就会漏掉。

超长推理链: 在需要 10 步以上顺序推理、且每一步都依赖上一步的任务上,Sonnet 5 偶尔会丢失上下文,或者进行逻辑跳跃。Opus 4.8 在这方面要严谨得多。

1M 上下文窗口确实有,但情况比较微妙: 没错,它支持 1M token 的上下文窗口。但把窗口塞满,和在整个窗口内都能保持稳定的检索质量,是两码事。对于大多数实际的编程任务,我发现上下文在 200K token 以内时性能都很强。超过这个范围,它利用上下文最开头信息的能力就会开始打折扣。

用了一周后的实用建议

  1. 清掉你以前的提示词工程。 把你为 Sonnet 4.6 写的手动思考指令、采样参数和分步推理提示都删了吧。自适应思考处理这些比你写的提示词好多了。

  2. 给它工具,然后别管它。 Sonnet 5 最大的优势是 Agent 自主性。与其用详尽的指令去微操它,不如给它所需工具(终端、浏览器、文件系统)的权限和一个明确的目标。它的规划能力比你想象的要好。

  3. 在优惠期盯紧你的 token 成本。 自适应思考意味着 token 用量比以前更难预测了。趁着现在优惠价还能兜底学习成本,赶紧把监控建起来。

  4. 拿你的真实工作负载做验证。 跑分确实好看,但正如 Caylent 的分析正确指出的那样,Sonnet 5 需要针对你的真实代码库、延迟目标和成本限制进行任务级别的验证。别光换个模型 ID 就以为万事大吉了。

  5. 把 128K 的输出窗口用起来。 以前用 Sonnet 4.6,做大型重构时我经常触碰到输出上限。Sonnet 5 高达 128K 的输出 token 上限意味着你可以在单次回复中要求更大的改动。放心用。

Sonnet 5 不是什么魔法。它只是一个价格非常划算的优秀模型,终于让我们不用非得咬牙上 Opus 就能跑通 Agent 工作流了。对我们团队来说,它已经成了新的默认选择——这也是我能给出的最高评价了。

相关 Agent

C

光标编辑器

AI驱动的代码编辑器,支持智能补全和对话。

了解更多 →