2026年9月大模型选购指南:GLM-5.3、Kimi K3、Kimi K2.8、GPT-5.6、Claude Sonnet 5、Gemini 3.5、DeepSeek V4 七模型横评
开场:这个9月,中端市场变天了
上个月我做8月横评的时候,还跟读者说“长文本处理要么买旗舰、要么忍”。结果9月月之暗面一个操作直接把牌桌掀了——Kimi K2.8 百万上下文全员开放,而且官方口径性能逼近K3。这一刀砍下来,受影响最大的不是K3自己,而是GLM-5.3和DeepSeek V4这两个长期盘踞“性价比之王”位置的选手。
加上GPT-5.6终于跳票结束正式发布,9月这期横评的排序和8月相比有了实质性变化。我把七个模型按六个维度重新跑了一遍,直接上结论。
参数速览
| 模型 | 厂商 | 上下文窗口 | API价格(输入/每百万token) | 开源 | 发布时间 |
|---|---|---|---|---|---|
| GLM-5.3 | 智谱AI | 200K | 约¥8 / ¥32 | 否 | 2026.8 |
| Kimi K3 | 月之暗面 | 256K | 约¥16 / ¥64 | 是(开放权重) | 2026.9 |
| Kimi K2.8 | 月之暗面 | 1M | 约¥4 / ¥16 | 是(开放权重) | 2026.9 |
| GPT-5.6 | OpenAI | 400K | 约$10 / $30 | 否 | 2026.9 |
| Claude Sonnet 5 | Anthropic | 200K | $3 / $15 | 否 | 2026.6 |
| Gemini 3.5 | 2M | 约$1.5 / $6 | 否 | 2026.5 | |
| DeepSeek V4 | 深度求索 | 128K | 约¥1 / ¥4 | 是(MoE 671B) | 2026 |
价格为公开API牌价的大致区间,批量/缓存价另算,以官网为准。
六维度横排(含8月版变化)
| 维度 | 第1 | 第2 | 第3 | vs 8月版变化 |
|---|---|---|---|---|
| 编程 | Claude Sonnet 5 | Kimi K3 | GLM-5.3 | K3编程分追平差距缩小,GLM-5.3被挤到第三但差距很小 |
| 中文写作 | GLM-5.3 | Kimi K3 | Claude Sonnet 5 | 变化不大,GLM-5.3依然稳坐头名 |
| 推理 | GPT-5.6 | Kimi K3 | Gemini 3.5 | GPT-5.6发布后直接登顶 |
| 多模态 | Gemini 3.5 | GPT-5.6 | Claude Sonnet 5 | 无变化,Gemini视频理解仍是独档 |
| 长文本 | Gemini 3.5 | Kimi K2.8 | Kimi K3 | 最大变化:K2.8百万上下文开放后冲到第二,且实际可用性比Gemini的长上下文更稳(后段召回更可靠) |
| 性价比 | Kimi K2.8 | DeepSeek V4 | GLM-5.3 | K2.8空降第一,DeepSeek被挤到第二但纯token成本仍是全场最低 |
各模型短评:一个都不放过
GLM-5.3:中文写作还是我最愿意推荐的一个,“人味儿”拿捏得最好,写公众号、写报告不需要大量返工。思考模式开关能省约90% token,日常问答成本可控。Coding Plan套餐对国内开发者依然友好。短板:200K上下文在全员百万的时代已经不够看,多模态能力在第一梯队里垫底。
Kimi K3:全球最大的开放权重模型,多项主流基准霸榜,编程和推理都是第一梯队。自部署跑agent任务的表现让我印象深刻。短板:API价格是K2.8的四倍,如果不是非要顶级能力,大部分场景K2.8就够了——某种程度上月之暗面自己在左右互搏。
Kimi K2.8:本期最大变量。性能官方说逼近K3(实测在编程和推理上还是有可见差距,大约落后5-8%的benchmark分),但百万上下文+中端价格,做长文档分析、批量代码审读这种活儿,单位成本下的实际产出是全场最高。短板:多模态基本没有,极限推理不如K3和GPT-5.6。
GPT-5.6:跳票后确实补了课,推理是本场最硬的,复杂多步任务的成功率我测下来比GPT-5.5高了一截。短板:贵,而且经过安全审查调整后,某些敏感话题的拒答率明显偏高,国内访问也麻烦。
Claude Sonnet 5:编程+长时agent运行依然是标杆,连续跑几个小时不崩、不跑偏,这点Gemini 3.5都还差口气。短板:上下文只有200K,中文写作偏“翻译腔”,价格中等偏上。
Gemini 3.5:2M上下文+多模态独档,视频理解没有对手。短板:2M窗口的后段召回质量衰减明显(我测过塞满文档后询问中后段细节,准确率掉得比K2.8厉害),Agentic能力宣传大于实际。
DeepSeek V4:671B MoE开源,推理编程都在线,¥1/¥4的牌价是地板价。短板:128K上下文是全场最小,长文本直接出局,多模态同样缺席。
分场景推荐
- 开发者:主力选 Claude Sonnet 5(agent稳定性无可替代),预算敏感就用 GLM-5.3 Coding Plan 顶上,差距在缩小。想自部署研究,Kimi K3 或 DeepSeek V4 的开放权重是正解。
- 内容创作者:GLM-5.3,中文写作质量第一没有争议。
- 企业:核心业务 Claude Sonnet 5 或 GPT-5.6,国内合规场景选 GLM-5.3。
- 学生/研究者处理长文献:Kimi K2.8,百万上下文+低价格,9月最佳新选择。
- 价格敏感型:DeepSeek V4 仍是token成本地板;但如果你的场景涉及长文档,K2.8 的综合成本反而更低——128K的截断重试会吃掉省下的钱。
一句话总结9月:旗舰格局没大变,但Kimi K2.8把“长文本+性价比”这块市场焊死了,其他家下个月得跟牌。