2026年9月大模型选购指南:GLM-5.3、Kimi K3、Kimi K2.8、GPT-5.6、Claude Sonnet 5、Gemini 3.5、DeepSeek V4 七模型横评

0🔥·6 分钟阅读·AI工具·2026-09-29
🏆
胜者
Kimi K2.8
GLM-5.3
智谱GLM-5.3
VS
Kimi K3
由中国公司月之暗面(Moonshot AI)最新发布的 Kimi K3,是目前全球最大的开放权重AI模型。这款模型在性能上足以和美国顶尖的AI系统掰手腕,并且在多项主流基准测试中霸榜。作为一款重磅的开源大模型,K3 的发布标志着中国在开源AI领域实现了重大突破,为全球的开发者和研究人员提供了强大的开源替代方案,极大地推动了开源AI生态的发展。

📊 快速评分

易用性
智谱GLM-5.3
9.4⚡9.6
由中国公司月之暗面(Moonshot AI)最新发布的 Kimi K3,是目前全球最大的开放权重AI模型。这款模型在性能上足以和美国顶尖的AI系统掰手腕,并且在多项主流基准测试中霸榜。作为一款重磅的开源大模型,K3 的发布标志着中国在开源AI领域实现了重大突破,为全球的开发者和研究人员提供了强大的开源替代方案,极大地推动了开源AI生态的发展。
功能
智谱GLM-5.3
9.5⚡9.5
由中国公司月之暗面(Moonshot AI)最新发布的 Kimi K3,是目前全球最大的开放权重AI模型。这款模型在性能上足以和美国顶尖的AI系统掰手腕,并且在多项主流基准测试中霸榜。作为一款重磅的开源大模型,K3 的发布标志着中国在开源AI领域实现了重大突破,为全球的开发者和研究人员提供了强大的开源替代方案,极大地推动了开源AI生态的发展。
性能
智谱GLM-5.3
5⚡5
由中国公司月之暗面(Moonshot AI)最新发布的 Kimi K3,是目前全球最大的开放权重AI模型。这款模型在性能上足以和美国顶尖的AI系统掰手腕,并且在多项主流基准测试中霸榜。作为一款重磅的开源大模型,K3 的发布标志着中国在开源AI领域实现了重大突破,为全球的开发者和研究人员提供了强大的开源替代方案,极大地推动了开源AI生态的发展。
性价比
智谱GLM-5.3
8⚡9.5
由中国公司月之暗面(Moonshot AI)最新发布的 Kimi K3,是目前全球最大的开放权重AI模型。这款模型在性能上足以和美国顶尖的AI系统掰手腕,并且在多项主流基准测试中霸榜。作为一款重磅的开源大模型,K3 的发布标志着中国在开源AI领域实现了重大突破,为全球的开发者和研究人员提供了强大的开源替代方案,极大地推动了开源AI生态的发展。

2026年9月大模型选购指南:GLM-5.3、Kimi K3、Kimi K2.8、GPT-5.6、Claude Sonnet 5、Gemini 3.5、DeepSeek V4 七模型横评

开场:这个9月,中端市场变天了

上个月我做8月横评的时候,还跟读者说“长文本处理要么买旗舰、要么忍”。结果9月月之暗面一个操作直接把牌桌掀了——Kimi K2.8 百万上下文全员开放,而且官方口径性能逼近K3。这一刀砍下来,受影响最大的不是K3自己,而是GLM-5.3和DeepSeek V4这两个长期盘踞“性价比之王”位置的选手。

加上GPT-5.6终于跳票结束正式发布,9月这期横评的排序和8月相比有了实质性变化。我把七个模型按六个维度重新跑了一遍,直接上结论。

参数速览

模型 厂商 上下文窗口 API价格(输入/每百万token) 开源 发布时间
GLM-5.3 智谱AI 200K 约¥8 / ¥32 否 2026.8
Kimi K3 月之暗面 256K 约¥16 / ¥64 是(开放权重) 2026.9
Kimi K2.8 月之暗面 1M 约¥4 / ¥16 是(开放权重) 2026.9
GPT-5.6 OpenAI 400K 约$10 / $30 否 2026.9
Claude Sonnet 5 Anthropic 200K $3 / $15 否 2026.6
Gemini 3.5 Google 2M 约$1.5 / $6 否 2026.5
DeepSeek V4 深度求索 128K 约¥1 / ¥4 是(MoE 671B) 2026

价格为公开API牌价的大致区间,批量/缓存价另算,以官网为准。

六维度横排(含8月版变化)

维度 第1 第2 第3 vs 8月版变化
编程 Claude Sonnet 5 Kimi K3 GLM-5.3 K3编程分追平差距缩小,GLM-5.3被挤到第三但差距很小
中文写作 GLM-5.3 Kimi K3 Claude Sonnet 5 变化不大,GLM-5.3依然稳坐头名
推理 GPT-5.6 Kimi K3 Gemini 3.5 GPT-5.6发布后直接登顶
多模态 Gemini 3.5 GPT-5.6 Claude Sonnet 5 无变化,Gemini视频理解仍是独档
长文本 Gemini 3.5 Kimi K2.8 Kimi K3 最大变化:K2.8百万上下文开放后冲到第二,且实际可用性比Gemini的长上下文更稳(后段召回更可靠)
性价比 Kimi K2.8 DeepSeek V4 GLM-5.3 K2.8空降第一,DeepSeek被挤到第二但纯token成本仍是全场最低

各模型短评:一个都不放过

GLM-5.3:中文写作还是我最愿意推荐的一个,“人味儿”拿捏得最好,写公众号、写报告不需要大量返工。思考模式开关能省约90% token,日常问答成本可控。Coding Plan套餐对国内开发者依然友好。短板:200K上下文在全员百万的时代已经不够看,多模态能力在第一梯队里垫底。

Kimi K3:全球最大的开放权重模型,多项主流基准霸榜,编程和推理都是第一梯队。自部署跑agent任务的表现让我印象深刻。短板:API价格是K2.8的四倍,如果不是非要顶级能力,大部分场景K2.8就够了——某种程度上月之暗面自己在左右互搏。

Kimi K2.8:本期最大变量。性能官方说逼近K3(实测在编程和推理上还是有可见差距,大约落后5-8%的benchmark分),但百万上下文+中端价格,做长文档分析、批量代码审读这种活儿,单位成本下的实际产出是全场最高。短板:多模态基本没有,极限推理不如K3和GPT-5.6。

GPT-5.6:跳票后确实补了课,推理是本场最硬的,复杂多步任务的成功率我测下来比GPT-5.5高了一截。短板:贵,而且经过安全审查调整后,某些敏感话题的拒答率明显偏高,国内访问也麻烦。

Claude Sonnet 5:编程+长时agent运行依然是标杆,连续跑几个小时不崩、不跑偏,这点Gemini 3.5都还差口气。短板:上下文只有200K,中文写作偏“翻译腔”,价格中等偏上。

Gemini 3.5:2M上下文+多模态独档,视频理解没有对手。短板:2M窗口的后段召回质量衰减明显(我测过塞满文档后询问中后段细节,准确率掉得比K2.8厉害),Agentic能力宣传大于实际。

DeepSeek V4:671B MoE开源,推理编程都在线,¥1/¥4的牌价是地板价。短板:128K上下文是全场最小,长文本直接出局,多模态同样缺席。

分场景推荐

  • 开发者:主力选 Claude Sonnet 5(agent稳定性无可替代),预算敏感就用 GLM-5.3 Coding Plan 顶上,差距在缩小。想自部署研究,Kimi K3 或 DeepSeek V4 的开放权重是正解。
  • 内容创作者:GLM-5.3,中文写作质量第一没有争议。
  • 企业:核心业务 Claude Sonnet 5 或 GPT-5.6,国内合规场景选 GLM-5.3。
  • 学生/研究者处理长文献:Kimi K2.8,百万上下文+低价格,9月最佳新选择。
  • 价格敏感型:DeepSeek V4 仍是token成本地板;但如果你的场景涉及长文档,K2.8 的综合成本反而更低——128K的截断重试会吃掉省下的钱。

一句话总结9月:旗舰格局没大变,但Kimi K2.8把“长文本+性价比”这块市场焊死了,其他家下个月得跟牌。

分享:𝕏fin

相关对比

相关教程

Claude Sonnet 5, GPT-5.6, Grok 4.5 vs 手动操作:效率对比实测

# Claude Sonnet 5, GPT-5.6, Grok 4.5 vs 手动操作:效率对比实测 上周我遇到一个让人头疼的问题:团队需要在三天内完成一个包含 12 个 API 端点的用户管理模块,包含完整的 CRUD 操作、权限校验和分页逻辑。按我平时的手写速度,这至少需要两天半的全神贯注。但这次客户临时加了需求,时间被压缩到了一天半。 我决定做个实验:把同样的任务分别交给 Claude

DeepSeek V4 常见问题与解决方案

# DeepSeek V4 常见问题与踩坑解决方案:一个开发者的实战手记 上个月,我手头一个大型代码仓库的自动重构项目卡壳了。旧模型在处理跨文件依赖时总是"断片",上下文窗口不够用,改了东墙塌西墙。正好 DeepSeek V4 发布,号称百万上下文加 Agent 能力大幅增强,我立刻把项目切了过去。结果?模型是真好用,但从接入到跑顺,我踩了一连串莫名其妙的坑。今天就把这些问题和解决方案整理出来,

Claude Sonnet 5, GPT-5.6, Grok 4.5 实战技巧:5个提效方法

# Claude Sonnet 5, GPT-5.6, Grok 4.5 实战技巧:5个提效方法 上周我遇到一个让人头疼的问题:我需要在一个下午内完成三个不同的编码任务——给新服务搭脚手架和测试、对接一个第三方API、以及把一个复杂的schema转成带类型的模型。如果只用一个模型,要么速度跟不上,要么token消耗让我肉疼。 于是我花了几天时间,把Claude Sonnet 5、GPT-5.6