Gemini 4 正式发布:写作与知识能力突出,编程表现起伏

2026/10/1news

停更七个半月的 Gemini 旗舰模型终于迎来更新。Google 官方多个账号同步宣布 Gemini 4 Argon 正式发布,这是其旗舰模型时隔许久的一次重大迭代。值得注意的是,这可能是近期唯一一个写作、知识和长文本能力明显强于编程与 Agent 能力的前沿模型。

新模型沿用了测试期间的内部代号「Argon」(氩,第 18 号元素),命名方式的变化颇为新鲜。不过普通用户暂时还无法直接体验:目前 Gemini 4 Argon 仅通过 Fairwind 计划向少量网络安全合作伙伴开放,后续将首先向付费 API 用户和 Google AI Ultra 订阅者开放,全面公开时间尚未确定。

从官方公布的跑分来看,Gemini 4 在列出的 18 项测试中有 13 项取得领先。优势最明显的是知识工作领域:在涉及真实金融分析工作的 Vals Finance Agent v2 和律师工作基准 Harvey's Legal Agent Benchmark 上,Gemini 4 领先其他模型约两档。长上下文同样是传统强项,在测试 256k 至 1M 超长上下文应用的 Graphwalks 中领先其他旗舰模型超过 10%。

这一领先得益于一项新特性:输出上限从上一代的 6.4 万 token 提升至 100 万 token,官方称这将为推理带来全新深度,可一次性解决复杂问题。

编程方面则表现起伏:在真实世界软件构建测试 DeepSWE v1.1 上达到 77.9%,领先 GPT-6 Astra 和 Claude Opus 5.5 近 4 个百分点;但在 FrontierSWE v2 和终端操作基准 Terminal-Bench 4.0 上均处于垫底水平。第三方盲评平台 Arena.ai 的结果也印证了这一特点:Gemini 4 在 Text Arena 排名第一,但在偏重工程能力的 Code Arena: WebDev 和 Agent Arena 中仅列第 8。

另一亮点是幻觉率大幅下降。据 Artificial Analysis 测试,Gemini 4 的幻觉率仅 15%,为所有前沿模型中最低,意味着模型在面对不确定问题时更倾向于承认不知道而非编造答案。

定价方面,官方 API 价格为每百万 token 输入 2 美元、输出 10 美元,缓存命中价格 0.1 美元。官方表示首发优惠期结束后价格将翻倍,但从以往经验看,优惠期大概率会持续到下一代模型发布之前。