Back to blog

谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5

谷歌发布 Gemini 3.8 Flash:DeepSWE 代码基准 74% 与 Claude Opus 5 并列全球第一,单题成本仅其 1/5,首发半价 $0.75/$3.75。附跑分对比、短板分析与社区实测反馈。

Sep 3, 2026Maynor
谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5

Gemini 国内快速体验途径: 🔗 https://tryallapi.com/https://trygpt.asia/list/#/home


谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5

刚刚,谷歌正式发布了全新的轻量级旗舰模型 —— Gemini 3.8 Flash

不仅性能迎来质的飞跃,定价策略也诚意满满:当前价格暂时保持不变,且享受首发半价优惠政策。

📊 价格对比一览

阶段 / 时间节点 每百万 Token 输入价格 (Input) 每百万 Token 输出价格 (Output) 状态
首发限时优惠(当前) $0.75 美元 $3.75 美元 现已上线
2027 年起(恢复原价) $1.50 美元 $7.50 美元 预计恢复

Gemini 3.8 Flash 模型选择界面 ▲ 图 1:Google 官方控制台中已支持选择 Gemini 3.8 Flash 系列模型


一、疯狂的"两周一更",宛如科技春晚

不得不惊叹谷歌近期的研发与发布节奏 —— 这是谷歌在短短 6 周内发布的第 3 个 Flash 系列模型

  • 📅 7月21日:Gemini 3.6 Flash
  • 📅 8月13日:Gemini 3.7 Flash
  • 📅 今天:Gemini 3.8 Flash

平均两周迭代一代模型,这种推进速度属实让整个 AI 界感受到了前所未有的压力。

Sundar Pichai 发布 Gemini 3.8 Flash 的消息 ▲ 图 2:谷歌 CEO Sundar Pichai 亲自发文宣布 Gemini 3.8 Flash 上线


二、跑分不讲武德:Flash 小模型直接叫板各家顶级旗舰

玩笑归玩笑,这次官方评测对比的参照物直接拉满 —— 对手不再是同级别的小模型,而是直接对标 Claude Opus 5GPT-5.6 Sol 这两家头部厂商的顶配超大旗舰

Gemini 3.8 Flash 与主流模型跑分对比 ▲ 图 3:Gemini 3.8 Flash 与 GPT-5.6 Sol、Claude Opus 5 的全方位跑分对比

1. 编程能力:直接打平 Claude Opus 5

单论代码生成与解决真实工程问题的能力,Gemini 3.8 Flash 与 Claude Opus 5 几乎战平:

  • DeepSWE73.7% vs 74.0%
  • Terminal-bench 2.189.4% vs 89.1%

在由知名数据公司 Datacurve 构建的第三方编程基准 DeepSWE(涵盖 91 个真实开源仓库的 113 道硬核代码修补任务,要求模型自主读代码、改代码并跑通测试)上,Gemini 3.8 Flash 与 Opus 5 的通过率均为 74%,并列全球第一

DeepSWE 编程榜单与成本对比 ▲ 图 4:第三方机构 Datacurve 的 DeepSWE 代码基准测试榜单


2. 性价比拉满:性能打平,成本仅为旗舰的 1/5

虽然得分同为 74%,但两者的开销完全不在一个量级:

评估模型 DeepSWE 任务通过率 平均单题消耗成本 综合成本倍数
Gemini 3.8 Flash 74% $2.36 美元 基准 (1x)
Claude Opus 5 74% $11.84 美元 贵 5 倍 (5x)

在 Datacurve 绘制的"得分-成本"性价比象限图(越靠右上代表越高效)中,Gemini 3.8 Flash 直接独霸右上角最顶端,被官方直接标注为 Most Efficient(全场最高效)。哪怕是主打极致性价比的 GLM-5.3,也被牢牢压在效率线之下。

DeepSWE 得分与单题成本性价比图 ▲ 图 5:各大主流模型在 DeepSWE 榜单上的性价比象限图(右上角代表最极致的性价比)

短短 4 个月,谷歌把自家的 Flash 从 3.5 时代的 35% 通过率一路狂飙到 3.8 的 74%,在追平顶级旗舰的同时,单题调用成本几乎没变


3. 垂直 Agent 能力甚至反超

除了通用代码基准,在针对垂直领域的 金融 Agent(Finance Agent)法律 Agent(Legal Agent) 两项专业测试中,Gemini 3.8 Flash 甚至反超了同台竞技的旗舰大模型。

Gemini 3.8 Flash 金融与法律 Agent 跑分 ▲ 图 6:Gemini 3.8 Flash 在金融与法律垂直领域 Agent 评测中的领先表现


三、冷静客观:Flash 依然存在哪些短板?

尽管 Gemini 3.8 Flash 在代码与垂直任务上表现亮眼,但它依然不是全能无敌的"六边形战士":

Gemini 3.8 Flash Terminal-bench 成绩对比 ▲ 图 7:Terminal-bench 多版本跑分及细分能力对比

1. 超长程复杂任务耐力不足

在评估长流程、多步骤复合任务能力的 Terminal-bench 4.0 榜单上:

  • Claude Opus 5:得分 51.8%
  • Gemini 3.8 Flash:仅有 19.1%

面对极度复杂的连续长任务时,Flash 模型的深度推理与长程规划能力仍与顶级旗舰有明显断层。

关于 Terminal-bench 4.0 差距的评论 ▲ 图 8:技术社区关于 Terminal-bench 4.0 长程任务表现差距的讨论

2. 综合泛化智力仍属第二梯队

在权威评测机构 Artificial Analysis 的模型综合智力榜单上:

  • Gemini 3.8 Flash 综合得分 59 分,位列第 8
  • 整体与 Kimi K3GLM-5.3 处于同一档位,略低于 GPT-5.6 Sol(差 2 分)。

Artificial Analysis 模型智力榜单 ▲ 图 9:Artificial Analysis 全球大模型综合智力排行榜


四、技术解密:不换底座的"后训练魔法"

综合排名第八,单项代码却能干到全球前二,谷歌是怎么做到的?

查阅官方 Model Card(模型卡) 发现:

  • Gemini 3.8 Flash 是在 3.7 Flash 的基础上继续训练出来的,底座完全没换。
  • 进一步追溯,3.6 和 3.7 同样基于同一个底座。
  • 历代模型卡的知识截止日期一直停留在 2025 年 1 月,说明谷歌在此期间并未进行大规模重新预训练。

这三代 Flash 的飞跃,完全是依赖后训练(Post-training)技术极限压榨出来的成果。谷歌在 3.8 这一代将后训练算力与策略大幅向代码能力倾斜,最终实现了单点突破的奇迹。


五、实测反馈:用户用起来到底怎么样?

近两日 3.8 Flash 已开启多轮灰度测试,社区和内部用户的反馈呈现出非常鲜明的两极特点:

Gemini 3.8 Flash 模型身份回答 ▲ 图 10:Gemini 3.8 Flash 模型身份确认与即时问答效果

👍 好评点:极致的速度与极高的听话度

  • 响应极其迅捷:生成小游戏、小组件等即时任务行云流水。
  • 严格遵循指令:不会"自作主张",完全按照用户的 Prompt 要求执行,极度听话。

Gemini 3.8 Flash 生成的鸭子骑行游戏 ▲ 图 11:用户使用 Gemini 3.8 Flash 提示词一键生成的"鸭子骑行"互动小游戏

用户对 Gemini 3.8 Flash 听话与速度的评价 ▲ 图 12:社区用户称赞其"速度飞快且指令遵循能力极强"


⚠️ 争议点:Token 消耗翻倍,"拿思考时间换质量"

  • 许多开发者反馈:代码一复杂、流程一拉长,Flash "交付虽快但容易留 Bug" 的老毛病偶有复发。
  • 思维链(CoT)显著变长:同一套评测任务中,3.7 Flash (High 档) 消耗约 6400 万 Token,而 3.8 Flash 消耗达到了 1.2 亿 Token,几乎翻倍

用户对 Gemini 3.8 Flash 编程表现的评价 ▲ 图 13:部分开发者对其复杂工程场景下稳定性的讨论

用户对 Opus 5 不同推理档位的评价 ▲ 图 14:关于深度推理档位与长思维链 Token 消耗的对比探讨

对于 Token 消耗增加这一点,谷歌官方在迁移指南中也很坦诚地建议:如果应用场景对算力效率和 Token 消耗极度敏感,可以适当调低推理档位,或继续选择使用 3.7 Flash


六、结语:说好的 Gemini 3.5 Pro 呢?

看到 Flash 这么猛,大家最关心的还是:跳票许久的 Gemini Pro 旗舰到底何时来?

答案是:可能不叫 3.5 Pro 了。 从 5 月一路鸽到 9 月,谷歌很可能将下一代旗舰 Pro 直接更名为 Gemini 4 推出。

在正统旗舰 Pro 还在闭关打磨的空档期,谷歌直接派出了"先锋小弟" Flash 上阵冲锋,甚至一度打平了友商的旗舰。

回顾 7 月 Gemini 3.6 发布时评论区的冷嘲热讽,再看今天 3.8 Flash 的强悍表现,只想说一句:

Google,那个强大的搜索与 AI 巨人,真的杀回来了!

文章结束图 ▲ 图 15:Google Gemini 进化之路


Gemini 国内快速体验途径: 🔗 https://tryallapi.com/https://trygpt.asia/list/#/home