谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5
谷歌发布 Gemini 3.8 Flash:DeepSWE 代码基准 74% 与 Claude Opus 5 并列全球第一,单题成本仅其 1/5,首发半价 $0.75/$3.75。附跑分对比、短板分析与社区实测反馈。

Gemini 国内快速体验途径: 🔗 https://tryallapi.com/ | https://trygpt.asia/list/#/home
谷歌杀疯了!Gemini 3.8 Flash 突袭发布:代码打平 Opus 5,成本仅需 1/5
刚刚,谷歌正式发布了全新的轻量级旗舰模型 —— Gemini 3.8 Flash!
不仅性能迎来质的飞跃,定价策略也诚意满满:当前价格暂时保持不变,且享受首发半价优惠政策。
📊 价格对比一览
| 阶段 / 时间节点 | 每百万 Token 输入价格 (Input) | 每百万 Token 输出价格 (Output) | 状态 |
|---|---|---|---|
| 首发限时优惠(当前) | $0.75 美元 | $3.75 美元 | 现已上线 |
| 2027 年起(恢复原价) | $1.50 美元 | $7.50 美元 | 预计恢复 |
▲ 图 1:Google 官方控制台中已支持选择 Gemini 3.8 Flash 系列模型
一、疯狂的"两周一更",宛如科技春晚
不得不惊叹谷歌近期的研发与发布节奏 —— 这是谷歌在短短 6 周内发布的第 3 个 Flash 系列模型:
- 📅 7月21日:Gemini 3.6 Flash
- 📅 8月13日:Gemini 3.7 Flash
- 📅 今天:Gemini 3.8 Flash
平均两周迭代一代模型,这种推进速度属实让整个 AI 界感受到了前所未有的压力。
▲ 图 2:谷歌 CEO Sundar Pichai 亲自发文宣布 Gemini 3.8 Flash 上线
二、跑分不讲武德:Flash 小模型直接叫板各家顶级旗舰
玩笑归玩笑,这次官方评测对比的参照物直接拉满 —— 对手不再是同级别的小模型,而是直接对标 Claude Opus 5 与 GPT-5.6 Sol 这两家头部厂商的顶配超大旗舰。
▲ 图 3:Gemini 3.8 Flash 与 GPT-5.6 Sol、Claude Opus 5 的全方位跑分对比
1. 编程能力:直接打平 Claude Opus 5
单论代码生成与解决真实工程问题的能力,Gemini 3.8 Flash 与 Claude Opus 5 几乎战平:
- DeepSWE:73.7% vs 74.0%
- Terminal-bench 2.1:89.4% vs 89.1%
在由知名数据公司 Datacurve 构建的第三方编程基准 DeepSWE(涵盖 91 个真实开源仓库的 113 道硬核代码修补任务,要求模型自主读代码、改代码并跑通测试)上,Gemini 3.8 Flash 与 Opus 5 的通过率均为 74%,并列全球第一。
▲ 图 4:第三方机构 Datacurve 的 DeepSWE 代码基准测试榜单
2. 性价比拉满:性能打平,成本仅为旗舰的 1/5
虽然得分同为 74%,但两者的开销完全不在一个量级:
| 评估模型 | DeepSWE 任务通过率 | 平均单题消耗成本 | 综合成本倍数 |
|---|---|---|---|
| Gemini 3.8 Flash | 74% | $2.36 美元 | 基准 (1x) |
| Claude Opus 5 | 74% | $11.84 美元 | 贵 5 倍 (5x) |
在 Datacurve 绘制的"得分-成本"性价比象限图(越靠右上代表越高效)中,Gemini 3.8 Flash 直接独霸右上角最顶端,被官方直接标注为 Most Efficient(全场最高效)。哪怕是主打极致性价比的 GLM-5.3,也被牢牢压在效率线之下。
▲ 图 5:各大主流模型在 DeepSWE 榜单上的性价比象限图(右上角代表最极致的性价比)
短短 4 个月,谷歌把自家的 Flash 从 3.5 时代的 35% 通过率一路狂飙到 3.8 的 74%,在追平顶级旗舰的同时,单题调用成本几乎没变。
3. 垂直 Agent 能力甚至反超
除了通用代码基准,在针对垂直领域的 金融 Agent(Finance Agent) 和 法律 Agent(Legal Agent) 两项专业测试中,Gemini 3.8 Flash 甚至反超了同台竞技的旗舰大模型。
▲ 图 6:Gemini 3.8 Flash 在金融与法律垂直领域 Agent 评测中的领先表现
三、冷静客观:Flash 依然存在哪些短板?
尽管 Gemini 3.8 Flash 在代码与垂直任务上表现亮眼,但它依然不是全能无敌的"六边形战士":
▲ 图 7:Terminal-bench 多版本跑分及细分能力对比
1. 超长程复杂任务耐力不足
在评估长流程、多步骤复合任务能力的 Terminal-bench 4.0 榜单上:
- Claude Opus 5:得分 51.8%
- Gemini 3.8 Flash:仅有 19.1%
面对极度复杂的连续长任务时,Flash 模型的深度推理与长程规划能力仍与顶级旗舰有明显断层。
▲ 图 8:技术社区关于 Terminal-bench 4.0 长程任务表现差距的讨论
2. 综合泛化智力仍属第二梯队
在权威评测机构 Artificial Analysis 的模型综合智力榜单上:
- Gemini 3.8 Flash 综合得分 59 分,位列第 8;
- 整体与 Kimi K3、GLM-5.3 处于同一档位,略低于 GPT-5.6 Sol(差 2 分)。
▲ 图 9:Artificial Analysis 全球大模型综合智力排行榜
四、技术解密:不换底座的"后训练魔法"
综合排名第八,单项代码却能干到全球前二,谷歌是怎么做到的?
查阅官方 Model Card(模型卡) 发现:
- Gemini 3.8 Flash 是在 3.7 Flash 的基础上继续训练出来的,底座完全没换。
- 进一步追溯,3.6 和 3.7 同样基于同一个底座。
- 历代模型卡的知识截止日期一直停留在 2025 年 1 月,说明谷歌在此期间并未进行大规模重新预训练。
这三代 Flash 的飞跃,完全是依赖后训练(Post-training)技术极限压榨出来的成果。谷歌在 3.8 这一代将后训练算力与策略大幅向代码能力倾斜,最终实现了单点突破的奇迹。
五、实测反馈:用户用起来到底怎么样?
近两日 3.8 Flash 已开启多轮灰度测试,社区和内部用户的反馈呈现出非常鲜明的两极特点:
▲ 图 10:Gemini 3.8 Flash 模型身份确认与即时问答效果
👍 好评点:极致的速度与极高的听话度
- 响应极其迅捷:生成小游戏、小组件等即时任务行云流水。
- 严格遵循指令:不会"自作主张",完全按照用户的 Prompt 要求执行,极度听话。
▲ 图 11:用户使用 Gemini 3.8 Flash 提示词一键生成的"鸭子骑行"互动小游戏
▲ 图 12:社区用户称赞其"速度飞快且指令遵循能力极强"
⚠️ 争议点:Token 消耗翻倍,"拿思考时间换质量"
- 许多开发者反馈:代码一复杂、流程一拉长,Flash "交付虽快但容易留 Bug" 的老毛病偶有复发。
- 思维链(CoT)显著变长:同一套评测任务中,3.7 Flash (High 档) 消耗约 6400 万 Token,而 3.8 Flash 消耗达到了 1.2 亿 Token,几乎翻倍。
▲ 图 13:部分开发者对其复杂工程场景下稳定性的讨论
▲ 图 14:关于深度推理档位与长思维链 Token 消耗的对比探讨
对于 Token 消耗增加这一点,谷歌官方在迁移指南中也很坦诚地建议:如果应用场景对算力效率和 Token 消耗极度敏感,可以适当调低推理档位,或继续选择使用 3.7 Flash。
六、结语:说好的 Gemini 3.5 Pro 呢?
看到 Flash 这么猛,大家最关心的还是:跳票许久的 Gemini Pro 旗舰到底何时来?
答案是:可能不叫 3.5 Pro 了。 从 5 月一路鸽到 9 月,谷歌很可能将下一代旗舰 Pro 直接更名为 Gemini 4 推出。
在正统旗舰 Pro 还在闭关打磨的空档期,谷歌直接派出了"先锋小弟" Flash 上阵冲锋,甚至一度打平了友商的旗舰。
回顾 7 月 Gemini 3.6 发布时评论区的冷嘲热讽,再看今天 3.8 Flash 的强悍表现,只想说一句:
Google,那个强大的搜索与 AI 巨人,真的杀回来了!
▲ 图 15:Google Gemini 进化之路
Gemini 国内快速体验途径: 🔗 https://tryallapi.com/ | https://trygpt.asia/list/#/home