刚刚,Claude Fable 5.1 震撼登场!
Anthropic 发布 Claude Fable 5.1(全平台人人可用)与白名单版 Mythos 5.1:科研探索跑分翻倍至 52.6%、缓存读取降价 75%、手写 GPU Kernel 让生信模型提速 2.5 倍、成本直降 55%。

刚刚,Claude Fable 5.1 震撼登场!
一觉醒来,Anthropic 再次重构了机器智能的战力坐标系!
今天,Claude Fable 5.1 正式全平台上线,人人可用;
而战力完全释放的顶配版 Mythos 5.1,则暂时锁定在白名单内,专供受审核的网络安全与生命科学顶尖科研团队调遣。
▲ 图 1:Anthropic 官方正式发布新一代模型 Claude Fable 5.1
▲ 图 2:Fable 5.1 与专攻高维科研的 Mythos 5.1 构成双旗舰阵容
从重构极端复杂的工程代码仓库,到攻坚跨越数周的长链路科研探索,这对"孪生大脑"正在重新定义顶级**「赛博脑力劳动者」**的标准。
它们最擅长的,就是啃下过去人类专家都感到棘手的高维度、长链路复杂任务。
跑分断层式领跑:代差级战力跃迁
老规矩,先看硬核成绩单。这一次,新模型直接把跑分拉出了断代式的差距:
▲ 图 3:Claude Fable 5.1 与竞品在科研、代码及综合认知基准上的断层领先
核心评测成绩一览
| 评测维度 / 基准测试 | 前代 Fable 5 | OpenAI GPT-5.6 Sol | Claude Fable 5.1 | Mythos 5.1(白名单) |
|---|---|---|---|---|
| 科研探索 (Terminal-Bench-Science 0.1) | 24.7% | 22.4% | 52.6%(超2倍提升) | — |
| 代码工程 (Terminal-Bench 4.0) | 42.0% | — | 55.8% | 60.9%(断层领跑) |
| 知识工作 (GDPval-AA) | — | — | 1853 分(新纪录) | — |
| 高难综合考试 (带工具实测) | — | — | 突破 65.0% 门槛 | — |
更令人惊叹的是:哪怕将**「思考程度(Thinking Effort)」调至最低**,它依然能以极低的 Token 消耗跑出碾压上一代的效果。
| 极低思考消耗下的能力展现 | 长链路推理与代码优化表现 |
|---|---|
<br>▲ 图 4:低 Token 消耗下的高效推理表现 |
<br>▲ 图 5:不同思考深度下的性能基准 |
<br>▲ 图 6:复杂任务响应速度与准确率分布 |
<br>▲ 图 7:多模态与长上下文效率曲线 |
算力降本:缓存读取暴降 75%
在能力实现大跃迁的同时,Anthropic 顺手把算力使用成本砸穿了底线:
价格与成本对比表
| 计费项目 / 模型 | Claude Fable 5.1 | OpenAI GPT-5.6 Sol (促销价) | 成本优化幅度 |
|---|---|---|---|
| 输入 Token | $10 / 百万 Token | $2 / 百万 Token | 维持前代基础价 |
| 输出 Token | $50 / 百万 Token | $10 / 百万 Token | 维持前代基础价 |
| 缓存读取 (Cache Read) | $0.25 / 百万 Token | $0.20 / 百万 Token | 直接降价 75% (原价 $1.00) |
| Agent 长任务综合成本 | 最高降低 45% | — | 极大幅度降低多轮 Agent 预算 |
▲ 图 8:官方给出的最新 API 定价标准与缓存折扣明细
▲ 图 9:长上下文与 Agent 重复调用任务下,总开销显著下降达 45%
跑分与降价只是前菜。
真正的分水岭在于:从这一代开始,AI 彻底蜕去了"辅助打工仔"的外衣——它开始亲自下场做科研了!
▲ 图 10:Anthropic 展示模型攻入前沿科研核心腹地
攻入科研腹地:重绘金星、手搓 GPU Kernel
Anthropic 直接拿出了三个颠覆认知的前沿真实案例:
案例 1:AI 独立重绘三分之一"金星高精地形"
30 年前,NASA 麦哲伦号探测器采集的金星雷达高程数据分辨率仅为 10–20 公里(相当于地球上一座城市只占几个像素),人类耗时数十年也只完成了 1/5 区域的绘制。
Fable 5.1 独自使用这批原始雷达数据训练了神经网络,全新重构出覆盖金星约 1/3 面积的高精度地形图,将分辨率推进到 2–3 公里,高度估计精度最高提升 25%!
▲ 图 11:Fable 5.1 神经网络重建的金星高分辨率三维地形模型
▲ 图 12:从原始低清雷达到高分辨率拓扑地貌的神经渲染过程
案例 2:分子与蛋白设计,真实湿实验命中率飙至 50%
在药物研发中,设计能够精准结合靶点的特定蛋白难度极高,目前生物学界的常态命中率通常仅有 10% ~ 15%。
Mythos 5.1 调用开源设计工具给出的蛋白质设计稿,被直接送往真实实验室进行了湿实验验证:
- 在 EGFR、Nipah G 等 3 个靶点上,结合亲和力直接达到 Adaptyv Bio 竞赛冠军方案的 10 倍!
- 在 12 个靶点上的总体设计命中率逼近 50%,将行业研发效率推升至全新量级。
▲ 图 13:Mythos 5.1 设计的高亲和力蛋白质与靶点精准对接模拟
案例 3:手写 GPU Kernel,生信模型提速 2.5 倍,账单狂降 55%
全基因组分析需要运行海量突变推理,优化此类专有深度学习模型底层算子(GPU Kernel)向来需要顶尖性能工程师数周的手工打磨。
Mythos 5.1 仅凭公开源代码,几天之内便完成了任务:
- 一口气为 7 个主流开源蛋白质与基因组学模型手写了底层 GPU Kernel;
- 推理速度最高提升 2.5 倍,且输出结果与原版绝对无损一致;
- 单项扫 300 万个基因突变的分析成本,直接从 1.8 万美元砍到了 8000 美元!
| 七大模型推理加速比 | 优化前后 GPU 算力成本对比 |
|---|---|
<br>▲ 图 14:7 个生物学模型在 NVIDIA H100 上的推理加速比 |
<br>▲ 图 15:Kernel 优化前后的预估 GPU 费用对比 |
▲ 图 16:Kernel 优化对各算子耗时与吞吐量的深层影响
全球最强编程 AI:长程稳定性闭环
Fable 5.1 搞定复杂科研的底座,在于其极具韧性的工程代码逻辑。
面对耗时数小时、调用几十种工具的长程 Agent 任务,Fable 5.1 构建了一条稳固的自愈式闭环:
读取代码仓库 → 任务精准拆解 → 执行代码修改 → 运行测试套件 → 自检报错根因 → 启动下一轮迭代
▲ 图 17:真实 IDE 测试(CursorBench 3.2 达 73.4%)与商业流(AutomationBench 达 31.4%)双破纪录
实战案例: 它甚至帮助华尔街顶级对冲基金 Millennium 解决了潜伏长达 4~5 年的历史级 Bug!面对"百万次仅偶现一次"的幽灵崩溃,它一路向外追踪并反汇编了底层第三方库,直接将深埋底层的病根彻底拔除。
| 长链路排障逻辑展示 1 | 长链路排障逻辑展示 2 |
|---|---|
<br>▲ 图 18:面对复杂依赖项的反汇编追踪过程 |
<br>▲ 图 19:长周期任务中杜绝"隐患捷径"的自检机制 |
社区第一波硬核实测:从渲染到代码生成
▲ 图 20:Fable 5.1 登顶 AAAI 相关技术榜单
1. 复杂场景 3D 渲染对比(vs GPT-5.6 Sol)
在相同 Prompt 的一次性生成盲测中:
- Fable 5.1(花费 $5.69):极度追求写实细节,海浪物理效果、景深过渡、沙环质感均有电影级质感;
- GPT-5.6 Sol(花费 $0.88):偏向简洁风格,在多场景切换时保持了高度的风格一致性。
▲ 视频 1:Fable 5.1 与竞品在海岸物理渲染细节上的实机对比演示
2. 看图建模:从一张空地照片到"电影级豪宅导览"
Anthropic 研究员 Alex Albert 输入了一张空置地皮照片,Fable 5.1 自主完成了建筑设计、室内软装、光影渲染,并实时输出了第一人称漫游导览视频:
▲ 视频 2:输入地皮实景,模型自主生成的完整 3D 豪宅漫游动效
3. 前端交互与游戏手搓
- 手搓交互式人脑神经传导模型:完整还原大脑皮层沟回,动态可视化"递一下盐"指令在神经元网络中的电信号传递。
- 全自主生成 ARC 生存类游戏:逻辑、物理碰撞、UI 界面一次性跑通交付。
| 交互式 3D 人脑神经网络模型 | ARC 游戏端到端生成 |
|---|---|
<br>▲ 图 21:用代码构建的动态脑电传导模型 |
<br>▲ 图 22:Fable 5.1 端到端独立编写的 ARC 风格游戏 |
▲ 图 23:生成的游戏逻辑架构与 Canvas 渲染源码
安全机制"一松一紧":放开漏洞审查,彻底封死"模型蒸馏"
Anthropic 在安全策略上采取了极具辨识度的调整:
▲ 图 24:网络安全审查策略调整与误报率降低数据
▲ 图 25:底层 API 防思维链蒸馏校验机制示意
- "松"——告别神经质误报:
放宽了代码审查权限,程序员拿它扫描代码库安全隐患时,误报率骤降 60%。(但仍严禁生成攻击型利用脚本,渗透测试需走更高权限模型)。 - "紧"——API 级反蒸馏重锁:
为防止通过篡改多轮对话上下文套取 Claude 的「思维链(CoT)」进行下游小模型蒸馏,API 层加入了强一致性校验:
一旦提交的 Prompt 与生成思维块时不匹配,API 将直接拦截报错或完全抽离思维块! 该锁目前已对 8 月 31 日后新注册 API 账号生效,未来将覆盖全员。
结语
硅谷顶尖学者曾提出过一个宏大愿景:AI 最大的价值,是将原本需要几十年的生物医药与基础科学进程,压缩到短短几年内。
从绘制金星地貌,到实验室里试管级别的蛋白高命中率突破,这对孪生大脑正在将预言化为现实。
科学探索的门槛正在以肉眼可见的速度塌缩。只是别忘了:那只向人类递出火种的手,也在同一时刻,悄悄用「反蒸馏锁」抽走了身后的梯子。
🔗 Claude 国内高速体验通道:
👉 https://claude-opus.top/
⭐ 点赞、转发、在看,一键三连 ⭐
<br>▲ 图 4:低 Token 消耗下的高效推理表现
<br>▲ 图 5:不同思考深度下的性能基准
<br>▲ 图 6:复杂任务响应速度与准确率分布
<br>▲ 图 7:多模态与长上下文效率曲线
<br>▲ 图 14:7 个生物学模型在 NVIDIA H100 上的推理加速比
<br>▲ 图 15:Kernel 优化前后的预估 GPU 费用对比
<br>▲ 图 18:面对复杂依赖项的反汇编追踪过程
<br>▲ 图 19:长周期任务中杜绝"隐患捷径"的自检机制
<br>▲ 图 21:用代码构建的动态脑电传导模型
<br>▲ 图 22:Fable 5.1 端到端独立编写的 ARC 风格游戏