返回博客

刚刚,Claude Fable 5.1 震撼登场!

Anthropic 发布 Claude Fable 5.1(全平台人人可用)与白名单版 Mythos 5.1:科研探索跑分翻倍至 52.6%、缓存读取降价 75%、手写 GPU Kernel 让生信模型提速 2.5 倍、成本直降 55%。

2026年9月3日Maynor
刚刚,Claude Fable 5.1 震撼登场!

刚刚,Claude Fable 5.1 震撼登场!

一觉醒来,Anthropic 再次重构了机器智能的战力坐标系!

今天,Claude Fable 5.1 正式全平台上线,人人可用
而战力完全释放的顶配版 Mythos 5.1,则暂时锁定在白名单内,专供受审核的网络安全与生命科学顶尖科研团队调遣。

Claude Fable 5.1 全面上线 ▲ 图 1:Anthropic 官方正式发布新一代模型 Claude Fable 5.1

▲ 图 2:Fable 5.1 与专攻高维科研的 Mythos 5.1 构成双旗舰阵容

从重构极端复杂的工程代码仓库,到攻坚跨越数周的长链路科研探索,这对"孪生大脑"正在重新定义顶级**「赛博脑力劳动者」**的标准。

它们最擅长的,就是啃下过去人类专家都感到棘手的高维度、长链路复杂任务。


跑分断层式领跑:代差级战力跃迁

老规矩,先看硬核成绩单。这一次,新模型直接把跑分拉出了断代式的差距

各项基准测试跑分对比 ▲ 图 3:Claude Fable 5.1 与竞品在科研、代码及综合认知基准上的断层领先

核心评测成绩一览

评测维度 / 基准测试 前代 Fable 5 OpenAI GPT-5.6 Sol Claude Fable 5.1 Mythos 5.1(白名单)
科研探索 (Terminal-Bench-Science 0.1) 24.7% 22.4% 52.6%(超2倍提升)
代码工程 (Terminal-Bench 4.0) 42.0% 55.8% 60.9%(断层领跑)
知识工作 (GDPval-AA) 1853 分(新纪录)
高难综合考试 (带工具实测) 突破 65.0% 门槛

更令人惊叹的是:哪怕将**「思考程度(Thinking Effort)」调至最低**,它依然能以极低的 Token 消耗跑出碾压上一代的效果。

极低思考消耗下的能力展现 长链路推理与代码优化表现
思考程度调节实测 1<br>▲ 图 4:低 Token 消耗下的高效推理表现 思考程度调节实测 2<br>▲ 图 5:不同思考深度下的性能基准
思考程度调节实测 3<br>▲ 图 6:复杂任务响应速度与准确率分布 思考程度调节实测 4<br>▲ 图 7:多模态与长上下文效率曲线

算力降本:缓存读取暴降 75%

在能力实现大跃迁的同时,Anthropic 顺手把算力使用成本砸穿了底线

价格与成本对比表

计费项目 / 模型 Claude Fable 5.1 OpenAI GPT-5.6 Sol (促销价) 成本优化幅度
输入 Token $10 / 百万 Token $2 / 百万 Token 维持前代基础价
输出 Token $50 / 百万 Token $10 / 百万 Token 维持前代基础价
缓存读取 (Cache Read) $0.25 / 百万 Token $0.20 / 百万 Token 直接降价 75% (原价 $1.00)
Agent 长任务综合成本 最高降低 45% 极大幅度降低多轮 Agent 预算

API 定价与缓存优化详情 ▲ 图 8:官方给出的最新 API 定价标准与缓存折扣明细

长任务成本测算曲线 ▲ 图 9:长上下文与 Agent 重复调用任务下,总开销显著下降达 45%

跑分与降价只是前菜。
真正的分水岭在于:从这一代开始,AI 彻底蜕去了"辅助打工仔"的外衣——它开始亲自下场做科研了!

AI攻入真实科研场景 ▲ 图 10:Anthropic 展示模型攻入前沿科研核心腹地


攻入科研腹地:重绘金星、手搓 GPU Kernel

Anthropic 直接拿出了三个颠覆认知的前沿真实案例:

案例 1:AI 独立重绘三分之一"金星高精地形"

30 年前,NASA 麦哲伦号探测器采集的金星雷达高程数据分辨率仅为 10–20 公里(相当于地球上一座城市只占几个像素),人类耗时数十年也只完成了 1/5 区域的绘制。

Fable 5.1 独自使用这批原始雷达数据训练了神经网络,全新重构出覆盖金星约 1/3 面积的高精度地形图,将分辨率推进到 2–3 公里,高度估计精度最高提升 25%

金星高精地形重绘对比 ▲ 图 11:Fable 5.1 神经网络重建的金星高分辨率三维地形模型

▲ 图 12:从原始低清雷达到高分辨率拓扑地貌的神经渲染过程


案例 2:分子与蛋白设计,真实湿实验命中率飙至 50%

在药物研发中,设计能够精准结合靶点的特定蛋白难度极高,目前生物学界的常态命中率通常仅有 10% ~ 15%

Mythos 5.1 调用开源设计工具给出的蛋白质设计稿,被直接送往真实实验室进行了湿实验验证

  • 在 EGFR、Nipah G 等 3 个靶点上,结合亲和力直接达到 Adaptyv Bio 竞赛冠军方案的 10 倍
  • 在 12 个靶点上的总体设计命中率逼近 50%,将行业研发效率推升至全新量级。

蛋白质靶向结合设计动图 ▲ 图 13:Mythos 5.1 设计的高亲和力蛋白质与靶点精准对接模拟


案例 3:手写 GPU Kernel,生信模型提速 2.5 倍,账单狂降 55%

全基因组分析需要运行海量突变推理,优化此类专有深度学习模型底层算子(GPU Kernel)向来需要顶尖性能工程师数周的手工打磨。

Mythos 5.1 仅凭公开源代码,几天之内便完成了任务:

  • 一口气为 7 个主流开源蛋白质与基因组学模型手写了底层 GPU Kernel
  • 推理速度最高提升 2.5 倍,且输出结果与原版绝对无损一致;
  • 单项扫 300 万个基因突变的分析成本,直接从 1.8 万美元砍到了 8000 美元
七大模型推理加速比 优化前后 GPU 算力成本对比
七大模型加速比<br>▲ 图 14:7 个生物学模型在 NVIDIA H100 上的推理加速比 GPU成本对比<br>▲ 图 15:Kernel 优化前后的预估 GPU 费用对比

GPU Kernel 性能测试完整图表 ▲ 图 16:Kernel 优化对各算子耗时与吞吐量的深层影响


全球最强编程 AI:长程稳定性闭环

Fable 5.1 搞定复杂科研的底座,在于其极具韧性的工程代码逻辑

面对耗时数小时、调用几十种工具的长程 Agent 任务,Fable 5.1 构建了一条稳固的自愈式闭环

读取代码仓库 → 任务精准拆解 → 执行代码修改 → 运行测试套件 → 自检报错根因 → 启动下一轮迭代

代码能力基准对比 ▲ 图 17:真实 IDE 测试(CursorBench 3.2 达 73.4%)与商业流(AutomationBench 达 31.4%)双破纪录

实战案例: 它甚至帮助华尔街顶级对冲基金 Millennium 解决了潜伏长达 4~5 年的历史级 Bug!面对"百万次仅偶现一次"的幽灵崩溃,它一路向外追踪并反汇编了底层第三方库,直接将深埋底层的病根彻底拔除。

长链路排障逻辑展示 1 长链路排障逻辑展示 2
长程Agent逻辑 1<br>▲ 图 18:面对复杂依赖项的反汇编追踪过程 长程Agent逻辑 2<br>▲ 图 19:长周期任务中杜绝"隐患捷径"的自检机制

社区第一波硬核实测:从渲染到代码生成

Fable 5.1 登顶 AAAI ▲ 图 20:Fable 5.1 登顶 AAAI 相关技术榜单

1. 复杂场景 3D 渲染对比(vs GPT-5.6 Sol)

在相同 Prompt 的一次性生成盲测中:

  • Fable 5.1(花费 $5.69):极度追求写实细节,海浪物理效果、景深过渡、沙环质感均有电影级质感;
  • GPT-5.6 Sol(花费 $0.88):偏向简洁风格,在多场景切换时保持了高度的风格一致性。

视频 1:海岛与浪花实时渲染对比 ▲ 视频 1:Fable 5.1 与竞品在海岸物理渲染细节上的实机对比演示


2. 看图建模:从一张空地照片到"电影级豪宅导览"

Anthropic 研究员 Alex Albert 输入了一张空置地皮照片,Fable 5.1 自主完成了建筑设计、室内软装、光影渲染,并实时输出了第一人称漫游导览视频

视频 2:建筑设计与漫游视频生成 ▲ 视频 2:输入地皮实景,模型自主生成的完整 3D 豪宅漫游动效


3. 前端交互与游戏手搓

  • 手搓交互式人脑神经传导模型:完整还原大脑皮层沟回,动态可视化"递一下盐"指令在神经元网络中的电信号传递。
  • 全自主生成 ARC 生存类游戏:逻辑、物理碰撞、UI 界面一次性跑通交付。
交互式 3D 人脑神经网络模型 ARC 游戏端到端生成
交互式 3D 人脑神经传导模型<br>▲ 图 21:用代码构建的动态脑电传导模型 ARC 风格游戏端到端生成<br>▲ 图 22:Fable 5.1 端到端独立编写的 ARC 风格游戏

代码生成细节截图 ▲ 图 23:生成的游戏逻辑架构与 Canvas 渲染源码


安全机制"一松一紧":放开漏洞审查,彻底封死"模型蒸馏"

Anthropic 在安全策略上采取了极具辨识度的调整:

安全与合规新机制说明 1 ▲ 图 24:网络安全审查策略调整与误报率降低数据

安全与合规新机制说明 2 ▲ 图 25:底层 API 防思维链蒸馏校验机制示意

  1. "松"——告别神经质误报
    放宽了代码审查权限,程序员拿它扫描代码库安全隐患时,误报率骤降 60%。(但仍严禁生成攻击型利用脚本,渗透测试需走更高权限模型)。
  2. "紧"——API 级反蒸馏重锁
    为防止通过篡改多轮对话上下文套取 Claude 的「思维链(CoT)」进行下游小模型蒸馏,API 层加入了强一致性校验
    一旦提交的 Prompt 与生成思维块时不匹配,API 将直接拦截报错或完全抽离思维块! 该锁目前已对 8 月 31 日后新注册 API 账号生效,未来将覆盖全员。

结语

硅谷顶尖学者曾提出过一个宏大愿景:AI 最大的价值,是将原本需要几十年的生物医药与基础科学进程,压缩到短短几年内。

从绘制金星地貌,到实验室里试管级别的蛋白高命中率突破,这对孪生大脑正在将预言化为现实。

科学探索的门槛正在以肉眼可见的速度塌缩。只是别忘了:那只向人类递出火种的手,也在同一时刻,悄悄用「反蒸馏锁」抽走了身后的梯子。


🔗 Claude 国内高速体验通道:
👉 https://claude-opus.top/


点赞、转发、在看,一键三连