当地时间9月1日,Anthropic正式发布新一代旗舰模型Claude Fable 5.1与Claude Mythos 5.1,距离上一代Fable 5发布仅约三个月。两款模型共享同一底层能力,区别在于安全边界:Fable 5.1面向所有用户与开发者开放,Mythos 5.1则只通过受信访问计划提供给通过审核的网络安全与生命科学机构。官方数据显示,新模型在科研智能体基准上跑分翻倍有余,缓存读取价格大降75%,而真正引发行业讨论的,是同步更新的API规则,思考块签名机制让未经授权的大规模模型蒸馏第一次在协议层面被堵死。
Fable 5.1与Mythos 5.1本质上是同一个底层模型,两者的差异完全体现在安全设置上。Fable 5.1保留了Anthropic为生产环境设计的安全分类器与兜底机制,可广泛用于企业部署;Mythos 5.1移除部分高风险管理场景限制,经Project Glasswing定向邀请,供通过审核的网络安全与生命科学机构使用。
参数层面,两款模型均支持100万token上下文窗口,单次输出上限达12.8万token,定价与上代一致,输入输出分别为每百万token 10美元与50美元。Anthropic把这一代定位为"能力最强的通用Claude模型",重点服务跨代码库开发、复杂知识工作与持续数小时乃至数天的长程自主任务,官方强调其在多步骤任务中的稳定性:即便第二步出现微小错误,也能在后续数十步中保持输出不崩塌。
从产品节奏看,Fable系列从5到5.1仅隔三个月,明显快于Opus系列的迭代周期。Anthropic将Fable定位为"科研与智能体冲锋型号",与面向通用生产的Opus形成双线布局,两者共用推理底座、按安全等级与场景分流。双版本齐发延续了这一策略,前沿模型的能力上限与安全分级正同步加速。
Anthropic公布的基准测试显示,新模型在科研智能体方向进步最为显著。在Terminal-Bench-Science 0.1上,Fable 5.1拿到52.6%,相比Fable 5的24.7%实现翻倍,并超过Opus 5与GPT-5.6 Sol。编程维度,Fable 5.1在Terminal-Bench 4.0上达到55.8%,放开安全限制的Mythos 5.1进一步冲到60.9%,上一代Fable 5为42.0%。知识工作方面,Fable 5.1在GDPval-AA v2拿到1853分,反超Opus 5的1824分。
除公开跑分外,Anthropic还展示了多项真实科研案例。在蛋白质设计方向,团队用Mythos 5.1设计高亲和力结合蛋白并送至两家外部机构验证,在三个靶标上的结合亲和力达到Adaptyv Bio蛋白质设计竞赛最佳方案的10倍,全部12个靶标的命中率接近50%,而行业典型命中率只有10%到15%。天文学方向,Fable 5.1基于NASA麦哲伦号三十多年前的雷达影像训练神经网络,为金星约三分之一表面生成分辨率2至3公里的新地形图,此前公开数据仅覆盖五分之一。
在计算生物学上,Mythos 5.1通过编写自定义GPU内核并缓存中间结果,将7个开源深度学习模型的推理速度提升最高2.5倍且输出完全一致,研究人员日常需对基因附近所有可能突变跑数千次实验,优化后GPU成本可降低30%到60%,这类工作以往需要性能工程团队数周完成。Anthropic表示相关优化代码计划近期开源。
与模型同步到来的是Messages API的重要规则变更。从9月1日起,新注册的API账户将无法在多轮对话中手动编辑Claude的历史上下文,同时保留此前的思考链记录。官方解释称,此前攻击者常诱导模型输出推理过程,再篡改对话前缀、注入对抗性指令,迫使模型"解密重播"旧思考内容以批量收集推理数据,思考块签名机制正是为堵住这条后门。
新的机制为每个思考块附加数字签名,系统会在后续请求中校验两件事:当前模型是否有权读取该区块,以及该区块之前的整段对话是否与生成时完全一致,包括系统提示词、工具列表与全部历史消息。一旦检测到任何改动,校验即失败。开发者可通过prefix_mismatch_behavior参数选择处理方式,默认返回400错误拒绝请求,也可设为drop_block静默丢弃该区块及其后的思考链。
为降低对合法工作流的影响,Anthropic提供了替代方案:中途改指令用对话内系统消息,临时提醒用带clear_at的轮次级消息,增减工具用专门区块,上下文裁剪交给服务端压缩完成。Claude Code、claude.ai等官方产品已自动遵守新规则,直接调用API的开发者应把消息数组当作只追加使用。此外,新模型还正式引入欧盟AI法案要求的数字水印能力,检测API目前仅向符合欧盟法律要求的组织开放。
定价端最大的动作是缓存读取费用从每百万token 1美元降至0.25美元,降幅达75%。在长上下文与工具密集的智能体工作流中,缓存读取通常占成本大头,因此Anthropic测算典型工作负载总成本下降约25%,重度Agent化任务最高可省45%,输入输出价格则保持不变。对高频调用方而言,这相当于在不牺牲质量的前提下显著拉低单次任务的边际成本。
生态跟进的速度同样反常地快。Cursor、Vercel、Devin等开发工具在发布后数小时内上线支持,主流工具链对新旗舰的适配已高度模板化。Anthropic还披露,Fable 5.1在与投资机构Millennium的真实排障中,定位到一处困扰人类工程师与多个竞品模型数年的罕见系统崩溃根因,长程调试能力获得实战背书。
从行业视角看,信号相当明确:缓存降价继续压低智能体调用成本,思考块签名把蒸馏防御从"加密"升级为"绑定校验",模型经济与安全攻防在同步演进。当推理过程成为可审计的资产,蒸馏这门灰色生意将面临更高门槛,围绕思考链的保护也会成为各家大厂API设计的标配考量。