Claude Haiku 5.5发布:电脑操作成绩暴涨至72.4%,最高降价九成

首页 / AI资讯 / 大模型

0:00
0:00
1x
定时

大模型价格战还没打到终局,Anthropic又补上一枪。10月7日前后,多家外媒披露Anthropic正式发布Claude Haiku 5.5,这是继Opus 5.5与Sonnet 5.5之后5.5家族的第三款模型,主打高吞吐、低成本与电脑操作能力,官方口径下多数任务价格较前代最多下降九成。

成绩单:从15.7%到72.4%的跃升

Haiku 5.5最抓眼球的数字来自OSWorld。这项考察模型操作真实电脑完成任务的基准测试里,上一代Haiku只拿到15.7%的成绩,而Haiku 5.5一举跃升至72.4%,进步幅度在小模型阵营里相当罕见。这个分数意味着什么?此前OSWorld一直被旗舰级模型把持,小模型在涉及点击、输入、跨应用流转的真实图形界面操作上长期不及格,Haiku 5.5把它拉到七成以上,等于宣告电脑操作能力第一次下放到轻量模型层级。

Anthropic给它的定位也非常明确:高并发、大批量任务和子智能体。所谓子智能体,是指主智能体在复杂工作流中派生出的大量分支执行单元,它们各自需要调用模型完成检索、判断、格式化等轻量步骤,数量多但单步任务简单,成本敏感度极高。Haiku 5.5恰好卡在这个生态位上。渠道方面,模型已登陆Amazon Bedrock托管,企业可以在不迁移现有安全基础设施的前提下直接调用,区域数据驻留与既有IAM权限控制全部保留,对合规敏感的客户来说迁移成本几乎为零。

把72.4%放到横向对比里看更有感觉。这项基准考察的是模型在真实操作系统里完成安装软件、整理文件、填写表单这类任务,此前只有旗舰模型能摸到及格线,轻量模型普遍在二三成徘徊。小模型在图形界面操作上的历史短板,一是视觉理解精度不够,二是多步任务的中途纠错能力弱,Haiku 5.5能越过七成线,说明轻量化的代价正在被训练方法与推理优化逐步填平,这对依赖大量界面自动化流程的企业是个直接利好。

价格战打到九折以下,但账要细算

价格是这次发布的另一半主角。官方称多数任务成本较前代下降最多90%,具体到不同任务类型降幅不等。9月下旬发布的Opus 5.5曾以成本降四成惊艳市场,Sonnet 5.5随后跟进,如今Haiku 5.5把降幅推到九成量级,5.5家族三代产品全部到位,形成旗舰、中端、轻量的完整价格梯度。

不过有一个细节值得开发者留意:Anthropic为Haiku 5.5引入了新分词器,官方同时提示新分词器会增加每任务的词元消耗。单价降了九成,词元用量涨上去,实际账单的降幅会被部分抵消,两头相抵后的真实降幅因任务而异。这也是今年模型定价的一个新现象,厂商竞相压低每百万词元的标价,同时通过推理行为、缓存策略、词元效率等变量重塑真实成本结构,采购方需要用自己业务的真实负载跑一遍基准,而不是只看价目表。

竞品侧的压力同样在加大。今年各家厂商轮番调价之后,轻量档位的单价已经进入过去无法想象的区间,有渠道统计显示主流旗舰厂商的轻量模型定价在一年内普遍下探了数倍。对采购方来说,这意味着合同到期续签时几乎必然能谈到更好的价格,把议价窗口与模型代际节奏对齐,是今年成本优化最简单有效的一招。

低价小模型背后的商业逻辑

为什么头部厂商都在拼命做便宜的小模型?答案藏在智能体时代的流量结构里。当应用从单次问答转向多步骤智能体工作流,一次用户请求背后可能是几十次模型调用,其中大部分不需要旗舰智能,只需要便宜、快、够用。谁能把这部分海量长尾调用的成本压到最低,谁就能承接住智能体经济的基础流量。

Anthropic自身的数据也佐证了这个方向。此前披露的企业词元支出统计显示,Anthropic在企业侧的份额已经反超,而价格是撬动份额最直接的杠杆。与此同时,亚马逊与Anthropic的绑定持续加深,Bedrock渠道首发托管让企业客户在既有云合规框架内就能用上新模型,这种云厂加模型厂的组合拳,正在成为企业采购时的默认选项。

还有一层容易被忽略的结构性因素:模型家族的版本节奏本身在改变采购行为。当旗舰、中端、轻量三档保持同步迭代时,企业可以放心地在家族内部做任务分层,升级时整体平移,不必逐个模型重新评估。这种全家桶式的黏性,正是头部厂商敢于在轻量档位上贴着成本定价的底气,用最低的利润率锁住最高频的调用,再在上层档位回收收益,定价结构的雁阵形态已经成型。

开发者怎么用、行业往哪走

对开发者,有几个实操建议。第一,把Haiku 5.5放在子智能体与批处理场景里做A/B测试,重点观察新分词器下自己业务的实际词元账单,别被标价降幅锚定。第二,涉及电脑操作与图形界面的自动化流程,现在多了一个高性价比选项,RPA类工作流值得重估。第三,注意家族内的分工,Opus 5.5负责攻坚,Sonnet 5.5承接主力,Haiku 5.5跑量,三档组合的总体拥有成本比单模型方案更优。

最后提醒一句评测口径。各家公布的降幅与跑分均为官方口径,任务类型不同差异极大,接入前务必用自己的代表性负载做一轮小规模实测,把真实词元账单与耗时记录下来,再决定放量节奏,这一步的成本很低,却能避免后续绝大多数预期落差。

往大处看,这次发布再次确认了一个行业趋势:模型层的竞争已经从谁能做出最聪明的模型,转向谁能把每单位智能的价格压到最低。当旗舰能力逐级下放、轻量模型承接海量调用,模型厂商的护城河越来越依赖工程效率、词元经济学与生态绑定,而不是单点跑分。对用户这是好消息,智能的基础价格正在进入快速下行通道;对二三线模型厂商则是坏消息,头部玩家的价格地板,正在击穿一大批后来者的成本线。

素材来源:The Decoder、Daily AI Report、钛媒体 发布时间:2026-10-08