📊 查看 Claude Haiku 5.5 用量排名

📱 下载 AI Rank App

Claude Haiku 5.5 的跑分可以帮助你决定下一步该测试哪些模型,但不能保证它一定能解决你的应用任务。这篇文章分开回答三个问题:官方公布了哪些成绩、哪些评测设置会影响结果,以及 AI Rank 当前有哪些可用于参考的数据。

实际选择时,可以把 Haiku 5.5 纳入候选,在相同任务上与当前模型对照测试,同时记录成功结果与完成任务所需的资源。下文的数据观察均核对于 2026 年 10 月 9 日。

Haiku 5.5 的部分官方跑分

以下数值来自 Anthropic 的发布报告,属于厂商公布的评测结果,并非 AI Rank 自行测试。

基准与评测条件 Haiku 5.5 Haiku 4.5
OSWorld 2.1,离线子集 72.4% 15.7%
Humanity's Last Exam,不使用工具 45.9% 10.2%
Terminal-Bench 4.0 39.2% 0.0%

这里只列出部分基准,不构成综合评分。引用每项成绩时,应保留版本、子集和工具设置。尤其是表中的 0.0%,对应的是那一次 Terminal-Bench 评测,不能理解为 Haiku 4.5 完全没有编程能力。

怎样读懂 Claude Haiku 5.5 的一项跑分

把模型标识、提示词、工具、effort 设置和输出上限一起记录,比较才更有意义。否则,可能是在比较不同的系统配置,却把差异全归因于模型本身。

Anthropic 的 effort 文档 列出 Haiku 5.5 的五档设置,并说明 Claude API 默认是 medium。提高 effort 可能改变质量、延迟和 token 消耗,因此省略该设置,不应被理解为使用最高档。

自行评测时,明确指定 effort,并保持外围工作流程一致。如果给不同模型选择不同配置,应把结果描述为“这些配置之间的比较”,而不是纯粹的模型能力对比。

AI Rank 当前数据能补充什么

AI Rank 提供的是筛选候选模型时可参考的其他信号,不会把一种榜单换算成另一种榜单。

本次核对的 Arena 总榜与编程榜快照,数据日期均为 2026 年 10 月 8 日;其中没有 claude-haiku-5-5 条目。因此,这里不会给 Haiku 5.5 编造 Arena 名次。没有记录不等于得分为零,也不能据此认定模型表现差。

较早的 claude-haiku-4-5-20251001 则有记录:

Arena 分类 记录名次 评分 评分区间 票数
总榜 142 1414.03 1411.61–1416.45 146,351
编程 107 1481.31 1477.26–1485.36 37,782

来源:AI Rank 的总榜接口与编程榜接口,采用 Arena 的 text_style_control 策略。原始数据来自 Arena 及其榜单数据集,许可为 CC BY 4.0。评分与区间端点四舍五入到小数点后两位;实时页面在本文观察日期之后可能变化。

→ 在 AI Rank 查看: Claude Haiku 4.5 的 Arena 评分、名次与 90 天走势

📱 在 AI Rank App 里持续关注

这些评分与 OSWorld、Terminal-Bench 属于不同的评测体系。Arena 评分不是百分比,Haiku 4.5 的记录也不能直接套到 Haiku 5.5 上。

AI Rank 还追踪 OpenRouter 使用量,它回答的又是另一个问题:某个模型在特定平台、分类和时间窗口内被使用了多少。token 使用量不是基准成绩。可以查看模型使用量榜单的来源与日期,再判断某个热门模型是否适合自己的任务。

切换模型前,做一次自己的评测

先定义什么结果算通过,再决定模型是否胜出。Anthropic 的评测指南建议根据应用目的制定可衡量的标准。下面是 AI Rank 建议的起始检查表,不是我们已经完成的实测:

你的任务 定义通过条件 同时记录
结构化信息提取 必需字段正确,输出可解析 缺字段、无效输出与修正次数
代码仓库修改 预期改动通过你的检查 回归问题、重试次数与审核时间
工具调用流程 达到请求的最终状态 错误工具调用与恢复尝试

准备一组不参与调优的代表性案例,包含当前系统容易失败的例子。让当前模型与 Haiku 5.5 执行同一组任务,对不稳定的案例重复测试,并保存提示词、配置与结果。

每次记录任务是否成功、端到端延迟、实际计费和是否需要人工介入。除了每次请求的成本,还应比较每次成功任务的成本:一次便宜但失败的调用,随后需要人工修复,未必划算。

接下来怎么看

可以在 Haiku 4.5 模型详情查看上文讨论的历史型号,再用模型评分榜寻找其他候选。比较之前,先确认分类与快照日期。

下一步要判断的是:Haiku 5.5 是否满足你自己的验收条件。把官方跑分作为一项证据,再用可比较的实际任务结果作决定。

选型前先对比: 评分和排名每天都在变,决定前先看 AI Rank 的模型评分榜。

或 📱 下载 AI Rank App 在手机上随时查看。

本文使用 AI 辅助撰写,由 AI Rank 核对所引用的官方文档与记录数据;本文不声称完成了独立的上手跑分测试。