Claude Haiku 5.5 的跑分可以帮助你决定下一步该测试哪些模型,但不能保证它一定能解决你的应用任务。这篇文章分开回答三个问题:官方公布了哪些成绩、哪些评测设置会影响结果,以及 AI Rank 当前有哪些可用于参考的数据。
实际选择时,可以把 Haiku 5.5 纳入候选,在相同任务上与当前模型对照测试,同时记录成功结果与完成任务所需的资源。下文的数据观察均核对于 2026 年 10 月 9 日。
Haiku 5.5 的部分官方跑分
以下数值来自 Anthropic 的发布报告,属于厂商公布的评测结果,并非 AI Rank 自行测试。
| 基准与评测条件 | Haiku 5.5 | Haiku 4.5 |
|---|---|---|
| OSWorld 2.1,离线子集 | 72.4% | 15.7% |
| Humanity's Last Exam,不使用工具 | 45.9% | 10.2% |
| Terminal-Bench 4.0 | 39.2% | 0.0% |
这里只列出部分基准,不构成综合评分。引用每项成绩时,应保留版本、子集和工具设置。尤其是表中的 0.0%,对应的是那一次 Terminal-Bench 评测,不能理解为 Haiku 4.5 完全没有编程能力。
怎样读懂 Claude Haiku 5.5 的一项跑分
把模型标识、提示词、工具、effort 设置和输出上限一起记录,比较才更有意义。否则,可能是在比较不同的系统配置,却把差异全归因于模型本身。
Anthropic 的 effort 文档 列出 Haiku 5.5 的五档设置,并说明 Claude API 默认是 medium。提高 effort 可能改变质量、延迟和 token 消耗,因此省略该设置,不应被理解为使用最高档。
自行评测时,明确指定 effort,并保持外围工作流程一致。如果给不同模型选择不同配置,应把结果描述为“这些配置之间的比较”,而不是纯粹的模型能力对比。
AI Rank 当前数据能补充什么
AI Rank 提供的是筛选候选模型时可参考的其他信号,不会把一种榜单换算成另一种榜单。
本次核对的 Arena 总榜与编程榜快照,数据日期均为 2026 年 10 月 8 日;其中没有 claude-haiku-5-5 条目。因此,这里不会给 Haiku 5.5 编造 Arena 名次。没有记录不等于得分为零,也不能据此认定模型表现差。
较早的 claude-haiku-4-5-20251001 则有记录:
| Arena 分类 | 记录名次 | 评分 | 评分区间 | 票数 |
|---|---|---|---|---|
| 总榜 | 142 | 1414.03 | 1411.61–1416.45 | 146,351 |
| 编程 | 107 | 1481.31 | 1477.26–1485.36 | 37,782 |
来源:AI Rank 的总榜接口与编程榜接口,采用 Arena 的 text_style_control 策略。原始数据来自 Arena 及其榜单数据集,许可为 CC BY 4.0。评分与区间端点四舍五入到小数点后两位;实时页面在本文观察日期之后可能变化。
→ 在 AI Rank 查看: Claude Haiku 4.5 的 Arena 评分、名次与 90 天走势
这些评分与 OSWorld、Terminal-Bench 属于不同的评测体系。Arena 评分不是百分比,Haiku 4.5 的记录也不能直接套到 Haiku 5.5 上。
AI Rank 还追踪 OpenRouter 使用量,它回答的又是另一个问题:某个模型在特定平台、分类和时间窗口内被使用了多少。token 使用量不是基准成绩。可以查看模型使用量榜单的来源与日期,再判断某个热门模型是否适合自己的任务。
切换模型前,做一次自己的评测
先定义什么结果算通过,再决定模型是否胜出。Anthropic 的评测指南建议根据应用目的制定可衡量的标准。下面是 AI Rank 建议的起始检查表,不是我们已经完成的实测:
| 你的任务 | 定义通过条件 | 同时记录 |
|---|---|---|
| 结构化信息提取 | 必需字段正确,输出可解析 | 缺字段、无效输出与修正次数 |
| 代码仓库修改 | 预期改动通过你的检查 | 回归问题、重试次数与审核时间 |
| 工具调用流程 | 达到请求的最终状态 | 错误工具调用与恢复尝试 |
准备一组不参与调优的代表性案例,包含当前系统容易失败的例子。让当前模型与 Haiku 5.5 执行同一组任务,对不稳定的案例重复测试,并保存提示词、配置与结果。
每次记录任务是否成功、端到端延迟、实际计费和是否需要人工介入。除了每次请求的成本,还应比较每次成功任务的成本:一次便宜但失败的调用,随后需要人工修复,未必划算。
接下来怎么看
可以在 Haiku 4.5 模型详情查看上文讨论的历史型号,再用模型评分榜寻找其他候选。比较之前,先确认分类与快照日期。
下一步要判断的是:Haiku 5.5 是否满足你自己的验收条件。把官方跑分作为一项证据,再用可比较的实际任务结果作决定。
选型前先对比: 评分和排名每天都在变,决定前先看 AI Rank 的模型评分榜。
或 📱 下载 AI Rank App 在手机上随时查看。
本文使用 AI 辅助撰写,由 AI Rank 核对所引用的官方文档与记录数据;本文不声称完成了独立的上手跑分测试。