如何阅读这次 AutomationBench 结果
保留测试结果、样本范围与不能横向排名的边界。
这篇文章保留此前首页展示的冻结评测结果。它说明一次具体评测,不承诺未来任务的成功率、成本或速度。
当前 100-case 样本与所附官方 held-out 结果不是同一集合;图中的参考值不能用来横向排名。解释结果时应同时阅读样本范围、严格通过标准和原始评测证据。
实测结果
Mission 把 Luna 的正确率提升到 34.00%
100 个 AutomationBench case,按严格通过标准计分;先看原始模型,再看 OpenCorvus 完整执行后的结果。
AutomationBench · 严格正确率
OpenCorvus Mission Base
原始 GPT-5.6 Luna8.07%没有 OpenCorvus Mission 编排
OpenCorvus Mission Base34.00%同一 Luna 模型 · 100 case
- 已评测 case
- 100
- 本次冻结样本
- 绝对提升
- +25.93 pp
- 个百分点
- 相对原始 Luna
- 4.21×
- 严格通过率倍数
不同样本参考
官方 held-out 结果
- Gemini 3.7 Flash High30.44%
- Claude Opus 5 Max26.94%
- GPT-5.6 Terra Max21.00%
- GPT-5.6 Sol Max19.63%
参考值来自所附官方 held-out 对照;它们与本次 100-case 冻结样本不是同一集合,因此只提供量级背景,不构成模型排名。