跳到主要内容
OpenCorvus
← 博客

如何阅读这次 AutomationBench 结果

保留测试结果、样本范围与不能横向排名的边界。

这篇文章保留此前首页展示的冻结评测结果。它说明一次具体评测,不承诺未来任务的成功率、成本或速度。

当前 100-case 样本与所附官方 held-out 结果不是同一集合;图中的参考值不能用来横向排名。解释结果时应同时阅读样本范围、严格通过标准和原始评测证据。

实测结果

Mission 把 Luna 的正确率提升到 34.00%

100 个 AutomationBench case,按严格通过标准计分;先看原始模型,再看 OpenCorvus 完整执行后的结果。

AutomationBench · 严格正确率

OpenCorvus Mission Base

openai/gpt-5.6-luna
原始 GPT-5.6 Luna8.07%没有 OpenCorvus Mission 编排
OpenCorvus Mission Base34.00%同一 Luna 模型 · 100 case
已评测 case
100
本次冻结样本
绝对提升
+25.93 pp
个百分点
相对原始 Luna
4.21×
严格通过率倍数

不同样本参考

官方 held-out 结果

不可横向排名
  • Gemini 3.7 Flash High30.44%
  • Claude Opus 5 Max26.94%
  • GPT-5.6 Terra Max21.00%
  • GPT-5.6 Sol Max19.63%

参考值来自所附官方 held-out 对照;它们与本次 100-case 冻结样本不是同一集合,因此只提供量级背景,不构成模型排名。