跳到主要内容
OpenCorvus
$ git clone https://github.com/yangheng95/opencorvus
$ cd opencorvus && bun install
$ bun run --cwd packages/opencorvus build
$ bun packages/opencorvus/src/index.ts doctor
$ cd /path/to/your/repo
$ bun "$OPENCORVUS_SOURCE" serve

→ 工作台 http://127.0.0.1:7878/ui/

产品故事

别再替 Agent 维持交接

从上下文遗忘,到 Mission 调度、恢复、验收和专家团进化,4 分 11 秒讲清楚。

简体中文版 · 4 分 11 秒 · 有声旁白与字幕 · 随页面语言切换

实测结果

Mission 把 Luna 的正确率提升到 34.00%

100 个 AutomationBench case,按严格通过标准计分;先看原始模型,再看 OpenCorvus 完整执行后的结果。

AutomationBench · 严格正确率

OpenCorvus Mission Base

openai/gpt-5.6-luna
原始 GPT-5.6 Luna8.07%没有 OpenCorvus Mission 编排
OpenCorvus Mission Base34.00%同一 Luna 模型 · 100 case
已评测 case
100
本次冻结样本
绝对提升
+25.93 pp
个百分点
相对原始 Luna
4.21×
严格通过率倍数

不同样本参考

官方 held-out 结果

不可横向排名
  • Gemini 3.7 Flash High30.44%
  • Claude Opus 5 Max26.94%
  • GPT-5.6 Terra Max21.00%
  • GPT-5.6 Sol Max19.63%

参考值来自所附官方 held-out 对照;它们与本次 100-case 冻结样本不是同一集合,因此只提供量级背景,不构成模型排名。

长程

长程工作在哪里断

三种失败,各自对应一个真实机制。

  • 跑不彻底

    需求带验收与非目标;进程丢了是恢复不是重来;终态任务收到你下一条消息就继续。

    终态可重开

  • 结果不能用

    带出处的类型化产物;宿主观测独立于 agent 自述;核查、完整性与视觉复核都是具名阶段。

    校验具名阶段

  • 永远不会变好

    把你真正想要的说给专家团;它起草修订,你点头才安装,回执就是撤销凭据。

    安装条件你的接受

组合

专家团组合起来

最长的工作不是一支队伍干更久,而是几支各自负责一段。

案例

把 DeBERTa 做成一项完整研究工程

模型、数据、CUDA 实验、实时网页、图表、论文、审校与仓库都在同一个 Mission 里;每一段都由一支完整专家团负责。

6支专家团44个具名角色

原始 Mission 要求

  1. 下载 DeBERTa v3 Base ABSA v1.1;重新调研资料,检索或合成可追溯训练数据,并完成模型训练。
  2. 完整配置仅限 CUDA 的训练环境,禁止 CPU 训练;每次创新设计与模型迭代都记录训练/测试性能;建设自动更新数据的训练监控与推理网页,并持续超过明确基线。
  3. 根据最佳实验对应的模型架构与设计思路,绘制可复现、可发表的图表。
  4. 调研相关文献并撰写一篇完整的 ACL 风格短文,正文至少四页。
  5. 深入审查并校对论文,消除事实错误,优化组织结构,使全文 concise 且 informative。
  6. 创建组织清晰的 Git 仓库,用 Mission 模式分解并执行复杂任务,最终完成经审查的 GitHub 推送。

最终必须交付

  • 可追溯 ABSA 数据集
  • 仅限 CUDA 的训练环境
  • 最佳模型 checkpoint
  • 实时监控与推理网页
  • 架构图与实验图表
  • 经审校的 ACL 论文
  • 已发布的 Mission 仓库

六项高层交付

  1. 01模型与数据深度研究核验 DeBERTa v3 Base ABSA v1.1 来源,重查 ABSA 证据,并形成检索、清洗或合成训练数据的可追溯方案。
  2. 02CUDA 训练系统Advanced交付仅限 CUDA 的运行环境、基线与候选训练、实验台账,以及自动更新的训练监控与推理网页。
  3. 03架构证据数据分析与商业洞察对齐最佳实验、模型架构与设计思路,产出绑定精确 checkpoint 的可复现图表。
  4. 04ACL 短文研究工作室基于相关工作与最佳实验,完成至少四页、concise 且 informative 的 ACL 风格短文。
  5. 05独立论文审校学术论文审查逐项结算事实、引文、新颖性、方法、结构、图表、幻觉风险、简洁性与信息密度问题。
  6. 06Mission 仓库Base交付可复现、组织清晰的 Git 仓库,包含 Mission 阶段图、经审查的文档与已验证的 GitHub 推送。
展开完整执行图收起完整执行图把 6 项高层交付展开为 5 条工作流、18 个专家团阶段和逐层里程碑。

任务规模 ×3

这才是 OpenCorvus 实际要协调的完整任务图

从模型与数据证据开始,穿过 CUDA 训练、实时产品、研究发表,最后收敛到独立复现和 GitHub 发布。

18个专家团阶段99个具名角色

模型与数据证据

先证明能训练什么、数据从哪里来,以及用什么口径判断模型真的变好。

3 个阶段15 个具名角色

  1. 核验模型与文献深度研究核验模型身份、许可与 checkpoint,并建立当前 ABSA 工作的证据图谱。
  2. 建立数据管线数据工程可靠性版本化完成采集、清洗、切分、合成、血缘与可复现数据构建。
  3. 冻结基线AI 模型治理与评估固化模型与数据卡、评估切片、质量风险和基线协议。
CUDA 训练与实验

搭好 GPU 环境、实现训练器、运行候选实验,并把每一项训练/测试指标对清楚。

4 个阶段32 个具名角色

  1. 设计 CUDA 环境云平台架构固定驱动、CUDA、框架、容器、存储和 GPU 观测契约,不保留 CPU 训练路径。
  2. 实现训练系统Advanced交付可复现训练器、配置面、checkpoint 生命周期与聚焦验证。
  3. 运行候选实验演进实验室冻结对照臂、预算与变异,记录训练/测试指标,完成完整性审查和最佳候选决策。
  4. 对账模型性能数据分析与商业洞察统一指标口径,分析切片、不确定性和失败簇,并独立核查排名。
实时产品

把实验数据做成真实训练监控与推理体验,再用浏览器完成验收。

2 个阶段12 个具名角色

  1. 构建实时产品前端创新基于实验数据契约,设计并实现训练监控与推理体验。
  2. 验收实时更新浏览器研究与验收用真实页面证明指标会刷新、推理可用、响应式状态成立且控制台无故障。
研究与发表

解释最佳设计、重绘证据、定位相关工作、完成论文,并由另一支专家团独立审稿。

6 个阶段28 个具名角色

  1. 解释模型设计科学研究设计明确研究问题、假设、消融、因果边界和可辩护的架构叙事。
  2. 决策最佳系统产品管理用同一份决策登记册绑定最佳架构、用户价值、证据、取舍与非目标。
  3. 绘制论文图表Office 交付从已验收源数据生成架构图、实验图和对比图,并附校验回执。
  4. 梳理相邻工作专利格局与现有技术形成带日期、可复现查询的相邻工作版图,区分论文、主张与空白。
  5. 撰写 ACL 论文研究工作室完成四页以上短文,让方法、结果、图表、局限与引文共用同一证据底座。
  6. 独立审查论文学术论文审查独立审查新颖性、方法、事实、引文、幻觉、结构与简洁性,并逐项结算。
复现与发布

完整复现系统、加固发布边界,并推送一份组织清晰的 Mission 仓库。

3 个阶段12 个具名角色

  1. 复现与调试审查与调试独立复现训练、评估、推理和网页启动,并修复真实根因。
  2. 加固仓库网络安全保障发布前完成密钥、依赖、来源、许可、工作流与发布边界审查。
  3. 发布 Mission 仓库Base交付组织清晰的 Git 仓库,包含精确安装、CUDA 复现、数据/模型卡、网页、论文、证据与经审查的 GitHub 推送。

另一个长 Mission

让 OpenCorvus 写一篇介绍自己的论文

一篇至少三十页、证据密集的系统论文:以一手材料、可执行评测、出版级图表和独立审稿为底座,不靠自说自话。

9支专家团55个具名角色

原始 Mission 要求

  1. 从实际检查过的源码、当前架构规格、文档、发布产物和版本历史重建 OpenCorvus;禁止凭记忆或产品宣传写作。
  2. 实际阅读相关工作,提出可证伪问题与边界清楚的贡献,并设计含基线、指标、不确定性、失败案例和消融的可复现实证评测。
  3. 成稿前必须使用研究工作室的 analysis-report-quality Skill 建立唯一且验证过的证据模型;系统论文有效正文至少 30 页,参考文献和附录不计页数。
  4. 禁止用重复背景、泛泛的 Agent 文案、超大图表、稀疏排版、把正文挪进附录或无证据主张灌水。
  5. 每张必要图表都要从已验收数据重新绘制,具备出版级层级、标签、单位、样本量、不确定性、来源、图注和无障碍编码;严禁原始 notebook 或图表库默认输出。
  6. 独立审查文献、新颖性、逻辑、方法、统计、事实、引文、幻觉风险和呈现,结算全部 critical/major 问题,并一起交付论文、源文件、参考文献、证据台账、图表源文件和复现说明。

最终必须交付

  • 30+ 页有效正文
  • 源码与架构证据库
  • 可复现实证评测
  • 出版级图表
  • 核验过的参考文献
  • 完整论文源文件与证据包

完整执行工作流

研究底座

先冻结研究问题、核验一手资料并重建系统,之后才允许提出主张。

3 个阶段24 个具名角色

  1. 冻结研究章程科学研究设计冻结可证伪问题、贡献边界、替代解释、证据需求、伦理边界和禁止灌水的验收契约。
  2. 建立一手证据库深度研究实际核验源码、规格、版本、历史、论文与官方资料,形成主张级定位和检索边界。
  3. 重建系统机制Advanced以可执行证据重建控制流、持久化、Mission/Task 语义、专家团、进化、权限、恢复与可观测性。
评测与复现

运行已声明的基线与消融,再独立复现中心结果。

2 个阶段11 个具名角色

  1. 运行实证评测数据分析与商业洞察交付可复现基线、案例、指标、不确定性、消融、失败分析、规范结果表和已核查定量主张。
  2. 独立复现审查与调试洁净环境复现关键工作流与结果,修复真实根因并记录仍未解决的边界。
从证据到成稿

定位相关工作、精修全部图表,并从同一证据模型写出三十页高信息密度正文。

3 个阶段12 个具名角色

  1. 定位相关工作专利格局与现有技术形成可复现检索的相关工作版图,区分已核验工作、重叠、可辩护创新与未知项。
  2. 精修全部图表Office 交付从已验收数据重绘出版级架构图、实验图、消融图与对比图,绝不交付原始绘图输出。
  3. 撰写三十页论文研究工作室使用 analysis-report-quality Skill 建立唯一证据模型,完成正文 30 页以上、简洁而信息密集且主张、文字、图表、局限和引文一致的论文。
独立论文审查

在接受最终交付包前,独立挑战新颖性、逻辑、方法、事实、引文与呈现。

1 个阶段8 个具名角色

  1. 独立审稿并定稿学术论文审查结算文献、新颖性、逻辑、方法、统计、事实、引文、幻觉和呈现问题,并最终对账图表与正文。

其它组合

看组合是怎么跑的

进化

会修订自己的专家团

两条路径,终点都是一次必须由你给出的确认。

  • 从你说过的话来

    说出你真正想要的。宿主复制精确版本、套用改动、校验成可运行的包,然后挂起等你。

  • 从度量结果来

    进化实验室先冻结目标版本、用例、评分器、预算与变异面,再跑对照臂并复核结果。

没有你的确认,任何修订都不会安装;每次改动都能回退。

看进化是怎么做的

特性

开源、定制、可控、透明

四件事,决定一个工具能不能长期用下去。

  • 开源

    MIT 许可证,全部源码公开。可自托管、可审计、可 fork。

    MIT许可证

  • 定制

    换模型、改工具、调权限、装专家团,都不必改源码。

    119可装专家团

  • 可控

    跑在自己机器上。工具按项目授权,不可逆操作先问过你。

    本机运行位置

  • 透明

    每次工具调用、参数和结果都留在会话原文里,可逐条回看。

    全程过程记录

和相近产品的区别

定位最接近的两个,放在一起看。

和相近产品的区别WorkBuddyDeepSeek HarnessOpenCorvus
许可商业,Token 套餐计费MIT 开源MIT 开源
运行位置云端服务本地本地或自己的服务器
出发点一句话交付成品插件内核,能力自行组合完整 harness 开箱即用,再逐层替换
能力封装平台内的 Expert Group插件生态带版本与 digest 的专家团(119 支)
上手桌面客户端npx 一行拉起 Web UI安装包或源码构建

DeepSeek Harness 同样是 MIT 开源,也同样把运行过程完整留痕;它的插件内核比我们更彻底。选它还是选这里,取决于你要的是自己拼一套,还是拿到一套再改。

对比依据两者的公开产品说明

开始

开始使用

从源码起,或者直接装桌面端。

源码构建

装好 Bun,克隆、构建、自检。

git clone https://github.com/yangheng95/opencorvus.git

已经装好了?

在你的仓库里起服务,工作台开在本地。

bun "$OPENCORVUS_SOURCE" serve

三条边界

  • 签名校验资源包先验签名和 SHA-256,再落盘。
  • 权限边界工具按项目授权,不可逆操作需确认。
  • 证据可回看每次调用和结果都留在会话原文里。

常见问题

常见问题

定位、边界、数据去向。

和 Claude Code、Codex 这类编码助手是什么关系?

不在一层,而且能一起用。它们是绑定各自厂商模型的编码会话,OpenCorvus 是底下那层 harness:模型无关、多 Agent 协调、自托管。桌面端还能认出本机装好的 Claude Code、Codex、Gemini Code、Copilot、GLM Code,在当前项目目录直接打开。

我已经在用其中一个,还有必要吗?

看你缺哪一块。只是想要更好的单次编码对话,不必换。需要跨任务协调、锁版本的专家团、统一的权限与证据、重启后接着跑——那是这里在做的事。

代码会离开我的机器吗?

运行时在你自己的机器或服务器上,MIT 开源,源码全都能审。模型请求只发给你自己配的 provider;用本地模型就完全不出网。

支持哪些模型?

内置目录解析出 87 个 provider、2,579 个模型,含本地运行时。换模型是改配置,不是改源码。

「专家团」到底是什么?

一个能打开看的能力包:角色、工作流、Skills、工具、适用说明、版本和 digest 冻在一起。任务创建时锁死一个版本,中途不会被悄悄换掉。

这套东西是自己写的吗?

后端 harness 和桌面前端都在这个仓库里,底下没有套第三方 Agent 引擎——这样每一层才换得动。它站在很多开源项目的肩膀上:Bun、AI SDK、Solid、Tauri。

长程到底能长到什么程度?

取决于你的运行时在不在线。工作能扛过重启,靠的是租约、事件日志和协调器,不是靠某个进程一直活着。已完成、已失败或已取消的任务,收到你下一条消息就在新的执行轮次里继续,旧历史原样保留。

它会背着我改自己吗?

不会。修订会被起草、校验成可运行的包并挂起,只有你用自己的消息确认之后才安装;返回的回执就是恢复上一个版本的凭据。

无人值守能跑多久?

只在你的运行时在线时。它不是托管服务,也不承诺无限自治——结果取决于选的模型、能访问的来源和拿到的证据。

参与

参与共建

提 issue、写一支专家团,或者直接改代码。