专家团组合
为什么最长的工作是几支专家团、而不是一支跑更久;以 DeBERTa 研究工程和 OpenCorvus 自述论文两个 Mission 完整走一遍。
最长的工作不是一支队伍干更久,而是几支队伍各自负责一段,每一段交给下一段的都是能读的东西。
这是关于失败模式的判断,不是关于组织架构的偏好。一支队伍从第一份资料一路扛到最终文件,会累积自己 早期的判断偏差,会和自己抢上下文,最后还要复核自己写的东西。把结果拆成有归属的阶段,等于在每一次 交接的两侧各放一支专家团——角色不同、工具不同,而且对上一段的结论没有任何立场。
Mission 持有什么
Mission 在启动时记录哪些专家团 ID 可用。之后再安装的能力不会静默扩大这个集合。子任务创建时,从这个 集合里解析出一个精确的包版本及其已选工作流,在该任务的生命周期内固定不变。
所以组合发生在 Mission 层,归属仍留在任务层。把专家团组合起来,不会稀释任何一项交付的责任人。
案例:把 DeBERTa 从模型卡做到公开仓库
最短而完整的链条有六项交付:模型与数据;带实时监控和推理页的仅限 CUDA 训练系统;架构证据; ACL 风格短文;独立论文审校;以及 Mission 仓库。这里的每一个数字都从目录解析而来,不是写死在 这一页上的。
6 支专家团44 个具名角色
- 下载 DeBERTa v3 Base ABSA v1.1;重新调研资料,检索或合成可追溯训练数据,并完成模型训练。
- 完整配置仅限 CUDA 的训练环境,禁止 CPU 训练;每次创新设计与模型迭代都记录训练/测试性能;建设自动更新数据的训练监控与推理网页,并持续超过明确基线。
- 根据最佳实验对应的模型架构与设计思路,绘制可复现、可发表的图表。
- 调研相关文献并撰写一篇完整的 ACL 风格短文,正文至少四页。
- 深入审查并校对论文,消除事实错误,优化组织结构,使全文 concise 且 informative。
- 创建组织清晰的 Git 仓库,用 Mission 模式分解并执行复杂任务,最终完成经审查的 GitHub 推送。
| 阶段 | 专家团 | 角色 | 交出什么 |
|---|---|---|---|
| 模型与数据 | 深度研究 | 6 | 核验 DeBERTa v3 Base ABSA v1.1 来源,重查 ABSA 证据,并形成检索、清洗或合成训练数据的可追溯方案。 |
| CUDA 训练系统 | Advanced | 14 | 交付仅限 CUDA 的运行环境、基线与候选训练、实验台账,以及自动更新的训练监控与推理网页。 |
| 架构证据 | 数据分析与商业洞察 | 7 | 对齐最佳实验、模型架构与设计思路,产出绑定精确 checkpoint 的可复现图表。 |
| ACL 短文 | 研究工作室 | 5 | 基于相关工作与最佳实验,完成至少四页、concise 且 informative 的 ACL 风格短文。 |
| 独立论文审校 | 学术论文审查 | 8 | 逐项结算事实、引文、新颖性、方法、结构、图表、幻觉风险、简洁性与信息密度问题。 |
| Mission 仓库 | Base | 4 | 交付可复现、组织清晰的 Git 仓库,包含 Mission 阶段图、经审查的文档与已验证的 GitHub 推送。 |
要看的是它的形状,而不是单个模型选择。落地页可以把同一个 Mission 从六项交付展开成十八个专家团 Task:来源与数据血缘、CUDA 环境、训练实验、指标对账、真实监控与推理网页、图表、相关工作、论文审计、 独立复现、仓库加固和发布。任务规模变大了,但不会让同一支队伍同时编写、测试、审查并批准自己的工作。
案例:让 OpenCorvus 研究并介绍自己
第二个长 Mission 不是让系统凭记忆写一篇产品软文,而是要求它从源码、当前架构规格、发布产物、版本历史、 实证评测和实际阅读过的相关工作建立证据链,再完成一篇正文至少 30 页的系统论文。参考文献和附录不计入 页数,也不能靠重复背景、泛泛而谈、超大图表或稀疏排版灌水。
9 支专家团55 个具名角色
- 从实际检查过的源码、当前架构规格、文档、发布产物和版本历史重建 OpenCorvus;禁止凭记忆或产品宣传写作。
- 实际阅读相关工作,提出可证伪问题与边界清楚的贡献,并设计含基线、指标、不确定性、失败案例和消融的可复现实证评测。
- 成稿前必须使用研究工作室的 analysis-report-quality Skill 建立唯一且验证过的证据模型;系统论文有效正文至少 30 页,参考文献和附录不计页数。
- 禁止用重复背景、泛泛的 Agent 文案、超大图表、稀疏排版、把正文挪进附录或无证据主张灌水。
- 每张必要图表都要从已验收数据重新绘制,具备出版级层级、标签、单位、样本量、不确定性、来源、图注和无障碍编码;严禁原始 notebook 或图表库默认输出。
- 独立审查文献、新颖性、逻辑、方法、统计、事实、引文、幻觉风险和呈现,结算全部 critical/major 问题,并一起交付论文、源文件、参考文献、证据台账、图表源文件和复现说明。
可直接交给 OpenCorvus 的 Mission完成下面的长 Mission,每一个编号都必须由一支完整专家团负责。最终交付一篇介绍 OpenCorvus 的通用学术系统论文:正文至少 30 页,参考文献和附录不计入页数;禁止用重复背景、泛泛而谈的 Agent 文案、超大图表、稀疏排版、把正文挪进附录或无证据主张凑页数。必须从当前源码、架构规格、文档、发布产物与版本历史重建系统;检索并实际阅读多 Agent Harness、长程执行、证据交接、评测与自我改进的相关论文和官方资料;提出可证伪的研究问题与边界清楚的贡献;把架构、控制流、持久化、Task/Mission 语义、专家团组合与进化、权限、恢复和可观测性逐项绑定到精确证据。设计并运行可复现的实证评测,明确基线、数据集或案例、指标、不确定性、失败案例、消融和局限,保存可运行脚本与规范结果表。研究工作室必须先使用 analysis-report-quality Skill 建立并验证唯一证据模型,再开始写作。每一张图表都必须必要、绑定主张、可追溯来源且可独立复现,并以结论式标题、清晰标签、单位、样本量、不确定性、完整图注、无障碍编码和统一出版主题重新绘制;严禁原始 notebook 输出、图表库默认样式、裁切标签、装饰性架构图、用截图代替证据或任何视觉垃圾。正文必须完整包含摘要、引言、研究问题、相关工作、系统设计、实现、方法、结果、消融、讨论、有效性威胁、局限、负责任使用与安全、可复现性声明、结论和核验过的参考文献。最后分别执行文献、新颖性、逻辑、方法/统计/事实、引文/幻觉与呈现审查,结算全部 critical 和 major 问题,让图表再次对齐最终正文,并一起交付论文、源文件、参考文献、证据台账、图表源文件和复现说明。
| 阶段 | 专家团 | 角色 | 交出什么 |
|---|---|---|---|
| 冻结研究章程 | 科学研究设计 | 4 | 冻结可证伪问题、贡献边界、替代解释、证据需求、伦理边界和禁止灌水的验收契约。 |
| 建立一手证据库 | 深度研究 | 6 | 实际核验源码、规格、版本、历史、论文与官方资料,形成主张级定位和检索边界。 |
| 重建系统机制 | Advanced | 14 | 以可执行证据重建控制流、持久化、Mission/Task 语义、专家团、进化、权限、恢复与可观测性。 |
| 运行实证评测 | 数据分析与商业洞察 | 7 | 交付可复现基线、案例、指标、不确定性、消融、失败分析、规范结果表和已核查定量主张。 |
| 独立复现 | 审查与调试 | 4 | 洁净环境复现关键工作流与结果,修复真实根因并记录仍未解决的边界。 |
| 定位相关工作 | 专利格局与现有技术 | 4 | 形成可复现检索的相关工作版图,区分已核验工作、重叠、可辩护创新与未知项。 |
| 精修全部图表 | Office 交付 | 3 | 从已验收数据重绘出版级架构图、实验图、消融图与对比图,绝不交付原始绘图输出。 |
| 撰写三十页论文 | 研究工作室 | 5 | 使用 analysis-report-quality Skill 建立唯一证据模型,完成正文 30 页以上、简洁而信息密集且主张、文字、图表、局限和引文一致的论文。 |
| 独立审稿并定稿 | 学术论文审查 | 8 | 结算文献、新颖性、逻辑、方法、统计、事实、引文、幻觉和呈现问题,并最终对账图表与正文。 |
成稿阶段必须使用 Research Studio 的 analysis-report-quality Skill 建立唯一、验证过的证据模型。所有图表
从已验收数据重新绘制,带结论式标题、单位、样本量、不确定性、来源和可访问编码;原始 notebook 输出、
图表库默认主题、裁切标签和装饰性垃圾不能进入论文。最后由学术论文审查专家团独立核查文献、新颖性、逻辑、
方法、统计、事实、引文幻觉和呈现质量,并逐项结算全部 critical 与 major 问题。
其它已经能用的组合
同样的形状,换三个更短的领域:
| 其它组合 | 专家团 | 角色 |
|---|---|---|
| 交易尽调 | 并购尽职调查法务会计调查商事法务税务合规内部审计与控制保障 | 29 |
| 从一次事故到沉淀下来的知识 | 服务可靠性与事件运营数字取证事件调查审查与调试知识库运营 | 18 |
| 把东西发出去 | 产品管理营销与增长战略SEO 与生成式引擎优化产品视频制作本地化与适配 | 26 |
怎么决定在哪里拆
在「一项交付可以被独立归属、独立验收、或被独立依赖」的地方拆。为拆而拆只会制造没有责任人的协调成本。
具体来说:
- 新阶段需要的是另一种证据。 来源、交易流水、渲染出来的页面、统计结果,核对方式各不相同; 核对其中一种的专家团,不是核对另一种的那一支。
- 新阶段需要一个独立的读者。 如果这一段的意义就是不同意上一段,那它必须是另一支专家团—— 同一批角色复核自己的产出,只是名义上的复核。
- 新阶段产出的东西,后面要依赖。 带来源的类型化 Artifact,才让这种依赖成为真的依赖,而不是叙述。
除此之外的一切,都应该留在你已经有的那支专家团里面。
相关
- 长程工作在哪里断 —— 组合要解决的那三种失败
- Mission 如何运行长程任务 —— 依赖图、冻结与重开
- 专家团市场 —— 上面提到的每一支,含角色与工作流
- 专家团怎么进化 —— 修订链条中的某一支