跳转到内容

专家团组合

为什么最长的工作是几支专家团、而不是一支跑更久;以 DeBERTa 研究工程和 OpenCorvus 自述论文两个 Mission 完整走一遍。

最长的工作不是一支队伍干更久,而是几支队伍各自负责一段,每一段交给下一段的都是能读的东西。

这是关于失败模式的判断,不是关于组织架构的偏好。一支队伍从第一份资料一路扛到最终文件,会累积自己 早期的判断偏差,会和自己抢上下文,最后还要复核自己写的东西。把结果拆成有归属的阶段,等于在每一次 交接的两侧各放一支专家团——角色不同、工具不同,而且对上一段的结论没有任何立场。

Mission 持有什么

Mission 在启动时记录哪些专家团 ID 可用。之后再安装的能力不会静默扩大这个集合。子任务创建时,从这个 集合里解析出一个精确的包版本及其已选工作流,在该任务的生命周期内固定不变。

所以组合发生在 Mission 层,归属仍留在任务层。把专家团组合起来,不会稀释任何一项交付的责任人。

案例:把 DeBERTa 从模型卡做到公开仓库

最短而完整的链条有六项交付:模型与数据;带实时监控和推理页的仅限 CUDA 训练系统;架构证据; ACL 风格短文;独立论文审校;以及 Mission 仓库。这里的每一个数字都从目录解析而来,不是写死在 这一页上的。

6 支专家团44 个具名角色

原始 Mission 要求
  1. 下载 DeBERTa v3 Base ABSA v1.1;重新调研资料,检索或合成可追溯训练数据,并完成模型训练。
  2. 完整配置仅限 CUDA 的训练环境,禁止 CPU 训练;每次创新设计与模型迭代都记录训练/测试性能;建设自动更新数据的训练监控与推理网页,并持续超过明确基线。
  3. 根据最佳实验对应的模型架构与设计思路,绘制可复现、可发表的图表。
  4. 调研相关文献并撰写一篇完整的 ACL 风格短文,正文至少四页。
  5. 深入审查并校对论文,消除事实错误,优化组织结构,使全文 concise 且 informative。
  6. 创建组织清晰的 Git 仓库,用 Mission 模式分解并执行复杂任务,最终完成经审查的 GitHub 推送。

查看经审计的 CUDA 实验 GitHub 产物 ↗

阶段专家团角色交出什么
模型与数据深度研究6核验 DeBERTa v3 Base ABSA v1.1 来源,重查 ABSA 证据,并形成检索、清洗或合成训练数据的可追溯方案。
CUDA 训练系统Advanced14交付仅限 CUDA 的运行环境、基线与候选训练、实验台账,以及自动更新的训练监控与推理网页。
架构证据数据分析与商业洞察7对齐最佳实验、模型架构与设计思路,产出绑定精确 checkpoint 的可复现图表。
ACL 短文研究工作室5基于相关工作与最佳实验,完成至少四页、concise 且 informative 的 ACL 风格短文。
独立论文审校学术论文审查8逐项结算事实、引文、新颖性、方法、结构、图表、幻觉风险、简洁性与信息密度问题。
Mission 仓库Base4交付可复现、组织清晰的 Git 仓库,包含 Mission 阶段图、经审查的文档与已验证的 GitHub 推送。

要看的是它的形状,而不是单个模型选择。落地页可以把同一个 Mission 从六项交付展开成十八个专家团 Task:来源与数据血缘、CUDA 环境、训练实验、指标对账、真实监控与推理网页、图表、相关工作、论文审计、 独立复现、仓库加固和发布。任务规模变大了,但不会让同一支队伍同时编写、测试、审查并批准自己的工作。

案例:让 OpenCorvus 研究并介绍自己

第二个长 Mission 不是让系统凭记忆写一篇产品软文,而是要求它从源码、当前架构规格、发布产物、版本历史、 实证评测和实际阅读过的相关工作建立证据链,再完成一篇正文至少 30 页的系统论文。参考文献和附录不计入 页数,也不能靠重复背景、泛泛而谈、超大图表或稀疏排版灌水。

9 支专家团55 个具名角色

原始 Mission 要求
  1. 从实际检查过的源码、当前架构规格、文档、发布产物和版本历史重建 OpenCorvus;禁止凭记忆或产品宣传写作。
  2. 实际阅读相关工作,提出可证伪问题与边界清楚的贡献,并设计含基线、指标、不确定性、失败案例和消融的可复现实证评测。
  3. 成稿前必须使用研究工作室的 analysis-report-quality Skill 建立唯一且验证过的证据模型;系统论文有效正文至少 30 页,参考文献和附录不计页数。
  4. 禁止用重复背景、泛泛的 Agent 文案、超大图表、稀疏排版、把正文挪进附录或无证据主张灌水。
  5. 每张必要图表都要从已验收数据重新绘制,具备出版级层级、标签、单位、样本量、不确定性、来源、图注和无障碍编码;严禁原始 notebook 或图表库默认输出。
  6. 独立审查文献、新颖性、逻辑、方法、统计、事实、引文、幻觉风险和呈现,结算全部 critical/major 问题,并一起交付论文、源文件、参考文献、证据台账、图表源文件和复现说明。
可直接交给 OpenCorvus 的 Mission

完成下面的长 Mission,每一个编号都必须由一支完整专家团负责。最终交付一篇介绍 OpenCorvus 的通用学术系统论文:正文至少 30 页,参考文献和附录不计入页数;禁止用重复背景、泛泛而谈的 Agent 文案、超大图表、稀疏排版、把正文挪进附录或无证据主张凑页数。必须从当前源码、架构规格、文档、发布产物与版本历史重建系统;检索并实际阅读多 Agent Harness、长程执行、证据交接、评测与自我改进的相关论文和官方资料;提出可证伪的研究问题与边界清楚的贡献;把架构、控制流、持久化、Task/Mission 语义、专家团组合与进化、权限、恢复和可观测性逐项绑定到精确证据。设计并运行可复现的实证评测,明确基线、数据集或案例、指标、不确定性、失败案例、消融和局限,保存可运行脚本与规范结果表。研究工作室必须先使用 analysis-report-quality Skill 建立并验证唯一证据模型,再开始写作。每一张图表都必须必要、绑定主张、可追溯来源且可独立复现,并以结论式标题、清晰标签、单位、样本量、不确定性、完整图注、无障碍编码和统一出版主题重新绘制;严禁原始 notebook 输出、图表库默认样式、裁切标签、装饰性架构图、用截图代替证据或任何视觉垃圾。正文必须完整包含摘要、引言、研究问题、相关工作、系统设计、实现、方法、结果、消融、讨论、有效性威胁、局限、负责任使用与安全、可复现性声明、结论和核验过的参考文献。最后分别执行文献、新颖性、逻辑、方法/统计/事实、引文/幻觉与呈现审查,结算全部 critical 和 major 问题,让图表再次对齐最终正文,并一起交付论文、源文件、参考文献、证据台账、图表源文件和复现说明。

阶段专家团角色交出什么
冻结研究章程科学研究设计4冻结可证伪问题、贡献边界、替代解释、证据需求、伦理边界和禁止灌水的验收契约。
建立一手证据库深度研究6实际核验源码、规格、版本、历史、论文与官方资料,形成主张级定位和检索边界。
重建系统机制Advanced14以可执行证据重建控制流、持久化、Mission/Task 语义、专家团、进化、权限、恢复与可观测性。
运行实证评测数据分析与商业洞察7交付可复现基线、案例、指标、不确定性、消融、失败分析、规范结果表和已核查定量主张。
独立复现审查与调试4洁净环境复现关键工作流与结果,修复真实根因并记录仍未解决的边界。
定位相关工作专利格局与现有技术4形成可复现检索的相关工作版图,区分已核验工作、重叠、可辩护创新与未知项。
精修全部图表Office 交付3从已验收数据重绘出版级架构图、实验图、消融图与对比图,绝不交付原始绘图输出。
撰写三十页论文研究工作室5使用 analysis-report-quality Skill 建立唯一证据模型,完成正文 30 页以上、简洁而信息密集且主张、文字、图表、局限和引文一致的论文。
独立审稿并定稿学术论文审查8结算文献、新颖性、逻辑、方法、统计、事实、引文、幻觉和呈现问题,并最终对账图表与正文。

成稿阶段必须使用 Research Studio 的 analysis-report-quality Skill 建立唯一、验证过的证据模型。所有图表 从已验收数据重新绘制,带结论式标题、单位、样本量、不确定性、来源和可访问编码;原始 notebook 输出、 图表库默认主题、裁切标签和装饰性垃圾不能进入论文。最后由学术论文审查专家团独立核查文献、新颖性、逻辑、 方法、统计、事实、引文幻觉和呈现质量,并逐项结算全部 critical 与 major 问题。

其它已经能用的组合

同样的形状,换三个更短的领域:

怎么决定在哪里拆

在「一项交付可以被独立归属、独立验收、或被独立依赖」的地方拆。为拆而拆只会制造没有责任人的协调成本。

具体来说:

  • 新阶段需要的是另一种证据。 来源、交易流水、渲染出来的页面、统计结果,核对方式各不相同; 核对其中一种的专家团,不是核对另一种的那一支。
  • 新阶段需要一个独立的读者。 如果这一段的意义就是不同意上一段,那它必须是另一支专家团—— 同一批角色复核自己的产出,只是名义上的复核。
  • 新阶段产出的东西,后面要依赖。 带来源的类型化 Artifact,才让这种依赖成为真的依赖,而不是叙述。

除此之外的一切,都应该留在你已经有的那支专家团里面。

相关