参考资料

实验与验证

本站的每个数字都来自项目仓库里的对照实验,不来自直觉。

基准测试怎么跑

隔离环境

每次运行使用临时 HOME 和独立工作区,并剥离其他插件;发现任何污染痕迹的运行直接作废。

对照设计

同一模型、同一提示词、同一仓库状态:基线组不装插件,候选组装当前插件;随机场景每组至少采样 3 次。

确定性评分

用可执行的评分器检查实际发生了什么:改了哪些文件、是否复用了既有能力、有没有未授权提交,而不是印象分。

指纹分群

每次指令修改都会产生新指纹;不同指纹的结果绝不混合平均。

关键结果

这些数字来自项目自己公开的测试记录,本页不会重新计算。

51/51智能体行为未装工作流的对照组:45/51
12/12多轮任务连续性对照组:0/12
51/51显式调用路由错误路由 0 · 遗漏 0 · 冲突 0
50/50静态测试全部确定性检查通过
打开完整验证结果页

实验改变了什么

两个自动触发实验都被回滚。它们就是今天所有工作流都必须显式调用的原因。

自动加载设计技能

自动加载 code-design 的触发准确率是 100%,但结果没有变好:耗时 +34.6%、工具调用 +75%、输入 token +76.9%。开销是真的,收益不存在,于是改为用户显式调用。

自动触发诊断

即使收窄了描述,模型仍然会把无关的策略修改当成诊断任务。负面措辞构不成确定性边界,于是全部工作流改为显式调用,只保留极简核心自动注入。

显式调用决定整个任务的处理方式;自动的那部分只保留小而确定的规则。

验证状态与限制

  • 静态与确定性测试:50/50 通过。
  • Codex 当前通用 cohort:17 个场景,候选组 51/51 通过;显式调用 51/51,误触发、漏触发、碰撞、污染和未授权提交均为 0。
  • 最新任务级配对 A/B:相同模型、推理等级和最终场景指纹下,current-release 对照组 0/12,候选组 12/12。
  • Claude Code 2.1.197 通过 strict manifest 校验,并完成显式 /engineering-flow:develop 实机样本。
  • Claude 的 Core-only 歧义样本尚未达到 Codex 同等行为,涉及数据、权限等重大决定时应显式调用完整工作流。
  • 完整工作流会增加上下文、工具调用和耗时,这正是它们不会被加载到每个请求里的原因。
这些数字只代表所列版本的真实结果,不能当作对其他模型、供应商或环境的保证。