参考资料
实验与验证
本站的每个数字都来自项目仓库里的对照实验,不来自直觉。
基准测试怎么跑
隔离环境
每次运行使用临时 HOME 和独立工作区,并剥离其他插件;发现任何污染痕迹的运行直接作废。
对照设计
同一模型、同一提示词、同一仓库状态:基线组不装插件,候选组装当前插件;随机场景每组至少采样 3 次。
确定性评分
用可执行的评分器检查实际发生了什么:改了哪些文件、是否复用了既有能力、有没有未授权提交,而不是印象分。
指纹分群
每次指令修改都会产生新指纹;不同指纹的结果绝不混合平均。
关键结果
这些数字来自项目自己公开的测试记录,本页不会重新计算。
51/51智能体行为未装工作流的对照组:45/51
12/12多轮任务连续性对照组:0/12
51/51显式调用路由错误路由 0 · 遗漏 0 · 冲突 0
50/50静态测试全部确定性检查通过
实验改变了什么
两个自动触发实验都被回滚。它们就是今天所有工作流都必须显式调用的原因。
自动加载设计技能
自动加载 code-design 的触发准确率是 100%,但结果没有变好:耗时 +34.6%、工具调用 +75%、输入 token +76.9%。开销是真的,收益不存在,于是改为用户显式调用。
自动触发诊断
即使收窄了描述,模型仍然会把无关的策略修改当成诊断任务。负面措辞构不成确定性边界,于是全部工作流改为显式调用,只保留极简核心自动注入。
显式调用决定整个任务的处理方式;自动的那部分只保留小而确定的规则。
验证状态与限制
- 静态与确定性测试:50/50 通过。
- Codex 当前通用 cohort:17 个场景,候选组 51/51 通过;显式调用 51/51,误触发、漏触发、碰撞、污染和未授权提交均为 0。
- 最新任务级配对 A/B:相同模型、推理等级和最终场景指纹下,current-release 对照组 0/12,候选组 12/12。
- Claude Code 2.1.197 通过 strict manifest 校验,并完成显式 /engineering-flow:develop 实机样本。
- Claude 的 Core-only 歧义样本尚未达到 Codex 同等行为,涉及数据、权限等重大决定时应显式调用完整工作流。
- 完整工作流会增加上下文、工具调用和耗时,这正是它们不会被加载到每个请求里的原因。
这些数字只代表所列版本的真实结果,不能当作对其他模型、供应商或环境的保证。