|
| 1 | +# Rumination 专用工具组合复测 |
| 2 | + |
| 3 | +D-554 的工具组合修复已在实际运行中生效。Rumination 三次均自然结束,但整轮仍有 evidence stance 和 |
| 4 | +synthesis 耗尽,写前重复读取也仍存在,因此不能宣布所有执行效率问题已解决。派生内容准确性残余按 |
| 5 | +Sir 已确认的 best-effort 处理,不以这些残余单独否定本次工具组合修复,也不追加未经确认的修复。 |
| 6 | + |
| 7 | +## 运行条件 |
| 8 | + |
| 9 | +源码为 5fef0fd8144a6b5e0952bbbdd1cf6bd6099502c1。Preview application 34684004663 成功; |
| 10 | +debug 34684003813 首次配置读回失败,重跑后成功,之后才启动 Agent。原始证据保存于 |
| 11 | +[tool-repair-focal.json](tool-repair-focal.json)。 |
| 12 | + |
| 13 | +仍使用 qwen3.6-plus、12 次模型调用预算、原初始 fixture、max_seeds=3,以及前三种顺序、后四种独立入队的 |
| 14 | +调度方式。预算没有进入提示词,语义 Profile 仍未配置。本轮没有新增测试或运行 upstream-change 阶段; |
| 15 | +只为既有驱动新增 focal 输出名称,未更改验收逻辑。候选及前序图变化意味着这不是严格单变量实验。 |
| 16 | + |
| 17 | +## 结果 |
| 18 | + |
| 19 | +| 行为 / Job | 模型调用次数 | 结果 | |
| 20 | +| --- | --- | --- | |
| 21 | +| rumination / 81 | 4、4、5 | 全部自然结束 | |
| 22 | +| supersession / 82 | 4、5、3 | 全部自然结束 | |
| 23 | +| refinement / 83 | 7、4、5 | 全部自然结束 | |
| 24 | +| evidence stance / 84 | 12 | 首次耗尽,无写入 | |
| 25 | +| synthesis / 85 | 12 | 首次耗尽,最后一次写入成功 | |
| 26 | +| existing referent anchoring / 86 | 5、10、9 | 全部自然结束 | |
| 27 | +| duplicate assertion / 87 | 3、3、5 | 全部自然结束 | |
| 28 | + |
| 29 | +5/7 Job 完成,15/17 次执行自然结束。共 100 次模型调用、126 次工具调用,零工具错误。 |
| 30 | +不能将与上轮的总调用数差直接解释为效率提升:本轮两个 Job 首次失败,未继续剩余 seed。 |
| 31 | + |
| 32 | +## 修复效果与残余 |
| 33 | + |
| 34 | +实际 thread.created 记录确认 rumination 仅绑定 get_draft_graph_schema、draft_graph、submit_graph, |
| 35 | +使用独立完整提示词,没有探索与 candidate 指导。三次分别处理五月事故、checkout 团队假说和修订方案, |
| 36 | +只经过草稿与提交,没有查询图、读取实体或标记 candidate,也没有写后确认循环。 |
| 37 | +第一、第三个 seed 与 guidance 轮原始信息角色相同,调用数分别从 8→4、11→5;中间 seed 不同,不能比较。 |
| 38 | +这支持恢复原用法的修复有效,不保证所有未来输入都能在同样次数内完成。 |
| 39 | + |
| 40 | +写前无需重读的说明也确实出现在 Job 84/85 的实际系统提示词中,但未消除下述重复: |
| 41 | + |
| 42 | +- Job 84 输入已包含 305 全文,调用 1 仍读取 305,并同时查询其邻域。邻域已返回完整 311,调用 2 又读取 311。 |
| 43 | +- Job 85 调用 1 的邻域已返回 311–316 全文,调用 3 重新读取 312–316,调用 6 又用 Resolver 读取 311。 |
| 44 | + |
| 45 | +这些是实际内容重叠,不只是“多次用了读工具”。它们发生在写入前,不能归为写后确认回执,也不能因已经 |
| 46 | +增加说明就声称根因解决。当前轨迹不足以进一步断定模型为什么忽略了已有内容。 |
| 47 | + |
| 48 | +Job 84 的 12 次 retrieve 有 6 次词法空结果,其余多次只返回已知方案。调用 8 才查询 Nimbus 扩展材料, |
| 49 | +随后继续搜索 approval、replay passed 等没有找到的证据,到第 12 次仍在检索,没有写入。 |
| 50 | +这与之前的长查询/目标发现不收敛问题相似,但 seed 是修订方案而非此前实验或五月事故,不能视作严格重放。 |
| 51 | + |
| 52 | +Job 85 则在收集与反复读取方案派生片段、查询已有综合及 find_path 后,于调用 12 成功创建综合 324, |
| 53 | +下一轮自然结束的机会已被调用上限截断。它有有效产出,不是纯检索死循环;也不能据此证明多给一次必定结束。 |
| 54 | + |
| 55 | +## 图与 best-effort 记录 |
| 56 | + |
| 57 | +最终图为 36 Blocks、21 Relations。五月事故提取的两个 Block 有来源边;checkout 假说保留了 pre-replay |
| 58 | +和未确认性质;综合 324 连接原始方案 304/305 并保留 rollout 条件。这些是可见的有效整理结果。 |
| 59 | + |
| 60 | +仍可观察到信息与关系语义残余:rumination 为方案机制增加解释,创建的方案子图未直接连回原始 305, |
| 61 | +316 replaces 311 的方向与文本含义相反;后续存在 311 supersedes 316,以及复合原文 306 与其局部提取 |
| 62 | +309 之间的 duplicates assertion。它们作为 best-effort 观察保留,本轮没有为此调整提示词或写入机制。 |
| 63 | +这不把这些关系重新定义为正确,也不从“接受部分准确性不足”推导出任意未来错误均可忽略。 |
| 64 | + |
| 65 | +## 清理与交接 |
| 66 | + |
| 67 | +本轮 36 Blocks、21 Relations、8 Jobs、7 Agents、1 Model、1 Provider 已移除;临时配置恢复/移除, |
| 68 | +日志导出后清理,所有 remaining_new_ids 为空,无驱动 failure。验收后的只读检查也返回 jobs=[]。 |
| 69 | +当前可以确认 rumination 工具组合修复生效;其余耗尽和写前重读问题保持未解决,不继续擅改实现。 |
0 commit comments