Skip to content

Commit 17ec054

Browse files
committed
docs(organization): 记录专用反刍组合复验结果
- 验证反刍三工具生效,保留其它行为耗尽与写前重读证据 - 记录 best-effort 图结果及 preview 清理
1 parent 5fef0fd commit 17ec054

5 files changed

Lines changed: 27137 additions & 2 deletions

File tree

‎tasks/knowledge-lifecycle-capabilities/decisions/D551-D560.md‎

Lines changed: 2 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -12,6 +12,8 @@
1212
或其它行为的精确写入。不因单轮未使用就删除其图检索能力;核查说明见 remaining-budget-diagnosis。
1313
- **验证**:同步现有黑盒 fixture 与 preview 驱动的 definition 装配逻辑,不新增测试。
1414
本轮静态检查,不把之前 guidance 轮当作本次修正的真实模型验收。
15+
- **后续验收**:Sir 随后要求重新验收,focal 轮已完成并清理。Rumination 4/4/5 全部结束且只绑定三工具;
16+
evidence stance/synthesis 仍耗尽,写前重读未消除。见 [focal 评审](../units/organization-nowledge-study/acceptance/focal-review.md)。
1517

1618
### D-553 — 保持产品职责,优化检索契约与最小充分引导后复测
1719

Lines changed: 69 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,69 @@
1+
# Rumination 专用工具组合复测
2+
3+
D-554 的工具组合修复已在实际运行中生效。Rumination 三次均自然结束,但整轮仍有 evidence stance 和
4+
synthesis 耗尽,写前重复读取也仍存在,因此不能宣布所有执行效率问题已解决。派生内容准确性残余按
5+
Sir 已确认的 best-effort 处理,不以这些残余单独否定本次工具组合修复,也不追加未经确认的修复。
6+
7+
## 运行条件
8+
9+
源码为 5fef0fd8144a6b5e0952bbbdd1cf6bd6099502c1。Preview application 34684004663 成功;
10+
debug 34684003813 首次配置读回失败,重跑后成功,之后才启动 Agent。原始证据保存于
11+
[tool-repair-focal.json](tool-repair-focal.json)。
12+
13+
仍使用 qwen3.6-plus、12 次模型调用预算、原初始 fixture、max_seeds=3,以及前三种顺序、后四种独立入队的
14+
调度方式。预算没有进入提示词,语义 Profile 仍未配置。本轮没有新增测试或运行 upstream-change 阶段;
15+
只为既有驱动新增 focal 输出名称,未更改验收逻辑。候选及前序图变化意味着这不是严格单变量实验。
16+
17+
## 结果
18+
19+
| 行为 / Job | 模型调用次数 | 结果 |
20+
| --- | --- | --- |
21+
| rumination / 81 | 4、4、5 | 全部自然结束 |
22+
| supersession / 82 | 4、5、3 | 全部自然结束 |
23+
| refinement / 83 | 7、4、5 | 全部自然结束 |
24+
| evidence stance / 84 | 12 | 首次耗尽,无写入 |
25+
| synthesis / 85 | 12 | 首次耗尽,最后一次写入成功 |
26+
| existing referent anchoring / 86 | 5、10、9 | 全部自然结束 |
27+
| duplicate assertion / 87 | 3、3、5 | 全部自然结束 |
28+
29+
5/7 Job 完成,15/17 次执行自然结束。共 100 次模型调用、126 次工具调用,零工具错误。
30+
不能将与上轮的总调用数差直接解释为效率提升:本轮两个 Job 首次失败,未继续剩余 seed。
31+
32+
## 修复效果与残余
33+
34+
实际 thread.created 记录确认 rumination 仅绑定 get_draft_graph_schema、draft_graph、submit_graph,
35+
使用独立完整提示词,没有探索与 candidate 指导。三次分别处理五月事故、checkout 团队假说和修订方案,
36+
只经过草稿与提交,没有查询图、读取实体或标记 candidate,也没有写后确认循环。
37+
第一、第三个 seed 与 guidance 轮原始信息角色相同,调用数分别从 8→4、11→5;中间 seed 不同,不能比较。
38+
这支持恢复原用法的修复有效,不保证所有未来输入都能在同样次数内完成。
39+
40+
写前无需重读的说明也确实出现在 Job 84/85 的实际系统提示词中,但未消除下述重复:
41+
42+
- Job 84 输入已包含 305 全文,调用 1 仍读取 305,并同时查询其邻域。邻域已返回完整 311,调用 2 又读取 311。
43+
- Job 85 调用 1 的邻域已返回 311–316 全文,调用 3 重新读取 312–316,调用 6 又用 Resolver 读取 311。
44+
45+
这些是实际内容重叠,不只是“多次用了读工具”。它们发生在写入前,不能归为写后确认回执,也不能因已经
46+
增加说明就声称根因解决。当前轨迹不足以进一步断定模型为什么忽略了已有内容。
47+
48+
Job 84 的 12 次 retrieve 有 6 次词法空结果,其余多次只返回已知方案。调用 8 才查询 Nimbus 扩展材料,
49+
随后继续搜索 approval、replay passed 等没有找到的证据,到第 12 次仍在检索,没有写入。
50+
这与之前的长查询/目标发现不收敛问题相似,但 seed 是修订方案而非此前实验或五月事故,不能视作严格重放。
51+
52+
Job 85 则在收集与反复读取方案派生片段、查询已有综合及 find_path 后,于调用 12 成功创建综合 324,
53+
下一轮自然结束的机会已被调用上限截断。它有有效产出,不是纯检索死循环;也不能据此证明多给一次必定结束。
54+
55+
## 图与 best-effort 记录
56+
57+
最终图为 36 Blocks、21 Relations。五月事故提取的两个 Block 有来源边;checkout 假说保留了 pre-replay
58+
和未确认性质;综合 324 连接原始方案 304/305 并保留 rollout 条件。这些是可见的有效整理结果。
59+
60+
仍可观察到信息与关系语义残余:rumination 为方案机制增加解释,创建的方案子图未直接连回原始 305,
61+
316 replaces 311 的方向与文本含义相反;后续存在 311 supersedes 316,以及复合原文 306 与其局部提取
62+
309 之间的 duplicates assertion。它们作为 best-effort 观察保留,本轮没有为此调整提示词或写入机制。
63+
这不把这些关系重新定义为正确,也不从“接受部分准确性不足”推导出任意未来错误均可忽略。
64+
65+
## 清理与交接
66+
67+
本轮 36 Blocks、21 Relations、8 Jobs、7 Agents、1 Model、1 Provider 已移除;临时配置恢复/移除,
68+
日志导出后清理,所有 remaining_new_ids 为空,无驱动 failure。验收后的只读检查也返回 jobs=[]。
69+
当前可以确认 rumination 工具组合修复生效;其余耗尽和写前重读问题保持未解决,不继续擅改实现。

‎tasks/knowledge-lifecycle-capabilities/units/organization-nowledge-study/acceptance/preview-tool-repair.py‎

Lines changed: 3 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -30,9 +30,10 @@
3030
"array",
3131
"references",
3232
"guidance",
33+
"focal",
3334
):
3435
raise ValueError(
35-
"Choose baseline, repaired, prompt, batch, array, references or guidance"
36+
"Choose baseline, repaired, prompt, batch, array, references, guidance or focal"
3637
)
3738
OUT = Path(__file__).with_name(f"tool-repair-{MODE}.json")
3839
RESUME = "--resume" in sys.argv
@@ -42,7 +43,7 @@
4243
DEFINITIONS_PATH = ROOT / "tests/organization/acceptance/agent_definitions.json"
4344
DEFINITIONS = (
4445
json.loads(DEFINITIONS_PATH.read_text())
45-
if MODE in ("prompt", "batch", "array", "references", "guidance")
46+
if MODE in ("prompt", "batch", "array", "references", "guidance", "focal")
4647
else None
4748
)
4849
secret = subprocess.check_output(

0 commit comments

Comments
 (0)