Slim With · EXPERIMENT DETAIL

Slim With · 一次澄清与 Plan-on

一次外部行为问答和一个计划入口,能否以很小的成本补足原生路径?

01 / 结果快照
盲评分83.17
tool calls / 条34.7
dedup token / 条2.27M
墙钟 / 条9:10

证据:三条 run 平均 34.7 次 tool calls、2.27M dedup token、83.17 分;相对 Without 只增加 +1.50 分。

边界:这是历史追加批次,不能和 Requirement Loop 当作同期随机对照;没有 Full 的 TDD、spec commit、子代理或独立 reviewer gate。

02 / 作业路径

这个条件具体要求候选做什么?

  1. 01第一动作读取 brainstorming
  2. 02询问一次外部行为问题
  3. 03读取 writing-plans 并形成计划
  4. 04同一 session 原生实施、按需 debug、完成前 verify
03 / 阶段与 actor

时间 / token 的主要落点

测试 / 调试39.3%
协调27.9%
探索11.6%
Review6.8%
实现5.6%
完成3.5%

阶段是可见动作分类器的派生标签。Full 页面中的 coordinate 具体包括 spawn_agentwait_agentfollowup_tasksend_message、worktree / approval / guardian 等过程动作,不等同于“模型在思考”。

04 / 本组 run

每条轨迹的真实状态

slim-0184.0
墙钟
8:46
Token
2.49M
tool calls
34
Operator
1
需求审批
Review / 修复
0 / 0
状态
completed
首次 mutation
+2:32
在总时间线中定位 →
slim-0279.0
墙钟
9:08
Token
2.03M
tool calls
34
Operator
1
需求审批
Review / 修复
0 / 0
状态
completed
首次 mutation
+2:20
在总时间线中定位 →
slim-0386.5
墙钟
9:36
Token
2.30M
tool calls
36
Operator
1
需求审批
Review / 修复
0 / 0
状态
completed
首次 mutation
+2:26
在总时间线中定位 →
05 / 回到问题

把本组放回五组比较

这张子页解释“这条方法怎么走”;首页的三个研究问题再回答质量—成本、需求 / review 阶梯和 token 归因。

返回首页三问 →