Without · EXPERIMENT DETAIL

Without · 原生直接执行

公开目标明确,但隐藏规格没有被强制转成设计清单时,原生 Codex 会怎么做?

01 / 结果快照
盲评分81.67
tool calls / 条32.7
dedup token / 条2.08M
墙钟 / 条8:36

证据:三条 run 平均 32.7 次 tool calls、2.08M dedup token、81.67 分;requirements / plan 阶段没有独立 gate,root lane 占主导。

边界:没有 operator 澄清和独立 review,不等于没有测试;focused-test 日志存在且通过,但它不能覆盖全部 hidden contract。

02 / 作业路径

这个条件具体要求候选做什么?

  1. 01读取仓库与现有实现
  2. 02直接修改 product code / tests
  3. 03运行 focused Go tests
  4. 04根据失败继续调试或收尾
03 / 阶段与 actor

时间 / token 的主要落点

测试 / 调试37.0%
协调24.0%
探索20.2%
实现9.5%
Review5.1%
完成4.3%

阶段是可见动作分类器的派生标签。Full 页面中的 coordinate 具体包括 spawn_agentwait_agentfollowup_tasksend_message、worktree / approval / guardian 等过程动作,不等同于“模型在思考”。

04 / 本组 run

每条轨迹的真实状态

run-0182.0
墙钟
7:01
Token
1.27M
tool calls
23
Operator
0
需求审批
Review / 修复
0 / 0
状态
completed
首次 mutation
+2:15
在总时间线中定位 →
run-0482.5
墙钟
12:12
Token
3.94M
tool calls
54
Operator
0
需求审批
Review / 修复
0 / 0
状态
completed
首次 mutation
+2:03
在总时间线中定位 →
run-0580.5
墙钟
6:36
Token
1.02M
tool calls
21
Operator
0
需求审批
Review / 修复
0 / 0
状态
completed
首次 mutation
+1:49
在总时间线中定位 →
05 / 回到问题

把本组放回五组比较

这张子页解释“这条方法怎么走”;首页的三个研究问题再回答质量—成本、需求 / review 阶梯和 token 归因。

返回首页三问 →