WORKFLOW ARENA · LUNA/HIGH · 5 WORKFLOWS · 8 TASKS

同一批任务,
五种技能工作流。

这是 Workflow Arena 的 Luna 五工作流、八任务横评面板:比较产品分、精确测试、workflow 完成率和候选侧资源,把五种方法放在同一组任务尺度上观察。

WORKFLOW ARENA候选 Luna/highOperator + Judge Terra/high每格 n=3
候选运行120

5 workflows × 8 tasks × 3

自动盲评分240

每条 run 两个 score

Focused tests93 / 120

compact 表中的通过标志

终态107 · 12 · 1

completed / protocol-failed / token-limit

01 / DIRECT ANSWER

Grill Me 当前领跑,但这不是“通用冠军”证明

宏均分是八个 task cell 等权平均;每格只有三条。

质量 / 成本同时看92.14

Grill Me · 23/24 tests

平均 5.85M candidate token、18.50 分钟;在当前面板中分数与精确测试通过数最高。

Full 不是最高分

Superpowers Full 为 89.64、21/24 tests,但平均 32.99M token 和 48.38 分钟,约为 Grill Me 的 5.64× token、2.62× 时间。

流程完成不能被分数替代

MatrixSpec L0 得分 86.71、19/24 tests,但 workflow 只完成 11/24;协议失败必须单列。

没有同期 Bare

该面板不能回答“相比原生 Luna 提升多少”,也不能与本站 Terra 单任务五组直接相减。

02 / QUALITY × COST

五种工作流的发布结果

Score、tests 和 workflow completion 是不同终点;token、时间和 credits 只描述候选侧计算负担。

01
需求决策循环

Grill Me

24/24 workflow · 23/24 tests · 11.58 operator decisions/run

宏均分92.14
Token5.85M
时间18.50m
Credits91.32
02
完整 SDLC workflow

Superpowers Full

24/24 workflow · 21/24 tests · 8.92 operator decisions/run

宏均分89.64
Token32.99M
时间48.38m
Credits324.64
03
状态机 + 独立 reviewer

MatrixSpec L0

11/24 workflow · 19/24 tests · 10.33 operator decisions/run

宏均分86.71
Token21.05M
时间41.24m
Credits247.38
04
proposal → apply

OpenSpec core

24/24 workflow · 16/24 tests · 0.08 operator decisions/run

宏均分72.00
Token5.51M
时间13.62m
Credits55.18
05
单体完整规则集

Ponytail

24/24 workflow · 14/24 tests · 0.00 operator decisions/run

宏均分70.19
Token3.17M
时间9.25m
Credits34.48
03 / TASK MATRIX

不是每个任务都有相同排序

每个单元格是三条 run 的 mean score,再按八个任务等权求宏均分。

WorkflowCLI fieldsESLintpytest pluginpytest addinibat sanitizeSQLModelAxumPrometheusMacro
Grill Me10099.6798.6786.8397.338697.8370.8392.14
Superpowers Full99.179999.5089.5075.3384.3397.5072.8389.64
MatrixSpec L094.5094.5095.1787.178784.8387.1763.3386.71
OpenSpec core83.334894.8379.3389.8381.67653472.00
Ponytail78.3347.6794.5085807361.6741.3370.19

稳定高分区:CLI、pytest plugin 与 Axum 上,多数 workflow 都能达到较高分;流程差异更容易体现在资源和完成状态。

分化区:ESLint 和 Prometheus 上差距最大。Grill Me 的 ESLint 为 99.67,但 Prometheus 仍只有 70.83;单一宏均分会隐藏任务敏感性。

04 / WHAT IS GRILL ME

本体很小,实验 treatment 比 Skill 本身更完整

01

/grill-me wrapper

显式入口,原始内容只是启动一个 /grilling session;它禁止模型自动调用。

02

grilling primitive

沿决策树一次问一个问题,每题给推荐答案;可查事实自己探索,产品决策交给用户。

03

Workflow Arena adapter

强制 operator marker、多轮 GT 回答和实施前共享理解审批;批准后才允许原生实现与验证。

探索事实一次一个决策Operator 回答共享理解获批单 Agent 实现 / 验证

它没有 Full Superpowers 的正式 spec、writing-plans、TDD、任务拆分、子代理实施或独立 review loop。当前结果测量的是“两个窄 Skill + harness 强制的 GT 决策闭环”,不能归因于一行 prompt。

05 / EXECUTION STATUS

产品质量、精确测试和协议可靠性必须并列

107workflow completed
12protocol failed
1token limit
93focused-test flags passed
Candidate + subagents1.602B13.35M token / run
GT operator122.27M1.02M token / run
Matrix reviewer43.50M23 reviewer units
Blind judges38.99M240 judgments
MatrixSpec 的 12 条协议失败

9 条是独立 reviewer 修改产品文件,另有 review 尝试耗尽、无效 stage verdict、以及 review 前创建 full baseline 文档各 1 条。报告保留这些失败,没有用高盲评分覆盖流程终态。