工程设计
只看 PASS 会骗你,6 条 Agent Trace 里的 Coding Agent 评测真相
我让 gpt-6-astra 和 claude-fable-5.1 分别在 Evot、Pi、DeepSeek Harness 上修复 serde_json 的同一个 JSON 解析 Bug。六次运行都通过了完整测试,核心补丁逐字节相同。只看 PASS 率,六次没有区别。Trace 记录了另一组数据。GPT-6-Astra 平均请求模型 9 次,耗时 52.0 秒。Claude-Fable-5.1 平均请求 13 次,耗时 118.6 秒,输出 token 是前者的 9.6 倍。六次运行还撞上了同一个环境问题。Claude 在 Pi 上为此多花 3 个回合,在 DSH 上触发上下文压缩,最终答复也被完整生成了两遍。这些情况都不会出现在最终 diff 里。本文只讨论这六条真实 Session 里的工程行为,不给两个模型做通用排名。就这次实验而言,最终 diff 提供的信息最少。






