同一个模型,为什么会变成完全不同的 Agent
我们过去习惯用“模型能力”解释 Agent 的表现:任务完成得好,是因为模型更强;执行失败,则归因于模型能力不足。但本周多项实践都在说明,同一个模型放进不同的 Harness,可能会表现得像完全不同的 Agent。
OpenAI 在 ARC-AGI-3 实验中没有更换模型,只是保留推理过程,并调整长任务中的上下文压缩方式,得分就从 13.3% 提高到 38.3%,输出 Token 同时减少约六倍。SIGIL 将自然语言 Skill 编译成可执行 Harness 后,Agent 对规定步骤的执行率也从 56% 提高到 86%。Cursor 的实践则进一步表明,持续增加 Prompt 和 Skills 带来的改善有限,最终仍需要统一 CLI、进程托管和环境恢复机制。
这意味着,我们观察到的 Agent 能力,已经不能简单等同于模型能力。上下文如何组织、工具如何暴露、状态如何保留、结果如何验证,都会直接改变 Agent 的能力、成本与安全表现。
未来评价一个 Agent,不能只问它用了什么模型,还要看这个模型运行在什么样的 Harness 中。