Agent 的行为,开始像代码一样被定义、测试和治理
这周,GitHub 开始让 Code Review Agent 读取仓库中的 AGENTS.md、Skills 和 Review 指令,并为其配置独立的运行环境与网络权限;Google 把 Prompt、规则和 Skill 变成可校验、可编译的构建产物;Microsoft 则开始内置由专家维护的 Agent Skills,并使用隔离环境对其进行回归评测。
这些变化指向同一个方向:决定 Agent 如何工作的 Prompt、Skills、规则、规范、运行环境和 Eval,正在进入版本库、构建系统、测试框架、权限控制与观测机制。Agent 的工作方式由此变得可以评审、复现、验证和持续改进。
当工程对象从一段 Prompt 扩展到 Skills、规则、运行环境和 Eval,一种更系统的实践正在形成。我们或许可以把它称为 Agent Behavior Engineering——Agent 行为工程:系统地定义、测试和治理 Agent 在真实任务中的行为。