本周 Signal
Signal #33 · 2026.10.12
Coding Agent 的质量验证正在覆盖执行过程
本周几项研究发现,Coding Agent 即使生成了功能正确的代码,执行过程中仍可能存在问题。SWE-CC 发现,功能正确的补丁仍可能违反仓库规范,近半数违规发生在中间执行步骤;AgentSpy 发现,最终测试通过的任务仍可能存在与任务无关的操作。 与此同时,HarnessTe...
长期技术观察 / LONG-TERM OBSERVATION
持续观察 AI 如何改变软件工程、研发系统与组织协作,从技术动态、开源项目和真实实践中,识别值得长期跟踪的变化。
本周 Signal
Signal #33 · 2026.10.12
本周几项研究发现,Coding Agent 即使生成了功能正确的代码,执行过程中仍可能存在问题。SWE-CC 发现,功能正确的补丁仍可能违反仓库规范,近半数违规发生在中间执行步骤;AgentSpy 发现,最终测试通过的任务仍可能存在与任务无关的操作。 与此同时,HarnessTe...
HOW IT WORKS
这里不追求把所有信息摆在读者面前,而是持续筛选、组织和验证,最终留下可以复用的判断。
LONG-TERM TOPICS
它们不是短期热点标签,而是理解 AI 如何改变软件工程的一组持续问题。
LATEST OBSERVATIONS
Coding Agent 修好了 Bug,测试也通过了,但这是否足以说明任务完成得可靠?本周三项研究发现,Agent 可能违反仓库规范、执行与任务无关的操作,甚至运行它的 Harness 本身也存在测试盲区。随着 Agent 承担更完整的研发任务,我们需要重新审视质量验证应该覆盖哪些环节。 _本文是「每周 Signal|AI × SE」第 33 期,持续关注 AI Coding、Agent 与软件工程的演进。_
LangChain 在 Coding Agent 的真实任务中引入模型路由,让每线程模型成本的中位数下降了 64%。这项实验除了展示降本效果,还提供了一套可以借鉴的方法:先分析真实任务,再按任务选择模型,并用实际交付结果检查成本优化是否成立。
一项新研究发现,给四种现有 Computer Use Agent 直接开放 CLI,任务准确率反而下降了 2.5~11.5 个百分点。研究者随后通过混合操作训练,让一个 9B 模型在 OSWorld 上达到 53.6% 的准确率。问题出在哪里?Agent 应该怎样在 GUI 和 CLI 之间作出选择?
GitHub、Kiro 正将工作流执行能力引入 Coding Agent,让系统负责研发步骤的衔接、结果传递和运行状态管理。随着 Agent 能够连续推进更多工作,团队需要进一步明确每一步的完成依据,以及哪些决策必须由人来作出。 本文是「每周 Signal|AI × SE」第 32 期,关注 AI 如何改变软件工程与研发实践。
RESEARCH LIBRARY
公众号、主题导航和 arXiv 共同构成支撑长期观察的信息与研究基础设施,并作为 Signal 和技术观察的资料来源。
ABOUT THE EDITOR
长期关注 AI 软件工程、研发自动化与 Agent 系统,持续维护技术周刊,并参与真实团队中的 AI 研发落地与开源实践。这里记录的不是旁观式评论,而是问题、实践与判断之间的往返。
关于梯度不陡 →