长期技术观察 / LONG-TERM OBSERVATION

AI 软件工程与研发自动化的长期观察站

持续观察 AI 如何改变软件工程、研发系统与组织协作,从技术动态、开源项目和真实实践中,识别值得长期跟踪的变化。

Weekly
#293
Signals
32
Essays
76

本周 Signal

Signal #33 · 2026.10.12

Coding Agent 的质量验证正在覆盖执行过程

本周几项研究发现,Coding Agent 即使生成了功能正确的代码,执行过程中仍可能存在问题。SWE-CC 发现,功能正确的补丁仍可能违反仓库规范,近半数违规发生在中间执行步骤;AgentSpy 发现,最终测试通过的任务仍可能存在与任务无关的操作。 与此同时,HarnessTe...

HOW IT WORKS

从信息到判断,是一条连续的研究链路

这里不追求把所有信息摆在读者面前,而是持续筛选、组织和验证,最终留下可以复用的判断。

LONG-TERM TOPICS

长期追踪的六个问题

它们不是短期热点标签,而是理解 AI 如何改变软件工程的一组持续问题。

LATEST OBSERVATIONS

最近的技术观察

查看全部文章 →
2026-10-12 周一01

Signal #33:Coding Agent 的质量验证正在覆盖执行过程

Coding Agent 修好了 Bug,测试也通过了,但这是否足以说明任务完成得可靠?本周三项研究发现,Agent 可能违反仓库规范、执行与任务无关的操作,甚至运行它的 Harness 本身也存在测试盲区。随着 Agent 承担更完整的研发任务,我们需要重新审视质量验证应该覆盖哪些环节。 _本文是「每周 Signal|AI × SE」第 33 期,持续关注 AI Coding、Agent 与软件工程的演进。_

#coding-agent#quality-validation
2026-10-11 周日02

Coding Agent 降本,不能只看 Token 单价

LangChain 在 Coding Agent 的真实任务中引入模型路由,让每线程模型成本的中位数下降了 64%。这项实验除了展示降本效果,还提供了一套可以借鉴的方法:先分析真实任务,再按任务选择模型,并用实际交付结果检查成本优化是否成立。

2026-10-10 周六03

给 Computer Use Agent 加上 CLI,准确率反而下降了

一项新研究发现,给四种现有 Computer Use Agent 直接开放 CLI,任务准确率反而下降了 2.5~11.5 个百分点。研究者随后通过混合操作训练,让一个 9B 模型在 OSWorld 上达到 53.6% 的准确率。问题出在哪里?Agent 应该怎样在 GUI 和 CLI 之间作出选择?

2026-10-09 周五04

Signal #32:Coding Agent 正在接手研发流程的推进

GitHub、Kiro 正将工作流执行能力引入 Coding Agent,让系统负责研发步骤的衔接、结果传递和运行状态管理。随着 Agent 能够连续推进更多工作,团队需要进一步明确每一步的完成依据,以及哪些决策必须由人来作出。 本文是「每周 Signal|AI × SE」第 32 期,关注 AI 如何改变软件工程与研发实践。

#coding-agent#workflows

RESEARCH LIBRARY

形成判断之前,我们从哪里看见变化

公众号、主题导航和 arXiv 共同构成支撑长期观察的信息与研究基础设施,并作为 Signal 和技术观察的资料来源。

ABOUT THE EDITOR

由真实研发实践持续校准的个人观察

长期关注 AI 软件工程、研发自动化与 Agent 系统,持续维护技术周刊,并参与真实团队中的 AI 研发落地与开源实践。这里记录的不是旁观式评论,而是问题、实践与判断之间的往返。

关于梯度不陡 →
梯度不陡|AI 软件工程与研发自动化