本周 Signal
Signal #29 · 2026.09.14
当 AI Coding 拿不到完整需求
代码可以正常运行,业务却可能做错。本周,Sierra 的 Hyper-τ-bench 让 Agent 从企业资料与客户沟通中自行还原需求,发现它们常停留在浅层检索,很少主动追问。IdeaAMBIG 则揭示:模型在被告知缺口后较擅长提出澄清问题,但自行发现缺口仍然困难。 Claud...
长期技术观察 / LONG-TERM OBSERVATION
持续观察 AI 如何改变软件工程、研发系统与组织协作,从技术动态、开源项目和真实实践中,识别值得长期跟踪的变化。
本周 Signal
Signal #29 · 2026.09.14
代码可以正常运行,业务却可能做错。本周,Sierra 的 Hyper-τ-bench 让 Agent 从企业资料与客户沟通中自行还原需求,发现它们常停留在浅层检索,很少主动追问。IdeaAMBIG 则揭示:模型在被告知缺口后较擅长提出澄清问题,但自行发现缺口仍然困难。 Claud...
HOW IT WORKS
这里不追求把所有信息摆在读者面前,而是持续筛选、组织和验证,最终留下可以复用的判断。
LONG-TERM TOPICS
它们不是短期热点标签,而是理解 AI 如何改变软件工程的一组持续问题。
LATEST OBSERVATIONS
去年底,我们还在讨论怎样让 AI 像人一样看屏幕、点鼠标。 九个月后,Astra 展示出的 Computer Use 已经出现另一种变化:Agent 可以结合视觉和结构化信息理解软件,并通过代码等更高效的方式改变软件状态。 GUI Agent 正在从“模仿人操作电脑”,走向“让 Agent 用自己的方式使用软件”。 本文是「企业研发 AI 自动化」系列第 41 篇,欢迎关注和交流。
本文是「每周 Signal|AI × SE」第 28 期,欢迎关注和交流~ AI 开始获得代码合并审批权。当实现和评审都交给 Agent,判断所需的依据也要进入自动化流程。 9 月 1 日,GitHub 宣布 Copilot 可以正式批准 PR,也就是代码合并请求。管理员授权后,
本文是「每周 Signal|AI × SE」第 27 期,欢迎关注和交流~ Agent Session 可以保存,但随着任务变长、多次执行和多 Agent 接力,一项工作的长期状态正在逐渐从单次 Session 中拆出来。任务、决策、产物和验证结果可能需要由更长期的 Worksp
本文是「每周 Signal|AI × SE」第 26 期,欢迎关注和交流~ HarnessRisk 的实验显示,部分 Agent 虽然能够识别恶意指令或越权风险,危险动作仍可能发生。本文结合 OpenAI、Google 和 AWS 本周的安全实践,讨论模型的风险识别为什么还不够,
RESEARCH LIBRARY
公众号、主题导航和 arXiv 共同构成支撑长期观察的信息与研究基础设施,并作为 Signal 和技术观察的资料来源。
ABOUT THE EDITOR
长期关注 AI 软件工程、研发自动化与 Agent 系统,持续维护技术周刊,并参与真实团队中的 AI 研发落地与开源实践。这里记录的不是旁观式评论,而是问题、实践与判断之间的往返。
关于梯度不陡 →