本周 Signal
Signal #26 · 2026.08.24
Agent 明明发现了风险,为什么还会继续执行?
我们通常认为,Agent 识别出恶意指令或越权风险后,就会停下来。 本周发布的预印本 HarnessRisk(尚未同行评审)测试了 3 个开源 Harness 和 6 个模型。部分组合识别风险的比例超过 90%,攻击仍有相当比例成功。这只是有限环境下的新实验,却揭示了一个值得警惕...
长期技术观察 / LONG-TERM OBSERVATION
持续观察 AI 如何改变软件工程、研发系统与组织协作,从技术动态、开源项目和真实实践中,识别值得长期跟踪的变化。
本周 Signal
Signal #26 · 2026.08.24
我们通常认为,Agent 识别出恶意指令或越权风险后,就会停下来。 本周发布的预印本 HarnessRisk(尚未同行评审)测试了 3 个开源 Harness 和 6 个模型。部分组合识别风险的比例超过 90%,攻击仍有相当比例成功。这只是有限环境下的新实验,却揭示了一个值得警惕...
HOW IT WORKS
这里不追求把所有信息摆在读者面前,而是持续筛选、组织和验证,最终留下可以复用的判断。
LONG-TERM TOPICS
它们不是短期热点标签,而是理解 AI 如何改变软件工程的一组持续问题。
LATEST OBSERVATIONS
本文是「每周 Signal|AI × SE」第 26 期,欢迎关注和交流~ HarnessRisk 的实验显示,部分 Agent 虽然能够识别恶意指令或越权风险,危险动作仍可能发生。本文结合 OpenAI、Google 和 AWS 本周的安全实践,讨论模型的风险识别为什么还不够,
当 Coding Agent 可以并行完成越来越多任务,研发效率的瓶颈也开始从代码生成向 Review、验证和风险判断迁移。Vercel 最近在 AI SDK 上运行的 Software Factory,已经把这件事推进到了真实生产环境:下一阶段真正需要重新设计的,可能不是 Agent 能写多少代码,而是整个研发系统如何消化这些工作。 本文是「企业研发 AI 自动化」系列第 40 篇,欢迎关注和交流。
本文是「每周 Signal|AI × SE」第 25 期,欢迎关注和交流~ JetBrains 的内部评测显示,更贵的模型在部分复杂任务中,可能因成功率更高、执行步骤更少而拥有更低的单任务成本。本文讨论 Agent 成本为什么应从 Token 单价,走向完成一个经过验证的任务所需的总成本。
插件系统的价值,不只在于加载能力,更在于能否安全地卸载、替换和重组运行中的能力。本文从一个 Mini Cordis 出发,拆解 Context、Effect 与生命周期管理,并说明 DeepSeek DSH 为什么选择 Cordis 作为运行时基础。 Mini Cordis:https://github.com/grad0x/learn-cordis-by-building 本文是「企业研发 AI 自动化」系列第 39 篇,欢迎关注和交流。
RESEARCH LIBRARY
公众号、主题导航和 arXiv 共同构成支撑长期观察的信息与研究基础设施,并作为 Signal 和技术观察的资料来源。
ABOUT THE EDITOR
长期关注 AI 软件工程、研发自动化与 Agent 系统,持续维护技术周刊,并参与真实团队中的 AI 研发落地与开源实践。这里记录的不是旁观式评论,而是问题、实践与判断之间的往返。
关于梯度不陡 →