本周 Signal
Signal #23 · 2026.08.03
同一个模型,为什么会变成完全不同的 Agent
我们过去习惯用“模型能力”解释 Agent 的表现:任务完成得好,是因为模型更强;执行失败,则归因于模型能力不足。但本周多项实践都在说明,同一个模型放进不同的 Harness,可能会表现得像完全不同的 Agent。 OpenAI 在 ARC-AGI-3 实验中没有更换模型,只是保...
长期技术观察 / LONG-TERM OBSERVATION
持续观察 AI 如何改变软件工程、研发系统与组织协作,从技术动态、开源项目和真实实践中,识别值得长期跟踪的变化。
本周 Signal
Signal #23 · 2026.08.03
我们过去习惯用“模型能力”解释 Agent 的表现:任务完成得好,是因为模型更强;执行失败,则归因于模型能力不足。但本周多项实践都在说明,同一个模型放进不同的 Harness,可能会表现得像完全不同的 Agent。 OpenAI 在 ARC-AGI-3 实验中没有更换模型,只是保...
HOW IT WORKS
这里不追求把所有信息摆在读者面前,而是持续筛选、组织和验证,最终留下可以复用的判断。
LONG-TERM TOPICS
它们不是短期热点标签,而是理解 AI 如何改变软件工程的一组持续问题。
LATEST OBSERVATIONS
AI 不会简单消灭组件库,但会改变组件库的边界。低风险 UI 会更多转向按需生成,验证成本较高的基础能力仍应沉淀为稳定组件,页面层面的通用经验和领域知识则会以页面模式、领域契约和测试等形态继续沉淀。传统组件库可能收缩,更广义的组件资产体系会随之扩展,技术栈升级的判断方式也需要重新调整。 本文是「企业研发 AI 自动化」系列第 36 篇,欢迎关注和交流。
当 Agent 可以在 Loop 中持续推进任务,系统变化的速度可能逐渐超过团队形成共同理解的速度。 本周 Signal 关注的是,在自动化持续扩大的过程中,团队如何保留对设计意图、关键边界和长期演化成本的理解与判断。 本文是「每周 Signal|AI × SE」第 22 期,关于关注和交流~
最近,从 《Agents Want to Compile》 到 LLMCompiler、PlanCompiler 等研究,一个共同方向逐渐清晰:Agent 生成的计划,正在从会话中的临时文本,变成可以由执行系统直接消费的工程产物。本文尝试讨论,这种变化对 AI Coding 意味着什么。
本文是「每周 Signal|AI × SE」第 21 期。 本周 Signal:Agent 的行为,开始像代码一样被定义、测试和治理。
RESEARCH LIBRARY
公众号、主题导航和 arXiv 共同构成支撑长期观察的信息与研究基础设施,并作为 Signal 和技术观察的资料来源。
ABOUT THE EDITOR
长期关注 AI 软件工程、研发自动化与 Agent 系统,持续维护技术周刊,并参与真实团队中的 AI 研发落地与开源实践。这里记录的不是旁观式评论,而是问题、实践与判断之间的往返。
关于梯度不陡 →