Signal #29:当 AI Coding 拿不到完整需求
代码可以正常运行,业务却可能做错。本周,Sierra 的 Hyper-τ-bench 让 Agent 从企业资料与客户沟通中自行还原需求,发现它们常停留在浅层检索,很少主动追问。IdeaAMBIG 则揭示:模型在被告知缺口后较擅长提出澄清问题,但自行发现缺口仍然困难。
Claude Code 已在官方实践中建议先访谈用户、形成规格,再进入实现。本周研究进一步提醒我们:有了需求澄清环节,还要检验 Agent 能否发现真正影响实现的信息缺口。 它是否能区分已有依据与自行假设,识别哪些不确定性会改变业务行为或验收结果,再通过查证和有针对性的提问补齐信息,将直接影响后续实现是否符合预期。

2026-09-07|天猫技术大型 AI 项目的研发协同实践
围绕真实项目,逐步解决上下文共享、规格维护和多人变更冲突。
天猫新品 MDI 项目以简短的 AGENTS.md 作为导航,将规格、架构、运行手册等知识交给不同 Skill 维护;代码提交时提示规格差异,由人决定如何更新。团队还把业务冲突检测放到预发集成环境,结合真实代码状态、自动分析和告警反馈,补齐单人 AI 编程之外的协作能力。
2026-09-11|基于 AgentKit 的端到端需求交付平台:从个人提效到组织提效的 AI 落地实践
DeliveryAI 围绕同一份 Spec 连接需求澄清、实现、测试与发布。
平台将目标、范围、依赖和验收条件组织为人和 Agent 的共同约定,关联代码、测试结果、Review 意见与发布记录,并沉淀项目知识和流程经验。文章将当前阶段定位为“监督自治”:Agent 推进执行,人在关键节点审核,通过交付周期、人工介入和验收结果评估实际收益。
2026-09-09|从钉群提问到任务交付:团队级 Agent 基础设施全链路实践
Domino 将日常协作入口、团队知识与隔离执行环境连接起来。
ConsoleAgent 处理群内提问与任务分流,SandboxAgent 在独立环境中完成编码、构建、审查、部署和页面验证。系统区分群级会话、跨会话空间记忆与正式知识源,并通过 Skill 固化国际化处理、MasterGo 设计稿解析和前端验证方法,使通用 Agent 能够进入团队已有研发流程。
2026-09-09|让AI真正读懂你的代码:一套可复用的Cursor 辅助编码实践
将工程约束、工作方法与业务事实分别维护,减少模型对项目的误解。
团队用 Rules 注入架构与编码约束,用 Skills 编排需求开发、审查和排障,用领域知识库统一业务概念、接口字段和状态流转。复杂 Skill 拆成主流程与按需读取的参考文件,再通过 Figma、GitLab MCP 获取真实设计和代码差异,串起方案确认、实现与验证。
2026-09-09|AliExpress技术-【详情域AAIC实践】:让 AI 自己把配置建出来,不只「写得快」,更能「上线快」
把规则、实验和多语言配置纳入 AI 编码流程,减少等待人工操作的断点。
团队为配置平台提供聚合接口和领域 Skills,通过独立通道、影子表与环境白名单限制写入范围。Agent 创建配置后执行定向刷新、回读和页面命中验证,正式发布由人完成。文章还讨论了影子表缺少基线数据的问题,以及分源合并和写时复制的处理方法。
2026-09-08|Harness 工程治理:从一次做成,到可复制、可运营的交付能力
把任务执行、团队规范和组织治理连接到真实交付结果。
作者从 Better Harness 出发,讨论如何将有效做法沉淀为 Skill、模板、MCP 服务和质量规则。当前 Dashboard 已能汇总跨项目的模型、工具与 Token 活动;文章明确指出,调用次数只能说明使用情况,后续还需要关联任务目标、验收条件与产物,才能判断这些能力是否有效。
2026-09-11|AI 使用心得:B 端产品工作中的方法、边界与实践
通过明确业务背景与判断边界,让 AI 承担需求工作的结构化劳动。
作者将需求文档流程拆为建立 Skill、交代关键节点、让 AI 追问缺失信息、生成并复核文档。交互设计也先形成可讨论版本,再检查流程、异常状态和系统联动。文章强调把节省的时间投入业务理解与方案取舍,并由人确认关键规则和验收结论。
2026-09-09|零基础也能看懂的 Loop Engineering
有效的执行循环,需要让当前结果真正参与下一轮决策。
文章区分观察结果、验证目标、选择下一步和保存进度等职责,强调将证据关联到当前代码或数据版本。运行状态也应区分成功、失败、停滞、预算耗尽和人工接管,避免把“停止运行”视为“任务完成”,并以库迁移任务说明如何提前定义可检查的完成条件。
2026-09-07|从一次 LLM 调用到完整 Harness,Agent 到底经历了什么?
随着任务变复杂,Agent 需要持续补齐上下文、工具、状态与权限管理。
文章以 Pi、OpenCode、Codex 和 Hermes 为例,对比精简工具集、结构化事件、审批与沙箱、跨会话记忆等设计。其关注点是模型决策如何在具体执行环境中落地,以及不同运行机制如何影响上下文开销、任务生命周期和恢复能力。
2026-09-08|从生态坐标到生产级长跑:AgentScope2.0运行时与最佳实践
通过中间件和工具扩展,在 ReAct 循环上组织长任务所需的运行能力。
文章介绍 Core、Harness、Service 分层,以及 Workspace、上下文压缩、Skills、子 Agent 和沙箱的接入方式。重点讨论会话状态隔离、事件流、工具异常和人工中断,并区分独立子任务委派与团队任务协作,帮助理解框架能力在运行过程中如何组合。
2026-09-09|企业级 MultiAgent 落地:Plan 模式与主子 Agent 协作|得物技术
将计划维护为可持久化的运行对象,结合主子 Agent 分工推进任务。
平台通过计划工具管理任务状态,用结构化事件向前端展示进度,并在恢复时处理幂等与状态查询。子 Agent 拥有独立工具和上下文,取消与追踪需要贯穿调用层级;跨服务协作则进一步处理会话归属、身份传递和租户隔离。
2026-09-09|Agent 长程任务断点续传:从框架 Checkpoint 到跨进程恢复的完整实践
将框架检查点与上层任务调度结合,应对人工暂停和系统重启。
实践基于 Spring AI Alibaba 的检查点、Hook 和拦截器扩展,区分用户、工具与系统级中断。文章重点分析多工具调用中间缺少检查点的风险,以及已执行结果、待重试工具和消息顺序的恢复处理,并通过任务状态和消息队列协调跨进程续跑。
2026-09-10|DeepSeek Harness 更新:适配 DeepSeek V4.1 Flash 模型
DSH v0.1.5 同时推进模型适配、文件处理和可扩展工作区。
更新包括文件上传、工作区文件树与多格式预览,左右侧栏也提供标准化插件入口。长会话的加载和恢复得到优化,父子 Agent 可在执行中双向补充信息。实验性 Agent Teams 引入共享任务列表与成员通信,当前以默认关闭的插件形式提供。
2026-09-10|从 AutoGLM 到 Astra:AI 不再只是看屏幕、点鼠标
Computer Use 正在结合视觉、结构化界面信息与代码执行完成任务。
文章从 AutoGLM 实践出发,结合 Kyle Jeong 的工程分析与公开文档,讨论截图、无障碍树和代码操作各自的作用,以及持续会话、状态保存和执行后验证的重要性。作者进一步用环境表示与执行方式理解这类系统,并明确区分第三方实现分析和官方披露。
2026-09-07|Agent Plan 「Agent云电脑」工具: 让 AI 在云电脑上完成股市深度研究
把云端执行环境、Agent 循环和任务进度管理封装为可调用工具。
文章以研究任务演示浏览器检索、页面交互和资料整理,并展示通过 Skill 发起任务、查看云桌面及获取产物的过程。任务在云端持续执行,监控连接中断不影响运行;工程参考点包括任务提交与状态轮询分离,以及机器资源和模型调用分别计量。
2026-09-08|OpenClaw 2.0:欠下的技术债,这次连本带利还清
围绕会话持久化、工作区和插件拆分,分析 Agent 系统的架构调整。
文章梳理会话从进程内状态转为可恢复资源、控制台围绕工作区重建,以及能力逐步外置为插件的变化。同时讨论 SQLite 存储迁移、备份恢复和兼容性问题,并区分共享会话的协作权限与真正的租户隔离边界。
2026-09-07|换工具、换 Agent,不换上下文:OpenViking 让研发 Context 始终在线
将资源、记忆和技能统一组织,让不同 Agent 复用项目背景与经验。
OpenViking 用统一路径管理代码、文档、个人偏好和工作方法,并按摘要、目录概览和完整内容分层加载。任务结束后,通过 Session Commit 提取可保留的经验。文章以代码审查、编码、群聊协作和周报场景说明跨工具上下文复用方式。
2026-09-09|【AI 创新实践】“架构师 Agent” 系统化落地
让 Agent 在理解业务与系统约束后,再形成可验证的技术方案。
作者将知识分为业务、架构、服务内部以及工程组织约束,指出相关性检索本身难以保证方案所需信息完整。实践从技术方案和稳定性材料中提炼业务知识,按原则、场景、实践与历史组织索引,并要求方案设计回到代码和配置核对事实。
2026-09-11|让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍
区分原始经历与当前认知,让记忆能够修正、追溯和退出召回。
HL-Mem 保留不可变 Event,从中提取可更新 Claim,并用证据关系和有效时间解释事实变化。事实与任务经验采用不同处理路径,后台执行去重、冲突处理和归档;底层以 SQLite 为主,召回结合实体、时间与上下文预算组织结果。
2026-09-07|Claude Code 与 Codex Memory 机制详解
围绕 Markdown 索引和按需检索,分析跨会话记忆如何进入 Agent。
文章基于特定版本源码与提示信息,比较记忆摘要、主题文件、会话提取和后台整理,并介绍作者的 dsh-memory 插件。阅读时需注意证据范围:Codex 分析对应明确源码版本,Claude Code 部分涉及旧泄露源码,作者也注明部分机制是否仍在使用尚不确定。
2026-09-08|字节跳动质量保障团队|让 QA 真正用起来:测试用例生成 Agent 落地,我们做对了什么
NL2Test 结合测试流量与结构化校验,连接 QA 意图和 API 自动化。
方案将请求匹配、依赖提取、断言识别与代码生成拆成可检查的小任务,字段匹配和参数替换交给确定性程序处理,并优先保留稳定断言。文章报告,85.4% 的生成用例被集成到 CI/CD,说明落地重点包含用例可执行性、容错与既有流程接入。
2026-09-09|TLS 全链路可观测体系:破解 LLM 应用黑盒,实现会话透明复盘
按会话、请求和执行阶段组织观测数据,支持排障与消耗分析。
方案通过 LLM Observer SDK 采集模型交互、工具调用和异常,按照 OpenTelemetry GenAI 语义组织并上报 Trace。界面可聚合多轮会话的 Token 与耗时,下钻调用链;正文采集可独立关闭,保留必要的运行指标。
2026-09-09|5分钟烧掉1000块!Agent token成本如何治理
任务授权需要配套可理解、可观察、可中止的消费边界。
作者从一次多子 Agent、重复检索与缓存未命中的高消耗事件出发,提出预算上限、事前预估、过程展示、偏差告警、暂停控制和任务账单六个环节。文章重点讨论产品机制:用户应能知道消耗为何增加,并决定缩小范围、追加预算或保存进度后停止。
2026-09-08|改三行代码扣费8刀 - 如何高效节约 LLM 的 Token 消耗?
任务成本同时受调用轮数、缓存、工具输出和返工影响。
文章建议按变化频率组织上下文,将稳定规则与工具定义放在前部,动态需求和结果放在后部,并通过实际用量检查缓存效果。对大段检索结果和构建日志控制返回规模,按任务风险配置模型预算,以完成质量和总消耗评价工作流。
2026-09-08|Agent 观测与优化开发者摸底报告
不少团队已进入试点,但完整轨迹、自动评估和反馈回灌仍不充分。
报告基于三场活动报名问卷的 700 多份数据,呈现参会群体在观测工具、人工评估、审计和 Skill 沉淀方面的现状。其参考价值在于帮助团队检查自身能力缺口;样本来自活动参与者,相关比例不宜直接推及整个行业。
2026-09-07|AI 生成图表时,默认值为什么比配置项更重要?
将重复的视觉判断放进组件默认行为,减少生成图表的误导。
GPT-Vis 调整单系列配色、标签避让、共享 Tooltip 和双轴颜色关联,并为词云提供稳定布局。文章还明确分析与呈现的分工:分析 Agent 负责查询、计算和口径,图表组件负责表达已确定的数据,让模型减少对细碎样式参数的反复决策。
2026-09-08|我用腾讯 Kuikly,把 DeepSeek Harness装进了口袋
手机处理进度、审批与追问,电脑继续承担 Agent 执行。
DSH Mobile 通过共享 Kotlin 代码连接 DSH Host 协议,并把 WebSocket、SSH 和扫码能力封装为跨端接口。文章重点介绍流式 Markdown、断线事件补偿、历史与快照对齐,以及丢弃旧连接响应,避免重连后重复提交任务。
2026-09-10|iPhone Duo来了,腾讯 Kuikly 助 App 从容适配
将折叠屏和多窗口适配沉淀为共享的状态与交互规则。
Kuikly 把原生容器尺寸变化传递到共享层,由响应式状态统一驱动布局和导航。小屏跳转与大屏区域切换保持相同业务语义,同时处理返回栈、手势作用域、动画和安全距离,使一次适配可以复用于平板、分屏等场景。
2026-09-09|Dart Skills CLI 1.0 :AI 时代的 Dart 交付支持
将 Skills 纳入 package 发行物,减少使用知识与实际依赖版本脱节。
CLI 根据项目依赖解析结果定位 package,发现并校验其中的 Skills,再同步到不同编程 Agent 的目录。文章重点介绍命名前缀、状态比较和增量更新机制,使 API 用法、工程约定与辅助流程能够跟随项目真正使用的版本一起维护。
2026-09-09|Vibe Coding:C端AI创意平台设计新范式
把需求解析、生图、编辑与规范输出组合成面向业务的设计工具。
平台区分快速创意探索与专业精调,结合材质风格库、局部修改和多端尺寸拓展处理不同需求。对重复性卡片生产,则将 Prompt 模板、参考素材、渲染合成、切图与审核组织为专用流程,通过既有协作入口交付结果。
2026-09-07|百万用户,一人一 Topic:百炼资产中心用 RocketMQ LiteTopic 实现隔离与限流
将用户映射为独立消息单元,隔离突发流量与消费异常。
百炼资产中心围绕素材处理链路,使用 LiteTopic 实现按需创建、自动回收和用户级暂停投递。消费侧通过通配订阅覆盖用户队列,将隔离与限流交给消息系统承担,减少业务层自建路由和调度逻辑。
2026-09-09|Apache Paimon C++ :从阿里数据湖走向开源社区
把快照、合并与提交等表语义带入 C++ 数据处理生态。
Paimon C++ 以 Arrow 批式交换连接执行引擎,覆盖扫描、读取、写入、提交和压缩流程,并允许复用引擎已有的文件系统、缓存和内存管理能力。文章结合 Native Spark、StarRocks 等实践,解释格式兼容与插件化边界的设计取舍。
2026-09-09|CommInsight:从通信库底层事件重建大规模训推的全栈因果链
结合通信事实、训练阶段和跨进程关系,定位等待与停滞。
CommInsight 通过 NCCL Profiler 插件采集通信事件,在节点侧处理并归档,再恢复训练阶段和跨 Rank 等待关系。系统将时间线、通信拓扑与硬件指标连接起来,帮助区分主动导致等待的进程和被动等待者;最终根因仍需结合日志与现场证据验证。
2026-09-08|从容面对收银高峰,乐檬的零售连锁智能运维实践
以统一观测数据支撑告警治理、定时巡检和业务排障。
乐檬围绕收银、支付和分账链路,整合日志、指标、拓扑与变更信息,通过 STAROps 执行规则检查、自然语言查询和巡检任务。高风险变更保留人工确认,巡检结果形成可比较的结构化报告,为日常维护和故障分析提供连续依据。
2026-09-10|DeepSeek V4.1 Flash:更强、更快、更普惠
发布文章介绍原生多模态、非对称输入输出计算与 KV Cache 压缩。
据官方介绍,V4.1 Flash 采用新的 Causal-Encoder-Decoder 结构,为输入与输出分配不同计算规模,并减少上下文缓存的存储需求。文章同时说明 API 接入和旧模型迁移安排。对研发团队而言,可结合真实长任务评估完成率、总耗时与缓存消耗,判断模型更新的实际影响。