Signal #28:AI 开始获得代码合并审批权
本周,Copilot 开始允许管理员授权 AI 正式批准代码合并请求,批准结果可以计入仓库的合并要求。VS Code Agent Merge 则持续处理评审意见、失败检查和冲突,推进到可合并状态。
此前,Vercel 的软件工厂 已让 Agent 完成实现、验证和评审,再由人最终合并。本周的变化进一步表明:AI 的判断开始成为代码能否合并的一项正式依据。
由此值得关注的趋势是,研发自动化正延伸到变更审批。团队需要明确哪些变更可以交给 AI 批准、需要哪些验证证据、哪些风险仍由人判断,让自动化范围随着验证能力逐步扩大。

2026-09-02|得物小摊 AI Native 演进实录:用 Harness 构建可控 AI 交付
得物小摊围绕跨端、跨服务的 AI 开发,构建覆盖版本约定、执行边界、验收证据和修复验证的工程约束体系,让业务规则在不同运行时保持一致。
在 H5、运营后台、Node 网关和 Go 服务协同开发中,团队通过版本契约固定需求口径,用 Git worktree 隔离改动,并将需求、用例与验证证据关联起来。修复必须满足基线失败、候选版本通过、回归通过三个条件。多 SKU 履约案例展示了如何把“订单是履约原子单位”落实为跨模块约束,同时明确区分代码完成、验证通过和验收通过。
2026-09-04|淘宝百亿补贴数据分析助手 Agent 实战
淘宝百亿补贴的数据分析助手在自然语言与 SQL 之间加入业务语义层,并结合多 Agent 编排、知识检索和执行校验,串联取数、分析与归因流程。
系统借助 WrenAI 的模型定义语言先校验字段和指标口径,再生成 SQL,执行前还要经过 SQL 校验关卡。知识体系覆盖表结构、业务知识和会话记忆,支持血缘溯源与 Python 沙箱分析。针对多步分析,团队按场景启用 Hologres 外部表加速;文章披露,案例中的查询耗时由 30—120 秒缩至 3—10 秒,该结果对应其具体查询与加速条件。
2026-09-02|一文讲透确定性Harness
围绕工单审核场景,作者用阶段化编排、全链路记录、提前终止和统一外部调用管理构建 Harness,使模型参与的复杂决策流程能够被检查和追溯。
审核策略被拆成接口统一的阶段函数,每一步记录输入、命中分支、接口原始返回、输出与耗时;处理器给出终止标记后,主流程停止后续检查。外部 API 则通过统一网关调用,并按任务标识缓存结果。这套方案具体说明了如何组织分支和外部依赖,但流程可控仍需与模型判断是否正确分别验证。
2026-09-01|删掉80%的Prompt规则,Agent交付成功率反而更高了
作者围绕 Agent 交付过程提出精简提示词的做法,将规则分别落实到上下文索引、可信事实来源、工具能力和验证关卡,减少单靠文字约束执行行为的负担。
实践中,AGENTS.md 负责指引 Agent 找到任务相关资料,具体要求由可执行检查、操作手册和 Skill 承接。需要反复人工确认的问题,逐步沉淀为后续任务可复用的工程机制,同时保留任务恢复所需的状态和证据。作者由此将提示词精简与交付环境建设结合起来,讨论哪些要求应放在文档中,哪些应由工具和验证流程负责。
2026-08-31|从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考
作者基于 Agent 开发经历提出一套团队协作设计,将方案讨论、目标协商、横向通信和集体复盘纳入执行流程,尝试解决多 Agent 仅分工而缺少协作的问题。
方案要求 Leader 同时承担技术决策与协调职责,任务按提案、反馈、共识推进,Worker 之间支持广播、查询和求助升级。目标与关键结果用于跟踪进度,岗位定义和团队宗旨为自主取舍提供依据,复盘结果再沉淀为协作经验。这些机制目前主要是作者的设计思考,资料中未提供整套方案的工程实现或量化验证。
2026-09-04|DeepSeek Harness背后的“心脏”:Cordis 到底是什么
作为 DeepSeek Harness 的底层插件框架,Cordis 将插件生命周期、依赖关系和资源清理纳入统一上下文,为运行时能力的动态装配与替换提供基础。
插件通过上下文注册服务和事件,依赖变化会触发相应的生命周期处理;通过 ctx.effect 注册的清理逻辑,可在插件卸载时释放关联资源。文章还拆解了事件分发和声明式配置机制,说明模型、工具、会话等能力如何以插件组合。这里的可逆性针对受框架管理的注册与清理操作,不能据此理解为任意外部业务操作都能撤销。
框架与实现:Cordis、DeepSeek Harness。
2026-09-05|模型后训练视角:DeepSeek Harness 把企业进化做进了架构
作者从企业适配角度解读 DeepSeek Harness,将只追加的会话日志、由日志派生的上下文和插件化能力组合,视为试验并沉淀 Agent 工作方式的架构基础。
文章关注运行时改动如何被记录、撤销和固化:会话状态从事件日志恢复,工具与模型能力通过插件装配,临时试验与持久配置采用不同的审批要求。作者进一步提出,现场验证过的行为可为后训练提供候选经验;这一判断属于架构分析与概念验证,不能等同于系统已具备自动训练模型权重的能力。
架构资料:DeepSeek Harness architecture。
2026-09-01|从查账单到运营云成本:STAROps 如何把 FinOps 跑成一条闭环
STAROps 将云成本管理拆为可信取数、异常归因和持续巡检,结合账单口径、资源利用率与业务约束,让 Agent 参与可重复执行的成本分析流程。
自然语言查询先经过 SQL 字段和权限校验,再按标签、资源组等维度归集费用。异常分析对比基线周期,沿产品、计费项和资源逐层下钻,并结合 CPU、内存等利用率判断核查优先级。长期任务机制负责周期检查、报告汇总和中断恢复,将一次性分析延续为持续运行的成本巡检。
2026-09-03|美团智播——数字人直播技术创新与实践
美团智播围绕数字人直播搭建实时交互与内容量产两套引擎,将形象一致性、动作生成和流式语音手势协调接入同一业务系统,支撑商家直播内容生产。
形象生成与编辑侧重点保持人物身份一致,动作侧结合因果生成模型处理姿态序列,流式共语动作生成则服务于边说边动的交互。系统配套知识库,为实时应答和批量内容生产提供业务信息,并将这些能力接入商家直播场景,展示从生成模型到业务运行链路的工程组合方式。
2026-09-04|工具型 Agent 的分层评测方法与机制验证
AliExpress 提出结果、决策、动作和可靠性四层评测方法,将工具型 Agent 的最终答案与执行轨迹一起检查,使失败能够对应到具体的修复对象。
运行前固定测试输入、输出契约和断言,执行中采集工具参数、状态码和产物引用;结构、字段及数值优先用确定性校验器检查,语义维度再交给模型评审。关键错误由独立发布关卡直接阻断,避免被其他高分抵消。文中以口径、输出契约和权限错误三个示例说明机制,量化收益仍需在实际任务集上重复验证。
2026-09-01|「AliExpress资损防控」Checker智能化无损攻防方案设计与实现
AliExpress 为营销校验系统搭建 AI 驱动的测试生成流水线,通过替换子调用返回值构造异常输入,验证校验规则能否触发预期行为,减少直接修改业务数据的风险。
系统从错误码位置分析出发,依次完成触发条件枚举、数据溯源、用例设计、流量查询与模拟规则生成,并通过消息队列推进分步执行。测试利用 Saiga Mock 拦截数据库查询或远程调用的响应,让 Checker 接收到构造的异常数据。这里的“无损”主要指以响应替换代替直接篡改数据库,适用范围仍取决于所覆盖的调用链。
2026-09-03|广告埋点参数自动化校验的AI升级实战
搜狐在既有广告埋点规则引擎旁增加 AI 校验链路,通过并行执行、超时降级和结果融合,补充跨参数关联等检查能力,同时保留原有规则的确定性判定。
AI 链路设有 8 秒超时,异常时回退到原有检查流程;融合结果时只补充发现的问题,不推翻传统引擎结论。校验能力被封装为接口统一的 Skill,并配套缓存和熔断机制。这一增量接入方式为既有系统提供额外检查能力,也明确了模型判断在最终结果中的作用范围。
2026-09-02|AI Agent 应用精细化评测:评测体系设计与工程实践(部分正文)
阿里商品中心将 Agent 评测拆为端到端效果和感知、规划、记忆、工具等模块指标,并建立评测范围与数据集、埋点的映射,帮助团队从任务失败定位到具体环节。
端到端指标关注任务完成、指令遵循和异常处理,模块指标则承担优化诊断职责。选择评测范围后,系统装配相应数据集与指标,支持持续运行的评测流程。文中对知识忠实度的界定尤其明确:回答是否忠于检索内容,与检索来源本身是否正确,是需要分别处理的问题。
2026-08-31|数据飞轮的起点:四种方式把 Agent 连进 AgentLoop丨AgentLoop 数据飞轮实践(二)
AgentLoop 基于 OpenTelemetry 可观测性标准组织 Agent 运行数据,通过统一轨迹标识关联模型调用与工具调用,为后续评估、回测和经验提取提供执行记录。
文章给出通用 Agent 对接、框架 SDK、自定义应用注解埋点和 eBPF 监测四种接入路径。Claude Code 客服案例使用 LoongSuite Pilot 旁路进程,通过 webhook 接收事件并上报,最终在控制台查看调用链。应用名称与接入凭据分别用于区分服务和鉴权,统一轨迹则成为后续评估与失败案例分析的共同输入。
2026-09-01|评估:从黄金指标到 Rubric丨AgentLoop 数据飞轮实践(三)
AgentLoop 将评估器与评估任务分开配置,用代码规则处理确定性检查,用 Agent 按 Rubric 评分细则评判语义质量,并为评分保留可追溯的依据。
评估输入包含任务输入、输出和运行轨迹,结果除分数外还记录决策、摘要、证据与细则版本。任务层负责选择历史或持续评估、采样比例及字段映射,以控制覆盖范围和成本。低分案例随后进入数据集,供后续实验回测使用,使“为什么没通过”能够转成下一轮优化的具体输入。
2026-09-02|实验:回测、离线实验平台与题目级 Rubric丨AgentLoop 数据飞轮实践(四)
AgentLoop 通过内网实验执行与题目级 Rubric,将线上发现的失败案例转成可重复运行的测试任务,使每道题都能按照自身业务要求比较 Agent 版本变化。
实验平台就近调用内网 Agent,并与云端控制台同步数据;数据集中的 rubric 字段为每个案例提供独立评分细则。实验计划绑定数据集、评估器和变量映射,支持定时运行与逐题下钻。分析分数变化前,先检查评分标准是否明确一致,再据此判断版本差异,把整体分数变化对应到具体题目和修复方向。
2026-09-02|AI Coding 的观测与科学降本:从一次 Trace 到自动调优闭环
作者围绕 AI Coding 的执行轨迹建立效率评估和责任归因机制,将重复取数、过大工具输出、无变化重试和长会话膨胀等问题转成可验证的优化动作。
方案以单位有效产出的 Token 消耗为观察对象,再按影响范围与责任方区分问题应由使用者、Agent、接入方还是平台处理。人工调优、辅助经验挖掘和自动经验注入分别对应不同自动化程度,优化结果需要回到任务质量与成本对照中检验。这样可以避免只压低调用量,却把未完成任务或质量下降当成降本收益。
2026-09-03|经验自进化:自动挖掘经验资产,消融实验验证真实收益丨AgentLoop 数据飞轮实践(五)
AgentLoop 从历史轨迹提取带适用场景和来源的经验,通过运行时检索注入上下文,并用消融实验比较召回、数量、位置和内容长度对任务质量与成本的影响。
文中将完整经验与精简结论、不同召回阈值及注入条数分别对照,还加入“经验仅供参考”的约束,减少历史结论对当前任务的误导。团队披露,其案例经策略调整后耗时下降约 30%—40%、成本下降约 20%—47%;这些数字对应文中任务与配置,不能直接推算为所有 Agent 的预期收益。
2026-09-02|换工具、换 Agent,不换上下文:OpenViking 让研发 Context 始终在线
OpenViking 将资源、记忆和技能组织为统一的上下文文件系统,通过分层加载和会话经验提取,帮助不同 Agent 复用研发资料,并按当前任务需要获取信息。
项目使用 viking:// 地址管理内容,按 L0 摘要、L1 概览、L2 详情逐层读取,避免每次都注入完整资料。会话提交后可提取长期记忆,检索过程保留轨迹,便于检查内容为何被选中。文章进一步展示跨工具使用的研发场景;其基础机制也可在 OpenViking 项目说明中查阅。
2026-09-03|Agent每次接新任务都像新人第一天入职?带你告别"一次性智能"
Forge 将任务日志进一步整理为带身份、适用范围、证据和修正历史的知识对象,并分别控制经验的写入与读取,让工程判断能够跨任务复用且保持可纠正。
读取时先按任务缩小候选范围,再判断经验是否适用;写入时依据开发与验证结果,决定拒绝、合并、新建或转人工复核。Memory 与需求规范、执行约束共享任务过程,使“为什么这样改”能够随代码结果一起留下来。方案同时强调,经验进入长期记忆的门槛应高于生成一份任务总结,避免未经验证的猜测反复传播。
2026-08-31|zg 正式开源:本地检索,不止于关键词
zg 将向量检索、BM25 关键词排序与 ripgrep 精确匹配整合为本地优先的检索入口,通过命令行和 MCP 工具接口服务代码理解、文档查询与 Agent 任务。
检索流程先帮助 Agent 从自然语言问题定位相关内容,再按符号或原文进行精确核对;默认本地处理模式将文件、索引和本地模型留在设备内。团队提供了配对评测与复现文档,但接入检索工具的收益需要结合建索引开销和使用频次评估。实现与当前支持范围见 zg 项目。
2026-09-06|AI Agent 时代,需要的不是更多数据,而是一个语义层
UnifiedModel 尝试将企业资产、运行数据和系统关系组织成可查询的对象图,为 Agent 提供统一语义入口,减少面对指标、日志和工单时反复猜测对象关系的成本。
方案以 Set、Link、Field 描述集合、关系与字段约束,并区分模型定义和运行时实例。查询接口覆盖实体、拓扑和方法发现,Agent 可先检查对象提供哪些操作,再获取相应查询计划。文章还给出接入层、运行时、图抽象层和存储层的分层设计,将分散系统中的对象定义与实际查询过程连接起来。
2026-09-03|Agent 做了这么多轮重构,企业到底该留下什么?
围绕企业 Agent 的持续迭代,作者提出用统一元数据和语义定义连接消息接入、加工、存储与查询,让业务对象及指标口径能够随实时数据一起被理解和复用。
EventHouse 的产品思路以消息集成为基础,将对象、范围、关系、计算和值等语义接入后续处理与 Agent 检索。文章区分通用运行时能力与企业自身的业务知识投入,强调订单、日志等持续产生的数据也要进入上下文。内容主要展示架构与产品设计,尚未给出完整部署和性能验证。
2026-09-03|火山引擎 Milvus Vector Lakebase 正式公测
火山引擎 Milvus Vector Lakebase 通过外部数据集合与按需查询计算,将对象存储中的 Parquet 数据接入向量检索,面向低频、大规模探索减少重复搬运与常驻计算投入。
External Collection 关联外部文件并建立检索所需索引,On-Demand 查询节点随任务启停;持续在线和轻量弹性场景则分别提供 Dedicated、Serverless 形态。使用流程包括数据连接、权限配置、同步与索引准备,主要减少源数据重复导入,检索索引与查询计算仍需相应的存储及算力。
2026-09-04|从线性对话到二维协作,Huabu 探索 Agent 时代的“新桌面”
微软亚洲研究院的 Huabu 将资料、笔记和 Agent 产物放入可操作的二维空间,让位置、分组和连接关系参与上下文表达,支持信息收集、组织与任务执行连续进行。
用户可以并排比较材料、移动节点并建立关系,Agent 则结合内容及其组织方式理解任务,在用户可检查的过程中提出修改。相较只沿时间展开的对话记录,这一设计让项目材料持续可见,便于多轮整理与复用。文章介绍的是单人和多 Agent 协作,多人共享空间仍属后续方向;代码见 Huabu。
2026-09-03|Rslib 1.0 正式发布:面向多场景的 JavaScript 库开发工具
字节跳动发布 Rslib 1.0,基于 Rsbuild 整合 JavaScript 库的编译、类型生成和资源处理,支持多种模块产物以及打包、保留模块结构两种构建方式。
工具覆盖工具库、组件库与 CLI 等场景,可复用 Rspack/webpack 生态,输出 ESM、CJS 等格式,并处理样式和静态资源。类型生成支持 TypeScript 7 与独立声明模式,开发流程可结合 Rstest、Rspress 等工具。1.0 包含不兼容变更,已有项目升级需按官方发布说明核对迁移要求。
2026-09-02|Flutter A2UI 深度解析,它是怎么提供动态生产力的,然后为什么 A2UI 不只是 Flutter
围绕 A2UI 的动态界面机制,作者解析客户端函数与组件目录如何协作,让模型描述界面和操作意图,再由客户端已注册的能力完成高频交互及状态更新。
界面协议中的函数调用由本地 Dart 实现承接,并通过组件与函数目录约束可用能力;响应式绑定使滑块等交互不必每次经过模型往返。文章同时区分客户端函数与后端工具调用,说明界面描述、端侧执行和服务端操作各自承担的职责,为理解跨端 Agent UI 的实现边界提供参考。
2026-09-03|小红书 x vivo 首发!从相册到社交,一文读懂3D图片技术实践
小红书与 vivo 围绕三维高斯泼溅技术打通相册生成、社交发布和端侧渲染,并通过场景压缩、按设备分发与渲染优化,控制移动端的体积、算力和内存开销。
方案结合几何与外观压缩、结构剪枝及分级细节,将生成内容适配移动端传播。渲染侧采用早期裁剪、计算化简和实例化绘制,加载侧使用并行解码与局部选择替代完整排序。团队披露,在文中中端 Android 设备测试中,帧率由 30 FPS 提升至 45 FPS;这一结果对应其具体场景和设备条件。
2026-09-02|当我们再也读不完AI写的代码: 理解债务、Harness Engineering 与代码审查的未来
思特沃克作者以“理解债务”描述代码生成速度超过团队理解速度的问题,提出结合可执行质量检查、独立评估和风险分级审查,为人类保留关键系统决策的理解责任。
文章梳理多角色 Agent 工作流与自动化测试案例,认为规范应进入可执行关卡,生成者与评估者也应适当分离。在此基础上,作者建议按改动风险决定自动化程度和人工审查投入,并讨论初级工程师如何继续积累系统理解。这一方法分析将审查流程、责任分工和人员培养放到同一个研发治理问题中。
2026-09-04|传统企业 AI 转型的最短路径,藏在研发部门
InfoQ 通过海信、三一重工和孩子王案例,讨论企业如何从研发场景积累规范、验证和知识复用能力,再把 Agent 平台及跨部门协作机制延伸到具体业务流程。
报道中的海信案例将 AI Coding 纳入规范驱动与闭环验证体系,三一重工强调研发、数据和 AI 团队协作,孩子王则以自研平台承接业务智能体。三个案例分别呈现了工程规范、跨部门平台和业务应用的组织方式,可供参考的是研发团队如何将可靠性处理与系统集成经验转成共享能力。