Signal #30:知识检索跟着任务进度走
Agent 刚接到故障和已经排查一半,需要的资料并不相同。本周,The Missing Complement 尝试补齐 Agent 下一步决策缺少的证据,RAFT 则根据排障进度寻找有用的历史案例。
两项研究指向同一个变化:检索同时考虑问题是什么、已经查清了什么,以及下一步还缺什么。 随着 Agent 持续执行任务,知识供给也需要跟着任务进展调整。

2026-09-16|个人提效,攒不成组织提效:货拉拉 AI Coding 落地实践
货拉拉用 AiBox 统一下发 Rules、Skills 和 MCP,将个人用法转为团队共用流程。需求开发先召回相关 Spec,经研发确认后拆成可验证的变更;规范使用后记录命中与误导情况,推动修订。平台同时观察 AI 代码合入占比、过程 Trace 和首次生成后的修改程度,并指出:修改少不等于质量高,合入后的返工和故障仍需另行衡量。
2026-09-16|高德扫街榜技术实践|扫街榜 2.0:10 万+行代码背后的可控重构之路
扫街榜 2.0 用关系图分析代码、配置和接口的影响范围,先约定行为边界及回退条件,再分步迁移。CR Agent 检查实现,ATDD Agent 用真实样本对照新老业务行为,两者基于同一代码版本分别给出证据,由人决定放行。文章中的 10 万余行指代码变更规模,不能直接换算为 AI 提效比例。
2026-09-14|Deepseek Harness 架构解析和应用
团队基于 DSH 插件机制接入 OpenSpec:流程服务维护变更状态,在没有活动 Change 时拦截写入;进入验证阶段后运行规范校验、类型检查、Lint 和测试,失败诊断返回 Agent。界面按项目展示阶段、任务数和验证结果,让规范执行从对话提醒进入工具约束和状态管理。
2026-09-17|真正烧Token的不是代码,而是模型反复看同一份上下文
腾讯轻量云将代码探索交给短生命周期 Agent,低频模板按需加载,并用 replace_batch 合并基于同一代码状态确定的修改,减少长上下文的重复输入和模型往返。在一个涉及 6 个接口的需求中,两种模型配置的全流程 Token 分别下降 25.69% 和 41.95%;结果仅对应这一需求,不等同于费用或耗时降幅。
2026-09-16|看完我的AGENTS.md,你将看到我和不说人话且over-engineering的模型搏斗的这一生
作者将长期使用模型遇到的问题写成 AGENTS.md,涵盖多余对比、生造术语、擅自扩展需求、恢复已删除内容,以及实现后未验证就停止等行为。规则强调基于最新文件继续工作、完成运行验证,并让最终产物只呈现当前方案。清单带有鲜明的个人使用偏好,展示了如何把反复纠错整理成持续生效的协作约定。
2026-09-17|个体快了十倍,组织却更慢了:AI时代到底卡在哪?
肖然在分享中提出,编码加速后,需求交接、评审等待和责任划分可能成为更明显的瓶颈。管理者需要设计人与 Agent 的分工、介入节点和执行边界,工程师则需加强问题定义、系统设计与评测能力。他建议从现有流程的交接处寻找改进点,建立业务评测集;“沙漏型组织”等属于其方向判断,尚非普遍验证的组织模式。
2026-09-13|玩家说“充值没到账”,日志只回了一句 BAG_FULL
SLS 先整理日志字段、枚举和指标,再汇聚跨数据源的业务术语与口径,供 DataAgent 查询。自动提取的信息经采纳后才可使用。在模拟游戏客服案例中,Agent 联合支付、发货和背包日志解释充值未到账;口径不明时先确认,证据不足时保留不确定性,误封申诉等问题交由人工复核。
2026-09-16|从“做过”到“会做”:用 OpenViking 经验记忆构建 Agent 的进化闭环
2026-09-17|火山引擎Agent社区|OpenViking:给 Codex 加上长期记忆
OpenViking 将原始会话加工为任务轨迹,再提炼可复用步骤、检查项和风险边界。新任务按需检索经验,核对适用条件后使用,执行结果继续更新记忆;项目资料按摘要、概览和全文分层加载。团队在 τ²-bench 的零售与航空任务上分别报告成功率提升 6.87、11.87 个百分点,接入方式包括插件和 MCP。
2026-09-17|WorkBuddy资料库:从三大场景开始,让多人多Agent轻松协作
WorkBuddy 资料库把本地 Demo 和活动页面转成共享在线页面。团队成员可以在同一页面评论、圈选问题,调用各自的 Agent 修改,再通过同一链接查看和验收,减少附件重发与版本混淆。文章还介绍了关联页面反馈、保留版本记录的 PPT 协作方式;PPT 多人多 Agent 共创在发布时仍处于内测。
2026-09-18|Agent 评估实践:从“改了不敢发”到“发布有据可依”
AliExpress 由平台统一执行、留痕和发布检查,业务团队维护数据集与判分。实践发现三类误判:少量简单样本绕过发布门槛、空期望值制造失败、重复运行分数波动。团队增加各层最小样本量检查,抽样模式不再给出发布通过结论,并校验数据、观察重复运行分布。评测系统自身的缺陷,也可能产生看似合理的错误分数。
2026-09-18|让Agent可评、可控、可迭代:业务效果导向的评测体系与场景实践
大淘宝将营销策略评测分为规则检查、模型判断和线上实验,分别验证硬约束、业务合理性与真实收益。异常按知识、执行、策略或评估器问题分类处理;灰度中增加运行旧策略的验证桶,辅助排除环境变化。团队还单独验证 Judge:一版准确率从测试集的 86% 降至泛化验证集的 55%,暴露出评估器过拟合问题。
2026-09-16|agent优化之GEPA——一种提示词自进化的优化方案
团队基于 GEPA 构建提示词优化系统,依次执行批量推理、评分、错误归因和候选变异,保留不同指标间的有效取舍。适配层统一输出结构、答案提取与评分方式,支持分类、评分和对比任务;最终提示词在独立留出集复评。每轮配置、过程和结果分别保存,使修改原因与收益能够追溯和比较。
2026-09-17|日志服务 TLS AgentLoop:让多模态调用清晰可见
TLS AgentLoop 将图片等媒体关联到具体会话、消息和调用节点,便于核对 Agent 收到了什么、随后如何执行。媒体文件进入对象存储,Trace 保留引用和元数据,避免大段 Base64 撑大日志。详情支持预览,并串联后续反馈;记录未显示图片时,还需检查采集、上传和权限,不能直接认定模型未收到图片。
2026-09-17|周五 21:47,checkout 又慢了:云监控 MCP 想接住的那二十分钟
云监控 MCP 将 aliyun cms2 的命令能力映射为远程工具,Agent 可在一段会话中查询告警、指标、链路和事件,交叉验证问题,再按授权调整规则,减少宿主机安装和配置成本。ToolSet 控制本次连接开放的工具范围,实际权限仍由 RAM 决定;调查与写入可以分别授权。文章以 checkout 延迟排查串联完整操作过程。
2026-09-17|B端AI设计工程化提效
淘宝闪购探索让设计师直接交付工程代码,以业务流程、页面框架、组件和全局样式组织设计 Skill。通用规范统一维护,业务规范分别管理,减少设计稿到代码的转换。设计师因此承担部分前端实现工作,并继续把控质量。文中标准页面设计提效 80%—90% 为后续目标,尚非已实现的整体收益。
2026-09-16|指标平台:从语义底座到智能消费的实践路径|得物技术
得物统一高频指标口径,同时核查数据血缘、整理域内资产,以 YAML 生成模型和指标,并将分布、空值、主键校验设为上线要求。这套语义资料同时服务 Text2SQL 与 AI Coding,提供字段、来源和计算约束。团队报告系统测评 SQL 准确率随治理从 85% 以上升至 95% 以上,收益来自一系列治理动作。
2026-09-14|小红书 AllSpark 发布 Iris:同量级最强开源 Search Agent
Iris 从网页链接关系构造跨页面搜索题,筛选闭卷难答、给证据可解的样本。训练交替进行 SFT 与 RL,将判分和摘要放在集群内部,并让超长轨迹断点续跑,减少外部依赖与等待。团队在统一工具和上下文配置下评测,已公开模型权重与评测代码,完整数据和训练配方计划后续公布。
2026-09-17|高德扫街榜技术实践|从兴趣空间到地理空间:生成式召回的三次迭代
高德为本地生活召回补充地理信息:GeoGR 用时空共访行为构建 POI 语义 ID,HF-SID 进一步单独编码坐标、数值和类目,减少远距离相似门店混淆。在指定数据集上,簇内平均距离从 0.49 公里降至 0.25 公里;替换线上召回模型后的 A/B 实验平均取得 PV_CTR 提升 2%、PV_CVR 提升 3%。