Signal #24:Agent Harness,会越来越通用还是定制化?
这周出现了一组看起来相反的信号。AWS、Microsoft、Pydantic 都在把 Session、Context、Tool、Sandbox 等 Harness 能力做成通用组件;但 Steve Yegge 在复杂项目中的实践又显示,Agent 真正进入项目后,仍会出现大量与具体系统相关的规则和机制。
但这些“定制”未必都会长期存在。任务拆解、上下文检索、重试、Multi-Agent 协作,甚至部分验证策略,都可能随着通用 Agent 变强继续被吸收。真正无法仅靠模型升级自动获得的,是项目和组织自己的目标、事实、约束、完成标准和责任边界。未来真正需要沉淀的,可能不是更多 Harness 代码,而是让 Agent 能获取、理解并验证“什么才是对的”。

2026-08-07|大淘宝技术|原文链接
淘宝主播 Agent 围绕执行循环、上下文、工具、状态、评估和安全机制构建模型外部的 Harness,将大模型的不确定性约束在可执行、可恢复、可审计的工程系统中。
文章给出了比较完整的工业级 Agent Harness 实践:上下文采用分层压缩和 Reducer 模式,让模型负责决策、确定性函数负责状态变更;工具调用通过 Schema、幂等和结构化错误保证可靠性;复杂任务采用 DAG 规划,并配套沙箱、分级审批和多层安全防护。这套 Harness 已经明显超出“给模型挂几个工具”的阶段,而是在围绕长期运行、状态一致性和高风险动作建立完整执行系统。
2026-08-05|大淘宝技术|原文链接
大淘宝团队将知识资产、研发过程资产和 Agent 执行协议统一沉淀到代码仓库,让复杂业务中的 AI Coding 从个人工具使用逐渐转向可持续的团队交付机制。
方案将知识拆成跨应用通用知识、应用领域知识、候选知识和个人经验,并通过结构化模板约束内容;每个需求又单独保存从输入、澄清、分析、拆解到实现、验证和知识回补的全过程产物,使 Agent 能跨 Session 接续工作。文章特别强调“知识库提供稳定上下文,代码仍是实现事实”,避免把容易变化的接口和字段复制进知识库后形成新的事实漂移。
2026-08-03|大淘宝技术|原文链接
百亿补贴 C 端团队围绕规范驱动、知识增强和自动验证构建 Coding Agent,并将页面 Solution、模块、组件和原子能力等前端资产转化为 Agent 可消费的工程知识。
系统覆盖需求输入、仓库匹配、设计稿解析、代码生成和多层质量验证,并通过自动同步机制保持知识库与代码演进一致。D2C 部分同时使用 MasterGo 结构化数据、截图和 UI 特征 DSL,说明前端生成正在从单纯视觉还原进一步走向设计语义、组件资产和工程约束的联合匹配。
2026-08-06|腾讯云开发者|原文链接
文章结合团队大幅删减 tdsql-harness 内容的实践,提出模型能力增强后,Harness 的重点应从穷举模型应该怎样做,转向明确目标、边界和可验证的成功标准。
一个值得关注的判断是“放开路径,收紧验收”:不要继续用越来越长的规则限制模型搜索空间,而应把高频能力转为按需加载的 Skill,把成功标准尽可能转换成测试、产物和命令返回值等可机械判断的结果。这与近期 Harness 从 Prompt 堆叠转向 Capability、Eval 和 Runtime 约束的变化形成呼应。
2026-08-08|阿里云云原生|原文链接
文章提出,面向 Agent 参与研发的系统需要进一步显式化架构、服务、领域、接口、数据和运行事实,将过去依赖工程师经验理解的隐式知识转换为 AI 可读取的工程表示。
具体方案包括 Architecture Map、Service Card、领域不变量、接口契约、数据事实与运行事实,并将高频开发任务进一步封装成 Skill。这里的价值不只是“补更多文档”,而是在讨论软件系统是否需要为了 Agent 重新设计自己的知识表示和执行边界:系统越容易被机器理解,Agent 才越可能安全地参与修改和维护。
2026-08-07|腾讯技术工程|原文链接
腾讯技术工程团队通过清理遗留代码、简化过度设计、统一工程规范和补齐自动化验证,逐步改善 AI 在历史项目中的代码理解和修改质量。
这篇文章一个很现实的价值是,它没有把问题简单归结为“缺少更多 Prompt 或知识库”。旧代码、失效设计和工程债务本身都会成为 Agent 的错误上下文,因此让系统更适合 AI 的过程同时也是一次工程治理过程。团队随后补齐单测、E2E、视觉回归和 AI Review,把“AI 能生成修改”进一步推进到“修改后能够验证”。
2026-08-06|美团技术团队|原文链接
美团图灵 Agent 评测团队提出,Agent 的评测对象已经从单一模型输出变成“模型 + 系统 + 工具 + 执行流程”,因此不能只判断最终答案,而需要同时观察结果、过程、效率和风险。
文章强调从生产 Bad Case 建立评测样本,并将模糊的主观标准不断下钻成可执行 Rubric。对于长程 Agent,还需要评估任务拆分、依赖关系、目标保持和状态一致性。随着 Coding Agent 从一次生成走向长时间自主执行,Eval 正逐渐成为 Agent 系统本身的一部分,而不是发布前最后做一次 Benchmark。
2026-08-04|京东技术|原文链接
京东行云 Coding 正把传统代码托管平台扩展为 AI 研发能力底座,通过代码图谱、语义检索、仓库 Wiki、MCP 和 Agent Framework,将代码仓库转变为可被 Agent 查询、理解和操作的工程知识入口。
其中代码实体及调用、继承、依赖关系通过图数据库显式表示,关键词搜索和语义搜索联合支撑 Repository Context;上层又提供脚本、Prompt 和 Skill 三种 Agent 扩展方式,并允许在 MR、Commit 等研发事件中触发自动化 Agent。代码平台开始从“存代码”向“提供 Agent 所需的工程上下文和执行入口”演进。
2026-08-05|得物技术|原文链接
得物技术团队使用 Zig 实现 Agent Loop、模型适配、工具注册、Session 和 EventBus,再通过 TCP 将 Agent 能力暴露给 Python Client。
文章从较底层的视角拆解了一个 Coding Agent 的运行结构:Agent Loop 负责模型调用和 Tool Call 循环,模型适配层统一不同厂商接口,Session 负责历史持久化和 Context Overflow 后的压缩恢复,EventBus 则承担插件与事件扩展。对于理解 Coding Agent 从 Runtime 到产品层如何拆分,有较强的架构参考价值。
2026-08-04|腾讯云开发者|原文链接
文章从上下文腐烂、错误级联、工具过载和可观测性等问题出发,讨论如何通过显式节点、状态、路由和策略,将复杂 Agent 工作流组织成更可控制的 Graph。
其中比较值得关注的判断是,Graph 的价值不在于堆更多 Agent,而在于把决策和验证拆开,并通过测试、库存、线上指标等真实世界信号为模型结果提供硬锚点。相比 Loop 与 Graph 的概念之争,更有参考价值的是对“确定性步骤应该放在哪里”的工程讨论。
2026-08-09|阿里云云原生|原文链接
阿里云 RUM Flutter SDK 将页面、Action、网络请求、LongTask、异常和资源快照串进统一 Session,使“页面一直在转圈”这类模糊体验问题能够被还原成完整执行链路。
文章覆盖 Widget Action 捕获、Dio / HttpOverrides 网络采集、主 Isolate LongTask、异常通道以及 FP/FCP/TTI 等页面性能指标。对 AI 应用尤其有价值的是通过 flow_id、business_stage 等业务字段区分模型请求、流式返回和页面渲染,把模型延迟和客户端体验放到同一条用户链路中观察。
2026-08-06|快手技术|原文链接
快手在推进更高比例 AI 研发需求时发现,个人 Coding 效率提升并不会自动转化为团队级交付提升,多人需求中的协作、流程等待和人机边界开始成为新的瓶颈。
文章给出的数据表明,不同研发人员之间 AI 使用效果差异明显,同时参与人数增加后,整体提效幅度反而下降。它把 AI 研发问题进一步从工具和模型能力推向组织设计:当 Agent 能承担更多实现工作后,原来的角色分工、串行等待和交付方式是否仍然合理,开始成为规模化落地必须面对的问题。
2026-08-06|腾讯云 TVP|原文链接
盖国强分享了智能体在资料翻译、事实核查、新闻追踪和书籍写作中的长期工作流,将个人知识管理从静态资料整理扩展到持续检索、核查和更新。
其中“让 Agent 替我怀疑,而不只是替我写”的定位比较有启发性:Agent 的价值不只是加速内容生成,也可以承担资料校验、信息追踪和知识维护这类长期、重复但需要一定判断的工作。
2026-08-06|爱奇艺技术产品团队|原文链接
爱奇艺广告预估系统完成 TensorFlow + CPU 到 PyTorch + GPU 的迁移,在模型参数量增长约 10 倍的同时,通过推理优化降低机器成本,并取得线上收入提升。
文章完整记录了大规模推荐模型迁移中容易被忽略的工程问题,包括初始化、API 默认行为、优化器差异、CPU/GPU 数据搬运、小算子合并、TensorRT、BF16、CUDA Graph 和 Triton Serving。相比单纯模型结构升级,它更完整地呈现了“训练框架迁移 + 模型升级 + 在线推理”的工程闭环。
2026-08-06|字节跳动技术团队|原文链接
火山引擎 RDS MySQL 增加 VECTOR 字段和 ANN 索引能力,让业务数据与向量检索可以继续保存在同一套 MySQL 系统中,并适配 LangChain、LlamaIndex 等 RAG 生态。
官方测试中重点优化了并行索引构建、标量量化和查询吞吐。这个方向反映出向量能力正在从独立 Vector Database 向传统数据基础设施下沉:对于并不需要专门向量系统规模和复杂度的业务,已有数据库直接提供向量能力可能会成为更低成本的 RAG 基础设施选择。
2026-08-05|思特沃克洞见|原文链接
Thoughtworks 提出将 Ontology 与 LLM 结合,用显式的实体、属性、关系和规则表示业务语义,再让 Agent 自动完成数据源理解、语义对齐和差异识别。
与直接让模型阅读数据库 Schema 不同,本体论在这里承担稳定、可审计、可版本控制的语义锚点,LLM 则负责处理跨数据源映射和不一致分析。最终形成的是一种持续更新的结构化上下文,而不是一次性生成的数据文档。对于企业知识、数据现代化以及后续 Agent 使用业务语义,都有较强参考价值。
2026-08-07|小红书技术 REDtech|原文链接
小红书联合浙江大学、复旦大学提出 CULTURE-MT,将社交媒体翻译从字面准确进一步扩展到语气、表达方式和文化适应性,并发现 BLEU、ChrF 等传统指标很难反映这一差异。
团队同时训练自动 Judge,并通过人类一致性验证新的评测标准。更值得关注的是其方法论:当模型能力提升以后,很多产品体验问题已经无法继续由传统离线指标解释,需要把“业务真正关心的质量”重新表示成可以测量和训练的 Eval。
2026-08-05|京东技术|原文链接
京东开源 JoyAI-Video-Edit,聚焦实时流式视频编辑,在 720P 下实现边播放边修改,并支持长视频持续处理。
相比传统整段生成后再查看结果,流式编辑把生成模型进一步推向实时交互场景。除营销、影视和设计外,项目还探索了通过视频编辑生成具身智能训练素材的路径,作为本周国内多模态模型和实时生成能力的一项进展。