Signal #33:Coding Agent 的质量验证正在覆盖执行过程
本周几项研究发现,Coding Agent 即使生成了功能正确的代码,执行过程中仍可能存在问题。SWE-CC 发现,功能正确的补丁仍可能违反仓库规范,近半数违规发生在中间执行步骤;AgentSpy 发现,最终测试通过的任务仍可能存在与任务无关的操作。
与此同时,HarnessTester 在真实 Agent 执行框架中发现了 122 个缺陷。这些研究表明,Coding Agent 的质量验证正在覆盖更多环节:除了检查最终代码是否正确,还需要关注执行过程是否符合工程约束,以及支撑 Agent 运行的 Harness 是否可靠。

2026-10-09|淘宝直播数字人互动Harness-Aware Training实践:让Agent Model随Harness一起进化
淘宝直播数字人团队提出 Harness-Aware Training(HAT)方法,解决数字人 Agent 需要低延迟响应、同时频繁适应业务规则变化的问题。团队将 Skills、Hooks、Prompt 和 Tools 构建为可独立演进的 Harness,并通过多配置监督微调、通用能力蒸馏和强化学习,让模型适应不同 Harness 状态。基于 Qwen3.6-35B-A3B 的模型在直播问答评测中达到 94.8 分,在 Harness 变化场景下达到 94.6 分,部署测试 P50 延迟约 3.4 秒。该方案已应用于淘宝直播数字人业务,为模型与运行时 Harness 协同演进提供了实践案例。
2026-10-10|让视频生成流水线跑不崩:一个事件溯源的多 Agent 可靠执行框架
AliExpress 技术团队介绍基于 Event Sourcing(事件溯源)的 Java 多 Agent 可靠执行框架,针对视频生成流水线中长时间等待、外部调用付费、实例故障和人工审批等问题设计。框架以事件日志作为状态事实源,通过重放恢复执行状态,并使用确定性规则处理任务调度、预算、合规和状态流转,仅将开放性判断交给 LLM。针对外部调用重复执行和并发冲突,还设计了执行前意图记录、结果对账、幂等控制和 Fencing Token 机制。文章重点介绍框架设计与实现机制,尚未提供视频业务实际接入后的系统性效果评估。
2026-10-10|给 Computer Use Agent 加上 CLI,准确率反而下降了
文章解读浙江大学等机构的 HybridCUA 研究,讨论 Computer Use Agent 如何在图形界面(GUI)与命令行(CLI)之间选择执行方式。研究发现,直接给四种现有 Agent 增加 CLI 能力后,OSWorld 任务准确率反而下降 2.5~11.5 个百分点,主要原因是模型缺乏跨工具选择与切换经验。研究者通过混合操作轨迹和两阶段训练,将 HybridCUA-9B 在 OSWorld 上的准确率提升至 53.6%,比基础模型提高 14.8 个百分点。文章进一步结合专业软件操作研究,讨论 Agent 从具备工具调用能力到可靠完成跨工具任务之间的差距。
2026-10-10|从看日志猜问题到基于证据链调试:Agentic AI 如何重塑 OpenBMC 软件诊断
字节跳动 STE 固件研发团队分享 OpenBMC 软件故障诊断方案,将确定性程序分析与 Agent 推理结合。系统首先从构建产物中提取日志字符串、符号和函数调用关系,再将运行时日志映射回源码位置,重建异常调用路径并压缩关键证据。Agent 基于结构化证据完成根因分析、候选问题排序和验证建议,避免直接读取大量日志导致上下文膨胀与无依据推断。这一方案对复杂软件系统的自动诊断具有参考价值,其核心在于让 Agent 的判断建立在可追溯的程序执行证据上。
2026-10-10|Coding Agent 降本,不能只看 Token 单价
文章分析 LangChain 在开源 Coding Agent Open SWE 中开展的模型路由实验。团队将任务划分到 Fast、Balanced 和 Performance 三档模型,通过 Harness 中间件按任务选择模型。在 973 条真实任务线程的 A/B 测试中,模型路由使每线程成本中位数下降约 64%、平均成本下降 42%,产生合并 PR 的线程比例未出现统计显著差异。文章还结合多模型执行策略与 Prompt Cache 实验,提出应从模型调用成本、任务执行成本和有效交付成本三个层次衡量 Coding Agent 的经济性,避免单纯以 Token 单价评价降本效果。
2026-10-10|网关处理时延降低 97.1%:开源 Higress 与阿里云 AI 网关 Serverless 企业版性能对比
阿里云对比了开源 Higress 自建部署与 AI 网关 Serverless 企业版在大请求体场景下的性能。测试使用 1MB 和 10MB 合成 JSON 请求及 Mock 后端,排除模型推理时间影响。文中报告,在部分 1MB 请求并发场景下,企业版的网关处理时延最高降低 97.1%。文章分析了 Wasm 插件多次读取请求体带来的内存复制、分配及回收压力,并介绍基于 Envoy 原生插件的优化方案。该结果来自厂商特定配置的对照测试,不能直接推导为所有 Higress 部署场景的性能差异。
2026-10-10|服务 10 万+ 师生,基于 AgentKit 的教育智能体规模化落地实践
火山引擎介绍威科姆基于 AgentKit 建设教育智能体的实践,使用 VeADK 开发多 Agent 应用,并通过 Gateway、Runtime、Identity、Observability 和 Evaluation 等组件提供运行、权限和质量管理能力。方案覆盖智能备考、作业评价及就业规划三个场景,通过任务编排和领域专家协作完成复杂教学流程。据案例披露,平台已覆盖 20 余所高校、服务超过 10 万名师生,作业评价系统日均处理超过 16 万份作业。文章提供了垂直领域 Agent 生产部署的架构参考,但这些规模指标仍属于案例方披露数据。
2026-10-08|很多人并不想当管理者,只是过去没有别的路
文章从传统职场中管理岗位与职业晋升高度绑定的问题出发,讨论 AI 对个人能力边界和组织分工的影响。结合 Lovable 增长负责人 Elena Verna 提出的高影响力个人贡献者(HI-IC)概念,分析个人如何借助 AI 跨越部分职能边界,独立推进从想法、实现到反馈的完整工作。文章进一步讨论了组织需要提供的信息透明、决策授权与容错机制,提出管理岗位与专业贡献路径应当拥有各自的发展空间。