Signal #23:同一个模型,为什么会变成完全不同的 Agent
我们过去习惯用“模型能力”解释 Agent 的表现:任务完成得好,是因为模型更强;执行失败,则归因于模型能力不足。但本周多项实践都在说明,同一个模型放进不同的 Harness,可能会表现得像完全不同的 Agent。
OpenAI 在 ARC-AGI-3 实验中没有更换模型,只是保留推理过程,并调整长任务中的上下文压缩方式,得分就从 13.3% 提高到 38.3%,输出 Token 同时减少约六倍。SIGIL 将自然语言 Skill 编译成可执行 Harness 后,Agent 对规定步骤的执行率也从 56% 提高到 86%。Cursor 的实践则进一步表明,持续增加 Prompt 和 Skills 带来的改善有限,最终仍需要统一 CLI、进程托管和环境恢复机制。
这意味着,我们观察到的 Agent 能力,已经不能简单等同于模型能力。上下文如何组织、工具如何暴露、状态如何保留、结果如何验证,都会直接改变 Agent 的能力、成本与安全表现。
未来评价一个 Agent,不能只问它用了什么模型,还要看这个模型运行在什么样的 Harness 中。

2026-07-29|京东技术|原文链接
京东海博通过双层规则目录、文件驱动机制、Skill 与审查 Agent、知识库以及双 Loop 质量保障,将 AI 编程从随机对话改造成可约束、可验证和可持续沉淀的工程流程。
海博研发 RoadMap 将团队通用规范与项目专属规则分层管理,并以 Preamble 自检和五阶段流水线约束执行过程。17 项 Skill 覆盖需求拆分、方案设计、编码、评审和上线检查,三类只读 Agent 负责独立复核;知识库按需加载,Skill 则基于运行数据持续评测和迭代。开发期 TDD 与部署后真实接口自测组成双重验证闭环。文章披露,“堂食判官”等案例显著缩短了审核时间并降低处理成本。
2026-07-31|阿里云云原生|原文链接
AgentLoop 将模型输入、回复、工具调用和执行结果组织成可回放的行为链,再通过上下文判断,将局部规则命中提升为具有完整证据的高保真风险事件。
系统先统一采集不同 Agent 的行为事实,产生“疑似密钥泄露”等低保真信号,再判断敏感信息停留在输入侧,还是已经进入模型回复、工具调用或外部系统。最终事件需要说明风险越过了什么边界、影响了哪些实体、证据位于哪里以及应如何处置。相比单纯减少告警,这种设计更强调保留底层事实,同时提高高危队列的可信度和可复核性。
2026-07-29|阿里云云原生|原文链接
OpsPilot Zero 用四个职责明确的 Agent 和七个可独立评测的 Skill 串起事故接入、根因分析、修复规划和恢复验证,并以 Guardrail、证据链和风险分级限制自动化边界。
文章认为,是否拆分 Agent 应取决于每一步能否产出可被下游独立消费的语义对象。任何根因结论至少需要两条独立证据,修复动作按 L0 至 L3 分级,只有只读诊断和可回滚的低风险操作可以自动执行。作者还强调 Mock 与真实工具应共用 Schema,报告必须记录缺失证据,生产系统则需要补齐评估集、幂等、Trace、Registry 和回滚能力。
2026-07-27|阿里云云原生|原文链接
AgentScope 2.0 将 Agent 的推理与状态管理和工具执行分离,使同一 Agent 定义能够在本地、云沙箱或客户 VPC 中运行。
平台划分为控制面、数据面和 Worker:控制面管理 Agent 版本、运行环境和权限,数据面承载会话状态、模型调用与事件日志,Worker 在具体环境中执行工具。系统还区分 Agent 定义、会话事件、推理状态和工作区文件的归属,为多租户、水平扩展和故障恢复提供基础,并支持 Harness 原生委派和平台级 fan-out 两种多 Agent 编排方式。
2026-07-30|腾讯技术工程|原文链接
QQ 浏览器团队将研发对话中的纠偏和隐性知识提炼成可被 Agent 召回的高置信团队经验,并通过审核、去重和历史合并治理自动抽取产生的噪声。
初版系统直接从对话中抽取经验,约九成结果缺少复用价值。迭代后的链路增加主题分组、源码事实核验、严格去重,以及 create、update、skip、contradict 四类合并动作,并用“召回后能否让 Agent 产生正向行为变化”判断经验价值。团队披露,该系统已覆盖 6 个仓库、50 余名研发人员,累计处理 1236 次对话,垃圾经验比例由约 90% 降至约 5%。
2026-07-28|腾讯技术工程|原文链接
文章将 Graph Engineering 概括为从设计单个 Agent 的循环行为,上移到设计多个 Agent、工具和人的组织关系,并通过节点、边、状态和策略提高系统的可观测性与可恢复性。
文章用上下文腐化、错误级联、工具过载和缺少控制粒度解释单一 Loop 的局限,并介绍提示链、路由、并行、主管—工人和评估—优化等常见拓扑。其核心判断并非所有任务都要改造成 Graph,而是将模型判断放在节点中,将格式校验、测试和状态转移等确定性逻辑放在边与验证器中。文章同时比较了 LangGraph、CrewAI、AutoGen 和 Google ADK。
2026-07-28|蚂蚁技术 AntTech|原文链接
Alipay-PIBench 将支付专家对于功能闭环和资金安全的判断转化为 459 条可执行 Rubric,用确定性测试、语义评审和红队攻击评估 Coding Agent 是否完成了安全的支付接入。
PIBench 基于 9 类支付产品和 9 个真实开源项目构造 18 个项目级任务,覆盖支付创建、验签、幂等、金额校验、异常状态、查单补偿和退款边界。其 Mock 网关能够稳定注入签名错误、金额篡改、重复通知和超额退款等异常,并同时检查接口是否拒绝以及数据库是否被污染。团队披露,在 108 组配对实验中,加入结构化接入 Skill 后有 101 组得分提升,平均提高 10.31 个百分点。
2026-07-29|字节跳动技术团队|原文链接
SearchCLI 将搜索专家的参数调优过程拆成 Agent 决策、Skill 知识和 CLI 确定性执行三层,使搜索策略能够通过自动实验、评测和比较持续迭代。
系统通过 validate、plan、run、report、compare 和 apply 等命令固化搜索实验流程,并使用检查点、标签缓存和结构化日志保证长任务可恢复、可审阅。SPA 算法将搜索参数编码为带领域含义的 Genome,再通过多保真评测、多视角 Elite 保留和退火机制分配有限的评测预算。团队披露,在三个业务数据集上,自动调优后的 NDCG@20 相较默认策略提高了 11.66% 至 13.50%。
2026-07-29|得物技术|原文链接
得物订单系统将 AI Coding 流程重构为需求澄清、技术方案、TDD 实施、门禁卡控和全流程埋点五道关口,让生成代码具备明确输入、验证出口和可追溯的质量责任。
需求阶段以 Gherkin 场景定义验收契约,方案阶段统一描述变更位置、处理逻辑和兜底行为,编码阶段则将工作拆成具有 RED 和 GREEN 验证点的原子任务。各阶段配置独立审核 Agent,最终由 gate-check 汇总结论,并通过增量代码扫描识别稳定性风险。过程看板持续观察知识覆盖、工具成功率、门禁通过率、定位时间和回退频率。
2026-07-31|大淘宝技术|原文链接
作者将 AB 实验查询、代码扫描和依赖版本升级分别封装为 Skill,再让 Coding Agent 组合这些能力完成状态核验、代码固化和提测报告生成。
整个过程先扫描代码中的实验 Key,再调用内部平台查询运行状态,筛选已经全量发布的实验,并生成报告供人工确认。为降低修改风险,Agent 没有直接删除分支逻辑,而是将实验 Key 置空并保留原值和下线日期,后续再逐步清理。文章规模不大,但具体展示了如何通过小型 Skill、中间报告和人工 Review 控制 Coding Agent 的执行过程。
2026-07-27|大淘宝技术|原文链接
百亿补贴团队以 Spec 作为需求、架构、任务和约束的统一事实来源,让开发者控制关键决策,AI 在明确边界内执行编码,并通过跨会话记忆和多层审查维持复杂业务开发的一致性。
其 SDD 流程分为 Specify、Plan、Implement 和 Validate,文档体系覆盖需求、架构、执行任务和工程约束。团队没有采用完全自动化的长链路 Agent,而是让开发者逐步审核 Spec、方案和架构,再由 Aone Copilot 完成单步实现。topic-open 和 topic-save 将技术决策按主题写入 Markdown,并通过索引按需加载。团队披露,一个具体项目产生了 4000 余行 AI 代码,开发阶段耗时 4 天,但不包含联调。
2026-07-29|千问 AI 平台|原文链接
公开榜单只能提供通用坐标,团队仍需要收集真实业务中的困难样本,建立自己的测试集,才能判断模型是否适合具体任务。
文章从 MMLU、LMArena、SWE-bench 到 Agent 全链路评测梳理了不同方法的局限:固定题集会被针对性优化,用户偏好评测容易受到表达风格影响,真实代码任务仍未必匹配企业场景,而完整 Agent 评测又成本较高。作者的实践是持续收集模型处理不好的真实问题,将 Prompt 和期望结果保存成 JSONL,既用于新模型横向比较,也可以作为 Few-shot 示例改善日常输出。
2026-07-31|火山引擎|原文链接
Seedance 2.5 试图将视频生成从内容制作延伸到训练数据合成、工业流程培训和智能驾驶仿真,使动态生成模型开始进入实体产业的生产环节。
火山引擎披露,徐工集团、小鹏汽车以及多家具身智能企业已达成合作意向。具身智能团队主要利用其生成不同光照、背景和长尾运动轨迹,工业企业则尝试将 SOP、维修手册和安全规范转化为培训视频,汽车企业还在探索极端天气和复杂交互场景的数据合成。当前材料主要展示合作方向,尚未提供系统性的生产效果或训练增益。
2026-07-27|腾讯技术工程|原文链接
文章将自进化 Agent 分为外部 Skill 存储、强化学习内化和零数据自学三条路线,并指出当前被普遍忽视的问题不是如何积累更多经验,而是如何训练负责筛选和整理经验的“总结者”。
第一类方法不修改模型权重,而是把成功轨迹保存成可检索 Skill;第二类通过强化学习将经验内化到模型;第三类让 Agent 自己出题、解题和验证,减少对人工数据的依赖。文章重点比较了 AutoSkill、EvoSkill、SkillRL、SkillOS、AgentEvolver 和 Absolute Zero 等工作,并注意到多数方案仍使用冻结的大模型总结经验。SkillOS 的实验说明,技能管理本身也可能成为需要独立训练的模型能力。
2026-07-27|美团 Meituan|原文链接
CatPaw 将目标拆解、多 Agent 并行执行、云端长任务和可复用 Skill 组合为面向商家的 Agent 平台,并通过数据隔离、凭证托管、分级权限和审计限制其操作范围。
商家可以提交经营分析、评价处理或营销内容等任务,系统自动拆解步骤并调度不同 Agent。“操作录制”功能还能将人工流程转化为团队共享的 Skill。美团披露,CatPaw 已在内部运行一年,覆盖 9 万名员工并搭建超过 3 万个 Agent;但文章主要是产品发布介绍,外部商家场景的实际效果仍需继续观察。
2026-07-31|小红书技术 REDtech|原文链接
VibeSearchBench 和 VibeLifeBench 分别用模糊需求交互和持续数周的动态世界,测试模型在澄清、主动执行、长期记忆和约束保持方面的真实能力。
VibeSearchBench 的任务从不完整 Query 开始,模型只有主动追问才能逐步获得真实需求;VibeLifeBench 则构造日历、邮件、银行、机票和天气等 22 个模拟服务,并持续注入通知和静默变化。团队披露,搜索评测中 8 个模型的最高 F1 仅为 31.14,生活评测中的最强模型平均分也只有 0.325。失败主要集中在主动性、持久化和跨阶段约束保持。
2026-07-28|小红书技术 REDtech|原文链接
Vision-OPD 通过让同一模型分别充当局部裁剪教师和全图学生,把放大区域后才能获得的细粒度视觉判断蒸馏到单次全图推理中。
团队观察到,多种前沿多模态模型在查看局部裁剪图时,准确率比直接查看完整图像高出约 18 至 22 个百分点。Vision-OPD 在学生自己的生成轨迹上进行 Token 级在线蒸馏,不依赖外部教师或人工答案,并通过自动流程合成约 6200 条训练数据。团队披露,9B 模型在六个细粒度视觉基准上的平均分达到 79.68,同时没有明显损伤通用视觉任务表现。
2026-07-27|蚂蚁技术 AntTech|原文链接
LLaDA2.2 将扩散语言模型的动作从等长替换扩展到插入、删除、修改和保持,使其能够根据环境反馈调整代码、工具调用和回答结构。
模型通过 L-EBPO 优化动态编辑轨迹,并以工具调用是否成功、输出格式是否有效和任务是否完成作为环境奖励。团队还引入 128K 持续预训练和块级专家路由机制。文章披露,启用 Levenshtein 编辑后,SWE-bench Verified 解决率由 35.8% 提高到 44.4%;模型在 7 个 Agent 基准上的平均分为 53.83,同时 BF16 解码吞吐量达到对照自回归模型的 1.64 倍。
2026-08-02|梯度不陡|原文链接
AI 降低了 UI 实现和框架迁移的机械成本,但组件资产的长期价值将更多来自保存业务语义、组织约束和验证证据,而不只是减少重复编码。
文章将前端资产拆分为不同形态:低风险的局部 UI 可以更多按需生成,复杂页面经验可以沉淀为 Pattern 和 Recipe,上传、地图等验证成本较高的能力仍适合保持为稳定组件,支付、审核等业务规则则需要沉淀为领域契约和测试。AI 也会降低 Vue、React 等框架迁移的代码修改成本,但无法替团队回答升级收益和行为一致性问题。传统组件库的代码边界可能收缩,广义组件资产体系则会继续扩展。
2026-08-02|阿里云云原生|原文链接
畅捷通先建立覆盖基础设施、应用、业务和用户体验的五层可观测体系,再引入运维数字孪生和 AI 分析,将故障发现、根因定位与自动化处置连接成闭环。
平台整合日志、指标、链路和事件数据,并以 UModel 图模型构建应用、资源和租户的关联拓扑。团队将能力建设分为体系、平台、方法论和 AI 四个阶段,逐步形成“0-2-5-10”应急目标,并在巡检、故障自愈和容量预测中引入自动化动作。团队披露,整体 SLA 从 99.9% 提高到 99.995%,故障定位时间从平均 10 分钟以上降到 30 秒以内。
2026-07-28|阿里云云原生|原文链接
SysOM 巡检 Skill 将四十余项系统检查和内存、磁盘等深度诊断工具封装为 Agent 可调用能力,使主机排查从指标告警延伸到具体进程、文件和处置建议。
当巡检命中高风险项后,Skill 会自动调用 memgraph、diskanalysis 等诊断工具,并生成包含异常等级、关键发现、根因和建议的结构化报告。其能力已在阿里云 Skills 平台开源,可供 Qoder、Claude Code 等 Agent 环境加载。团队披露,内部评测的异常识别准确率超过 80%,高风险项误判率为零;详细故障过程属于演示场景。
2026-07-31|快手技术|原文链接
快手围绕 Attention 与 MoE 并行、长上下文通信、投机解码、分级 KV Cache 和 PD 弹性调度优化 kLLM,在维持模型能力的同时降低 Token 成本与推理延迟。
团队采用 Request DP Attention 与 EP 组合减少 KV 重复保存,使用 Ring Attention 支持百万级上下文,并通过三级 KV Cache 和 Cache-Aware 路由提高跨请求复用。大 PD 架构则让 Prefill 和 Decode 资源池独立扩缩容。文章披露,8 卡节点有效 KV 容量提高约 7.3 倍,平均 TTFT 下降 25%,典型场景缓存命中率提高 20 个百分点,实例启动时间由约 10 分钟压缩至 10 秒以内。
2026-07-31|群核科技质量技术|原文链接
群核科技为缺少明确标准答案的 3DGS 重建建立了覆盖输入质量、图像指标、主观视觉、点云特征、异常检测和性能成本的六维质量体系。
团队首先在 COLMAP 阶段评估注册率、重投影误差、点云密度和相机覆盖度,避免低质量输入继续消耗训练资源;训练结果再结合 PSNR、SSIM、LPIPS、人眼视觉检查以及对 PLY 点云的无参考分析进行判断。回归体系同时提供本地快速验证和线上全量测试,通过固定视角自动渲染并比较不同算法版本。目前部分评分能力已接入自动化流程,后续还计划使用 AI 检测漂浮物、空洞和其他视觉异常。