Signal #26:Agent 明明发现了风险,为什么还会继续执行?
我们通常认为,Agent 识别出恶意指令或越权风险后,就会停下来。
本周发布的预印本 HarnessRisk(尚未同行评审)测试了 3 个开源 Harness 和 6 个模型。部分组合识别风险的比例超过 90%,攻击仍有相当比例成功。这只是有限环境下的新实验,却揭示了一个值得警惕的差距:发现风险,不等于危险动作会被阻止。
本周,Google 为 Workspace Flow 增加独立标识和最小权限;AWS 也将访问控制交给基础设施和下游系统。
共同方向已经出现:模型负责识别和提示,系统负责审批、拒绝和停止。评价 Agent 是否安全,最终要看危险动作有没有真正被阻止。

2026-08-23|Agent 明明发现了风险,为什么还会继续执行?
文章结合 HarnessRisk 的实验与 OpenAI、Google、AWS 本周的安全实践,区分了两个经常被混在一起的问题:Agent 有没有识别出风险,以及危险动作最终有没有真正发生。部分 Model × Harness 组合虽然频繁报告恶意指令或越权风险,攻击仍可能通过工具调用、状态写入或后续执行成功。
风险提示本身只是一段模型输出,不能自动撤销权限、暂停工具或回滚已污染的状态。真正的安全边界需要落实到独立身份、最小权限、人工审批、下游授权校验和执行阻断:模型可以提出下一步动作,但系统必须握有拒绝并让操作停下来的能力。
2026-08-18|开启 Benchmark 的 Harness 时代:15 家学术机构联合发布 HarnessEval
HarnessEval 将 Harness 引入 Agent 评测:评估系统不只调用 Judge 模型给分,还需要理解案例、规划验证路径、选择工具、搜集证据并检查推理过程。
这个方向回应了一个越来越现实的问题:Agent 的最终表现由模型、上下文、工具、执行环境和验证机制共同决定,单一模型分数无法解释完整系统。评测因此也需要可追溯的执行轨迹,让每个结论都能回到证据和验证步骤。
2026-08-19|基于阿里云 AgentLoop 的 DeepSeek Harness 评测实践
文章基于 AgentLoop 和 terminal-bench 2.1 的十个任务子集评测 DeepSeek Harness,以容器终态而不是文本回答判断任务是否完成。
评测同时检查任务完成度、红线合规和执行过程可靠性,评分逻辑由确定性脚本完成。相比只看二值通过率,这种方法能够区分“结果完成但过程越界”“偶然成功但执行不稳定”等情况,也更适合用于 Harness 迭代。
2026-08-19|EP-Harness:从个人 AI Coding 到团队级 Agent 工作流
得物基于 Multica 构建 EP-Harness,把 Agent 作为有身份、任务、状态、执行记录和权限边界的团队成员进行管理。
平台将 Agent 任务关联到 Issue、项目、需求、应用、分支、工作流、评论和执行日志,试图补齐本地 AI Coding 工具进入团队后暴露的四个缺口:Prompt 缺少 Review、经验无法沉淀、过程不可见、研发链路没有闭环。
2026-08-20|DeepSeek Harness 是自进化 Agent 的基石
文章从 Coding Agent、插件化 Harness 和 Cordis Meta-framework 三层理解 DeepSeek Harness,重点关注模型之外的 Agent Loop、工具、会话和运行策略能否被替换、组合与撤销。
作者认为,自进化 Agent 不只需要继续积累能力,也需要安全地修改和删除已经过时的 Harness 组件。热重载和可逆生命周期因此不只是开发便利,而可能成为持续学习系统控制变化范围的基础。
2026-08-20|支持 DeepSeek Harness 接入:AgentScope Service 开源智能体服务控制面解读
AgentScope Service 面向企业级分布式 Agent 场景,为 AgentScope、Claude、DeepSeek Harness 和 LangChain 等不同形态的 Agent 提供统一接入、调试、多租户与多 Agent 编排能力。
它不替换具体 Agent Framework,而是在数据面之上增加控制面。不同技术栈构建的 Agent 可以被统一注册、观察和组合成 Team,平台负责治理,业务团队仍可保留自己的运行时选择。
2026-08-20|TLS for DeepSeek Harness 可观测实践:从系统总览到会话复盘
TLS for DeepSeek Harness 将模型请求和工具调用转换为 OpenTelemetry Trace,并用 agent.turn、llm.request 和 tool.call 三类 Span 组织执行过程。
这种结构让开发者可以从整体耗时、Token 和错误分布下钻到单次模型请求或工具调用,再还原完整会话。面对长任务,高消耗或异常结果不再只能从聊天记录中猜测,而能够沿调用链定位具体阶段。
2026-08-21|浅谈 Skill 研发的最佳实践——以百补详情助手为例
文章以经历五十多次 Commit 的百亿补贴详情助手为例,从架构、研发效率、运行优化和结果呈现四个维度总结 Skill 工程实践。
团队采用分层加载减少上下文开销,用桥接器解耦本地 Skill 与远程 Agent,并按需共享上下文、优先交付可读的 HTML 报告。核心判断是:Skill 不是写完一份说明文件,而是需要根据真实任务持续观测、修正和演进的工程资产。
2026-08-17|Harness 工程之道:Skill 原理与最佳实践
文章将 Agent Skill 定义为轻量、开放的能力扩展规范,并用“发现—激活—执行”三阶段解释渐进式披露:会话先加载名称和描述,触发后读取 SKILL.md,执行过程中再按需读取脚本、参考资料和其他资源。
文章还区分了 System Prompt 与 Skill:前者承载项目级全局约束,后者封装可复用的领域能力。一个项目可以同时使用全局规则和多个 Skill,通过作用域与触发机制控制哪些知识在何时进入上下文。
2026-08-21|Agent 终章(Harness 成本篇):一次百炼账单降低 88% 实战
文章以故障诊断 Agent 为例,将高成本归因于三个来源:循环次数过多、历史消息每轮全量重发,以及工具结果持续堆入上下文。
团队通过调整循环、压缩历史、控制工具输出和改进缓存,将隐式缓存命中率由约 33% 提升到约 80%,并显著降低多轮会话输入费用。这些数字来自具体生产实践,不能直接套用;更值得复用的是按执行链路定位成本,而不是只比较模型单价。
2026-08-21|DeepSeek Harness 更新:官方多模态支持
DeepSeek Harness 连续更新多模态输入、子 Agent 协作、跨平台兼容和长会话体验。新版本支持原生图片请求,/goal、/plan 等命令可以接收图文输入,Codex 与 Claude Code 子 Agent 也被接入 Job Panel。
这些变化说明多模态和异构 Agent 不再只是外部工具,而开始进入 Harness 的任务、状态和界面模型。运行时需要统一处理输入、任务进度、权限和结果,而不是把每种能力做成互不相连的入口。
2026-08-22|给 DeepSeek Harness 一句话生成可视化图表的插件 dsh-plugin-chart
dsh-plugin-chart 为 DeepSeek Harness 提供组织架构图、桑基图、折线图、树图、网络图和统计图等可视化能力,并同时注册 Skill 与 Tool。
Skill 负责告诉 Agent 何时以及如何选择图表,Tool 负责将结构化配置转成图片。这个分工展示了 Agent 扩展的一种实用边界:领域方法进入 Skill,确定性的渲染和导出进入工具。
2026-08-18|AI Coding 的共生与替代:一场分阶段的演进
文章将 AI Coding 拆成工具、副驾、协作者和共生体四个阶段,观察每个阶段中 AI 接管什么、人仍需判断什么,以及新的协作界面出现在哪里。
其中“需求分治”让 AI 参与架构级拆分,人则把精力放到约束、验证和裁决。文章提炼的稳定原则包括控制验证成本、明确约束、按置信度分流、保持批判性审验和沉淀团队知识;工具会变化,但这些责任不会自动消失。
2026-08-17|去哪儿网:前端需求端到端交付 AI 落地实践
去哪儿网尝试让 Agent 贯穿需求、设计、实现、联调、测试和发布,当前优先打通需求到联调的核心链路。
前端交付的难点不只是生成代码:输入包含需求文档、设计稿和交互说明,验证依赖真实设备,还要同时检查数据、视觉和交互。团队先把设计稿转成结构化 UI 物料,再结合目标端技术栈和组件规范生成实现,以减少上下文消耗并提高可验证性。
2026-08-17|去哪儿网:AI Coding 驱动大型核心系统重构实践
去哪儿网国内机票团队将 AI Coding 用于约十五万行高并发核心系统重构。文中披露总工时、主流程耗时和机器成本均有明显下降,并称项目最终无故障上线。
比数字更可复用的方法是:大型重构不能只拆成更多代码任务,还要把行为一致性、异常、性能、资源、副作用和回滚路径变成显式验证条件。AI 适合在这个执行系统中持续推进,而不是独自决定系统是否安全完成迁移。
2026-08-21|“女娲”:AI Bug 修复数字员工介绍
京东将故障处理拆成告警感知、日志检索、根因分析、类型分流、方案生成、编码、提交、Review 和部署等九个步骤,并由“女娲”串联从告警到发布的闭环。
文章认为,大量故障属于已知模式的新实例,适合由 Agent 处理信息检索和重复操作。真正的工程边界在于把每一步的输入、证据、权限与退出条件明确下来,避免“自动修复”变成缺少审查的自动变更。
2026-08-21|云效 AI 助手上新:让 AI 融入 DevOps 协作的每个环节
云效 AI 助手覆盖需求录入与优化、测试用例生成、Merge Request Review、流水线 YAML 排障、发布风险评估和项目进展汇总。
产品提供主动提问、场景内按钮和定时或事件触发三类入口。Agent 因此不再只在独立聊天框中工作,而是嵌入已有研发对象和流程;相应地,自动化行为也需要继承这些对象原有的权限、状态和审计边界。
2026-08-20|Vercel 开始造“软件工厂”了:AI Coding 的下一站,不是更多 Agent
Vercel AI SDK 团队没有继续堆叠单个 Coding Agent,而是让不同 Agent 分别负责问题分类、复现、分析、实现、Review 和旧版本 Backport,并把验证、风险评估和人工决策放进同一条链路。
文中披露,这套 Software Factory 运行四周后,每周约 25%~35% 的合并 PR 来自 Factory,7 月关闭的 Issue 中超过 75% 由它处理。这个案例的关键信号不是 Agent 生成了更多代码,而是研发系统开始重新分配有限的 Review 和判断能力。
2026-08-18|Cursor 一夜干掉了 GitHub
文章用“取代 GitHub”的强烈措辞介绍 Cursor Origin,但当前产品更准确的定位仍是面向 Agent 工作流的代码托管早期版本。它提供 Repository、PR、代码浏览、合并队列以及与 GitHub 的同步,并接入 Vercel、Depot 和 Buildkite。
对同步仓库而言,GitHub 初始仍是 Source of Truth。真正值得关注的是,代码托管开始原生考虑多 Agent 并发、机器可读的 Review 状态和自动化事件,而不是 GitHub 已经被实际替代。
2026-08-21|Bun 稳定版落地:跨语言重写之后仍需清理大量问题
文章复盘 Bun 大规模跨语言重写后的稳定版交付:AI 可以在很短时间内完成大量代码迁移,但之后仍需处理兼容、回归、性能和社区反馈。
文中将数千项问题修复视为“写完不等于可以发布”的证据。大型 AI Coding 项目真正昂贵的部分可能不是首次生成,而是让行为、接口和生态兼容性达到生产标准,并持续证明这些条件没有被后续修改破坏。
2026-08-18|规模化应用 AI 的最大绊脚石,其实不是技术?
文章指出,企业对 Agent 的需求增长很快,但数据基础、输出可信度和实际采用之间存在明显落差。数据不可靠时,越自主的系统越可能放大错误,最终让高投入项目停留在概念验证阶段。
因此,规模化应用 Agent 不能只比较模型和工具,还要回到数据质量、来源、权限和责任边界。Agent 能否持续创造价值,取决于组织是否愿意先修复这些不显眼但决定可信度的基础条件。
2026-08-18|支付宝拉上手机、汽车、大模型,准备让 AI 办一件大事
支付宝发布 AHA 多 Agent 跨端互联协议体系和智能体商业底座,并通过“阿宝”连接出行、餐饮、文旅和政务民生等服务。
文中披露,阿宝已完成万余项服务适配,并与多家手机厂商和车企打通协同。AHA 要解决的核心不是让单个 Agent 无所不能,而是让不同服务中的 Agent 能发现彼此、组合任务并完成履约;身份、支付、隐私和失败处理也因此成为协议的一部分。
2026-08-19|AI 理解、引擎驱动:零代码搭建实时数据链路
直播数据团队提出“维度 + 指标”的实时数据开发方式,由 AI 将自然语言需求转换为 DSL,再由确定性引擎生成 Flink SQL 和依赖拓扑。
方案刻意将“理解需求”和“保证正确性”分开:模型负责提取业务意图,引擎负责依赖、增量调整和执行约束。开发者因此可以从流式计算细节上移到指标语义,同时把可复用的业务定义沉淀为数据资产。
2026-08-20|高德动量机器狗途途:从看懂空间到多场景自主作业
高德动量机器狗“途途”不依赖预先构建的静态地图,而是结合时空数据和众源融合定位,在运行过程中生成可用于导航的空间表示。
开放环境中的难点不仅是定位,还包括理解道路、动态人车、地形和禁行语义。文章展示的演进方向,是从“一项任务一个模型”走向能够理解指令、结合现场信息并在多个场景中作业的具身系统。
2026-08-21|V4-Flash-Vision-Exp 上线,开启多模态 API 服务
DeepSeek 发布 V4-Flash-Vision-Exp,在保持文本能力的同时增加视觉理解,并支持 Chat Completions、Messages 和 Responses 三种 API 格式。
图片可以通过 Base64、外部 URL 或 Files API 传入,并转换为 Token 计费。多种协议同时开放,降低了现有 Agent Harness 接入视觉模型的迁移成本,也让图片输入开始进入统一的上下文与成本管理。
2026-08-19|从文件高清到体验高清:小红书如何守住全链路画质?
文章围绕 HDR 与广色域、超清分辨率、全屏大图、LivePhoto 和 3D Photo,介绍从素材解析、编辑发布、云端生产、资源分发到终端显示的全链路画质体系。
源文件只决定画质上限,格式识别、色彩管理、编辑保留、压缩策略和设备显示共同决定最终体验。面对 PQ、HLG、Dolby Vision、增益图等多种格式,画质系统需要同时处理兼容性、性能和视觉一致性,而不能只比较文件参数。
2026-08-19|从斜箭头到 AI 指针:光标交互的新变化
文章回顾鼠标光标从早期垂直箭头到斜向箭头的演变,并观察 iPadOS 圆形指针、微软 Click to Do 等新交互。
AI 让光标不再只表达点击位置,还可以预测目标、吸附控件、理解屏幕内容并触发后续动作。光标正在从随情境切换的视觉符号,发展为人和系统共同理解当前意图的交互层。
2026-08-20|Flutter A2UI 的正确用法:如何让 AI 与动态 UI 进入真实生产
实时生成 A2UI 需要模型理解上下文、调用工具、生成 JSON 再转换成 Widget,等待时间可能达到几十秒甚至更久。Async A2UI 将生成动作提前到业务数据变化时,用户打开页面时直接读取结果。
文章将这种结构类比为数据库物化视图:A2UI 不再是一次模型输出中的临时消息,而是可以保存、传输、恢复和重放的 UI 数据。Generative UI 因而开始具备缓存、一致性和失败恢复等生产系统问题。
2026-08-17|代码越改越乱?来试试前端领域模型驱动设计
文章以购物车自动合并分组为例,展示缺少领域模型时,一个局部需求如何让条件判断、状态和页面逻辑不断耦合。
前端 DDD 的目标不是增加更多抽象,而是把持续变化的业务规则从视图和流程代码中提取出来,使复杂度集中在可命名、可测试的领域对象内。它适合业务长期演进的场景,但仍需要避免为简单页面引入超过问题规模的模型。
2026-08-20|从新版 MCP 到 Gateway API 推理扩展:读懂 Higress v2.2.4 的关键变化
Higress v2.2.4 支持 MCP 无状态 HTTP Tools,使每个请求携带完整上下文,减少远程工具在横向扩容时维护会话状态的负担。
新版本还对齐 Kubernetes Gateway API 和推理扩展,并在工具调用前执行输入 Schema 校验。它同时保留新旧协议的显式转换路径,让客户端和既有 MCP Server 可以渐进迁移,而不是一次性切换全部基础设施。
2026-08-22|Higress 接入 Qwen3Guard:把 AI 内容安全放进网关主链路
Higress 通过 Wasm 插件接入 Qwen3Guard,在请求进入模型前审核输入,并在模型返回后检查普通 JSON 或 SSE 流式输出。
安全模型可以独立部署和扩缩容,风险阈值与拒答策略由网关统一配置。这样做不要求每个业务重复修改代码,也将审核策略从应用内部提升为可集中更新、观察和审计的基础设施能力。
2026-08-23|GPU 利用率低却难定位根因?试试这款零侵入 AI Profiling 工具
SysOM AI Profiling 面向训练和推理过程,在不修改代码、不重启进程的情况下采集 Python 调用栈、CPU、GPU 算子、Torch 调用、显存、FLOPS、RDMA 和 TCP 等数据。
工具同时提供多进程聚合与单进程下钻视图,试图把“GPU 利用率低”从一个结果指标还原为可定位的调用、计算、通信或数据瓶颈。AI 基础设施的可观测性因此需要跨越框架、运行时和硬件层,而不是只看单一设备曲线。