Signal #21:Agent 的行为,开始像代码一样被定义、测试和治理
这周,GitHub 开始让 Code Review Agent 读取仓库中的
AGENTS.md、Skills 和 Review 指令,并为其配置独立的运行环境与网络权限;Google 把 Prompt、规则和 Skill 变成可校验、可编译的构建产物;Microsoft 则开始内置由专家维护的 Agent Skills,并使用隔离环境对其进行回归评测。这些变化指向同一个方向:决定 Agent 如何工作的 Prompt、Skills、规则、规范、运行环境和 Eval,正在进入版本库、构建系统、测试框架、权限控制与观测机制。Agent 的工作方式由此变得可以评审、复现、验证和持续改进。
当工程对象从一段 Prompt 扩展到 Skills、规则、运行环境和 Eval,一种更系统的实践正在形成。我们或许可以把它称为 Agent Behavior Engineering——Agent 行为工程:系统地定义、测试和治理 Agent 在真实任务中的行为。

得物推荐系统诊断 Agent:从 “调接口” 到 “会思考”|AICon 演讲整理
推荐系统诊断 Agent 的关键,不是接入更多接口,而是区分确定性问题与开放性问题,并让排查经验持续回流。
得物构建了名为“推查查”的推荐系统诊断 Agent,采用 Highway 与 ATV 混合架构:常见问题走预编排的确定性链路,复杂异常则进入 ReAct 式探索。系统底层通过原子化 Skill、Story 编排、OpenViking 与 Graphify 知识库,以及“反思—抽象—验证”机制沉淀排查经验。这套实践展示了业务诊断 Agent 从工具调用走向知识积累和能力进化的完整路径。

从超级个体到超级组织:1688 数据中心 Multi-Agent 研发小队实录
AI 研发提效正在从增强单个工程师,转向建立能够共享知识、协同执行和持续进化的 Agent 组织。
1688 数据中心将数据研发中的 AI Coding 实践扩展为 Multi-Agent 研发小队。体系通过 KST 知识工程沉淀业务语义,以 Harness Engineering 约束和验证 NL2SQL,再通过 Agent 协作平台实现任务分工、审批与知识回流。文章尤其强调,端到端链路跑通之后,真正的瓶颈会转向知识冷启动、经验复用和组织运行成本。

模型负责理解和生成,Harness 负责身份、流程、验证、恢复与进化,两者共同决定 Agent 能否进入生产环境。
文章将数据研发 Agent 的 Harness 拆为身份层、执行层和进化层,并进一步归纳出 Identity、Orchestration、Context、Gate、Recovery、Evolution 六个支柱。相比只讨论 Prompt 或上下文,这套架构把权限、执行门禁、错误恢复和经验回流纳入统一系统,更接近生产级 Agent 的完整工程边界。

高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践
评测正在从 Agent 上线前的一次性检查,变成与 Skill、真实数据和线上反馈共同演进的工程资产。
高价率运营 AI 工作台将评测集、指标定义与 Skill 目录结构关联起来,并通过 Coding Agent 自动生成和执行评测。评测数据来自真实业务,指标包含通用指标与专项指标,部分结果由 LLM Judge 完成。实践也暴露出下一阶段的问题:线上失败样本如何自动回流、指标如何迭代,以及评测建议如何真正驱动 Agent 修改。

Agent 治理:用 Hook 堵住 LLM 的偷懒、越权与失忆
Prompt 很难稳定约束模型行为,关键规则需要下沉到 Agent 框架的执行切面中。
腾讯 DECO 数仓 Agent 引擎通过 Hook 链处理长文本截断、危险操作确认和上下文失忆等问题。长内容通过读写两侧 Offload 与引用句柄保证完整性,危险操作由配置驱动的人机确认机制阻断,上下文则通过 Hook 采集、State 保存和 Attachment 注入形成闭环。这类横切治理能力,是 Agent 从 Demo 进入真实业务系统的重要基础。

AgentScope 2.0 生产可用,企业级 Harness 底座全解析!
企业级 Agent 框架的竞争,正在从推理循环扩展到工作空间、上下文、沙箱、记忆和多智能体编排。
AgentScope 2.0 在 ReActAgent 推理内核之上增加了完整的 Harness 层,包括 Workspace、抽象文件系统、上下文压缩、长期记忆、子智能体编排、沙箱和 Skill 管理。框架同时支持多语言实现、权限控制和分布式服务,说明 Agent 基础设施正逐渐形成类似应用服务器的标准能力集合。

企业推广 Agent 的难点已经不只是能力是否可用,还包括安全隔离、Token 成本、记忆机制和组织采纳速度。
小红书选择基于 OpenClaw 建设企业级 AI 个人助理,并在较短时间内推进至全员覆盖。系统通过独立 AI Zone、NEX 沙箱和数据不出域解决安全问题,通过 Self-GC 和自动模型路由控制成本,同时建设 Memory、Skill Hub 与 Cowork Studio。文章提供了一个少见的组织级 Agent 规模化样本。

爱奇艺AI驱动漏洞闭环治理:让安全发现更智能、修复闭环更高效
安全 Agent 的价值不止是发现漏洞,还要打通资产识别、风险验证、修复和运营跟踪。
爱奇艺构建了由“AI 安全白帽”和“安全小助手”组成的漏洞治理体系,前者负责漏洞挖掘与验证,后者承接流程运营和闭环管理。系统已经覆盖 SQL 注入、业务逻辑漏洞和自动修复等场景,并通过人工校验控制误判风险。这反映出安全自动化正在从扫描工具升级为具备业务理解能力的治理 Agent。

SingGuard-NSFA 正式开源:从“管住模型说什么”走向“守住 Agent 做什么”
当模型拥有执行能力,安全边界必须从内容审核扩展到对 Agent 行为和工具调用的实时判断。
SingGuard-NSFA 面向智能体行为安全,在执行前识别并阻断高风险操作。项目提供风险分类体系、评测基准、双模推理护栏和插件化扩展能力,并开源多个不同尺寸的模型。其核心变化在于,安全对象从模型输出文本转向 Agent 即将采取的动作。

凌晨2点的PR谁来回?AgentTeams 给 LoongSuite 配了个 7×24h 社区管理员
标准化、可验证、重复频率高的维护工作,是组织级 Agent 最容易形成稳定价值的入口。
LoongSuite 团队使用 AgentTeams 搭建 GitHub 社区管理员,通过 Cron 调度、Skill 模块化、分层 Agent 和通知闭环完成 PR 巡检、CI 故障处理与代码审查。三周运行结果显示响应速度和维护覆盖度有所改善,同时也暴露出超时配置、审查深度和成本平衡等问题。这类长期运行案例比一次性 Demo 更能说明 Agent 的真实边界。

WebSkill - Agentic Web面向SaaS的进化
WebSkill 试图让网页除了暴露操作接口,还能向 Agent 提供完成业务任务所需的方法和上下文。
WebSkill 提案将 Skill 放在浏览器侧运行,并与 WebMCP、生成式 UI 共同组成 Agentic Web 架构。Skill 可以按需加载任务说明、工具绑定和业务约束,减少上下文一次性注入带来的膨胀。其更长远的意义是,网页可能从供人操作的界面,进一步成为 Agent 获取局部业务能力的运行边界。

Tool 解决“能做什么”,Skill 则需要说明“如何完成一项完整任务”。
文章从复杂 SaaS 任务出发,分析 WebMCP 只暴露原子 Tool 时的局限,并进一步梳理 WebSkill 需要解决的任务知识、上下文作用域、工具契约和人机边界。WebSkill 的价值不只是减少 Prompt,而是让页面中的业务方法能够被定义、发现、版本化和治理。

[视频] Design Systems与Vibe Coding
设计系统下一阶段的挑战,是让组件能力不仅能被开发者阅读,也能被模型稳定理解、组合和扩展。
分享讨论了传统 Design System 在 AI 开发中的几个问题:组件功能复杂、设计一致性与自由度冲突、文档与实现更新不同步。业界正在通过 Headless 组件、语义化结构、MCP 服务和更明确的子组件边界改善模型使用体验。设计系统正在从 UI 资产库转向面向人和 Agent 的工程能力接口。
复杂 Web 自动化测试的稳定性,很大程度上取决于 Agent 是否理解业务组件,而不只是识别页面上的像素和 DOM。
PagePilot 面向支付宝商家中心 PC 场景构建 AI 测试 Skill,通过组件知识、元素查找优先级、脚本纪律、阶段门控和失败自学习提高测试执行稳定性。实践表明,前端组件库、页面结构知识和测试规则可以共同成为 Agent 的 Harness,减少浏览器 Agent 在复杂业务页面中的随机探索。

Flutter 共享内存多线程即将完成,IsolateGroupBound 来了
Dart 正逐步突破 Isolate 之间不能共享内存的限制,但性能收益之外,也会引入新的状态安全和依赖兼容问题。
Dart 正在通过 Isolate Group、可共享静态字段和同步原语推进共享内存能力,以减少大对象传递中的复制与序列化成本。这可能改善大 JSON 处理和原生应用嵌入场景,但第三方依赖中的隐藏状态、垃圾回收和并发安全仍需要运行时检查与更完整的语言约束。

AI 降低了跨栈开发的局部成本,但前后端融合能否成立,最终取决于工程标准化和交付链路是否成熟。
文章区分了团队全栈、需求全栈和个人全栈三个层次,并分析不同类型需求和工程师跨栈时的真实难点。企业推进融合,需要统一工程结构、简化开发联调、自动化质量标准并保留专业评审机制。AI 提供了新的可能性,但组织不能把模型能力直接等同于完整的软件交付能力。

腾讯Ray团队实践:K8s + Ray如何支撑超大规模AI Workload
Kubernetes 管理集群资源,Ray 管理 AI 任务内部的动态执行,两者正在形成大规模 AI Workload 的分层调度体系。
文章梳理了 K8s、Ray、PyTorch 与 vLLM 组成的 AI 基础设施栈,并重点讨论异构资源、动态分配、高容错和 Single-Controller 任务的调度需求。腾讯通过扩展 KubeRay 实现跨集群联邦、跨层弹性调度与自动化容灾,为后训练、强化学习和多模态数据处理提供统一运行底座。

从 Data Lake 到 State Lake:面向 Agent 时代的存储基础设施重构
Agent 需要保存的不只是输入和结果,还包括工作空间、执行状态、中间产物、轨迹和评测数据。
火山引擎存储团队提出从 Data Lake 向 State Lake 演进,并围绕 Sandbox Store、Artifact Store、Agent 观测与评测建设 Storage Agent Infra。随着 AI 从回答问题走向长任务执行,存储系统也要从被动保存内容,转向支撑 Agent 状态恢复、任务接续和运行分析。

想到即建、不用即停 —— 火山 PostgreSQL 助力飞书妙搭的 AI 效率革新
AI 可以快速生成应用,数据库也需要具备秒级创建、按需启停和低成本试错能力。
飞书妙搭接入火山 PostgreSQL Serverless,以解决传统数据库创建慢、闲置成本高和数据恢复复杂的问题。产品提供秒级实例创建、Data as Git、AI Function 和企业级管理能力,使数据库能够随 AI 应用一起快速生成、回退和扩展。这类按应用生命周期分配资源的基础设施,会成为 Vibe Coding 产品的重要组成部分。

别再为 AI 调用超支头疼:Credits 配额,让每一笔消耗都透明可控
多模型调用不能只按 Token 数量管理,还需要把模型价格、输入输出类型和供应商差异转换为统一成本单位。
阿里云 AI 网关引入 Credits 计量体系,并增加模型元信息、供应商资源和 Credits 配额管理。不同模型和调用方式可以被映射到统一额度,再按团队、应用或租户分配。随着企业同时使用多个模型,网关正在从流量入口升级为模型路由、成本核算和使用治理的控制面。

业务规则只有从代码分支变成可配置、可测试、可审批和可追溯的资产,才能真正降低复杂系统的变更成本。
货拉拉将复杂业务判断抽象为可视化策略,通过管理面、配置面和运行面分离规则的编辑与执行。规则以 Chain JSON 发布,由 LiteFlow 在运行时执行,并配套测试、审批、版本和空间管理。该实践适合规则变化频繁、组合复杂且需要非研发人员参与配置的业务场景。

Oxygen AIIC:京东首发面向百亿商品的工业级大模型商品中心全解析
大模型进入产业系统后,高质量、持续更新且语义统一的业务知识仍然需要专门的数据生产基础设施。
Oxygen AIIC 由本体工程、AI 商品库、商品理解大模型和商品总线组成,覆盖商品知识定义、生产、迭代与消费。体系通过人机协同维护本体,使用高吞吐架构处理海量商品,并通过增量学习保证模型持续更新。它说明企业 AI 落地的核心资产之一,仍然是被结构化和治理过的领域知识。

Kimi K3 将大参数规模、百万上下文、视觉理解与长程编码能力放进同一个开放模型,重点指向复杂 Agent 任务。
Kimi K3 采用 KDA 混合线性注意力与 Attention Residuals,支持视觉输入和 100 万 Token 上下文。官方展示的重点场景包括长程编码、内核优化、编译器开发、行业研究和多媒体处理。相比单轮问答,K3 更强调复杂任务中的规划、工具使用和持续执行,也暴露出推理成本、主动性和交互体验仍需平衡的问题。

Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?
实时语音模型正在从语音识别与合成,走向能够判断对话节奏、理解环境并调用工具的交互 Agent。
Qwen-Audio-3.0-Realtime 支持情绪和语气调整、音色克隆、声纹过滤、双工控制与动态工具调用。底层采用多教师蒸馏,在推理能力、响应速度和语音表现力之间进行平衡。其重要变化是,语音模型不再只处理声音,而是开始负责何时听、何时说以及何时行动。

Doubao-Seed-Evolving升级:1M上下文来了!
固定模型版本正在让位于持续演进的模型服务,长上下文和长程执行成为 Coding 与 Agent 场景的核心指标。
Doubao-Seed-Evolving 将上下文扩展到 100 万 Token,并强化长程任务与 Token 使用效率。该模型采用固定模型标识持续更新,开发者无需频繁迁移版本。它反映出模型产品正在从周期性大版本发布,转向围绕真实工作负载高频优化的持续交付模式。
腾讯PCG联合深圳河套学院:在全双工语音大模型领域取得重要突破,获 ACL 2026 杰出论文奖
全双工语音的难点不只是低延迟,还要同时建模语义理解、声学表达和对话节奏。
团队提出 Lychee-FD 原生端到端全双工语音模型,通过层次化语义—声学建模、实时多流并行推理和控制头早退机制,提高交互流畅度与响应效率。相比把 ASR、LLM 和 TTS 串联起来的系统级方案,原生模型更有机会实现连续、可打断和接近真人的语音交流。

淘宝直播数字人 AgenticRL 实践:从 RLVR 到 MultiAgent RL
复杂业务 Agent 的强化学习,可能需要按角色拆分训练,而不是让单个模型同时承担规划、工具调用和内容生成。
淘宝直播将数字人系统从固定 Workflow 升级为感知、决策、执行三域组成的 Agentic 架构,并通过 Agent Tuning 与 RLVR 优化延迟和幻觉。单 Agent 强化学习难以收敛后,团队进一步将工具调用与回复模型拆分为 Multi-Agent RL,使各角色在更明确的奖励目标下训练。

Coding Agent 的交互单位正在从“一轮对话”转向“一个带完成条件的目标”。
Goal 模式允许开发者通过 /goal 定义任务和完成标准。Agent 每轮执行后自动评估当前结果,未达到条件则继续推进,满足条件后停止,并通过操作面板展示目标、状态和控制入口。这种设计把验证条件直接纳入循环,是 Coding Agent 从聊天式助手转向自主执行系统的重要一步。

在线产品不一定需要重新实现 Coding Agent,也可以通过协议连接用户本地已有的 Agent 能力。
方案使用 ACP 连接本地 CodeBuddy 或 Cursor,通过 MCP 向 Agent 暴露在线模板编辑器的业务工具,并采用 MCP-only Access 避免 Agent 直接操作 DOM 或镜像文件。文章还讨论了会话工作区、Prompt 链路与 Localhost 通信细节,为网页产品接入本地 Agent 提供了一条相对轻量的路径。

代码不出内网,也能用上 AI 智能评审:云效现已支持 GitLab
企业级 AI Code Review 的落地前提,是不改变现有协作流程,也不要求代码库暴露到公网。
云效 AI 智能评审新增对自建和托管 GitLab 的支持,可以通过专有网络访问内网代码仓库。开发者继续使用原有 Merge Request 流程,同时可以针对评审意见追问。产品还增强了跨文件代码理解,以提高对关联风险的识别能力。这类低侵入集成方式,更符合企业研发工具的实际推广条件。
