阅鹿 Logo阅鹿
SignalSignal技术观察技术观察技术周刊技术周刊研究资料库研究资料库关于关于
登录注册
第 281 期
2026.07.20

Signal #21:Agent 的行为,开始像代码一样被定义、测试和治理

技术周刊

第 281 期
2026.07.20
Signal #21:Agent 的行为,开始像代码一样被定义、测试和治理
第 280 期
2026.07.13
Signal #20:当 Agent 开始塑造模型
第 279 期
2026.07.06
Signal #19:AI 工具越来越多,团队要开始管起来了
第 278 期
2026.06.29
Signal #18:Coding Agent,从 IDE 走进研发系统
第 277 期
2026.06.22
Signal #17:Agent 开始进入组织系统
第 276 期
2026.06.15
Signal #16:Coding Agent 开始有了工作现场
第 275 期
2026.06.08
Signal #15:Agent 开始进入团队账本
第 274 期
2026.06.01
Signal #14:AI Coding 的新指标,不再只是代码采纳率
第 273 期
2026.05.25
Signal #13:AI Coding 的下一站,是失败与反馈
第 272 期
2026.05.18
Signal #12:Coding Agent 正在拥有自己的运行时
第 271 期
2026.05.11
Signal #11:Agent 的中间过程,正在被产品化
第 270 期
2026.05.04
本周 Signal:Coding Agent 正在从工具入口,走向工程基础设施
第 269 期
2026.04.27
本周 Signal:模型更新仍然重要,但不再是唯一主角
第 268 期
2026.04.20
本周 Signal:多 Agent 并行,开始从实验玩法变成产品默认交互
第 267 期
2026.04.13
本周 Signal:前沿 AI Coding 的分水岭,开始从 Agent 转向系统
第 266 期
2026.04.06
本周 Signal:代码仓库不只是实现载体,也开始成为 AI 理解业务的入口
第 265 期
2026.03.30
本周Signal:执行开始接管软件,界面退居为观测层
第 264 期
2026.03.23
本周 Signal:复杂度开始从“人”迁移到“系统”
第 263 期
2026.03.16
本周 Signal:软件工程岗位开始 AI-native 化
第 262 期
2026.03.09
本周 Signal:AI 工具正在获得长期记忆
第 261 期
2026.03.02
本周Signal & 我们可能一直误解了AI对软件研发的影响
第 260 期
2026.02.16
新年快乐&国产大模型崛起&企业研发AI自动化能力框架
第 259 期
2026.02.07
Anthropic和OpenAI同日发布,大模型还在狂奔吗?
第 258 期
2026.02.02
OpenClaw 才是真正的 AI 入口?
第 257 期
2026.01.26
Vibe Engineering & Skills & jQuery 4.0.0
第 256 期
2026.01.19
软件工程未来两年展望 & Web Almanac 2025
第 255 期
2026.01.12
CES 2026 & Agentic Coding 拆解
第 254 期
2026.01.05
FEDAY 2025 & Meta 收购 Manus
第 253 期
2025.12.29
The End of 2025 & A2UI
第 252 期
2025.12.22
又年底了,AI 啥样了 & State of AI
第 251 期
2025.12.15
React 再爆漏洞 & SPEC 会失败吗 & AutoGLM开源
第 250 期
2025.12.08
RSC 漏洞 & AI Code综述 & SEE Conf PPT
第 249 期
2025.12.01
Snapchat Valdi & AI时代的架构师 & Opus 4.5
第 248 期
2025.11.24
SEE Conf 2025&Gemini3时代
第 247 期
2025.11.17
GPT-5.1与文心5.0&国产编程模型
第 246 期
2025.11.10
2025乌镇峰会
第 245 期
2025.11.03
LongCat-Video发布&如何提升AI出码率
第 244 期
2025.10.27
活动多多的 1024&Vitest 4.0 is out!
第 243 期
2025.10.20
Announcing Vite+ & React Conf 2025
第 242 期
2025.10.13
React Foundation
第 241 期
2025.10.13
你追我赶的时代,太好了!
第 240 期
2025.09.29
Lynx HarmonyOS & 蚂蚁开源Neovate Code
第 239 期
2025.09.22
公众号 AI Feed
第 238 期
2025.09.15
Seedream4.0&小美&Apple发布
第 237 期
2025.09.08
当 Anthropic 禁止服务
第 236 期
2025.09.01
AI 下一站:新消费硬件
第 235 期
2025.08.25
AI 编程的失控风险 & DeepSeek V3.1
第 234 期
2025.08.18
开发者的十字路口
第 233 期
2025.08.11
世界机器人大会 & OpenAI 开源 & GPT5
第 232 期
2025.08.04
AI 时代重生系列
第 231 期
2025.07.28
WAIC 2025 & 扣子开源 & CodeBuddy
第 230 期
2025.07.21
当 Agent 满天飞,我们应该做些什么?
第 229 期
2025.07.14
Vercel+NuxtLabs & MCP安全问题
第 228 期
2025.07.07
Agent 百花齐放 & 上下文工程 & 成熟度模型
第 227 期
2025.06.30
预见 2049 & 目前AI最重要的影响
第 226 期
2025.06.23
prompt2code & Computer Use Agent
第 225 期
2025.06.16
人工智能 × 交互设计 & iOS 26 体验报告
第 224 期
2025.06.09
Cursor 1.0 & Windsurf Statement & php-node
第 223 期
2025.06.02
Prompt=代码 & MCP 蛮荒时代
第 222 期
2025.05.26
JS turns 30 & Google I_O & MS Build 2025
第 221 期
2025.05.19
浏览器里的 AI 革命
第 220 期
2025.05.12
前端开发AI实践 & Figma Config 2025
第 219 期
2025.04.28
Paper2Code & DeepWiki & 独立开发者项目鉴赏
第 218 期
2025.04.21
AI 在中后台实践 & 下半场
第 217 期
2025.04.14
AIBook、ADK、A2A and AI 50 2025
第 216 期
2025.04.07
Agents Are Quietly Transforming FE Development
第 215 期
2025.03.31
State of Vue.js Report 2025
第 214 期
2025.03.24
模型即产品 & 产品范式动摇
第 213 期
2025.03.17
TS重写选择Go & 第19届D2终端技术大会
第 212 期
2025.03.09
前端范式转移 & AGI 还很远
第 211 期
2025.03.03
AI & 低代码
第 210 期
2025.02.24
AI 引领变革 & 前端领域大模型
第 209 期
2025.02.17
Sunsetting CRA & 热文之解读DS
第 208 期
2025.02.10
应用提示词化&AI加速落地&原理学习
第 207 期
2025.01.20
年终总结和最新发布
第 206 期
2025.01.13
2024 JS Rising Stars & GUI Agents
第 205 期
2025.01.06
AI 24回顾&25展望
第 204 期
2024.12.30
2025年技术发展趋势&最后一期
第 203 期
2024.12.23
NPM 投毒 & 智能研发 2024
第 202 期
2024.12.16
Web Almanac 2024 & VSCode M11
第 201 期
2024.12.09
React v19 & Astro 5.0 & 蚂蚁体验技术日
第 200 期
2024.12.02
《生成式人工智能应用发展报告(2024)》
第 199 期
2024.11.25
2025年或将成为 AI Agent 爆发年
第 198 期
2024.11.18
百度世界大会 2024
第 197 期
2024.11.11
AI 普通人的机会
第 195 期
2024.10.28
State of Frontend 2024 & 1024 技术书单

相邻期数

上一期 280Signal #20:当 Agent 开始塑造模型

Signal #21:Agent 的行为,开始像代码一样被定义、测试和治理

这周,GitHub 开始让 Code Review Agent 读取仓库中的 AGENTS.md、Skills 和 Review 指令,并为其配置独立的运行环境与网络权限;Google 把 Prompt、规则和 Skill 变成可校验、可编译的构建产物;Microsoft 则开始内置由专家维护的 Agent Skills,并使用隔离环境对其进行回归评测。

这些变化指向同一个方向:决定 Agent 如何工作的 Prompt、Skills、规则、规范、运行环境和 Eval,正在进入版本库、构建系统、测试框架、权限控制与观测机制。Agent 的工作方式由此变得可以评审、复现、验证和持续改进。

当工程对象从一段 Prompt 扩展到 Skills、规则、运行环境和 Eval,一种更系统的实践正在形成。我们或许可以把它称为 Agent Behavior Engineering——Agent 行为工程:系统地定义、测试和治理 Agent 在真实任务中的行为。

封面图

国内动态

AI 技术与算法实践

[得物技术] 推荐系统、诊断 Agent、知识工程

得物推荐系统诊断 Agent:从 “调接口” 到 “会思考”|AICon 演讲整理

推荐系统诊断 Agent 的关键,不是接入更多接口,而是区分确定性问题与开放性问题,并让排查经验持续回流。

得物构建了名为“推查查”的推荐系统诊断 Agent,采用 Highway 与 ATV 混合架构:常见问题走预编排的确定性链路,复杂异常则进入 ReAct 式探索。系统底层通过原子化 Skill、Story 编排、OpenViking 与 Graphify 知识库,以及“反思—抽象—验证”机制沉淀排查经验。这套实践展示了业务诊断 Agent 从工具调用走向知识积累和能力进化的完整路径。

[阿里云开发者] Multi-Agent、数据研发、知识工程

从超级个体到超级组织:1688 数据中心 Multi-Agent 研发小队实录

AI 研发提效正在从增强单个工程师,转向建立能够共享知识、协同执行和持续进化的 Agent 组织。

1688 数据中心将数据研发中的 AI Coding 实践扩展为 Multi-Agent 研发小队。体系通过 KST 知识工程沉淀业务语义,以 Harness Engineering 约束和验证 NL2SQL,再通过 Agent 协作平台实现任务分工、审批与知识回流。文章尤其强调,端到端链路跑通之后,真正的瓶颈会转向知识冷启动、经验复用和组织运行成本。

[阿里云开发者] Harness Engineering、Agent 架构、可靠性

数据研发Multi-Agent架构的Harness工程实践

模型负责理解和生成,Harness 负责身份、流程、验证、恢复与进化,两者共同决定 Agent 能否进入生产环境。

文章将数据研发 Agent 的 Harness 拆为身份层、执行层和进化层,并进一步归纳出 Identity、Orchestration、Context、Gate、Recovery、Evolution 六个支柱。相比只讨论 Prompt 或上下文,这套架构把权限、执行门禁、错误恢复和经验回流纳入统一系统,更接近生产级 Agent 的完整工程边界。

[大淘宝技术] Agent 评测、约定驱动、业务工作台

高价率运营 AI 工作台:约定驱动与 AI 编排的评测优化实践

评测正在从 Agent 上线前的一次性检查,变成与 Skill、真实数据和线上反馈共同演进的工程资产。

高价率运营 AI 工作台将评测集、指标定义与 Skill 目录结构关联起来,并通过 Coding Agent 自动生成和执行评测。评测数据来自真实业务,指标包含通用指标与专项指标,部分结果由 LLM Judge 完成。实践也暴露出下一阶段的问题:线上失败样本如何自动回流、指标如何迭代,以及评测建议如何真正驱动 Agent 修改。

[腾讯技术工程] Agent 治理、Hook、权限与上下文

Agent 治理:用 Hook 堵住 LLM 的偷懒、越权与失忆

Prompt 很难稳定约束模型行为,关键规则需要下沉到 Agent 框架的执行切面中。

腾讯 DECO 数仓 Agent 引擎通过 Hook 链处理长文本截断、危险操作确认和上下文失忆等问题。长内容通过读写两侧 Offload 与引用句柄保证完整性,危险操作由配置驱动的人机确认机制阻断,上下文则通过 Hook 采集、State 保存和 Attachment 注入形成闭环。这类横切治理能力,是 Agent 从 Demo 进入真实业务系统的重要基础。

[阿里云云原生] AgentScope、企业级 Harness、Agent 运行时

AgentScope 2.0 生产可用,企业级 Harness 底座全解析!

企业级 Agent 框架的竞争,正在从推理循环扩展到工作空间、上下文、沙箱、记忆和多智能体编排。

AgentScope 2.0 在 ReActAgent 推理内核之上增加了完整的 Harness 层,包括 Workspace、抽象文件系统、上下文压缩、长期记忆、子智能体编排、沙箱和 Skill 管理。框架同时支持多语言实现、权限控制和分布式服务,说明 Agent 基础设施正逐渐形成类似应用服务器的标准能力集合。

[小红书技术 REDtech] 企业级 Agent、安全、成本与推广

小红书企业级 AI 个人助理——从 0 到全员覆盖

企业推广 Agent 的难点已经不只是能力是否可用,还包括安全隔离、Token 成本、记忆机制和组织采纳速度。

小红书选择基于 OpenClaw 建设企业级 AI 个人助理,并在较短时间内推进至全员覆盖。系统通过独立 AI Zone、NEX 沙箱和数据不出域解决安全问题,通过 Self-GC 和自动模型路由控制成本,同时建设 Memory、Skill Hub 与 Cowork Studio。文章提供了一个少见的组织级 Agent 规模化样本。

[爱奇艺技术产品团队] AI 安全、漏洞治理、自动修复

爱奇艺AI驱动漏洞闭环治理:让安全发现更智能、修复闭环更高效

安全 Agent 的价值不止是发现漏洞,还要打通资产识别、风险验证、修复和运营跟踪。

爱奇艺构建了由“AI 安全白帽”和“安全小助手”组成的漏洞治理体系,前者负责漏洞挖掘与验证,后者承接流程运营和闭环管理。系统已经覆盖 SQL 注入、业务逻辑漏洞和自动修复等场景,并通过人工校验控制误判风险。这反映出安全自动化正在从扫描工具升级为具备业务理解能力的治理 Agent。

[蚂蚁技术 AntTech] Agent 安全、行为护栏、开源

SingGuard-NSFA 正式开源:从“管住模型说什么”走向“守住 Agent 做什么”

当模型拥有执行能力,安全边界必须从内容审核扩展到对 Agent 行为和工具调用的实时判断。

SingGuard-NSFA 面向智能体行为安全,在执行前识别并阻断高风险操作。项目提供风险分类体系、评测基准、双模推理护栏和插件化扩展能力,并开源多个不同尺寸的模型。其核心变化在于,安全对象从模型输出文本转向 Agent 即将采取的动作。

[阿里云云原生] Multi-Agent、开源维护、数字员工

凌晨2点的PR谁来回?AgentTeams 给 LoongSuite 配了个 7×24h 社区管理员

标准化、可验证、重复频率高的维护工作,是组织级 Agent 最容易形成稳定价值的入口。

LoongSuite 团队使用 AgentTeams 搭建 GitHub 社区管理员,通过 Cron 调度、Skill 模块化、分层 Agent 和通知闭环完成 PR 巡检、CI 故障处理与代码审查。三周运行结果显示响应速度和维护覆盖度有所改善,同时也暴露出超时配置、审查深度和成本平衡等问题。这类长期运行案例比一次性 Demo 更能说明 Agent 的真实边界。

前端、客户端与交互

[W3C 资讯] WebSkill、WebMCP、Agentic Web

WebSkill - Agentic Web面向SaaS的进化

WebSkill 试图让网页除了暴露操作接口,还能向 Agent 提供完成业务任务所需的方法和上下文。

WebSkill 提案将 Skill 放在浏览器侧运行,并与 WebMCP、生成式 UI 共同组成 Agentic Web 架构。Skill 可以按需加载任务说明、工具绑定和业务约束,减少上下文一次性注入带来的膨胀。其更长远的意义是,网页可能从供人操作的界面,进一步成为 Agent 获取局部业务能力的运行边界。

[梯度不陡] WebMCP、WebSkill、前端能力开放

WebMCP 之后,为什么还需要 WebSkill

Tool 解决“能做什么”,Skill 则需要说明“如何完成一项完整任务”。

文章从复杂 SaaS 任务出发,分析 WebMCP 只暴露原子 Tool 时的局限,并进一步梳理 WebSkill 需要解决的任务知识、上下文作用域、工具契约和人机边界。WebSkill 的价值不只是减少 Prompt,而是让页面中的业务方法能够被定义、发现、版本化和治理。

[W3C 资讯] Design System、Vibe Coding、AI 友好组件

[视频] Design Systems与Vibe Coding

设计系统下一阶段的挑战,是让组件能力不仅能被开发者阅读,也能被模型稳定理解、组合和扩展。

分享讨论了传统 Design System 在 AI 开发中的几个问题:组件功能复杂、设计一致性与自由度冲突、文档与实现更新不同步。业界正在通过 Headless 组件、语义化结构、MCP 服务和更明确的子组件边界改善模型使用体验。设计系统正在从 UI 资产库转向面向人和 Agent 的工程能力接口。

[阿里云开发者] PC Web、AI 测试、组件知识

PagePilot — PC端AI测试Skill设计与实战

复杂 Web 自动化测试的稳定性,很大程度上取决于 Agent 是否理解业务组件,而不只是识别页面上的像素和 DOM。

PagePilot 面向支付宝商家中心 PC 场景构建 AI 测试 Skill,通过组件知识、元素查找优先级、脚本纪律、阶段门控和失败自学习提高测试执行稳定性。实践表明,前端组件库、页面结构知识和测试规则可以共同成为 Agent 的 Harness,减少浏览器 Agent 在复杂业务页面中的随机探索。

[GSYTech] Flutter、Dart、共享内存与多线程

Flutter 共享内存多线程即将完成,IsolateGroupBound 来了

Dart 正逐步突破 Isolate 之间不能共享内存的限制,但性能收益之外,也会引入新的状态安全和依赖兼容问题。

Dart 正在通过 Isolate Group、可共享静态字段和同步原语推进共享内存能力,以减少大对象传递中的复制与序列化成本。这可能改善大 JSON 处理和原生应用嵌入场景,但第三方依赖中的隐藏状态、垃圾回收和并发安全仍需要运行时检查与更完整的语言约束。

[梯度不陡] 前后端融合、AI Coding、研发组织

最近,企业为什么又开始推动前后端融合?

AI 降低了跨栈开发的局部成本,但前后端融合能否成立,最终取决于工程标准化和交付链路是否成熟。

文章区分了团队全栈、需求全栈和个人全栈三个层次,并分析不同类型需求和工程师跨栈时的真实难点。企业推进融合,需要统一工程结构、简化开发联调、自动化质量标准并保留专业评审机制。AI 提供了新的可能性,但组织不能把模型能力直接等同于完整的软件交付能力。

云原生、数据与基础设施

[腾讯技术工程] Kubernetes、Ray、AI Workload

腾讯Ray团队实践:K8s + Ray如何支撑超大规模AI Workload

Kubernetes 管理集群资源,Ray 管理 AI 任务内部的动态执行,两者正在形成大规模 AI Workload 的分层调度体系。

文章梳理了 K8s、Ray、PyTorch 与 vLLM 组成的 AI 基础设施栈,并重点讨论异构资源、动态分配、高容错和 Single-Controller 任务的调度需求。腾讯通过扩展 KubeRay 实现跨集群联邦、跨层弹性调度与自动化容灾,为后训练、强化学习和多模态数据处理提供统一运行底座。

[字节跳动技术团队] Agent Infra、State Lake、存储

从 Data Lake 到 State Lake:面向 Agent 时代的存储基础设施重构

Agent 需要保存的不只是输入和结果,还包括工作空间、执行状态、中间产物、轨迹和评测数据。

火山引擎存储团队提出从 Data Lake 向 State Lake 演进,并围绕 Sandbox Store、Artifact Store、Agent 观测与评测建设 Storage Agent Infra。随着 AI 从回答问题走向长任务执行,存储系统也要从被动保存内容,转向支撑 Agent 状态恢复、任务接续和运行分析。

[字节跳动技术团队] PostgreSQL、Serverless、Vibe Coding

想到即建、不用即停 —— 火山 PostgreSQL 助力飞书妙搭的 AI 效率革新

AI 可以快速生成应用,数据库也需要具备秒级创建、按需启停和低成本试错能力。

飞书妙搭接入火山 PostgreSQL Serverless,以解决传统数据库创建慢、闲置成本高和数据恢复复杂的问题。产品提供秒级实例创建、Data as Git、AI Function 和企业级管理能力,使数据库能够随 AI 应用一起快速生成、回退和扩展。这类按应用生命周期分配资源的基础设施,会成为 Vibe Coding 产品的重要组成部分。

[阿里云云原生] AI 网关、Credits、配额治理

别再为 AI 调用超支头疼:Credits 配额,让每一笔消耗都透明可控

多模型调用不能只按 Token 数量管理,还需要把模型价格、输入输出类型和供应商差异转换为统一成本单位。

阿里云 AI 网关引入 Credits 计量体系,并增加模型元信息、供应商资源和 Credits 配额管理。不同模型和调用方式可以被映射到统一额度,再按团队、应用或租户分配。随着企业同时使用多个模型,网关正在从流量入口升级为模型路由、成本核算和使用治理的控制面。

[货拉拉技术] 规则引擎、可视化编排、业务治理

复杂业务规则太多?我们搭了一个规则可视化配置平台

业务规则只有从代码分支变成可配置、可测试、可审批和可追溯的资产,才能真正降低复杂系统的变更成本。

货拉拉将复杂业务判断抽象为可视化策略,通过管理面、配置面和运行面分离规则的编辑与执行。规则以 Chain JSON 发布,由 LiteFlow 在运行时执行,并配套测试、审批、版本和空间管理。该实践适合规则变化频繁、组合复杂且需要非研发人员参与配置的业务场景。

[京东技术] 商品知识、本体工程、数据生产

Oxygen AIIC:京东首发面向百亿商品的工业级大模型商品中心全解析

大模型进入产业系统后,高质量、持续更新且语义统一的业务知识仍然需要专门的数据生产基础设施。

Oxygen AIIC 由本体工程、AI 商品库、商品理解大模型和商品总线组成,覆盖商品知识定义、生产、迭代与消费。体系通过人机协同维护本体,使用高吞吐架构处理海量商品,并通过增量学习保证模型持续更新。它说明企业 AI 落地的核心资产之一,仍然是被结构化和治理过的领域知识。

大模型、算法与多模态

[Kimi 智能助手] Kimi K3、长上下文、Coding 与 Agent

Kimi K3:智能的新前沿

Kimi K3 将大参数规模、百万上下文、视觉理解与长程编码能力放进同一个开放模型,重点指向复杂 Agent 任务。

Kimi K3 采用 KDA 混合线性注意力与 Attention Residuals,支持视觉输入和 100 万 Token 上下文。官方展示的重点场景包括长程编码、内核优化、编译器开发、行业研究和多媒体处理。相比单轮问答,K3 更强调复杂任务中的规划、工具使用和持续执行,也暴露出推理成本、主动性和交互体验仍需平衡的问题。

[阿里云开发者] 实时语音、全双工交互、工具调用

Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?

实时语音模型正在从语音识别与合成,走向能够判断对话节奏、理解环境并调用工具的交互 Agent。

Qwen-Audio-3.0-Realtime 支持情绪和语气调整、音色克隆、声纹过滤、双工控制与动态工具调用。底层采用多教师蒸馏,在推理能力、响应速度和语音表现力之间进行平衡。其重要变化是,语音模型不再只处理声音,而是开始负责何时听、何时说以及何时行动。

[火山引擎 Agent 社区] 长上下文、长程任务、模型迭代

Doubao-Seed-Evolving升级:1M上下文来了!

固定模型版本正在让位于持续演进的模型服务,长上下文和长程执行成为 Coding 与 Agent 场景的核心指标。

Doubao-Seed-Evolving 将上下文扩展到 100 万 Token,并强化长程任务与 Token 使用效率。该模型采用固定模型标识持续更新,开发者无需频繁迁移版本。它反映出模型产品正在从周期性大版本发布,转向围绕真实工作负载高频优化的持续交付模式。

[腾讯技术工程] 全双工语音、层次化建模、实时推理

腾讯PCG联合深圳河套学院:在全双工语音大模型领域取得重要突破,获 ACL 2026 杰出论文奖

全双工语音的难点不只是低延迟,还要同时建模语义理解、声学表达和对话节奏。

团队提出 Lychee-FD 原生端到端全双工语音模型,通过层次化语义—声学建模、实时多流并行推理和控制头早退机制,提高交互流畅度与响应效率。相比把 ASR、LLM 和 TTS 串联起来的系统级方案,原生模型更有机会实现连续、可打断和接近真人的语音交流。

[大淘宝技术] 数字人、Agentic RL、Multi-Agent

淘宝直播数字人 AgenticRL 实践:从 RLVR 到 MultiAgent RL

复杂业务 Agent 的强化学习,可能需要按角色拆分训练,而不是让单个模型同时承担规划、工具调用和内容生成。

淘宝直播将数字人系统从固定 Workflow 升级为感知、决策、执行三域组成的 Agentic 架构,并通过 Agent Tuning 与 RLVR 优化延迟和幻觉。单 Agent 强化学习难以收敛后,团队进一步将工具调用与回复模型拆分为 Multi-Agent RL,使各角色在更明确的奖励目标下训练。

工程效率与工具链

[TRAE.ai] Coding Agent、目标模式、持续执行

TRAE IDE 全新推出 Goal 模式

Coding Agent 的交互单位正在从“一轮对话”转向“一个带完成条件的目标”。

Goal 模式允许开发者通过 /goal 定义任务和完成标准。Agent 每轮执行后自动评估当前结果,未达到条件则继续推进,满足条件后停止,并通过操作面板展示目标、状态和控制入口。这种设计把验证条件直接纳入循环,是 Coding Agent 从聊天式助手转向自主执行系统的重要一步。

[腾讯云开发者] ACP、MCP、在线应用与本地 Agent

如何将本地CodeBuddy/Cursor嵌入在线应用

在线产品不一定需要重新实现 Coding Agent,也可以通过协议连接用户本地已有的 Agent 能力。

方案使用 ACP 连接本地 CodeBuddy 或 Cursor,通过 MCP 向 Agent 暴露在线模板编辑器的业务工具,并采用 MCP-only Access 避免 Agent 直接操作 DOM 或镜像文件。文章还讨论了会话工作区、Prompt 链路与 Localhost 通信细节,为网页产品接入本地 Agent 提供了一条相对轻量的路径。

[阿里云云原生] AI Code Review、GitLab、企业安全

代码不出内网,也能用上 AI 智能评审:云效现已支持 GitLab

企业级 AI Code Review 的落地前提,是不改变现有协作流程,也不要求代码库暴露到公网。

云效 AI 智能评审新增对自建和托管 GitLab 的支持,可以通过专有网络访问内网代码仓库。开发者继续使用原有 Merge Request 流程,同时可以针对评审意见追问。产品还增强了跨文件代码理解,以提高对关联风险的识别能力。这类低侵入集成方式,更符合企业研发工具的实际推广条件。

补充关注

搜索、推荐与算法

  • 字节跳动技术团队|让搜索更懂用户:Viking AI 搜索如何用个性化提升转化
    Viking AI 搜索将物品热度和用户兴趣同时引入召回与排序,在保证相关性的基础上进一步提高搜索结果的个性化程度。
  • 阿里云开发者|淘宝闪购-爆品团精排 Scaling Up 迭代实践
    淘宝闪购将精排模型从传统 DLRM 升级为 Token-Based RankMixer,并通过负样本加权、GradNorm 等手段将模型规模从 85M 扩展至 243M。
  • 京东技术|SIGIR 2026|OxygenSearch 之生成式检索偏好对齐 RAD-DPO 技术解析
    RAD-DPO 针对电商生成式检索中的梯度冲突、噪声样本和概率挤压问题,引入多标签对比、Token 级梯度截断和动态奖励加权。
  • 滴滴技术|清华&滴滴自动驾驶新作|FAST:加速强化学习训练的并行计算框架
    FAST 解耦单个环境终止与全局重置,减少不同驾驶场景采样时长不一致造成的并行等待,提高强化学习训练的有效吞吐量。
  • 快手技术|SIGIR 2026|15 篇论文入选,快手技术最新研究成果速览
    快手集中展示了推荐系统、搜索排序、因果推断和生成式序列建模等方向的研究成果,并发布直播推荐数据集 KuaiLive。
  • 微软亚洲研究院|ICML 上新|五项视觉研究,让模型更持久、更轻量、更统一、更聚焦
    五项研究分别覆盖长程世界模型、轻量视觉编解码、隐式视觉表征、多模态统一建模和长视频问答中的算力分配。
  • PaperAgent|挺意外的,大模型的底层设施里,还藏着一家国产具身模型公司
    自变量机器人提出 DMuon,通过负载均衡、通信计算并行和矩阵压缩,降低 Muon 优化器在分布式训练中的额外开销。
  • 搜狐技术产品|RAG 命中率从 60% 到 78% 经验分享
    文章从固定长度切分转向结构感知和多级回退,展示分块策略对 RAG 检索效果的直接影响。

Agent 工程与研发体系

  • 大淘宝技术|AINMM:存量生产级工程向 AI Native 演进的五级成熟度模型
    AINMM 借鉴 CMMI 思路,为存量软件工程定义了从局部引入 AI 到自进化系统的五级演进路径和评估维度。
  • 腾讯技术工程|驾驭 AI Coding:一份面向团队的 Harness Engineering 落地规范
    文章尝试将代码规范、工具接入、验证规则和持续优化组织成团队级 Harness,为 AI Coding 建立统一质量底线。
  • 字节跳动技术团队|让 Agent 成为音视频工作台:AI MediaKit CLI + Skill 发布
    AI MediaKit 将一百多项音视频处理能力封装为 Agent 可调用的 CLI 和 Skill,并补充长任务状态管理与失败恢复机制。
  • 蚂蚁技术 AntTech|SingGuard 正式开源:面向原生多模态大模型的规则自适应与动态推理安全护栏
    SingGuard 将安全规则作为运行时输入,支持规则自适应、快慢动态推理和多模态内容安全判断,并同步开放评测基准。
  • 腾讯技术工程|上线后差点“挤爆”服务器,Marvis 凭什么让用户追着 6 只小马“上班”?
    Marvis 采用端云混布和 Multi-Agent 架构,在隐私、成本、跨端执行和不同能力模块之间进行系统级权衡。

前端安全与后端架构

  • KooFE 前端团队|ModHeader 被下架
    文章复盘 ModHeader 浏览器扩展被植入隐蔽数据收集 SDK 的供应链安全事件,提醒团队重新审视开发者工具的权限与依赖来源。
  • 搜狐技术产品|领域驱动设计(DDD)在视频付费服务端的实践
    搜狐视频将复杂付费业务从传统 MVC 结构迁移到领域模型,并讨论应用层边界、领域服务拆分、反腐层与过度建模问题。