Signal:Agent 的工作,不该只存在 Session 里
Agent Session 可以保存,但它天然围绕一次 Agent 的执行过程组织,不一定适合承载一项工作长期积累的全部状态。
随着 Agent 开始执行更长任务、跨本地与云端运行,甚至由不同 Agent 接力,任务进度、产物、决策和验证结果正在逐渐从单次 Session 中拆出来,由生命周期更长的 Workspace 持有。
VS Code 的 Agent Host、GitHub 的 Agent Sessions、Vercel 的持久化 Drive,以及云端 Agent Runtime,都已经出现类似变化。
如果这种变化继续发展,Workspace 可能会成为持续工作的主要载体,而 Agent Session 更像其中一次具体的执行。

2026-08-24|我对 AI Coding 的一点思考:从 Spec 驱动转向环境与验证驱动
当代码生成越来越便宜,真正限制 Agent 持续工作的,开始变成它能否获得可运行的环境和可信的验证反馈。
文章基于阿姆达尔定律指出,编码只占完整研发链路的一部分,即使这一环节完全自动化,整体效率提升仍有明显上限。作者因此主张减少对提示词编排等容易被模型升级吸收的投入,将构建、部署、测试、监控等研发系统改造成 Agent 可调用、可获取真实状态的环境,使模型能力提升能够持续放大已有工程基础设施的价值。
2026-08-26|场景营销互动&体验 AI Coding — 构建 Agent 自主执行闭环
上下文工程提高的是单轮成功率,长程任务还需要把目标维护、调度、验证和失败处理变成显式的循环机制。
塔罗平台以 Task 作为持久化目标锚点,以 Job 作为最小执行单元,每次执行必须返回完成、阻塞或失败状态,并携带截图、Diff、测试结果等证据;任务状态通过执行账本外置,而不是依赖对话历史。针对 UI 开发,系统还构建了设计稿与实现截图持续比较、定位、修正、再验证的 Pixel 小循环。
2026-08-27|两万字长文|手把手带你趟过 AI Coding 深水区:编码让位,人退到哪里
当代码真正可以大规模交给 AI,人没有消失,而是从写代码转向获取事实、判断方案和设计可靠的工程约束。
团队在一个项目中让 AI 端到端交付了 16 万行生产代码,随后发现提示词的边际收益会逐渐耗尽,很多约束最终需要沉入基础设施;复杂编排继续深入,则会遇到生命周期、终止、状态等 Runtime 问题。文章强调,只有确定事实才能成为硬门禁,验证信号应该从外部系统获取,而不能依赖 Agent 自述。
2026-08-27|AI 创新实践|「架构师 Agent」系统化落地
存量系统里的 Agent 难点往往不是不会写方案,而是不理解业务、架构以及系统长期形成的隐性约束。
团队将技术方案过程组织为「理解需求 → 理解业务与系统 → 回源代码和配置 → 产出方案」,并把架构师知识结构化为 meta、principle、scenario、practice、reference 等模块。文章提出,RAG 可以负责检索知识,但语义相似并不能替代领域建模,复杂工程知识仍然需要更明确的结构与关系。
2026-08-27|一人多端研发提效:ZSpec 工作流在知乎的落地
共享产品目标和各端工程事实被拆开管理后,多端 Agent 可以独立推进,同时保持需求变化和验证失败可追踪、可回退。
ZSpec 使用 Group 保存共享需求、业务规则和验收标准,每个平台对应独立 Unit,维护代码结构、技术方案和验证证据。流程覆盖 Context、Spec、Plan、Implementation、基础校验和真机验收等环节;需求变化只使受影响的 Unit 失效,验收失败则回到最早被证据反驳的阶段继续处理。
2026-08-27|AI Code Review 上下文增强实践:基于代码图谱的实现方案
仅靠 Diff 很难判断代码变更的真实影响面,调用、继承等确定性工程关系更适合通过图谱直接提供给 AI。
团队在编译阶段通过 Gradle 插件和 ASM 抽取类、方法、字段以及调用、继承、包含等关系并写入 Neo4j;Review 阶段再将 Diff 与图谱查询结果结合。相比依赖语义近似匹配的 RAG,这套方案更适合回答「谁调用了这个方法」「接口有哪些实现」等精确的代码关系问题。
2026-08-26|从Prompt到Harness,给反馈分类装上方向盘
持续把业务规则、例外和案例塞进 Prompt 很快会失控,更稳定的做法是让业务定义规则、Harness 固化流程、模型专注语义判断。
AiSee 将分类过程拆为「还原用户问题 → 执行业务规则 → 缩小分类范围 → 模型理解并选择 → 复核记录」,并让业务侧独立维护分类树和规则。某业务在持续变化的多终端场景下,分类准确率从最低 60%+ 提升并稳定在 90%+,同时降低了系统对模型规模的依赖。
2026-08-26|一篇讲透Agent自进化飞轮怎么搭:评测→记忆→落地→控制
Agent 的持续进化并不只是增加记忆或修改 Prompt,而是让评测信号经过诊断、沉淀、验证和发布,真正转化为 Harness 的持久改进。
文章把自进化拆成评测、记忆、落地、控制四个环节:通过规则、LLM-as-Judge 和人工抽样建立评测信号;通过分层记忆、版本和遗忘机制治理经验;再经过诊断、候选修复、独立评测、安全门控和灰度发布完成闭环。对于 Skill,文章还提出对照实验、难度校准、轨迹追踪和路径验证四层评测。
2026-08-28|AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环
Agent 上线之后的优化开始从手工调 Prompt,转向围绕运行数据持续发现 Badcase、评估、实验并沉淀经验。
AgentLoop 将 Trace 接入、运行观测、安全审计、数据集、评估、实验和经验库串成完整飞轮,同时支持专家 Rubric 驱动和自动经验挖掘两种模式。文章给出的消融实验中,经验注入可带来 30%~40% 的耗时降低和 20%~47% 的成本下降。
2026-08-26|高德Push机制智能化演进|从静态阈值到 Agent 感知投放
多 Agent 并不天然意味着更可靠,线上决策系统最终仍需要明确模型和确定性代码之间的边界。
高德第二代多 Agent 方案运行两周后出现策略震荡、错误放大、会话死锁和通信成本过高等问题。第三代架构改为「Agent 做指挥官,代码做计算器」:模型只能从六种离散策略中选择,具体数值、范围限制和九项安全检查全部由代码完成,同时把状态从会话迁移到外部持久化系统。
2026-08-24|DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查
当 Coding Agent 从单机使用进入规模化运行,可观测目标开始从查看一条轨迹扩展到跨会话聚合、成本统计和长期故障分析。
腾讯云团队为 DeepSeek Harness 开发原生可观测插件,通过事件总线和流式管道还原 entry、agent、step、chat、tool 五层调用关系,并按照 OpenTelemetry GenAI 语义上报。系统可分析首 Token 延迟、P95、Token 与成本,并区分模型失败、工具失败和循环中断。
2026-08-27|模型管不住、老系统接不上、Agent 连不起来?一个 AI 网关全搞定!
Agent 数量上升之后,模型、工具和 Agent 间通信正在汇聚成新的企业控制面。
AgentKit Gateway 同时提供模型网关、MCP 网关和 A2A 网关:模型网关统一模型接入、密钥、容灾和成本;MCP 网关负责把存量 API 转换成 Agent 可调用工具,并通过「先检索再调用」减少工具上下文;A2A 网关则负责 Agent 注册发现、认证、路由、限流和审计。
2026-08-26|企业级 MultiAgent 的记忆系统:短期上下文与四层记忆架构实现|得物技术
Agent 记忆的工程难点已经从有没有存储,转向什么值得写入、什么时候召回以及如何控制上下文预算。
得物将记忆拆为 Working、Session、User 和 Agent 四层;加载时并行读取短期历史和长期语义记忆,再通过分数过滤、单条截断和 Token Budget 控制注入。写入阶段则增加分布式锁、防重、重要度判断、相似度去重和冲突处理,避免长期记忆无限膨胀。
2026-08-27|一文搞懂个人AI记忆系统构建全流程
文件系统同样可以成为 Agent 的长期记忆底座,关键在于建立稳定分类、元数据索引以及可控的读写机制。
文章将记忆划分为 identity、principles、preferences、context、knowledge 五类,并通过 YAML 元数据、总索引和目录索引帮助 Agent 按需读取。Recall Skill 负责依据任务加载记忆,Curator Skill 负责从对话中发现候选内容;每次长期写入仍要求人工确认,避免自动沉淀错误或过时信息。
2026-08-26|零代码改造:让 AI Agent Sandbox 不再是黑盒
动态生成代码、Serverless 和短生命周期 Sandbox 让传统 SDK 埋点难以适用,无侵入观测因此成为 Agent Runtime 的重要基础能力。
ACS 通过 Sidecar + eBPF 在内核与库函数层拦截通信并解析协议,无需修改应用代码或重新构建镜像,即可生成标准 OpenTelemetry 遥测数据,并追踪 OpenAI、Anthropic、Gemini、通义千问等模型调用,以及 MCP、Embedding 和向量检索等环节。
2026-08-27|ADrive 跨产品协作实践:文件通了,Agent 就通了
不同 Agent 未必一定需要直接互相通信,共享文件和稳定的权限模型也可以成为跨产品协作的连接层。
案例中 Codex、豆包工作和 DeepSeek Harness 围绕同一套文件空间依次完成策划、制作和发布。ADrive CLI 提供搜索、读取、断点续传、增量同步和权限控制,并要求 Agent 在写入前说明计划并获得人工确认,高风险删除操作则设置更严格的门禁。
2026-08-25|从用户意图到三端原生界面:高德端云一体化的生成式 UI 实践
生成式 UI 真正进入生产环境后,中间契约、数据绑定、可控修改和质量门禁的重要性开始超过单纯的「模型生成页面」。
AGenUI 已覆盖 30+ 业务场景、约 5k QPS。云侧先通过内容契约固定内容、动作和缺失策略,再由样式 Agent、Bind Agent 和转换算子生成 UI 协议并绑定真实数据;规则版本、字段证据和算子引用等生产事实以 Artifact 持久化。端侧则通过共享 C++ 核心统一布局和样式计算,再使用 iOS、Android、HarmonyOS 原生组件渲染。
2026-08-25|用 Deepseek 多模态跑 E2E 测试 - Midscene 1.12 更新
国产多模态模型的输入成本已经逐渐进入 E2E 可承受区间,元素定位、页面状态理解和步骤规划开始成为更关键的模型选型指标。
Midscene 1.12 新增对 DeepSeek 多模态模型的支持。团队测评中,普通定位模式 P50 约 0.6 秒,在目标明确、结构简单的页面上准确率接近主流旗舰模型;复杂密集页面仍容易出现选择偏移,开启 deepLocate 后准确率有所改善,同时保持较低延迟。
2026-08-26|Rspack 2.2 发布:30+ 项性能优化,拥抱 Solid 2.0
Rspack 的演进已经不只是 Bundler 本身,Rsbuild、Rstest、Rslint、Rslib 正逐渐形成一套完整的 Rust 前端工具链。
Rspack 2.2 包含 30 多项性能优化,生产构建时间缩短约 5%,CSS 解析速度约提升 3 倍,并显著降低大型 CSS 项目的 HMR 开销。同期 Rsbuild、Rstest、Rslint、Rslib 也继续演进,包括 Playwright E2E、500+ 内置 Lint 规则以及 TypeScript 7 类型生成支持。
2026-08-27|WeaveFox × 支付宝:Vibe Coding 创作 H5 轻应用,创意即刻上线
Vibe Coding 正从生成 Demo 继续向真实平台能力、用户身份和一键发布延伸。
WeaveFox 推出的支付宝 H5 Agent 支持通过自然语言生成和修改 H5 应用,并集成支付宝 JSAPI、OpenID 登录及移动端 UI 适配。文章展示的应用已经面向真实用户上线,包括互动答题和游戏化运营等场景。
2026-08-27|Apache RocketMQ 面向 AI 演进:LiteTopic 支撑百万级多 Agent 会话协作
动态创建、持续时间长且单次计算昂贵的 Agent 会话,开始反过来改变传统消息基础设施的通道和调度模型。
LiteTopic 将每个 AI 会话映射为独立轻量 Topic,首条消息到达时创建、空闲后按 TTL 自动回收;底层通过 RocksDB 管理海量元数据,并使用 Ready Set 只调度有消息可投递的活跃通道。生产案例已覆盖 Qoder Cloud Agents 的任务交接与恢复,以及百炼网关的大规模限流场景。
2026-08-25|存算分离不只是弹性:一份 Kafka 数据如何同时服务当下与未来
存算分离带来的变化不只有扩缩容,也使 Kafka 数据能够同时成为实时事件流和长期开放数据资产。
方案提供 Table 与 SQL 两条路径:前者持续将数据写入 Iceberg 等开放表,并负责小文件、Schema 演进、CDC 语义、原子提交和失败恢复;后者处理实时过滤、窗口与聚合。两条路径共享底层数据,但拥有独立运行时和故障域。
2026-08-27|【大促备战】存储性能优化篇--从异构同步到链路解耦的 JES 治理实战
大促性能治理最终暴露的不只是查询参数问题,还包括数据倾斜和轻重业务共享链路带来的系统性风险。
团队围绕 JES 完成 Binlog 异构同步、Filter Cache 与查询优化、Segment 合并以及大 Key 治理。核心索引执行 force merge 后,单商家查询 RT 从 300~800ms 降至 60~140ms;同时将在线分页与离线重度下载物理隔离,避免单次导出引发 JVM 飙升和节点故障。
2026-08-25|全栈 AI Agent 从 0 到 1 :智能播客平台开发全记录
这是一篇较完整的 Agent 应用工程实践,从状态管理、流式协议一直落到具体工具和文件生命周期。
项目使用 Vue 3、FastAPI、LangChain / LangGraph 构建智能播客平台,并通过 AG-UI + SSE 将 Agent 运行事件转换为前端可消费的标准事件流。音频处理被拆为音色设计、语音合成、拼接、BGM 和混音等独立工具,同时处理多轮上下文、并发文件读写和临时文件回收等工程问题。
2026-08-28|腾讯混元 Hy4 preview 发布,稳居开源模型第一梯队
除了 1M 上下文和生产力任务能力,本次更值得关注的是模型开始进入自身训练和推理系统的研发循环。
Hy4 preview 总参数 770B、激活参数 49B,面向软件工程、办公分析、游戏开发和科学研究等任务。腾讯披露,模型已参与训练方法、数据策略、评估体系和底层算子优化;在一次围绕算子融合与通信优化的实践中,端到端吞吐相较基线提升 31.8%。