Signal #25:Agent 的成本单位,正在从 Token 变成一次完成的任务
此前我们在《Agent 开始进入团队账本》中记录过:当 Agent 进入团队级使用,成本、质量、效率和收益也需要被算清楚。本周出现了一个更具体的问题:这本账应该按什么单位来记?JetBrains 的内部评测发现,Fable 5 虽然每 Token 更贵,但在部分复杂任务中通过率更高、执行步骤约少 22%,最终的单任务成本反而更低。
Agent 执行的已经不是一次模型调用,而是一段包含上下文读取、工具调用、代码修改、测试和失败恢复的过程。模型、Thinking Effort、上下文长度、缓存、工具输出和重试次数,都会改变最终成本。价格较低的模型如果需要更多步骤和人工介入,完成任务未必更便宜。
因此,企业对 Agent 的评估口径会逐渐从 Token 和 Credit,走向完成一个经过验证的任务需要多少成本。模型单价仍然重要,但更有意义的指标将是任务成功率、执行步骤、总耗时、验证结果和人工介入次数。只有把消耗和最终交付关联起来,才能判断哪一种 Agent 工作流真正划算。

2026-08-14|DeepSeek Harness 拆解:一套能拼装的 Agent 架构
DeepSeek Harness 以 Cordis 插件框架组织模型、工具、会话等能力,通过依赖注入、作用域服务与可逆副作用管理组件的装载、替换和清理。
文章对比了传统 DI 容器、轻量钩子与 Cordis 三种插件形态。传统 DI 主要解决依赖创建和注入,通常不会把资源清理、依赖变化和插件卸载作为一等能力;Cordis 则要求插件注册自身产生的副作用及对应清理方法,并在作用域释放时统一逆转。文章还解释了 Preset 的 Scope 继承、Code Mode 隔离和工具遮蔽算法,并将 Cordis 的设计概括为“时间可组合性”与“空间可组合性”。
2026-08-16|为什么 DeepSeek DSH 选择 Cordis:重新理解插件、生命周期与运行时
文章从一个 Mini Cordis 的实现出发,拆解 Context、Effect 与生命周期管理的关系,说明 DeepSeek Harness 选择 Cordis 的原因在于它能够管理动态能力的边界。
插件系统的价值不仅在于加载能力,还在于能否安全地卸载、替换和重组运行中的能力。文章从 setInterval 等资源在插件退出后仍然残留的问题引出 Effect:插件对系统造成一次影响时,同时注册对应的撤销方法。真实 Cordis 将事件监听、子插件和服务都纳入这套机制,为 Agent Runtime 中生命周期不同的模型、工具、会话、沙箱和权限提供统一的组织基础。
2026-08-15|DeepSeek Harness 实测|模型之外的那一半,到底带来了什么
文章通过本机运行 npm、Web、Headless 和 Python SDK,评估 DeepSeek Harness 作为开放式 Agent 平台脚手架的完成度,并重点分析 Trajectory、Plugin 与 Preset 的分工。
Trajectory 直接基于 Session Event Log 展示请求、响应、工具调用和日志,更接近模型在执行时收到的真实信息。Plugin 负责提供 SQL、文件或浏览器等能力,Preset 则决定某类 Agent 能看见和使用哪些能力。作者认为,DSH 当前的平台开放性强于默认产品体验,其生产价值更多来自对能力的筛选、替换和组合,而非继续堆叠工具。
2026-08-12|从 Pi 到 Mini Pi:重新实现一次 Agent Harness
文章以 Pi 为源码样本实现 Mini Pi,通过逐步加入 Tool、持久化、上下文、事件和策略控制,观察 Agent 从最小 Loop 走向真实系统时复杂度从何而来。
最小 Agent Loop 只需要模型决策、执行工具和结果回填,但真实任务很快会遇到执行历史保存、上下文膨胀和高风险命令控制等问题。Mini Pi 将 AgentState 定义为当前运行状态,将 Session 定义为长期保存的执行轨迹,并使用 JSONL 持久化。这个实验说明,Harness 的复杂度主要来自长程任务所需的状态、上下文和控制机制。
2026-08-12|Raft 创始人:说 Harness 会被淘汰的,肯定没做过工程
Raft 创始人 RC 认为,模型能力增强不会让 Harness 消失,底层补丁式约束可能减少,但任务编排、协作和治理需求会推动 Harness 向更上层演进。
在 RC 的判断中,防止格式错误、补充工具说明等底层 Harness 会随着模型进步被逐渐内化;与此同时,更复杂的长程任务和多 Agent 协作会带来新的运行时需求。这个观点不意味着 Harness 必然越来越庞大,而是提示团队需要持续判断哪些外部约束已经过时,哪些控制仍然属于系统边界。
2026-08-14|企业内Agent工具落地实践:统一Harness、Skill与虚拟文件系统
文章围绕“任务可以访问什么、业务经验如何进入 Agent、长任务状态保存在哪里”三个问题,提出统一 Harness、Skill 分发和虚拟文件系统组成的企业 Agent 架构。
平台被拆为用户入口、控制平面、企业 Harness 和 Agent Runtime 四层。Harness 负责身份、权限、审计、会话、检查点、工具审批和执行环境,领域团队则通过 Skill 提供业务能力。文章反对“一个场景建设一个 Agent”和“直接把通用 Coding Agent 发给所有人”两种方式,主张共享运行平台、分布式沉淀领域能力。
2026-08-12|高德汽车工程AI Native演进实录|用Harness构建可控AI交付
高德汽车业务中心将 Harness 定义为模型之外的工程控制系统,通过上下文治理、行为约束、AI 自测、AI Review 和评测体系控制规模化 AI Coding 的交付风险。
文章以一份约 200k 的 PRD 为例,其中真正影响功能的关键规则只有约 10k,规则被大量背景信息淹没后,遗漏沿设计、编码和自测逐级放大,直到实车验证才暴露。团队据此归纳输入偏差、执行越界、验证缺位、缺陷逃逸和反馈断裂五类风险,并将规范、组件边界、测试策略和历史经验转化为运行时控制点。
2026-08-12|天猫AI助手:调度框架重构与AI Coding工程化实践
天猫 AI 助手团队通过调度框架重构和 AI Coding 工程化,将单业务接入成本从 3.5~4.5 人天降低到约 0.7 人天。
调度框架从硬编码升级为 Reducer 与 Event 驱动的三层模型,将分散的状态写入逻辑收敛到统一入口,并拆分监控、业务统计和异常日志。AI Coding 侧建立了 4 份范式、13 个 Skill、8 个 Hook 和月度观测报告。文中数据来自团队内部实践,参考价值主要在于说明:隐性知识只有被整理为范式、Skill 和反馈机制后,才能成为组织级工程能力。
2026-08-13|海外SKILL实践:基于开发事件驱动的自动化协同提效!
爱奇艺开发管理 Skill 以 Git Hooks 和本地开发动作为可信事件,将分支创建、提交、提测、MR 和 Tag 自动转化为多个研发系统中的协同操作。
方案围绕开发分支生命周期记录任务状态:创建 feature/ 分支触发开发开始,Commit 和 Push 同步进度,自定义命令触发提测与 MR,Tag 则收口交付和上线申请。它没有替代 PMS、GitLab 或交付平台,而是在开发者本地环境建立一个由真实开发事件驱动的协同入口。
2026-08-11|代码会成为 AI 时代的“汇编语言”吗?
文章从意图表达、验证能力、错误成本和长期演进四个维度,讨论哪些代码可以减少人工阅读,哪些代码仍然需要被工程师理解。
输入输出明确、能够通过类型检查和自动测试验证的生成代码,更有条件退到幕后;涉及架构决策、业务语义和高错误成本的代码,仍然需要人理解。文章进一步指出,只有当 DSL、Spec、类型系统和验证机制接管一部分设计决策后,底层代码才真正具备类似“汇编语言”的条件。
2026-08-12|Qoder CLI 上运行 Qwen3.8-Max:5 个硬核任务实测
文章使用 Qoder CLI 和 Qwen3.8-Max 完成五个长程任务,其中《清明上河图》任务连续运行 4 小时 23 分钟,并通过大量截图进行视觉迭代。
作者将结果与 Claude Opus 4.8、GPT-5.6 Sol 和 Claude Fable 5 进行对照。Qwen3.8-Max 选择从零编写渲染器,工程文件最小、渲染批次较少,但画面内容偏空。这组结果属于厂商自行设计和评分的展示性测试,不能直接作为模型排名,但能够观察不同模型在长程执行中选择的工程路径和资源分配方式。
2026-08-11|连续五天登上 GitHub Trending 首页的思考
文章复盘一款 AI Code Review 工具从内部使用到开源的过程,并公布了月活、采纳率、误报率和有效建议占比等运行数据。
工具采用确定性规则与 LLM Agent 混合架构,支持行级评论和多语言规则。文中披露其内部月活约 2 万、建议采纳率超过 30%、误报率低于 5%,合并到基线的有效建议中近八成来自 AI。这些内部口径不能直接推广,但说明 AI Review 进入生产后,需要从生成了多少评论转向有多少建议被接受、误报造成了多少额外负担。
2026-08-14|高德汽车工程 AI Native 演进实录|AutoSDK AI Coding 可观测与自进化闭环的构建
高德汽车业务中心通过 Hook 埋点、本地会话转录文件和本地数据库三源融合,采集 AI Coding 的执行过程,使系统能够从交付结果中持续改进。
Hook 提供实时事件,会话转录保留完整决策过程,本地 SQLite 则存储结构化数据。文中披露缺陷漏出下降约 73%、代码采纳率达到 84%、API 规范遵守率达到 80%,这些数字属于团队自身场景。更值得关注的是,可观测性开始从排查问题的辅助工具,变成评测、经验沉淀和 Harness 迭代的基础。
2026-08-13|Agent 越改越乱之后,我用评测和轨迹把它拉回来了
文章构建了一套基于结果评测的 Skill 改进流程:运行任务、分析错误、生成候选修改、重新验证,通过则接受,否则回滚。
代码安全审计能够通过漏报和误报客观判断结果,因此适合用作实验场景。LLM 只负责根据诊断生成候选 Patch,验证、回滚和黑名单等高风险环节由确定性规则控制。这套方法的关键不是让模型自由修改自己,而是把模型生成放进一个具有验收标准和失败恢复能力的受控优化循环。
2026-08-10|AI 评测还在看准确率?数据科学早就用因果推断做归因分析了
文章尝试将因果推断、扰动实验和博弈论归因引入 AI 与 Agent 评测,以判断工具、参数、Prompt 和任务难度分别对结果产生了多大影响。
文章介绍 Rubin 潜在结果模型、Pearl 因果图、DoWhy、EconML 和 SHAP,并给出基于完整 Trace 的组件分析、缺少中间数据时的黑盒扰动、控制混杂变量的 A/B 测试三类策略。需要注意,SHAP 描述的是特征或组件对模型结果的归因,并不天然等同于因果关系;只有具备合理干预、对照和混杂变量控制时,才能进一步讨论因果贡献。这篇文章的价值在于把评测从“指标变化了多少”推进到“究竟是什么导致变化”。
2026-08-12|重塑 Agent 度量衡:基于 LLM-as-a-Judge 的离线评估体系与实践
货拉拉面向 AI 外呼构建 LLM-as-a-Judge 离线评估体系,除了判断最终话术,还检查工具调用时机、参数和中间决策。
传统正则难以覆盖语义相同但表达不同的回复,大规模人工评测又需要大量人力。方案将 Agent 拆为 LLM 与 Harness 两部分,对最终结果和执行过程分别建立评价标准。LLM-as-a-Judge 能降低评测成本,但其一致性和偏差仍需要通过人工标注集、规则校验与持续抽检约束。
2026-08-13|货拉拉大模型记忆系统(一):从提取到召回的工程实践
货拉拉自研记忆系统将在线读写与离线整理分开,通过多层次“睡眠”机制整合重复信息、更新变化状态并提高跨会话召回质量。
长上下文扩大了一次调用能够阅读的材料,却没有自动把历史消息转化为可使用的记忆。系统在写入时判断新信息是补充、修正还是替代旧记录,读取时通过混合检索和重排序寻找当前问题所需内容。文章还对比了不带历史、携带全部历史和专门记忆系统在 Token 消耗、状态更新与跨会话连续性上的差异。
2026-08-12|得物知识问答:复合检索 Agent 的系统设计实践
得物基于 AgentScope 2.0 的 HarnessAgent 构建复合检索 Agent,通过 ReAct 循环、中间件和并行工具调用组合知识库与企业协作数据。
系统在中间件中加入 FastPass、Reranker 和 LLM Grading 三阶段 Pipeline,对候选结果逐层过滤,同时保持这套机制对 Agent 主循环透明。知识库和用户个人可见的协作数据可以在同一轮对话中同时检索,权限隔离则决定结果是否能够进入上下文。实践表明,知识问答 Agent 的重点已经从“接入一个向量库”转向检索质量、权限与多数据源协同。
2026-08-10|10万+Skill 背后:腾讯SkillHub如何帮用户找到真正好用的那20%
腾讯 SkillHub 已收录 10 万多个 Skill、月下载量超过 1000 万次,平台工作重点开始从扩大供给转向质量评估、曝光分配和面向 Agent 的发现能力。
Skill 的点击和下载并不代表它能够成功完成任务,真实反馈往往发生在用户安装到外部 Agent 之后。SkillHub 因此需要建立质量坐标、把有限曝光分配给更可靠的供给,并让检索和推荐能力能够被 Agent 直接调用。随着 Skill 数量快速增长,其治理方式正在接近软件包生态,而不只是内容社区。
2026-08-10|Claude Tag 可能是一个 10x Claude Code 级别的产品
Claude Tag 以独立账号进入 Slack 等团队空间,在频道上下文、共享记忆、工具权限和异步任务基础上,以团队成员的方式持续承担工作。
文章将 Claude Tag 视为从 Chat、个人 Coding Agent 向 AI Coworker 演进的产品形态。Anthropic 的官方实践说明显示,它目前创建约 65% 的内部 Pull Request,并已进入工程、GTM、支持和数据科学等频道。相比“完成了多少代码”,更值得关注的是独立身份、频道级权限、可编辑记忆和公开执行轨迹:Agent 开始持有一部分团队运行状态,同时也带来权限边界、缓存成本和迁移成本问题。
2026-08-13|6 支快手工程团队,让 AI 落地真实业务
快手六支工程团队的实践显示,当 AI 代码贡献率达到 63.1% 时,团队整体交付效率只提升了 12.8%,瓶颈逐渐从编码转向产研流程与协作方式。
综合应用中心建设 Agent-First 协作平台,让产品、研发和测试 Agent 围绕同一项目共享上下文并接续任务。文中案例以 1 名产品经理、1 名工程师和 6 个 Agent,在 6 天内完成传统方式预估约 60 人天的项目。内部数据不能直接推广,但它说明代码生成只覆盖交付链中的一部分,组织需要继续改造任务表达、上下文共享、验证和角色协同。
2026-08-11|从基础问答到事实核查:高德内容数字员工实践
高德将内容数字员工的落地过程类比为“配齐一张能工作的工位”,通过岗位边界、业务地图、工具权限和带教评测组织 Agent 的工作环境。
内容任务通常从告警卡片或用户反馈开始,成功标准是证据是否完整、根因是否可信,而非回答是否流畅。团队认为 Prompt 适合描述原则,可靠性仍需由状态记录、工具失败语义、只读权限和评测体系实现。这个实践把 Agent 上线从配置提示词推进到岗位设计和运行环境建设。
2026-08-11|从应急响应到主动治理:Argus 稳定性数字员工实践
高德 Argus 按照感知、分析、建议、执行和复盘链路,将监控、日志、Trace 与发布信息组织成可追溯的稳定性行动。
系统要求所有判断都能回到具体证据,回滚和全局限流等高风险动作必须由人确认。Argus 在上线前生成风险报告,上线中观察灰度,上线后辅助根因分析,并通过巡检推动主动治理。它解决的重点不是生成一份故障总结,而是把分散上下文、专家经验和处置动作接入同一条闭环。
2026-08-15|STAROps 云拨测智能分析实践:从任务分析到 APM 跨域定界
STAROps 通过 Agent 查询拨测配置、原始日志和应用调用链,回答异常位置、影响路径、责任边界及证据来源等问题。
传统拨测分析容易在任务上下文、原始证据、协议阶段和后端链路之间形成断点。方案打通云拨测、日志服务、统一对象模型和 APM,使 Agent 能够沿 DNS、TCP、TLS、HTTP 和应用调用链继续下钻。这里的关键能力是跨系统组织证据,而非只对聚合指标进行语言总结。
2026-08-11|一张告警卡片到一键 RCA:塔斯汀万店连锁的智能运维闭环实践
塔斯汀基于 CMS 2.0 和 STAROps 建设统一告警与智能运维平台,将多源告警接入、标准化处理、AI 分析和数字员工协作连接起来。
万店业务的告警分布在多个监控和日志系统,容易产生重复告警、跨平台排查和处置结果无法沉淀等问题。平台建设的重点是让每次告警拥有从发现、分析到恢复和复盘的完整生命周期,使根因和解决方案能够继续服务后续自动化治理。
2026-08-13|小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座
小红书开源 dots.tts,一个 20 亿参数的连续端到端自回归语音合成模型,直接在连续隐空间中生成语音,并开放训练、推理、微调和蒸馏代码。
官方报告显示,模型在 Seed-TTS-Eval 上取得平均 79.2 的说话人相似度和 2.95% 的平均 WER/CER。普通流式模式首包延迟为 85.4 毫秒,文本流与语音流交错推进的 1T1A 模式为 54.4 毫秒。开源版本包含六个不同训练与推理阶段的检查点,采用 Apache 2.0 许可证。
2026-08-14|dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步
小红书开源 dots3-note Preview,总参数 280B、激活参数 16B,支持 512K 上下文,并面向文本、视觉、语音和长程 Agent 任务进行优化。
小红书公布的评测结果显示,其在部分推理、Agent 和多模态任务上可达到或超过参数规模更大的模型。项目同时发布 VibeSearchBench 与 VibeLifeBench 两套模拟真实生活任务的环境,并通过长程强化学习训练模型从环境反馈中更新策略和记忆。模型已按 Apache 2.0 协议开放。
2026-08-13|ICML 2026|InstEmb:面向 Oxygen AIIC 商品知识表征的未来感知指令嵌入
京东提出 InstEmb,通过在输入后追加可学习的 Look-ahead Token,使 Embedding 能够吸收模型未来回答中才会展开的语义,相关论文已被 ICML 2026 接收。
方法将语义拆为输入已经明确表达的 Input-Intrinsic Semantics,以及回答中可能出现的 Output-Aware Semantics。它使用冻结 Teacher 的输出表示进行自蒸馏,通过多视图对比学习强化输入语义,再用 Dual-Anchor Alignment Pooling 融合两类表示,为指令遵循和商品知识检索提供更完整的语义表征。
2026-08-13|Vibe Designing Playbook: 面向 Agent 时代的设计指南
Vibe Designing Playbook 主张将设计师的专业判断封装成设计声明、执行契约和验证机制,使 Agent 能够理解、调用并持续评估设计规则。
文章认为,模型在需求不明确时容易收敛到高频且稳妥的界面方案,因此设计师需要把“什么是好”和“如何做好”转化为可执行机制。CloudAI 的 FlexCard 由 Agent 描述意图、内容和行为约束,渲染层再映射到组件、Design Token 与无障碍规则。这里的变化是设计资产开始从供人阅读的规范,转向 Agent 可使用的运行契约。
2026-08-14|重构协同:关于AI Native团队的思考
文章认为,当前 AI 提效容易陷入“单点优化、全局低效”,需要让 Agent 参与串联业务流程,并围绕知识底座重新设计人与 Agent 的协作方式。
文章将机会更多地放在生产侧:过去由人持续推动和衔接的流程,可以逐步交给 Agent。实现这一形态的基础不是增加一个协同工具,而是建设能够表达业务规则、流程和历史决策,并可持续更新的知识底座。这个判断将 AI Native 团队建设从采购工具提升到知识和组织结构的重建。
2026-08-12|把 AI 视频的钱花在刀刃上,不是每一刀上
文章提出 AI 视频生产应先以低规格完成方向探索,再对最终入选版本进行高清增强,把昂贵算力集中在真正交付的内容上。
视频创意需要多轮尝试,如果每一轮都使用最高规格,成本会限制探索空间。文中估算,1080P 生成成本约为 480P 的 5~6 倍,耗时超过 3 倍。前期可以用低规格确定画面、风格和节奏,筛选后再通过画质增强交付高清版本。这种分层策略的价值不只在视频降本,也体现了按任务阶段分配资源的工程思路。
2026-08-10|火山引擎 SenseFlow 重磅发布:突破存储边界,洞见数据价值
火山引擎对象存储 TOS 推出 SenseFlow,将多模态理解、向量检索和媒体处理能力放到存储侧,使数据可以在不搬出 Bucket 的情况下完成理解和加工。
自建 AI 数据链路通常需要数据搬迁、额外向量库、GPU、编排、权限和计量系统。SenseFlow 以“数据范围、模板、工作流”组成的规则作为核心抽象,存量与增量对象能够自动进入处理流程。它代表一种基础设施方向:让 AI 数据处理靠近数据所在位置,减少跨系统复制和权限对齐成本。