<?xml version="1.0" encoding="utf-8"?>
<feed xmlns="http://www.w3.org/2005/Atom">
  <author>
    <name>砚心</name>
  </author>
  <generator uri="https://hexo.io/">Hexo</generator>
  <id>https://www.coconut.xin/</id>
  <link href="https://www.coconut.xin/" rel="alternate"/>
  <link href="https://www.coconut.xin/atom.xml" rel="self"/>
  <rights>All rights reserved 2026, 砚心</rights>
  <subtitle>代码改变世界，技术成就未来</subtitle>
  <title>椰果点心的博客</title>
  <updated>2026-04-01T02:01:43.172Z</updated>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#token-%E6%93%85%E9%95%BF%E4%BB%80%E4%B9%88%E6%A8%A1%E5%BC%8F%E7%A9%BA%E9%97%B4%E5%86%85%E7%9A%84%E9%AB%98%E6%95%88%E6%89%A7%E8%A1%8C">Token 擅长什么：模式空间内的高效执行</a><ul><li><a href="#%E4%BB%A3%E7%A0%81%E7%94%9F%E6%88%90%E4%BB%8E%E8%A7%84%E6%A0%BC%E5%88%B0%E5%AE%9E%E7%8E%B0%E7%9A%84%E7%9B%B4%E7%BA%BF%E8%B7%9D%E7%A6%BB">代码生成：从规格到实现的直线距离</a></li><li><a href="#%E4%BF%A1%E6%81%AF%E5%A4%84%E7%90%86%E5%A4%A7%E8%A7%84%E6%A8%A1%E6%A8%A1%E5%BC%8F%E5%8C%B9%E9%85%8D%E7%9A%84%E9%99%8D%E7%BB%B4%E6%89%93%E5%87%BB">信息处理：大规模模式匹配的降维打击</a></li></ul></li><li><a href="#token-%E7%9A%84%E8%BE%B9%E7%95%8C%E6%A8%A1%E5%BC%8F%E7%A9%BA%E9%97%B4%E4%B9%8B%E5%A4%96%E7%9A%84%E6%97%A0%E4%BA%BA%E5%8C%BA">Token 的边界：模式空间之外的无人区</a><ul><li><a href="#%E9%97%AE%E9%A2%98%E5%AE%9A%E4%B9%89%E6%9C%80%E8%B4%B5%E7%9A%84%E8%AE%A4%E7%9F%A5%E5%8A%B3%E5%8A%A8">问题定义：最贵的认知劳动</a></li><li><a href="#%E6%9E%B6%E6%9E%84%E5%86%B3%E7%AD%96%E4%B8%8D%E5%8F%AF%E9%80%86%E9%80%89%E6%8B%A9%E4%B8%AD%E7%9A%84%E5%88%A4%E6%96%AD%E5%8A%9B">架构决策：不可逆选择中的判断力</a></li><li><a href="#%E5%88%A9%E7%9B%8A%E5%8D%9A%E5%BC%88%E4%BA%BA%E6%80%A7%E4%B8%8D%E6%98%AF%E5%8F%82%E6%95%B0">利益博弈：人性不是参数</a></li></ul></li><li><a href="#%E4%B8%80%E4%B8%AA%E5%AE%9E%E7%94%A8%E7%9A%84%E6%80%9D%E8%80%83%E6%A1%86%E6%9E%B6">一个实用的思考框架</a></li><li><a href="#%E7%BB%84%E7%BB%87%E5%B1%82%E9%9D%A2%E7%9A%84%E5%90%AF%E7%A4%BA">组织层面的启示</a></li><li><a href="#%E4%B8%A4%E4%B8%AA%E9%9C%80%E8%A6%81%E8%AD%A6%E6%83%95%E7%9A%84%E5%9D%91">两个需要警惕的坑</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>上周，一个做 ToB SaaS 的朋友跟我吐槽：他花了两周让 AI 帮忙写了一套完整的 CRM 后端，代码质量不错，测试覆盖率也够。但上线三天就被叫停了——因为产品方向本身就是错的，客户根本不需要这个功能。</p><p>两周的 Token 消耗，毁于一个没被认真思考过的问题。</p><p>这不是个例。2026 年了，我见过太多团队掉进同一个坑：<strong>把 AI 当成万能螺丝刀，拿着它满世界找螺丝拧。</strong> 问题在于，很多时候你面前的根本不是螺丝，而是一颗钉子——甚至连”要不要固定这块板”这个前提都没想清楚。</p><p>三年 AI 原生工作实践下来，我逐渐形成了一条判断标准：<strong>不能被 Token 解决的问题，才配叫问题。</strong></p><p>这句话听着像在抬杠，其实它是我用来做工作分配的核心心智模型。</p><h2 id="Token-擅长什么：模式空间内的高效执行"><a href="#Token-擅长什么：模式空间内的高效执行" class="headerlink" title="Token 擅长什么：模式空间内的高效执行"></a>Token 擅长什么：模式空间内的高效执行</h2><p>先说 Token 的能力边界在哪。这不是贬低 AI，而是用好它的前提。</p><h3 id="代码生成：从规格到实现的直线距离"><a href="#代码生成：从规格到实现的直线距离" class="headerlink" title="代码生成：从规格到实现的直线距离"></a>代码生成：从规格到实现的直线距离</h3><p>我现在的开发流程里，大约 70% 的”写代码”环节已经被 AI 接管。举几个真实场景：</p><p><strong>DingTalk 插件开发。</strong> 我维护一个 3800 行的钉钉消息处理插件。每次需要新增一种消息类型的处理逻辑，我只需要描述输入格式和期望行为，AI 就能生成符合项目既有模式的代码——包括错误处理、日志记录、类型定义，甚至单元测试。这类工作的特征是<strong>解空间被上下文高度约束</strong>，AI 在已有代码中学到了”这个项目是怎么做事的”。</p><p><strong>数据处理管道。</strong> 一家做电商数据分析的客户，需要把十几种不同格式的供应商数据统一成内部格式。以前这种 ETL 脚本写起来枯燥且容易出错，现在直接丢几个样本文件给 AI，它能准确推断映射规则并生成转换代码。效率提升不是百分比能衡量的——是从”一个人干两天”到”半小时搞定”的质变。</p><p><strong>测试用例补全。</strong> 某个项目的测试覆盖率从 40% 拉到 85%，核心工作不是我写的，是 AI 根据业务逻辑和边界条件批量生成的。我的工作是 review 这些测试是否真正测到了该测的东西——这个 review 环节，反而是 AI 做不好的。</p><p>这些场景的共同点：<strong>输入可以被清晰定义，输出有明确的评估标准，且解空间在训练数据的覆盖范围内。</strong> 简单说，这是”有标准答案的考试”，AI 是天生的应试高手。</p><h3 id="信息处理：大规模模式匹配的降维打击"><a href="#信息处理：大规模模式匹配的降维打击" class="headerlink" title="信息处理：大规模模式匹配的降维打击"></a>信息处理：大规模模式匹配的降维打击</h3><p>另一类 AI 擅长的工作是信息的搜集、整理和初步分析：</p><ul><li>一份 50 页的行业报告，AI 10 分钟提取出所有关键数据点和趋势判断</li><li>一个 GitHub 仓库的 200 条 Issue，AI 自动分类、识别重复、标记优先级</li><li>用户反馈的语音记录，AI 转写后提取情感倾向和高频关键词</li></ul><p>这些工作本质上是<strong>模式匹配</strong>。它们确实很重要、很耗时，但它们不是”问题”——它们是解决问题的原材料。</p><h2 id="Token-的边界：模式空间之外的无人区"><a href="#Token-的边界：模式空间之外的无人区" class="headerlink" title="Token 的边界：模式空间之外的无人区"></a>Token 的边界：模式空间之外的无人区</h2><p>说完 AI 能做的，来看看那些真正需要人类智能的地方。</p><h3 id="问题定义：最贵的认知劳动"><a href="#问题定义：最贵的认知劳动" class="headerlink" title="问题定义：最贵的认知劳动"></a>问题定义：最贵的认知劳动</h3><p>这是我见过最被低估的能力。</p><p>一家在线教育公司找我咨询，说”完课率太低，只有 30%，想用 AI 做个智能督学系统”。表面看这是个明确的技术问题，可以用 Token 解决——做个 Agent 定时推送提醒、分析学习行为、个性化推荐内容。</p><p>但我问了几个问题：</p><ul><li>用户买课的动机是什么？是真想学，还是冲动消费？</li><li>30% 的完课率在你们品类里算低吗？</li><li>完课的用户和没完课的用户，在续费率上有显著差异吗？</li></ul><p>深挖后发现：他们 60% 的用户是被直播间冲动转化的，买课本身就没有强学习意愿。完课率低不是”学习体验差”的问题，而是<strong>流量质量和产品定位不匹配</strong>的问题。花三个月做 AI 督学，不如花三周调整投放策略和课程定价。</p><p><strong>定义问题的能力，就是把钱花在对的地方的能力。</strong> AI 可以帮你更快更好地解决一个问题，但它不会告诉你”你在解决一个错误的问题”。</p><h3 id="架构决策：不可逆选择中的判断力"><a href="#架构决策：不可逆选择中的判断力" class="headerlink" title="架构决策：不可逆选择中的判断力"></a>架构决策：不可逆选择中的判断力</h3><p>技术架构选型是另一个典型案例。</p><p>一个日活 50 万的社交产品，技术负责人在纠结要不要把消息系统从 MySQL 迁移到专门的消息队列架构。AI 可以：</p><ul><li>详细对比 Kafka、Pulsar、RocketMQ 的技术指标</li><li>生成完整的迁移方案和代码</li><li>估算资源成本和迁移周期</li></ul><p>但 AI 判断不了的是：</p><ul><li>团队 8 个后端里只有 2 个人用过消息队列，培训周期和出错概率怎么算？</li><li>公司刚融了 A 轮，未来 12 个月的首要目标是用户增长而非技术稳定性，现在做这件事值不值？</li><li>如果 CTO 本人半年后可能离职，谁来为这个架构的长期演进负责？</li></ul><p><strong>这些因素没法被编码成 prompt。</strong> 它们涉及对人、对组织、对时机的综合判断——而这种判断力，恰恰是一个技术管理者最核心的价值。</p><h3 id="利益博弈：人性不是参数"><a href="#利益博弈：人性不是参数" class="headerlink" title="利益博弈：人性不是参数"></a>利益博弈：人性不是参数</h3><p>去年帮一个团队做技术选型，表面是”选 A 框架还是 B 框架”的问题，实际是两个技术 Leader 的路线之争。选 A 意味着甲方团队承担更多工作，选 B 意味着乙方团队要学新东西。技术指标上两者几乎打平。</p><p>最终决定选了 B，不是因为 B 在技术上更优，而是因为乙方团队 Leader 刚入职不久需要一个证明自己的机会，且甲方团队本身已经超负荷。</p><p>这种决策涉及的是<strong>组织政治、个人动机、团队士气</strong>——Token 对这些一无所知。</p><h2 id="一个实用的思考框架"><a href="#一个实用的思考框架" class="headerlink" title="一个实用的思考框架"></a>一个实用的思考框架</h2><p>把上面的思考落地，我日常工作中用三个问题做快速筛选：</p><p><strong>第一问：这件事的输入和输出能否被明确描述？</strong></p><p>如果你能用一段话清楚说明”给 AI 什么、期望它产出什么”，大概率可以交给 Token。如果你自己都说不清楚期望什么结果，那你要做的第一件事是想清楚，而不是急着调用 API。</p><p><strong>第二问：做错了的代价是什么？</strong></p><p>写错了一个函数，跑一遍测试就知道了，成本是几分钟。但选错了技术方向、误判了市场需求、得罪了关键人物——这些错误的修复成本可能是几个月甚至不可逆的。<strong>高风险决策必须由人类来做。</strong></p><p><strong>第三问：这个问题是否可以被拆解为”人类定义 + AI 执行”？</strong></p><p>大多数复杂工作都不是纯 Token 问题或纯人类问题，而是两者的组合。关键是找到切分点。比如写一篇技术博客：</p><p>环节</p><p>负责方</p><p>原因</p><p>选题和核心观点</p><p>人类</p><p>需要判断力和独特视角</p><p>资料搜集和整理</p><p>AI</p><p>模式匹配，大规模信息处理</p><p>大纲和初稿</p><p>AI</p><p>基于模式生成结构化内容</p><p>深度修改和润色</p><p>人类</p><p>加入经验、调整语气、强化逻辑</p><p>事实核查</p><p>AI + 人类</p><p>AI 初筛，人类终审</p><p>这篇文章本身就是这么写的。核心论点和案例来自我三年的实践经验，结构生成和初稿交给了 AI，最终的表达、判断和取舍是我自己的。</p><h2 id="组织层面的启示"><a href="#组织层面的启示" class="headerlink" title="组织层面的启示"></a>组织层面的启示</h2><p>如果你带团队，这个框架意味着一些深层变化：</p><p><strong>岗位价值需要重新评估。</strong> 如果一个人的工作内容 80% 是”能被 Token 解决的”，那这个岗位的价值支撑点在哪？不是说要裁人，而是要把人从低价值工作中释放出来，让他们去做问题定义、方案决策、关系建设这些真正有壁垒的事。</p><p><strong>评估标准必须改变。</strong> “写了多少代码”“处理了多少工单”这类执行指标越来越廉价。真正有价值的指标是：你定义了多少好问题？你做了多少影响深远的正确决策？你阻止了多少团队走弯路？</p><p><strong>AI 基础设施要当一等公民。</strong> 团队的知识库、Prompt 模板库、AI 工作流——这些不是锦上添花，而是基础设施。就像十年前你不会让员工用记事本写代码一样，今天也不应该让他们裸手处理那些 AI 能轻松搞定的工作。</p><h2 id="两个需要警惕的坑"><a href="#两个需要警惕的坑" class="headerlink" title="两个需要警惕的坑"></a>两个需要警惕的坑</h2><p><strong>坑一：AI 依赖症。</strong> 什么都问 AI，包括那些本应自己想清楚的问题。长此以往，判断力会退化。我见过有人连”今天中午吃什么”都要问 ChatGPT——这不是 AI 原生，这是思考懒惰。</p><p><strong>坑二：AI 恐惧症。</strong> 因为 AI “不完美”就拒绝使用，坚持手动完成所有工作。这就像因为计算器”有时候按错键”就坚持用算盘。重点不是 AI 是否完美，而是它是否比你手动做更高效、更一致。</p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>“不能被 Token 解决的问题，才配叫问题”——这句话的潜台词是：<strong>你的时间和注意力是稀缺资源，要投入到投资回报率最高的地方。</strong></p><p>能被 Token 解决的事，让 Token 去做。 不能被 Token 解决的事，才是你作为一个人、一个专业人士、一个决策者真正的战场。</p><p>当你下次接到一个任务时，先停三秒钟问自己：这是一个 Token 问题，还是一个真正的问题？</p><p>这三秒钟的思考，可能比之后三天的执行更有价值。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/agent/">Agent</a>  <a href="https://hugozhu.site/tags/thinking/">Thinking</a>  <a href="https://hugozhu.site/tags/productivity/">Productivity</a>  <a href="https://hugozhu.site/tags/engineering/">Engineering</a> </p><hr><ul><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></li><li><a href="/post/2026/158-maas-core-capabilities/">AI的MaaS层最核心的能力：把一个不稳定的概率接口，变成一个可运营的服务</a></li><li><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/31/2026-03-31-AI-%E5%8E%9F%E7%94%9F%E7%9A%84%E6%80%9D%E8%80%83%E6%96%B9%E5%BC%8F-%E4%B8%8D%E8%83%BD%E8%A2%AB-Token-%E8%A7%A3%E5%86%B3%E7%9A%84%E9%97%AE%E9%A2%98-%E6%89%8D%E9%85%8D%E5%8F%AB%E9%97%AE%E9%A2%98/</id>
    <link href="https://www.coconut.xin/2026/03/31/2026-03-31-AI-%E5%8E%9F%E7%94%9F%E7%9A%84%E6%80%9D%E8%80%83%E6%96%B9%E5%BC%8F-%E4%B8%8D%E8%83%BD%E8%A2%AB-Token-%E8%A7%A3%E5%86%B3%E7%9A%84%E9%97%AE%E9%A2%98-%E6%89%8D%E9%85%8D%E5%8F%AB%E9%97%AE%E9%A2%98/"/>
    <published>2026-03-31T04:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#token-%E6%93%85%E9%95%BF%E4%BB%80%E4%B9%88%]]>
    </summary>
    <title>AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</title>
    <updated>2026-04-01T02:01:43.172Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E5%85%88%E6%90%9E%E6%B8%85%E6%A5%9A%E9%97%AE%E9%A2%98%E4%BC%A0%E7%BB%9F-voc-%E5%A4%84%E7%90%86%E4%B8%BA%E4%BB%80%E4%B9%88%E6%96%AD%E8%A3%82">一、先搞清楚问题：传统 VOC 处理为什么断裂</a></li><li><a href="#%E4%BA%8C%E7%9B%AE%E6%A0%87%E6%9E%B6%E6%9E%84voc-%E8%87%AA%E5%8A%A8%E5%8C%96%E7%94%9F%E4%BA%A7%E7%BA%BF%E5%85%A8%E6%99%AF%E5%9B%BE">二、目标架构：VOC 自动化生产线全景图</a></li><li><a href="#%E4%B8%89%E7%AC%AC%E4%B8%80%E5%B1%82%E6%95%B0%E6%8D%AE%E9%87%87%E9%9B%86%E6%8A%8A%E6%95%A3%E8%90%BD%E7%9A%84%E5%A3%B0%E9%9F%B3%E6%94%B6%E6%8B%A2">三、第一层：数据采集——把散落的声音收拢</a><ul><li><a href="#31-%E6%A2%B3%E7%90%86%E4%BD%A0%E7%9A%84-voc-%E6%9D%A5%E6%BA%90">3.1 梳理你的 VOC 来源</a></li><li><a href="#32-%E6%9E%84%E5%BB%BA%E7%BB%9F%E4%B8%80%E9%87%87%E9%9B%86%E7%AE%A1%E9%81%93">3.2 构建统一采集管道</a></li><li><a href="#33-%E9%92%89%E9%92%89%E4%BC%81%E5%BE%AE%E7%BE%A4%E8%81%8A%E9%87%87%E9%9B%86%E5%AE%9E%E6%88%98">3.3 钉钉&#x2F;企微群聊采集实战</a></li></ul></li><li><a href="#%E5%9B%9B%E7%AC%AC%E4%BA%8C%E5%B1%82ai-%E5%A4%84%E7%90%86%E5%BC%95%E6%93%8E%E7%94%9F%E4%BA%A7%E7%BA%BF%E7%9A%84%E6%A0%B8%E5%BF%83">四、第二层：AI 处理引擎——生产线的核心</a><ul><li><a href="#41-%E7%AC%AC%E4%B8%80%E6%AD%A5%E5%8F%8D%E9%A6%88%E8%AF%86%E5%88%AB%E4%B8%8E%E8%BF%87%E6%BB%A4">4.1 第一步：反馈识别与过滤</a></li><li><a href="#42-%E7%AC%AC%E4%BA%8C%E6%AD%A5%E5%A4%9A%E7%BB%B4%E5%BA%A6%E7%BB%93%E6%9E%84%E5%8C%96%E6%8F%90%E5%8F%96">4.2 第二步：多维度结构化提取</a></li><li><a href="#43-%E7%AC%AC%E4%B8%89%E6%AD%A5%E8%81%9A%E7%B1%BB%E4%B8%8E%E5%8E%BB%E9%87%8D">4.3 第三步：聚类与去重</a></li><li><a href="#44-%E7%AC%AC%E5%9B%9B%E6%AD%A5%E4%BC%98%E5%85%88%E7%BA%A7%E8%AF%84%E5%88%86">4.4 第四步：优先级评分</a></li></ul></li><li><a href="#%E4%BA%94%E7%AC%AC%E4%B8%89%E5%B1%82%E8%BE%93%E5%87%BA%E4%B8%8E%E8%A1%8C%E5%8A%A8%E8%AE%A9%E7%94%9F%E4%BA%A7%E7%BA%BF%E4%BA%A7%E5%87%BA%E7%9C%9F%E6%AD%A3%E7%9A%84%E6%88%90%E6%9E%9C">五、第三层：输出与行动——让生产线产出真正的成果</a><ul><li><a href="#51-%E8%87%AA%E5%8A%A8%E7%94%9F%E6%88%90-backlog-item">5.1 自动生成 Backlog Item</a></li><li><a href="#52-%E5%AE%9E%E6%97%B6%E5%91%8A%E8%AD%A6%E5%85%B3%E9%94%AE%E4%BF%A1%E5%8F%B7%E4%B8%8D%E7%AD%89%E5%91%A8%E6%8A%A5">5.2 实时告警：关键信号不等周报</a></li><li><a href="#53-%E5%91%A8%E6%8A%A5%E4%B8%8E%E8%B6%8B%E5%8A%BF%E7%9C%8B%E6%9D%BF">5.3 周报与趋势看板</a></li></ul></li><li><a href="#%E5%85%AD%E5%AE%9E%E6%88%98%E9%83%A8%E7%BD%B2%E4%B8%80%E4%B8%AA%E6%9C%80%E5%B0%8F%E5%8F%AF%E7%94%A8%E7%89%88%E6%9C%AC">六、实战部署：一个最小可用版本</a><ul><li><a href="#61-%E6%8A%80%E6%9C%AF%E6%A0%88">6.1 技术栈</a></li><li><a href="#62-%E6%A0%B8%E5%BF%83%E5%A4%84%E7%90%86%E6%B5%81%E7%A8%8B%E5%8F%AF%E7%9B%B4%E6%8E%A5%E8%BF%90%E8%A1%8C%E7%9A%84%E4%BC%AA%E4%BB%A3%E7%A0%81">6.2 核心处理流程（可直接运行的伪代码）</a></li><li><a href="#63-%E6%88%90%E6%9C%AC%E4%BC%B0%E7%AE%97">6.3 成本估算</a></li></ul></li><li><a href="#%E4%B8%83%E9%81%BF%E5%9D%91%E6%8C%87%E5%8D%97%E6%88%91%E8%B8%A9%E8%BF%87%E7%9A%84%E5%9D%91">七、避坑指南：我踩过的坑</a><ul><li><a href="#%E5%9D%91-1%E4%B8%80%E4%B8%8A%E6%9D%A5%E5%B0%B1%E8%BF%BD%E6%B1%82%E5%AE%8C%E7%BE%8E">坑 1：一上来就追求完美</a></li><li><a href="#%E5%9D%91-2%E8%AE%A9-ai-%E5%81%9A%E6%89%80%E6%9C%89%E5%86%B3%E7%AD%96">坑 2：让 AI 做所有决策</a></li><li><a href="#%E5%9D%91-3%E5%BF%BD%E7%95%A5%E5%8F%8D%E9%A6%88%E9%97%AD%E7%8E%AF">坑 3：忽略反馈闭环</a></li><li><a href="#%E5%9D%91-4%E4%B8%8D%E5%81%9A%E8%B4%A8%E9%87%8F%E7%9B%91%E6%8E%A7">坑 4：不做质量监控</a></li></ul></li><li><a href="#%E5%85%AB%E8%BF%9B%E9%98%B6%E6%96%B9%E5%90%91%E4%BB%8E%E7%94%9F%E4%BA%A7%E7%BA%BF%E5%88%B0%E6%99%BA%E8%83%BD%E5%B7%A5%E5%8E%82">八、进阶方向：从生产线到智能工厂</a><ul><li><a href="#81-%E9%A2%84%E6%B5%8B%E6%80%A7%E5%88%86%E6%9E%90">8.1 预测性分析</a></li><li><a href="#82-%E8%B7%A8%E6%BA%90%E5%85%B3%E8%81%94">8.2 跨源关联</a></li><li><a href="#83-%E8%87%AA%E5%8A%A8%E5%8C%96-ab-%E9%AA%8C%E8%AF%81">8.3 自动化 A&#x2F;B 验证</a></li></ul></li><li><a href="#%E4%B9%9D%E6%80%BB%E7%BB%93voc-%E7%94%9F%E4%BA%A7%E7%BA%BF%E7%9A%84%E6%A0%B8%E5%BF%83%E7%90%86%E5%BF%B5">九、总结：VOC 生产线的核心理念</a></li></ul><p>每家公司都说”以用户为中心”，但 90% 的用户声音（Voice of Customer, VOC）最终的归宿是——躺在某个 Excel 表里，等着某个产品经理”有空的时候”去翻一翻。</p><p>问题不是团队不重视用户反馈。问题是：<strong>从原始反馈到可执行的产品动作之间，隔着太多手工活。</strong> 收集、清洗、分类、归因、优先级排序、写进 Backlog——每一步都在消耗人的精力，而人的精力是有限的。</p><p>这篇文章是一个完整的教程：<strong>如何用 AI + 自动化工具，把 VOC 变成一条可执行的生产线</strong>——从原始数据采集，到最终输出结构化的产品需求，全程自动。</p><h2 id="一、先搞清楚问题：传统-VOC-处理为什么断裂"><a href="#一、先搞清楚问题：传统-VOC-处理为什么断裂" class="headerlink" title="一、先搞清楚问题：传统 VOC 处理为什么断裂"></a>一、先搞清楚问题：传统 VOC 处理为什么断裂</h2><p>在动手之前，先画一张图：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br></pre></td><td class="code"><pre><span class="line">用户反馈（多渠道）</span><br><span class="line">    ↓</span><br><span class="line">人工收集、复制粘贴</span><br><span class="line">    ↓</span><br><span class="line">Excel / 钉钉文档 汇总</span><br><span class="line">    ↓</span><br><span class="line">产品经理人工阅读</span><br><span class="line">    ↓</span><br><span class="line">归类、打标签</span><br><span class="line">    ↓</span><br><span class="line">写需求文档</span><br><span class="line">    ↓</span><br><span class="line">排优先级</span><br><span class="line">    ↓</span><br><span class="line">进入开发 Backlog</span><br></pre></td></tr></table></figure><p>这条链路有几个致命问题：</p><ol><li><strong>采集断裂</strong>：反馈散落在客服系统、社交媒体、App Store 评论、销售群聊、工单系统……没有一个地方能看到全貌</li><li><strong>处理瓶颈</strong>：全靠人读。一个产品经理一天能认真读多少条反馈？50 条？100 条？如果日均反馈 1000+，直接放弃</li><li><strong>分类主观</strong>：不同的人对同一条反馈的归类不同，标签体系混乱</li><li><strong>时效性差</strong>：从用户说出”这个功能太难用了”到产品团队真正看到，可能隔了两周</li><li><strong>闭环缺失</strong>：反馈处理了没有？用户知道吗？没人跟踪</li></ol><p>我们要做的，是<strong>把这条链路上的每一个断点，用自动化焊起来</strong>。</p><h2 id="二、目标架构：VOC-自动化生产线全景图"><a href="#二、目标架构：VOC-自动化生产线全景图" class="headerlink" title="二、目标架构：VOC 自动化生产线全景图"></a>二、目标架构：VOC 自动化生产线全景图</h2><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br></pre></td><td class="code"><pre><span class="line">┌─────────────────────────────────────────────────────┐</span><br><span class="line">│                    数据采集层                         │</span><br><span class="line">│  客服工单 │ App 评论 │ 社交媒体 │ 群聊 │ 问卷 │ 邮件  │</span><br><span class="line">└────────────────────┬────────────────────────────────┘</span><br><span class="line">                     ↓</span><br><span class="line">┌─────────────────────────────────────────────────────┐</span><br><span class="line">│                  统一接入层（ETL）                     │</span><br><span class="line">│         格式标准化 → 去重 → 元数据标注                  │</span><br><span class="line">└────────────────────┬────────────────────────────────┘</span><br><span class="line">                     ↓</span><br><span class="line">┌─────────────────────────────────────────────────────┐</span><br><span class="line">│                AI 处理层（核心引擎）                    │</span><br><span class="line">│  意图识别 → 情感分析 → 主题聚类 → 需求提取 → 优先级     │</span><br><span class="line">└────────────────────┬────────────────────────────────┘</span><br><span class="line">                     ↓</span><br><span class="line">┌─────────────────────────────────────────────────────┐</span><br><span class="line">│                  输出与行动层                         │</span><br><span class="line">│   结构化 Backlog │ 告警通知 │ 周报 │ 趋势看板          │</span><br><span class="line">└─────────────────────────────────────────────────────┘</span><br></pre></td></tr></table></figure><p>接下来，我们逐层拆解。</p><h2 id="三、第一层：数据采集——把散落的声音收拢"><a href="#三、第一层：数据采集——把散落的声音收拢" class="headerlink" title="三、第一层：数据采集——把散落的声音收拢"></a>三、第一层：数据采集——把散落的声音收拢</h2><h3 id="3-1-梳理你的-VOC-来源"><a href="#3-1-梳理你的-VOC-来源" class="headerlink" title="3.1 梳理你的 VOC 来源"></a>3.1 梳理你的 VOC 来源</h3><p>先做一张表，列出所有用户反馈的来源：</p><p>来源</p><p>格式</p><p>频率</p><p>接入方式</p><p>客服工单系统（Zendesk&#x2F;钉钉工单）</p><p>结构化文本</p><p>实时</p><p>API Webhook</p><p>App Store &#x2F; Google Play 评论</p><p>短文本</p><p>每日</p><p>爬虫 &#x2F; API</p><p>企业微信 &#x2F; 钉钉客户群</p><p>聊天消息</p><p>实时</p><p>Bot 监听</p><p>NPS &#x2F; 满意度问卷</p><p>评分 + 文本</p><p>周期</p><p>Webhook</p><p>社交媒体（微博&#x2F;Twitter）</p><p>短文本</p><p>实时</p><p>关键词监控 API</p><p>销售 &#x2F; CSM 转述</p><p>非结构化文本</p><p>不定期</p><p>表单提交</p><p>邮件</p><p>长文本</p><p>不定期</p><p>邮件解析</p><h3 id="3-2-构建统一采集管道"><a href="#3-2-构建统一采集管道" class="headerlink" title="3.2 构建统一采集管道"></a>3.2 构建统一采集管道</h3><p>核心原则：<strong>不管来源是什么，最终都要变成一条标准化的记录。</strong></p><p>定义统一的 VOC 数据结构：</p><figure class="highlight json"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br></pre></td><td class="code"><pre><span class="line"><span class="punctuation">&#123;</span></span><br><span class="line">  <span class="attr">&quot;id&quot;</span><span class="punctuation">:</span> <span class="string">&quot;voc-20260331-001&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;source&quot;</span><span class="punctuation">:</span> <span class="string">&quot;zendesk&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;source_id&quot;</span><span class="punctuation">:</span> <span class="string">&quot;ticket-12345&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;timestamp&quot;</span><span class="punctuation">:</span> <span class="string">&quot;2026-03-31T10:30:00+08:00&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;customer&quot;</span><span class="punctuation">:</span> <span class="punctuation">&#123;</span></span><br><span class="line">    <span class="attr">&quot;id&quot;</span><span class="punctuation">:</span> <span class="string">&quot;cust-001&quot;</span><span class="punctuation">,</span></span><br><span class="line">    <span class="attr">&quot;name&quot;</span><span class="punctuation">:</span> <span class="string">&quot;张三&quot;</span><span class="punctuation">,</span></span><br><span class="line">    <span class="attr">&quot;tier&quot;</span><span class="punctuation">:</span> <span class="string">&quot;enterprise&quot;</span><span class="punctuation">,</span></span><br><span class="line">    <span class="attr">&quot;industry&quot;</span><span class="punctuation">:</span> <span class="string">&quot;金融&quot;</span></span><br><span class="line">  <span class="punctuation">&#125;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;content&quot;</span><span class="punctuation">:</span> <span class="punctuation">&#123;</span></span><br><span class="line">    <span class="attr">&quot;raw_text&quot;</span><span class="punctuation">:</span> <span class="string">&quot;你们的报表导出功能太慢了，每次导出 Excel 要等 3 分钟，我们财务部每天要导出 20 次...&quot;</span><span class="punctuation">,</span></span><br><span class="line">    <span class="attr">&quot;language&quot;</span><span class="punctuation">:</span> <span class="string">&quot;zh-CN&quot;</span></span><br><span class="line">  <span class="punctuation">&#125;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;metadata&quot;</span><span class="punctuation">:</span> <span class="punctuation">&#123;</span></span><br><span class="line">    <span class="attr">&quot;product&quot;</span><span class="punctuation">:</span> <span class="string">&quot;数据分析平台&quot;</span><span class="punctuation">,</span></span><br><span class="line">    <span class="attr">&quot;module&quot;</span><span class="punctuation">:</span> <span class="string">&quot;报表导出&quot;</span><span class="punctuation">,</span></span><br><span class="line">    <span class="attr">&quot;channel&quot;</span><span class="punctuation">:</span> <span class="string">&quot;工单&quot;</span></span><br><span class="line">  <span class="punctuation">&#125;</span></span><br><span class="line"><span class="punctuation">&#125;</span></span><br></pre></td></tr></table></figure><p><strong>实现方式选型：</strong></p><ul><li><strong>轻量级</strong>：用 deap &#x2F; Make（Integromat）搭 workflow，各渠道触发 → 统一写入数据库</li><li><strong>中等规模</strong>：用 Python + Celery 写采集 worker，消息队列（RabbitMQ&#x2F;Redis）做缓冲</li><li><strong>企业级</strong>：用 Kafka 做消息总线，各渠道 connector 独立部署</li></ul><p>对大多数团队，<strong>deap + PostgreSQL</strong> 就够了。别过度工程化。</p><h3 id="3-3-钉钉-企微群聊采集实战"><a href="#3-3-钉钉-企微群聊采集实战" class="headerlink" title="3.3 钉钉&#x2F;企微群聊采集实战"></a>3.3 钉钉&#x2F;企微群聊采集实战</h3><p>这是最容易被忽略、又最有价值的来源。客户在群里随口说的一句话，往往比正式工单更真实。</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 钉钉机器人监听群消息的简化示例</span></span><br><span class="line"><span class="keyword">from</span> dingtalk_stream <span class="keyword">import</span> AckMessage, ChatbotHandler</span><br><span class="line"></span><br><span class="line"><span class="keyword">class</span> <span class="title class_">VOCCollector</span>(<span class="title class_ inherited__">ChatbotHandler</span>):</span><br><span class="line">    <span class="keyword">async</span> <span class="keyword">def</span> <span class="title function_">process</span>(<span class="params">self, callback</span>):</span><br><span class="line">        message = callback.data</span><br><span class="line">        </span><br><span class="line">        <span class="comment"># 过滤：只采集客户消息，忽略内部员工</span></span><br><span class="line">        <span class="keyword">if</span> <span class="variable language_">self</span>.is_internal_user(message.sender_id):</span><br><span class="line">            <span class="keyword">return</span> AckMessage.STATUS_OK</span><br><span class="line">        </span><br><span class="line">        <span class="comment"># 标准化写入</span></span><br><span class="line">        voc_record = &#123;</span><br><span class="line">            <span class="string">&quot;source&quot;</span>: <span class="string">&quot;dingtalk_group&quot;</span>,</span><br><span class="line">            <span class="string">&quot;source_id&quot;</span>: message.message_id,</span><br><span class="line">            <span class="string">&quot;timestamp&quot;</span>: message.create_at,</span><br><span class="line">            <span class="string">&quot;content&quot;</span>: &#123;<span class="string">&quot;raw_text&quot;</span>: message.text.content&#125;,</span><br><span class="line">            <span class="string">&quot;metadata&quot;</span>: &#123;</span><br><span class="line">                <span class="string">&quot;group_id&quot;</span>: message.conversation_id,</span><br><span class="line">                <span class="string">&quot;group_name&quot;</span>: message.conversation_title</span><br><span class="line">            &#125;</span><br><span class="line">        &#125;</span><br><span class="line">        </span><br><span class="line">        <span class="keyword">await</span> <span class="variable language_">self</span>.save_to_db(voc_record)</span><br><span class="line">        <span class="keyword">return</span> AckMessage.STATUS_OK</span><br></pre></td></tr></table></figure><blockquote><p><strong>关键点</strong>：群聊消息噪音很大，不是每条都是”反馈”。别在采集层做过滤——先全量存下来，在 AI 处理层做识别。过早过滤会丢失有价值的弱信号。</p></blockquote><h2 id="四、第二层：AI-处理引擎——生产线的核心"><a href="#四、第二层：AI-处理引擎——生产线的核心" class="headerlink" title="四、第二层：AI 处理引擎——生产线的核心"></a>四、第二层：AI 处理引擎——生产线的核心</h2><p>这是整条流水线最关键的部分。我们要用 LLM 做一系列链式处理。</p><h3 id="4-1-第一步：反馈识别与过滤"><a href="#4-1-第一步：反馈识别与过滤" class="headerlink" title="4.1 第一步：反馈识别与过滤"></a>4.1 第一步：反馈识别与过滤</h3><p>不是所有消息都是反馈。先让 AI 判断：这条消息是不是一个有价值的用户反馈？</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br></pre></td><td class="code"><pre><span class="line">FILTER_PROMPT = <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">你是一个 VOC（用户声音）分析专家。判断以下消息是否包含有价值的产品反馈。</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">有价值的反馈包括：功能建议、Bug 报告、使用困难、体验抱怨、竞品对比、流失预警。</span></span><br><span class="line"><span class="string">无价值的包括：闲聊、问好、纯操作指令、已有答案的咨询。</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">消息内容：</span></span><br><span class="line"><span class="string">&#123;message&#125;</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">请用 JSON 返回：</span></span><br><span class="line"><span class="string">&#123;</span></span><br><span class="line"><span class="string">  &quot;is_feedback&quot;: true/false,</span></span><br><span class="line"><span class="string">  &quot;confidence&quot;: 0.0-1.0,</span></span><br><span class="line"><span class="string">  &quot;reason&quot;: &quot;简要说明&quot;</span></span><br><span class="line"><span class="string">&#125;</span></span><br><span class="line"><span class="string">&quot;&quot;&quot;</span></span><br></pre></td></tr></table></figure><h3 id="4-2-第二步：多维度结构化提取"><a href="#4-2-第二步：多维度结构化提取" class="headerlink" title="4.2 第二步：多维度结构化提取"></a>4.2 第二步：多维度结构化提取</h3><p>对识别为反馈的消息，做深度提取：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br></pre></td><td class="code"><pre><span class="line">EXTRACT_PROMPT = <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">分析以下用户反馈，提取结构化信息：</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">反馈内容：&#123;feedback&#125;</span></span><br><span class="line"><span class="string">客户信息：&#123;customer_context&#125;</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">请返回 JSON：</span></span><br><span class="line"><span class="string">&#123;</span></span><br><span class="line"><span class="string">  &quot;intent&quot;: &quot;feature_request|bug_report|usability_issue|performance|churn_risk|praise&quot;,</span></span><br><span class="line"><span class="string">  &quot;sentiment&quot;: &quot;positive|neutral|negative|urgent&quot;,</span></span><br><span class="line"><span class="string">  &quot;severity&quot;: 1-5,</span></span><br><span class="line"><span class="string">  &quot;product_area&quot;: &quot;具体功能模块&quot;,</span></span><br><span class="line"><span class="string">  &quot;summary&quot;: &quot;一句话概括&quot;,</span></span><br><span class="line"><span class="string">  &quot;user_pain&quot;: &quot;用户真正的痛点是什么&quot;,</span></span><br><span class="line"><span class="string">  &quot;desired_outcome&quot;: &quot;用户期望的结果&quot;,</span></span><br><span class="line"><span class="string">  &quot;frequency_hint&quot;: &quot;这个问题出现频率的线索&quot;,</span></span><br><span class="line"><span class="string">  &quot;business_impact&quot;: &quot;对客户业务的影响&quot;,</span></span><br><span class="line"><span class="string">  &quot;tags&quot;: [&quot;标签1&quot;, &quot;标签2&quot;]</span></span><br><span class="line"><span class="string">&#125;</span></span><br><span class="line"><span class="string">&quot;&quot;&quot;</span></span><br></pre></td></tr></table></figure><blockquote><p><strong>设计要点</strong>：注意 <code>user_pain</code> 和 <code>desired_outcome</code> 两个字段。用户说的不一定是他要的。“导出太慢”的背后，也许是”我需要定时自动推送报表到邮箱”。让 AI 去挖一层。</p></blockquote><h3 id="4-3-第三步：聚类与去重"><a href="#4-3-第三步：聚类与去重" class="headerlink" title="4.3 第三步：聚类与去重"></a>4.3 第三步：聚类与去重</h3><p>单条反馈价值有限，100 条类似反馈汇聚在一起，就是一个必须解决的需求。</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">import</span> numpy <span class="keyword">as</span> np</span><br><span class="line"><span class="keyword">from</span> sklearn.cluster <span class="keyword">import</span> DBSCAN</span><br><span class="line"></span><br><span class="line"><span class="keyword">async</span> <span class="keyword">def</span> <span class="title function_">cluster_feedbacks</span>(<span class="params">feedbacks, embeddings_model</span>):</span><br><span class="line">    <span class="comment"># 1. 生成 embedding</span></span><br><span class="line">    texts = [f[<span class="string">&quot;summary&quot;</span>] + <span class="string">&quot; &quot;</span> + f[<span class="string">&quot;user_pain&quot;</span>] <span class="keyword">for</span> f <span class="keyword">in</span> feedbacks]</span><br><span class="line">    embeddings = <span class="keyword">await</span> embeddings_model.encode(texts)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 2. DBSCAN 聚类（不需要预设簇数）</span></span><br><span class="line">    clustering = DBSCAN(eps=<span class="number">0.3</span>, min_samples=<span class="number">3</span>, metric=<span class="string">&#x27;cosine&#x27;</span>)</span><br><span class="line">    labels = clustering.fit_predict(embeddings)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 3. 为每个簇生成主题摘要</span></span><br><span class="line">    clusters = &#123;&#125;</span><br><span class="line">    <span class="keyword">for</span> i, label <span class="keyword">in</span> <span class="built_in">enumerate</span>(labels):</span><br><span class="line">        <span class="keyword">if</span> label == -<span class="number">1</span>:  <span class="comment"># 噪音点，单独处理</span></span><br><span class="line">            <span class="keyword">continue</span></span><br><span class="line">        <span class="keyword">if</span> label <span class="keyword">not</span> <span class="keyword">in</span> clusters:</span><br><span class="line">            clusters[label] = []</span><br><span class="line">        clusters[label].append(feedbacks[i])</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 4. 用 LLM 为每个簇生成结构化需求</span></span><br><span class="line">    <span class="keyword">for</span> label, items <span class="keyword">in</span> clusters.items():</span><br><span class="line">        cluster_summary = <span class="keyword">await</span> generate_cluster_summary(items)</span><br><span class="line">        clusters[label] = &#123;</span><br><span class="line">            <span class="string">&quot;feedbacks&quot;</span>: items,</span><br><span class="line">            <span class="string">&quot;count&quot;</span>: <span class="built_in">len</span>(items),</span><br><span class="line">            <span class="string">&quot;summary&quot;</span>: cluster_summary</span><br><span class="line">        &#125;</span><br><span class="line">    </span><br><span class="line">    <span class="keyword">return</span> clusters</span><br></pre></td></tr></table></figure><h3 id="4-4-第四步：优先级评分"><a href="#4-4-第四步：优先级评分" class="headerlink" title="4.4 第四步：优先级评分"></a>4.4 第四步：优先级评分</h3><p>聚类后，用一个评分模型来排优先级：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">def</span> <span class="title function_">calculate_priority</span>(<span class="params">cluster</span>):</span><br><span class="line">    <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">    优先级 = 频次权重 × 严重性 × 客户价值 × 时效性</span></span><br><span class="line"><span class="string">    &quot;&quot;&quot;</span></span><br><span class="line">    <span class="comment"># 频次：同类反馈数量</span></span><br><span class="line">    freq_score = <span class="built_in">min</span>(cluster[<span class="string">&quot;count&quot;</span>] / <span class="number">10</span>, <span class="number">1.0</span>) * <span class="number">30</span></span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 严重性：平均 severity</span></span><br><span class="line">    severity_score = np.mean([f[<span class="string">&quot;severity&quot;</span>] <span class="keyword">for</span> f <span class="keyword">in</span> cluster[<span class="string">&quot;feedbacks&quot;</span>]]) * <span class="number">20</span></span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 客户价值：涉及大客户加权</span></span><br><span class="line">    enterprise_count = <span class="built_in">sum</span>(<span class="number">1</span> <span class="keyword">for</span> f <span class="keyword">in</span> cluster[<span class="string">&quot;feedbacks&quot;</span>] </span><br><span class="line">                          <span class="keyword">if</span> f[<span class="string">&quot;customer&quot;</span>][<span class="string">&quot;tier&quot;</span>] == <span class="string">&quot;enterprise&quot;</span>)</span><br><span class="line">    value_score = <span class="built_in">min</span>(enterprise_count / <span class="number">3</span>, <span class="number">1.0</span>) * <span class="number">30</span></span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 时效性：最近 7 天的反馈占比</span></span><br><span class="line">    recent = <span class="built_in">sum</span>(<span class="number">1</span> <span class="keyword">for</span> f <span class="keyword">in</span> cluster[<span class="string">&quot;feedbacks&quot;</span>] </span><br><span class="line">                 <span class="keyword">if</span> f[<span class="string">&quot;age_days&quot;</span>] &lt;= <span class="number">7</span>)</span><br><span class="line">    recency_score = (recent / cluster[<span class="string">&quot;count&quot;</span>]) * <span class="number">20</span></span><br><span class="line">    </span><br><span class="line">    <span class="keyword">return</span> freq_score + severity_score + value_score + recency_score</span><br></pre></td></tr></table></figure><blockquote><p><strong>不要让 AI 直接打优先级分数。</strong> AI 不知道你的商业上下文。用 AI 提取维度，用规则做评分。这样可解释、可调优。</p></blockquote><h2 id="五、第三层：输出与行动——让生产线产出真正的成果"><a href="#五、第三层：输出与行动——让生产线产出真正的成果" class="headerlink" title="五、第三层：输出与行动——让生产线产出真正的成果"></a>五、第三层：输出与行动——让生产线产出真正的成果</h2><p>处理完的数据如果只是躺在数据库里，和之前躺在 Excel 里没有本质区别。关键是<strong>触发行动</strong>。</p><h3 id="5-1-自动生成-Backlog-Item"><a href="#5-1-自动生成-Backlog-Item" class="headerlink" title="5.1 自动生成 Backlog Item"></a>5.1 自动生成 Backlog Item</h3><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br></pre></td><td class="code"><pre><span class="line">BACKLOG_PROMPT = <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">基于以下聚类分析结果，生成一个产品需求 Backlog 条目。</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">聚类主题：&#123;cluster_summary&#125;</span></span><br><span class="line"><span class="string">相关反馈数量：&#123;count&#125;</span></span><br><span class="line"><span class="string">优先级得分：&#123;priority_score&#125;</span></span><br><span class="line"><span class="string">代表性原始反馈：</span></span><br><span class="line"><span class="string">&#123;sample_feedbacks&#125;</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">请生成：</span></span><br><span class="line"><span class="string">&#123;</span></span><br><span class="line"><span class="string">  &quot;title&quot;: &quot;需求标题（简洁、可执行）&quot;,</span></span><br><span class="line"><span class="string">  &quot;description&quot;: &quot;需求描述&quot;,</span></span><br><span class="line"><span class="string">  &quot;user_stories&quot;: [&quot;作为...我希望...以便于...&quot;],</span></span><br><span class="line"><span class="string">  &quot;acceptance_criteria&quot;: [&quot;验收标准1&quot;, &quot;验收标准2&quot;],</span></span><br><span class="line"><span class="string">  &quot;priority&quot;: &quot;P0|P1|P2|P3&quot;,</span></span><br><span class="line"><span class="string">  &quot;estimated_impact&quot;: &quot;影响评估&quot;,</span></span><br><span class="line"><span class="string">  &quot;evidence&quot;: &quot;数据支撑（反馈数、客户分布等）&quot;,</span></span><br><span class="line"><span class="string">  &quot;source_feedback_ids&quot;: [&quot;id1&quot;, &quot;id2&quot;]</span></span><br><span class="line"><span class="string">&#125;</span></span><br><span class="line"><span class="string">&quot;&quot;&quot;</span></span><br></pre></td></tr></table></figure><p>然后通过 API 自动写入你的项目管理工具：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">async</span> <span class="keyword">def</span> <span class="title function_">create_backlog_item</span>(<span class="params">item, tool=<span class="string">&quot;jira&quot;</span></span>):</span><br><span class="line">    <span class="keyword">if</span> tool == <span class="string">&quot;jira&quot;</span>:</span><br><span class="line">        <span class="keyword">await</span> jira_client.create_issue(</span><br><span class="line">            project=<span class="string">&quot;PROD&quot;</span>,</span><br><span class="line">            issue_type=<span class="string">&quot;Story&quot;</span>,</span><br><span class="line">            summary=item[<span class="string">&quot;title&quot;</span>],</span><br><span class="line">            description=format_jira_description(item),</span><br><span class="line">            priority=item[<span class="string">&quot;priority&quot;</span>],</span><br><span class="line">            labels=[<span class="string">&quot;voc-auto-generated&quot;</span>]</span><br><span class="line">        )</span><br><span class="line">    <span class="keyword">elif</span> tool == <span class="string">&quot;linear&quot;</span>:</span><br><span class="line">        <span class="keyword">await</span> linear_client.create_issue(...)</span><br><span class="line">    <span class="keyword">elif</span> tool == <span class="string">&quot;dingtalk&quot;</span>:</span><br><span class="line">        <span class="keyword">await</span> dingtalk_client.create_task(...)</span><br></pre></td></tr></table></figure><h3 id="5-2-实时告警：关键信号不等周报"><a href="#5-2-实时告警：关键信号不等周报" class="headerlink" title="5.2 实时告警：关键信号不等周报"></a>5.2 实时告警：关键信号不等周报</h3><p>某些反馈不能等。定义告警规则：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br></pre></td><td class="code"><pre><span class="line">ALERT_RULES = [</span><br><span class="line">    &#123;</span><br><span class="line">        <span class="string">&quot;name&quot;</span>: <span class="string">&quot;churn_risk&quot;</span>,</span><br><span class="line">        <span class="string">&quot;condition&quot;</span>: <span class="keyword">lambda</span> f: f[<span class="string">&quot;intent&quot;</span>] == <span class="string">&quot;churn_risk&quot;</span> <span class="keyword">and</span> f[<span class="string">&quot;customer&quot;</span>][<span class="string">&quot;tier&quot;</span>] == <span class="string">&quot;enterprise&quot;</span>,</span><br><span class="line">        <span class="string">&quot;channel&quot;</span>: <span class="string">&quot;dingtalk_urgent&quot;</span>,</span><br><span class="line">        <span class="string">&quot;message_template&quot;</span>: <span class="string">&quot;⚠️ 流失预警：&#123;customer_name&#125;（&#123;industry&#125;）表示：&#123;summary&#125;&quot;</span></span><br><span class="line">    &#125;,</span><br><span class="line">    &#123;</span><br><span class="line">        <span class="string">&quot;name&quot;</span>: <span class="string">&quot;critical_bug&quot;</span>,</span><br><span class="line">        <span class="string">&quot;condition&quot;</span>: <span class="keyword">lambda</span> f: f[<span class="string">&quot;intent&quot;</span>] == <span class="string">&quot;bug_report&quot;</span> <span class="keyword">and</span> f[<span class="string">&quot;severity&quot;</span>] &gt;= <span class="number">4</span>,</span><br><span class="line">        <span class="string">&quot;channel&quot;</span>: <span class="string">&quot;oncall_group&quot;</span>,</span><br><span class="line">        <span class="string">&quot;message_template&quot;</span>: <span class="string">&quot;🔴 严重 Bug 反馈：&#123;summary&#125;（来自 &#123;customer_name&#125;）&quot;</span></span><br><span class="line">    &#125;,</span><br><span class="line">    &#123;</span><br><span class="line">        <span class="string">&quot;name&quot;</span>: <span class="string">&quot;trending_spike&quot;</span>,</span><br><span class="line">        <span class="string">&quot;condition&quot;</span>: <span class="keyword">lambda</span> cluster: cluster[<span class="string">&quot;count&quot;</span>] &gt;= <span class="number">20</span> <span class="keyword">and</span> cluster[<span class="string">&quot;age_hours&quot;</span>] &lt;= <span class="number">24</span>,</span><br><span class="line">        <span class="string">&quot;channel&quot;</span>: <span class="string">&quot;product_team&quot;</span>,</span><br><span class="line">        <span class="string">&quot;message_template&quot;</span>: <span class="string">&quot;📈 反馈激增：&#123;summary&#125;（24h 内 &#123;count&#125; 条）&quot;</span></span><br><span class="line">    &#125;</span><br><span class="line">]</span><br></pre></td></tr></table></figure><h3 id="5-3-周报与趋势看板"><a href="#5-3-周报与趋势看板" class="headerlink" title="5.3 周报与趋势看板"></a>5.3 周报与趋势看板</h3><p>每周自动生成 VOC 分析报告：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br></pre></td><td class="code"><pre><span class="line">WEEKLY_REPORT_PROMPT = <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">基于本周的 VOC 数据，生成周报：</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">本周数据概览：</span></span><br><span class="line"><span class="string">- 总反馈数：&#123;total&#125;</span></span><br><span class="line"><span class="string">- 新增聚类主题：&#123;new_clusters&#125;</span></span><br><span class="line"><span class="string">- Top 5 主题及数量：&#123;top_themes&#125;</span></span><br><span class="line"><span class="string">- 情感分布：&#123;sentiment_dist&#125;</span></span><br><span class="line"><span class="string">- 与上周对比变化：&#123;week_over_week&#125;</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">请生成一份结构清晰的周报，包含：</span></span><br><span class="line"><span class="string">1. 本周关键发现（3-5 条）</span></span><br><span class="line"><span class="string">2. 需要立即关注的问题</span></span><br><span class="line"><span class="string">3. 正面反馈亮点</span></span><br><span class="line"><span class="string">4. 趋势变化分析</span></span><br><span class="line"><span class="string">5. 建议行动项</span></span><br><span class="line"><span class="string">&quot;&quot;&quot;</span></span><br></pre></td></tr></table></figure><h2 id="六、实战部署：一个最小可用版本"><a href="#六、实战部署：一个最小可用版本" class="headerlink" title="六、实战部署：一个最小可用版本"></a>六、实战部署：一个最小可用版本</h2><p>说了这么多架构，给一个能跑起来的最小版本。</p><h3 id="6-1-技术栈"><a href="#6-1-技术栈" class="headerlink" title="6.1 技术栈"></a>6.1 技术栈</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br></pre></td><td class="code"><pre><span class="line">采集层：deap（workflow 自动化） + PostgreSQL</span><br><span class="line">处理层：Python + LLM API（OpenAI / Claude / 通义千问）</span><br><span class="line">输出层：钉钉多维表格 / Notion API / 钉钉机器人通知</span><br><span class="line">调度：Cron（每小时处理一批）</span><br></pre></td></tr></table></figure><h3 id="6-2-核心处理流程（可直接运行的伪代码）"><a href="#6-2-核心处理流程（可直接运行的伪代码）" class="headerlink" title="6.2 核心处理流程（可直接运行的伪代码）"></a>6.2 核心处理流程（可直接运行的伪代码）</h3><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br><span class="line">36</span><br><span class="line">37</span><br><span class="line">38</span><br><span class="line">39</span><br><span class="line">40</span><br><span class="line">41</span><br><span class="line">42</span><br><span class="line">43</span><br><span class="line">44</span><br><span class="line">45</span><br><span class="line">46</span><br><span class="line">47</span><br><span class="line">48</span><br><span class="line">49</span><br><span class="line">50</span><br><span class="line">51</span><br><span class="line">52</span><br><span class="line">53</span><br><span class="line">54</span><br><span class="line">55</span><br><span class="line">56</span><br><span class="line">57</span><br><span class="line">58</span><br><span class="line">59</span><br><span class="line">60</span><br><span class="line">61</span><br><span class="line">62</span><br><span class="line">63</span><br><span class="line">64</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">import</span> asyncio</span><br><span class="line"><span class="keyword">from</span> datetime <span class="keyword">import</span> datetime, timedelta</span><br><span class="line"></span><br><span class="line"><span class="keyword">async</span> <span class="keyword">def</span> <span class="title function_">voc_pipeline</span>():</span><br><span class="line">    <span class="string">&quot;&quot;&quot;VOC 自动化生产线 - 主流程&quot;&quot;&quot;</span></span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 1. 拉取未处理的原始反馈</span></span><br><span class="line">    raw_feedbacks = <span class="keyword">await</span> db.query(</span><br><span class="line">        <span class="string">&quot;SELECT * FROM voc_raw WHERE processed = false ORDER BY timestamp&quot;</span></span><br><span class="line">    )</span><br><span class="line">    <span class="built_in">print</span>(<span class="string">f&quot;待处理反馈：<span class="subst">&#123;<span class="built_in">len</span>(raw_feedbacks)&#125;</span> 条&quot;</span>)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 2. AI 过滤：识别有价值的反馈</span></span><br><span class="line">    valid_feedbacks = []</span><br><span class="line">    <span class="keyword">for</span> batch <span class="keyword">in</span> chunks(raw_feedbacks, <span class="number">20</span>):  <span class="comment"># 批量处理，省 token</span></span><br><span class="line">        results = <span class="keyword">await</span> llm.batch_classify(batch, FILTER_PROMPT)</span><br><span class="line">        valid_feedbacks.extend(</span><br><span class="line">            [f <span class="keyword">for</span> f, r <span class="keyword">in</span> <span class="built_in">zip</span>(batch, results) <span class="keyword">if</span> r[<span class="string">&quot;is_feedback&quot;</span>]]</span><br><span class="line">        )</span><br><span class="line">    <span class="built_in">print</span>(<span class="string">f&quot;有效反馈：<span class="subst">&#123;<span class="built_in">len</span>(valid_feedbacks)&#125;</span> 条&quot;</span>)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 3. AI 提取：结构化分析</span></span><br><span class="line">    structured = []</span><br><span class="line">    <span class="keyword">for</span> batch <span class="keyword">in</span> chunks(valid_feedbacks, <span class="number">10</span>):</span><br><span class="line">        extracted = <span class="keyword">await</span> llm.batch_extract(batch, EXTRACT_PROMPT)</span><br><span class="line">        structured.extend(extracted)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 4. 实时告警检查</span></span><br><span class="line">    <span class="keyword">for</span> item <span class="keyword">in</span> structured:</span><br><span class="line">        <span class="keyword">await</span> check_and_alert(item, ALERT_RULES)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 5. 写入已处理表</span></span><br><span class="line">    <span class="keyword">await</span> db.bulk_insert(<span class="string">&quot;voc_processed&quot;</span>, structured)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 6. 每天执行一次聚类 + Backlog 生成</span></span><br><span class="line">    <span class="keyword">if</span> should_run_daily():</span><br><span class="line">        recent = <span class="keyword">await</span> db.query(</span><br><span class="line">            <span class="string">&quot;SELECT * FROM voc_processed WHERE timestamp &gt; NOW() - INTERVAL &#x27;30 days&#x27;&quot;</span></span><br><span class="line">        )</span><br><span class="line">        clusters = <span class="keyword">await</span> cluster_feedbacks(recent)</span><br><span class="line">        </span><br><span class="line">        <span class="keyword">for</span> cluster <span class="keyword">in</span> clusters.values():</span><br><span class="line">            cluster[<span class="string">&quot;priority&quot;</span>] = calculate_priority(cluster)</span><br><span class="line">        </span><br><span class="line">        <span class="comment"># 按优先级排序，Top N 生成 Backlog</span></span><br><span class="line">        top_clusters = <span class="built_in">sorted</span>(clusters.values(), </span><br><span class="line">                            key=<span class="keyword">lambda</span> c: c[<span class="string">&quot;priority&quot;</span>], reverse=<span class="literal">True</span>)[:<span class="number">10</span>]</span><br><span class="line">        </span><br><span class="line">        <span class="keyword">for</span> cluster <span class="keyword">in</span> top_clusters:</span><br><span class="line">            <span class="keyword">if</span> <span class="keyword">not</span> <span class="keyword">await</span> backlog_exists(cluster):</span><br><span class="line">                backlog_item = <span class="keyword">await</span> llm.generate(BACKLOG_PROMPT, cluster)</span><br><span class="line">                <span class="keyword">await</span> create_backlog_item(backlog_item)</span><br><span class="line">                <span class="built_in">print</span>(<span class="string">f&quot;已创建 Backlog：<span class="subst">&#123;backlog_item[<span class="string">&#x27;title&#x27;</span>]&#125;</span>&quot;</span>)</span><br><span class="line">    </span><br><span class="line">    <span class="comment"># 7. 标记已处理</span></span><br><span class="line">    <span class="keyword">await</span> db.update(</span><br><span class="line">        <span class="string">&quot;voc_raw&quot;</span>, </span><br><span class="line">        &#123;<span class="string">&quot;processed&quot;</span>: <span class="literal">True</span>&#125;, </span><br><span class="line">        &#123;<span class="string">&quot;id__in&quot;</span>: [f[<span class="string">&quot;id&quot;</span>] <span class="keyword">for</span> f <span class="keyword">in</span> raw_feedbacks]&#125;</span><br><span class="line">    )</span><br><span class="line"></span><br><span class="line"><span class="comment"># 入口</span></span><br><span class="line"><span class="keyword">if</span> __name__ == <span class="string">&quot;__main__&quot;</span>:</span><br><span class="line">    asyncio.run(voc_pipeline())</span><br></pre></td></tr></table></figure><h3 id="6-3-成本估算"><a href="#6-3-成本估算" class="headerlink" title="6.3 成本估算"></a>6.3 成本估算</h3><p>以日均 500 条反馈为例：</p><p>环节</p><p>Token 消耗</p><p>月成本（GPT-4o）</p><p>过滤</p><p>~200 token&#x2F;条</p><p>~$15</p><p>提取</p><p>~500 token&#x2F;条（有效反馈约 200 条）</p><p>~$20</p><p>聚类摘要</p><p>~1000 token&#x2F;簇 × 30 簇&#x2F;天</p><p>~$10</p><p>Backlog 生成</p><p>~800 token&#x2F;条 × 10 条&#x2F;天</p><p>~$5</p><p>周报</p><p>~2000 token × 4 次</p><p>~$1</p><p><strong>合计</strong></p><p><strong>~$51&#x2F;月</strong></p><p>一个产品经理的月薪够这条流水线跑多少年？</p><h2 id="七、避坑指南：我踩过的坑"><a href="#七、避坑指南：我踩过的坑" class="headerlink" title="七、避坑指南：我踩过的坑"></a>七、避坑指南：我踩过的坑</h2><h3 id="坑-1：一上来就追求完美"><a href="#坑-1：一上来就追求完美" class="headerlink" title="坑 1：一上来就追求完美"></a>坑 1：一上来就追求完美</h3><p><strong>错误</strong>：花三个月设计了一套完美架构，上线后发现用户反馈的表达方式和预想完全不同。</p><p><strong>正确</strong>：先用最简单的方式跑起来（哪怕是 Python 脚本 + CSV），用真实数据验证 prompt 效果，再逐步工程化。</p><h3 id="坑-2：让-AI-做所有决策"><a href="#坑-2：让-AI-做所有决策" class="headerlink" title="坑 2：让 AI 做所有决策"></a>坑 2：让 AI 做所有决策</h3><p><strong>错误</strong>：让 LLM 直接输出最终优先级和产品决策。</p><p><strong>正确</strong>：AI 做提取和分析，人做决策。生产线的输出是”决策素材”，不是”决策本身”。产品经理的时间应该花在判断上，而不是整理上。</p><h3 id="坑-3：忽略反馈闭环"><a href="#坑-3：忽略反馈闭环" class="headerlink" title="坑 3：忽略反馈闭环"></a>坑 3：忽略反馈闭环</h3><p><strong>错误</strong>：只做了从反馈到 Backlog 的单向流。</p><p><strong>正确</strong>：当一个需求上线后，回溯到原始反馈，通知对应客户”你反馈的问题我们解决了”。这才是完整的闭环。</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 需求上线后的闭环通知</span></span><br><span class="line"><span class="keyword">async</span> <span class="keyword">def</span> <span class="title function_">notify_feedback_resolved</span>(<span class="params">backlog_item</span>):</span><br><span class="line">    source_ids = backlog_item[<span class="string">&quot;source_feedback_ids&quot;</span>]</span><br><span class="line">    feedbacks = <span class="keyword">await</span> db.query(</span><br><span class="line">        <span class="string">&quot;SELECT * FROM voc_processed WHERE id = ANY($1)&quot;</span>, source_ids</span><br><span class="line">    )</span><br><span class="line">    </span><br><span class="line">    <span class="keyword">for</span> feedback <span class="keyword">in</span> feedbacks:</span><br><span class="line">        <span class="keyword">await</span> notification.send(</span><br><span class="line">            channel=feedback[<span class="string">&quot;source&quot;</span>],</span><br><span class="line">            customer=feedback[<span class="string">&quot;customer&quot;</span>],</span><br><span class="line">            message=<span class="string">f&quot;您之前反馈的「<span class="subst">&#123;feedback[<span class="string">&#x27;summary&#x27;</span>]&#125;</span>」已在最新版本中改进，感谢您的建议！&quot;</span></span><br><span class="line">        )</span><br></pre></td></tr></table></figure><h3 id="坑-4：不做质量监控"><a href="#坑-4：不做质量监控" class="headerlink" title="坑 4：不做质量监控"></a>坑 4：不做质量监控</h3><p><strong>错误</strong>：上线后不管了，以为 AI 会一直准确。</p><p><strong>正确</strong>：定期抽样检查 AI 的分类准确率。设一个 dashboard，监控关键指标：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">QUALITY_METRICS = &#123;</span><br><span class="line">    <span class="string">&quot;filter_precision&quot;</span>: <span class="string">&quot;被标记为反馈的消息中，真正是反馈的比例&quot;</span>,</span><br><span class="line">    <span class="string">&quot;filter_recall&quot;</span>: <span class="string">&quot;所有真实反馈中，被正确识别的比例&quot;</span>,</span><br><span class="line">    <span class="string">&quot;extraction_accuracy&quot;</span>: <span class="string">&quot;提取的结构化信息与人工标注的一致性&quot;</span>,</span><br><span class="line">    <span class="string">&quot;cluster_coherence&quot;</span>: <span class="string">&quot;同一聚类内反馈的相关性评分&quot;</span></span><br><span class="line">&#125;</span><br></pre></td></tr></table></figure><h2 id="八、进阶方向：从生产线到智能工厂"><a href="#八、进阶方向：从生产线到智能工厂" class="headerlink" title="八、进阶方向：从生产线到智能工厂"></a>八、进阶方向：从生产线到智能工厂</h2><p>当基础流水线跑通后，可以往这几个方向演进：</p><h3 id="8-1-预测性分析"><a href="#8-1-预测性分析" class="headerlink" title="8.1 预测性分析"></a>8.1 预测性分析</h3><p>不只分析已有反馈，预测未来可能出现的问题：</p><ul><li>某个功能的负面反馈趋势在上升 → 提前排查</li><li>新版本上线后，某类反馈突增 → 自动关联到发版变更</li></ul><h3 id="8-2-跨源关联"><a href="#8-2-跨源关联" class="headerlink" title="8.2 跨源关联"></a>8.2 跨源关联</h3><p>把 VOC 数据和其他数据源关联：</p><ul><li>VOC + 使用数据 → 发现”用户抱怨但实际使用量很高”的功能（痛点但刚需）</li><li>VOC + 流失数据 → 哪些类型的反馈是流失前兆</li><li>VOC + 竞品监控 → 用户提到竞品的上下文分析</li></ul><h3 id="8-3-自动化-A-B-验证"><a href="#8-3-自动化-A-B-验证" class="headerlink" title="8.3 自动化 A&#x2F;B 验证"></a>8.3 自动化 A&#x2F;B 验证</h3><p>需求上线后，自动对比相关 VOC 指标变化：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">上线前：「导出太慢」相关反馈 → 45 条/月</span><br><span class="line">上线后：「导出太慢」相关反馈 → 3 条/月</span><br><span class="line">自动结论：该需求有效解决了用户痛点 ✅</span><br></pre></td></tr></table></figure><h2 id="九、总结：VOC-生产线的核心理念"><a href="#九、总结：VOC-生产线的核心理念" class="headerlink" title="九、总结：VOC 生产线的核心理念"></a>九、总结：VOC 生产线的核心理念</h2><p>传统做法</p><p>自动化生产线</p><p>人工收集</p><p>多渠道自动采集</p><p>人工阅读</p><p>AI 批量理解</p><p>主观分类</p><p>结构化提取 + 向量聚类</p><p>拍脑袋排优先级</p><p>数据驱动的多维评分</p><p>Excel 汇报</p><p>实时看板 + 自动告警</p><p>反馈石沉大海</p><p>闭环通知用户</p><p>整条生产线的设计哲学是：<strong>让人做人擅长的事（判断、决策、创意），让机器做机器擅长的事（收集、整理、分析、通知）。</strong></p><p>VOC 不应该是一个季度做一次的”用户调研项目”，它应该是一条 7×24 小时运转的生产线——永远在倾听，永远在消化，永远在输出可执行的洞察。</p><p>当你的产品团队每天早上打开电脑，看到的不是 500 条原始反馈，而是 5 条结构清晰、证据充分、带有优先级的产品建议时——<strong>你就知道这条生产线值了。</strong></p><hr><p><em>如果你正在构建类似的系统，欢迎交流。把用户的声音认真对待，是对用户最好的尊重。</em></p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/voc/">VOC</a>  <a href="https://hugozhu.site/tags/automation/">automation</a>  <a href="https://hugozhu.site/tags/product/">product</a>  <a href="https://hugozhu.site/tags/agent/">agent</a>  <a href="https://hugozhu.site/tags/enterprise/">enterprise</a>  <a href="https://hugozhu.site/tags/tutorial/">tutorial</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></li><li>[同一</li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/31/2026-03-31-%E5%88%AB%E5%86%8D%E6%89%8B%E5%8A%A8%E6%95%B4%E7%90%86%E7%94%A8%E6%88%B7%E5%8F%8D%E9%A6%88%E4%BA%86-%E6%8A%8A-VOC-%E5%8F%98%E6%88%90%E4%B8%80%E6%9D%A1%E8%87%AA%E5%8A%A8%E5%8C%96%E7%94%9F%E4%BA%A7%E7%BA%BF/</id>
    <link href="https://www.coconut.xin/2026/03/31/2026-03-31-%E5%88%AB%E5%86%8D%E6%89%8B%E5%8A%A8%E6%95%B4%E7%90%86%E7%94%A8%E6%88%B7%E5%8F%8D%E9%A6%88%E4%BA%86-%E6%8A%8A-VOC-%E5%8F%98%E6%88%90%E4%B8%80%E6%9D%A1%E8%87%AA%E5%8A%A8%E5%8C%96%E7%94%9F%E4%BA%A7%E7%BA%BF/"/>
    <published>2026-03-31T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E5%85%88%E6%90%9E%E6%B8%85%E6%A5%]]>
    </summary>
    <title>别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</title>
    <updated>2026-04-01T02:01:44.496Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E4%B8%BA%E4%BB%80%E4%B9%88%E9%80%9A%E7%94%A8-benchmark-%E5%9C%A8-agent-%E8%AF%84%E6%B5%8B%E4%B8%AD%E5%A4%B1%E6%95%88">一、为什么通用 Benchmark 在 Agent 评测中失效</a></li><li><a href="#%E4%BA%8C%E5%88%86%E5%B1%82%E8%AF%84%E6%B5%8B%E6%A1%86%E6%9E%B6%E4%BB%8E%E9%80%9A%E7%94%A8%E5%88%B0%E8%A1%8C%E4%B8%9A%E5%88%B0%E5%B2%97%E4%BD%8D">二、分层评测框架：从通用到行业到岗位</a><ul><li><a href="#l1%E9%80%9A%E7%94%A8%E8%83%BD%E5%8A%9B%E5%B1%82agent-%E7%9A%84%E5%9F%BA%E6%9C%AC%E5%8A%9F">L1：通用能力层——Agent 的基本功</a></li><li><a href="#l2%E8%A1%8C%E4%B8%9A%E7%BA%A7%E8%AF%84%E6%B5%8B%E9%A2%86%E5%9F%9F%E7%9F%A5%E8%AF%86%E4%B8%8E%E5%90%88%E8%A7%84%E6%80%A7">L2：行业级评测——领域知识与合规性</a></li><li><a href="#l3%E5%B2%97%E4%BD%8D%E7%BA%A7%E8%AF%84%E6%B5%8B%E7%9C%9F%E5%AE%9E%E5%B7%A5%E4%BD%9C%E5%9C%BA%E6%99%AF%E7%9A%84%E4%BB%BB%E5%8A%A1%E5%AE%8C%E6%88%90%E5%BA%A6">L3：岗位级评测——真实工作场景的任务完成度</a></li></ul></li><li><a href="#%E4%B8%89%E4%B8%83%E4%B8%AA%E5%B2%97%E4%BD%8D%E7%9A%84%E8%AF%84%E6%B5%8B%E7%BB%B4%E5%BA%A6%E9%80%9F%E6%9F%A5%E8%A1%A8">三、七个岗位的评测维度速查表</a><ul><li><a href="#1-%E5%AE%A2%E6%9C%8D%E4%B8%93%E5%91%98">1. 客服专员</a></li><li><a href="#2-%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E5%B8%88">2. 数据分析师</a></li><li><a href="#3-%E5%86%85%E5%AE%B9%E8%BF%90%E8%90%A5">3. 内容运营</a></li><li><a href="#4-%E6%B3%95%E5%8A%A1%E4%B8%93%E5%91%98">4. 法务专员</a></li><li><a href="#5-hr-%E6%8B%9B%E8%81%98%E4%B8%93%E5%91%98">5. HR 招聘专员</a></li><li><a href="#6-%E8%B4%A2%E5%8A%A1%E5%88%86%E6%9E%90%E5%B8%88">6. 财务分析师</a></li><li><a href="#7-%E7%94%B5%E5%95%86%E8%BF%90%E8%90%A5">7. 电商运营</a></li></ul></li><li><a href="#%E5%9B%9B%E8%AF%84%E6%B5%8B%E6%95%B0%E6%8D%AE%E4%BB%8E%E5%93%AA%E6%9D%A5%E4%B8%89%E6%9D%A1%E5%AE%9E%E7%94%A8%E8%B7%AF%E5%BE%84">四、评测数据从哪来：三条实用路径</a><ul><li><a href="#%E8%B7%AF%E5%BE%84%E4%B8%80%E4%BB%8E%E7%9C%9F%E5%AE%9E%E5%B7%A5%E4%BD%9C%E8%AE%B0%E5%BD%95%E4%B8%AD%E6%8A%BD%E5%8F%96%E6%8E%A8%E8%8D%90">路径一：从真实工作记录中抽取（推荐）</a></li><li><a href="#%E8%B7%AF%E5%BE%84%E4%BA%8C%E7%94%A8-llm-%E7%94%9F%E6%88%90%E6%A8%A1%E6%8B%9F%E4%BB%BB%E5%8A%A1%E5%BF%AB%E9%80%9F%E5%90%AF%E5%8A%A8">路径二：用 LLM 生成模拟任务（快速启动）</a></li><li><a href="#%E8%B7%AF%E5%BE%84%E4%B8%89%E4%BC%97%E5%8C%85--%E4%B8%93%E5%AE%B6%E5%AE%A1%E6%A0%B8%E8%A7%84%E6%A8%A1%E5%8C%96">路径三：众包 + 专家审核（规模化）</a></li></ul></li><li><a href="#%E4%BA%94%E8%AF%84%E6%B5%8B%E7%9A%84%E5%8F%8D%E6%A8%A1%E5%BC%8F%E8%BF%99%E4%BA%9B%E5%9D%91%E4%B8%8D%E8%A6%81%E8%B8%A9">五、评测的反模式：这些坑不要踩</a><ul><li><a href="#%E5%8F%8D%E6%A8%A1%E5%BC%8F%E4%B8%80%E5%87%86%E7%A1%AE%E7%8E%87%E7%84%A6%E8%99%91%E7%97%87">反模式一：“准确率焦虑症”</a></li><li><a href="#%E5%8F%8D%E6%A8%A1%E5%BC%8F%E4%BA%8C%E5%AE%9E%E9%AA%8C%E5%AE%A4%E7%8E%AF%E5%A2%83%E8%87%AA%E5%97%A8">反模式二：“实验室环境自嗨”</a></li><li><a href="#%E5%8F%8D%E6%A8%A1%E5%BC%8F%E4%B8%89%E4%B8%80%E6%AC%A1%E8%AF%84%E6%B5%8B%E5%AE%9A%E7%BB%88%E8%BA%AB">反模式三：“一次评测定终身”</a></li><li><a href="#%E5%8F%8D%E6%A8%A1%E5%BC%8F%E5%9B%9B%E8%87%AA%E5%B7%B1%E8%AF%84%E8%87%AA%E5%B7%B1">反模式四：“自己评自己”</a></li></ul></li><li><a href="#%E5%85%AD%E4%B8%80%E4%B8%AA%E5%8F%AF%E6%89%A7%E8%A1%8C%E7%9A%84%E8%90%BD%E5%9C%B0%E8%B7%AF%E7%BA%BF">六、一个可执行的落地路线</a></li><li><a href="#%E6%80%BB%E7%BB%93">总结</a></li></ul><p>上个月参加一个 Agent 产品的内部评审，产品经理拿出一张 benchmark 表格：准确率 92%、响应时间 1.2 秒、幻觉率 3%。数字很漂亮，领导很满意。</p><p>然后我问了一个问题：<strong>“这个 92% 的准确率，是在什么任务上测的？”</strong></p><p>回答是一组通用 QA 数据集。</p><p>我又问：<strong>“你的目标用户是电商运营，你有没有用电商运营真实工作场景的任务来测？”</strong></p><p>会议室安静了五秒钟。</p><p>这就是今天 Agent 评测的核心矛盾：<strong>我们在用”通用考试”的成绩来预测”专业岗位”的表现。</strong> 这就像用高考数学成绩来判断一个人能不能当好外科医生——逻辑上不成立，但大家都在这么干。</p><h2 id="一、为什么通用-Benchmark-在-Agent-评测中失效"><a href="#一、为什么通用-Benchmark-在-Agent-评测中失效" class="headerlink" title="一、为什么通用 Benchmark 在 Agent 评测中失效"></a>一、为什么通用 Benchmark 在 Agent 评测中失效</h2><p>先说清楚问题的本质。</p><p>当前主流的 Agent benchmark（SWE-bench、WebArena、GAIA 等）有一个共同特征：<strong>它们测的是 Agent 的”底层能力”——推理、工具使用、多步规划。</strong> 这些很重要，但远远不够。</p><p>打个比方：你要招一个财务分析师。通用 benchmark 相当于测他的智商、阅读理解和数学计算能力。这些当然是基础，但你真正关心的是：</p><ul><li>他能不能准确做出一张现金流预测表？</li><li>面对模糊的业务数据，他会不会做出合理假设？</li><li>他产出的分析报告，CFO 能不能直接拿去做决策？</li></ul><p><strong>能力 ≠ 胜任力。</strong> 通用 benchmark 测的是能力，但业务需要的是胜任力。</p><p>这个 gap 有多大？我们在实际项目中观察到的数据：</p><p>场景</p><p>通用 benchmark 表现</p><p>实际业务任务完成率</p><p>差距</p><p>电商客服 Agent</p><p>90%+</p><p>62%</p><p>-28%</p><p>法务合同审查 Agent</p><p>88%+</p><p>45%</p><p>-43%</p><p>HR 简历筛选 Agent</p><p>91%+</p><p>71%</p><p>-20%</p><p>运维告警处理 Agent</p><p>89%+</p><p>58%</p><p>-31%</p><p><strong>差距来自哪里？</strong> 三个层面：</p><ol><li><strong>领域知识缺失：</strong> 通用 benchmark 不测”你知不知道《劳动合同法》第 39 条”，但 HR Agent 必须知道。</li><li><strong>流程适配不足：</strong> 每个岗位有自己的 SOP，Agent 是否能嵌入而非打断现有流程，benchmark 完全不覆盖。</li><li><strong>输出格式错配：</strong> 运维要的是可执行的 shell 命令，财务要的是符合会计准则的报表格式——通用评测只看”答对没有”，不看”输出能不能直接用”。</li></ol><h2 id="二、分层评测框架：从通用到行业到岗位"><a href="#二、分层评测框架：从通用到行业到岗位" class="headerlink" title="二、分层评测框架：从通用到行业到岗位"></a>二、分层评测框架：从通用到行业到岗位</h2><p>解决方案不是扔掉通用 benchmark，而是在它上面叠加两层。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">┌─────────────────────────────────┐</span><br><span class="line">│   L3: 岗位级评测（Role-level）    │  ← &quot;这个具体岗位的活，干得怎么样&quot;</span><br><span class="line">├─────────────────────────────────┤</span><br><span class="line">│   L2: 行业级评测（Industry-level）│  ← &quot;这个行业的规则和知识，懂不懂&quot;</span><br><span class="line">├─────────────────────────────────┤</span><br><span class="line">│   L1: 通用能力评测（General）     │  ← &quot;基本功扎不扎实&quot;</span><br><span class="line">└─────────────────────────────────┘</span><br></pre></td></tr></table></figure><p>每一层回答不同的问题，用不同的方法来测。</p><h3 id="L1：通用能力层——Agent-的基本功"><a href="#L1：通用能力层——Agent-的基本功" class="headerlink" title="L1：通用能力层——Agent 的基本功"></a>L1：通用能力层——Agent 的基本功</h3><p>这一层已有成熟方案，简单列一下核心维度：</p><p>维度</p><p>测什么</p><p>典型 benchmark</p><p>推理能力</p><p>多步逻辑推导</p><p>MMLU, ARC, GSM8K</p><p>工具使用</p><p>API 调用准确率</p><p>ToolBench, API-Bank</p><p>指令跟随</p><p>理解并执行复杂指令</p><p>IFEval, MT-Bench</p><p>多步规划</p><p>任务分解与执行</p><p>SWE-bench, WebArena</p><p>上下文管理</p><p>长对话一致性</p><p>RULER, LongBench</p><p>L1 是门槛，不是终点。通过 L1 只能说明”这个 Agent 有潜力”，不能说明”它能胜任某个岗位”。</p><h3 id="L2：行业级评测——领域知识与合规性"><a href="#L2：行业级评测——领域知识与合规性" class="headerlink" title="L2：行业级评测——领域知识与合规性"></a>L2：行业级评测——领域知识与合规性</h3><p>这一层测的是 Agent 对特定行业的理解深度。不同行业差异极大，以下是四个典型行业的评测维度设计：</p><h4 id="金融行业"><a href="#金融行业" class="headerlink" title="金融行业"></a>金融行业</h4><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 金融行业 Agent 评测维度</span></span><br><span class="line"><span class="attr">domain_knowledge:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">会计准则理解（CAS/IFRS</span> <span class="string">关键条款识别与应用）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">金融产品知识（债券、衍生品、结构化产品）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">监管政策理解（银保监会、证监会最新规定）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">compliance:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">反洗钱规则遵循（可疑交易识别准确率）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">信息披露规范（格式、时限、内容完整性）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">客户隐私保护（PII</span> <span class="string">脱敏处理）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">numerical_precision:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">财务计算准确度（小数点精度、四舍五入规则）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">汇率/利率计算（T+0/T+1</span> <span class="string">规则理解）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">税务计算（增值税、所得税、跨境税务）</span></span><br></pre></td></tr></table></figure><h4 id="医疗健康"><a href="#医疗健康" class="headerlink" title="医疗健康"></a>医疗健康</h4><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 医疗健康行业 Agent 评测维度</span></span><br><span class="line"><span class="attr">clinical_knowledge:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">诊断逻辑（症状→疾病的推理链准确性）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">药物知识（适应症、禁忌症、药物相互作用）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">检验指标解读（正常范围、临床意义）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">safety_boundaries:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">诊断建议的免责声明（是否主动提示就医）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">紧急情况识别（是否能识别需要急救的信号）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">禁止行为边界（不开处方、不替代医生）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">terminology:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">医学术语准确性（ICD-10</span> <span class="string">编码、药品通用名）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">患者沟通语言（专业术语转化为通俗语言）</span></span><br></pre></td></tr></table></figure><h4 id="法律行业"><a href="#法律行业" class="headerlink" title="法律行业"></a>法律行业</h4><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 法律行业 Agent 评测维度</span></span><br><span class="line"><span class="attr">legal_knowledge:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">法条引用准确性（法条号、条款内容是否真实存在）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">司法解释理解（最新司法解释的适用）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">案例检索相关性（判例与当前案情的匹配度）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">reasoning_quality:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">法律推理链完整性（大前提→小前提→结论）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">多方利益分析（原告/被告/第三方视角）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">风险评估的保守性（是否倾向于提示风险而非忽略）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">output_standards:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">法律文书格式（起诉状、合同、法律意见书的规范性）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">引用格式（法条、案例的标准引用方式）</span></span><br></pre></td></tr></table></figure><h4 id="电商零售"><a href="#电商零售" class="headerlink" title="电商零售"></a>电商零售</h4><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 电商零售行业 Agent 评测维度</span></span><br><span class="line"><span class="attr">business_knowledge:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">平台规则理解（淘宝/京东/抖音各平台规则差异）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">营销知识（ROI</span> <span class="string">计算、投放策略、促销机制）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">供应链概念（库存周转、采购周期、物流时效）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">data_literacy:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">数据指标理解（GMV、UV、转化率、客单价的关系）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">数据异常识别（刷单、异常退货、流量波动）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">趋势分析（同比/环比、季节性因素）</span></span><br><span class="line"></span><br><span class="line"><span class="attr">platform_operations:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">商品信息规范（标题优化、属性填写、图片要求）</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">客服话术合规（广告法禁用词、承诺底线）</span></span><br></pre></td></tr></table></figure><h3 id="L3：岗位级评测——真实工作场景的任务完成度"><a href="#L3：岗位级评测——真实工作场景的任务完成度" class="headerlink" title="L3：岗位级评测——真实工作场景的任务完成度"></a>L3：岗位级评测——真实工作场景的任务完成度</h3><p>这是最关键也最难的一层。<strong>L3 不是问 Agent”你知不知道”，而是让它”做一遍”。</strong></p><p>核心设计原则：<strong>从岗位的真实工作任务中抽取评测用例。</strong></p><p>具体方法：</p><p><strong>第一步：拆解岗位的日常任务清单。</strong></p><p>以”电商运营”岗位为例：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br></pre></td><td class="code"><pre><span class="line">电商运营日常任务</span><br><span class="line">├── 数据分析（30%）</span><br><span class="line">│   ├── 日报/周报制作</span><br><span class="line">│   ├── 竞品数据监控</span><br><span class="line">│   └── 活动效果复盘</span><br><span class="line">├── 商品管理（25%）</span><br><span class="line">│   ├── 商品上架/编辑</span><br><span class="line">│   ├── 价格策略调整</span><br><span class="line">│   └── 库存预警处理</span><br><span class="line">├── 营销推广（25%）</span><br><span class="line">│   ├── 活动策划执行</span><br><span class="line">│   ├── 广告投放管理</span><br><span class="line">│   └── 优惠券/满减设置</span><br><span class="line">└── 客户运营（20%）</span><br><span class="line">    ├── 客户分群</span><br><span class="line">    ├── 会员权益管理</span><br><span class="line">    └── 客诉升级处理</span><br></pre></td></tr></table></figure><p><strong>第二步：为每个任务设计评测场景。</strong></p><p>不是出选择题，而是给一个完整的任务情境，让 Agent 产出完整的工作交付物。</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 岗位级评测用例示例：电商运营 - 日报制作</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br><span class="line"></span><br><span class="line">eval_case = &#123;</span><br><span class="line">    <span class="string">&quot;role&quot;</span>: <span class="string">&quot;电商运营&quot;</span>,</span><br><span class="line">    <span class="string">&quot;task&quot;</span>: <span class="string">&quot;制作昨日店铺运营日报&quot;</span>,</span><br><span class="line">    <span class="string">&quot;context&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;store&quot;</span>: <span class="string">&quot;XX旗舰店&quot;</span>,</span><br><span class="line">        <span class="string">&quot;platform&quot;</span>: <span class="string">&quot;淘宝&quot;</span>,</span><br><span class="line">        <span class="string">&quot;data_source&quot;</span>: <span class="string">&quot;生意参谋导出的 CSV 数据&quot;</span>,</span><br><span class="line">        <span class="string">&quot;date&quot;</span>: <span class="string">&quot;2026-03-30&quot;</span></span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;input&quot;</span>: <span class="string">&quot;attached_csv_file.csv&quot;</span>,  <span class="comment"># 真实脱敏数据</span></span><br><span class="line">    <span class="string">&quot;expected_output&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;format&quot;</span>: <span class="string">&quot;markdown_table + key_insights&quot;</span>,</span><br><span class="line">        <span class="string">&quot;required_metrics&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;访客数及环比变化&quot;</span>,</span><br><span class="line">            <span class="string">&quot;支付转化率&quot;</span>,</span><br><span class="line">            <span class="string">&quot;客单价&quot;</span>,</span><br><span class="line">            <span class="string">&quot;GMV 及目标达成率&quot;</span></span><br><span class="line">        ],</span><br><span class="line">        <span class="string">&quot;required_analysis&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;流量来源变化分析&quot;</span>,</span><br><span class="line">            <span class="string">&quot;转化率异常归因&quot;</span>,</span><br><span class="line">            <span class="string">&quot;至少一条可执行的优化建议&quot;</span></span><br><span class="line">        ]</span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;scoring&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;data_accuracy&quot;</span>: <span class="number">0.3</span>,    <span class="comment"># 数字是否正确</span></span><br><span class="line">        <span class="string">&quot;insight_quality&quot;</span>: <span class="number">0.3</span>,  <span class="comment"># 分析是否有价值</span></span><br><span class="line">        <span class="string">&quot;actionability&quot;</span>: <span class="number">0.2</span>,    <span class="comment"># 建议是否可执行</span></span><br><span class="line">        <span class="string">&quot;format_compliance&quot;</span>: <span class="number">0.1</span>,<span class="comment"># 格式是否规范</span></span><br><span class="line">        <span class="string">&quot;efficiency&quot;</span>: <span class="number">0.1</span>        <span class="comment"># 完成时间</span></span><br><span class="line">    &#125;</span><br><span class="line">&#125;</span><br></pre></td></tr></table></figure><p><strong>第三步：定义”合格”的标准——对标人类岗位能力。</strong></p><p>这一步最容易被忽略，也最重要。评分标准不是拍脑袋定的，而是来自对人类员工的分级：</p><p>等级</p><p>人类对标</p><p>Agent 需要达到的标准</p><p>L0 - 不可用</p><p>实习生第一天</p><p>输出无法使用，需要全部重做</p><p>L1 - 辅助级</p><p>实习生一周后</p><p>能产出初稿，但需要大量修改</p><p>L2 - 可用级</p><p>初级员工</p><p>产出可用，只需少量调整</p><p>L3 - 独立级</p><p>熟练员工</p><p>产出可直接使用，质量稳定</p><p>L4 - 专家级</p><p>资深员工</p><p>产出超过一般人类水平</p><p><strong>Agent 产品的上线门槛应该是 L2，而不是 L3。</strong> 因为 Agent 的价值公式是：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">Agent 价值 = (人类时间成本 × 节省比例) - (Agent 产出修正成本 + Agent 运行成本)</span><br></pre></td></tr></table></figure><p>只要修正成本低于从零开始做的成本，Agent 就有正向价值。</p><h2 id="三、七个岗位的评测维度速查表"><a href="#三、七个岗位的评测维度速查表" class="headerlink" title="三、七个岗位的评测维度速查表"></a>三、七个岗位的评测维度速查表</h2><p>讲了方法论，接下来给干货。以下是七个典型岗位的 L3 评测维度设计，可以直接拿来用（其中电商运营给出了最详细的完整方案）。</p><h3 id="1-客服专员"><a href="#1-客服专员" class="headerlink" title="1. 客服专员"></a>1. 客服专员</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                    权重</span><br><span class="line">──────────────────────────────────────────────────────</span><br><span class="line">意图识别                    识别准确率                   20%</span><br><span class="line">知识库问答                  回答准确率 + 引用准确性      20%</span><br><span class="line">情绪安抚                    用户情绪转化率（负→中/正）   15%</span><br><span class="line">多轮对话管理                上下文一致性 + 追问合理性     15%</span><br><span class="line">工单流转判断                升级/转接决策准确率          15%</span><br><span class="line">违禁词/敏感信息管控         零容忍（一票否决）           15%</span><br></pre></td></tr></table></figure><p>关键评测场景：<strong>给 Agent 一段愤怒客户的投诉录音转写文本，要求它完成安抚、问题定位、解决方案提供、工单创建的全流程。</strong></p><h3 id="2-数据分析师"><a href="#2-数据分析师" class="headerlink" title="2. 数据分析师"></a>2. 数据分析师</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                    权重</span><br><span class="line">──────────────────────────────────────────────────────</span><br><span class="line">SQL 编写                    查询正确率 + 性能合理性      20%</span><br><span class="line">数据清洗                    异常值识别率 + 处理合理性     15%</span><br><span class="line">可视化制作                  图表选型合理性 + 标注完整性   15%</span><br><span class="line">分析报告撰写                洞察深度 + 结论可靠性        25%</span><br><span class="line">统计方法应用                方法选择正确性 + 假设合理性   15%</span><br><span class="line">业务指标定义                口径理解准确率               10%</span><br></pre></td></tr></table></figure><p>关键评测场景：<strong>给 Agent 一份原始销售数据（含脏数据），要求输出一份完整的月度分析报告，包括数据清洗说明、核心趋势、异常解释和建议。</strong></p><h3 id="3-内容运营"><a href="#3-内容运营" class="headerlink" title="3. 内容运营"></a>3. 内容运营</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                    权重</span><br><span class="line">──────────────────────────────────────────────────────</span><br><span class="line">内容策划                    选题相关性 + 角度新颖性      20%</span><br><span class="line">文案撰写                    品牌调性一致性 + 可读性      25%</span><br><span class="line">SEO 优化                    关键词覆盖 + 结构化合理性    15%</span><br><span class="line">多平台适配                  不同平台格式/字数/风格适配   15%</span><br><span class="line">数据复盘                    内容指标归因分析质量         15%</span><br><span class="line">热点响应                    时效性 + 品牌关联度          10%</span><br></pre></td></tr></table></figure><h3 id="4-法务专员"><a href="#4-法务专员" class="headerlink" title="4. 法务专员"></a>4. 法务专员</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                    权重</span><br><span class="line">──────────────────────────────────────────────────────</span><br><span class="line">合同审查                    风险条款识别率 + 修改建议质量 30%</span><br><span class="line">法律研究                    法条引用准确性 + 分析完整性   25%</span><br><span class="line">合规检查                    违规点识别率 + 整改建议可行性 20%</span><br><span class="line">法律文书起草                格式规范性 + 逻辑严密性      15%</span><br><span class="line">风险提示                    风险等级判断准确性           10%</span><br></pre></td></tr></table></figure><p>关键评测场景：<strong>给 Agent 一份真实的商业合同（脱敏），要求标出所有对我方不利条款，给出修改建议，并出具一份法律风险评估意见。</strong></p><h3 id="5-HR-招聘专员"><a href="#5-HR-招聘专员" class="headerlink" title="5. HR 招聘专员"></a>5. HR 招聘专员</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                    权重</span><br><span class="line">──────────────────────────────────────────────────────</span><br><span class="line">简历筛选                    匹配度评分准确性 + 理由合理性 25%</span><br><span class="line">JD 编写                    岗位要求完整性 + 吸引力      15%</span><br><span class="line">面试问题设计                问题针对性 + 覆盖度          20%</span><br><span class="line">候选人沟通                  专业度 + 温度感 + 信息完整性  15%</span><br><span class="line">人才画像分析                维度全面性 + 判断准确性      15%</span><br><span class="line">背调要点梳理                风险维度覆盖 + 问题设计质量   10%</span><br></pre></td></tr></table></figure><h3 id="6-财务分析师"><a href="#6-财务分析师" class="headerlink" title="6. 财务分析师"></a>6. 财务分析师</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                    权重</span><br><span class="line">──────────────────────────────────────────────────────</span><br><span class="line">财务报表分析                比率计算准确性 + 趋势解读     25%</span><br><span class="line">预算编制                    假设合理性 + 数字一致性      20%</span><br><span class="line">成本分析                    归因准确性 + 优化建议质量     20%</span><br><span class="line">现金流预测                  预测模型合理性 + 敏感性分析   20%</span><br><span class="line">审计支持                    凭证匹配率 + 异常标记准确率   15%</span><br></pre></td></tr></table></figure><p>关键评测场景：<strong>给 Agent 三年的财务报表数据，要求输出一份包含杜邦分析、现金流预测和风险提示的管理层报告。</strong></p><h3 id="7-电商运营"><a href="#7-电商运营" class="headerlink" title="7. 电商运营"></a>7. 电商运营</h3><p>电商运营是本文反复用来举例的岗位，因为它天然适合 Agent 介入——任务标准化程度高、数据密集、时效性强。下面给出一套可以直接落地的完整评测方案。</p><h4 id="评测维度总览"><a href="#评测维度总览" class="headerlink" title="评测维度总览"></a>评测维度总览</h4><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br></pre></td><td class="code"><pre><span class="line">评测任务                    核心指标                        权重</span><br><span class="line">──────────────────────────────────────────────────────────</span><br><span class="line">数据看板与日报              数据准确性 + 洞察质量            20%</span><br><span class="line">商品上架与优化              信息完整性 + 平台规则合规         15%</span><br><span class="line">活动策划与执行              方案可行性 + ROI 预估合理性       20%</span><br><span class="line">广告投放分析                投放策略合理性 + 优化建议质量      15%</span><br><span class="line">客户分群与触达              分群逻辑 + 触达方案转化预估       15%</span><br><span class="line">竞品监控与分析              信息抓取完整性 + 差异化洞察       10%</span><br><span class="line">异常预警与应急              响应速度 + 处置方案可行性          5%</span><br></pre></td></tr></table></figure><h4 id="五个核心评测场景"><a href="#五个核心评测场景" class="headerlink" title="五个核心评测场景"></a>五个核心评测场景</h4><p><strong>场景一：跨平台日报生成（数据分析能力）</strong></p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 电商运营日报评测用例</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br><span class="line"></span><br><span class="line">eval_daily_report = &#123;</span><br><span class="line">    <span class="string">&quot;task&quot;</span>: <span class="string">&quot;根据多平台数据生成跨渠道运营日报&quot;</span>,</span><br><span class="line">    <span class="string">&quot;context&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;platforms&quot;</span>: [<span class="string">&quot;淘宝天猫&quot;</span>, <span class="string">&quot;抖音电商&quot;</span>, <span class="string">&quot;京东&quot;</span>],</span><br><span class="line">        <span class="string">&quot;date&quot;</span>: <span class="string">&quot;2026-03-30&quot;</span>,</span><br><span class="line">        <span class="string">&quot;store_tier&quot;</span>: <span class="string">&quot;年 GMV 5000 万级&quot;</span>,</span><br><span class="line">        <span class="string">&quot;data_inputs&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;生意参谋_流量概览.csv&quot;</span>,</span><br><span class="line">            <span class="string">&quot;抖店_罗盘数据.csv&quot;</span>,</span><br><span class="line">            <span class="string">&quot;京东_商智数据.csv&quot;</span></span><br><span class="line">        ]</span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;expected_output&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;required_sections&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;全渠道 GMV 汇总及目标达成率&quot;</span>,</span><br><span class="line">            <span class="string">&quot;各平台核心指标对比（UV/转化率/客单价）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;流量来源结构变化（自然流量 vs 付费流量）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;TOP10 商品动销排行及库存预警&quot;</span>,</span><br><span class="line">            <span class="string">&quot;关键异常标记（转化率下降&gt;10%、退货率上升等）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;次日重点待办事项（至少 3 条可执行建议）&quot;</span></span><br><span class="line">        ],</span><br><span class="line">        <span class="string">&quot;format&quot;</span>: <span class="string">&quot;结构化 markdown，含数据表格和环比箭头标记&quot;</span></span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;scoring&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;data_accuracy&quot;</span>: <span class="number">0.30</span>,        <span class="comment"># 数字、百分比、环比计算是否正确</span></span><br><span class="line">        <span class="string">&quot;cross_platform_insight&quot;</span>: <span class="number">0.25</span>,<span class="comment"># 跨平台对比分析是否有增量价值</span></span><br><span class="line">        <span class="string">&quot;actionability&quot;</span>: <span class="number">0.20</span>,        <span class="comment"># 建议是否具体到可直接执行</span></span><br><span class="line">        <span class="string">&quot;format_compliance&quot;</span>: <span class="number">0.15</span>,    <span class="comment"># 是否符合运营团队的日报模板</span></span><br><span class="line">        <span class="string">&quot;anomaly_detection&quot;</span>: <span class="number">0.10</span>     <span class="comment"># 是否主动发现了数据中的异常</span></span><br><span class="line">    &#125;</span><br><span class="line">&#125;</span><br></pre></td></tr></table></figure><p><strong>场景二：大促活动策划（营销策划能力）</strong></p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 电商运营大促策划评测用例</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br><span class="line"></span><br><span class="line">eval_campaign = &#123;</span><br><span class="line">    <span class="string">&quot;task&quot;</span>: <span class="string">&quot;策划 618 大促期间的店铺营销方案&quot;</span>,</span><br><span class="line">    <span class="string">&quot;context&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;platform&quot;</span>: <span class="string">&quot;淘宝天猫&quot;</span>,</span><br><span class="line">        <span class="string">&quot;category&quot;</span>: <span class="string">&quot;家居日用&quot;</span>,</span><br><span class="line">        <span class="string">&quot;budget&quot;</span>: <span class="string">&quot;推广预算 50 万&quot;</span>,</span><br><span class="line">        <span class="string">&quot;historical_data&quot;</span>: <span class="string">&quot;去年 618 销售数据 + 竞品活动复盘&quot;</span>,</span><br><span class="line">        <span class="string">&quot;constraints&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;主推 3 款新品，库存各 5000 件&quot;</span>,</span><br><span class="line">            <span class="string">&quot;老客复购率目标 35%&quot;</span>,</span><br><span class="line">            <span class="string">&quot;ROI 不低于 3.0&quot;</span></span><br><span class="line">        ]</span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;expected_output&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;required_sections&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;活动节奏（蓄水期/预热期/爆发期/返场期各阶段策略）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;商品分层策略（引流款/利润款/形象款定价与库存分配）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;推广费用分配（直通车/引力魔方/万相台各渠道预算占比）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;优惠券与满减梯度设计&quot;</span>,</span><br><span class="line">            <span class="string">&quot;预估 GMV 及 ROI 测算过程&quot;</span>,</span><br><span class="line">            <span class="string">&quot;风险预案（库存不足、流量不达预期、竞品低价打击）&quot;</span></span><br><span class="line">        ]</span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;scoring&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;strategy_coherence&quot;</span>: <span class="number">0.25</span>,   <span class="comment"># 各阶段策略是否逻辑自洽</span></span><br><span class="line">        <span class="string">&quot;budget_rationality&quot;</span>: <span class="number">0.20</span>,   <span class="comment"># 预算分配是否有数据支撑</span></span><br><span class="line">        <span class="string">&quot;roi_calculation&quot;</span>: <span class="number">0.20</span>,      <span class="comment"># ROI 测算过程是否可验证</span></span><br><span class="line">        <span class="string">&quot;creativity&quot;</span>: <span class="number">0.15</span>,           <span class="comment"># 玩法设计是否有差异化亮点</span></span><br><span class="line">        <span class="string">&quot;risk_awareness&quot;</span>: <span class="number">0.10</span>,       <span class="comment"># 风险预案是否覆盖主要场景</span></span><br><span class="line">        <span class="string">&quot;platform_rules&quot;</span>: <span class="number">0.10</span>       <span class="comment"># 方案是否符合平台活动规则</span></span><br><span class="line">    &#125;</span><br><span class="line">&#125;</span><br></pre></td></tr></table></figure><p><strong>场景三：商品标题与详情页优化（商品运营能力）</strong></p><p>给 Agent 一组商品（含现有标题、主图、属性、近 30 天搜索词报表），要求它：</p><ol><li>诊断当前标题的关键词覆盖问题</li><li>基于搜索词报表重新组合标题（30 字以内，核心词+属性词+长尾词）</li><li>输出详情页卖点提炼框架（痛点→方案→证据→促单）</li><li>标注违反广告法的禁用词风险</li></ol><p>评分标准：关键词覆盖率（25%）、标题可读性（20%）、卖点提炼精准度（25%）、合规性（20%）、与竞品的差异化（10%）。</p><p><strong>场景四：广告投放诊断与优化（付费推广能力）</strong></p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 广告投放优化评测用例</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br><span class="line"></span><br><span class="line">eval_ad_optimization = &#123;</span><br><span class="line">    <span class="string">&quot;task&quot;</span>: <span class="string">&quot;诊断直通车计划表现并给出优化方案&quot;</span>,</span><br><span class="line">    <span class="string">&quot;context&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;platform&quot;</span>: <span class="string">&quot;淘宝&quot;</span>,</span><br><span class="line">        <span class="string">&quot;campaign_data&quot;</span>: <span class="string">&quot;近 14 天直通车分日报表 + 关键词报表 + 人群报表&quot;</span>,</span><br><span class="line">        <span class="string">&quot;current_status&quot;</span>: &#123;</span><br><span class="line">            <span class="string">&quot;daily_budget&quot;</span>: <span class="number">3000</span>,</span><br><span class="line">            <span class="string">&quot;avg_ppc&quot;</span>: <span class="number">2.8</span>,</span><br><span class="line">            <span class="string">&quot;roi&quot;</span>: <span class="number">1.5</span>,</span><br><span class="line">            <span class="string">&quot;target_roi&quot;</span>: <span class="number">3.0</span>,</span><br><span class="line">            <span class="string">&quot;click_rate&quot;</span>: <span class="string">&quot;3.2%&quot;</span>,</span><br><span class="line">            <span class="string">&quot;conversion_rate&quot;</span>: <span class="string">&quot;1.8%&quot;</span></span><br><span class="line">        &#125;</span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;expected_output&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;required_sections&quot;</span>: [</span><br><span class="line">            <span class="string">&quot;当前投放问题诊断（至少 3 个具体问题及数据佐证）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;关键词层面优化（删词/加词/调价的具体操作清单）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;人群溢价调整建议（各人群包的出价系数）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;创意优化方向（基于点击率数据）&quot;</span>,</span><br><span class="line">            <span class="string">&quot;预期优化效果（调整后 ROI 预估及测算逻辑）&quot;</span></span><br><span class="line">        ]</span><br><span class="line">    &#125;,</span><br><span class="line">    <span class="string">&quot;scoring&quot;</span>: &#123;</span><br><span class="line">        <span class="string">&quot;diagnosis_accuracy&quot;</span>: <span class="number">0.30</span>,   <span class="comment"># 问题定位是否命中真因</span></span><br><span class="line">        <span class="string">&quot;optimization_specificity&quot;</span>: <span class="number">0.30</span>, <span class="comment"># 建议是否具体到可直接操作</span></span><br><span class="line">        <span class="string">&quot;data_reasoning&quot;</span>: <span class="number">0.20</span>,       <span class="comment"># 每条建议是否有数据支撑</span></span><br><span class="line">        <span class="string">&quot;roi_projection&quot;</span>: <span class="number">0.10</span>,       <span class="comment"># 优化后 ROI 预估是否合理</span></span><br><span class="line">        <span class="string">&quot;platform_knowledge&quot;</span>: <span class="number">0.10</span>    <span class="comment"># 是否了解最新的投放产品功能</span></span><br><span class="line">    &#125;</span><br><span class="line">&#125;</span><br></pre></td></tr></table></figure><p><strong>场景五：客户分群与精准营销（用户运营能力）</strong></p><p>给 Agent 一份脱敏的客户 RFM 数据（最近购买时间、购买频次、累计消费金额，约 1 万条），要求它：</p><ol><li>设计客户分群模型（不少于 5 个层级）</li><li>每个层级给出标签定义、客户数量占比、典型画像</li><li>针对每个分群设计差异化触达策略（渠道、时机、内容、优惠力度）</li><li>给出”沉睡客户唤醒”专项方案，包括预期唤醒率和成本估算</li></ol><p>评分标准：分群逻辑合理性（25%）、策略差异化程度（25%）、预期效果可量化（20%）、成本测算合理性（15%）、方案可执行性（15%）。</p><h4 id="电商运营-Agent-的”一票否决”项"><a href="#电商运营-Agent-的”一票否决”项" class="headerlink" title="电商运营 Agent 的”一票否决”项"></a>电商运营 Agent 的”一票否决”项</h4><p>除了上面的常规评分，电商运营 Agent 有几条红线，触碰任意一条直接判定为不合格：</p><p>否决项</p><p>说明</p><p>为什么是红线</p><p>价格计算错误</p><p>满减、折扣、优惠券叠加后的到手价计算有误</p><p>直接影响利润，可能导致亏本销售</p><p>广告法违规</p><p>使用”最”“第一”“国家级”等绝对化用语</p><p>面临平台处罚甚至行政罚款</p><p>库存超卖建议</p><p>活动方案中的预估销量超过实际可用库存</p><p>超卖导致批量退款和店铺评分下降</p><p>平台规则违反</p><p>建议的促销方式违反平台当期活动规则</p><p>导致活动资格取消或店铺降权</p><p>数据口径混淆</p><p>混淆 GMV 与实收、UV 与 PV 等基础概念</p><p>基于错误数据做出的决策全部无效</p><h4 id="评测数据准备建议"><a href="#评测数据准备建议" class="headerlink" title="评测数据准备建议"></a>评测数据准备建议</h4><p>电商运营的评测数据相比其他岗位有一个天然优势：<strong>数据高度结构化，且容易脱敏。</strong> 具体操作：</p><ol><li><strong>导出真实数据：</strong> 从生意参谋、抖店罗盘等后台导出 CSV，将店铺名&#x2F;商品名&#x2F;客户信息替换为虚构值</li><li><strong>保留数据分布：</strong> 脱敏时保持数据的统计特征（均值、方差、趋势），否则评测场景会失真</li><li><strong>标注”金标准”：</strong> 让团队里最优秀的运营针对同一份数据产出一份标准答案，作为对照</li><li><strong>覆盖季节性：</strong> 评测集应包含大促期、日销期、淡季等不同阶段的数据，避免只在某一类场景下测试</li></ol><h2 id="四、评测数据从哪来：三条实用路径"><a href="#四、评测数据从哪来：三条实用路径" class="headerlink" title="四、评测数据从哪来：三条实用路径"></a>四、评测数据从哪来：三条实用路径</h2><p>方法论有了，最大的难题是：<strong>评测数据从哪来？</strong></p><h3 id="路径一：从真实工作记录中抽取（推荐）"><a href="#路径一：从真实工作记录中抽取（推荐）" class="headerlink" title="路径一：从真实工作记录中抽取（推荐）"></a>路径一：从真实工作记录中抽取（推荐）</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">日常工作 → 脱敏 → 标注 → 评测集</span><br></pre></td></tr></table></figure><ul><li>找到目标岗位表现最好的 3-5 个员工</li><li>收集他们过去一个月的典型工作交付物</li><li>脱敏后作为”标准答案”</li><li>用同样的输入让 Agent 做一遍，对比差异</li></ul><p><strong>优点：</strong> 最贴近真实场景，评测结果最有参考价值。</p><p><strong>成本：</strong> 高，需要岗位专家配合标注。</p><h3 id="路径二：用-LLM-生成模拟任务（快速启动）"><a href="#路径二：用-LLM-生成模拟任务（快速启动）" class="headerlink" title="路径二：用 LLM 生成模拟任务（快速启动）"></a>路径二：用 LLM 生成模拟任务（快速启动）</h3><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 用 GPT-4/Claude 生成特定岗位的模拟评测数据</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br><span class="line"></span><br><span class="line">prompt = <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">你是一个有 10 年经验的电商运营总监。</span></span><br><span class="line"><span class="string">请生成 5 个电商运营日常工作的评测场景，每个场景需要包括：</span></span><br><span class="line"><span class="string">1. 任务背景描述</span></span><br><span class="line"><span class="string">2. 提供给 Agent 的输入数据（模拟真实数据格式）</span></span><br><span class="line"><span class="string">3. 期望的输出格式和内容</span></span><br><span class="line"><span class="string">4. 评分标准（列出各维度及权重）</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">要求：</span></span><br><span class="line"><span class="string">- 场景要覆盖数据分析、商品管理、营销推广、客户运营四个方向</span></span><br><span class="line"><span class="string">- 难度分为简单/中等/困难三个级别</span></span><br><span class="line"><span class="string">- 输入数据要足够具体，不能是笼统描述</span></span><br><span class="line"><span class="string">&quot;&quot;&quot;</span></span><br></pre></td></tr></table></figure><p><strong>优点：</strong> 速度快，成本低，一天内可以搭建初版评测集。</p><p><strong>缺点：</strong> 可能与真实场景有偏差，需要岗位专家 review。</p><h3 id="路径三：众包-专家审核（规模化）"><a href="#路径三：众包-专家审核（规模化）" class="headerlink" title="路径三：众包 + 专家审核（规模化）"></a>路径三：众包 + 专家审核（规模化）</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">众包标注 → 专家审核 → 一致性检验 → 入库</span><br></pre></td></tr></table></figure><p>适合需要大规模评测集的场景。众包解决数据量问题，专家审核解决质量问题，一致性检验（Kappa 系数 &gt; 0.7）解决标注一致性问题。</p><h2 id="五、评测的反模式：这些坑不要踩"><a href="#五、评测的反模式：这些坑不要踩" class="headerlink" title="五、评测的反模式：这些坑不要踩"></a>五、评测的反模式：这些坑不要踩</h2><p>在实践中，我见过太多评测做砸了的案例。总结几个典型反模式：</p><h3 id="反模式一：“准确率焦虑症”"><a href="#反模式一：“准确率焦虑症”" class="headerlink" title="反模式一：“准确率焦虑症”"></a>反模式一：“准确率焦虑症”</h3><p>只盯着准确率一个数字，忽略了其他维度。一个准确率 95% 但每次回答都需要 30 秒的客服 Agent，不如一个准确率 88% 但 3 秒内回答的。<strong>响应速度、输出格式、交互体验，都是评测维度。</strong></p><h3 id="反模式二：“实验室环境自嗨”"><a href="#反模式二：“实验室环境自嗨”" class="headerlink" title="反模式二：“实验室环境自嗨”"></a>反模式二：“实验室环境自嗨”</h3><p>在干净数据上测得很好，一遇到真实世界的脏数据就翻车。评测数据必须包含：</p><ul><li>模糊输入（“帮我看看那个数据”）</li><li>错误输入（数据格式错误、信息矛盾）</li><li>对抗输入（用户故意试探边界）</li><li>多轮上下文切换（中途换话题再换回来）</li></ul><h3 id="反模式三：“一次评测定终身”"><a href="#反模式三：“一次评测定终身”" class="headerlink" title="反模式三：“一次评测定终身”"></a>反模式三：“一次评测定终身”</h3><p>Agent 是动态系统——模型升级、Prompt 调整、知识库更新都会影响表现。评测应该是持续集成的一部分，不是一次性的验收。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">每次发布 → 自动回归测试 → 核心指标对比 → 异常告警</span><br></pre></td></tr></table></figure><h3 id="反模式四：“自己��自己”"><a href="#反模式四：“自己��自己”" class="headerlink" title="反模式四：“自己��自己”"></a>反模式四：“自己��自己”</h3><p>用 LLM 评判 LLM 的输出（LLM-as-Judge）很方便，但要注意偏差。最可靠的方案是：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">评判方式           适用场景              可信度</span><br><span class="line">──────────────────────────────────────────</span><br><span class="line">人类专家评判       高风险决策            ★★★★★</span><br><span class="line">人类 + LLM 混合    大规模评测            ★★★★</span><br><span class="line">LLM 交叉评判       快速迭代              ★★★</span><br><span class="line">单一 LLM 评判      内部 A/B 测试         ★★</span><br></pre></td></tr></table></figure><h2 id="六、一个可执行的落地路线"><a href="#六、一个可执行的落地路线" class="headerlink" title="六、一个可执行的落地路线"></a>六、一个可执行的落地路线</h2><p>如果你明天就要开始做 Agent 评测，建议按这个顺序来：</p><p><strong>第 1 周：定义岗位任务清单</strong></p><ul><li>找到目标岗位的 3 个核心任务</li><li>每个任务准备 5 个评测用例（1 简单 + 2</li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业��岗位设计评测体系才是正经事</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/31/2026-03-31-%E5%88%AB%E7%94%A8%E5%90%8C%E4%B8%80%E6%8A%8A%E5%B0%BA%E5%AD%90%E9%87%8F%E6%89%80%E6%9C%89-Agent-%E6%8C%89%E8%A1%8C%E4%B8%9A--%E5%B2%97%E4%BD%8D%E8%AE%BE%E8%AE%A1%E8%AF%84%E6%B5%8B%E4%BD%93%E7%B3%BB%E6%89%8D%E6%98%AF%E6%AD%A3%E7%BB%8F%E4%BA%8B/</id>
    <link href="https://www.coconut.xin/2026/03/31/2026-03-31-%E5%88%AB%E7%94%A8%E5%90%8C%E4%B8%80%E6%8A%8A%E5%B0%BA%E5%AD%90%E9%87%8F%E6%89%80%E6%9C%89-Agent-%E6%8C%89%E8%A1%8C%E4%B8%9A--%E5%B2%97%E4%BD%8D%E8%AE%BE%E8%AE%A1%E8%AF%84%E6%B5%8B%E4%BD%93%E7%B3%BB%E6%89%8D%E6%98%AF%E6%AD%A3%E7%BB%8F%E4%BA%8B/"/>
    <published>2026-03-31T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E4%B8%BA%E4%BB%80%E4%B9%88%E9%80%]]>
    </summary>
    <title>别用同一把尺子量所有 Agent：按行业��岗位设计评测体系才是正经事</title>
    <updated>2026-04-01T02:01:45.577Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E5%9B%9B%E4%BB%A3%E7%B3%BB%E7%BB%9F%E4%B8%80%E4%B8%AA%E5%85%AC%E5%BC%8F">一、四代系统，一个公式</a></li><li><a href="#%E4%BA%8C%E6%84%8F%E5%9B%BE%E7%90%86%E8%A7%A3%E4%BB%8E%E5%85%B3%E9%94%AE%E8%AF%8D%E5%88%B0%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E8%BF%9B%E5%8C%96%E7%9A%84%E5%8F%AA%E6%98%AF%E7%95%8C%E9%9D%A2">二、意图理解：从关键词到自然语言，进化的只是界面</a></li><li><a href="#%E4%B8%89%E5%80%99%E9%80%89%E5%8F%AC%E5%9B%9E--%E7%B2%BE%E6%8E%92%E6%B0%B8%E6%81%92%E7%9A%84%E4%B8%A4%E9%98%B6%E6%AE%B5%E8%8C%83%E5%BC%8F">三、候选召回 + 精排：永恒的两阶段范式</a><ul><li><a href="#%E6%8E%92%E5%BA%8F%E7%9A%84%E6%9C%AC%E8%B4%A8%E9%A2%84%E4%BC%B0%E4%B8%80%E4%B8%AA%E5%88%86%E6%95%B0">排序的本质：预估一个分数</a></li></ul></li><li><a href="#%E5%9B%9B%E5%8F%8D%E9%A6%88%E9%97%AD%E7%8E%AF%E6%89%80%E6%9C%89%E7%B3%BB%E7%BB%9F%E9%83%BD%E9%9D%A0%E7%94%A8%E6%88%B7%E8%A1%8C%E4%B8%BA%E8%BF%9B%E5%8C%96">四、反馈闭环：所有系统都靠”用户行为”进化</a></li><li><a href="#%E4%BA%94%E5%95%86%E4%B8%9A%E9%80%BB%E8%BE%91%E4%BB%8E%E5%8C%B9%E9%85%8D%E6%95%88%E7%8E%87%E4%B8%AD%E6%8A%BD%E7%A8%8E">五、商业逻辑：从匹配效率中抽税</a></li><li><a href="#%E5%85%AD%E4%B8%80%E5%BC%A0%E5%9B%BE%E7%9C%8B%E5%9B%9B%E4%BB%A3%E7%B3%BB%E7%BB%9F%E7%9A%84%E9%80%92%E8%BF%9B%E5%85%B3%E7%B3%BB">六、一张图看四代系统的递进关系</a></li><li><a href="#%E4%B8%83%E5%AF%B9%E4%BB%8E%E4%B8%9A%E8%80%85%E7%9A%84%E5%90%AF%E7%A4%BA">七、对从业者的启示</a><ul><li><a href="#1-%E6%90%9C%E7%B4%A2%E5%92%8C%E6%8E%A8%E8%8D%90%E7%9A%84%E7%BB%8F%E9%AA%8C%E5%8F%AF%E4%BB%A5%E7%9B%B4%E6%8E%A5%E8%BF%81%E7%A7%BB%E5%88%B0agent%E7%B3%BB%E7%BB%9F">1. 搜索和推荐的经验可以直接迁移到Agent系统</a></li><li><a href="#2-%E8%AF%84%E4%BC%B0%E6%8C%87%E6%A0%87%E5%8F%AF%E4%BB%A5%E5%80%9F%E9%89%B4">2. 评估指标可以借鉴</a></li><li><a href="#3-agent%E7%9A%84%E7%AB%9E%E4%BA%89%E5%A3%81%E5%9E%92%E5%9C%A8%E6%95%B0%E6%8D%AE%E9%A3%9E%E8%BD%AE">3. Agent的竞争壁垒在数据飞轮</a></li><li><a href="#4-%E5%95%86%E4%B8%9A%E6%A8%A1%E5%BC%8F%E7%9A%84%E7%BB%88%E5%B1%80%E6%98%AF%E6%8C%89%E6%95%88%E6%9E%9C%E4%BB%98%E8%B4%B9">4. 商业模式的终局是按效果付费</a></li></ul></li><li><a href="#%E7%BB%93%E8%AF%AD">结语</a></li></ul><p>如果你在过去二十年里分别做过搜索引擎、广告系统、推荐系统，再到今天做AI Agent，你可能会有一个越来越强烈的感觉：<strong>这不就是同一个生意吗？</strong></p><p>表面上看，Google做搜索、Meta做广告、抖音做推荐、OpenAI做Agent，四个完全不同的产品形态，四个不同的技术栈，甚至四个不同的行业叙事。但如果你把外壳剥掉，盯着底层看，会发现一个令人不安的事实：<strong>这四代系统的核心逻辑，从来没有变过。</strong></p><p>它们都在做同一件事——<strong>在信息过载的世界里，帮用户匹配到最相关的东西，然后从匹配效率的提升中抽税。</strong></p><h2 id="一、四代系统，一个公式"><a href="#一、四代系统，一个公式" class="headerlink" title="一、四代系统，一个公式"></a>一、四代系统，一个公式</h2><p>先把四代系统并排放在一起看：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">系统         用户侧            供给侧           系统做的事</span><br><span class="line">─────────   ──────────       ──────────        ──────────────</span><br><span class="line">搜索引擎     一个query         十亿个网页         匹配最相关的10条</span><br><span class="line">广告系统     一次页面展示       十万个广告主        匹配最该展示的广告</span><br><span class="line">推荐系统     一个用户画像       百万条内容          匹配最可能感兴趣的</span><br><span class="line">Agent系统    一个用户意图       千个工具和知识源     匹配最该执行的动作</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>看出来了吗？无论系统怎么进化，它始终在解决同一个问题：</p><blockquote><p><strong>从海量供给中，为特定需求，选出最优匹配。</strong></p></blockquote><p>这不是比喻。如果你把四代系统的技术架构画出来，会发现它们<strong>共享同一条流水线</strong>：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">意图理解 → 候选召回 → 精排打分 → 结果交付 → 反馈学习</span><br><span class="line">  │           │          │          │          │</span><br><span class="line">  │   搜索：Query理解    倒排索引    BM25/LTR   SERP展示    点击率</span><br><span class="line">  │   广告：用户画像     广告库匹配   CTR预估     竞价展示    转化率</span><br><span class="line">  │   推荐：兴趣建模     协同过滤     深度排序     Feed流      停留时长</span><br><span class="line">  └── Agent：意图解析    工具检索     规划选择     执行输出    任务完成率</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p><strong>五个阶段，一个没多，一个没少。</strong> 每一代系统只是把每个阶段的实现方式换了一遍，但架构的骨架从未改变。</p><h2 id="二、意图理解：从关键词到自然语言，进化的只是界面"><a href="#二、意图理解：从关键词到自然语言，进化的只是界面" class="headerlink" title="二、意图理解：从关键词到自然语言，进化的只是界面"></a>二、意图理解：从关键词到自然语言，进化的只是界面</h2><p>搜索引擎时代，用户的意图被压缩成几个关键词。你想找”北京周末适合带孩子去的博物馆”，但你输入的是”北京 博物馆 亲子”。系统要做的是<strong>从残缺的信号中猜测完整的意图</strong>——这就是Query理解、Query改写、同义词扩展存在的原因。</p><p>广告系统更极端：用户根本没有表达意图。系统要从用户的浏览历史、地理位置、设备信息中<strong>推断</strong>用户可能对什么感兴趣。这是一种没有query的搜索。</p><p>推荐系统走得更远：不仅没有显式query，连”用户正在寻找什么”这个前提都不存在。系统要从用户的行为序列中<strong>建模</strong>一个持续演化的兴趣向量——用户自己都不一定知道自己想看什么，系统替你做决定。</p><p>到了Agent系统，似乎画了一个圆：用户又开始用自然语言表达意图了——“帮我订明天下午的会议室，要有投影仪的”。但Agent要做的意图理解，远比搜索引擎复杂：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 搜索引擎的意图理解</span></span><br><span class="line"><span class="keyword">def</span> <span class="title function_">understand_search</span>(<span class="params">query: <span class="built_in">str</span></span>) -&gt; <span class="built_in">list</span>[<span class="built_in">str</span>]:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;把 query 拆成关键词和意图分类&quot;&quot;&quot;</span></span><br><span class="line">    <span class="keyword">return</span> extract_keywords(query), classify_intent(query)</span><br><span class="line"></span><br><span class="line"><span class="comment"># Agent的意图理解</span></span><br><span class="line"><span class="keyword">def</span> <span class="title function_">understand_agent</span>(<span class="params">message: <span class="built_in">str</span>, context: <span class="built_in">dict</span></span>) -&gt; ActionPlan:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;理解自然语言意图，结合上下文，生成可执行计划&quot;&quot;&quot;</span></span><br><span class="line">    intent = parse_intent(message)</span><br><span class="line">    constraints = extract_constraints(message)  <span class="comment"># 明天下午、有投影仪</span></span><br><span class="line">    history = context.get(<span class="string">&quot;conversation_history&quot;</span>, [])</span><br><span class="line">    user_prefs = context.get(<span class="string">&quot;user_preferences&quot;</span>, &#123;&#125;)</span><br><span class="line">    <span class="keyword">return</span> plan_actions(intent, constraints, history, user_prefs)</span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>进化的方向很清楚：<strong>从用户适应系统（学会输入关键词），到系统适应用户（理解自然语言）</strong>。但底层在做的事——把模糊的人类需求转化为系统可处理的结构化意图——从来没变。</p><h2 id="三、候选召回-精排：永恒的两阶段范式"><a href="#三、候选召回-精排：永恒的两阶段范式" class="headerlink" title="三、候选召回 + 精排：永恒的两阶段范式"></a>三、候选召回 + 精排：永恒的两阶段范式</h2><p>所有这四代系统都面临同一个工程约束：<strong>你不可能对所有候选都做精细评估。</strong></p><p>Google有万亿网页，你不可能用BERT对每一个网页做相关性打分。广告系统有十万个广告主，你不可能对每个广告都跑一遍CTR预估模型。推荐系统有百万条内容，你不可能对每条内容都做深度排序。</p><p>所以，所有系统都收敛到了同一个架构：<strong>先粗筛，再精排。</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">全量候选 ──[召回]──→ 千级候选 ──[粗排]──→ 百级候选 ──[精排]──→ 最终结果</span><br><span class="line"></span><br><span class="line">搜索：倒排索引           → TF-IDF初筛      → Learning to Rank</span><br><span class="line">广告：定向条件 + 预算过滤  → 粗排CTR模型     → 精排CTR + 竞价</span><br><span class="line">推荐：协同过滤 + 向量召回  → 双塔模型        → 多目标精排</span><br><span class="line">Agent：工具描述匹配       → 相关性过滤       → LLM规划与选择</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>Agent系统也逃不开这个范式。���一个Agent有1000个可用工具（tool&#x2F;function）时，你不可能把所有工具的描述都塞进LLM的prompt——context window装不下，成本也扛不住。所以Agent系统同样需要：</p><ol><li><strong>召回阶段</strong>：用embedding相似度或关键词匹配，从1000个工具中筛出20个最可能相关的</li><li><strong>精排阶段</strong>：把这20个工具的描述放进LLM的context，让LLM决定用哪个</li></ol><p>这不就是搜索引擎的倒排索引 + Learning to Rank的翻版吗？只不过”排序模型”从GBDT换成了LLM。</p><h3 id="排序的本质：预估一个分数"><a href="#排序的本质：预估一个分数" class="headerlink" title="排序的本质：预估一个分数"></a>排序的本质：预估一个分数</h3><p>更深层地看，无论是搜索的相关性排序、广告的CTR预估、推荐的兴趣匹配，还是Agent的工具选择，<strong>排序的本质都是在预估一个分数</strong>：</p><p>系统</p><p>预估的分数</p><p>含义</p><p>搜索</p><p>Relevance Score</p><p>这个文档和query有多相关</p><p>广告</p><p>pCTR × bid</p><p>这个广告被点击的概率 × 出价</p><p>推荐</p><p>P(engage)</p><p>用户会和这条内容互动的概率</p><p>Agent</p><p>P(task_success)</p><p>用这个工具能完成任务的概率</p><p>技术在变，但底层的数学抽象始终是：<strong>给候选打一个分，按分排序，取top-K。</strong> 万物皆排序，不是修辞，是工程事实。</p><h2 id="四、反馈闭环：所有系统都靠”用户行为”进化"><a href="#四、反馈闭环：所有系统都靠”用户行为”进化" class="headerlink" title="四、反馈闭环：所有系统都靠”用户行为”进化"></a>四、反馈闭环：所有系统都靠”用户行为”进化</h2><p>四代系统还有一个深层统一：<strong>它们都靠用户的隐式反馈来优化自己。</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">搜索引擎：用户点了第3条结果而不是第1条 → 调整排序模型</span><br><span class="line">广告系统：用户看了广告没点 → 降低该广告的质量分</span><br><span class="line">推荐系统：用户快速滑过某条视频 → 减少该类内容的推荐权重</span><br><span class="line">Agent：用户否决了Agent的操作建议 → 调整工具选择策略</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>这个反馈闭环的结构是完全一致的：</p><blockquote><p><strong>系统做一个决策 → 用户做出反应 → 反应被记录为信号 → 信号用于优化下一次决策</strong></p></blockquote><p>区别只在于反馈信号的丰富度和延迟：</p><ul><li>搜索的反馈最简单：点击&#x2F;不点击，毫秒级</li><li>广告的反馈稍复杂：点击、加购、转化，分钟到天级</li><li>推荐的反馈更丰富：停留时长、完播率、分享、评论，秒到小时级</li><li>Agent的反馈最复杂：任务是否完成、用户是否满意、中间步骤是否合理，可能需要整个会话结束才能评估</li></ul><p>Agent系统的反馈闭环目前是做得最差的——这也是为什么Agent的”智能”还远不如搜索和推荐系统稳定。搜索引擎有二十年的点击日志来训练排序模型，而Agent系统才刚刚开始积累反馈数据。</p><p><strong>但方向是一样的：谁能更快、更准确地闭合这个反馈环，谁的系统就进化得更快。</strong></p><h2 id="五、商业逻辑：从匹配效率中抽税"><a href="#五、商业逻辑：从匹配效率中抽税" class="headerlink" title="五、商业逻辑：从匹配效率中抽税"></a>五、商业逻辑：从匹配效率中抽税</h2><p>技术底层一致，商业逻辑自然也一致。</p><p>这四代系统的商业模式，本质上都可以用一句话概括：</p><blockquote><p><strong>在供给和需求之间充当中介，通过提升匹配效率创造价值，然后从中抽取一部分作为收入。</strong></p></blockquote><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">系统         供给方        需求方        收入来源</span><br><span class="line">─────────   ──────       ──────        ──────────────</span><br><span class="line">搜索引擎     网页/信息      找信息的人     广告（注意力变现）</span><br><span class="line">广告系统     广告主         有需求的用户   广告费（按点击/展示/转化）</span><br><span class="line">推荐系统     内容创作者      消费内容的人   广告 + 电商佣金</span><br><span class="line">Agent系统    工具/服务提供者  需要完成任务的人  订阅费 + API调用 + ?</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>有意思的是，前三代系统的商业模式已经非常成熟——它们的核心收入都来自<strong>广告</strong>或<strong>交易佣金</strong>。这两种模式的共同点是：<strong>按效果付费</strong>。广告主为点击付费，卖家为成交付费，本质上都是在为”系统帮我匹配到了对的用户”这件事买单。</p><p>Agent系统的商业模式还在探索期，但底层逻辑必然一致：<strong>谁帮用户更高效地完成了任务，谁就有资格收”匹配税”。</strong> 可能的形式包括：</p><ul><li><strong>按任务收费</strong>：完成一次订票、写一份报告，收一次费</li><li><strong>按Token收费</strong>：消耗的计算资源直接计价（当前主流）</li><li><strong>佣金模式</strong>：Agent帮你买了东西、订了服务，从交易中抽成</li><li><strong>订阅模式</strong>：月费换取无限次使用</li></ul><p>如果你从这个角度看，<strong>OpenAI的$200&#x2F;月订阅和Google的广告收入，本质上赚的是同一笔钱：帮用户从信息过载中解脱出来的”注意力溢价”。</strong></p><h2 id="六、一张图看四代系统的递进关系"><a href="#六、一张图看四代系统的递进关系" class="headerlink" title="六、一张图看四代系统的递进关系"></a>六、一张图看四代系统的递进关系</h2><p>四代系统不是并列的，是递进的。每一代都在前一代的基础上，扩展了系统的”能动性”：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br></pre></td><td class="code"><pre><span class="line">         用户主动性 ↓    系统能动性 ↑</span><br><span class="line">         ─────────────────────────────→</span><br><span class="line"></span><br><span class="line">搜索      用户主动提问 → 系统被动返回结果</span><br><span class="line">  ↓       &quot;我要找什么&quot;</span><br><span class="line">广告      系统主动展示 → 用户被动接收</span><br><span class="line">  ↓       &quot;你可能需要这个&quot;</span><br><span class="line">推荐      系统主动猜测 → 用户被动消费</span><br><span class="line">  ↓       &quot;你一定喜欢这个&quot;</span><br><span class="line">Agent     用户提出目标 → 系统主动执行</span><br><span class="line">          &quot;帮我把这件事办了&quot;</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>从搜索到Agent，变化的方向非常清晰：</p><ol><li><strong>意图表达</strong>：从残缺的关键词 → 没有显式表达 → 回到自然语言，但更完整</li><li><strong>系统输出</strong>：从返回链接列表 → 返回商品&#x2F;内容 → <strong>直接帮你执行动作</strong></li><li><strong>价值创造</strong>：从节省你的搜索时间 → 节省你的选择时间 → <strong>节省你的执行时间</strong></li></ol><p>每一代系统，都在接管用户更多的认知负担。搜索替你找，推荐替你选，Agent替你做。但底层都是同一件事：<strong>缩短”需求”到”满足”之间的距离。</strong></p><h2 id="七、对从业者的启示"><a href="#七、对从业者的启示" class="headerlink" title="七、对从业者的启示"></a>七、对从业者的启示</h2><p>如果你认同四代系统本质相同，那么有几个实用的推论：</p><h3 id="1-搜索和推荐的经验可以直接迁移到Agent系统"><a href="#1-搜索和推荐的经验可以直接迁移到Agent系统" class="headerlink" title="1. 搜索和推荐的经验可以直接迁移到Agent系统"></a>1. 搜索和推荐的经验可以直接迁移到Agent系统</h3><p>Agent系统的工具选择就是搜索，Agent的记忆管理就是用户画像，Agent的规划就是多步排序。如果你做过搜索或推荐，你已经有了做Agent系统最核心的能力。</p><h3 id="2-评估指标可以借鉴"><a href="#2-评估指标可以借鉴" class="headerlink" title="2. 评估指标可以借鉴"></a>2. 评估指标可以借鉴</h3><p>搜索用NDCG和MRR，推荐用CTR和留存，Agent系统也需要类似的定量评估框架。任务完成率、步骤效率（完成任务用了几步）、用户满意度——这些指标和搜索推荐的评估体系是同构的。</p><h3 id="3-Agent的竞争壁垒在数据飞轮"><a href="#3-Agent的竞争壁垒在数据飞轮" class="headerlink" title="3. Agent的竞争壁垒在数据飞轮"></a>3. Agent的竞争壁垒在数据飞轮</h3><p>搜索引擎的壁垒不是算法，是二十年的点击日志。推荐系统的壁垒不是模型，是海量的用户行为数据。同理，Agent系统的长期壁垒也不会是模型能力（模型会商品化），而是<strong>谁积累了最多、最高质量的”用户意图→执行路径→反馈信号”三元组。</strong></p><h3 id="4-商业模式的终局是按效果付费"><a href="#4-商业模式的终局是按效果付费" class="headerlink" title="4. 商业模式的终局是按效果付费"></a>4. 商业模式的终局是按效果付费</h3><p>搜索和推荐已经证明了：最健康的商业模式是按效果付费——用户得到了价值，系统才收费。Agent系统的商业模式最终也会收敛到这个逻辑：不是按Token收费（那只是过渡形态），而是按任务完成度收费。</p><h2 id="结语"><a href="#结语" class="headerlink" title="结语"></a>结语</h2><p>二十年前，Larry Page说”搜索引擎的终极形态是能理解你的意图并直接给出答案”。十年前，今日头条证明了”最好的搜索是不需要搜索”。今天，Agent系统正在兑现这个承诺——不仅理解你的意图，不仅给出答案，还直接帮你把事情办了。</p><p>但如果你跳出产品形态，看底层逻辑，会发现：<strong>从搜索到Agent，我们一直在做同一门生意——在信息过载的世界里，缩短需求到满足的距离，然后从效率提升中获取回报。</strong></p><p>技术在进化，但本质没有变。理解这个本质的人，无论下一代系统叫什么名字，都不会迷路。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/architecture/">architecture</a>  <a href="https://hugozhu.site/tags/search/">search</a>  <a href="https://hugozhu.site/tags/recommendation/">recommendation</a>  <a href="https://hugozhu.site/tags/advertising/">advertising</a>  <a href="https://hugozhu.site/tags/%E6%80%9D%E8%80%83/">思考</a> </p><hr><ul><li><p><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></p></li><li><p><a href="/post/2026/158-maas-core-capabilities/">AI的MaaS层最核心的能力：把一个不稳定的概率接口，变成一个可运营的服务</a></p></li><li><p><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></p></li><li><p><a href="/post/2026/159-language-math-ai-education-foundation/">素质之外，语言和数学仍然是教育的基础，是驾驭AI的底层能力</a></p></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/30/2026-03-30-%E5%90%8C%E4%B8%80%E4%B8%AA%E7%94%9F%E6%84%8F%E5%81%9A%E4%BA%86%E5%9B%9B%E9%81%8D-%E4%BB%8E%E6%90%9C%E7%B4%A2%E5%88%B0Agent-%E4%B8%87%E7%89%A9%E7%9A%86%E6%8E%92%E5%BA%8F/</id>
    <link href="https://www.coconut.xin/2026/03/30/2026-03-30-%E5%90%8C%E4%B8%80%E4%B8%AA%E7%94%9F%E6%84%8F%E5%81%9A%E4%BA%86%E5%9B%9B%E9%81%8D-%E4%BB%8E%E6%90%9C%E7%B4%A2%E5%88%B0Agent-%E4%B8%87%E7%89%A9%E7%9A%86%E6%8E%92%E5%BA%8F/"/>
    <published>2026-03-30T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E5%9B%9B%E4%BB%A3%E7%B3%BB%E7%BB%]]>
    </summary>
    <title>同一个生意做了四遍：从搜索到Agent，万物皆排序</title>
    <updated>2026-03-31T02:02:57.296Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E4%B8%80%E4%B8%AA%E8%A2%AB%E5%BF%BD%E8%A7%86%E7%9A%84%E4%BA%8B%E5%AE%9E%E6%9E%B6%E6%9E%84%E5%86%B3%E5%AE%9A%E4%BA%86%E4%BA%A7%E5%93%81%E7%9A%84%E8%A7%84%E6%A8%A1%E5%A4%A9%E8%8A%B1%E6%9D%BF%E5%92%8C%E7%94%A8%E6%88%B7%E4%BD%93%E9%AA%8C%E7%9A%84%E4%BA%A4%E4%BB%98%E6%88%90%E6%9C%AC">一、一个被忽视的事实：架构决定了产品的规模天花板和用户体验的交付成本</a></li><li><a href="#%E4%BA%8C%E5%B9%B3%E5%8F%B0%E6%BC%94%E8%BF%9B%E7%AE%80%E5%8F%B2%E4%BB%8Edesktop%E5%88%B0ai%E6%AF%8F%E4%B8%80%E4%BB%A3%E5%B9%B3%E5%8F%B0%E7%9A%84%E8%83%9C%E8%B4%9F%E9%83%BD%E5%8F%96%E5%86%B3%E4%BA%8E%E6%9E%B6%E6%9E%84">二、平台演进简史：从Desktop到AI，每一代平台的胜负都取决于架构</a><ul><li><a href="#desktop%E6%97%B6%E4%BB%A3%E6%9E%B6%E6%9E%84%E5%86%B3%E5%AE%9A%E4%BA%86%E8%B0%81%E8%83%BD%E5%BB%BA%E7%AB%8B%E8%BD%AF%E4%BB%B6%E7%94%9F%E6%80%81">Desktop时代：架构决定了谁能建立软件生态</a></li><li><a href="#web%E6%97%B6%E4%BB%A3%E6%9E%B6%E6%9E%84%E5%86%B3%E5%AE%9A%E4%BA%86%E8%B0%81%E8%83%BD%E5%A4%84%E7%90%86%E8%A7%84%E6%A8%A1">Web时代：架构决定了谁能处理规模</a></li><li><a href="#mobile%E6%97%B6%E4%BB%A3%E6%9E%B6%E6%9E%84%E5%86%B3%E5%AE%9A%E4%BA%86%E8%B0%81%E8%83%BD%E6%8B%A5%E6%9C%89%E5%BC%80%E5%8F%91%E8%80%85">Mobile时代：架构决定了谁能拥有开发者</a></li><li><a href="#ai-agent%E6%97%B6%E4%BB%A3%E6%9E%B6%E6%9E%84%E7%9A%84%E8%B5%8C%E6%B3%A8%E6%9B%B4%E5%A4%A7%E4%BA%86">AI Agent时代：架构的赌注更大了</a></li></ul></li><li><a href="#%E4%B8%89agent%E6%9E%B6%E6%9E%84%E7%9A%84%E4%BA%94%E4%B8%AA%E5%85%B3%E9%94%AE%E5%86%B3%E7%AD%96">三、Agent架构的五个关键决策</a><ul><li><a href="#%E5%86%B3%E7%AD%96%E4%B8%80%E7%BC%96%E6%8E%92%E6%96%B9%E5%BC%8F%E7%A1%AC%E7%BC%96%E7%A0%81-vs-%E5%8A%A8%E6%80%81%E8%A7%84%E5%88%92">决策一：编排方式——硬编码 vs. 动态规划</a></li><li><a href="#%E5%86%B3%E7%AD%96%E4%BA%8C%E7%8A%B6%E6%80%81%E7%AE%A1%E7%90%86%E6%97%A0%E7%8A%B6%E6%80%81-vs-%E6%9C%89%E8%AE%B0%E5%BF%86">决策二：状态管理——无状态 vs. 有记忆</a></li><li><a href="#%E5%86%B3%E7%AD%96%E4%B8%89%E5%B7%A5%E5%85%B7%E4%BD%93%E7%B3%BB%E5%B0%81%E9%97%AD-vs-%E5%BC%80%E6%94%BE">决策三：工具体系——封闭 vs. 开放</a></li><li><a href="#%E5%86%B3%E7%AD%96%E5%9B%9B%E5%A4%9A%E6%A8%A1%E5%9E%8B%E5%8D%8F%E4%BD%9C%E5%8D%95%E8%84%91-vs-%E5%A4%9A%E8%84%91">决策四：多模型协作——单脑 vs. 多脑</a></li><li><a href="#%E5%86%B3%E7%AD%96%E4%BA%94%E9%83%A8%E7%BD%B2%E6%9E%B6%E6%9E%84%E4%BA%91%E7%AB%AF-vs-%E7%AB%AF%E4%BE%A7-vs-%E6%B7%B7%E5%90%88">决策五：部署架构——云端 vs. 端侧 vs. 混合</a></li></ul></li><li><a href="#%E5%9B%9B%E6%9E%B6%E6%9E%84%E6%98%AF%E5%B8%82%E5%9C%BA%E7%AB%9E%E4%BA%89%E7%9A%84%E4%B9%98%E6%95%B0%E6%95%88%E5%BA%94">四、架构是市场竞争的乘数效应</a><ul><li><a href="#%E8%BF%AD%E4%BB%A3%E9%80%9F%E5%BA%A6%E7%9A%84%E4%B9%98%E6%95%B0">迭代速度的乘数</a></li><li><a href="#%E6%88%90%E6%9C%AC%E7%BB%93%E6%9E%84%E7%9A%84%E4%B9%98%E6%95%B0">成本结构的乘数</a></li><li><a href="#%E8%83%BD%E5%8A%9B%E6%89%A9%E5%B1%95%E7%9A%84%E4%B9%98%E6%95%B0">能力扩展的乘数</a></li></ul></li><li><a href="#%E4%BA%94%E5%BD%93%E5%89%8Dagent%E5%B8%82%E5%9C%BA%E7%9A%84%E6%9E%B6%E6%9E%84%E5%88%86%E9%87%8E">五、当前Agent市场的架构分野</a></li><li><a href="#%E5%85%AD%E7%BB%93%E8%AF%AD%E6%9E%B6%E6%9E%84%E6%98%AF%E5%86%99%E7%BB%99%E6%9C%AA%E6%9D%A5%E7%9A%84%E6%89%BF%E8%AF%BA">六、结语：架构是写给未来的承诺</a></li></ul><p>每一代平台级产品的竞争，最终都不是功能之争，而是<strong>架构之争</strong>。Windows赢了OS&#x2F;2，不是因为功能更多，而是因为它的架构让第三方开发者能更容易地构建应用。iOS赢了Symbian，不是因为初期功能更强，而是因为它的架构从第一天就为触控交互和应用生态设计。Chrome赢了IE，不是因为它一开始更快，而是因为多进程架构让它在页面崩溃时不会拖垮整个浏览器。</p><p>现在，AI Agent正在成为从Desktop、Web、Mobile之后的第四代平台级产品。而历史正在重演：<strong>决定谁能赢的，不是谁的模型更强、谁的功能更多，而是谁的架构更对。</strong></p><h2 id="一、一个被忽视的事实：架构决定了产品的规模天花板和用户体验的交付成本"><a href="#一、一个被忽视的事实：架构决定了产品的规模天花板和用户体验的交付成本" class="headerlink" title="一、一个被忽视的事实：架构决定了产品的规模天花板和用户体验的交付成本"></a>一、一个被忽视的事实：架构决定了产品的规模天花板和用户体验的交付成本</h2><p>很多技术讨论把架构当作纯工程问题——选什么语言、用什么框架、数据库怎么分片。但对于平台级产品来说，架构是一个<strong>商业问题</strong>，因为它直接决定两件事：</p><p><strong>第一，产品能做多大。</strong></p><p>架构决定了系统的扩展方式。一个monolithic架构的Agent，把模型调用、工具执行、记忆管理、会话状态全部耦合在一个进程里，初期开发确实快。但当你要支持100个工具、10种模型、百万级用户时，你会发现每加一个功能都要改动核心代码，每次部署都是全量发布，每个bug都可能影响所有用户。</p><p>这不是”技术债”，这是<strong>架构的物理极限</strong>。就像一栋楼的承重结构决定了它最多能盖多少层——不是你想加就能加的。</p><p><strong>第二，用户体验的交付成本。</strong></p><p>架构决定了你做一个功能改进需要花多大力气。好的架构下，加一个新工具可能只需要写一个插件，不碰核心代码；坏的架构下，加一个新工具可能要改三层抽象、更新五个接口、重新测试整个系统。</p><p>用户不关心你的架构，但用户能感知到架构的后果：<strong>为什么这个功能等了三个月还没上？为什么每次更新都会出新bug？为什么竞品已经支持了你们还没有？</strong> 这些问题的根源，往往都在架构上。</p><p>用一个公式来表达：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">用户体验 = f(团队能力, 架构效率)</span><br><span class="line"></span><br><span class="line">当团队能力相当时：</span><br><span class="line">  好架构 → 快速迭代 → 持续优化体验 → 用户增长</span><br><span class="line">  坏架构 → 迭代变慢 → 体验停滞 → 用户流失</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>这就是为什么同样融了一亿美金的两家AI公司，一家能每周发新功能，另一家三个月才更新一次。不是人不够多，不是模型不够好，而是架构效率的差距在指数级放大。</p><h2 id="二、平台演进简史：从Desktop到AI，每一代平台的胜负都取决于架构"><a href="#二、平台演进简史：从Desktop到AI，每一代平台的胜负都取决于架构" class="headerlink" title="二、平台演进简史：从Desktop到AI，每一代平台的胜负都取决于架构"></a>二、平台演进简史：从Desktop到AI，每一代平台的胜负都取决于架构</h2><p>回顾过去40年的平台演进史，有一个清晰的规律：<strong>每一代平台的早期竞争靠功能，中期竞争靠生态，而生态的繁荣程度取决于架构。</strong></p><h3 id="Desktop时代：架构决定了谁能建立软件生态"><a href="#Desktop时代：架构决定了谁能建立软件生态" class="headerlink" title="Desktop时代：架构决定了谁能建立软件生态"></a>Desktop时代：架构决定了谁能建立软件生态</h3><p>1980-90年代，PC操作系统混战。IBM的OS&#x2F;2技术上比Windows更先进——支持真正的多任务、更好的内存管理、更稳定。但Windows赢了。为什么？</p><p>因为Windows的架构做了一个关键决策：<strong>向后兼容 + 开放的API + 低门槛的开发工具</strong>。任何一个小开发者都能用Visual Basic写一个Windows应用，而OS&#x2F;2的开发门槛高得多。结果就是Windows上的应用数量爆发式增长，应用多→用户多→开发者更多，飞轮转起来了。</p><p>OS&#x2F;2的架构更”正确”，但Windows的架构更”开放”。在平台竞争中，开放性比正确性更重要。</p><h3 id="Web时代：架构决定了谁能处理规模"><a href="#Web时代：架构决定了谁能处理规模" class="headerlink" title="Web时代：架构决定了谁能处理规模"></a>Web时代：架构决定了谁能处理规模</h3><p>2000年代，互联网平台崛起。Google能处理全球的搜索请求，不是因为它的算法一开始就比Yahoo强多少，而是因为它从第一天就设计了<strong>分布式架构</strong>——MapReduce、GFS、Bigtable。这套架构让Google能在廉价硬件上水平扩展，而当时的竞争对手还在用昂贵的大型服务器垂直扩展。</p><p>Facebook打败MySpace，一个关键因素是Facebook从早期就建立了<strong>数据中心级的架构能力</strong>，能够在不崩溃的前提下支撑指数级的用户增长。MySpace在技术栈上的选择（ASP.NET+SQL Server的单体架构）让它在用户暴增时不断宕机，用户体验急剧恶化。</p><p>Web时代的教训：<strong>你的架构决定了你能服务多少用户，而用户数量决定了你在网络效应驱动的市场里能走多远。</strong></p><h3 id="Mobile时代：架构决定了谁能拥有开发者"><a href="#Mobile时代：架构决定了谁能拥有开发者" class="headerlink" title="Mobile时代：架构决定了谁能拥有开发者"></a>Mobile时代：架构决定了谁能拥有开发者</h3><p>2007年iPhone发布时，它甚至不支持第三方应用。但苹果做了一个关键的架构决策：<strong>设计一套完整的应用沙箱架构和API体系（Cocoa Touch + App Store + 严格的审核机制）</strong>。这套架构让开发者能够在安全的环境里构建高质量应用，同时让用户能够信任和方便地安装这些应用。</p><p>Android选择了另一条路：<strong>开源的Linux内核 + 开放的SDK + 宽松的应用分发</strong>。这让Android快速覆盖了中低端市场，建立了更大的设备安装量。</p><p>两种架构，两条路径，但共同点是：<strong>架构的核心设计决策都围绕”如何让开发者更容易在这个平台上构建应用”</strong>。Symbian、BlackBerry、Windows Phone的失败，根本原因都是架构不能有效地支撑第三方生态。</p><h3 id="AI-Agent时代：架构的赌注更大了"><a href="#AI-Agent时代：架构的赌注更大了" class="headerlink" title="AI Agent时代：架构的赌注更大了"></a>AI Agent时代：架构的赌注更大了</h3><p>现在轮到Agent了。但Agent时代的架构挑战比前三代平台都大，因为：</p><ol><li><p><strong>不确定性是内生的</strong>。Desktop&#x2F;Web&#x2F;Mobile的底层是确定性的计算——给定输入，输出可预测。Agent的底层是大模型——给定输入，输出是概率性的。你的架构必须处理这种根本性的不确定性。</p></li><li><p><strong>交互模式是开放的</strong>。前三代平台的交互模式相对固定：Desktop是WIMP（窗口、图标、菜单、指针），Web是页面+链接，Mobile是触控+手势。Agent的交互是自然语言——用户可以说任何话，Agent需要理解并执行。</p></li><li><p><strong>能力边界是动态的</strong>。一个Mobile应用的功能在发布时就确定了。但一个Agent的能力取决于它能调用哪些工具、连接哪些服务、使用哪些模型——这些都可以动态变化。</p></li></ol><p>这意味着Agent的架构不能简单地借鉴前三代平台的经验。它需要原生地解决三个前所未有的问题：<strong>概率性输出的可靠化、开放式交互的结构化、动态能力的可管理化。</strong></p><h2 id="三、Agent架构的五个关键决策"><a href="#三、Agent架构的五个关键决策" class="headerlink" title="三、Agent架构的五个关键决策"></a>三、Agent架构的五个关键决策</h2><p>如果你在今天设计一个Agent产品的架构，有五个决策会决定你的产品能走多远。</p><h3 id="决策一：编排方式——硬编码-vs-动态规划"><a href="#决策一：编排方式——硬编码-vs-动态规划" class="headerlink" title="决策一：编排方式——硬编码 vs. 动态规划"></a>决策一：编排方式——硬编码 vs. 动态规划</h3><p>最基础的架构决策：Agent收到一个任务后，怎么决定”先做什么、再做什么”？</p><p><strong>硬编码流程（Workflow）</strong>：把任务分解成固定的步骤，用代码写死执行顺序。比如”用户问天气→调天气API→格式化输出→返回”。这种方式可控、可预测、容易调试，但灵活性差——每加一个新场景就要写新的流程代码。</p><p><strong>动态规划（Autonomous Agent）</strong>：让模型自己决定执行步骤。ReAct、Plan-and-Execute、Tree of Thoughts等框架都属于这一类。灵活性极高，但可控性差——你不知道模型会做出什么决策，成本不可预测，还可能陷入死循环。</p><p><strong>正确答案是混合架构</strong>：关键路径用编排保证可靠性，长尾场景用动态规划保证灵活性。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line">┌────────���───────────────────────────────┐</span><br><span class="line">│              用户请求                    │</span><br><span class="line">├────────────────────────────────────────┤</span><br><span class="line">│         意图识别与路由（确定性）          │</span><br><span class="line">├──────────────┬─────────────────────────┤</span><br><span class="line">│ 高频已知场景  │     低频/复杂场景         │</span><br><span class="line">│ （编排流程）  │   （动态规划）            │</span><br><span class="line">│              │                         │</span><br><span class="line">│ 步骤1→2→3   │  模型自主分解任务          │</span><br><span class="line">│ 确定性执行    │  动态选择工具             │</span><br><span class="line">│ 可预测成本    │  自我纠错                │</span><br><span class="line">│ 快速响应      │  成本上限控制             │</span><br><span class="line">└──────────────┴─────────────────────────┘</span><br></pre></td></tr></table></figure><p>这个决策为什么关键？因为它直接影响了<strong>用户体验的一致性</strong>。全部用动态规划，用户会发现”同样的问题，有时回答得很好，有时答非所问”——这种不确定性在消费级产品中是致命的。全部用硬编码，用户会发现”这个Agent只能做几件固定的事”——那它和一个普通App有什么区别？</p><h3 id="决策二：状态管理——无状态-vs-有记忆"><a href="#决策二：状态管理——无状态-vs-有记忆" class="headerlink" title="决策二：状态管理——无状态 vs. 有记忆"></a>决策二：状态管理——无状态 vs. 有记忆</h3><p>人类助理之所以好用，一个关键原因是他<strong>记得之前发生的事</strong>。你不需要每次开会都重新介绍自己的项目背景。</p><p>Agent的记忆架构决定了它能不能提供这种持续改进的体验：</p><ul><li><strong>会话记忆</strong>：当前对话的上下文。最基础的能力，但受限于context window大小。</li><li><strong>短期记忆</strong>：跨会话但有时效的信息。比如”用户今天早上提到下午要开会”。</li><li><strong>长期记忆</strong>：用户的偏好、习惯、历史行为。比如”这个用户喜欢简洁的回答”“这个用户是Python开发者”。</li><li><strong>工作记忆</strong>：当前任务的中间状态。比如Agent正在执行一个多步骤任务，中间步骤的结果需要暂存。</li></ul><p>大部分Agent产品只做了会话记忆，少数做了长期记忆，几乎没有人把工作记忆做好。但<strong>工作记忆恰恰是Agent从”聊天机器人”进化为”真正的助手”的关键</strong>——它让Agent能处理跨越时间的复杂任务，而不是只能回答即时的问题。</p><p>状态管理的架构选择还直接影响了<strong>成本结构</strong>。把所有历史对话都塞进context window是最简单的实现，但也是最昂贵的——每次请求都带上完整历史，token成本线性增长。好的记忆架构需要做到<strong>选择性召回</strong>：只把与当前任务相关的记忆注入上下文，而不是全量加载。</p><h3 id="决策三：工具体系——封闭-vs-开放"><a href="#决策三：工具体系——封闭-vs-开放" class="headerlink" title="决策三：工具体系——封闭 vs. 开放"></a>决策三：工具体系——封闭 vs. 开放</h3><p>Agent的价值取决于它能做什么，而它能做什么取决于它能调用哪些工具。</p><p><strong>封闭工具体系</strong>：所有工具由Agent平台官方提供和维护。质量可控，但覆盖面有限——你永远不可能预见所有用户的需求。</p><p><strong>开放工具体系</strong>：提供标准化的工具接口（类似MCP这样的协议），允许第三方开发者构建和发布工具。覆盖面广，但质量参差不齐，安全风险增大。</p><p>这个决策本质上是在重演Mobile时代的App Store之争：<strong>iOS的封闭审核 vs. Android的开放市场</strong>。历史告诉我们，纯封闭和纯开放都不是最优解——你需要<strong>开放的接口 + 标准化的协议 + 分层的信任机制</strong>。</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 一个好的工具架构需要分层</span></span><br><span class="line"><span class="keyword">class</span> <span class="title class_">ToolRegistry</span>:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;</span></span><br><span class="line"><span class="string">    三层信任模型：</span></span><br><span class="line"><span class="string">    - 内置工具(builtin): 平台提供，完全信任，无需用户确认</span></span><br><span class="line"><span class="string">    - 认证工具(verified): 第三方开发，平台审核，首次使用需用户授权</span></span><br><span class="line"><span class="string">    - 社区工具(community): 社区贡献，未审核，每次使用需用户确认</span></span><br><span class="line"><span class="string">    &quot;&quot;&quot;</span></span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">execute</span>(<span class="params">self, tool_call, trust_level</span>):</span><br><span class="line">        <span class="keyword">if</span> trust_level == <span class="string">&quot;builtin&quot;</span>:</span><br><span class="line">            <span class="keyword">return</span> <span class="variable language_">self</span>._execute_directly(tool_call)</span><br><span class="line">        <span class="keyword">elif</span> trust_level == <span class="string">&quot;verified&quot;</span>:</span><br><span class="line">            <span class="keyword">if</span> <span class="variable language_">self</span>._user_has_authorized(tool_call):</span><br><span class="line">                <span class="keyword">return</span> <span class="variable language_">self</span>._execute_in_sandbox(tool_call)</span><br><span class="line">            <span class="keyword">else</span>:</span><br><span class="line">                <span class="keyword">return</span> <span class="variable language_">self</span>._request_authorization(tool_call)</span><br><span class="line">        <span class="keyword">elif</span> trust_level == <span class="string">&quot;community&quot;</span>:</span><br><span class="line">            <span class="keyword">return</span> <span class="variable language_">self</span>._execute_with_confirmation(tool_call)</span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>为什么这个决策是关键的架构选择而不只是产品决策？因为工具的接入方式、调用方式、权限模型、沙箱机制——这些都需要在架构层面设计好。事后改造的成本极高，而且很容易留下安全漏洞。</p><h3 id="决策四：多模型协作——单脑-vs-多脑"><a href="#决策四：多模型协作——单脑-vs-多脑" class="headerlink" title="决策四：多模型协作——单脑 vs. 多脑"></a>决策四：多模型协作——单脑 vs. 多脑</h3><p>当前大多数Agent产品的架构是”单脑”——一个模型负责所有事情：理解用户意图、规划任务、调用工具、生成回答。这就像让一个人同时当CEO、工程师、客服和会计。</p><p>更高效的架构是<strong>多模型协作</strong>：</p><ul><li><strong>路由模型（小而快）</strong>：快速判断用户意图，决定分发到哪个专项模型</li><li><strong>规划模型（强推理）</strong>：分解复杂任务，制定执行计划</li><li><strong>执行模型（专项能力）</strong>：代码生成用代码模型，图像理解用视觉模型</li><li><strong>验证模型（质量把关）</strong>：检查输出质量，发现错误，决定是否需要重做</li><li><strong>摘要模型（低成本）</strong>：压缩历史上下文，管理记忆</li></ul><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br></pre></td><td class="code"><pre><span class="line">              ┌──────────┐</span><br><span class="line">              │ 路由模型  │ (Haiku级, &lt;100ms)</span><br><span class="line">              │ 意图分类  │</span><br><span class="line">              └────┬─────┘</span><br><span class="line">                   │</span><br><span class="line">      ┌────────────┼────────────┐</span><br><span class="line">      ▼            ▼            ▼</span><br><span class="line">┌──────────┐ ┌──────────┐ ┌──────────┐</span><br><span class="line">│ 简单问答  │ │ 复杂任务  │ │ 代码任务  │</span><br><span class="line">│ (Haiku)  │ │ (Opus)   │ │ (Sonnet) │</span><br><span class="line">└──────────┘ └────┬─────┘ └──────────┘</span><br><span class="line">                  │</span><br><span class="line">             ┌────┴─────┐</span><br><span class="line">             │ 规划模型  │ (Opus级)</span><br><span class="line">             │ 任务分解  │</span><br><span class="line">             └────┬─────┘</span><br><span class="line">                  │</span><br><span class="line">             ┌────┴─────┐</span><br><span class="line">             │ 验证模型  │ (Sonnet级)</span><br><span class="line">             │ 质量检查  │</span><br><span class="line">             └──────────┘</span><br></pre></td></tr></table></figure><p>多模型架构的核心价值不只是省钱（虽然确实能省很多），更重要的是<strong>每个环节都用最合适的模型，整体效果好于用一个通用模型做所有事</strong>。这和人类组织的分工原理一样——专业化带来效率。</p><p>但多模型架构的实现难度远高于单模型。模型之间的信息传递、上下文共享、错误传播、延迟叠加——每一个都是工程挑战。这就是为什么它是一个架构决策而不是一个简单的优化：你必须从一开始就把多模型协作设计进架构里，否则后期改造的代价是推倒重来。</p><h3 id="决策五：部署架构——云端-vs-端侧-vs-混合"><a href="#决策五：部署架构——云端-vs-端侧-vs-混合" class="headerlink" title="决策五：部署架构——云端 vs. 端侧 vs. 混合"></a>决策五：部署架构——云端 vs. 端侧 vs. 混合</h3><p>Agent在哪里运行？这个看似基础设施的问题，实际上深刻影响着用户体验和商业模式。</p><p><strong>纯云端</strong>：所有计算在服务器上完成。优点是模型能力不受设备限制，缺点是延迟高、隐私性差、离线不可用。</p><p><strong>纯端侧</strong>：Agent运行在用户设备上。优点是低延迟、强隐私、离线可用，缺点是受限于设备算力，只能用小模型。</p><p><strong>混合架构</strong>：端侧处理高频低复杂度请求（意图识别、简单回答），云端处理低频高复杂度请求（深度推理、多步任务）。这是用户体验和能力上限的最佳平衡点。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br></pre></td><td class="code"><pre><span class="line">端侧 (手机/PC)                           云端</span><br><span class="line">┌─────────────────┐                 ┌─────────────────┐</span><br><span class="line">│ 小模型 (3B)     │                 │ 大模型 (Opus)   │</span><br><span class="line">│ - 意图识别      │  ── 复杂请求 ──▶ │ - 深度推理      │</span><br><span class="line">│ - 简单回答      │                 │ - 多步任务      │</span><br><span class="line">│ - 上下文缓存    │ ◀── 结果回传 ── │ - 工具调用      │</span><br><span class="line">│ - 隐私数据处理  │                 │ - 模型协作      │</span><br><span class="line">└─────────────────┘                 └─────────────────┘</span><br><span class="line">   延迟: &lt;100ms                        延迟: 1-10s</span><br><span class="line">   成本: 0                             成本: 按token</span><br><span class="line">   隐私: 数据不出设备                    隐私: 需传输数据</span><br></pre></td></tr></table></figure><p>苹果的Apple Intelligence选择了混合架构，端侧用3B模型处理简单请求，云端用更大的模型处理复杂请求。这个架构决策很可能为整个行业定下了基调——<strong>未来的Agent产品大概率都会走向端云混合架构</strong>，区别只在于端侧和云端的能力分界线画在哪里。</p><h2 id="四、架构是市场竞争的乘数效应"><a href="#四、架构是市场竞争的乘数效应" class="headerlink" title="四、架构是市场竞争的乘数效应"></a>四、架构是市场竞争的乘数效应</h2><p>前面讨论了架构的五个关键决策，但还没有回答一个根本问题：<strong>为什么说架构是竞争的关键因素，而不仅仅是工程效率的问题？</strong></p><p>因为架构产生<strong>乘数效应</strong>。</p><h3 id="迭代速度的乘数"><a href="#迭代速度的乘数" class="headerlink" title="迭代速度的乘数"></a>迭代速度的乘数</h3><p>好架构让团队的迭代速度更快。在Agent领域，迭代速度是生死线——模型在进化、用户需求在变化、竞争对手在追赶。一个月发布一个新能力的团队和一周发布一个新能力的团队，一年后的差距不是4倍，而是可能是几十倍——因为快速迭代带来的用户反馈又会加速下一轮迭代。</p><h3 id="成本结构的乘数"><a href="#成本结构的乘数" class="headerlink" title="成本结构的乘数"></a>成本结构的乘数</h3><p>Agent产品的边际成本不是零——每次调用都消耗模型token。架构决定了你的成本结构：单模型架构下，成本随用户数线性增长（甚至超线性，因为上下文越来越长）；多模型+缓存+路由架构下，成本增长曲线可以被压平。</p><p>当你的竞争对手每个用户每月花$5的模型成本，而你只需要$1，你就有4倍的空间来做免费增长或者提供更好的体验。这不是一个小优势——在烧钱换增长的阶段，成本效率决定了谁能活到盈利。</p><h3 id="能力扩展的乘数"><a href="#能力扩展的乘数" class="headerlink" title="能力扩展的乘数"></a>能力扩展的乘数</h3><p>开放的工具架构让你的Agent能力呈指数增长——不是你自己的团队在增加能力，而是整个开发者社区在为你增加能力。就像App Store让iPhone从”一部手机”变成了”一个无限可能的平台”，开放的Agent工具生态可以让一个Agent从”一个聊天机器人”变成”一个能做任何事的数字助手”。</p><p>但这种生态效应<strong>只有在架构支持的前提下才能发生</strong>。如果你的工具接入方式是硬编码的、非标准化的，每接入一个新工具都需要改核心代码——那你永远建不起生态。</p><h2 id="五、当前Agent市场的架构分野"><a href="#五、当前Agent市场的架构分野" class="headerlink" title="五、当前Agent市场的架构分野"></a>五、当前Agent市场的架构分野</h2><p>看看今天的Agent市场，可以清晰地看到不同玩家的架构选择正在塑造竞争格局：</p><p><strong>ChatGPT&#x2F;Claude</strong>：从对话界面起步，逐步增加工具调用能力。架构的核心优势是强大的基座模型，挑战是如何从”对话产品”演进为”平台产品”——这需要根本性的架构重构，而不只是加功能。</p><p><strong>Cursor&#x2F;Claude Code&#x2F;Windsurf</strong>：以代码为核心场景的Agent。架构的核心创新是<strong>把IDE作为Agent的执行环境</strong>，让Agent能直接读写文件、运行命令、操作开发工具。这个架构选择极大地降低了Agent在编程场景下的”最后一公里”成本。</p><p><strong>Manus&#x2F;Devin</strong>：定位为通用&#x2F;专项自主Agent。架构赌注是<strong>高度自主的任务执行</strong>——用户给一个目标，Agent自主完成。这个架构的挑战在于可靠性——自主度越高，失败的爆炸半径越大。</p><p><strong>Apple Intelligence</strong>：端云混合架构的先行者。架构赌注是<strong>隐私为先的本地化处理</strong>。这个选择牺牲了一部分能力上限，但赢得了用户信任——在隐私敏感的市场里，这可能是决定性的优势。</p><p>每一种架构选择都在押注不同的未来：对话范式 vs. 工具范式，云端 vs. 端侧，封闭 vs. 开放，通用 vs. 垂直。<strong>这些赌注不能在产品上线后轻易改变——因为它们是架构级的决策。</strong></p><h2 id="六、结语：架构是写给未来的承诺"><a href="#六、结语：架构是写给未来的承诺" class="headerlink" title="六、结语：架构是写给未来的承诺"></a>六、结语：架构是写给未来的承诺</h2><p>总结这篇文章的三个核心观点：</p><p><strong>1. 架构决定了产品的规模和用户体验的交付成本。</strong> 好架构不是让你现在更强，而是让你未来能更快地变强。坏架构不是让你现在更弱，而是让你未来越来越慢、越来越脆弱。</p><p><strong>2. Agent是继Desktop、Web、Mobile之后发展最快的平台级产品。</strong> 但它面临的架构挑战比前三代都大——因为它必须在概率性的模型之上构建确定性的用户体验，在开放式的交互中提供结构化的价值。</p><p><strong>3. Agent的架构是市场竞争的关键乘数。</strong> 它放大（或缩小）团队的迭代速度、成本效率、生态扩展能力。在一个技术快速变化的市场里，这种乘数效应会随时间累积，最终决定谁能胜出。</p><p>对于正在构建Agent产品的团队，我的建议是：<strong>在前三个月，花至少一个月的时间在架构上。</strong> 不是画漂亮的架构图，而是认真回答那五个关键决策，并且在每个决策上做出有意识的选择——而不是无意识地滑入最容易的实现方式。</p><p>因为架构是你写给未来的承诺。它决定了当市场机会来临时，你能不能接得住。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/agent/">Agent</a>  <a href="https://hugozhu.site/tags/architecture/">architecture</a>  <a href="https://hugozhu.site/tags/platform/">platform</a>  <a href="https://hugozhu.site/tags/%E6%80%9D%E8%80%83/">思考</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/158-maas-core-capabilities/">AI的MaaS层最核心的能力：把一个不稳定的概率接口，变成一个可运营的服务</a></li><li><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/29/2026-03-29-Agent%E7%9A%84%E6%9E%B6%E6%9E%84%E4%B9%8B%E6%88%98-%E4%BB%8EDesktop%E5%88%B0AI%E6%97%B6%E4%BB%A3-%E6%9E%B6%E6%9E%84%E5%86%B3%E5%AE%9A%E5%B9%B3%E5%8F%B0%E7%9A%84%E7%94%9F%E6%AD%BB/</id>
    <link href="https://www.coconut.xin/2026/03/29/2026-03-29-Agent%E7%9A%84%E6%9E%B6%E6%9E%84%E4%B9%8B%E6%88%98-%E4%BB%8EDesktop%E5%88%B0AI%E6%97%B6%E4%BB%A3-%E6%9E%B6%E6%9E%84%E5%86%B3%E5%AE%9A%E5%B9%B3%E5%8F%B0%E7%9A%84%E7%94%9F%E6%AD%BB/"/>
    <published>2026-03-29T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E4%B8%80%E4%B8%AA%E8%A2%AB%E5%BF%]]>
    </summary>
    <title>Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</title>
    <updated>2026-04-01T02:01:46.154Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#ai-%E5%81%9A%E7%9A%84%E4%B8%8D%E6%98%AF%E7%AD%94%E6%A1%88">“AI 做的”不是答案</a></li><li><a href="#%E5%8F%AF%E8%BF%BD%E8%B4%A3%E4%B8%8D%E6%98%AF%E4%BA%8B%E5%90%8E%E6%97%A5%E5%BF%97%E6%98%AF%E8%AE%BE%E8%AE%A1%E5%8E%9F%E5%88%99">可追责不是事后日志，是设计原则</a><ul><li><a href="#1-%E8%B0%81%E6%8E%88%E6%9D%83%E4%BA%86%E8%BF%99%E4%B8%AA%E8%A1%8C%E4%B8%BAauthorization-chain">1. 谁授权了这个行为？（Authorization Chain）</a></li><li><a href="#2-%E8%B0%81%E5%AE%9A%E4%B9%89%E4%BA%86%E8%BE%B9%E7%95%8Cboundary-ownership">2. 谁定义了边界？（Boundary Ownership）</a></li><li><a href="#3-%E8%B0%81%E5%9C%A8%E7%9B%91%E6%8E%A7%E8%BF%90%E8%A1%8C%E6%97%B6runtime-accountability">3. 谁在监控运行时？（Runtime Accountability）</a></li><li><a href="#4-%E5%87%BA%E4%BA%86%E9%97%AE%E9%A2%98%E8%B0%81%E6%9D%A5%E5%AE%9A%E8%B4%A3incident-attribution">4. 出了问题谁来定责？（Incident Attribution）</a></li></ul></li><li><a href="#%E5%AE%9E%E9%99%85%E8%90%BD%E5%9C%B0%E7%9A%84%E4%B8%89%E4%B8%AA%E5%B1%82%E6%AC%A1">实际落地的三个层次</a><ul><li><a href="#%E7%AC%AC%E4%B8%80%E5%B1%82%E6%93%8D%E4%BD%9C%E5%AE%A1%E8%AE%A1%E5%A4%A7%E5%A4%9A%E6%95%B0%E4%BC%81%E4%B8%9A%E5%9C%A8%E8%BF%99%E9%87%8C">第一层：操作审计（大多数企业在这里）</a></li><li><a href="#%E7%AC%AC%E4%BA%8C%E5%B1%82%E5%86%B3%E7%AD%96%E6%BA%AF%E6%BA%90%E5%B0%91%E6%95%B0%E4%BC%81%E4%B8%9A%E5%9C%A8%E6%8E%A2%E7%B4%A2">第二层：决策溯源（少数企业在探索）</a></li><li><a href="#%E7%AC%AC%E4%B8%89%E5%B1%82%E8%B4%A3%E4%BB%BB%E6%9E%B6%E6%9E%84%E7%9B%AE%E6%A0%87%E7%8A%B6%E6%80%81">第三层：责任架构（目标状态）</a></li></ul></li><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E8%AE%A9-ai-%E6%9B%B4%E5%87%86%E4%B8%8D%E8%83%BD%E6%9B%BF%E4%BB%A3%E8%BF%BD%E8%B4%A3%E5%88%B0%E4%BA%BA">为什么”让 AI 更准”不能替代”追责到人”</a></li><li><a href="#%E7%BB%99%E6%AD%A3%E5%9C%A8%E8%90%BD%E5%9C%B0-agent-%E7%9A%84%E5%9B%A2%E9%98%9F%E7%9A%84%E5%BB%BA%E8%AE%AE">给正在落地 Agent 的团队的建议</a></li><li><a href="#%E7%BB%93%E8%AF%AD">结语</a></li></ul><p>上周一个真实案例：某电商公司的 AI Agent 自动调整了 2000 个 SKU 的定价策略，导致部分商品以成本价以下售出，一天亏了 80 万。复盘会上，所有人面面相觑——</p><p>运营说：“我没动过，是 AI 自动调的。” 技术说：“模型输出没问题，是数据源有异常。” 数据团队说：“数据是实时抓取的，跟我们无关。”</p><p><strong>没有一个人为这 80 万负责。</strong></p><p>这不是个例。当 AI 从”辅助工具”升级为”执行主体”，一个被企业严重低估的问题出现了：<strong>出了事，找谁？</strong></p><h2 id="“AI-做的”不是答案"><a href="#“AI-做的”不是答案" class="headerlink" title="“AI 做的”不是答案"></a>“AI 做的”不是答案</h2><p>在传统软件系统中，每个操作都有明确的执行者。运营点了”发布”，就是运营的责任；审批人签了字，就是审批人的责任。责任链条清晰，追溯简单。</p><p>但 AI Agent 打破了这条链。</p><p>一个 Agent 的一次执行，背后可能涉及：</p><ul><li><strong>提出需求的业务方</strong>——“帮我自动优化定价”</li><li><strong>配置策略的运营</strong>——设定了调价幅度和频率</li><li><strong>开发 Agent 的技术团队</strong>——写了 Prompt 和工具调用逻辑</li><li><strong>提供数据的数据团队</strong>——对接了商品和竞品数据源</li><li><strong>部署和运维的平台团队</strong>——负责 Agent 运行环境和权限</li></ul><p>当 Agent 做了一个错误决策，这五个角色都可以说”不是我的问题”。<strong>责任被分散在整条链路上，最后没有人承担。</strong></p><p>这就是 AI 治理中最危险的状态：<strong>系统有能力做决策，但组织中没有人为这些决策负责。</strong></p><h2 id="可追责不是事后日志，是设计原则"><a href="#可追责不是事后日志，是设计原则" class="headerlink" title="可追责不是事后日志，是设计原则"></a>可追责不是事后日志，是设计原则</h2><p>很多团队以为”可追责”就是多打点日志、保存 Prompt 和模型输出。这只是最表层的一步。</p><p>真正的可追责系统，需要在架构层面回答四个问题：</p><h3 id="1-谁授权了这个行为？（Authorization-Chain）"><a href="#1-谁授权了这个行为？（Authorization-Chain）" class="headerlink" title="1. 谁授权了这个行为？（Authorization Chain）"></a>1. 谁授权了这个行为？（Authorization Chain）</h3><p>每一次 Agent 的高风险操作，必须能追溯到一个具体的人类授权者。这不是指用户登录的那个人，而是指<strong>谁决定了 Agent 可以做这件事</strong>。</p><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 定价 Agent 的授权链</span></span><br><span class="line"><span class="attr">action:</span> <span class="string">adjust_price</span></span><br><span class="line"><span class="attr">agent:</span> <span class="string">pricing-optimizer</span></span><br><span class="line"><span class="attr">authorized_by:</span> <span class="string">&quot;张三 (运营总监)&quot;</span>          <span class="comment"># 谁批准了这个 Agent 的上线</span></span><br><span class="line"><span class="attr">policy_set_by:</span> <span class="string">&quot;李四 (品类运营)&quot;</span>          <span class="comment"># 谁设定了调价策略参数</span></span><br><span class="line"><span class="attr">boundary_approved_by:</span> <span class="string">&quot;王五 (财务总监)&quot;</span>   <span class="comment"># 谁批准了调价幅度上限</span></span><br><span class="line"><span class="attr">last_policy_review:</span> <span class="string">&quot;2026-03-15&quot;</span>          <span class="comment"># 上次策略复审时间</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>关键设计：<strong>不是记录”AI 做了什么”，而是记录”谁让 AI 可以这么做”。</strong></p><p>当出了问题，追责路径清晰：</p><ul><li>如果 Agent 做了超出策略范围的事 → 技术团队的问题（Agent 实现有 bug）</li><li>如果策略范围本身设得不合理 → 设定策略的运营的责任</li><li>如果策略合理但业务场景变了没更新 → 审批策略的管理层需要解释为什么没有定期复审</li></ul><h3 id="2-谁定义了边界？（Boundary-Ownership）"><a href="#2-谁定义了边界？（Boundary-Ownership）" class="headerlink" title="2. 谁定义了边界？（Boundary Ownership）"></a>2. 谁定义了边界？（Boundary Ownership）</h3><p>每个 Agent 都必须有明确的<strong>行为边界</strong>，而每个边界都必须有一个人类 owner。</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">class</span> <span class="title class_">AgentBoundary</span>:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;Agent 行为边界定义 —— 每条规则绑定一个责任人&quot;&quot;&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">__init__</span>(<span class="params">self</span>):</span><br><span class="line">        <span class="variable language_">self</span>.rules = [</span><br><span class="line">            &#123;</span><br><span class="line">                <span class="string">&quot;rule&quot;</span>: <span class="string">&quot;单次调价幅度不超过 15%&quot;</span>,</span><br><span class="line">                <span class="string">&quot;owner&quot;</span>: <span class="string">&quot;李四&quot;</span>,                      <span class="comment"># 谁定的这条规则</span></span><br><span class="line">                <span class="string">&quot;owner_role&quot;</span>: <span class="string">&quot;品类运营负责人&quot;</span>,</span><br><span class="line">                <span class="string">&quot;approved_date&quot;</span>: <span class="string">&quot;2026-03-01&quot;</span>,</span><br><span class="line">                <span class="string">&quot;next_review&quot;</span>: <span class="string">&quot;2026-04-01&quot;</span>,          <span class="comment"># 强制复审日期</span></span><br><span class="line">                <span class="string">&quot;rationale&quot;</span>: <span class="string">&quot;历史数据显示超过15%的调价导致退货率飙升&quot;</span></span><br><span class="line">            &#125;,</span><br><span class="line">            &#123;</span><br><span class="line">                <span class="string">&quot;rule&quot;</span>: <span class="string">&quot;单日累计影响 SKU 不超过 500&quot;</span>,</span><br><span class="line">                <span class="string">&quot;owner&quot;</span>: <span class="string">&quot;王五&quot;</span>,</span><br><span class="line">                <span class="string">&quot;owner_role&quot;</span>: <span class="string">&quot;财务总监&quot;</span>,</span><br><span class="line">                <span class="string">&quot;approved_date&quot;</span>: <span class="string">&quot;2026-03-01&quot;</span>,</span><br><span class="line">                <span class="string">&quot;next_review&quot;</span>: <span class="string">&quot;2026-04-01&quot;</span>,</span><br><span class="line">                <span class="string">&quot;rationale&quot;</span>: <span class="string">&quot;控制单日最大潜在损失在可接受范围&quot;</span></span><br><span class="line">            &#125;</span><br><span class="line">        ]</span><br><span class="line">    <span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p><strong>核心原则：没有 owner 的边界等于没有边界。</strong> 如果一条规则没人愿意签字负责，那这条规则就不应该存在——要么它不重要（删掉），要么它太重要以至于没人敢负责（那就不应该让 Agent 做这件事）。</p><h3 id="3-谁在监控运行时？（Runtime-Accountability）"><a href="#3-谁在监控运行时？（Runtime-Accountability）" class="headerlink" title="3. 谁在监控运行时？（Runtime Accountability）"></a>3. 谁在监控运行时？（Runtime Accountability）</h3><p>Agent 运行过程中，必须有明确的”值班人”概念——不是系统运维的值班，而是<strong>业务结果的值班</strong>。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br></pre></td><td class="code"><pre><span class="line">┌─────────────────────────────────────────┐</span><br><span class="line">│          Agent 运行时责任体系            │</span><br><span class="line">├─────────────────────────────────────────┤</span><br><span class="line">│                                         │</span><br><span class="line">│   触发操作 ──→ 风险评估 ──→ 执行        │</span><br><span class="line">│       │            │           │        │</span><br><span class="line">│       ▼            ▼           ▼        │</span><br><span class="line">│   记录触发源    判定风险等级   记录结果  │</span><br><span class="line">│   (谁/什么      (低/中/高)    (成功/    │</span><br><span class="line">│    触发的)          │         异常)      │</span><br><span class="line">│                    │                    │</span><br><span class="line">│          ┌────────┼────────┐            │</span><br><span class="line">│          ▼        ▼        ▼            │</span><br><span class="line">│        低风险   中风险    高风险         │</span><br><span class="line">│        自动执行  通知值班人  值班人审批   │</span><br><span class="line">│        事后可查  15分钟响应  实时阻断     │</span><br><span class="line">│                                         │</span><br><span class="line">│   值班人：有明确排班，轮转记录在案      │</span><br><span class="line">│   不响应 = 自动拦截 + 升级              │</span><br><span class="line">└─────────────────────────────────────────┘</span><br></pre></td></tr></table></figure><p>这里的关键不是技术实现，而是<strong>组织设计</strong>：必须有一个具体的人，在 Agent 运行的每一刻，为它的行为承担最终责任。就像自动驾驶汽车——不管自动化程度多高，方向盘后面必须坐着一个人。</p><h3 id="4-出了问题谁来定责？（Incident-Attribution）"><a href="#4-出了问题谁来定责？（Incident-Attribution）" class="headerlink" title="4. 出了问题谁来定责？（Incident Attribution）"></a>4. 出了问题谁来定责？（Incident Attribution）</h3><p>事故发生后，追责流程必须能在 30 分钟内回答：<strong>这是谁的责任？</strong></p><p>设计一套标准化的归因框架：</p><p>故障类型</p><p>归因逻辑</p><p>典型责任方</p><p>Agent 执行了边界外的操作</p><p>技术实现问题</p><p>Agent 开发团队</p><p>Agent 在边界内执行但结果不好</p><p>策略&#x2F;边界设定问题</p><p>边界 Owner</p><p>边界合理但场景已变化</p><p>复审机制失效</p><p>审批管理层</p><p>外部数据异常导致错误判断</p><p>数据质量&#x2F;监控问题</p><p>数据团队</p><p>值班人未响应告警</p><p>运营流程问题</p><p>值班人及其管理者</p><p><strong>每一类故障都有且仅有一个首要责任方。</strong> 不允许”多方共同承担”这种模糊表述——共同承担 &#x3D; 没人承担。</p><h2 id="实际落地的三个层次"><a href="#实际落地的三个层次" class="headerlink" title="实际落地的三个层次"></a>实际落地的三个层次</h2><h3 id="第一层：操作审计（大多数企业在这里）"><a href="#第一层：操作审计（大多数企业在这里）" class="headerlink" title="第一层：操作审计（大多数企业在这里）"></a>第一层：操作审计（大多数企业在这里）</h3><p>记录 Agent 的每一次操作，包括输入、输出、调用的工具、影响的数据。这是基础，但远远不够——它只能告诉你”发生了什么”，不能告诉你”这是谁的责任”。</p><h3 id="第二层：决策溯源（少数企业在探索）"><a href="#第二层：决策溯源（少数企业在探索）" class="headerlink" title="第二层：决策溯源（少数企业在探索）"></a>第二层：决策溯源（少数企业在探索）</h3><p>不仅记录操作，还记录<strong>决策链路</strong>：这个操作是基于什么策略、什么数据、什么上下文做出的？策略是谁设定的？数据是从哪来的？上下文是否完整？</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">class</span> <span class="title class_">DecisionTrace</span>:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;每一次 Agent 决策的完整溯源记录&quot;&quot;&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">record</span>(<span class="params">self, decision</span>):</span><br><span class="line">        <span class="keyword">return</span> &#123;</span><br><span class="line">            <span class="string">&quot;decision_id&quot;</span>: generate_id(),</span><br><span class="line">            <span class="string">&quot;timestamp&quot;</span>: now(),</span><br><span class="line">            <span class="string">&quot;agent_id&quot;</span>: decision.agent_id,</span><br><span class="line"></span><br><span class="line">            <span class="comment"># 决策依据</span></span><br><span class="line">            <span class="string">&quot;input_data&quot;</span>: decision.input_snapshot,        <span class="comment"># 输入数据快照</span></span><br><span class="line">            <span class="string">&quot;policy_version&quot;</span>: decision.policy_ref,        <span class="comment"># 使用的策略版本</span></span><br><span class="line">            <span class="string">&quot;model_version&quot;</span>: decision.model_ref,          <span class="comment"># 模型版本</span></span><br><span class="line">            <span class="string">&quot;prompt_hash&quot;</span>: decision.prompt_hash,          <span class="comment"># Prompt 指纹</span></span><br><span class="line"></span><br><span class="line">            <span class="comment"># 责任链</span></span><br><span class="line">            <span class="string">&quot;triggered_by&quot;</span>: decision.trigger_source,      <span class="comment"># 谁/什么触发的</span></span><br><span class="line">            <span class="string">&quot;policy_owner&quot;</span>: decision.policy_owner,        <span class="comment"># 策略责任人</span></span><br><span class="line">            <span class="string">&quot;boundary_owner&quot;</span>: decision.boundary_owner,    <span class="comment"># 边界责任人</span></span><br><span class="line">            <span class="string">&quot;on_duty&quot;</span>: decision.current_on_duty,          <span class="comment"># 当时的值班人</span></span><br><span class="line"></span><br><span class="line">            <span class="comment"># 执行结果</span></span><br><span class="line">            <span class="string">&quot;action_taken&quot;</span>: decision.action,</span><br><span class="line">            <span class="string">&quot;affected_scope&quot;</span>: decision.impact_summary,</span><br><span class="line">            <span class="string">&quot;risk_score&quot;</span>: decision.risk_assessment,</span><br><span class="line">        &#125;</span><br><span class="line">    <span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><h3 id="第三层：责任架构（目标状态）"><a href="#第三层：责任架构（目标状态）" class="headerlink" title="第三层：责任架构（目标状态）"></a>第三层：责任架构（目标状态）</h3><p>将追责能力设计到组织架构中：</p><ul><li><strong>每个 Agent 有一个业务 Owner</strong>，对 Agent 的业务结果负责——不是技术负责人，是业务负责人</li><li><strong>每个策略有 Review 周期</strong>，到期未 Review 自动降级 Agent 权限</li><li><strong>每次高风险操作有审批人</strong>，审批记录不可篡改</li><li><strong>事故归因有标准流程</strong>，30 分钟内可定位首要责任人</li></ul><h2 id="为什么”让-AI-更准”不能替代”追责到人”"><a href="#为什么”让-AI-更准”不能替代”追责到人”" class="headerlink" title="为什么”让 AI 更准”不能替代”追责到人”"></a>为什么”让 AI 更准”不能替代”追责到人”</h2><p>有人会说：与其花精力搞追责，不如把 AI 做得更准，错误率降到足够低不就行了？</p><p><strong>这是一个危险的错觉。</strong></p><p>第一，AI 的错误率永远不会是零。即使 99.9% 的准确率，在每天执行 10 万次操作的场景下，每天仍然有 100 次错误。</p><p>第二，AI 的错误模式跟人类不同。人类犯错是渐进的、分散的，容易被同事发现和纠正。AI 犯错是瞬间的、批量的、高度一致的——在你反应过来之前，错误已经扩散到整个系统。</p><p>第三，也是最根本的：<strong>追责的目的不是惩罚，而是闭环。</strong> 当没有人为 Agent 的行为负责时，就没有人有动力去改进策略、更新边界、完善监控。系统会在一个看似正常实则脆弱的状态下运行，直到某一天突然崩溃。</p><p><strong>可追责性不是对 AI 的约束，是对组织的保护。</strong></p><h2 id="给正在落地-Agent-的团队的建议"><a href="#给正在落地-Agent-的团队的建议" class="headerlink" title="给正在落地 Agent 的团队的建议"></a>给正在落地 Agent 的团队的建议</h2><ol><li><p><strong>先定责任，再写代码。</strong> 在开发任何 Agent 之前，先确定：这个 Agent 出了错，谁来负责？如果这个问题回答不了，就不应该开发。</p></li><li><p><strong>每个 Agent 必须有且仅有一个业务 Owner。</strong> 不是”团队负责”，是某个具体的人。这个人有权随时关闭 Agent。</p></li><li><p><strong>“AI 做的”在组织里不应该是一个合法的答案。</strong> 要建立文化：AI 做的每一件事，都有一个人在为它背书。</p></li><li><p><strong>设计降级机制。</strong> 当追责链路断裂时（比如值班人未响应、策略过期未审批），Agent 必须自动降级到安全模式，而不是继续全速运行。</p></li><li><p><strong>定期做”追责演练”。</strong> 就像消防演习，定期模拟 Agent 事故，看是否能在 30 分钟内定位到责任人。如果不能，说明追责体系有漏洞。</p></li></ol><h2 id="结语"><a href="#结语" class="headerlink" title="结语"></a>结语</h2><p>AI 的能力在飞速进步，但企业治理的进化速度远远跟不上。</p><p>今天大多数企业在 Agent 落地时的思路还是：<strong>先跑起来，出了事再说。</strong> 但历史反复证明，“出了事再说”的系统在出事后，往往找不到人来”说”。</p><p><strong>可追责性不是 Agent 做好了之后的锦上添花，而是 Agent 能不能上线的前提条件。</strong></p><p>你不会允许一个不知道向谁汇报的员工上岗。同样，你也不应该允许一个出了问题找不到责任人的 AI Agent 上线。</p><p>设计系统时请记住：<strong>技术越强大，追责越重要。不是因为你不信任 AI，而是因为你必须保护用好 AI 的人。</strong></p><p><a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/enterprise/">enterprise</a>  <a href="https://hugozhu.site/tags/%E5%AE%89%E5%85%A8/">安全</a>  <a href="https://hugozhu.site/tags/%E6%B2%BB%E7%90%86/">治理</a>  <a href="https://hugozhu.site/tags/%E6%9E%B6%E6%9E%84%E8%AE%BE%E8%AE%A1/">架构设计</a>  <a href="https://hugozhu.site/tags/accountability/">accountability</a> </p><hr><ul><li><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></li><li><a href="/post/2026/156-agent-vs-model-boundary/">模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</a></li><li><a href="/post/2026/154-tob-agent-failure-not-capability-but-closed-loop/">To B Agent 失败的根本原因：不是能力问题，是没有把 Agent 变成默认路径</a></li><li><a href="/post/2026/153-wukong-llm-governable-execution-system/">悟空的真正价值：把LLM变成可治理的执行系统</a></li><li><a href="/post/2026/152-agent-security-ai-native-execution-control/">Agent安全是企业安全的新命题——用AI管AI的执行控制体系</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/161-enterprise-ai-accountability-by-design/">企业级 AI 必须设计成出错后可以追责到人</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/29/2026-03-29-%E4%BC%81%E4%B8%9A%E7%BA%A7-AI-%E5%BF%85%E9%A1%BB%E8%AE%BE%E8%AE%A1%E6%88%90%E5%87%BA%E9%94%99%E5%90%8E%E5%8F%AF%E4%BB%A5%E8%BF%BD%E8%B4%A3%E5%88%B0%E4%BA%BA/</id>
    <link href="https://www.coconut.xin/2026/03/29/2026-03-29-%E4%BC%81%E4%B8%9A%E7%BA%A7-AI-%E5%BF%85%E9%A1%BB%E8%AE%BE%E8%AE%A1%E6%88%90%E5%87%BA%E9%94%99%E5%90%8E%E5%8F%AF%E4%BB%A5%E8%BF%BD%E8%B4%A3%E5%88%B0%E4%BA%BA/"/>
    <published>2026-03-29T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#ai-%E5%81%9A%E7%9A%84%E4%B8%8D%E6%98%AF%E7%]]>
    </summary>
    <title>企业级 AI 必须设计成出错后可以追责到人</title>
    <updated>2026-03-30T02:03:04.000Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E5%85%88%E7%90%86%E8%A7%A3%E9%97%AE%E9%A2%98%E8%A3%B8%E8%B0%83%E6%A8%A1%E5%9E%8Bapi%E7%9A%84%E4%BA%94%E4%B8%AA%E8%87%B4%E5%91%BD%E7%9F%AD%E6%9D%BF">一、先理解问题：裸调模型API的五个致命短板</a></li><li><a href="#%E4%BA%8C%E6%A0%B8%E5%BF%83%E8%83%BD%E5%8A%9B%E4%B8%80%E6%A8%A1%E5%9E%8B%E6%8A%BD%E8%B1%A1%E4%B8%8E%E6%99%BA%E8%83%BD%E8%B7%AF%E7%94%B1">二、核心能力一：模型抽象与智能路由</a><ul><li><a href="#%E6%8C%89%E8%83%BD%E5%8A%9B%E8%B7%AF%E7%94%B1">按能力路由</a></li><li><a href="#%E6%8C%89%E6%88%90%E6%9C%AC%E8%B7%AF%E7%94%B1">按成本路由</a></li><li><a href="#%E6%8C%89%E5%8F%AF%E7%94%A8%E6%80%A7%E8%B7%AF%E7%94%B1fallback">按可用性路由（Fallback）</a></li></ul></li><li><a href="#%E4%B8%89%E6%A0%B8%E5%BF%83%E8%83%BD%E5%8A%9B%E4%BA%8C%E5%8F%AF%E9%9D%A0%E6%80%A7%E5%B7%A5%E7%A8%8B">三、核心能力二：可靠性工程</a><ul><li><a href="#%E6%99%BA%E8%83%BD%E9%87%8D%E8%AF%95">智能重试</a></li><li><a href="#%E7%86%94%E6%96%AD%E4%B8%8E%E9%99%8D%E7%BA%A7">熔断与降级</a></li><li><a href="#%E8%B6%85%E6%97%B6%E7%AE%A1%E7%90%86">超时管理</a></li></ul></li><li><a href="#%E5%9B%9B%E6%A0%B8%E5%BF%83%E8%83%BD%E5%8A%9B%E4%B8%89%E8%AF%AD%E4%B9%89%E7%BC%93%E5%AD%98">四、核心能力三：语义缓存</a></li><li><a href="#%E4%BA%94%E6%A0%B8%E5%BF%83%E8%83%BD%E5%8A%9B%E5%9B%9B%E5%8F%AF%E8%A7%82%E6%B5%8B%E6%80%A7">五、核心能力四：可观测性</a><ul><li><a href="#%E8%AF%B7%E6%B1%82%E7%BA%A7%E5%88%AB%E6%AF%8F%E6%AC%A1%E8%B0%83%E7%94%A8%E5%8F%91%E7%94%9F%E4%BA%86%E4%BB%80%E4%B9%88">请求级别：每次调用发生了什么</a></li><li><a href="#%E4%B8%9A%E5%8A%A1%E7%BA%A7%E5%88%AB%E8%BF%99%E4%BA%9B%E8%B0%83%E7%94%A8%E7%9A%84%E6%95%88%E6%9E%9C%E5%A6%82%E4%BD%95">业务级别：这些调用的效果如何</a></li><li><a href="#%E7%B3%BB%E7%BB%9F%E7%BA%A7%E5%88%AB%E6%95%B4%E4%BD%93%E6%9C%8D%E5%8A%A1%E7%9A%84%E5%81%A5%E5%BA%B7%E7%8A%B6%E5%86%B5">系统级别：整体服务的健康状况</a></li></ul></li><li><a href="#%E5%85%AD%E6%A0%B8%E5%BF%83%E8%83%BD%E5%8A%9B%E4%BA%94%E6%B5%81%E9%87%8F%E6%B2%BB%E7%90%86%E4%B8%8E%E5%AE%89%E5%85%A8">六、核心能力五：流量治理与安全</a><ul><li><a href="#%E5%A4%9A%E7%A7%9F%E6%88%B7%E9%9A%94%E7%A6%BB">多租户隔离</a></li><li><a href="#%E5%86%85%E5%AE%B9%E5%AE%89%E5%85%A8">内容安全</a></li></ul></li><li><a href="#%E4%B8%83maas%E5%B1%82%E7%9A%84%E6%9C%AC%E8%B4%A8ai%E5%BA%94%E7%94%A8%E7%9A%84%E5%8F%AF%E9%9D%A0%E6%80%A7%E4%B8%AD%E9%97%B4%E4%BB%B6">七、MaaS层的本质：AI应用的可靠性中间件</a></li><li><a href="#%E5%85%AB%E6%80%8E%E4%B9%88%E5%88%A4%E6%96%AD%E4%BD%A0%E7%9A%84maas%E5%B1%82%E5%A4%9F%E4%B8%8D%E5%A4%9F%E7%94%A8">八、怎么判断你的MaaS层够不够用</a></li></ul><p>很多人对MaaS（Model as a Service）的理解停留在”套一层API”——把OpenAI的接口包一下，加个Key管理，做个用量统计，就叫MaaS了。如果这就是MaaS的全部，那它确实没什么技术含量，随便一个API Gateway就能干。</p><p>但现实是：<strong>几乎所有在生产环境跑AI应用的团队，最终都会自建或依赖一个MaaS层。</strong> 不是因为他们闲，而是因为裸调模型API在生产环境里根本撑不住。</p><p>MaaS层真正要解决的问题是：<strong>把一个概率性的、无状态的、昂贵的模型API调用，变成一个可靠的、可观测的、成本可控的服务。</strong></p><h2 id="一、先理解问题：裸调模型API的五个致命短板"><a href="#一、先理解问题：裸调模型API的五个致命短板" class="headerlink" title="一、先理解问题：裸调模型API的五个致命短板"></a>一、先理解问题：裸调模型API的五个致命短板</h2><p>在聊MaaS的核心能力之前，先看清楚它要解决什么问题。直接调用模型API（无论是OpenAI、Anthropic还是国内的各家大模型），在生产环境会遇到五个硬伤：</p><p><strong>1. 可用性不确定</strong></p><p>模型API不是数据库，不是Redis，不能假设它”永远在线”。限流、超时、服务降级、区域故障——这些在传统基础设施里偶尔发生的事，在模型API里是常态。某个provider的某个模型突然返回503，你的整个业务链路就断了。</p><p><strong>2. 成本不可预测</strong></p><p>一个GPT-4o的请求和一个Haiku的请求，成本可以差50倍。但很多场景下，用Haiku就够了，你却用了GPT-4o——不是因为你不知道，而是因为你没有一个层来做这个判断和路由。更隐蔽的成本黑洞是重复请求：同一个prompt反复调用，每次都花钱。</p><p><strong>3. 质量不可控</strong></p><p>模型的输出是概率性的。同一个请求，今天返回的结果和明天返回的可能完全不同。你的应用上线后，模型provider悄悄更新了模型版本，你的下游解析逻辑突然全部报错——你连发生了什么都不知道。</p><p><strong>4. 可观测性为零</strong></p><p>大多数模型API的日志只有”请求成功&#x2F;失败”。但你真正需要知道的是：这次请求花了多少token？延迟是多少？输出质量怎么样？哪个prompt模板的效果最好？哪些请求可以用更便宜的模型替代？这些信息，裸调API一个都拿不到。</p><p><strong>5. 供应商锁定</strong></p><p>今天用OpenAI，明天Claude出了更好的模型，后天Google放出了性价比更高的方案。如果你的代码里到处都是<code>openai.chat.completions.create()</code>，切换成本是灾难性的。</p><p>MaaS层的核心能力，就是系统性地解决这五个问题。</p><h2 id="二、核心能力一：模型抽象与智能路由"><a href="#二、核心能力一：模型抽象与智能路由" class="headerlink" title="二、核心能力一：模型抽象与智能路由"></a>二、核心能力一：模型抽象与智能路由</h2><p>MaaS层最基础也最关键的能力是<strong>把”选哪个模型”这件事从业务代码里抽出来</strong>。</p><p>这不是简单的接口统一。真正有价值的模型路由包含三层决策：</p><h3 id="按能力路由"><a href="#按能力路由" class="headerlink" title="按能力路由"></a>按能力路由</h3><p>不同的任务对模型能力的要求不同：</p><ul><li>简单的文本分类、实体提取 → 小模型就够（Haiku、GPT-4o-mini）</li><li>复杂推理、代码生成 → 需要强模型（Opus、GPT-4o）</li><li>多模态理解 → 需要支持视觉的模型</li><li>长文档处理 → 需要大上下文窗口的模型</li></ul><p>一个好的MaaS层能根据请求的特征（任务类型、输入长度、所需能力标签）自动选择最合适的模型，而不是把这个决策丢给每个业务开发者。</p><h3 id="按成本路由"><a href="#按成本路由" class="headerlink" title="按成本路由"></a>按成本路由</h3><p>这是MaaS层最直接的经济价值。一个真实的例子：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line">场景：客服系统每天处理10万次对话</span><br><span class="line"></span><br><span class="line">路由前：全部用 GPT-4o</span><br><span class="line">  → 平均每次 2000 tokens × $5/M tokens = $1,000/天</span><br><span class="line"></span><br><span class="line">路由后：70%简单问题用 Haiku，30%复杂问题用 Opus</span><br><span class="line">  → 70,000 × 2000 tokens × $0.25/M + 30,000 × 2000 tokens × $15/M</span><br><span class="line">  → $35 + $900 = $935/天（仅省6.5%）</span><br><span class="line"></span><br><span class="line">更激进的路由：70%用Haiku，20%用Sonnet，10%用Opus</span><br><span class="line">  → 70,000 × $0.25/M × 2K + 20,000 × $3/M × 2K + 10,000 × $15/M × 2K</span><br><span class="line">  → $35 + $120 + $300 = $455/天（省55%）</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>关键洞察：<strong>大多数请求不需要最强的模型。</strong> 一个好的路由策略能在几乎不损失质量的前提下，把成本砍掉一半以上。</p><h3 id="按可用性路由（Fallback）"><a href="#按可用性路由（Fallback）" class="headerlink" title="按可用性路由（Fallback）"></a>按可用性路由（Fallback）</h3><p>当首选模型不可用时，自动切换到备选模型：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">优先级链：Claude Opus → GPT-4o → DeepSeek-V3 → Qwen-Max</span><br><span class="line">触发条件：超时 &gt; 30s / HTTP 5xx / 限流 429</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>这看起来简单，但实现起来有很多细节：Fallback之后prompt格式要不要调整？不同模型的system prompt约束是否兼容？切换后质量下降是否可接受？这些都是MaaS层需要处理的。</p><h2 id="三、核心能力二：可靠性工程"><a href="#三、核心能力二：可靠性工程" class="headerlink" title="三、核心能力二：可靠性工程"></a>三、核心能力二：可靠性工程</h2><p>模型API不是一个可靠的服务。MaaS层要做的，就是<strong>在一个不可靠的底层之上，构建出可靠的上层</strong>。</p><p>这和传统微服务架构的可靠性工程异曲同工，但有模型API独有的特点：</p><h3 id="智能重试"><a href="#智能重试" class="headerlink" title="智能重试"></a>智能重试</h3><p>不是所有失败都应该重试。MaaS层需要区分：</p><ul><li><strong>可重试的失败</strong>：网络超时、429限流、503暂时不可用 → 指数退避重试</li><li><strong>不可重试的失败</strong>：400参数错误、401认证失败、上下文超长 → 立即报错</li><li><strong>需要变更后重试的</strong>：上下文超长 → 自动截断后重试；内容审查被拒 → 调整prompt后重试</li></ul><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 一个MaaS层的重试决策伪代码</span></span><br><span class="line"><span class="keyword">def</span> <span class="title function_">should_retry</span>(<span class="params">error, attempt</span>):</span><br><span class="line">    <span class="keyword">if</span> error.status == <span class="number">429</span>:</span><br><span class="line">        wait = error.headers.get(<span class="string">&#x27;retry-after&#x27;</span>, <span class="number">2</span> ** attempt)</span><br><span class="line">        <span class="keyword">return</span> RetryAfter(wait)</span><br><span class="line">    <span class="keyword">if</span> error.status <span class="keyword">in</span> (<span class="number">500</span>, <span class="number">502</span>, <span class="number">503</span>):</span><br><span class="line">        <span class="keyword">return</span> RetryAfter(<span class="number">2</span> ** attempt)</span><br><span class="line">    <span class="keyword">if</span> error.status == <span class="number">400</span> <span class="keyword">and</span> <span class="string">&#x27;context_length&#x27;</span> <span class="keyword">in</span> error.message:</span><br><span class="line">        <span class="keyword">return</span> RetryWithModification(truncate_context)</span><br><span class="line">    <span class="keyword">return</span> DoNotRetry(error)</span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><h3 id="熔断与降级"><a href="#熔断与降级" class="headerlink" title="熔断与降级"></a>熔断与降级</h3><p>当某个模型provider持续故障时，不能让请求一直打上去等超时。MaaS层需要熔断机制：</p><ul><li>连续N次失败 → 熔断，流量切到备选模型</li><li>每隔一段时间放一个探测请求 → 检测是否恢复</li><li>恢复后逐步放量 → 避免雪崩</li></ul><h3 id="超时管理"><a href="#超时管理" class="headerlink" title="超时管理"></a>超时管理</h3><p>模型API的延迟分布和传统API完全不同。传统API的P99可能是P50的2-3倍，但模型API的P99可能是P50的10倍以上——因为长输出、复杂推理、queue排队都会导致极端延迟。</p><p>MaaS层需要针对模型特点设计超时策略：首token超时（检测排队是否过长）、流式传输中断超时（检测生成是否卡住）、总体超时（兜底保护）。</p><h2 id="四、核心能力三：语义缓存"><a href="#四、核心能力三：语义缓存" class="headerlink" title="四、核心能力三：语义缓存"></a>四、核心能力三：语义缓存</h2><p>传统的HTTP缓存基于URL和参数的精确匹配。但模型请求的特点是：<strong>语义相同的请求，文本可能完全不同。</strong></p><p>“帮我总结这篇文章”和”请概括一下这篇文章的要点”是同一个请求吗？从字符串角度看完全不同，从语义角度看几乎一样。</p><p>MaaS层的语义缓存需要：</p><ol><li><strong>Embedding-based匹配</strong>：把请求转成向量，在向量空间中查找相似的历史请求</li><li><strong>结果有效期管理</strong>：不是所有缓存都应该永久有效，需要根据请求类型设定TTL</li><li><strong>缓存命中的质量校验</strong>：语义相似不代表答案可复用，需要有置信度阈值</li></ol><p>语义缓存的投入产出比极高。在实际业务中，大量请求是”换个说法问同一个问题”。一个好的语义缓存能把模型API的实际调用量降低30-50%，直接反映在成本和延迟上。</p><h2 id="五、核心能力四：可观测性"><a href="#五、核心能力四：可观测性" class="headerlink" title="五、核心能力四：可观测性"></a>五、核心能力四：可观测性</h2><p>这是最容易被忽视、但在生产环境里最关键的能力。</p><p>MaaS层需要提供三个层次的可观测性：</p><h3 id="请求级别：每次调用发生了什么"><a href="#请求级别：每次调用发生了什么" class="headerlink" title="请求级别：每次调用发生了什么"></a>请求级别：每次调用发生了什么</h3><ul><li>使用了哪个模型（包括是否触发了Fallback）</li><li>输入&#x2F;输出token数量</li><li>首token延迟（TTFT）和总延迟</li><li>请求是否命中缓存</li><li>是否触发了重试，重试了几次</li></ul><h3 id="业务级别：这些调用的效果如何"><a href="#业务级别：这些调用的效果如何" class="headerlink" title="业务级别：这些调用的效果如何"></a>业务级别：这些调用的效果如何</h3><ul><li>不同prompt模板的输出质量对比</li><li>不同模型在同一任务上的表现对比</li><li>用户满意度与模型选择的关联</li><li>输出被下游成功解析的比例（结构化输出的格式正确率）</li></ul><h3 id="系统级别：整体服务的健康状况"><a href="#系统级别：整体服务的健康状况" class="headerlink" title="系统级别：整体服务的健康状况"></a>系统级别：整体服务的健康状况</h3><ul><li>各provider的可用率和延迟趋势</li><li>成本消耗速率和预算预警</li><li>Token使用量的分布（哪些业务在消耗最多的token）</li><li>异常模式检测（突然的成本飙升、某个provider的延迟异常增大）</li></ul><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br></pre></td><td class="code"><pre><span class="line">┌─────────────────────────────────────────────────────────┐</span><br><span class="line">│                   MaaS 可观测性                          │</span><br><span class="line">├─────────┬─────────────────────┬─────────────────────────┤</span><br><span class="line">│ 请求级   │ 业务级               │ 系统级                   │</span><br><span class="line">├─────────┼─────────────────────┼─────────────────────────┤</span><br><span class="line">│ 模型选择 │ Prompt模板效果       │ Provider可用率            │</span><br><span class="line">│ Token数  │ 任务成功率           │ 成本消耗趋势              │</span><br><span class="line">│ 延迟分布 │ 模型间质量对比       │ Token使用分布             │</span><br><span class="line">│ 缓存命中 │ 格式正确率           │ 异常检测                  │</span><br><span class="line">│ 重试次数 │ 用户满意度           │ 预算预警                  │</span><br><span class="line">└─────────┴─────────────────────┴─────────────────────────┘</span><br></pre></td></tr></table></figure><p>没有可观测性的MaaS就像没有仪表盘的飞机——能飞，但你不知道飞到哪了，也不知道什么时候会掉下来。</p><h2 id="六、核心能力五：流量治理与安全"><a href="#六、核心能力五：流量治理与安全" class="headerlink" title="六、核心能力五：流量治理与安全"></a>六、核心能力五：流量治理与安全</h2><h3 id="多租户隔离"><a href="#多租户隔离" class="headerlink" title="多租户隔离"></a>多租户隔离</h3><p>一个MaaS层通常服务多个业务方。某个业务方突然搞了一波大促，请求量暴增，不能把其他业务方的额度也耗光了。MaaS层需要：</p><ul><li>按租户的配额管理（Token限额、请求频率限制、预算上限）</li><li>优先级调度（核心业务的请求优先处理）</li><li>公平排队（避免大请求饿死小请求）</li></ul><h3 id="内容安全"><a href="#内容安全" class="headerlink" title="内容安全"></a>内容安全</h3><p>在请求到达模型之前，MaaS层是最后一道防线：</p><ul><li><strong>输入过滤</strong>：拦截注入攻击、违规内容、敏感数据泄露</li><li><strong>输出过滤</strong>：检测模型输出中的有害内容、PII信息、幻觉事实</li><li><strong>审计日志</strong>：记录所有请求和响应，满足合规要求</li></ul><p>这一层不做，每个业务方都要自己做一遍——重复造轮子还容易漏。</p><h2 id="七、MaaS层的本质：AI应用的可靠性中间件"><a href="#七、MaaS层的本质：AI应用的可靠性中间件" class="headerlink" title="七、MaaS层的本质：AI应用的可靠性中间件"></a>七、MaaS层的本质：AI应用的可靠性中间件</h2><p>回到最初的问题：MaaS层最核心的能力是什么？</p><p>不是API转发，不是Key管理，不是用量统计。这些都是基本功，不是核心价值。</p><p>MaaS层的核心能力是：<strong>在模型API这个概率性的、不稳定的、昂贵的底层之上，构建出一个确定性的、可靠的、成本可控的服务层。</strong></p><p>这和数据库连接池的逻辑一样——你不会让每个业务直连MySQL，你会在中间放一层连接池来管理连接复用、故障检测、负载均衡。MaaS层对模型API做的是同一件事，只不过模型API比数据库复杂得多：它的输出是概率性的，它的成本是按token计费的，它的质量是随模型版本浮动的。</p><p>如果用一句话总结：<strong>MaaS是AI时代的中间件。它不让模型变得更聪明，但它让模型的聪明可以被安全地、可靠地、经济地使用。</strong></p><h2 id="八、怎么判断你的MaaS层够不够用"><a href="#八、怎么判断你的MaaS层够不够用" class="headerlink" title="八、怎么判断你的MaaS层够不够用"></a>八、怎么判断你的MaaS层够不够用</h2><p>最后给一个自检清单：</p><p>能力</p><p>基础版</p><p>生产版</p><p>说明</p><p>模型路由</p><p>手动配置</p><p>按任务&#x2F;成本&#x2F;可用性自动路由</p><p>核心经济价值</p><p>重试与Fallback</p><p>简单重试</p><p>智能重试+熔断+降级</p><p>可靠性基础</p><p>缓存</p><p>精确匹配</p><p>语义缓存</p><p>成本优化利器</p><p>可观测性</p><p>请求日志</p><p>请求+业务+系统三层</p><p>运营决策依据</p><p>流量治理</p><p>全局限流</p><p>多租户隔离+优先级</p><p>多业务共存前提</p><p>内容安全</p><p>无</p><p>输入输出双向过滤</p><p>合规硬要求</p><p>如果你的AI应用还在裸调模型API，而且已经或即将上生产——是时候认真考虑MaaS层了。不是因为它酷，而是因为没有它，你的AI应用在生产环境里活不长。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/maas/">MaaS</a>  <a href="https://hugozhu.site/tags/architecture/">architecture</a>  <a href="https://hugozhu.site/tags/llm/">LLM</a>  <a href="https://hugozhu.site/tags/infrastructure/">infrastructure</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></li><li><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/158-maas-core-capabilities/">AI的MaaS层最核心的能力：把一个不稳定的概率接口，变成一个可运营的服务</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/28/2026-03-28-AI%E7%9A%84MaaS%E5%B1%82%E6%9C%80%E6%A0%B8%E5%BF%83%E7%9A%84%E8%83%BD%E5%8A%9B-%E6%8A%8A%E4%B8%80%E4%B8%AA%E4%B8%8D%E7%A8%B3%E5%AE%9A%E7%9A%84%E6%A6%82%E7%8E%87%E6%8E%A5%E5%8F%A3-%E5%8F%98%E6%88%90%E4%B8%80%E4%B8%AA%E5%8F%AF%E8%BF%90%E8%90%A5%E7%9A%84%E6%9C%8D%E5%8A%A1/</id>
    <link href="https://www.coconut.xin/2026/03/28/2026-03-28-AI%E7%9A%84MaaS%E5%B1%82%E6%9C%80%E6%A0%B8%E5%BF%83%E7%9A%84%E8%83%BD%E5%8A%9B-%E6%8A%8A%E4%B8%80%E4%B8%AA%E4%B8%8D%E7%A8%B3%E5%AE%9A%E7%9A%84%E6%A6%82%E7%8E%87%E6%8E%A5%E5%8F%A3-%E5%8F%98%E6%88%90%E4%B8%80%E4%B8%AA%E5%8F%AF%E8%BF%90%E8%90%A5%E7%9A%84%E6%9C%8D%E5%8A%A1/"/>
    <published>2026-03-28T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E5%85%88%E7%90%86%E8%A7%A3%E9%97%]]>
    </summary>
    <title>AI的MaaS层最核心的能力：把一个不稳定的概率接口，变成一个可运营的服务</title>
    <updated>2026-04-01T02:01:46.727Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E9%9C%80%E8%A6%81%E8%BF%99%E7%A7%8D%E5%8D%8F%E5%90%8C">为什么需要这种协同</a></li><li><a href="#%E6%95%B4%E4%BD%93%E6%9E%B6%E6%9E%84">整体架构</a></li><li><a href="#%E6%A0%B8%E5%BF%83%E6%9C%BA%E5%88%B6claude-code-%E7%9A%84-stream-json-%E8%BE%93%E5%87%BA">核心机制：Claude Code 的 stream-json 输出</a></li><li><a href="#%E5%AE%9E%E7%8E%B0%E8%AF%A6%E8%A7%A3">实现详解</a><ul><li><a href="#%E7%AC%AC%E4%B8%80%E6%AD%A5skill-%E5%AE%9A%E4%B9%89%E8%AE%A9-main-agent-%E7%9F%A5%E9%81%93%E5%A6%82%E4%BD%95%E5%90%AF%E5%8A%A8%E4%BB%BB%E5%8A%A1">第一步：Skill 定义——让 main Agent 知道如何启动任务</a></li><li><a href="#%E7%AC%AC%E4%BA%8C%E6%AD%A5%E5%90%AF%E5%8A%A8-claude-code-%E4%BB%BB%E5%8A%A1">第二步：启动 Claude Code 任务</a></li><li><a href="#%E7%AC%AC%E4%B8%89%E6%AD%A5%E7%9B%91%E6%8E%A7%E8%84%9A%E6%9C%AC%E8%A7%A3%E6%9E%90%E8%BF%9B%E5%BA%A6%E5%B9%B6%E6%8E%A8%E9%80%81">第三步：监控脚本——解析进度并推送</a></li><li><a href="#%E7%AC%AC%E5%9B%9B%E6%AD%A5%E7%94%A8%E6%88%B7%E7%9C%8B%E5%88%B0%E4%BB%80%E4%B9%88">第四步：用户看到什么</a></li></ul></li><li><a href="#%E8%AE%BE%E8%AE%A1%E5%86%B3%E7%AD%96%E8%83%8C%E5%90%8E%E7%9A%84%E6%9D%83%E8%A1%A1">设计决策背后的权衡</a><ul><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E7%94%A8%E6%96%87%E4%BB%B6%E8%80%8C%E4%B8%8D%E6%98%AF-websocketapi">为什么用文件而不是 WebSocket&#x2F;API？</a></li><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E9%80%89%E6%8B%A9-tail--f-%E8%80%8C%E4%B8%8D%E6%98%AF%E8%BD%AE%E8%AF%A2">为什么选择 tail -f 而不是轮询？</a></li><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E5%8F%AA%E8%BD%AC%E5%8F%91-assistant-%E6%96%87%E6%9C%AC%E4%B8%8D%E8%BD%AC%E5%8F%91%E5%B7%A5%E5%85%B7%E8%B0%83%E7%94%A8%E7%BB%86%E8%8A%82">为什么只转发 assistant 文本，不转发工具调用细节？</a></li><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E4%BB%BB%E5%8A%A1%E5%AE%8C%E6%88%90%E6%97%B6%E8%A6%81%E8%81%9A%E5%90%88%E7%BB%9F%E8%AE%A1">为什么任务完成时要聚合统计？</a></li></ul></li><li><a href="#%E6%9B%B4%E8%BF%9B%E4%B8%80%E6%AD%A5%E8%87%AA%E5%AE%9A%E4%B9%89%E8%BF%9B%E5%BA%A6%E6%A3%80%E6%B5%8B%E8%84%9A%E6%9C%AC">更进一步：自定义进度检测脚本</a></li><li><a href="#%E4%B8%A4%E7%A7%8D%E6%96%B9%E6%A1%88%E7%9A%84%E5%AF%B9%E6%AF%94">两种方案的对比</a></li><li><a href="#%E7%AB%AF%E5%88%B0%E7%AB%AF%E6%B5%81%E7%A8%8B%E5%9B%BE">端到端流程图</a></li><li><a href="#%E7%94%9F%E4%BA%A7%E7%8E%AF%E5%A2%83%E7%9A%84%E6%B3%A8%E6%84%8F%E4%BA%8B%E9%A1%B9">生产环境的注意事项</a></li><li><a href="#%E6%80%BB%E7%BB%93">总结</a></li></ul><p>你在钉钉里对 AI 助手说：“帮我写一个博客文章”，然后 Agent 回复”好的”——接下来呢？你等了 3 分钟、5 分钟、10 分钟，不知道它在干什么、进展到哪了、是不是卡住了。这是所有 Agent 系统面临的共同问题：<strong>编程类耗时任务的进度黑洞</strong>。</p><p>OpenClaw 通过 Sub-Agent 机制调用 Claude Code 执行编程任务，再借助 <code>stream-json</code> 输出格式和一个轻量级的监控脚本，将任务进度实时同步到钉钉。本文完整拆解这套方案的架构设计和实现细节。</p><h2 id="为什么需要这种协同"><a href="#为什么需要这种协同" class="headerlink" title="为什么需要这种协同"></a>为什么需要这种协同</h2><p>OpenClaw 的 main Agent 擅长对话、决策、调度，但它本身不是一个编程工具。当用户的需求涉及”写代码、改文件、跑测试”时，真正适合干活的是 Claude Code——它拥有完整的文件系统访问、终端操作能力和工程上下文理解。</p><p>问题在于，Claude Code 作为一个 CLI 工具，天然是”闷头干活”型的：启动后进入自己的工作循环，直到任务完成才输出最终结果。如果一个编程任务需要 10 分钟，用户就得干等 10 分钟，期间没有任何反馈。</p><p>这带来三个实际痛点：</p><ol><li><strong>信息断层</strong>：OpenClaw 把任务委托给 Claude Code 后，自己也不知道进展如何，无法回答用户”做到哪了”</li><li><strong>资源浪费</strong>：如果 Claude Code 在第 2 分钟就卡在权限问题上，用户要到第 10 分钟才知道</li><li><strong>体验割裂</strong>：用户在钉钉发指令，却要去终端看 Claude Code 的输出，交互通道断了</li></ol><p>解决方案的核心思路是：<strong>让 Claude Code 的执行过程变得可观测，然后把观测到的信息实时推回用户所在的通道。</strong></p><h2 id="整体架构"><a href="#整体架构" class="headerlink" title="整体架构"></a>整体架构</h2><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br><span class="line">36</span><br></pre></td><td class="code"><pre><span class="line">┌─────────────────────────────────────────────────────────┐</span><br><span class="line">│                    用户 (钉钉)                           │</span><br><span class="line">│                       │                                  │</span><br><span class="line">│                       ▼                                  │</span><br><span class="line">│               ┌──────────────┐                           │</span><br><span class="line">│               │ OpenClaw     │                           │</span><br><span class="line">│               │ main Agent   │ ← 接收用户指令             │</span><br><span class="line">│               └──────┬───────┘                           │</span><br><span class="line">│                      │ 1. 启动 Sub-Agent                  │</span><br><span class="line">│                      ▼                                   │</span><br><span class="line">│  ┌────────────────────────────────────────────────┐      │</span><br><span class="line">│  │             Sub-Agent 执行层                     │      │</span><br><span class="line">│  │                                                │      │</span><br><span class="line">│  │  ┌──────────────┐    stdout    ┌────────────┐  │      │</span><br><span class="line">│  │  │  Claude Code  │ ──────────► │ progress   │  │      │</span><br><span class="line">│  │  │  (claude.sh)  │  stream-   │ .jsonl     │  │      │</span><br><span class="line">│  │  │              │  json       │            │  │      │</span><br><span class="line">│  │  └──────────────┘             └─────┬──────┘  │      │</span><br><span class="line">│  │                                     │         │      │</span><br><span class="line">│  │  ┌──────────────┐    tail -f        │         │      │</span><br><span class="line">│  │  │  monitor.sh  │ ◄────────────────┘         │      │</span><br><span class="line">│  │  │  (监控脚本)   │                             │      │</span><br><span class="line">│  │  └──────┬───────┘                             │      │</span><br><span class="line">│  │         │                                     │      │</span><br><span class="line">│  └─────────┼─────────────────────────────────────┘      │</span><br><span class="line">│            │ 2. 解析 JSONL 事件                          │</span><br><span class="line">│            │ 3. 提取 assistant text                      │</span><br><span class="line">│            ▼                                             │</span><br><span class="line">│    ┌───────────────┐                                     │</span><br><span class="line">│    │ dws chat      │ ← OpenClaw CLI 发送消息              │</span><br><span class="line">│    │ message send  │                                     │</span><br><span class="line">│    └───────┬───────┘                                     │</span><br><span class="line">│            │ 4. 实时推送进度                               │</span><br><span class="line">│            ▼                                             │</span><br><span class="line">│        用户 (钉钉) ← 看到实时进度更新                      │</span><br><span class="line">└─────────────────────────────────────────────────────────┘</span><br></pre></td></tr></table></figure><p>四个关键环节：</p><ol><li><strong>main Agent 启动 Claude Code</strong>：通过 <code>claude.sh</code> 命令行调用，加上 <code>--output-format stream-json</code> 参数，将输出重定向到一个 JSONL 进度文件</li><li><strong>Claude Code 执行任务</strong>：每一次模型调用、工具使用、文本输出都以 JSON 事件的形式写入进度文件</li><li><strong>monitor.sh 实时解析</strong>：通过 <code>tail -f</code> 监听进度文件，从 JSONL 事件中提取有意义的信息</li><li><strong>钉钉消息推送</strong>：通过 OpenClaw 的 <code>dws chat message send</code> 命令将进度发送到用户</li></ol><h2 id="核心机制：Claude-Code-的-stream-json-输出"><a href="#核心机制：Claude-Code-的-stream-json-输出" class="headerlink" title="核心机制：Claude Code 的 stream-json 输出"></a>核心机制：Claude Code 的 stream-json 输出</h2><p>Claude Code 的 <code>--output-format stream-json</code> 是整套方案的基础。它将 Claude Code 的整个执行过程序列化为 newline-delimited JSON (JSONL) 格式，每一行是一个独立的事件。</p><p>主要事件类型包括：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">&#123;&quot;type&quot;:&quot;system&quot;,&quot;subtype&quot;:&quot;init&quot;,&quot;session_id&quot;:&quot;abc123&quot;,&quot;tools&quot;:[&quot;Read&quot;,&quot;Write&quot;,&quot;Bash&quot;,...]&#125;</span><br><span class="line">&#123;&quot;type&quot;:&quot;assistant&quot;,&quot;message&quot;:&#123;&quot;role&quot;:&quot;assistant&quot;,&quot;content&quot;:[&#123;&quot;type&quot;:&quot;text&quot;,&quot;text&quot;:&quot;我���帮你写这篇文章...&quot;&#125;],&quot;usage&quot;:&#123;&quot;input_tokens&quot;:2048,&quot;output_tokens&quot;:512&#125;&#125;&#125;</span><br><span class="line">&#123;&quot;type&quot;:&quot;tool_use&quot;,&quot;tool&quot;:&quot;Read&quot;,&quot;input&quot;:&#123;&quot;file_path&quot;:&quot;/home/node/Projects/blog2/content/post/2026/&quot;&#125;&#125;</span><br><span class="line">&#123;&quot;type&quot;:&quot;tool_result&quot;,&quot;tool&quot;:&quot;Read&quot;,&quot;output&quot;:&quot;...文件内容...&quot;&#125;</span><br><span class="line">&#123;&quot;type&quot;:&quot;assistant&quot;,&quot;message&quot;:&#123;&quot;role&quot;:&quot;assistant&quot;,&quot;content&quot;:[&#123;&quot;type&quot;:&quot;text&quot;,&quot;text&quot;:&quot;文章已写好，保存在...&quot;&#125;],&quot;usage&quot;:&#123;&quot;input_tokens&quot;:4096,&quot;output_tokens&quot;:1024&#125;&#125;&#125;</span><br><span class="line">&#123;&quot;type&quot;:&quot;result&quot;,&quot;result&quot;:&quot;任务完成&quot;,&quot;session_id&quot;:&quot;abc123&quot;,&quot;duration_ms&quot;:180000,&quot;total_cost_usd&quot;:0.15&#125;</span><br></pre></td></tr></table></figure><p>关键观察：</p><ul><li><strong><code>assistant</code> 事件</strong>包含模型的文本输出和 token 使用量——这是用户最关心的”进度”</li><li><strong><code>tool_use</code> &#x2F; <code>tool_result</code> 事件</strong>记录了工具调用过程——可以用来判断 Claude Code 在做什么</li><li><strong><code>result</code> 事件</strong>标志任务完成——包含总耗时、总花费等统计信息</li></ul><h2 id="实现详解"><a href="#实现详解" class="headerlink" title="实现详解"></a>实现详解</h2><h3 id="第一步：Skill-定义——让-main-Agent-知道如何启动任务"><a href="#第一步：Skill-定义——让-main-Agent-知道如何启动任务" class="headerlink" title="第一步：Skill 定义——让 main Agent 知道如何启动任务"></a>第一步：Skill 定义——让 main Agent 知道如何启动任务</h3><p>在 OpenClaw 中，我们通过一个 Skill 文件来教 main Agent 如何使用这套机制。Skill 是 OpenClaw 的能力扩展单元，本质上是一个 Markdown 文件，描述了何时使用、如何使用。</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br></pre></td><td class="code"><pre><span class="line">---</span><br><span class="line">name: run-task</span><br><span class="line">description: Run a claude task in the background, monitor progress</span><br><span class="line"><span class="section">  via stream-json JSONL, and send updates via dws chat message</span></span><br><span class="line"><span class="section">---</span></span><br><span class="line"></span><br><span class="line"><span class="section"># When to use this skill</span></span><br><span class="line">When the user wants to run a Claude Code task in the background</span><br><span class="line">with progress tracking and message notifications.</span><br><span class="line"></span><br><span class="line"><span class="section"># Instructions</span></span><br><span class="line"></span><br><span class="line"><span class="section">## Arguments</span></span><br><span class="line">/run-task <span class="language-xml"><span class="tag">&lt;<span class="name">progress-file</span>&gt;</span></span> <span class="language-xml"><span class="tag">&lt;<span class="name">target</span>&gt;</span></span> <span class="language-xml"><span class="tag">&lt;<span class="name">task</span> <span class="attr">description</span>&gt;</span></span></span><br><span class="line"></span><br><span class="line"><span class="section">## Execution Steps</span></span><br><span class="line"><span class="bullet">1.</span> Initialize the progress file</span><br><span class="line"><span class="bullet">2.</span> Run claude.sh with --output-format stream-json in background</span><br><span class="line"><span class="bullet">3.</span> Start monitor.sh in background</span><br><span class="line"><span class="bullet">4.</span> Confirm to user that task has started</span><br></pre></td></tr></table></figure><p>当用户说”帮我写一篇博客”时，main Agent 判断这是一个编程任务，自动调用 <code>/run-task</code> Skill，启动 Claude Code 并配置好监控。</p><h3 id="第二步：启动-Claude-Code-任务"><a href="#第二步：启动-Claude-Code-任务" class="headerlink" title="第二步：启动 Claude Code 任务"></a>第二步：启动 Claude Code 任务</h3><p>main Agent 执行以下命令，两个都以后台进程方式运行：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 1. 初始化进度文件</span></span><br><span class="line">&gt; /tmp/task-progress.jsonl</span><br><span class="line"></span><br><span class="line"><span class="comment"># 2. 启动 Claude Code 任务，输出重定向到进度文件</span></span><br><span class="line">claude.sh -p <span class="string">&quot;写一篇关于 AI Agent 架构的博客文章，保存到 content/post/2026/&quot;</span> \</span><br><span class="line">  --output-format stream-json \</span><br><span class="line">  --verbose \</span><br><span class="line">  --permission-mode auto \</span><br><span class="line">  &gt; /tmp/task-progress.jsonl 2&gt;&amp;1 &amp;</span><br><span class="line"></span><br><span class="line"><span class="comment"># 3. 启动监控脚本</span></span><br><span class="line">bash skills/run-task/monitor.sh /tmp/task-progress.jsonl <span class="string">&quot;<span class="variable">$TARGET_USER_ID</span>&quot;</span> &amp;</span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>几个关键参数说明：</p><ul><li><code>--output-format stream-json</code>：启用 JSONL 格式输出，这是获取结构化进度的前提</li><li><code>--verbose</code>：与 <code>stream-json</code> 配合使用，输出更详细的事件信息</li><li><code>--permission-mode auto</code>：自动授权工具调用，避免后台进程因等待交互输入而卡住</li><li>输出重定向到 <code>.jsonl</code> 文件：monitor.sh 通过 <code>tail -f</code> 实时读取</li></ul><h3 id="第三步：监控脚本——解析进度并推送"><a href="#第三步：监控脚本——解析进度并推送" class="headerlink" title="第三步：监控脚本——解析进度并推送"></a>第三步：监控脚本——解析进度并推送</h3><p><code>monitor.sh</code> 是整套方案中最核心的组件。它的职责很简单：读取进度文件中的 JSONL 事件，提取有意义的信息，通过 <code>dws chat message send</code> 发送到用户。</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br><span class="line">36</span><br><span class="line">37</span><br><span class="line">38</span><br><span class="line">39</span><br><span class="line">40</span><br><span class="line">41</span><br><span class="line">42</span><br><span class="line">43</span><br><span class="line">44</span><br><span class="line">45</span><br><span class="line">46</span><br><span class="line">47</span><br><span class="line">48</span><br><span class="line">49</span><br><span class="line">50</span><br><span class="line">51</span><br><span class="line">52</span><br><span class="line">53</span><br><span class="line">54</span><br><span class="line">55</span><br><span class="line">56</span><br><span class="line">57</span><br><span class="line">58</span><br><span class="line">59</span><br><span class="line">60</span><br><span class="line">61</span><br><span class="line">62</span><br><span class="line">63</span><br><span class="line">64</span><br><span class="line">65</span><br><span class="line">66</span><br><span class="line">67</span><br><span class="line">68</span><br><span class="line">69</span><br><span class="line">70</span><br><span class="line">71</span><br><span class="line">72</span><br><span class="line">73</span><br><span class="line">74</span><br><span class="line">75</span><br><span class="line">76</span><br><span class="line">77</span><br><span class="line">78</span><br><span class="line">79</span><br><span class="line">80</span><br><span class="line">81</span><br><span class="line">82</span><br></pre></td><td class="code"><pre><span class="line"><span class="meta">#!/usr/bin/env bash</span></span><br><span class="line"><span class="comment"># monitor.sh - Monitor Claude stream-json and send updates via dws</span></span><br><span class="line"></span><br><span class="line"><span class="built_in">set</span> -euo pipefail</span><br><span class="line"></span><br><span class="line">PROGRESS_FILE=<span class="string">&quot;<span class="variable">$&#123;1:?Usage: monitor.sh &lt;progress-file&gt; &lt;target&gt;&#125;</span>&quot;</span></span><br><span class="line">TARGET=<span class="string">&quot;<span class="variable">$&#123;2:?Usage: monitor.sh &lt;progress-file&gt; &lt;target&gt;&#125;</span>&quot;</span></span><br><span class="line"></span><br><span class="line"><span class="comment"># 聚合统计信息（任务完成时调用）</span></span><br><span class="line"><span class="function"><span class="title">aggregate_stats</span></span>() &#123;</span><br><span class="line">  <span class="built_in">local</span> file=<span class="string">&quot;<span class="variable">$1</span>&quot;</span></span><br><span class="line">  <span class="built_in">local</span> result_line=<span class="string">&quot;<span class="variable">$2</span>&quot;</span></span><br><span class="line"></span><br><span class="line">  <span class="comment"># 从整个文件统计 assistant 轮次数</span></span><br><span class="line">  <span class="built_in">local</span> num_turns</span><br><span class="line">  num_turns=$(jq -s <span class="string">&#x27;[.[] | select(.type == &quot;assistant&quot;)] | length&#x27;</span> \</span><br><span class="line">    <span class="string">&quot;<span class="variable">$file</span>&quot;</span> 2&gt;/dev/null || <span class="built_in">echo</span> 0)</span><br><span class="line"></span><br><span class="line">  <span class="comment"># 汇总 token 用量</span></span><br><span class="line">  <span class="built_in">local</span> input_tokens output_tokens</span><br><span class="line">  input_tokens=$(jq -s \</span><br><span class="line">    <span class="string">&#x27;[.[] | select(.type == &quot;assistant&quot;)</span></span><br><span class="line"><span class="string">     | .message.usage.input_tokens // 0] | add // 0&#x27;</span> \</span><br><span class="line">    <span class="string">&quot;<span class="variable">$file</span>&quot;</span> 2&gt;/dev/null || <span class="built_in">echo</span> 0)</span><br><span class="line">  output_tokens=$(jq -s \</span><br><span class="line">    <span class="string">&#x27;[.[] | select(.type == &quot;assistant&quot;)</span></span><br><span class="line"><span class="string">     | .message.usage.output_tokens // 0] | add // 0&#x27;</span> \</span><br><span class="line">    <span class="string">&quot;<span class="variable">$file</span>&quot;</span> 2&gt;/dev/null || <span class="built_in">echo</span> 0)</span><br><span class="line"></span><br><span class="line">  <span class="comment"># 从 result 事件提取耗时和花费</span></span><br><span class="line">  <span class="built_in">local</span> duration_ms cost session_id result_text</span><br><span class="line">  duration_ms=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$result_line</span>&quot;</span> | jq -r <span class="string">&#x27;.duration_ms // 0&#x27;</span>)</span><br><span class="line">  cost=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$result_line</span>&quot;</span> | jq -r <span class="string">&#x27;.total_cost_usd // 0&#x27;</span>)</span><br><span class="line">  session_id=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$result_line</span>&quot;</span> | jq -r <span class="string">&#x27;.session_id // &quot;unknown&quot;&#x27;</span>)</span><br><span class="line">  result_text=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$result_line</span>&quot;</span> | jq -r <span class="string">&#x27;.result // empty&#x27;</span>)</span><br><span class="line"></span><br><span class="line">  <span class="built_in">local</span> duration_s cost_fmt</span><br><span class="line">  duration_s=$(awk <span class="string">&quot;BEGIN &#123;printf \&quot;%.1f\&quot;, <span class="variable">$duration_ms</span> / 1000&#125;&quot;</span>)</span><br><span class="line">  cost_fmt=$(awk <span class="string">&quot;BEGIN &#123;printf \&quot;%.4f\&quot;, <span class="variable">$cost</span>&#125;&quot;</span>)</span><br><span class="line"></span><br><span class="line">  <span class="comment"># 构建并发送摘要</span></span><br><span class="line">  <span class="built_in">local</span> summary=<span class="string">&quot;## Task completed</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">- Task: <span class="variable">$&#123;session_id&#125;</span></span></span><br><span class="line"><span class="string">- Turns: <span class="variable">$&#123;num_turns&#125;</span></span></span><br><span class="line"><span class="string">- Duration: <span class="variable">$&#123;duration_s&#125;</span>s</span></span><br><span class="line"><span class="string">- Cost: \$<span class="variable">$&#123;cost_fmt&#125;</span></span></span><br><span class="line"><span class="string">- Tokens: <span class="variable">$&#123;input_tokens&#125;</span> in / <span class="variable">$&#123;output_tokens&#125;</span> out</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string">---</span></span><br><span class="line"><span class="string"></span></span><br><span class="line"><span class="string"><span class="variable">$&#123;result_text&#125;</span>&quot;</span></span><br><span class="line"></span><br><span class="line">  dws chat message send --user <span class="string">&quot;<span class="variable">$TARGET</span>&quot;</span> \</span><br><span class="line">    --title <span class="string">&quot;Task: <span class="variable">$&#123;session_id&#125;</span>&quot;</span> <span class="string">&quot;<span class="variable">$summary</span>&quot;</span></span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="comment"># 主监控循环</span></span><br><span class="line"><span class="built_in">tail</span> -f <span class="string">&quot;<span class="variable">$PROGRESS_FILE</span>&quot;</span> | <span class="keyword">while</span> IFS= <span class="built_in">read</span> -r line; <span class="keyword">do</span></span><br><span class="line">  <span class="comment"># 跳过空行和非 JSON 行</span></span><br><span class="line">  <span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$line</span>&quot;</span> | jq -e . &gt;/dev/null 2&gt;&amp;1 || <span class="built_in">continue</span></span><br><span class="line"></span><br><span class="line">  <span class="comment"># 提取 assistant 消息中的文本</span></span><br><span class="line">  text=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$line</span>&quot;</span> | jq -r <span class="string">&#x27;</span></span><br><span class="line"><span class="string">    select(.type == &quot;assistant&quot;)</span></span><br><span class="line"><span class="string">    | .message.content[]?</span></span><br><span class="line"><span class="string">    | select(.type == &quot;text&quot;)</span></span><br><span class="line"><span class="string">    | .text // empty</span></span><br><span class="line"><span class="string">  &#x27;</span> 2&gt;/dev/null)</span><br><span class="line"></span><br><span class="line">  <span class="keyword">if</span> [ -n <span class="string">&quot;<span class="variable">$text</span>&quot;</span> ]; <span class="keyword">then</span></span><br><span class="line">    dws chat message send --user <span class="string">&quot;<span class="variable">$TARGET</span>&quot;</span> <span class="string">&quot;<span class="variable">$text</span>&quot;</span></span><br><span class="line">  <span class="keyword">fi</span></span><br><span class="line"></span><br><span class="line">  <span class="comment"># result 事件表示任务完成</span></span><br><span class="line">  <span class="keyword">if</span> <span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$line</span>&quot;</span> | jq -e <span class="string">&#x27;select(.type == &quot;result&quot;)&#x27;</span> \</span><br><span class="line">    &gt;/dev/null 2&gt;&amp;1; <span class="keyword">then</span></span><br><span class="line">    aggregate_stats <span class="string">&quot;<span class="variable">$PROGRESS_FILE</span>&quot;</span> <span class="string">&quot;<span class="variable">$line</span>&quot;</span></span><br><span class="line">    <span class="built_in">break</span></span><br><span class="line">  <span class="keyword">fi</span></span><br><span class="line"><span class="keyword">done</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>脚本的工作流程：</p><ol><li><strong><code>tail -f</code></strong> 持续监听进度文件的新增内容</li><li>每读到一行，先用 <code>jq -e .</code> 验证是否是合法 JSON（跳过 stderr 输出等噪音）</li><li>对 <code>assistant</code> 类型事件，提取其中的文本内容，通过 <code>dws</code> 发送给用户</li><li>当收到 <code>result</code> 类型事件时，调用 <code>aggregate_stats</code> 汇总整个任务的统计信息，发送完成报告，然后退出</li></ol><h3 id="第四步：用户看到什么"><a href="#第四步：用户看到什么" class="headerlink" title="第四步：用户看到什么"></a>第四步：用户看到什么</h3><p>从用户的视角，整个过程是这样的：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br></pre></td><td class="code"><pre><span class="line">用户: 帮我写一篇关于 AI Agent 安全性的博客</span><br><span class="line">Agent: 好的，我已启动编程任务，正在后台执行。</span><br><span class="line">       进度文件：/tmp/task-progress.jsonl</span><br><span class="line">       完成后会通知你。</span><br><span class="line"></span><br><span class="line">[30 秒后]</span><br><span class="line">Agent: 我来帮你写这篇关于 AI Agent 安全性的文章。</span><br><span class="line">       让我先看看现有文章的结构和风格...</span><br><span class="line"></span><br><span class="line">[1 分钟后]</span><br><span class="line">Agent: 已经分析了现有文章的结构，正在撰写文章内容。</span><br><span class="line">       文章将覆盖沙箱隔离、权限控制、输入验证等主题...</span><br><span class="line"></span><br><span class="line">[3 分钟后]</span><br><span class="line">Agent: 文章已写好并保存到</span><br><span class="line">       content/post/2026/158-agent-security.md</span><br><span class="line"></span><br><span class="line">[5 分钟后]</span><br><span class="line">Agent: ## Task completed</span><br><span class="line">       - Turns: 8</span><br><span class="line">       - Duration: 287.3s</span><br><span class="line">       - Cost: $0.1823</span><br><span class="line">       - Tokens: 45,210 in / 8,934 out</span><br></pre></td></tr></table></figure><p>用户全程在钉钉里就能看到任务的进展，不需要切换到终端，不需要猜测任务状态。</p><h2 id="设计决策背后的权衡"><a href="#设计决策背后的权衡" class="headerlink" title="设计决策背后的权衡"></a>设计决策背后的权衡</h2><h3 id="为什么用文件而不是-WebSocket-API？"><a href="#为什么用文件而不是-WebSocket-API？" class="headerlink" title="为什么用文件而不是 WebSocket&#x2F;API？"></a>为什么用文件而不是 WebSocket&#x2F;API？</h3><p>选择文件（JSONL）作为 Claude Code 和监控脚本之间的通信媒介，有几个原因：</p><ul><li><strong>Claude Code 原生支持</strong>：<code>--output-format stream-json</code> 直接输出到 stdout，重定向到文件是最自然的方式</li><li><strong>可回溯</strong>：文件保留了完整的执行历史，任务完成后还能用于分析和统计</li><li><strong>解耦</strong>：写入方（Claude Code）和读取方（monitor.sh）完全独立，monitor.sh 崩溃不影响任务执行</li><li><strong>调试友好</strong>：随时可以 <code>cat</code> 或 <code>jq</code> 查看原始事件流</li></ul><h3 id="为什么选择-tail-f-而不是轮询？"><a href="#为什么选择-tail-f-而不是轮询？" class="headerlink" title="为什么选择 tail -f 而不是轮询？"></a>为什么选择 tail -f 而不是轮询？</h3><p><code>tail -f</code> 是事件驱动的——文件有新内容就立即读取，延迟在毫秒级。相比之下，轮询（每 N 秒读一次文件）有固有的延迟，而且频率太高浪费 CPU、太低又错过更新。<code>tail -f</code> 正好在两者之间取得平衡。</p><h3 id="为什么只转发-assistant-文本，不转发工具调用细节？"><a href="#为什么只转发-assistant-文本，不转发工具调用细节？" class="headerlink" title="为什么只转发 assistant 文本，不转发工具调用细节？"></a>为什么只转发 assistant 文本，不转发工具调用细节？</h3><p>用户关心的是”Agent 在做什么、做到哪了”，而不是”Agent 调用了 <code>Read</code> 工具读取了 <code>hugo.toml</code> 文件”。工具调用的细节对用户来说是噪音。Assistant 文本通常包含了足够的上下文——Claude Code 在文本中会说”让我先看看现有文章的结构”，这比原始的 <code>tool_use</code> 事件可读性好得多。</p><p>如果需要更细粒度的进度（比如知道 Claude Code 正在编辑哪个文件），可以在 monitor.sh 中增加对 <code>tool_use</code> 事件的处理：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 可选：提取工具调用信息作为进度提示</span></span><br><span class="line">tool_info=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$line</span>&quot;</span> | jq -r <span class="string">&#x27;</span></span><br><span class="line"><span class="string">  select(.type == &quot;tool_use&quot;)</span></span><br><span class="line"><span class="string">  | &quot;正在使用 \(.tool) 工具...&quot;</span></span><br><span class="line"><span class="string">&#x27;</span> 2&gt;/dev/null)</span><br><span class="line"></span><br><span class="line"><span class="keyword">if</span> [ -n <span class="string">&quot;<span class="variable">$tool_info</span>&quot;</span> ]; <span class="keyword">then</span></span><br><span class="line">  dws chat message send --user <span class="string">&quot;<span class="variable">$TARGET</span>&quot;</span> <span class="string">&quot;<span class="variable">$tool_info</span>&quot;</span></span><br><span class="line"><span class="keyword">fi</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><h3 id="为什么任务完成时要聚合统计？"><a href="#为什么任务完成时要聚合统计？" class="headerlink" title="为什么任务完成时要聚合统计？"></a>为什么任务完成时要聚合统计？</h3><p><code>aggregate_stats</code> 函数在 <code>result</code> 事件到达时遍历整个 JSONL 文件，计算出总轮次、总 token 用量、总耗时和总花费。这些信息对用户有两重价值：</p><ol><li><strong>成本感知</strong>：知道这次任务花了多少钱（token 费用），有助于判断任务的性价比</li><li><strong>性能洞察</strong>：了解任务经历了多少轮对话，有助于优化 prompt 和任务拆分策略</li></ol><h2 id="更进一步：自定义进度检测脚本"><a href="#更进一步：自定义进度检测脚本" class="headerlink" title="更进一步：自定义进度检测脚本"></a>更进一步：自定义进度检测脚本</h2><p>除了 monitor.sh 这种通用方案，有时你需要更灵活的进度检测逻辑。比如根据任务状态字段做不同的处理、支持多种通知渠道、或者在特定条件下自动干预。</p><p>下面是一个增强版的进度同步脚本：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br><span class="line">36</span><br><span class="line">37</span><br><span class="line">38</span><br><span class="line">39</span><br><span class="line">40</span><br><span class="line">41</span><br><span class="line">42</span><br><span class="line">43</span><br><span class="line">44</span><br><span class="line">45</span><br><span class="line">46</span><br><span class="line">47</span><br><span class="line">48</span><br><span class="line">49</span><br><span class="line">50</span><br><span class="line">51</span><br><span class="line">52</span><br><span class="line">53</span><br><span class="line">54</span><br><span class="line">55</span><br><span class="line">56</span><br><span class="line">57</span><br><span class="line">58</span><br><span class="line">59</span><br><span class="line">60</span><br><span class="line">61</span><br><span class="line">62</span><br><span class="line">63</span><br><span class="line">64</span><br><span class="line">65</span><br><span class="line">66</span><br><span class="line">67</span><br><span class="line">68</span><br><span class="line">69</span><br><span class="line">70</span><br><span class="line">71</span><br><span class="line">72</span><br><span class="line">73</span><br><span class="line">74</span><br><span class="line">75</span><br><span class="line">76</span><br><span class="line">77</span><br><span class="line">78</span><br><span class="line">79</span><br><span class="line">80</span><br><span class="line">81</span><br><span class="line">82</span><br><span class="line">83</span><br><span class="line">84</span><br><span class="line">85</span><br><span class="line">86</span><br><span class="line">87</span><br></pre></td><td class="code"><pre><span class="line"><span class="meta">#!/bin/bash</span></span><br><span class="line"><span class="comment"># sync-progress.sh</span></span><br><span class="line"><span class="comment"># OpenClaw + Claude Code 进度同步脚本</span></span><br><span class="line"><span class="comment"># 支持轮询模式和持续监控模式</span></span><br><span class="line"></span><br><span class="line">PROGRESS_FILE=<span class="string">&quot;/tmp/claude-code-progress.jsonl&quot;</span></span><br><span class="line">DINGTALK_WEBHOOK=<span class="string">&quot;<span class="variable">$&#123;DINGTALK_WEBHOOK:-&#125;</span>&quot;</span></span><br><span class="line">LAST_PROGRESS=<span class="string">&quot;&quot;</span></span><br><span class="line">CHECK_INTERVAL=5  <span class="comment"># 秒</span></span><br><span class="line"></span><br><span class="line"><span class="comment"># 发送钉钉消息（Webhook 方式）</span></span><br><span class="line"><span class="function"><span class="title">send_dingtalk</span></span>() &#123;</span><br><span class="line">    <span class="built_in">local</span> content=<span class="string">&quot;<span class="variable">$1</span>&quot;</span></span><br><span class="line">    <span class="keyword">if</span> [ -n <span class="string">&quot;<span class="variable">$DINGTALK_WEBHOOK</span>&quot;</span> ]; <span class="keyword">then</span></span><br><span class="line">        curl -s -X POST <span class="string">&quot;<span class="variable">$DINGTALK_WEBHOOK</span>&quot;</span> \</span><br><span class="line">            -H <span class="string">&quot;Content-Type: application/json&quot;</span> \</span><br><span class="line">            -d <span class="string">&quot;&#123;\&quot;msgtype\&quot;: \&quot;text\&quot;, \&quot;text\&quot;: &#123;\&quot;content\&quot;: \&quot;<span class="variable">$content</span>\&quot;&#125;&#125;&quot;</span></span><br><span class="line">    <span class="keyword">else</span></span><br><span class="line">        <span class="built_in">echo</span> <span class="string">&quot;[钉钉] <span class="variable">$content</span>&quot;</span></span><br><span class="line">    <span class="keyword">fi</span></span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="comment"># 解析最新进度</span></span><br><span class="line"><span class="function"><span class="title">parse_progress</span></span>() &#123;</span><br><span class="line">    [ -f <span class="string">&quot;<span class="variable">$PROGRESS_FILE</span>&quot;</span> ] || <span class="built_in">return</span></span><br><span class="line">    <span class="built_in">local</span> latest</span><br><span class="line">    latest=$(<span class="built_in">tail</span> -n 1 <span class="string">&quot;<span class="variable">$PROGRESS_FILE</span>&quot;</span> 2&gt;/dev/null)</span><br><span class="line">    [ -z <span class="string">&quot;<span class="variable">$latest</span>&quot;</span> ] &amp;&amp; <span class="built_in">return</span></span><br><span class="line"></span><br><span class="line">    <span class="built_in">local</span> status task step total message</span><br><span class="line">    status=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$latest</span>&quot;</span> | jq -r <span class="string">&#x27;.status // &quot;unknown&quot;&#x27;</span>)</span><br><span class="line">    task=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$latest</span>&quot;</span> | jq -r <span class="string">&#x27;.task // &quot;未知任务&quot;&#x27;</span>)</span><br><span class="line">    step=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$latest</span>&quot;</span> | jq -r <span class="string">&#x27;.step // 0&#x27;</span>)</span><br><span class="line">    total=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$latest</span>&quot;</span> | jq -r <span class="string">&#x27;.total // 0&#x27;</span>)</span><br><span class="line">    message=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$latest</span>&quot;</span> | jq -r <span class="string">&#x27;.message // &quot;&quot;&#x27;</span>)</span><br><span class="line"></span><br><span class="line">    <span class="built_in">local</span> progress_msg=<span class="string">&quot;Claude Code 进度同步\n\n&quot;</span></span><br><span class="line">    progress_msg+=<span class="string">&quot;任务: <span class="variable">$task</span>\n状态: <span class="variable">$status</span>\n&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="keyword">if</span> [ <span class="string">&quot;<span class="variable">$total</span>&quot;</span> -gt 0 ] 2&gt;/dev/null; <span class="keyword">then</span></span><br><span class="line">        <span class="built_in">local</span> percent=$((step * <span class="number">100</span> / total))</span><br><span class="line">        progress_msg+=<span class="string">&quot;进度: <span class="variable">$step</span>/<span class="variable">$total</span> (<span class="variable">$percent</span>%)\n&quot;</span></span><br><span class="line">    <span class="keyword">fi</span></span><br><span class="line"></span><br><span class="line">    [ -n <span class="string">&quot;<span class="variable">$message</span>&quot;</span> ] &amp;&amp; [ <span class="string">&quot;<span class="variable">$message</span>&quot;</span> != <span class="string">&quot;null&quot;</span> ] &amp;&amp; \</span><br><span class="line">        progress_msg+=<span class="string">&quot;详情: <span class="variable">$message</span>\n&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$progress_msg</span>&quot;</span></span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="comment"># 主循环：持续监控</span></span><br><span class="line"><span class="function"><span class="title">main</span></span>() &#123;</span><br><span class="line">    <span class="built_in">echo</span> <span class="string">&quot;开始监控 Claude Code 进度...&quot;</span></span><br><span class="line">    send_dingtalk <span class="string">&quot;Claude Code 任务开始执行&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="keyword">while</span> <span class="literal">true</span>; <span class="keyword">do</span></span><br><span class="line">        <span class="keyword">if</span> [ -f <span class="string">&quot;<span class="variable">$PROGRESS_FILE</span>&quot;</span> ]; <span class="keyword">then</span></span><br><span class="line">            <span class="built_in">local</span> current</span><br><span class="line">            current=$(<span class="built_in">tail</span> -n 1 <span class="string">&quot;<span class="variable">$PROGRESS_FILE</span>&quot;</span> 2&gt;/dev/null)</span><br><span class="line"></span><br><span class="line">            <span class="comment"># 检测变化——只在进度更新时发送消息</span></span><br><span class="line">            <span class="keyword">if</span> [ <span class="string">&quot;<span class="variable">$current</span>&quot;</span> != <span class="string">&quot;<span class="variable">$LAST_PROGRESS</span>&quot;</span> ] &amp;&amp; [ -n <span class="string">&quot;<span class="variable">$current</span>&quot;</span> ]; <span class="keyword">then</span></span><br><span class="line">                LAST_PROGRESS=<span class="string">&quot;<span class="variable">$current</span>&quot;</span></span><br><span class="line">                <span class="built_in">local</span> msg</span><br><span class="line">                msg=$(parse_progress)</span><br><span class="line">                [ -n <span class="string">&quot;<span class="variable">$msg</span>&quot;</span> ] &amp;&amp; send_dingtalk <span class="string">&quot;<span class="variable">$msg</span>&quot;</span></span><br><span class="line">            <span class="keyword">fi</span></span><br><span class="line"></span><br><span class="line">            <span class="comment"># 检查是否完成</span></span><br><span class="line">            <span class="built_in">local</span> status</span><br><span class="line">            status=$(<span class="built_in">echo</span> <span class="string">&quot;<span class="variable">$current</span>&quot;</span> | jq -r <span class="string">&#x27;.status // &quot;&quot;&#x27;</span> 2&gt;/dev/null)</span><br><span class="line">            <span class="keyword">if</span> [ <span class="string">&quot;<span class="variable">$status</span>&quot;</span> = <span class="string">&quot;completed&quot;</span> ] || [ <span class="string">&quot;<span class="variable">$status</span>&quot;</span> = <span class="string">&quot;failed&quot;</span> ]; <span class="keyword">then</span></span><br><span class="line">                send_dingtalk <span class="string">&quot;Claude Code 任务已完成 (状态: <span class="variable">$status</span>)&quot;</span></span><br><span class="line">                <span class="built_in">break</span></span><br><span class="line">            <span class="keyword">fi</span></span><br><span class="line">        <span class="keyword">fi</span></span><br><span class="line">        <span class="built_in">sleep</span> <span class="variable">$CHECK_INTERVAL</span></span><br><span class="line">    <span class="keyword">done</span></span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="comment"># 支持两种运行模式</span></span><br><span class="line"><span class="keyword">case</span> <span class="string">&quot;<span class="variable">$&#123;1:-watch&#125;</span>&quot;</span> <span class="keyword">in</span></span><br><span class="line">    watch) main ;;</span><br><span class="line">    once)  parse_progress ;;</span><br><span class="line">    *)     <span class="built_in">echo</span> <span class="string">&quot;用法: <span class="variable">$0</span> [watch|once]&quot;</span>; <span class="built_in">exit</span> 1 ;;</span><br><span class="line"><span class="keyword">esac</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>这个脚本适合以下场景：</p><ul><li><strong>独立部署</strong>：不依赖 OpenClaw 的 <code>dws</code> 命令，直接用钉钉 Webhook 发送</li><li><strong>轮询模式</strong>：适合进度文件不是 <code>tail -f</code> 友好的情况（比如文件被覆写而非追加）</li><li><strong>单次检查</strong>：<code>once</code> 模式可以被 Cron 调用，按固定频率检查一次</li></ul><h2 id="两种方案的对比"><a href="#两种方案的对比" class="headerlink" title="两种方案的对比"></a>两种方案的对比</h2><p>维度</p><p>monitor.sh (tail -f)</p><p>sync-progress.sh (轮询)</p><p>实时性</p><p>毫秒级</p><p>秒级（取决于 CHECK_INTERVAL）</p><p>消息通道</p><p>dws（OpenClaw 原生）</p><p>钉钉 Webhook（独立）</p><p>适用格式</p><p>JSONL（追加写入）</p><p>任意 JSON 格式</p><p>完成检测</p><p>result 事件</p><p>status 字段</p><p>依赖</p><p>OpenClaw 环境</p><p>仅需 curl + jq</p><p>实际使用中，推荐用 <strong>monitor.sh</strong> 作为主方案——它实时性更好，与 OpenClaw 生态集成更紧密。<strong>sync-progress.sh</strong> 作为备选，适合需要独立部署或对接其他通知渠道的场景。</p><h2 id="端到端流程图"><a href="#端到端流程图" class="headerlink" title="端到端流程图"></a>端到端流程图</h2><p>用 Mermaid 图展示完整的任务生命周期：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br></pre></td><td class="code"><pre><span class="line">sequenceDiagram</span><br><span class="line">    participant U as 用户 (钉钉)</span><br><span class="line">    participant M as main Agent</span><br><span class="line">    participant C as Claude Code (Sub-Agent)</span><br><span class="line">    participant F as progress.jsonl</span><br><span class="line">    participant S as monitor.sh</span><br><span class="line">    participant D as dws (消息投递)</span><br><span class="line"></span><br><span class="line">    U-&gt;&gt;M: 帮我写一篇博客</span><br><span class="line">    M-&gt;&gt;M: 判断需要编程任务，调用 /run-task Skill</span><br><span class="line">    M-&gt;&gt;F: 初始化进度文件 (清空)</span><br><span class="line">    M-&gt;&gt;C: 启动 claude.sh --output-format stream-json (后台)</span><br><span class="line">    M-&gt;&gt;S: 启动 monitor.sh (后台)</span><br><span class="line">    M-&gt;&gt;D: 发送 &quot;任务已启动&quot;</span><br><span class="line">    D-&gt;&gt;U: 任务已启动，进度将实时同步</span><br><span class="line"></span><br><span class="line">    loop Claude Code 执行过程</span><br><span class="line">        C-&gt;&gt;F: 写入 assistant 事件 (JSONL)</span><br><span class="line">        F-&gt;&gt;S: tail -f 读取新行</span><br><span class="line">        S-&gt;&gt;S: 解析 JSON，提取 text</span><br><span class="line">        S-&gt;&gt;D: dws chat message send</span><br><span class="line">        D-&gt;&gt;U: 显示进度文本</span><br><span class="line">    end</span><br><span class="line"></span><br><span class="line">    C-&gt;&gt;F: 写入 result 事件</span><br><span class="line">    F-&gt;&gt;S: 读取 result 行</span><br><span class="line">    S-&gt;&gt;S: aggregate_stats() 汇总统计</span><br><span class="line">    S-&gt;&gt;D: 发送完成摘要 (轮次/耗时/花费/token)</span><br><span class="line">    D-&gt;&gt;U: Task completed 报告</span><br><span class="line">    S-&gt;&gt;S: break 退出</span><br></pre></td></tr></table></figure><h2 id="生产环境的注意事项"><a href="#生产环境的注意事项" class="headerlink" title="生产环境的注意事项"></a>生产环境的注意事项</h2><p><strong>1. 权限模式选择</strong></p><p>后台运行 Claude Code 时必须指定 <code>--permission-mode auto</code>，否则 Claude Code 在需要用户确认工具调用时会卡住。如果你的任务涉及敏感操作（删除文件、执行危险命令等），建议提前在 <code>.claude/settings.json</code> 中配置好允许的操作范围，而不是使用 <code>--dangerously-skip-permissions</code>。</p><p><strong>2. 进度文件清理</strong></p><p>每次启动新任务前，务必清空进度文件（&#96;&gt; &#x2F;tmp&#x2F;task-p</p><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/28/2026-03-28-OpenClaw---Claude-Code-%E5%8D%8F%E5%90%8C-%E7%94%A8-Sub-Agent-%E6%89%A7%E8%A1%8C%E7%BC%96%E7%A8%8B%E4%BB%BB%E5%8A%A1%E5%B9%B6%E5%AE%9E%E6%97%B6%E5%90%8C%E6%AD%A5%E8%BF%9B/</id>
    <link href="https://www.coconut.xin/2026/03/28/2026-03-28-OpenClaw---Claude-Code-%E5%8D%8F%E5%90%8C-%E7%94%A8-Sub-Agent-%E6%89%A7%E8%A1%8C%E7%BC%96%E7%A8%8B%E4%BB%BB%E5%8A%A1%E5%B9%B6%E5%AE%9E%E6%97%B6%E5%90%8C%E6%AD%A5%E8%BF%9B/"/>
    <published>2026-03-28T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E9%9C%80%E8%A6%]]>
    </summary>
    <title>OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</title>
    <updated>2026-03-29T02:02:07.689Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E4%B8%80%E4%B8%AA%E7%AE%80%E5%8D%95%E7%9A%84%E8%A7%82%E5%AF%9F%E8%B0%81%E5%9C%A8%E7%9C%9F%E6%AD%A3%E9%AB%98%E6%95%88%E5%9C%B0%E4%BD%BF%E7%94%A8ai">一、一个简单的观察：谁在真正高效地使用AI？</a></li><li><a href="#%E4%BA%8C%E8%AF%AD%E8%A8%80%E8%83%BD%E5%8A%9B%E4%BB%8E%E5%92%8C%E4%BA%BA%E6%B2%9F%E9%80%9A%E5%88%B0%E5%92%8Cai%E6%B2%9F%E9%80%9A">二、语言能力：从”和人沟通”到”和AI沟通”</a><ul><li><a href="#prompt-engineering%E7%9A%84%E6%9C%AC%E8%B4%A8%E6%98%AF%E8%AF%AD%E8%A8%80%E8%83%BD%E5%8A%9B">Prompt Engineering的本质是语言能力</a></li><li><a href="#%E9%98%85%E8%AF%BB%E7%90%86%E8%A7%A3%E8%83%BD%E5%8A%9B%E5%86%B3%E5%AE%9A%E4%BA%86%E4%BD%A0%E8%83%BD%E5%90%A6%E7%94%A8%E5%A5%BDai%E7%9A%84%E8%BE%93%E5%87%BA">阅读理解能力决定了你能否用好AI的输出</a></li><li><a href="#%E5%86%99%E4%BD%9C%E8%83%BD%E5%8A%9B%E6%98%AF%E6%9C%80%E8%A2%AB%E4%BD%8E%E4%BC%B0%E7%9A%84ai%E6%97%B6%E4%BB%A3%E7%AB%9E%E4%BA%89%E5%8A%9B">写作能力是最被低估的AI时代竞争力</a></li></ul></li><li><a href="#%E4%B8%89%E6%95%B0%E5%AD%A6%E8%83%BD%E5%8A%9B%E4%B8%8D%E5%8F%AA%E6%98%AF%E7%AE%97%E6%95%B0%E8%80%8C%E6%98%AF%E7%BB%93%E6%9E%84%E5%8C%96%E6%80%9D%E8%80%83%E7%9A%84%E5%BA%95%E5%BA%A7">三、数学能力：不只是算数，而是结构化思考的底座</a><ul><li><a href="#%E9%80%BB%E8%BE%91%E6%8E%A8%E7%90%86%E5%88%A4%E6%96%ADai%E5%AF%B9%E4%B8%8D%E5%AF%B9%E7%9A%84%E8%83%BD%E5%8A%9B">逻辑推理：判断AI对不对的能力</a></li><li><a href="#%E6%8A%BD%E8%B1%A1%E8%83%BD%E5%8A%9B%E6%8A%8A%E5%A4%8D%E6%9D%82%E9%97%AE%E9%A2%98%E7%AE%80%E5%8C%96%E7%9A%84%E8%83%BD%E5%8A%9B">抽象能力：把复杂问题简化的能力</a></li><li><a href="#debug%E8%83%BD%E5%8A%9B%E6%9C%AC%E8%B4%A8%E6%98%AF%E6%95%B0%E5%AD%A6%E8%AE%AD%E7%BB%83%E5%87%BA%E6%9D%A5%E7%9A%84">Debug能力：本质是数学训练出来的</a></li></ul></li><li><a href="#%E5%9B%9B%E7%B4%A0%E8%B4%A8%E6%95%99%E8%82%B2%E4%B8%8D%E6%98%AF%E6%9B%BF%E4%BB%A3%E5%9F%BA%E7%A1%80%E8%80%8C%E6%98%AF%E5%BB%BA%E7%AB%8B%E5%9C%A8%E5%9F%BA%E7%A1%80%E4%B9%8B%E4%B8%8A">四、素质教育不是替代基础，而是建立在基础之上</a></li><li><a href="#%E4%BA%94%E7%BB%99%E5%AE%B6%E9%95%BF%E5%92%8C%E6%95%99%E8%82%B2%E5%B7%A5%E4%BD%9C%E8%80%85%E7%9A%84%E5%BB%BA%E8%AE%AE">五、给家长和教育工作者的建议</a><ul><li><a href="#1-%E8%AF%AD%E8%A8%80%E8%83%BD%E5%8A%9B%E7%9A%84%E5%9F%B9%E5%85%BB%E9%98%85%E8%AF%BB--%E5%86%99%E4%BD%9C%E4%B8%8D%E8%83%BD%E5%81%8F%E5%BA%9F">1. 语言能力的培养：阅读 + 写作，不能偏废</a></li><li><a href="#2-%E6%95%B0%E5%AD%A6%E8%83%BD%E5%8A%9B%E7%9A%84%E5%9F%B9%E5%85%BB%E9%87%8D%E6%8E%A8%E7%90%86%E8%BF%87%E7%A8%8B%E8%BD%BB%E8%AE%A1%E7%AE%97%E7%BB%93%E6%9E%9C">2. 数学能力的培养：重推理过程，轻计算结果</a></li><li><a href="#3-%E5%9F%BA%E7%A1%80%E5%92%8C%E7%B4%A0%E8%B4%A8%E4%B8%8D%E6%98%AF%E4%BA%8C%E9%80%89%E4%B8%80">3. 基础和素质不是二选一</a></li></ul></li><li><a href="#%E5%85%AD%E7%BB%93%E8%AF%AD">六、结语</a></li></ul><p>AI时代的教育讨论，最常见的声音是：要培养批判性思维、创造力、跨学科能力、情商、沟通协作……这些当然重要。但一个危险的倾向正在蔓延——<strong>很多人把”素质教育”和”基础学科”对立起来了</strong>，好像强调语文数学就是应试教育的残余，而AI时代只需要”软实力”。</p><p>这是一个严重的误判。</p><p><strong>语言能力和数学能力，不是AI时代要淘汰的旧能力，恰恰是驾驭AI最底层的两项基础能力。</strong> 没有它们，所谓的批判性思维、创造力、AI素养，全都是空中楼阁。</p><h2 id="一、一个简单的观察：谁在真正高效地使用AI？"><a href="#一、一个简单的观察：谁在真正高效地使用AI？" class="headerlink" title="一、一个简单的观察：谁在真正高效地使用AI？"></a>一、一个简单的观察：谁在真正高效地使用AI？</h2><p>过去两年，大模型从实验室走进了日常工作。一个有趣的现象是：<strong>真正能把AI用好的人，几乎都有扎实的语言功底或数学功底，或者两者兼备。</strong></p><p>写prompt本质上是在写作——你需要精确地描述意图、限定范围、给出约束条件、预设输出格式。这和写一道好的作文题目、出一份清晰的需求文档，是同一种能力。</p><p>验证AI输出本质上是在做逻辑推理——你需要判断论证是否自洽、数据是否合理、推导过程是否有跳步、结论是否可信。这和做一道数学证明题、debug一段程序，是同一种能力。</p><p>那些在各行各业把AI用出花样的人——无论是用Claude写代码、用GPT辅助研究、用AI生成商业分析——他们身上最突出的共同点不是”懂AI技术”，而是<strong>语言表达精准、逻辑推理扎实</strong>。</p><p>反过来，那些抱怨”AI不好用”“ChatGPT总是答非所问”的人，往往问题出在自己身上：要么描述模糊，要么无法判断AI输出的质量。</p><h2 id="二、语言能力：从”和人沟通”到”和AI沟通”"><a href="#二、语言能力：从”和人沟通”到”和AI沟通”" class="headerlink" title="二、语言能力：从”和人沟通”到”和AI沟通”"></a>二、语言能力：从”和人沟通”到”和AI沟通”</h2><h3 id="Prompt-Engineering的本质是语言能力"><a href="#Prompt-Engineering的本质是语言能力" class="headerlink" title="Prompt Engineering的本质是语言能力"></a>Prompt Engineering的本质是语言能力</h3><p>Prompt engineering这个词听起来很技术，但拆开来看，它的核心就是三件事：</p><ol><li><strong>精确表达意图</strong>——你想让AI做什么，不做什么</li><li><strong>提供有效上下文</strong>——AI需要知道什么才能完成任务</li><li><strong>设定清晰的约束和格式</strong>——你期望什么样的输出</li></ol><p>这三件事，和语文课上教的”审题、组织材料、结构化表达”完全同构。</p><p>举一个真实的例子。同样是让AI帮忙分析一份财报：</p><p><strong>普通prompt：</strong></p><blockquote><p>帮我分析一下这份财报</p></blockquote><p>AI大概率会给你一堆泛泛而谈的废话。</p><p><strong>好的prompt：</strong></p><blockquote><p>请分析这份2025年Q3财报中的以下维度：1）营收同比增长率及主要驱动因素；2）毛利率变化趋势及原因分析；3）经营现金流与净利润的偏差是否存在异常。请用结构化表格呈现关键数据，并在最后给出三个需要进一步关注的风险点。</p></blockquote><p>两者的差距不在于”懂不懂AI”，而在于<strong>语言组织能力</strong>——能不能把一个模糊的需求拆解成精确的、可执行的指令。</p><p>这种能力从哪里来？从大量的阅读中来，从反复的写作训练中来，从对语言的敏感度和控制力中来。一个阅读面广、写作能力强的人，天然就能写出更好的prompt，因为他习惯了精确表达、结构化思考、预判读者（或AI）的理解方式。</p><h3 id="阅读理解能力决定了你能否用好AI的输出"><a href="#阅读理解能力决定了你能否用好AI的输出" class="headerlink" title="阅读理解能力决定了你能否用好AI的输出"></a>阅读理解能力决定了你能否用好AI的输出</h3><p>AI给你的回答，你能看懂吗？这不是一个多余的问题。</p><p>大模型的输出往往是长文本——几百字到几千字的分析、建议、代码、方案。面对这样的输出，你需要：</p><ul><li><strong>快速抓住核心论点</strong>，过滤掉填充性的废话</li><li><strong>识别逻辑漏洞</strong>——AI的论证是否有跳步，前提是否成立</li><li><strong>判断信息的可信度</strong>——AI可能在一本正经地胡说八道（幻觉问题）</li><li><strong>把AI的输出整合进自己的知识体系</strong></li></ul><p>这些全都是阅读理解能力。一个阅读理解能力弱的人，面对AI的输出，要么全盘接受（危险），要么全盘拒绝（浪费），无法做出有效的筛选和判断。</p><h3 id="写作能力是最被低估的AI时代竞争力"><a href="#写作能力是最被低估的AI时代竞争力" class="headerlink" title="写作能力是最被低估的AI时代竞争力"></a>写作能力是最被低估的AI时代竞争力</h3><p>AI时代有一个反直觉的结论：<strong>写作能力不是被AI替代的能力，而是使用AI的能力。</strong></p><p>因为AI本质上是一个”语言接口”。你和AI之间的所有交互——输入和输出——都是通过语言完成的。语言能力越强，你能通过这个接口获取的价值就越大。</p><p>这就像一个英语流利的人和一个英语磕巴的人同时出国——他们面对的是同一个世界，但能获取的信息、能办成的事情，完全不在一个量级。</p><h2 id="三、数学能力：不只是算数，而是结构化思考的底座"><a href="#三、数学能力：不只是算数，而是结构化思考的底座" class="headerlink" title="三、数学能力：不只是算数，而是结构化思考的底座"></a>三、数学能力：不只是算数，而是结构化思考的底座</h2><h3 id="逻辑推理：判断AI对不对的能力"><a href="#逻辑推理：判断AI对不对的能力" class="headerlink" title="逻辑推理：判断AI对不对的能力"></a>逻辑推理：判断AI对不对的能力</h3><p>数学教育的核心产出不是”会算题”，而是<strong>逻辑推理能力</strong>——给定前提，推导结论，并且能判断推导过程是否严密。</p><p>这种能力在AI时代变得前所未有的重要。因为AI会犯错，而且犯得很自信。</p><p>一个典型的场景：你让AI帮你做一个数据分析，它给了你一个漂亮的结论和一组支撑数据。但如果你仔细看，可能会发现：</p><ul><li>它混淆了相关性和因果性</li><li>它的样本选择有偏差</li><li>它的计算过程有一步跳跃了</li><li>它引用的”事实”根本不存在</li></ul><p><strong>能发现这些问题的前提是：你自己具备基本的逻辑和数学素养。</strong> 如果你连”相关不等于因果”这个概念都没有，AI给你一个错误的因果推论，你只会觉得”好有道理”。</p><h3 id="抽象能力：把复杂问题简化的能力"><a href="#抽象能力：把复杂问题简化的能力" class="headerlink" title="抽象能力：把复杂问题简化的能力"></a>抽象能力：把复杂问题简化的能力</h3><p>数学训练的另一个核心产出是<strong>抽象能力</strong>——从具体的问题中提取出结构，忽略不重要的细节，聚焦于关键变量和它们之间的关系。</p><p>使用AI时，抽象能力决定了你能不能把一个复杂的现实问题”翻译”成AI能处理的形式。</p><p>比如，一个运营经理想用AI优化促销策略。他面对的是一堆混乱的现实：不同渠道、不同品类、不同时间段、不同用户群体、不同促销力度……如果他不具备把这些因素抽象成变量、建立简化模型的能力，他连问题都描述不清楚，更别说让AI帮他分析了。</p><p>数学好的人，不一定要自己去建模型，但他能<strong>把现实问题转化为结构化的问题描述</strong>——而这正是AI需要的输入。</p><h3 id="Debug能力：本质是数学训练出来的"><a href="#Debug能力：本质是数学训练出来的" class="headerlink" title="Debug能力：本质是数学训练出来的"></a>Debug能力：本质是数学训练出来的</h3><p>写代码的人都知道，debug的核心不是”找哪一行写错了”，而是<strong>逻辑排查</strong>：</p><ol><li>预期结果是什么？</li><li>实际结果是什么？</li><li>偏差可能发生在哪些环节？</li><li>如何设计实验来缩小排查范围？</li><li>找到原因后如何验证修复是否正确？</li></ol><p>这个过程和数学中的”反证法”“分类讨论”“控制变量”是同一套思维方式。</p><p>AI时代，debug的对象变了——你不只是在debug代码，你还在”debug AI的输出”。AI给了一个错误的方案，你需要定位问题出在哪：是prompt不够清晰？是上下文不够？是AI的推理过程有误？还是这个任务本身超出了AI的能力范围？</p><p><strong>这种排查能力，根基在数学训练中。</strong></p><h2 id="四、素质教育不是替代基础，而是建立在基础之上"><a href="#四、素质教育不是替代基础，而是建立在基础之上" class="headerlink" title="四、素质教育不是替代基础，而是建立在基础之上"></a>四、素质教育不是替代基础，而是建立在基础之上</h2><p>回到教育的讨论。</p><p>“素质教育”这个概念被滥用了。很多人把它理解为”少做数学题，多搞艺术和社交”。但真正的素质教育从来不是要削弱基础学科，而是要<strong>在基础学科扎实的前提下，拓展更多的能力维度</strong>。</p><p>创造力需要基础吗？当然需要。没有对领域知识的深度理解，所谓的创造力只是天马行空的幻想。物理学上最伟大的创造——相对论——来自爱因斯坦极其扎实的数学功底和深刻的物理直觉，而不是”跳出框架思考”这种空洞的口号。</p><p>批判性思维需要基础吗？当然需要。批判性思维的核心是<strong>识别论证中的逻辑谬误</strong>——这本身就是逻辑和语言能力的综合运用。一个逻辑不好的人，连别人的论证结构都理不清楚，谈何”批判”？</p><p>跨学科能力需要基础吗？当然需要。跨学科的前提是<strong>你在每个学科都有基本的理解</strong>，否则”跨”���只是表面的词汇，而不是深层的思维方式。</p><p><strong>语言和数学，是这一切的地基。</strong> 地基不稳，上面盖的楼越高越危险。</p><h2 id="五、给家长和教育工作者的建议"><a href="#五、给家长和教育工作者的建议" class="headerlink" title="五、给家长和教育工作者的建议"></a>五、给家长和教育工作者的建议</h2><p>如果你正在思考AI时代该怎么教育孩子，以下是几个实操建议：</p><h3 id="1-语言能力的培养：阅读-写作，不能偏废"><a href="#1-语言能力的培养：阅读-写作，不能偏废" class="headerlink" title="1. 语言能力的培养：阅读 + 写作，不能偏废"></a>1. 语言能力的培养：阅读 + 写作，不能偏废</h3><ul><li><strong>大量阅读</strong>是最底层的投入。不只是读文学，也要读非虚构——科普、历史、商业、技术。阅读面越广，孩子能处理的信息类型就越多。</li><li><strong>写作要练到”精确”</strong>。不是写得华丽，而是写得清楚。能把一个复杂的事情用300字说明白，比写一篇3000字的散文更有价值。</li><li><strong>让孩子用AI写作，然后让他们评判AI的输出</strong>。这是一个绝佳的练习：AI写的哪里好？哪里有问题？你能不能改得更好？</li></ul><h3 id="2-数学能力的培养：重推理过程，轻计算结果"><a href="#2-数学能力的培养：重推理过程，轻计算结果" class="headerlink" title="2. 数学能力的培养：重推理过程，轻计算结果"></a>2. 数学能力的培养：重推理过程，轻计算结果</h3><ul><li>AI已经可以替代几乎所有的计算工作。但<strong>推理过程、建模能力、逻辑判断</strong>——这些AI替代不了，因为你需要它们来判断AI给出的计算结果是否合理。</li><li><strong>让孩子多做”为什么”的追问</strong>。不是”3×5等于多少”，而是”为什么3×5和5×3结果一样？““为什么负负得正？“理解”为什么”比记住”是什么”重要一百倍。</li><li><strong>培养估算的直觉</strong>。AI算出一个结果，你至少要能判断它的数量级对不对。这种直觉来自大量的数学练习。</li></ul><h3 id="3-基础和素质不是二选一"><a href="#3-基础和素质不是二选一" class="headerlink" title="3. 基础和素质不是二选一"></a>3. 基础和素质不是二选一</h3><p>不要掉进”要基础还是要素质”的假选择。<strong>真正的路径是：用扎实的语言和数学基础，去支撑更高层次的素质发展。</strong></p><ul><li>语言好 + 创造力 &#x3D; 能把创意清晰地表达出来，让别人（或AI）理解并执行</li><li>数学好 + 批判性思维 &#x3D; 能用逻辑和数据来支撑或反驳一个观点，而不是停留在”我觉得”</li><li>语言好 + 数学好 + AI工具 &#x3D; 一个能驾驭AI、放大自身能力的人</li></ul><h2 id="六、结语"><a href="#六、结语" class="headerlink" title="六、结语"></a>六、结语</h2><p>AI时代最大的教育陷阱，不是孩子学不会AI，而是<strong>因为追赶”AI素养”的表面概念，放松了对语言和数学这两项底层能力的训练</strong>。</p><p>一个语言好、数学好的人，给他任何一个新工具——无论是搜索引擎、编程语言，还是大模型——他都能快速上手，因为他具备理解工具、描述问题、验证结果的基础能力。</p><p>一个语言和数学基础薄弱的人，即使背会了所有的prompt模板，也只是在机械地操作，无法真正理解自己在做什么、AI在做什么、结果是否可信。</p><p><strong>教育的目标不是培养”会用AI的人”，而是培养”有能力驾驭任何新工具的人”。</strong> 而语言和数学，就是这种能力的底座。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/education/">education</a>  <a href="https://hugozhu.site/tags/prompt-engineering/">prompt-engineering</a>  <a href="https://hugozhu.site/tags/%E6%80%9D%E8%80%83/">思考</a> </p><hr><ul><li><a href="/post/2026/158-maas-core-capabilities/">AI的MaaS层最核心的能力：把一个不稳定的概率接口，变成一个可运营的服务</a></li><li><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></li><li><a href="/post/2026/155-microsoft-hr-restructuring-ai-era-organization/">微软的组织变革：从成长性思维到像AI一样自我进化的组织</a></li><li><a href="/post/2026/156-agent-vs-model-boundary/">模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</a></li><li><a href="/post/2026/151-tob-agent-user-feedback-loop/">别再卷模型了：To B Agent 创业，用户反馈才是生死线</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/159-language-math-ai-education-foundation/">素质之外，语言和数学仍然是教育的基础，是驾驭AI的底层能力</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/28/2026-03-28-%E7%B4%A0%E8%B4%A8%E4%B9%8B%E5%A4%96-%E8%AF%AD%E8%A8%80%E5%92%8C%E6%95%B0%E5%AD%A6%E4%BB%8D%E7%84%B6%E6%98%AF%E6%95%99%E8%82%B2%E7%9A%84%E5%9F%BA%E7%A1%80-%E6%98%AF%E9%A9%BE%E9%A9%ADAI%E7%9A%84%E5%BA%95%E5%B1%82%E8%83%BD%E5%8A%9B/</id>
    <link href="https://www.coconut.xin/2026/03/28/2026-03-28-%E7%B4%A0%E8%B4%A8%E4%B9%8B%E5%A4%96-%E8%AF%AD%E8%A8%80%E5%92%8C%E6%95%B0%E5%AD%A6%E4%BB%8D%E7%84%B6%E6%98%AF%E6%95%99%E8%82%B2%E7%9A%84%E5%9F%BA%E7%A1%80-%E6%98%AF%E9%A9%BE%E9%A9%ADAI%E7%9A%84%E5%BA%95%E5%B1%82%E8%83%BD%E5%8A%9B/"/>
    <published>2026-03-28T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E4%B8%80%E4%B8%AA%E7%AE%80%E5%8D%]]>
    </summary>
    <title>素质之外，语言和数学仍然是教育的基础，是驾驭AI的底层能力</title>
    <updated>2026-03-29T02:02:08.069Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E6%A0%B8%E5%BF%83%E8%A7%82%E7%82%B9%E5%9B%9B%E4%B8%AA%E6%A0%B9%E6%9C%AC%E6%80%A7%E8%BD%AC%E5%8F%98">一、核心观点：四个根本性转变</a></li><li><a href="#%E4%BA%8C%E6%88%90%E9%95%BF%E5%9E%8B%E6%80%9D%E7%BB%B4%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E5%A4%9F%E7%94%A8%E4%BA%86">二、“成长型思维”为什么不够用了？</a></li><li><a href="#%E4%B8%89%E4%B8%83%E5%A4%A7%E5%8F%98%E5%8C%96%E5%BE%AE%E8%BD%AF%E5%88%B0%E5%BA%95%E6%94%B9%E4%BA%86%E4%BB%80%E4%B9%88">三、七大变化：微软到底改了什么</a><ul><li><a href="#%E5%8F%98%E5%8C%961%E5%B7%A5%E7%A8%8Bhr%E7%BB%9F%E4%B8%80%E6%95%B4%E5%90%88">变化1：工程HR统一整合</a></li><li><a href="#%E5%8F%98%E5%8C%962%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E5%B5%8C%E5%85%A5%E4%BD%93%E9%AA%8C%E8%AE%BE%E8%AE%A1">变化2：数据分析嵌入体验设计</a></li><li><a href="#%E5%8F%98%E5%8C%963%E8%96%AA%E9%85%AC%E7%A6%8F%E5%88%A9%E9%9B%86%E4%B8%AD%E5%8C%96">变化3：薪酬福利集中化</a></li><li><a href="#%E5%8F%98%E5%8C%964%E6%8B%9B%E8%81%98%E6%8F%90%E5%8D%87%E5%88%B0%E6%88%98%E7%95%A5%E7%BA%A7">变化4：招聘提升到战略级</a></li><li><a href="#%E5%8F%98%E5%8C%965%E6%96%87%E5%8C%96%E5%B7%A5%E4%BD%9C%E6%97%A5%E5%B8%B8%E5%8C%96">变化5：文化工作日常化</a></li><li><a href="#%E5%8F%98%E5%8C%966%E4%BB%8E%E5%9F%B9%E8%AE%AD%E5%88%B0%E8%83%BD%E5%8A%9B%E5%BB%BA%E8%AE%BE">变化6：从”培训”到”能力建设”</a></li><li><a href="#%E5%8F%98%E5%8C%967%E6%96%B0%E8%AE%BEworkforce-acceleration%E6%9C%80%E5%80%BC%E5%BE%97%E5%85%B3%E6%B3%A8">变化7：新设Workforce Acceleration（最值得关注）</a></li></ul></li><li><a href="#%E5%9B%9B%E5%9B%9B%E4%BD%8D%E9%AB%98%E7%AE%A1%E7%A6%BB%E5%BC%80%E4%B8%80%E4%B8%AA%E6%97%B6%E4%BB%A3%E7%9A%84%E7%BB%93%E6%9D%9F">四、四位高管离开：一个时代的结束</a></li><li><a href="#%E4%BA%94%E4%B8%BA%E4%BB%80%E4%B9%88%E8%AF%B4%E5%BE%AE%E8%BD%AF%E6%83%B3%E8%AE%A9hr%E5%83%8Fai%E4%B8%80%E6%A0%B7%E8%BF%90%E8%A1%8C">五、为什么说微软想让HR”像AI一样运行”</a><ul><li><a href="#hr%E8%A7%92%E8%89%B2%E7%9A%84%E6%9C%AC%E8%B4%A8%E5%8D%87%E7%BA%A7%E4%BB%8E%E5%B9%B4%E5%BA%A6%E7%AE%A1%E7%90%86%E8%80%85%E5%88%B0%E5%AE%9E%E6%97%B6%E8%B0%83%E5%BA%A6%E8%80%85">HR角色的本质升级：从”年度管理者”到”实时调度者”</a></li></ul></li><li><a href="#%E5%85%AD%E5%AF%B9ai%E5%8F%98%E9%9D%A9%E4%B8%8B%E7%9A%84%E4%BC%81%E4%B8%9A%E4%B8%89%E7%82%B9%E5%90%AF%E7%A4%BA">六、对AI变革下的企业三点启示</a><ul><li><a href="#%E5%90%AF%E7%A4%BA%E4%B8%80ai%E8%BD%AC%E5%9E%8B%E4%BC%9A%E8%B6%8A%E6%9D%A5%E8%B6%8A%E6%B7%B1%E5%9C%B0%E8%BF%9B%E5%85%A5%E7%BB%84%E7%BB%87%E7%B3%BB%E7%BB%9F">启示一：AI转型会越来越深地进入组织系统</a></li><li><a href="#%E5%90%AF%E7%A4%BA%E4%BA%8Chr%E7%9A%84%E8%A7%92%E8%89%B2%E5%9C%A8%E5%8D%87%E7%BA%A7">启示二：HR的角色在升级</a></li><li><a href="#%E5%90%AF%E7%A4%BA%E4%B8%89%E4%BC%81%E4%B8%9A%E7%AB%9E%E4%BA%89%E8%B6%8A%E6%9D%A5%E8%B6%8A%E5%83%8F%E7%B3%BB%E7%BB%9F%E7%AB%9E%E4%BA%89">启示三：企业竞争越来越像系统竞争</a></li></ul></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>3月25日晚，微软首席人力官Amy Coleman在一份内部备忘录中，宣布对微软HR团队进行系统性调整。这不是一次普通的架构调整，而是AI时代组织进化的一次预演——微软正在把组织，从”管理系统”，升级为”计算系统”。</p><h2 id="一、核心观点：四个根本性转变"><a href="#一、核心观点：四个根本性转变" class="headerlink" title="一、核心观点：四个根本性转变"></a>一、核心观点：四个根本性转变</h2><p>在深入微软的具体动作之前，先说结论。这次重组背后，是四个根本性的认知转变：</p><ul><li><strong>人不再是”资源”，而是”可编排能力”</strong>——不再按岗位定义人，而是按技能组合调度人</li><li><strong>组织从”岗位驱动”转向”技能驱动”</strong>——岗位是静态的，技能是流动的</li><li><strong>从”流程驱动”转向”反馈闭环驱动”</strong>——不再追求标准化流程，而是追求学习速度</li><li><strong>HR从”后台支撑”升级为”系统架构师”</strong>——HR不再只管人，而是设计组织的运行方式</li></ul><p>一句话总结：<strong>在AI时代，企业的核心竞争力，不再是规模或流程效率，而是”组织作为一个系统的学习速度、调度能力和进化能力”。</strong></p><h2 id="二、“成长型思维”为什么不够用了？"><a href="#二、“成长型思维”为什么不够用了？" class="headerlink" title="二、“成长型思维”为什么不够用了？"></a>二、“成长型思维”为什么不够用了？</h2><p>过去十年，在CEO萨提亚·纳德拉和前HR负责人Kathleen Hogan的带领下，微软建立了以”成长型思维”为核心的管理体系。这套体系帮助微软完成了文化转型，市值也从3000亿美元飙升至3万亿美元。</p><p>但Coleman认为，这套体系已经跟不上AI时代的速度。她在备忘录中直言：</p><blockquote><p>“变化的速度已经超过了我们当前运营模式和决策节奏所能承受的范围。”</p></blockquote><p>过去HR的设计逻辑是**“为稳定而规模化”**——建立标准流程、统一规则、可重复的操作手册，确保22万人的大公司不出错。</p><p>但AI时代，业务在变、技术在变、员工的工作方式在变。当外部环境以天为单位变化时，以”年”为周期调整的HR体系，就成了瓶颈。</p><p>所以Coleman说：我们要**“为适应而规模化”**——不是建立更大的流程，而是建立更快进化的能力。</p><p>这就是整次重组的底层逻辑。</p><h2 id="三、七大变化：微软到底改了什么"><a href="#三、七大变化：微软到底改了什么" class="headerlink" title="三、七大变化：微软到底改了什么"></a>三、七大变化：微软到底改了什么</h2><p>从具体动作看，这次调整几乎覆盖了整个People团队，核心变化可以归纳为七项：</p><h3 id="变化1：工程HR统一整合"><a href="#变化1：工程HR统一整合" class="headerlink" title="变化1：工程HR统一整合"></a>变化1：工程HR统一整合</h3><p>Mel Simpson被任命为工程HR负责人，统管所有工程团队的HR工作。过去工程HR分散在不同业务线，各自为战。现在统一管理，意味着微软要用<strong>一套系统化的人才策略</strong>来应对AI人才的激烈争夺。</p><h3 id="变化2：数据分析嵌入体验设计"><a href="#变化2：数据分析嵌入体验设计" class="headerlink" title="变化2：数据分析嵌入体验设计"></a>变化2：数据分析嵌入体验设计</h3><p>Nathalie D’Hers领导的员工体验团队，将接管People Analytics团队。过去数据分析师出报告，体验设计师做方案，中间有延迟、有断层。现在分析能力被直接嵌入体验设计的过程。</p><p>Coleman的原话是：</p><blockquote><p>“让分析能力更接近它们所影响的体验和决策，实现更快的学习和更强的洞察到行动的闭环。”</p></blockquote><h3 id="变化3：薪酬福利集中化"><a href="#变化3：薪酬福利集中化" class="headerlink" title="变化3：薪酬福利集中化"></a>变化3：薪酬福利集中化</h3><p>Mike Cyran被任命为总薪酬负责人，统管全球薪酬、福利、股权激励。不再是”一刀切”的薪酬体系，而是根据不同业务、不同人才的竞争态势，<strong>动态调整</strong>。</p><h3 id="变化4：招聘提升到战略级"><a href="#变化4：招聘提升到战略级" class="headerlink" title="变化4：招聘提升到战略级"></a>变化4：招聘提升到战略级</h3><p>微软正在全球范围内寻找一位专职的招聘负责人，直接向Coleman汇报。Coleman说：<strong>“人才战略就是竞争战略。”</strong> 在AI人才争夺战中，招聘速度和质量直接决定了竞争位置。</p><h3 id="变化5：文化工作日常化"><a href="#变化5：文化工作日常化" class="headerlink" title="变化5：文化工作日常化"></a>变化5：文化工作日常化</h3><p>文化与包容不再作为独立职能存在，而是被放进新设立的People &amp; Culture团队中，由Leslie Lawson Sims负责。文化不再是一个独立的”项目”，而是嵌入HR的日常工作。</p><h3 id="变化6：从”培训”到”能力建设”"><a href="#变化6：从”培训”到”能力建设”" class="headerlink" title="变化6：从”培训”到”能力建设”"></a>变化6：从”培训”到”能力建设”</h3><p>Wyatt Cutler从AWS、PayPal等公司回归微软，负责人才发展工作。这不是职能合并，而是理念升级：<strong>培训是单向的知识传递，能力建设是让组织具备持续进化的动态能力。</strong></p><h3 id="变化7：新设Workforce-Acceleration（最值得关注）"><a href="#变化7：新设Workforce-Acceleration（最值得关注）" class="headerlink" title="变化7：新设Workforce Acceleration（最值得关注）"></a>变化7：新设Workforce Acceleration（最值得关注）</h3><p>Justin Thenutai被任命为劳动力加速负责人，统管技能提升、人才再部署、劳动力规划以及**“人-AI协作”能力**。</p><p>这意味着微软正在系统性地思考：当AI成为员工的工作伙伴时，人的角色是什么？如何让人和AI协同工作？不是用AI替代人，而是让人和AI各自发挥优势，形成1+1&gt;2的效应。</p><h2 id="四、四位高管离开：一个时代的结束"><a href="#四、四位高管离开：一个时代的结束" class="headerlink" title="四、四位高管离开：一个时代的结束"></a>四、四位高管离开：一个时代的结束</h2><p>这次重组伴随着几位资深高管的离开：</p><p>姓名</p><p>服务年限</p><p>职责领域</p><p>Kristen Roby Dimlow</p><p>近30年</p><p>人才招聘、总薪酬</p><p>Chuck Edward</p><p>22年</p><p>HR业务伙伴、人才招聘</p><p>Dawn Klinghoffer</p><p>20余年</p><p>HR数据分析开创者</p><p>Lindsay-Rae McIntyre</p><p>8年</p><p>首席多元化官</p><p>他们见证了微软从鲍尔默时代到纳德拉时代的转型，也参与了”成长型思维”文化的建设。Coleman在备忘录中写道：</p><blockquote><p>“他们的领导力、判断力和对人的关怀，树立了一个标准，这个标准将超越此刻而持续存在。”</p></blockquote><p>这句话既是对过去的致敬，也是对未来的宣告——<strong>标准已经变了。</strong></p><h2 id="五、为什么说微软想让HR”像AI一样运行”"><a href="#五、为什么说微软想让HR”像AI一样运行”" class="headerlink" title="五、为什么说微软想让HR”像AI一样运行”"></a>五、为什么说微软想让HR”像AI一样运行”</h2><p>内部信反复出现同一类词：<strong>更快、更紧、更简、更贴近业务、更快学习、更快闭环。</strong></p><ul><li>Employee Experience部分强调”faster learning”和”stronger insight to action loops”</li><li>Workforce Acceleration部分强调”test and learn faster with the business”</li><li>整封信开头强调”move faster”和”help set a new pace”</li></ul><p>微软对HR的期待，已经不再是一个稳定、流程化、周期性的后台系统，而是希望它像AI系统一样，具备三个新特征：</p><p><strong>第一，更快。</strong> 能快速响应业务变化，而不是等组织慢慢开会、层层传递之后再行动。</p><p><strong>第二，更灵活。</strong> 能跨团队、跨模块整合资源，而不是被传统边界困住。</p><p><strong>第三，更懂业务。</strong> 不是停留在”懂人”，而是要知道不同业务优先级、不同产品节奏、不同战略重点背后真正需要什么样的人才与组织配置。</p><p>“像AI一样”不是说HR要自动化，而是说<strong>HR本身也要从一个静态管理系统，变成一个动态适应系统。</strong></p><h3 id="HR角色的本质升级：从”年度管理者”到”实时调度者”"><a href="#HR角色的本质升级：从”年度管理者”到”实时调度者”" class="headerlink" title="HR角色的本质升级：从”年度管理者”到”实时调度者”"></a>HR角色的本质升级：从”年度管理者”到”实时调度者”</h3><p>但这里有一个更深层的变化值得展开——<strong>有了AI之后，HR这个角色本身的能力边界被彻底改写了。</strong></p><p>过去HR为什么只能做年度规划、半年度review、季度人才盘点？不是不想更快，而是<strong>做不到</strong>。原因很简单：数据采集慢、分析周期长、反馈链路断裂。一个组织调整的决策，往往要等半年的绩效数据出来，再花两个月做分析，再花一个月层层对齐，等真正落地时，业务环境可能已经变了两轮。</p><p>AI改变了这个底层约束。</p><p><strong>第一，过程数据变得可采集、可分析。</strong> 过去HR只能依赖结果数据——季度业绩、年度绩效评分、离职率。这些都是滞后指标，等看到数据时问题已经发生了。而现在，AI可以实时处理协作工具中的沟通模式、项目管理系统中的交付节奏、代码仓库中的贡献分布、会议记录中的决策效率。这些<strong>过程数据</strong>才是组织健康度的领先指标。</p><p>举个例子：传统HR要等到季度末才知道某个团队产出下降了，但AI可以在第三周就发现这个团队的代码review周期在拉长、跨团队协作频次在下降、会议时长在增加——这些信号比绩效数字早出现两个月。</p><p><strong>第二，反馈闭环的周期从”季度”缩短到”周”甚至”天”。</strong> 这是最关键的变化。过去组织调整是一个重决策：调研→分析→提案→审批→执行→评估，整个周期可能半年到一年。但有了AI的数据能力和分析能力，HR可以做到”小步快跑”式的持续优化——每周看数据、每月微调、每季度复盘。就像AI模型训练中的梯度下降一样，不需要一步到位找到最优解，而是通过高频的小幅调整，持续逼近最优状态。</p><p><strong>第三，人效变得真正可衡量。</strong> 这是HR长期以来最大的痛点——“人效”这个词被喊了很多年，但大多数企业的人效衡量要么停留在”人均营收”这类粗放指标，要么依赖主观评价。AI让更精细的人效衡量成为可能：一个工程师的实际产出中，多少是独立完成的，多少是AI辅助的？一个团队在引入AI工具前后，交付周期缩短了多少？技能提升项目的投入，在三个月后是否体现为可量化的能力增长？</p><p>当人效变得可衡量，组织调整就不再是拍脑袋，而是有据可依的系统优化。<strong>这本质上就是把HR从一个”凭经验做判断”的角色，升级为一个”用数据做决策、用反馈做迭代”的角色——这就是AI时代HR的真正价值。</strong></p><p>微软新设立的Workforce Acceleration部门，以及把People Analytics嵌入Employee Experience的动作，正是在为这个升级搭建基础设施。它不是在加人手，而是在<strong>改变HR这个职能的运行方式</strong>——让HR拥有和AI系统一样的”感知-分析-决策-执行-反馈”闭环能力。</p><h2 id="六、对AI变革下的企业三点启示"><a href="#六、对AI变革下的企业三点启示" class="headerlink" title="六、对AI变革下的企业三点启示"></a>六、对AI变革下的企业三点启示</h2><h3 id="启示一：AI转型会越来越深地进入组织系统"><a href="#启示一：AI转型会越来越深地进入组织系统" class="headerlink" title="启示一：AI转型会越来越深地进入组织系统"></a>启示一：AI转型会越来越深地进入组织系统</h3><p>很多企业今天还把AI看成某个部门、某种软件、某类效率工具，但微软已经把”人-AI协作”写进HR设计里了。AI的下一步，不只是改变工作内容，而是改变组织的配置方式。</p><h3 id="启示二：HR的角色在升级"><a href="#启示二：HR的角色在升级" class="headerlink" title="启示二：HR的角色在升级"></a>启示二：HR的角色在升级</h3><p>未来HR的价值，不只是招聘和绩效，也不只是文化和福利，而是<strong>组织能力的设计者</strong>。谁能更快完成技能重构、岗位重构、人机协作重构，谁就更有可能赢得AI时代的组织优势。</p><h3 id="启示三：企业竞争越来越像系统竞争"><a href="#启示三：企业竞争越来越像系统竞争" class="headerlink" title="启示三：企业竞争越来越像系统竞争"></a>启示三：企业竞争越来越像系统竞争</h3><p>不是比谁用了AI，而是比谁能更快学习、更快调整、更快把洞察转成行动、更快让组织和业务形成闭环。微软这次整套调整，几乎就是围绕这件事在动。</p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>微软这次HR重组，看似是一次内部架构调整，实则是AI时代组织进化的一次预演。</p><p>当AI开始改变工作方式、决策方式和协作方式时，企业的人力资源系统也必须同步进化。微软正在做的，就是为AI时代的组织管理，写一份新的操作手册。</p><p>Coleman在备忘录的最后写道：</p><blockquote><p>“Let’s keep learning, let go of old assumptions, and make Microsoft a place where everyone can do their best work.”</p></blockquote><p><strong>继续学习，放下旧假设。</strong></p><p>对组织如此，对个人也一样。AI时代真正拉开差距的，不只是公司能不能变，更是个人愿不愿意持续进化。放下旧假设，意味着不再用过去熟悉的经验判断今天的变化；持续学习，意味着不断更新自己的认知、方法和工作方式。</p><p>组织要为适应而生，个人也一样。</p><p><strong>大变革时代，与其担心，不如现在就行动起来。</strong></p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9/">组织变革</a>  <a href="https://hugozhu.site/tags/%E5%BE%AE%E8%BD%AF/">微软</a>  <a href="https://hugozhu.site/tags/%E4%BC%81%E4%B8%9A%E6%96%87%E5%8C%96/">企业文化</a>  <a href="https://hugozhu.site/tags/hr/">HR</a>  <a href="https://hugozhu.site/tags/%E4%BA%BA%E6%9C%BA%E5%8D%8F%E4%BD%9C/">人机协作</a> </p><hr><ul><li><a href="/post/2026/156-agent-vs-model-boundary/">模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</a></li><li><a href="/post/2026/154-tob-agent-failure-not-capability-but-closed-loop/">To B Agent 失败的根本原因：不是能力问题，是没有把 Agent 变成默认路径</a></li><li><a href="/post/2026/151-tob-agent-user-feedback-loop/">别再卷模型了：To B Agent 创业，用户反馈才是生死线</a></li><li><a href="/post/2026/149-openclaw-remote-browser-setup/">OpenClaw使用远程浏览器——让AI读懂你的个性化互联网</a></li><li><a href="/post/2026/150-dingtalk-cli-office-skills-token-era/">当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/155-microsoft-hr-restructuring-ai-era-organization/">微软的组织变革：从成长性思维到像AI一样自我进化的组织</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/27/2026-03-27-%E5%BE%AE%E8%BD%AF%E7%9A%84%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9-%E4%BB%8E%E6%88%90%E9%95%BF%E6%80%A7%E6%80%9D%E7%BB%B4%E5%88%B0%E5%83%8FAI%E4%B8%80%E6%A0%B7%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96%E7%9A%84%E7%BB%84%E7%BB%87/</id>
    <link href="https://www.coconut.xin/2026/03/27/2026-03-27-%E5%BE%AE%E8%BD%AF%E7%9A%84%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9-%E4%BB%8E%E6%88%90%E9%95%BF%E6%80%A7%E6%80%9D%E7%BB%B4%E5%88%B0%E5%83%8FAI%E4%B8%80%E6%A0%B7%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96%E7%9A%84%E7%BB%84%E7%BB%87/"/>
    <published>2026-03-27T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E6%A0%B8%E5%BF%83%E8%A7%82%E7%82%]]>
    </summary>
    <title>微软的组织变革：从成长性思维到像AI一样自我进化的组织</title>
    <updated>2026-03-28T02:02:10.676Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E6%A8%A1%E5%9E%8B%E5%86%B3%E5%AE%9A%E4%B8%8A%E9%99%90agent%E5%86%B3%E5%AE%9A%E4%BD%A0%E8%83%BD%E4%B8%8D%E8%83%BD%E7%A8%B3%E5%AE%9A%E6%8B%BF%E5%88%B0%E8%BF%99%E4%B8%AA%E4%B8%8A%E9%99%90">一、模型决定上限，Agent决定你能不能稳定拿到这个上限</a><ul><li><a href="#%E6%A8%A1%E5%9E%8B%E5%BC%BA--%E7%BB%93%E6%9E%9C%E7%A8%B3">模型强 ≠ 结果稳</a></li></ul></li><li><a href="#%E4%BA%8Cagent%E4%B8%8D%E4%BC%9A%E8%AE%A9%E6%A8%A1%E5%9E%8B%E6%9B%B4%E8%81%AA%E6%98%8E%E4%BD%86%E4%BC%9A%E8%AE%A9%E6%A8%A1%E5%9E%8B%E7%9A%84%E8%81%AA%E6%98%8E%E8%A2%AB%E7%A8%B3%E5%AE%9A%E5%85%91%E7%8E%B0">二、Agent不会让模型更聪明，但会让模型的聪明被稳定兑现</a><ul><li><a href="#1-%E4%BB%BB%E5%8A%A1%E5%88%86%E8%A7%A3%E6%8A%8A%E5%A4%A7%E9%97%AE%E9%A2%98%E5%8F%98%E6%88%90%E6%A8%A1%E5%9E%8B%E6%93%85%E9%95%BF%E7%9A%84%E5%B0%8F%E9%97%AE%E9%A2%98">1. 任务分解：把大问题变成模型擅长的小问题</a></li><li><a href="#2-%E7%BB%93%E6%9E%9C%E6%A0%A1%E9%AA%8C%E7%94%A8%E7%A1%AE%E5%AE%9A%E6%80%A7%E9%80%BB%E8%BE%91%E6%A3%80%E6%9F%A5%E6%A6%82%E7%8E%87%E6%80%A7%E8%BE%93%E5%87%BA">2. 结果校验：用确定性逻辑检查概率性输出</a></li><li><a href="#3-%E9%94%99%E8%AF%AF%E6%81%A2%E5%A4%8D%E5%A4%B1%E8%B4%A5%E4%B8%8D%E6%98%AF%E7%BB%88%E7%82%B9%E8%80%8C%E6%98%AF%E5%8F%8D%E9%A6%88">3. 错误恢复：失败不是终点，而是反馈</a></li></ul></li><li><a href="#%E4%B8%89%E5%88%AB%E8%AE%A9agent%E6%9B%B4%E5%83%8F%E4%BA%BA%E6%80%9D%E8%80%83%E8%AE%A9%E7%B3%BB%E7%BB%9F%E6%9B%B4%E5%83%8F%E6%9C%BA%E5%99%A8%E5%8F%AF%E9%9D%A0%E6%89%A7%E8%A1%8C">三、别让Agent更像人思考，让系统更像机器可靠执行</a><ul><li><a href="#%E5%83%8F%E4%BA%BA%E6%98%AF%E4%B8%80%E4%B8%AA%E9%99%B7%E9%98%B1">“像人”是一个陷阱</a></li><li><a href="#%E6%AD%A3%E7%A1%AE%E7%9A%84%E6%96%B9%E5%90%91%E5%83%8F%E6%9C%BA%E5%99%A8%E4%B8%80%E6%A0%B7%E5%8F%AF%E9%9D%A0">正确的方向：像机器一样可靠</a></li><li><a href="#%E4%B8%89%E4%B8%AA%E5%AE%9E%E8%B7%B5%E5%8E%9F%E5%88%99">三个实践原则</a></li></ul></li><li><a href="#%E5%9B%9B%E4%B8%80%E4%B8%AA%E5%88%A4%E6%96%AD%E6%A1%86%E6%9E%B6%E4%BB%80%E4%B9%88%E8%AF%A5%E4%BA%A4%E7%BB%99%E6%A8%A1%E5%9E%8B%E4%BB%80%E4%B9%88%E8%AF%A5%E4%BA%A4%E7%BB%99agent">四、一个判断框架：什么该交给模型，什么该交给Agent</a></li><li><a href="#%E4%BA%94%E6%A8%A1%E5%9E%8B%E8%BF%9B%E5%8C%96%E4%B8%8D%E4%BC%9A%E8%AE%A9agent%E6%B6%88%E4%BA%A1%E5%8F%8D%E8%80%8C%E8%AE%A9agent%E6%9B%B4%E6%9C%89%E4%BB%B7%E5%80%BC">五、模型进化不会让Agent消亡，反而让Agent更有价值</a></li><li><a href="#%E7%BB%93%E8%AF%AD">结语</a></li></ul><p>每个Agent开发者都绕不过一个灵魂拷问：<strong>模型一直在进化，Agent的价值到底在哪？</strong></p><p>GPT-5比GPT-4强，Claude 4比Claude 3强，Gemini 2比Gemini 1强。模型按周迭代、按月跨代，推理更深、上下文更长、幻觉更少。如果模型本身就在变强，我们在模型之上搭的这一层”Agent”——到底是在创造价值，还是在制造冗余？</p><p>这个问题不回答清楚，Agent开发就永远在焦虑中摇摆。</p><h2 id="一、模型决定上限，Agent决定你能不能稳定拿到这个上限"><a href="#一、模型决定上限，Agent决定你能不能稳定拿到这个上限" class="headerlink" title="一、模型决定上限，Agent决定你能不能稳定拿到这个上限"></a>一、模型决定上限，Agent决定你能不能稳定拿到这个上限</h2><p>先说结论：<strong>模型是能力，Agent是可靠性。</strong> 两者解决的不是同一个问题。</p><p>一个足够强的模型，在理想条件下，可以一次性给出完美答案。但”理想条件”本身就是一个幻觉——真实世界里，任务不是一句prompt能描述清楚的，上下文不是一个window能装得下的，结果不是一次调用能保证正确的。</p><p>打一个比方：模型是运动员的天赋，Agent是训练体系和比赛策略。</p><ul><li>天赋决定了你的理论上限——跑100米最快能到9秒58</li><li>但没有训练体系，没有比赛策略，你可能连10秒5都跑不进去</li></ul><p>Agent做的事情，就是<strong>把模型的理论上限，变成可重复、可预期的实际产出</strong>。</p><h3 id="模型强-≠-结果稳"><a href="#模型强-≠-结果稳" class="headerlink" title="模型强 ≠ 结果稳"></a>模型强 ≠ 结果稳</h3><p>即使是最强的模型，直接裸调也面临三个致命问题：</p><p><strong>1. 单次调用的成功率不等于系统成功率</strong></p><p>一个模型在某个任务上单次成功率95%，听起来很高。但如果一个完整工作流需要串联5个步骤，每步都依赖模型判断，那端到端成功率是 0.95^5 ≈ 77%。再加上真实场景中的边界情况、异常输入、格式不一致——实际成功率会更低。</p><p><strong>2. 模型的能力是概率性的，不是确定性的</strong></p><p>同一个prompt，同一个模型，跑十次可能得到八种不同的结果。有时候结构完美，有时候漏掉关键字段，有时候幻觉一个不存在的API。模型的本质是概率采样，不是确定性计算。</p><p><strong>3. 模型不知道自己什么时候错了</strong></p><p>这是最危险的一点。模型在犯错的时候，往往和正确的时候一样自信。它不会主动说”我不确定”，不会自己校验输出，不会发现自己遗漏了一个关键步骤。</p><p>Agent要解决的，正是这三个问题。通过重试、校验、分步执行、结果检查、异常恢复——把一个概率性的能力源，变成一个可靠的执行系统。</p><h2 id="二、Agent不会让模型更聪明，但会让模型的聪明被稳定兑现"><a href="#二、Agent不会让模型更聪明，但会让模型的聪明被稳定兑现" class="headerlink" title="二、Agent不会让模型更聪明，但会让模型的聪明被稳定兑现"></a>二、Agent不会让模型更聪明，但会让模型的聪明被稳定兑现</h2><p>这是第二个需要纠正的认知：<strong>Agent不是模型的增强器，而是模型的稳定器。</strong></p><p>很多Agent开发者的误区在于：试图通过精巧的prompt编排、复杂的思维链、多轮自我对话，让模型”变得更聪明”。这条路的投入产出比越来越低——因为你在和模型本身的迭代速度赛跑，而你永远跑不过它。</p><p>换一个视角理解Agent的真正定义：</p><blockquote><p><strong>Agent是一个让模型可以反复行动直到结果达成的系统。</strong></p></blockquote><p>关键词是三个：<strong>反复行动</strong>、<strong>直到</strong>、<strong>结果达成</strong>。</p><ul><li><strong>反复行动</strong>：不是一次调用，而是一个循环。观察→思考→行动→观察，直到任务完成或明确失败。</li><li><strong>直到</strong>：有明确的终止条件。不是无限循环，而是有收敛逻辑——知道什么时候该停。</li><li><strong>结果达成</strong>：以可验证的产出为标准，而不是以”模型觉得自己完成了”为标准。</li></ul><p>这意味着Agent的核心能力不在于”让模型想得更深”，而在于：</p><h3 id="1-任务分解：把大问题变成模型擅长的小问题"><a href="#1-任务分解：把大问题变成模型擅长的小问题" class="headerlink" title="1. 任务分解：把大问题变成模型擅长的小问题"></a>1. 任务分解：把大问题变成模型擅长的小问题</h3><p>模型处理一个复杂任务可能成功率只有60%，但如果把它拆成5个子任务，每个子任务成功率95%，系统的整体成功率反而更高。Agent的价值不是让模型在困难任务上表现更好，而是<strong>重新定义任务的粒度</strong>，让它落在模型的舒适区内。</p><h3 id="2-结果校验：用确定性逻辑检查概率性输出"><a href="#2-结果校验：用确定性逻辑检查概率性输出" class="headerlink" title="2. 结果校验：用确定性逻辑检查概率性输出"></a>2. 结果校验：用确定性逻辑检查概率性输出</h3><p>模型生成了一段代码？跑一下单测。模型提取了一组数据？和原文做个diff。模型输出了一个JSON？过一遍schema校验。这些校验逻辑不需要AI，传统代码就能做——但它们能把模型输出的可靠性从90%提到99.9%。</p><h3 id="3-错误恢复：失败不是终点，而是反馈"><a href="#3-错误恢复：失败不是终点，而是反馈" class="headerlink" title="3. 错误恢复：失败不是终点，而是反馈"></a>3. 错误恢复：失败不是终点，而是反馈</h3><p>模型第一次生成的代码编译失败了？把错误信息喂回去，让它修。模型调用的API返回了异常？换一个参数组合重试。Agent的循环结构天然支持这种”失败→学习→重试”的模式——而这恰恰是裸调模型做不到的。</p><h2 id="三、别让Agent更像人思考，让系统更像机器可靠执行"><a href="#三、别让Agent更像人思考，让系统更像机器可靠执行" class="headerlink" title="三、别让Agent更像人思考，让系统更像机器可靠执行"></a>三、别让Agent更像人思考，让系统更像机器可靠执行</h2><p>这是Agent开发中最大的战略误判：<strong>把精力花在”让Agent更像人”上。</strong></p><p>过去两年，行业在这个方向上投入了大量精力：</p><ul><li>给Agent设计”性格”和”角色”</li><li>让Agent进行”内心独白”和”反思”</li><li>构建Agent之间的”讨论”和”辩论”</li><li>追求Agent的”创造性”和”主动性”</li></ul><p>这些探索有学术价值，但在工程实践中，它们指向了一个错误的方向。</p><h3 id="“像人”是一个陷阱"><a href="#“像人”是一个陷阱" class="headerlink" title="“像人”是一个陷阱"></a>“像人”是一个陷阱</h3><p>人类思维的特点是：灵活、创造性强、善于处理模糊性——但同时也是不可预测的、难以复现的、容易犯低级错误的。</p><p>当我们让Agent”像人一样思考”时，我们同时也把人类思维的缺陷导入了系统。Agent开始变得：</p><ul><li><strong>不可预测</strong>：同一个任务，两次执行的路径完全不同</li><li><strong>难以调试</strong>：出了问题，不知道是哪一步的”思考”出了偏差</li><li><strong>无法保障SLA</strong>：因为执行路径不确定，时间和资源消耗也不确定</li></ul><h3 id="正确的方向：像机器一样可靠"><a href="#正确的方向：像机器一样可靠" class="headerlink" title="正确的方向：像机器一样可靠"></a>正确的方向：像机器一样可靠</h3><p>工程世界里最可靠的系统——数据库、消息队列、分布式存储——没有一个在模仿人类思维。它们的可靠性来自：</p><p><strong>确定性的状态管理</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">任务状态 = &#123;pending, running, success, failed, retrying&#125;</span><br><span class="line">每一步的状态转换都有明确规则</span><br><span class="line">不存在&quot;大概完成了&quot;的中间态</span><br></pre></td></tr></table></figure><p><strong>可观测的执行过程</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">[Step 1/5] 解析用户输入 → 成功 (120ms)</span><br><span class="line">[Step 2/5] 查询知识库    → 成功 (340ms)</span><br><span class="line">[Step 3/5] 生成初稿      → 成功 (2100ms)</span><br><span class="line">[Step 4/5] 格式校验      → 失败：缺少必填字段&quot;deadline&quot;</span><br><span class="line">[Step 5/5] 重试Step 3    → 成功 (1800ms)</span><br></pre></td></tr></table></figure><p><strong>明确的失败语义</strong></p><ul><li>可重试的失败 vs 不可重试的失败</li><li>部分成功 vs 完全失败</li><li>超时 vs 逻辑错误</li></ul><p>当Agent像机器一样运行时，它变成了一个<strong>可工程化的系统</strong>：可以监控、可以报警、可以做容量规划、可以给SLA承诺。</p><h3 id="三个实践原则"><a href="#三个实践原则" class="headerlink" title="三个实践原则"></a>三个实践原则</h3><p><strong>原则一：用代码控制流程，用模型处理判断</strong></p><p>不要让模型决定”下一步做什么”——用代码写死流程的主干。模型只在需要理解自然语言、生成内容、做模糊判断的环节介入。流程的骨架是确定性的，模型只填充其中需要智能的缝隙。</p><p><strong>原则二：校验层比推理层更重要</strong></p><p>与其花一周优化prompt让模型的一次性输出质量从90%提到95%，不如花一天写一个校验器把95%的输出变成99.9%的可靠交付。校验是确定性的，不会退化，不依赖模型版本——这才是真正可积累的资产。</p><p><strong>原则三：可恢复 &gt; 不犯错</strong></p><p>不要追求Agent永远不犯错。追求的应该是：<strong>犯了错能被发现，发现了能自动恢复，恢复不了能优雅降级。</strong> 这和分布式系统的设计哲学一模一样——你不可能消灭故障，但你可以让故障不影响最终结果。</p><h2 id="四、一个判断框架：什么该交给模型，什么该交给Agent"><a href="#四、一个判断框架：什么该交给模型，什么该交给Agent" class="headerlink" title="四、一个判断框架：什么该交给模型，什么该交给Agent"></a>四、一个判断框架：什么该交给模型，什么该交给Agent</h2><p>维度</p><p>交给模型</p><p>交给Agent（代码）</p><p>自然语言理解</p><p>✅</p><p>❌</p><p>内容生成</p><p>✅</p><p>❌</p><p>模糊判断</p><p>✅</p><p>❌</p><p>流程控制</p><p>❌</p><p>✅</p><p>状态管理</p><p>❌</p><p>✅</p><p>结果校验</p><p>❌</p><p>✅</p><p>错误恢复</p><p>❌</p><p>✅</p><p>权限控制</p><p>❌</p><p>✅</p><p>日志与监控</p><p>❌</p><p>✅</p><p>工具调用编排</p><p>❌</p><p>✅</p><p>一句话总结：<strong>模型处理”软”的部分（语言、推理、生成），Agent处理”硬”的部分（流程、状态、校验、恢复）。</strong></p><h2 id="五、模型进化不会让Agent消亡，反而让Agent更有价值"><a href="#五、模型进化不会让Agent消亡，反而让Agent更有价值" class="headerlink" title="五、模型进化不会让Agent消亡，反而让Agent更有价值"></a>五、模型进化不会让Agent消亡，反而让Agent更有价值</h2><p>回到开头的问题：模型越来越强，Agent还有必要吗？</p><p>答案是：<strong>模型越强，Agent的价值越大。</strong></p><p>这听起来反直觉，但逻辑很简单：</p><ul><li>模型越强，<strong>能做的事情越多</strong>——意味着需要编排的任务越复杂</li><li>模型越强，<strong>用户的期望越高</strong>——意味着对可靠性的要求越苛刻</li><li>模型越强，<strong>应用场景越关键</strong>——意味着出错的代价越大</li></ul><p>一个只能写邮件的模型，裸调就够了——错了重写一封。但一个能操作数据库、调用API、执行交易的模型——你敢不加任何校验和控制就让它跑？</p><p><strong>模型的能力边界越宽，Agent的治理价值越大。</strong></p><p>这就像汽车发动机越强劲，底盘、刹车、电子稳定系统就越重要。没有人会因为发动机够强就把刹车拆了。</p><h2 id="结语"><a href="#结语" class="headerlink" title="结语"></a>结语</h2><p>Agent开发者不需要焦虑”模型会不会替代我”。需要想清楚的是：</p><ol><li><p><strong>你的Agent是在试图让模型更聪明，还是在让模型的能力更可靠地兑现？</strong> 前者是一场注定失败的军备竞赛，后者是一个可持续积累的工程资产。</p></li><li><p><strong>你的Agent是在模仿人类思考，还是在像机器一样可靠执行？</strong> 前者让系统变得不可预测，后者让系统变得可工程化。</p></li><li><p><strong>你的核心投入是在优化prompt，还是在构建校验、恢复、监控体系？</strong> 前者随模型升级可能归零，后者跨模型版本持续有效。</p></li></ol><p>模型是原材料，Agent是工厂。原材料的品质很重要，但最终交付给客户的，是工厂产线上稳定产出的成品——而不是一块未经加工的璞玉。</p><p><strong>不要和模型比聪明。要比模型更可靠。</strong></p><p><a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/llm/">LLM</a>  <a href="https://hugozhu.site/tags/%E6%9E%B6%E6%9E%84/">架构</a>  <a href="https://hugozhu.site/tags/ai/">AI</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/156-agent-vs-model-boundary/">模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/27/2026-03-27-%E6%A8%A1%E5%9E%8B%E5%92%8CAgent%E7%9A%84%E8%BE%B9%E7%95%8C-%E6%A8%A1%E5%9E%8B%E5%86%B3%E5%AE%9A%E4%B8%8A%E9%99%90-Agent%E5%86%B3%E5%AE%9A%E4%BD%A0%E8%83%BD%E4%B8%8D%E8%83%BD%E7%A8%B3%E5%AE%9A%E6%8B%BF%E5%88%B0%E8%BF%99%E4%B8%AA%E4%B8%8A%E9%99%90/</id>
    <link href="https://www.coconut.xin/2026/03/27/2026-03-27-%E6%A8%A1%E5%9E%8B%E5%92%8CAgent%E7%9A%84%E8%BE%B9%E7%95%8C-%E6%A8%A1%E5%9E%8B%E5%86%B3%E5%AE%9A%E4%B8%8A%E9%99%90-Agent%E5%86%B3%E5%AE%9A%E4%BD%A0%E8%83%BD%E4%B8%8D%E8%83%BD%E7%A8%B3%E5%AE%9A%E6%8B%BF%E5%88%B0%E8%BF%99%E4%B8%AA%E4%B8%8A%E9%99%90/"/>
    <published>2026-03-27T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E6%A8%A1%E5%9E%8B%E5%86%B3%E5%AE%]]>
    </summary>
    <title>模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</title>
    <updated>2026-04-01T02:01:48.499Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E6%A0%B8%E5%BF%83%E8%A7%82%E7%82%B9%E5%9B%9B%E4%B8%AA%E6%A0%B9%E6%9C%AC%E6%80%A7%E8%BD%AC%E5%8F%98">一、核心观点：四个根本性转变</a></li><li><a href="#%E4%BA%8C%E6%88%90%E9%95%BF%E5%9E%8B%E6%80%9D%E7%BB%B4%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E5%A4%9F%E7%94%A8%E4%BA%86">二、“成长型思维”为什么不够用了？</a></li><li><a href="#%E4%B8%89%E4%B8%83%E5%A4%A7%E5%8F%98%E5%8C%96%E5%BE%AE%E8%BD%AF%E5%88%B0%E5%BA%95%E6%94%B9%E4%BA%86%E4%BB%80%E4%B9%88">三、七大变化：微软到底改了什么</a><ul><li><a href="#%E5%8F%98%E5%8C%961%E5%B7%A5%E7%A8%8Bhr%E7%BB%9F%E4%B8%80%E6%95%B4%E5%90%88">变化1：工程HR统一整合</a></li><li><a href="#%E5%8F%98%E5%8C%962%E6%95%B0%E6%8D%AE%E5%88%86%E6%9E%90%E5%B5%8C%E5%85%A5%E4%BD%93%E9%AA%8C%E8%AE%BE%E8%AE%A1">变化2：数据分析嵌入体验设计</a></li><li><a href="#%E5%8F%98%E5%8C%963%E8%96%AA%E9%85%AC%E7%A6%8F%E5%88%A9%E9%9B%86%E4%B8%AD%E5%8C%96">变化3：薪酬福利集中化</a></li><li><a href="#%E5%8F%98%E5%8C%964%E6%8B%9B%E8%81%98%E6%8F%90%E5%8D%87%E5%88%B0%E6%88%98%E7%95%A5%E7%BA%A7">变化4：招聘提升到战略级</a></li><li><a href="#%E5%8F%98%E5%8C%965%E6%96%87%E5%8C%96%E5%B7%A5%E4%BD%9C%E6%97%A5%E5%B8%B8%E5%8C%96">变化5：文化工作日常化</a></li><li><a href="#%E5%8F%98%E5%8C%966%E4%BB%8E%E5%9F%B9%E8%AE%AD%E5%88%B0%E8%83%BD%E5%8A%9B%E5%BB%BA%E8%AE%BE">变化6：从”培训”到”能力建设”</a></li><li><a href="#%E5%8F%98%E5%8C%967%E6%96%B0%E8%AE%BEworkforce-acceleration%E6%9C%80%E5%80%BC%E5%BE%97%E5%85%B3%E6%B3%A8">变化7：新设Workforce Acceleration（最值得关注）</a></li></ul></li><li><a href="#%E5%9B%9B%E5%9B%9B%E4%BD%8D%E9%AB%98%E7%AE%A1%E7%A6%BB%E5%BC%80%E4%B8%80%E4%B8%AA%E6%97%B6%E4%BB%A3%E7%9A%84%E7%BB%93%E6%9D%9F">四、四位高管离开：一个时代的结束</a></li><li><a href="#%E4%BA%94%E4%B8%BA%E4%BB%80%E4%B9%88%E8%AF%B4%E5%BE%AE%E8%BD%AF%E6%83%B3%E8%AE%A9hr%E5%83%8Fai%E4%B8%80%E6%A0%B7%E8%BF%90%E8%A1%8C">五、为什么说微软想让HR”像AI一样运行”</a><ul><li><a href="#hr%E8%A7%92%E8%89%B2%E7%9A%84%E6%9C%AC%E8%B4%A8%E5%8D%87%E7%BA%A7%E4%BB%8E%E5%B9%B4%E5%BA%A6%E7%AE%A1%E7%90%86%E8%80%85%E5%88%B0%E5%AE%9E%E6%97%B6%E8%B0%83%E5%BA%A6%E8%80%85">HR角色的本质升级：从”年度管理者”到”实时调度者”</a></li></ul></li><li><a href="#%E5%85%AD%E5%AF%B9ai%E5%8F%98%E9%9D%A9%E4%B8%8B%E7%9A%84%E4%BC%81%E4%B8%9A%E4%B8%89%E7%82%B9%E5%90%AF%E7%A4%BA">六、对AI变革下的企业三点启示</a><ul><li><a href="#%E5%90%AF%E7%A4%BA%E4%B8%80ai%E8%BD%AC%E5%9E%8B%E4%BC%9A%E8%B6%8A%E6%9D%A5%E8%B6%8A%E6%B7%B1%E5%9C%B0%E8%BF%9B%E5%85%A5%E7%BB%84%E7%BB%87%E7%B3%BB%E7%BB%9F">启示一：AI转型会越来越深地进入组织系统</a></li><li><a href="#%E5%90%AF%E7%A4%BA%E4%BA%8Chr%E7%9A%84%E8%A7%92%E8%89%B2%E5%9C%A8%E5%8D%87%E7%BA%A7">启示二：HR的角色在升级</a></li><li><a href="#%E5%90%AF%E7%A4%BA%E4%B8%89%E4%BC%81%E4%B8%9A%E7%AB%9E%E4%BA%89%E8%B6%8A%E6%9D%A5%E8%B6%8A%E5%83%8F%E7%B3%BB%E7%BB%9F%E7%AB%9E%E4%BA%89">启示三：企业竞争越来越像系统竞争</a></li></ul></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>3月25日晚，微软首席人力官Amy Coleman在一份内部备忘录中，宣布对微软HR团队进行系统性调整。这不是一次普通的架构调整，而是AI时代组织进化的一次预演——微软正在把组织，从”管理系统”，升级为”计算系统”。</p><h2 id="一、核心观点：四个根本性转变"><a href="#一、核心观点：四个根本性转变" class="headerlink" title="一、核心观点：四个根本性转变"></a>一、核心观点：四个根本性转变</h2><p>在深入微软的具体动作之前，先说结论。这次重组背后，是四个根本性的认知转变：</p><ul><li><strong>人不再是”资源”，而是”可编排能力”</strong>——不再按岗位定义人，而是按技能组合调度人</li><li><strong>组织从”岗位驱动”转向”技能驱动”</strong>——岗位是静态的，技能是流动的</li><li><strong>从”流程驱动”转向”反馈闭环驱动”</strong>——不再追求标准化流程，而是追求学习速度</li><li><strong>HR从”后台支撑”升级为”系统架构师”</strong>——HR不再只管人，而是设计组织的运行方式</li></ul><p>一句话总结：<strong>在AI时代，企业的核心竞争力，不再是规模或流程效率，而是”组织作为一个系统的学习速度、调度能力和进化能力”。</strong></p><h2 id="二、“成长型思维”为什么不够用了？"><a href="#二、“成长型思维”为什么不够用了？" class="headerlink" title="二、“成长型思维”为什么不够用了？"></a>二、“成长型思维”为什么不够用了？</h2><p>过去十年，在CEO萨提亚·纳德拉和前HR负责人Kathleen Hogan的带领下，微软建立了以”成长型思维”为核心的管理体系。这套体系帮助微软完成了文化转型，市值也从3000亿美元飙升至3万亿美元。</p><p>但Coleman认为，这套体系已经跟不上AI时代的速度。她在备忘录中直言：</p><blockquote><p>“变化的速度已经超过了我们当前运营模式和决策节奏所能承受的范围。”</p></blockquote><p>过去HR的设计逻辑是**“为稳定而规模化”**——建立标准流程、统一规则、可重复的操作手册，确保22万人的大公司不出错。</p><p>但AI时代，业务在变、技术在变、员工的工作方式在变。当外部环境以天为单位变化时，以”年”为周期调整的HR体系，就成了瓶颈。</p><p>所以Coleman说：我们要**“为适应而规模化”**——不是建立更大的流程，而是建立更快进化的能力。</p><p>这就是整次重组的底层逻辑。</p><h2 id="三、七大变化：微软到底改了什么"><a href="#三、七大变化：微软到底改了什么" class="headerlink" title="三、七大变化：微软到底改了什么"></a>三、七大变化：微软到底改了什么</h2><p>从具体动作看，这次调整几乎覆盖了整个People团队，核心变化可以归纳为七项：</p><h3 id="变化1：工程HR统一整合"><a href="#变化1：工程HR统一整合" class="headerlink" title="变化1：工程HR统一整合"></a>变化1：工程HR统一整合</h3><p>Mel Simpson被任命为工程HR负责人，统管所有工程团队的HR工作。过去工程HR分散在不同业务线，各自为战。现在统一管理，意味着微软要用<strong>一套系统化的人才策略</strong>来应对AI人才的激烈争夺。</p><h3 id="变化2：数据分析嵌入体验设计"><a href="#变化2：数据分析嵌入体验设计" class="headerlink" title="变化2：数据分析嵌入体验设计"></a>变化2：数据分析嵌入体验设计</h3><p>Nathalie D’Hers领导的员工体验团队，将接管People Analytics团队。过去数据分析师出报告，体验设计师做方案，中间有延迟、有断层。现在分析能力被直接嵌入体验设计的过程。</p><p>Coleman的原话是：</p><blockquote><p>“让分析能力更接近它们所影响的体验和决策，实现更快的学习和更强的洞察到行动的闭环。”</p></blockquote><h3 id="变化3：薪酬福利集中化"><a href="#变化3：薪酬福利集中化" class="headerlink" title="变化3：薪酬福利集中化"></a>变化3：薪酬福利集中化</h3><p>Mike Cyran被任命为总薪酬负责人，统管全球薪酬、福利、股权激励。不再是”一刀切”的薪酬体系，而是根据不同业务、不同人才的竞争态势，<strong>动态调整</strong>。</p><h3 id="变化4：招聘提升到战略级"><a href="#变化4：招聘提升到战略级" class="headerlink" title="变化4：招聘提升到战略级"></a>变化4：招聘提升到战略级</h3><p>微软正在全球范围内寻找一位专职的招聘负责人，直接向Coleman汇报。Coleman说：<strong>“人才战略就是竞争战略。”</strong> 在AI人才争夺战中，招聘速度和质量直接决定了竞争位置。</p><h3 id="变化5：文化工作日常化"><a href="#变化5：文化工作日常化" class="headerlink" title="变化5：文化工作日常化"></a>变化5：文化工作日常化</h3><p>文化与包容不再作为独立职能存在，而是被放进新设立的People &amp; Culture团队中，由Leslie Lawson Sims负责。文化不再是一个独立的”项目”，而是嵌入HR的日常工作。</p><h3 id="变化6：从”培训”到”能力建设”"><a href="#变化6：从”培训”到”能力建设”" class="headerlink" title="变化6：从”培训”到”能力建设”"></a>变化6：从”培训”到”能力建设”</h3><p>Wyatt Cutler从AWS、PayPal等公司回归微软，负责人才发展工作。这不是职能合并，而是理念升级：<strong>培训是单向的知识传递，能力建设是让组织具备持续进化的动态能力。</strong></p><h3 id="变化7：新设Workforce-Acceleration（最值得关注）"><a href="#变化7：新设Workforce-Acceleration（最值得关注）" class="headerlink" title="变化7：新设Workforce Acceleration（最值得关注）"></a>变化7：新设Workforce Acceleration（最值得关注）</h3><p>Justin Thenutai被任命为劳动力加速负责人，统管技能提升、人才再部署、劳动力规划以及**“人-AI协作”能力**。</p><p>这意味着微软正在系统性地思考：当AI成为员工的工作伙伴时，人的角色是什么？如何让人和AI协同工作？不是用AI替代人，而是让人和AI各自发挥优势，形成1+1&gt;2的效应。</p><h2 id="四、四位高管离开：一个时代的结束"><a href="#四、四位高管离开：一个时代的结束" class="headerlink" title="四、四位高管离开：一个时代的结束"></a>四、四位高管离开：一个时代的结束</h2><p>这次重组伴随着几位资深高管的离开：</p><p>姓名</p><p>服务年限</p><p>职责领域</p><p>Kristen Roby Dimlow</p><p>近30年</p><p>人才招聘、总薪酬</p><p>Chuck Edward</p><p>22年</p><p>HR业务伙伴、人才招聘</p><p>Dawn Klinghoffer</p><p>20余年</p><p>HR数据分析开创者</p><p>Lindsay-Rae McIntyre</p><p>8年</p><p>首席多元化官</p><p>他们见证了微软从鲍尔默时代到纳德拉时代的转型，也参与了”成长型思维”文化的建设。Coleman在备忘录中写道：</p><blockquote><p>“他们的领导力、判断力和对人的关怀，树立了一个标准，这个标准将超越此刻而持续存在。”</p></blockquote><p>这句话既是对过去的致敬，也是对未来的宣告——<strong>标准已经变了。</strong></p><h2 id="五、为什么说微软想让HR”像AI一样运行”"><a href="#五、为什么说微软想让HR”像AI一样运行”" class="headerlink" title="五、为什么说微软想让HR”像AI一样运行”"></a>五、为什么说微软想让HR”像AI一样运行”</h2><p>内部信反复出现同一类词：<strong>更快、更紧、更简、更贴近业务、更快学习、更快闭环。</strong></p><ul><li>Employee Experience部分强调”faster learning”和”stronger insight to action loops”</li><li>Workforce Acceleration部分强调”test and learn faster with the business”</li><li>整封信开头强调”move faster”和”help set a new pace”</li></ul><p>微软对HR的期待，已经不再是一个稳定、流程化、周期性的后台系统，而是希望它像AI系统一样，具备三个新特征：</p><p><strong>第一，更快。</strong> 能快速响应业务变化，而不是等组织慢慢开会、层层传递之后再行动。</p><p><strong>第二，更灵活。</strong> 能跨团队、跨模块整合资源，而不是被传统边界困住。</p><p><strong>第三，更懂业务。</strong> 不是停留在”懂人”，而是要知道不同业务优先级、不同产品节奏、不同战略重点背后真正需要什么样的人才与组织配置。</p><p>“像AI一样”不是说HR要自动化，而是说<strong>HR本身也要从一个静态管理系统，变成一个动态适应系统。</strong></p><h3 id="HR角色的本质升级：从”年度管理者”到”实时调度者”"><a href="#HR角色的本质升级：从”年度管理者”到”实时调度者”" class="headerlink" title="HR角色的本质升级：从”年度管理者”到”实时调度者”"></a>HR角色的本质升级：从”年度管理者”到”实时调度者”</h3><p>但这里有一个更深层的变化值得展开——<strong>有了AI之后，HR这个角色本身的能力边界被彻底改写了。</strong></p><p>过去HR为什么只能做年度规划、半年度review、季度人才盘点？不是不想更快，而是<strong>做不到</strong>。原因很简单：数据采集慢、分析周期长、反馈链路断裂。一个组织调整的决策，往往要等半年的绩效数据出来，再花两个月做分析，再花一个月层层对齐，等真正落地时，业务环境可能已经变了两轮。</p><p>AI改变了这个底层约束。</p><p><strong>第一，过程数据变得可采集、可分析。</strong> 过去HR只能依赖结果数据——季度业绩、年度绩效评分、离职率。这些都是滞后指标，等看到数据时问题已经发生了。而现在，AI可以实时处理协作工具中的沟通模式、项目管理系统中的交付节奏、代码仓库中的贡献分布、会议记录中的决策效率。这些<strong>过程数据</strong>才是组织健康度的领先指标。</p><p>举个例子：传统HR要等到季度末才知道某个团队产出下降了，但AI可以在第三周就发现这个团队的代码review周期在拉长、跨团队协作频次在下降、会议时长在增加——这些信号比绩效数字早出现两个月。</p><p><strong>第二，反馈闭环的周期从”季度”缩短到”周”甚至”天”。</strong> 这是最关键的变化。过去组织调整是一个重决策：调研→分析→提案→审批→执行→评估，整个周期可能半年到一年。但有了AI的数据能力和分析能力，HR可以做到”小步快跑”式的持续优化——每周看数据、每月微调、每季度复盘。就像AI模型训练中的梯度下降一样，不需要一步到位找到最优解，而是通过高频的小幅调整，持续逼近最优状态。</p><p><strong>第三，人效变得真正可衡量。</strong> 这是HR长期以来最大的痛点——“人效”这个词被喊了很多年，但大多数企业的人效衡量要么停留在”人均营收”这类粗放指标，要么依赖主观评价。AI让更精细的人效衡量成为可能：一个工程师的实际产出中，多少是独立完成的，多少是AI辅助的？一个团队在引入AI工具前后，交付周期缩短了多少？技能提升项目的投入，在三个月后是否体现为可量化的能力增长？</p><p>当人效变得可衡量，组织调整就不再是拍脑袋，而是有据可依的系统优化。<strong>这本质上就是把HR从一个”凭经验做判断”的角色，升级为一个”用数据做决策、用反馈做迭代”的角色——这就是AI时代HR的真正价值。</strong></p><p>微软新设立的Workforce Acceleration部门，以及把People Analytics嵌入Employee Experience的动作，正是在为这个升级搭建基础设施。它不是在加人手，而是在<strong>改变HR这个职能的运行方式</strong>——让HR拥有和AI系统一样的”感知-分析-决策-执行-反馈”闭环能力。</p><h2 id="六、对AI变革下的企业三点启示"><a href="#六、对AI变革下的企业三点启示" class="headerlink" title="六、对AI变革下的企业三点启示"></a>六、对AI变革下的企业三点启示</h2><h3 id="启示一：AI转型会越来越深地进入组织系统"><a href="#启示一：AI转型会越来越深地进入组织系统" class="headerlink" title="启示一：AI转型会越来越深地进入组织系统"></a>启示一：AI转型会越来越深地进入组织系统</h3><p>很多企业今天还把AI看成某个部门、某种软件、某类效率工具，但微软已经把”人-AI协作”写进HR设计里了。AI的下一步，不只是改变工作内容，而是改变组织的配置方式。</p><h3 id="启示二：HR的角色在升级"><a href="#启示二：HR的角色在升级" class="headerlink" title="启示二：HR的角色在升级"></a>启示二：HR的角色在升级</h3><p>未来HR的价值，不只是招聘和绩效，也不只是文化和福利，而是<strong>组织能力的设计者</strong>。谁能更快完成技能重构、岗位重构、人机协作重构，谁就更有可能赢得AI时代的组织优势。</p><h3 id="启示三：企业竞争越来越像系统竞争"><a href="#启示三：企业竞争越来越像系统竞争" class="headerlink" title="启示三：企业竞争越来越像系统竞争"></a>启示三：企业竞争越来越像系统竞争</h3><p>不是比谁用了AI，而是比谁能更快学习、更快调整、更快把洞察转成行动、更快让组织和业务形成闭环。微软这次整套调整，几乎就是围绕这件事在动。</p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>微软这次HR重组，看似是一次内部架构调整，实则是AI时代组织进化的一次预演。</p><p>当AI开始改变工作方式、决策方式和协作方式时，企业的人力资源系统也必须同步进化。微软正在做的，就是为AI时代的组织管理，写一份新的操作手册。</p><p>Coleman在备忘录的最后写道：</p><blockquote><p>“Let’s keep learning, let go of old assumptions, and make Microsoft a place where everyone can do their best work.”</p></blockquote><p><strong>继续学习，放下旧假设。</strong></p><p>对组织如此，对个人也一样。AI时代真正拉开差距的，不只是公司能不能变，更是个人愿不愿意持续进化。放下旧假设，意味着不再用过去熟悉的经验判断今天的变化；持续学习，意味着不断更新自己的认知、方法和工作方式。</p><p>组织要为适应而生，个人也一样。</p><p><strong>大变革时代，与其担心，不如现在就行动起来。</strong></p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9/">组织变革</a>  <a href="https://hugozhu.site/tags/%E5%BE%AE%E8%BD%AF/">微软</a>  <a href="https://hugozhu.site/tags/%E4%BC%81%E4%B8%9A%E6%96%87%E5%8C%96/">企业文化</a>  <a href="https://hugozhu.site/tags/hr/">HR</a>  <a href="https://hugozhu.site/tags/%E4%BA%BA%E6%9C%BA%E5%8D%8F%E4%BD%9C/">人机协作</a> </p><hr><ul><li><a href="/post/2026/156-agent-vs-model-boundary/">模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</a></li><li><a href="/post/2026/154-tob-agent-failure-not-capability-but-closed-loop/">To B Agent 失败的根本原因：不是能力问题，是没有把 Agent 变成默认路径</a></li><li><a href="/post/2026/151-tob-agent-user-feedback-loop/">别再卷模型了：To B Agent 创业，用户反馈才是生死线</a></li><li><a href="/post/2026/149-openclaw-remote-browser-setup/">OpenClaw使用远程浏览器——让AI读懂你的个性化互联网</a></li><li><a href="/post/2026/150-dingtalk-cli-office-skills-token-era/">当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/155-microsoft-hr-restructuring-ai-era-organization/">微软的组织变革：从成长��思维到像AI一样自我进化的组织</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/27/2026-03-27-%E5%BE%AE%E8%BD%AF%E7%9A%84%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9-%E4%BB%8E%E6%88%90%E9%95%BF--%E6%80%9D%E7%BB%B4%E5%88%B0%E5%83%8FAI%E4%B8%80%E6%A0%B7%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96%E7%9A%84%E7%BB%84%E7%BB%87/</id>
    <link href="https://www.coconut.xin/2026/03/27/2026-03-27-%E5%BE%AE%E8%BD%AF%E7%9A%84%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9-%E4%BB%8E%E6%88%90%E9%95%BF--%E6%80%9D%E7%BB%B4%E5%88%B0%E5%83%8FAI%E4%B8%80%E6%A0%B7%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96%E7%9A%84%E7%BB%84%E7%BB%87/"/>
    <published>2026-03-27T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E6%A0%B8%E5%BF%83%E8%A7%82%E7%82%]]>
    </summary>
    <title>微软的组织变革：从成长��思维到像AI一样自我进化的组织</title>
    <updated>2026-03-28T02:02:40.132Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E4%B8%AA%E8%A2%AB%E5%8F%8D%E5%A4%8D%E9%AA%8C%E8%AF%81%E7%9A%84%E5%A4%B1%E8%B4%A5%E6%A8%A1%E5%BC%8F">一个被反复验证的失败模式</a></li><li><a href="#%E5%B8%AE%E4%BD%A0%E6%8F%90%E6%95%88%E4%B8%BA%E4%BB%80%E4%B9%88%E6%98%AF%E6%AF%92%E8%8D%AF">“帮你提效”为什么是毒药</a></li><li><a href="#%E6%A0%B8%E5%BF%83%E6%B4%9E%E5%AF%9F%E4%B8%8D%E6%98%AF%E5%BF%83%E6%80%81%E5%86%B3%E5%AE%9A%E6%88%90%E8%B4%A5%E6%98%AF%E6%98%AF%E5%90%A6%E6%8A%8A-agent-%E5%8F%98%E6%88%90%E9%BB%98%E8%AE%A4%E8%B7%AF%E5%BE%84%E5%86%B3%E5%AE%9A%E6%88%90%E8%B4%A5">核心洞察：不是心态决定成败，是”是否把 Agent 变成默认路径”决定成败</a><ul><li><a href="#%E6%96%B9%E5%BC%8F-a%E5%BB%BA%E8%AE%AE%E5%9E%8B-agent%E6%B3%A8%E5%AE%9A%E5%A4%B1%E8%B4%A5">方式 A：建议型 Agent（注定失败）</a></li><li><a href="#%E6%96%B9%E5%BC%8F-b%E8%81%8C%E8%B4%A3%E6%9B%BF%E4%BB%A3%E5%9E%8B-agent%E6%AD%A3%E7%A1%AE%E8%B7%AF%E5%BE%84">方式 B：职责替代型 Agent（正确路径）</a></li></ul></li><li><a href="#%E6%82%9F%E7%A9%BA%E7%9A%84%E6%AD%A3%E7%A1%AE%E5%AE%9A%E4%BD%8D%E4%B8%8D%E6%98%AF%E5%B7%A5%E5%85%B7%E8%80%8C%E6%98%AF%E6%9B%BF%E4%BB%A3%E4%B8%80%E6%AE%B5%E8%81%8C%E8%B4%A3">悟空的正确定位：不是”工具”，而是”替代一段职责”</a></li><li><a href="#%E7%94%B5%E5%95%86%E5%9C%BA%E6%99%AF%E4%BA%94%E4%B8%AA%E5%8F%AF%E4%BB%A5%E6%B7%B1%E5%BA%A6%E5%85%B1%E5%88%9B%E7%9A%84%E6%96%B9%E5%90%91">电商场景：五个可以深度共创的方向</a><ul><li><a href="#1-%E8%87%AA%E5%8A%A8%E6%8A%95%E6%94%BE%E4%BC%98%E5%8C%96-agentroi-%E6%8F%90%E5%8D%87%E5%BC%95%E6%93%8E">1. 自动投放优化 Agent（ROI 提升引擎）</a></li><li><a href="#2-%E7%88%86%E6%AC%BE%E7%9B%91%E6%8E%A7%E4%B8%8E%E6%99%BA%E8%83%BD%E8%A1%A5%E8%B4%A7-agent%E4%B8%8D%E6%96%AD%E8%B4%A7%E5%A2%9E%E9%95%BF%E5%BC%95%E6%93%8E">2. 爆款监控与智能补货 Agent（不断货增长引擎）</a></li><li><a href="#3-%E5%8A%A8%E6%80%81%E8%B0%83%E4%BB%B7-agent%E5%88%A9%E6%B6%A6%E6%9C%80%E5%A4%A7%E5%8C%96%E5%BC%95%E6%93%8E">3. 动态调价 Agent（利润最大化引擎）</a></li><li><a href="#4-%E5%B7%AE%E8%AF%84%E4%BF%AE%E5%A4%8D%E4%B8%8E%E7%94%A8%E6%88%B7%E6%8C%BD%E5%9B%9E-agent%E5%A4%8D%E8%B4%AD%E6%8F%90%E5%8D%87%E5%BC%95%E6%93%8E">4. 差评修复与用户挽回 Agent（复购提升引擎）</a></li><li><a href="#5-%E6%99%BA%E8%83%BD%E9%80%89%E5%93%81%E4%B8%8E%E8%87%AA%E5%8A%A8%E4%B8%8A%E6%96%B0-agent%E7%88%86%E6%AC%BE%E5%AD%B5%E5%8C%96%E5%BC%95%E6%93%8E">5. 智能选品与自动上新 Agent（爆款孵化引擎）</a></li></ul></li><li><a href="#%E8%90%BD%E5%9C%B0%E7%AD%96%E7%95%A5%E4%B8%8D%E8%A6%81%E8%AF%95%E5%9B%BE%E8%AF%B4%E6%9C%8D%E8%BF%90%E8%90%A5%E7%94%A8%E8%80%8C%E6%98%AF%E8%AE%A9%E7%AE%A1%E7%90%86%E5%B1%82%E5%81%9A%E5%86%B3%E7%AD%96">落地策略：不要试图”说服运营用”，而是”让管理层做决策”</a><ul><li><a href="#%E4%B8%8D%E8%A6%81%E5%81%9A%E7%9A%84%E4%BA%8B">不要做的事</a></li><li><a href="#%E5%BA%94%E8%AF%A5%E5%81%9A%E7%9A%84%E4%BA%8B">应该做的事</a></li><li><a href="#%E5%85%B3%E9%94%AE%E5%AF%B9%E8%AF%9D%E4%B8%8D%E6%98%AF%E5%92%8C%E8%BF%90%E8%90%A5%E8%B0%88%E6%98%AF%E5%92%8C%E7%AE%A1%E7%90%86%E5%B1%82%E8%B0%88">关键对话不是和运营谈，是和管理层谈</a></li></ul></li><li><a href="#%E9%98%BB%E5%8A%9B%E8%BD%AC%E7%A7%BB%E4%BB%8E%E6%9A%97%E7%A4%81%E5%88%B0%E6%98%8E%E9%9A%9C">阻力转移：从暗礁到明障</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>回顾过去两年，无数 To B Agent 项目的墓碑上都刻着同一句话：<strong>“技术很好，但业务没用起来。”</strong></p><p>技术团队困惑——模型能力明明够了，准确率也达标了，为什么运营就是不用？是培训不够？是界面不好？是 Prompt 没调好？</p><p>都不是。<strong>真正的原因是：你给了运营”用不用随便”的选择权。而只要有选择权，理性人就会选择不用。</strong></p><h2 id="一个被反复验证的失败模式"><a href="#一个被反复验证的失败模式" class="headerlink" title="一个被反复验证的失败模式"></a>一个被反复验证的失败模式</h2><p>几乎所有 To B Agent 项目都经历过同一条路径：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">Phase 1: 技术团队做了一个 Agent，能力确实不错</span><br><span class="line">Phase 2: 给运营团队用，&quot;这个工具能帮你提效 30%&quot;</span><br><span class="line">Phase 3: 运营试了试，反馈&quot;还不够好&quot;、&quot;不适合我们的场景&quot;</span><br><span class="line">Phase 4: 技术团队继续优化，准确率从 85% 提到 92%</span><br><span class="line">Phase 5: 运营还是不用，反馈&quot;再看看&quot;</span><br><span class="line">Phase 6: 项目黄了，结论是&quot;AI 还不够成熟&quot;</span><br></pre></td></tr></table></figure><p>这个循环的问题出在哪里？</p><p>不在 Phase 1（技术不行），不在 Phase 4（优化不够），<strong>而在 Phase 2 的定位——“帮你提效的工具”。</strong></p><h2 id="“帮你提效”为什么是毒药"><a href="#“帮你提效”为什么是毒药" class="headerlink" title="“帮你提效”为什么是毒药"></a>“帮你提效”为什么是毒药</h2><p>当你对运营说”这个 Agent 能帮你提效”，你以为传递的信息是：</p><blockquote><p>“用了这个工具，你能把活干得更快更好。”</p></blockquote><p>但运营真正听到的是：</p><blockquote><p>“用了这个工具，你现在干的活可以被自动化。如果我用好了它，我就在证明自己的工作可以被替代。”</p></blockquote><p><strong>这不是心态问题，这是理性人的最优策略。</strong></p><p>想象你是一个电商运营，每天的工作是调投放策略、盯竞品价格、处理差评。现在有人给你一个 Agent，说”它能自动帮你调投放”。你会怎么想？</p><ol><li>如果我用好了这个 Agent，老板会发现投放调整这件事不需要人做了</li><li>如果 Agent 出了错，责任还是我的（“你怎么没盯着？”）</li><li>如果 Agent 做对了，功劳是 AI 的（“看，AI 比人做得好”）</li><li>无论哪种结果，我的不可替代性都在降低</li></ol><p><strong>收益不对称：用好了 → 证明自己可以被替代；用不好 → 承担出错的责任。</strong> 在这种激励结构下，“不用”或者”敷衍地用”才是运营的理性选择。</p><p>这就是为什么运营的反馈永远是”还不够好”——这不是技术反馈，这是自我保护机制。</p><h2 id="核心洞察：不是心态决定成败，是”是否把-Agent-变成默认路径”决定成败"><a href="#核心洞察：不是心态决定成败，是”是否把-Agent-变成默认路径”决定成败" class="headerlink" title="核心洞察：不是心态决定成败，是”是否把 Agent 变成默认路径”决定成败"></a>核心洞察：不是心态决定成败，是”是否把 Agent 变成默认路径”决定成败</h2><p>让我们对比两种截然不同的 Agent 落地方式：</p><h3 id="方式-A：建议型-Agent（注定失败）"><a href="#方式-A：建议型-Agent（注定失败）" class="headerlink" title="方式 A：建议型 Agent（注定失败）"></a>方式 A：建议型 Agent（注定失败）</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">运营日常工作 ──→ Agent 给建议 ──→ 运营决定采不采纳</span><br><span class="line">                                        ↑</span><br><span class="line">                                   选择权在运营手里</span><br><span class="line">                                        ↓</span><br><span class="line">                              用了也行，不用也行</span><br><span class="line">                                        ↓</span><br><span class="line">                              理性选择：不用</span><br></pre></td></tr></table></figure><p><strong>问题的本质：Agent 是一个”可选插件”，运营是”决策者”。</strong> 决策者没有动机把决策权交出去。</p><h3 id="方式-B：职责替代型-Agent（正确路径）"><a href="#方式-B：职责替代型-Agent（正确路径）" class="headerlink" title="方式 B：职责替代型 Agent（正确路径）"></a>方式 B：职责替代型 Agent（正确路径）</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">原来运营做的一段工作 ──→ Agent 直接接管 ──→ 运营的角色变了</span><br><span class="line">                                                ↑</span><br><span class="line">                                          选择权不在运营手里</span><br><span class="line">                                                ↓</span><br><span class="line">                                        Agent 是&quot;岗位&quot;，不是&quot;工具&quot;</span><br><span class="line">                                                ↓</span><br><span class="line">                                      运营从&quot;执行者&quot;变成&quot;管理者&quot;</span><br></pre></td></tr></table></figure><p><strong>关键区别：Agent 不是”帮运营做事的工具”，而是”替代了运营的一段职责”。</strong></p><p>这看起来更激进，但反而更容易落地。为什么？因为<strong>阻力的来源变了</strong>。</p><p>维度</p><p>建议型 Agent</p><p>职责替代型 Agent</p><p>决策权</p><p>在运营手里</p><p>在管理层手里</p><p>阻力来源</p><p>运营（自我保护）</p><p>管理层（组织调整）</p><p>运营的角色</p><p>不变（+ 一个不想用的工具）</p><p>升级（从执行到管理）</p><p>推动力</p><p>需要运营”主动用”</p><p>管理层决定”这件事交给 Agent”</p><p>失败模式</p><p>运营消极抵抗</p><p>管理层不敢决策</p><p><strong>建议型 Agent 的阻力是分散的、隐性的、无法攻克的</strong>——你没法强迫一百个运营”积极使用”一个他们本能抗拒的工具。</p><p><strong>职责替代型 Agent 的阻力是集中的、显性的、可以突破的</strong>——你只需要说服管理层做一个组织决策。</p><h2 id="悟空的正确定位：不是”工具”，而是”替代一段职责”"><a href="#悟空的正确定位：不是”工具”，而是”替代一段职责”" class="headerlink" title="悟空的正确定位：不是”工具”，而是”替代一段职责”"></a>悟空的正确定位：不是”工具”，而是”替代一段职责”</h2><p>回到我们的悟空系统。之前的文章讲了悟空的技术架构——代理循环、工具系统、治理护栏、可交付资产。但技术架构只解决了”能不能做”的问题，没有解决”会不会用”的问题。</p><p>悟空要做的不是给运营一个”更智能的工具箱”。悟空要做的是：</p><blockquote><p><strong>接管一段完整的业务职责，产出可直接使用的业务结果，让运营从”做这件事的人”变成”管理 Agent 做这件事的人”。</strong></p></blockquote><p>运营不是”用悟空”，而是”管悟空”。这个区别是根本性的：</p><ul><li><strong>用工具</strong>：我的核心能力是做这件事本身，工具只是辅助</li><li><strong>管 Agent</strong>：我的核心能力是判断 Agent 做得对不对、方向对不对，以及处理 Agent 处理不了的例外</li></ul><p>当运营的角色从”执行者”变成”Agent 管理者”，他们的不可替代性不降反升——因为管理 Agent 需要对业务的深层理解，这恰恰是运营最有价值的能力。</p><h2 id="电商场景：五个可以深度共创的方向"><a href="#电商场景：五个可以深度共创的方向" class="headerlink" title="电商场景：五个可以深度共创的方向"></a>电商场景：五个可以深度共创的方向</h2><p>电商是职责替代型 Agent 最天然的落地场景。为什么？因为电商运营的大量工作是<strong>规则驱动、数据密集、需要高频决策</strong>的——这恰好是 Agent 最擅长的。</p><p>以下五个方向，每一个都不是”给运营一个按钮”，而是”Agent 接管一整段职责”：</p><h3 id="1-自动投放优化-Agent（ROI-提升引擎）"><a href="#1-自动投放优化-Agent（ROI-提升引擎）" class="headerlink" title="1. 自动投放优化 Agent（ROI 提升引擎）"></a>1. 自动投放优化 Agent（ROI 提升引擎）</h3><p><strong>替代的职责</strong>：投放计划的日常调优——出价调整、人群包扩展&#x2F;收缩、素材轮换、预算分配。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br></pre></td><td class="code"><pre><span class="line">传统模式：</span><br><span class="line">  运营每天花 2-3 小时看报表 → 凭经验调出价 → 第二天看效果 → 再调</span><br><span class="line">  问题：反应慢（24 小时周期）、依赖个人经验、无法同时优化多个变量</span><br><span class="line"></span><br><span class="line">Agent 接管后：</span><br><span class="line">  Agent 实时监控投放数据 → 每 15 分钟评估 ROI 变化</span><br><span class="line">  → 自动调整出价和人群策略 → 记录每次调整的理由和结果</span><br><span class="line">  → 运营只需要：设定 ROI 目标、审批大幅调整、处理异常情况</span><br><span class="line"></span><br><span class="line">运营新角色：投放策略制定者 + Agent 监督者</span><br></pre></td></tr></table></figure><p><strong>为什么运营会接受</strong>：运营不再需要做”盯数据调参数”这种机械劳动，而是做”定策略看结果”这种更高价值的工作。Agent 做得好，运营管理有方；Agent 做得不好，正好体现运营的判断力。</p><h3 id="2-爆款监控与智能补货-Agent（不断货增长引擎）"><a href="#2-爆款监控与智能补货-Agent（不断货增长引擎）" class="headerlink" title="2. 爆款监控与智能补货 Agent（不断货增长引擎）"></a>2. 爆款监控与智能补货 Agent（不断货增长引擎）</h3><p><strong>替代的职责</strong>：库存监控、销量预测、补货决策、供应链协调。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br></pre></td><td class="code"><pre><span class="line">传统模式：</span><br><span class="line">  运营看销量趋势 → 估算库存消耗速度 → 手动下补货单</span><br><span class="line">  → 经常出现两种情况：</span><br><span class="line">    a) 爆款断货，错失销售窗口（损失可达数十万）</span><br><span class="line">    b) 补货过多，库存积压（资金被占用）</span><br><span class="line"></span><br><span class="line">Agent 接管后：</span><br><span class="line">  Agent 持续追踪每个 SKU 的：</span><br><span class="line">    - 实时销量 vs 历史同期</span><br><span class="line">    - 当前库存 vs 在途库存</span><br><span class="line">    - 供应商交货周期</span><br><span class="line">    - 活动日历（大促前需要提前备货）</span><br><span class="line">  → 自动生成补货建议单 → 紧急补货直接执行 + 通知运营</span><br><span class="line">  → 常规补货等运营确认后执行</span><br><span class="line"></span><br><span class="line">运营新角色：供应链策略制定者 + 异常处理者</span><br></pre></td></tr></table></figure><p><strong>为什么运营会接受</strong>：断货是运营最痛的 KPI 事故。Agent 帮他们避免了”爆款卖断”的噩梦，这是实打实的利益绑定。</p><h3 id="3-动态调价-Agent（利润最大化引擎）"><a href="#3-动态调价-Agent（利润最大化引擎）" class="headerlink" title="3. 动态调价 Agent（利润最大化引擎）"></a>3. 动态调价 Agent（利润最大化引擎）</h3><p><strong>替代的职责</strong>：竞品价格监控、定价策略执行、促销价格管理。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line">传统模式：</span><br><span class="line">  运营定期查看竞品价格 → 凭感觉调价 → 大促时手忙脚乱改一堆价格</span><br><span class="line">  问题：竞品改价到你跟价，中间可能隔了几小时甚至一天</span><br><span class="line"></span><br><span class="line">Agent 接管后：</span><br><span class="line">  Agent 实时监控竞品价格（爬虫 + 数据源）</span><br><span class="line">  → 基于预设策略自动响应：</span><br><span class="line">    - 竞品降价 5% 以内：跟价</span><br><span class="line">    - 竞品降价 5-15%：通知运营，给出建议</span><br><span class="line">    - 竞品降价 &gt; 15%：预警（可能是清仓/错误）</span><br><span class="line">  → 同时考虑自身成本线、库存水位、利润目标</span><br><span class="line">  → 所有调价操作留完整审计日志</span><br><span class="line"></span><br><span class="line">运营新角色：定价策略制定者 + 价格异常裁决者</span><br></pre></td></tr></table></figure><p><strong>为什么运营会接受</strong>：调价是高频低创造力的工作，而且出错代价大（标错价的事故每个电商团队都经历过）。让 Agent 做执行、人做决策，运营求之不得。</p><h3 id="4-差评修复与用户挽回-Agent（复购提升引擎）"><a href="#4-差评修复与用户挽回-Agent（复购提升引擎）" class="headerlink" title="4. 差评修复与用户挽回 Agent（复购提升引擎）"></a>4. 差评修复与用户挽回 Agent（复购提升引擎）</h3><p><strong>替代的职责</strong>：差评监控、原因分析、客户沟通、补偿方案执行。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br></pre></td><td class="code"><pre><span class="line">传统模式：</span><br><span class="line">  客服/运营每天翻评论 → 发现差评 → 想解决方案 → 联系客户</span><br><span class="line">  问题：响应慢（差评已经挂了一天）、处理标准不一致、漏处理</span><br><span class="line"></span><br><span class="line">Agent 接管后：</span><br><span class="line">  Agent 实时监控新评价</span><br><span class="line">  → 差评出现后 5 分钟内完成：</span><br><span class="line">    1. 分析差评原因（物流/质量/描述不符/服务态度）</span><br><span class="line">    2. 匹配预设补偿方案（根据客户等级、问题类型、历史记录）</span><br><span class="line">    3. 自动发送安抚消息 + 补偿方案</span><br><span class="line">    4. 跟踪客户是否修改评价</span><br><span class="line">    5. 未解决的 case 升级给运营处理</span><br><span class="line">  → 每周生成差评分析报告（问题分布、解决率、补偿成本）</span><br><span class="line"></span><br><span class="line">运营新角色：客户体验策略制定者 + 疑难 case 处理者</span><br></pre></td></tr></table></figure><p><strong>为什么运营会接受</strong>：差评处理是繁琐、重复、情绪消耗大的工作。Agent 接管常规 case（通常占 70-80%），运营只处理疑难 case，工作质量反而提高了。</p><h3 id="5-智能选品与自动上新-Agent（爆款孵化引擎）"><a href="#5-智能选品与自动上新-Agent（爆款孵化引擎）" class="headerlink" title="5. 智能选品与自动上新 Agent（爆款孵化引擎）"></a>5. 智能选品与自动上新 Agent（爆款孵化引擎）</h3><p><strong>替代的职责</strong>：市场趋势分析、选品建议、产品信息编辑、上架流程执行。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br></pre></td><td class="code"><pre><span class="line">传统模式：</span><br><span class="line">  运营刷各种平台找灵感 → 凭感觉选品 → 手动编辑产品信息</span><br><span class="line">  → 上架后祈祷能卖</span><br><span class="line"></span><br><span class="line">Agent 接管后：</span><br><span class="line">  Agent 持续分析：</span><br><span class="line">    - 各平台热搜趋势和新品动态</span><br><span class="line">    - 社交媒体话题热度</span><br><span class="line">    - 竞品上新节奏和销量表现</span><br><span class="line">    - 本店历史数据中的品类规律</span><br><span class="line">  → 每周生成选品建议报告（附数据支撑）</span><br><span class="line">  → 运营确认选品后，Agent 自动：</span><br><span class="line">    1. 生成产品标题、卖点、详情页文案</span><br><span class="line">    2. 设置初始定价（参考竞品和成本）</span><br><span class="line">    3. 配置初始投放计划</span><br><span class="line">    4. 执行上架流程</span><br><span class="line">  → 上架后自动进入监控模式</span><br><span class="line"></span><br><span class="line">运营新角色：选品决策者 + 品类策略制定者</span><br></pre></td></tr></table></figure><p><strong>为什么运营会接受</strong>：选品决策依然由运营做（这是最有价值的判断），但选品之后的一系列”苦力活”——写文案、设价格、配投放、做上架——全部由 Agent 完成。运营的效率不是提升 30%，是提升 300%。</p><h2 id="落地策略：不要试图”说服运营用”，而是”让管理层做决策”"><a href="#落地策略：不要试图”说服运营用”，而是”让管理层做决策”" class="headerlink" title="落地策略：不要试图”说服运营用”，而是”让管理层做决策”"></a>落地策略：不要试图”说服运营用”，而是”让管理层做决策”</h2><p>理解了上述逻辑，落地策略就清晰了：</p><h3 id="不要做的事"><a href="#不要做的事" class="headerlink" title="不要做的事"></a>不要做的事</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">❌ 给运营做培训，教他们&quot;怎么用 Agent&quot;</span><br><span class="line">❌ 在运营群里发&quot;Agent 又优化了，快来试试&quot;</span><br><span class="line">❌ 统计&quot;Agent 使用率&quot;然后焦虑为什么不高</span><br><span class="line">❌ 请运营&quot;多给反馈帮助改进&quot;</span><br><span class="line">❌ 把 Agent 做成一个独立的工具/入口</span><br></pre></td></tr></table></figure><h3 id="应该做的事"><a href="#应该做的事" class="headerlink" title="应该做的事"></a>应该做的事</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">✅ 找管理层，明确&quot;这一段职责将由 Agent 接管&quot;</span><br><span class="line">✅ 重新定义运营的角色：&quot;从执行者到 Agent 管理者&quot;</span><br><span class="line">✅ 设计 Agent 的输出为&quot;可直接使用的业务结果&quot;，而非&quot;建议&quot;</span><br><span class="line">✅ 建立 Agent 执行效果的度量体系（ROI、准确率、响应速度）</span><br><span class="line">✅ 让运营的 KPI 变成&quot;管理 Agent 的效果&quot;，而非&quot;自己做事的效果&quot;</span><br></pre></td></tr></table></figure><h3 id="关键对话不是和运营谈，是和管理层谈"><a href="#关键对话不是和运营谈，是和管理层谈" class="headerlink" title="关键对话不是和运营谈，是和管理层谈"></a>关键对话不是和运营谈，是和管理层谈</h3><p>和运营谈（无效）</p><p>和管理层谈（有效）</p><p>“这个 Agent 能帮你提效”</p><p>“投放调优这件事，可以由 Agent 接管”</p><p>“你试试用 Agent 做这个”</p><p>“运营团队的角色需要升级”</p><p>“Agent 准确率已经 92% 了”</p><p>“Agent 接管后，ROI 提升了 15%”</p><p>“给我们反馈帮改进”</p><p>“需要管理层做一个组织决策”</p><h2 id="阻力转移：从暗礁到明障"><a href="#阻力转移：从暗礁到明障" class="headerlink" title="阻力转移：从暗礁到明障"></a>阻力转移：从暗礁到明障</h2><p>这个策略的核心智慧在于<strong>阻力转移</strong>。</p><p>建议型 Agent 面对的阻力是<strong>暗礁</strong>——运营的消极抵抗是无形的、分散的、你无法正面应对的。你不能说”你们不用 Agent 是因为怕被替代”，这话说出来就是灾难。</p><p>职责替代型 Agent 面对的阻力是<strong>明障</strong>——管理层的顾虑是明确的、可以讨论的、可以用数据和案例说服的：</p><ul><li>“Agent 出错了怎么办？” → 有治理护栏和回滚机制</li><li>“运营团队会不会反弹？” → 角色升级，不是裁员</li><li>“效果能保证吗？” → 先跑一个场景，用数据说话</li><li>“安全性怎么保证？” → 全链路审计 + 分级权限 + 人工确认</li></ul><p><strong>把 100 个人的消极抵抗，变成 3 个管理者的显性决策——这才是 Agent 落地的正确战场。</strong></p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>To B Agent 失败了太多次。每次事后复盘，结论总是”模型不够好”、“产品不够好”、“用户习惯需要培养”。</p><p>但真正的原因从来不是这些。</p><p><strong>真正的原因是：你做了一个工具，然后期望那些可能被这个工具替代的人主动拥抱它。</strong> 这不是技术问题，这是人性问题。</p><p>悟空的路径选择是：不做”工具”，做”职责接管者”。不问运营”你想不想用”，而是让管理层决定”这件事交给 Agent 做”。运营的角色不是消失，而是升级——从”每天盯数据调参数”到”制定策略、管理 Agent、处理异常”。</p><p><strong>不是心态决定成败，而是”是否把 Agent 变成默认路径”决定成败。</strong></p><p>当 Agent 的使用变成一个组织决策而非个人选择，当运营的角色变成”管理者”而非”被替代者”，Agent 的落地才真正进入了业务闭环。</p><p>这不温柔，但这是唯一有效的路径。</p><p><a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/enterprise/">enterprise</a>  <a href="https://hugozhu.site/tags/%E7%94%B5%E5%95%86/">电商</a>  <a href="https://hugozhu.site/tags/%E6%82%9F%E7%A9%BA/">悟空</a>  <a href="https://hugozhu.site/tags/%E7%BB%84%E7%BB%87%E5%8F%98%E9%9D%A9/">组织变革</a>  <a href="https://hugozhu.site/tags/product/">product</a> </p><hr><ul><li><p><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></p></li><li><p><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></p></li><li><p><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></p></li><li><p><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></p></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/154-tob-agent-failure-not-capability-but-closed-loop/">To B Agent 失败的根本原因：不是能力问题，是没有把 Agent 变成默认路径</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/26/2026-03-26-To-B-Agent-%E5%A4%B1%E8%B4%A5%E7%9A%84%E6%A0%B9%E6%9C%AC%E5%8E%9F%E5%9B%A0-%E4%B8%8D%E6%98%AF%E8%83%BD%E5%8A%9B%E9%97%AE%E9%A2%98-%E6%98%AF%E6%B2%A1%E6%9C%89%E6%8A%8A-Agent-%E5%8F%98%E6%88%90%E9%BB%98%E8%AE%A4%E8%B7%AF%E5%BE%84/</id>
    <link href="https://www.coconut.xin/2026/03/26/2026-03-26-To-B-Agent-%E5%A4%B1%E8%B4%A5%E7%9A%84%E6%A0%B9%E6%9C%AC%E5%8E%9F%E5%9B%A0-%E4%B8%8D%E6%98%AF%E8%83%BD%E5%8A%9B%E9%97%AE%E9%A2%98-%E6%98%AF%E6%B2%A1%E6%9C%89%E6%8A%8A-Agent-%E5%8F%98%E6%88%90%E9%BB%98%E8%AE%A4%E8%B7%AF%E5%BE%84/"/>
    <published>2026-03-26T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E4%B8%AA%E8%A2%AB%E5%8F%8D%E5%A4%]]>
    </summary>
    <title>To B Agent 失败的根本原因：不是能力问题，是没有把 Agent 变成默认路径</title>
    <updated>2026-04-01T02:01:49.154Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E8%81%8A%E5%A4%A9%E5%8A%A9%E6%89%8B%E7%9A%84%E5%A4%A9%E8%8A%B1%E6%9D%BF">聊天助手的天花板</a></li><li><a href="#%E6%82%9F%E7%A9%BA%E7%9A%84%E5%AE%9A%E4%BD%8D%E5%8F%AF%E6%B2%BB%E7%90%86%E7%9A%84%E6%89%A7%E8%A1%8C%E7%B3%BB%E7%BB%9F">悟空的定位：可治理的执行系统</a><ul><li><a href="#1-%E4%BB%A3%E7%90%86%E5%BE%AA%E7%8E%AF%E7%9A%84%E7%A8%B3%E5%AE%9A%E6%80%A7">1. 代理循环的稳定性</a></li><li><a href="#2-%E5%B7%A5%E5%85%B7%E7%B3%BB%E7%BB%9F%E7%9A%84%E5%8F%AF%E9%9D%A0%E6%80%A7">2. 工具系统的可靠性</a></li><li><a href="#3-%E5%AE%89%E5%85%A8%E8%BE%B9%E7%95%8C%E7%9A%84%E5%8F%AF%E4%BF%A1%E5%BA%A6">3. 安全边界的可信度</a></li><li><a href="#4-%E7%94%A8%E6%88%B7%E4%BD%93%E9%AA%8C%E7%9A%84%E5%AE%89%E5%BF%83%E6%84%9F">4. 用户体验的安心感</a></li></ul></li><li><a href="#%E6%9E%B6%E6%9E%84%E8%8C%83%E5%BC%8F%E5%9B%9B%E8%A6%81%E7%B4%A0%E7%BC%BA%E4%B8%80%E4%B8%8D%E5%8F%AF">架构范式：四要素缺一不可</a></li><li><a href="#%E4%B8%8E%E4%BC%A0%E7%BB%9F%E6%96%B9%E6%A1%88%E7%9A%84%E6%9C%AC%E8%B4%A8%E5%8C%BA%E5%88%AB">与传统方案的本质区别</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>把 ChatGPT 接入企业系统就能替代人工？这是 2024 年最昂贵的幻觉之一。</p><p>如果把传统聊天助手看作”知识与语言能力的放大器”，那么悟空代表了下一个阶段：<strong>把语言模型变成可行动、可交付、可治理的工作代理</strong>。这不是能力的线性升级，而是系统定位的根本转变——从”回答问题”到”完成工作”。</p><h2 id="聊天助手的天花板"><a href="#聊天助手的天花板" class="headerlink" title="聊天助手的天花板"></a>聊天助手的天花板</h2><p>大模型聊天助手的能力已经让人印象深刻：写方案、做翻译、改代码、分析数据。但在企业真实场景中，它始终卡在一个关键瓶颈上——<strong>它只能”说”，不能”做”</strong>。</p><p>用户问”帮我整理上周的销售数据”，助手会给出一段漂亮的分析框架，但它不会真的去读取数据库、生成报表、发送给相关人。用户问”帮我把这个需求拆成开发任务”，助手会输出一个合理的任务列表，但它不会真的去创建 Jira ticket、分配负责人、设置截止日期。</p><p><strong>聊天助手是一个”建议者”，不是一个”执行者”。</strong> 而企业需要的，恰恰是能闭环完成工作的执行者。</p><h2 id="悟空的定位：可治理的执行系统"><a href="#悟空的定位：可治理的执行系统" class="headerlink" title="悟空的定位：可治理的执行系统"></a>悟空的定位：可治理的执行系统</h2><p>悟空的成败不取决于底层模型的写作能力有多强——那只是基础设施。真正决定它价值的是四个工程维度的能力：</p><h3 id="1-代理循环的稳定性"><a href="#1-代理循环的稳定性" class="headerlink" title="1. 代理循环的稳定性"></a>1. 代理循环的稳定性</h3><p>一个能”自主工作”的 Agent，最大的风险不是不够聪明，而是<strong>不可收敛</strong>。</p><p>在实际运行中，Agent 需要反复执行”思考→规划→行动→观察→调整”的循环。如果这个循环设计不好，就会出现几种致命问题：</p><ul><li><strong>瞎忙</strong>：Agent 不断执行操作但没有朝目标推进，消耗大量算力和 API 调用</li><li><strong>死循环</strong>：陷入两个状态之间反复跳转，永远无法完成任务</li><li><strong>发散</strong>：从一个简单任务出发，越做越偏，最终产出一堆无关的结果</li></ul><p>悟空在代理循环设计上的核心原则是<strong>可收敛</strong>：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">class</span> <span class="title class_">AgentLoop</span>:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;悟空代理循环：保证任务可收敛&quot;&quot;&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">__init__</span>(<span class="params">self, max_iterations: <span class="built_in">int</span> = <span class="number">20</span></span>):</span><br><span class="line">        <span class="variable language_">self</span>.max_iterations = max_iterations</span><br><span class="line">        <span class="variable language_">self</span>.progress_tracker = ProgressTracker()</span><br><span class="line"></span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">run</span>(<span class="params">self, task: Task</span>) -&gt; Result:</span><br><span class="line">        <span class="keyword">for</span> i <span class="keyword">in</span> <span class="built_in">range</span>(<span class="variable language_">self</span>.max_iterations):</span><br><span class="line">            <span class="comment"># 1. 规划下一步</span></span><br><span class="line">            plan = <span class="variable language_">self</span>.think(task, <span class="variable language_">self</span>.progress_tracker.history)</span><br><span class="line"></span><br><span class="line">            <span class="comment"># 2. 检测是否在原地打转</span></span><br><span class="line">            <span class="keyword">if</span> <span class="variable language_">self</span>.progress_tracker.is_stalled(plan):</span><br><span class="line">                <span class="keyword">return</span> <span class="variable language_">self</span>.escalate_or_pivot(task)</span><br><span class="line"></span><br><span class="line">            <span class="comment"># 3. 执行并观察结果</span></span><br><span class="line">            result = <span class="variable language_">self</span>.act(plan)</span><br><span class="line">            observation = <span class="variable language_">self</span>.observe(result)</span><br><span class="line"></span><br><span class="line">            <span class="comment"># 4. 判断是否达成目标</span></span><br><span class="line">            <span class="keyword">if</span> <span class="variable language_">self</span>.is_task_complete(task, observation):</span><br><span class="line">                <span class="keyword">return</span> <span class="variable language_">self</span>.package_deliverable(task, observation)</span><br><span class="line"></span><br><span class="line">            <span class="comment"># 5. 更新进度追踪</span></span><br><span class="line">            <span class="variable language_">self</span>.progress_tracker.record(plan, result, observation)</span><br><span class="line"></span><br><span class="line">        <span class="comment"># 超过最大轮次，交还给人</span></span><br><span class="line">        <span class="keyword">return</span> <span class="variable language_">self</span>.handoff_to_human(task, <span class="variable language_">self</span>.progress_tracker.summary())</span><br><span class="line">    <span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>关键设计点：<strong>有进度追踪、有停滞检测、有最大轮次限制、有人工兜底</strong>。Agent 不是被放出去自由奔跑，而是在一条有护栏的跑道上前进。</p><h3 id="2-工具系统的可靠性"><a href="#2-工具系统的可靠性" class="headerlink" title="2. 工具系统的可靠性"></a>2. 工具系统的可靠性</h3><p>Agent 的”手脚”是工具系统。如果工具不可靠，Agent 再聪明也是空谈。</p><p>悟空的工具系统强调三个”真实”：</p><p><strong>真实读取</strong>——不是让模型”猜测”数据长什么样，而是通过标准化接口真正读取业务系统中的数据。读到什么就是什么，不幻觉、不补全。</p><p><strong>真实写入</strong>——Agent 的操作结果必须落到真实系统中。创建的任务要出现在项目管理工具里，生成的报表要能被下载和打开，发出的通知要真的到达接收人。</p><p><strong>真实验证</strong>——每一步操作完成后，都要验证结果是否符合预期。不是”我调了 API 所以应该成功了”，而是”我调了 API，然后回查确认数据确实更新了”。</p><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 悟空工具调用规范</span></span><br><span class="line"><span class="attr">tool_execution:</span></span><br><span class="line">  <span class="attr">pre_check:</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">验证参数合法性</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">确认操作权限</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">检查前置条件</span></span><br><span class="line">  <span class="attr">execution:</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">调用目标系统</span> <span class="string">API</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">记录请求与响应</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">设置超时与重试策略</span></span><br><span class="line">  <span class="attr">post_check:</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">验证操作结果</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">确认状态变更</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">记录审计日志</span></span><br><span class="line">  <span class="attr">rollback:</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">定义回滚操作</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">保留回滚窗口</span></span><br><span class="line">    <span class="bullet">-</span> <span class="string">支持人工触发回滚</span></span><br></pre></td></tr></table></figure><h3 id="3-安全边界的可信度"><a href="#3-安全边界的可信度" class="headerlink" title="3. 安全边界的可信度"></a>3. 安全边界的可信度</h3><p>Agent 能做的事情越多，安全边界就越关键。悟空的安全设计遵循五层防护原则：</p><p><strong>最小权限</strong>：Agent 只拥有完成当前任务所需的最小权限集。一个负责生成周报的 Agent 不应该有删除数据的权限，即使它接入了同一个数据库。</p><p><strong>操作确认</strong>：高风险操作（删除、修改、导出、发送）在执行前需要人工确认。确认流程通过钉钉等即时通讯工具推送，降低响应延迟。</p><p><strong>全链路审计</strong>：每一次思考、每一次工具调用、每一次结果，都有完整的日志记录。出了问题可以精确回溯到是哪一步、什么原因、什么上下文导致的。</p><p><strong>可回滚</strong>：关键操作保留回滚能力。不是所有操作都能回滚（比如已发送的消息），但对于数据变更类操作，系统会在执行前自动创建快照。</p><p><strong>注入防护</strong>：对用户输入和外部数据源进行 Prompt 注入检测，防止恶意指令劫持 Agent 行为。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">用户请求 → 意图解析 → 权限校验 → 注入检测</span><br><span class="line">                                      ↓</span><br><span class="line">                              风险评估（低/中/高）</span><br><span class="line">                                      ↓</span><br><span class="line">                    低风险：直接执行 + 审计记录</span><br><span class="line">                    中风险：执行 + 结果验证 + 审计记录</span><br><span class="line">                    高风险：人工确认 → 执行 → 验证 → 审计记录</span><br></pre></td></tr></table></figure><h3 id="4-用户体验的安心感"><a href="#4-用户体验的安心感" class="headerlink" title="4. 用户体验的安心感"></a>4. 用户体验的安心感</h3><p>技术再好，如果用户感觉”不知道 AI 在干什么”，就不会信任它。悟空在用户体验上追求四个”可”：</p><p><strong>可见</strong>——Agent 正在做什么、做到哪一步、下一步计划做什么，用户随时可以看到。不是一个黑盒丢进去一个任务，等半天出来一个结果。</p><p><strong>可控</strong>——用户可以随时暂停、调整方向、修改参数。Agent 不是一列没有刹车的火车。</p><p><strong>可纠错</strong>——发现 Agent 走偏了，可以指出问题让它调整，而不是只能取消重来。已经完成的正确步骤应该保留，只修正出错的部分。</p><p><strong>可交付</strong>——Agent 的产出不是一段聊天记录里的文字，而是真实的、可直接使用的工作成果：一份排好版的文档、一组已创建的任务、一封已发送的邮件、一张已生成的报表。</p><h2 id="架构范式：四要素缺一不可"><a href="#架构范式：四要素缺一不可" class="headerlink" title="架构范式：四要素缺一不可"></a>架构范式：四要素缺一不可</h2><p>从工程视角来看，悟空代表的是当下知识工作自动化的主流架构范式。这个范式由四个要素组成，缺一不可：</p><p>要素</p><p>核心问题</p><p>失败后果</p><p><strong>代理循环</strong></p><p>Agent 能否稳定地推进任务到完成？</p><p>瞎忙、死循环、发散，浪费资源且无产出</p><p><strong>工具系统</strong></p><p>Agent 能否真实地操作业务系统？</p><p>只能”说”不能”做”，沦为高级聊天机器人</p><p><strong>治理护栏</strong></p><p>Agent 的行为是否在安全边界内？</p><p>误操作、数据泄露、越权行为，造成真实损失</p><p><strong>可交付资产</strong></p><p>Agent 的产出能否直接用于业务？</p><p>产出停留在文本层面，还需要人工”翻译”成行动</p><p>这四个要素之间是相互依赖的关系：</p><ul><li>没有稳定的代理循环，工具系统调用就是混乱的</li><li>没有可靠的工具系统，代理循环就是空转</li><li>没有治理护栏，工具系统越强大风险越大</li><li>没有可交付资产，前三者的投入就没有业务价值</li></ul><h2 id="与传统方案的本质区别"><a href="#与传统方案的本质区别" class="headerlink" title="与传统方案的本质区别"></a>与传统方案的本质区别</h2><p>维度</p><p>聊天助手</p><p>RPA</p><p>悟空（Agent）</p><p>输入</p><p>自然语言问题</p><p>预定义流程</p><p>自然语言任务</p><p>处理</p><p>生成文本回答</p><p>执行固定脚本</p><p>动态规划 + 工具调用</p><p>输出</p><p>文本建议</p><p>固定格式结果</p><p>可交付的工作成果</p><p>灵活性</p><p>高（但不能行动）</p><p>低（脚本固定）</p><p>高（且能行动）</p><p>可治理性</p><p>不需要（只是文本）</p><p>天然可控（脚本）</p><p>需要专门设计</p><p>适用场景</p><p>咨询、创作</p><p>重复性流程</p><p>知识工作自动化</p><p>悟空填补的是中间的空白地带：<strong>既有 LLM 的灵活理解能力，又有 RPA 的真实执行能力，同时具备企业级的治理能力。</strong></p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>把 LLM 变成可治理的执行系统，这不是一个”锦上添花”的优化，而是 AI 从”玩具”到”工具”的关键跨越。</p><p>聊天很酷，但企业买单的是执行。<strong>能收敛的代理循环、能落地的工具系统、能兜底的治理护栏、能交付的工作成果</strong>——这四件事做扎实了，LLM 才真正从”会说话的模型”变成”能干活的系统”。</p><p>悟空的价值，不在于它用了多好的模型，而在于它把模型装进了一个可靠的执行框架里。这个框架，才是企业愿意把真实业务交给 AI 的前提。</p><p><a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/llm/">LLM</a>  <a href="https://hugozhu.site/tags/%E6%9E%B6%E6%9E%84/">架构</a>  <a href="https://hugozhu.site/tags/%E6%B2%BB%E7%90%86/">治理</a>  <a href="https://hugozhu.site/tags/%E6%82%9F%E7%A9%BA/">悟空</a> </p><hr><ul><li><a href="/post/2026/154-tob-agent-failure-not-capability-but-closed-loop/">To B Agent 失败的根本原因：不是能力问题，是没有把 Agent 变成默认路径</a></li><li><a href="/post/2026/152-agent-security-ai-native-execution-control/">Agent安全是企业安全的新命题——用AI管AI的执行控制体系</a></li><li><a href="/post/2026/151-tob-agent-user-feedback-loop/">别再卷模型了：To B Agent 创业，用户反馈才是生死线</a></li><li><a href="/post/2026/150-dingtalk-cli-office-skills-token-era/">当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</a></li><li><a href="/post/2026/147-autoresearch-token-optimization-paradigm/">人写规则，Token做实验：从Karpathy的autoresearch看AI应用优化新范式</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/153-wukong-llm-governable-execution-system/">悟空的真正价值：把LLM变成可治理的执行系统</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/25/2026-03-25-%E6%82%9F%E7%A9%BA%E7%9A%84%E7%9C%9F%E6%AD%A3%E4%BB%B7%E5%80%BC-%E6%8A%8ALLM%E5%8F%98%E6%88%90%E5%8F%AF%E6%B2%BB%E7%90%86%E7%9A%84%E6%89%A7%E8%A1%8C%E7%B3%BB%E7%BB%9F/</id>
    <link href="https://www.coconut.xin/2026/03/25/2026-03-25-%E6%82%9F%E7%A9%BA%E7%9A%84%E7%9C%9F%E6%AD%A3%E4%BB%B7%E5%80%BC-%E6%8A%8ALLM%E5%8F%98%E6%88%90%E5%8F%AF%E6%B2%BB%E7%90%86%E7%9A%84%E6%89%A7%E8%A1%8C%E7%B3%BB%E7%BB%9F/"/>
    <published>2026-03-25T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E8%81%8A%E5%A4%A9%E5%8A%A9%E6%89%8B%E7%9A%]]>
    </summary>
    <title>悟空的真正价值：把LLM变成可治理的执行系统</title>
    <updated>2026-03-26T02:06:32.830Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%BC%A0%E7%BB%9F%E5%AE%89%E5%85%A8%E6%A8%A1%E5%9E%8B%E4%B8%BA%E4%BB%80%E4%B9%88%E5%A4%B1%E6%95%88%E4%BA%86">传统安全模型为什么失效了</a></li><li><a href="#%E8%A7%A3%E6%B3%95%E6%89%A7%E8%A1%8C%E6%97%B6%E7%9A%84%E5%AE%9E%E6%97%B6%E6%8E%A7%E5%88%B6%E4%BD%93%E7%B3%BB">解法：执行时的实时控制体系</a><ul><li><a href="#1-%E5%AE%9E%E6%97%B6%E9%A3%8E%E9%99%A9%E8%AF%84%E4%BC%B0%E5%AE%89%E5%85%A8-agent">1. 实时风险评估——安全 Agent</a></li><li><a href="#2-%E4%BA%BA%E5%9C%A8%E7%8E%AF%E6%8E%88%E6%9D%83%E9%92%89%E9%92%89%E4%BD%9C%E4%B8%BA%E5%AE%89%E5%85%A8%E6%8E%A7%E5%88%B6%E7%82%B9">2. 人在环授权——钉钉作为安全控制点</a></li><li><a href="#3-%E5%8A%A8%E6%80%81%E5%AE%89%E5%85%A8%E5%BC%BA%E5%BA%A6%E6%8E%A7%E5%88%B6%E6%95%88%E7%8E%87%E4%B8%8E%E5%AE%89%E5%85%A8%E7%9A%84%E5%8F%AF%E8%B0%83%E5%B9%B3%E8%A1%A1">3. 动态安全强度控制——效率与安全的可调平衡</a></li><li><a href="#4-%E5%88%86%E5%B1%82%E5%AE%89%E5%85%A8%E6%9E%B6%E6%9E%84%E6%88%90%E6%9C%AC%E5%8F%AF%E6%8E%A7%E7%9A%84%E5%85%B3%E9%94%AE">4. 分层安全架构——成本可控的关键</a></li></ul></li><li><a href="#%E8%BF%99%E5%A5%97%E4%BD%93%E7%B3%BB%E5%B8%A6%E6%9D%A5%E7%9A%84%E6%A0%B8%E5%BF%83%E4%BB%B7%E5%80%BC">这套体系带来的核心价值</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>当企业开始把越来越多的业务流程交给 AI Agent 自动执行时，一个被严重低估的问题浮出水面：<strong>传统安全体系管的是”谁能进来”，但没人管”AI进来之后做了什么”。</strong></p><p>这不是一个可以等的问题。Agent 一旦接入企业核心系统，风险就从”入口”转移到了”执行过程”。我们需要的不是又一套传统防火墙，而是一套 AI 原生的执行控制能力——<strong>用 AI 来管 AI</strong>。</p><h2 id="传统安全模型为什么失效了"><a href="#传统安全模型为什么失效了" class="headerlink" title="传统安全模型为什么失效了"></a>传统安全模型为什么失效了</h2><p>企业安全体系经过了二十多年的迭代，但核心逻辑始终围绕<strong>访问控制</strong>——身份认证、权限管理、网络隔离。这套体系回答的是一个问题：<strong>谁能访问什么资源？</strong></p><p>但 AI Agent 改变了游戏规则。一个被授权接入 CRM 系统的 Agent，可能因为一次 Prompt 注入就执行了批量删除客户数据的操作。一个有权访问财务系统的 Agent，可能因为上下文理解偏差，把”导出本月报表”理解成”导出全部历史数据并发送到外部邮箱”。</p><p>传统安全模型无法应对三类新型威胁：</p><ul><li><strong>Prompt 注入攻击</strong>：恶意指令被嵌入用户输入或外部数据中，劫持 Agent 行为</li><li><strong>自动化误操作</strong>：Agent 对业务上下文理解偏差导致的批量错误执行</li><li><strong>大规模错误放大</strong>：传统人工操作的错误是线性的，Agent 的错误是指数级的——它可以在几秒内对数千条记录执行错误操作</li></ul><p><strong>风险的本质变了：不再是”有人闯进来”，而是”被授权的 AI 在里面做了不该做的事”。</strong></p><h2 id="解法：执行时的实时控制体系"><a href="#解法：执行时的实时控制体系" class="headerlink" title="解法：执行时的实时控制体系"></a>解法：执行时的实时控制体系</h2><p>我们提出的核心理念是：<strong>将安全检查从”事后审计”前移到”执行时决策”</strong>。整套体系由四个层次组成。</p><h3 id="1-实时风险评估——安全-Agent"><a href="#1-实时风险评估——安全-Agent" class="headerlink" title="1. 实时风险评估——安全 Agent"></a>1. 实时风险评估——安全 Agent</h3><p>在每一次 Agent 执行动作的瞬间，一个专门的安全 Agent 同步介入：</p><ul><li><strong>理解上下文</strong>：当前任务是什么？用户的原始意图是什么？这个操作在业务流程中是否合理？</li><li><strong>评估风险</strong>：这次操作影响多少条数据？是否涉及敏感字段？是否超出历史操作模式？</li><li><strong>实时决策</strong>：放行、降级执行、暂停等待确认、或直接拦截</li></ul><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">class</span> <span class="title class_">SecurityAgent</span>:</span><br><span class="line">    <span class="string">&quot;&quot;&quot;AI Agent 执行过程中的实时安全评估&quot;&quot;&quot;</span></span><br><span class="line"></span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">evaluate</span>(<span class="params">self, action_context: ActionContext</span>) -&gt; RiskDecision:</span><br><span class="line">        <span class="comment"># 1. 解析操作意图与影响范围</span></span><br><span class="line">        intent = <span class="variable language_">self</span>.understand_intent(action_context)</span><br><span class="line">        scope = <span class="variable language_">self</span>.assess_impact_scope(action_context)</span><br><span class="line"></span><br><span class="line">        <span class="comment"># 2. 多维度风险评分</span></span><br><span class="line">        risk_score = <span class="variable language_">self</span>.calculate_risk(</span><br><span class="line">            data_sensitivity=scope.sensitivity_level,</span><br><span class="line">            operation_type=intent.operation_type,  <span class="comment"># read/write/delete/export</span></span><br><span class="line">            affected_records=scope.record_count,</span><br><span class="line">            historical_pattern=<span class="variable language_">self</span>.check_anomaly(action_context),</span><br><span class="line">            prompt_injection_score=<span class="variable language_">self</span>.detect_injection(action_context)</span><br><span class="line">        )</span><br><span class="line"></span><br><span class="line">        <span class="comment"># 3. 基于风险等级做出决策</span></span><br><span class="line">        <span class="keyword">if</span> risk_score &lt; <span class="number">0.3</span>:</span><br><span class="line">            <span class="keyword">return</span> RiskDecision.ALLOW</span><br><span class="line">        <span class="keyword">elif</span> risk_score &lt; <span class="number">0.6</span>:</span><br><span class="line">            <span class="keyword">return</span> RiskDecision.ALLOW_WITH_LOGGING</span><br><span class="line">        <span class="keyword">elif</span> risk_score &lt; <span class="number">0.8</span>:</span><br><span class="line">            <span class="keyword">return</span> RiskDecision.REQUIRE_HUMAN_APPROVAL</span><br><span class="line">        <span class="keyword">else</span>:</span><br><span class="line">            <span class="keyword">return</span> RiskDecision.BLOCK</span><br><span class="line">    <span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>这不是传统的规则引擎——它是一个能理解业务语义的 AI 安全守卫。它能区分”导出本月销售报表给领导”和”导出全部客户手机号到个人邮箱”的本质差异。</p><h3 id="2-人在环授权——钉钉作为安全控制点"><a href="#2-人在环授权——钉钉作为安全控制点" class="headerlink" title="2. 人在环授权——钉钉作为安全控制点"></a>2. 人在环授权——钉钉作为安全控制点</h3><p>当安全 Agent 判定某个操作为高风险时，系统不会直接拦截（那会严重影响效率），而是将决策权交给人。</p><p><strong>钉钉手机端成为 AI Agent 高风险操作的统一授权入口</strong>，典型流程如下：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line">Agent 发起操作（如：批量删除过期订单）</span><br><span class="line">       ↓</span><br><span class="line">安全 Agent 评估：高风险（影响 5000+ 条记录）</span><br><span class="line">       ↓</span><br><span class="line">推送钉钉消息：</span><br><span class="line">  &quot;⚠️ Agent 请求执行：删除 5,238 条过期订单</span><br><span class="line">   触发规则：批量删除 &gt; 1000 条</span><br><span class="line">   操作者：销售数据清理 Agent</span><br><span class="line">   [确认执行] [查看详情] [拒绝]&quot;</span><br><span class="line">       ↓</span><br><span class="line">用户生物识别验证 → 确认/拒绝</span><br><span class="line">       ↓</span><br><span class="line">Agent 收到授权结果，继续或终止</span><br></pre></td></tr></table></figure><p>这个模式的本质是<strong>AI 时代的 U 盾</strong>——把最关键的决策权留给人，同时不拖慢日常操作。它也是 Agent 层面的 MFA（多重认证）：Agent 有权限还不够，高风险操作还需要人的实时确认。</p><h3 id="3-动态安全强度控制——效率与安全的可调平衡"><a href="#3-动态安全强度控制——效率与安全的可调平衡" class="headerlink" title="3. 动态安全强度控制——效率与安全的可调平衡"></a>3. 动态安全强度控制——效率与安全的可调平衡</h3><p>不同业务场景对安全的要求天然不同。一个内部数据分析 Agent 和一个面向客户的交易 Agent，显然需要不同等级的安全控制。</p><p>我们设计了三个维度的动态调节能力：</p><p>维度</p><p>说明</p><p>调节方式</p><p><strong>覆盖面</strong></p><p>多少比例的操作需要安全检查</p><p>策略档位 &#x2F; 滑块</p><p><strong>检查深度</strong></p><p>用规则、小模型还是大模型进行评估</p><p>基于风险等级自动升级</p><p><strong>人工介入阈值</strong></p><p>多容易触发人在环确认</p><p>业务场景预设 + 手动调整</p><p>企业可以选择三种预设策略档位：</p><ul><li><strong>效率优先</strong>：仅检查写入&#x2F;删除操作，轻量规则过滤，高阈值触发人工确认</li><li><strong>平衡模式</strong>：覆盖所有写操作和敏感读操作，中等模型评估，适中的人工确认阈值</li><li><strong>安全优先</strong>：全量操作检查，大模型深度推理，低阈值触发人工确认</li></ul><p>系统还支持<strong>自动档</strong>——当检测到异常模式（如短时间内大量高风险操作）时，自动提升安全等级。</p><h3 id="4-分层安全架构——成本可控的关键"><a href="#4-分层安全架构——成本可控的关键" class="headerlink" title="4. 分层安全架构——成本可控的关键"></a>4. 分层安全架构——成本可控的关键</h3><p>安全不能以无限制增加成本为代价。我们采用<strong>漏斗式</strong>分层设计，让大部分操作以极低成本通过安全检查，只有真正的高风险操作才消耗大模型算力或人工注意力：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line">所有 Agent 操作（100%）</span><br><span class="line">        ↓</span><br><span class="line">   规则过滤层（成本极低）</span><br><span class="line">   过滤明显安全的操作（~80% 放行）</span><br><span class="line">        ↓</span><br><span class="line">   轻量模型判断（低成本）</span><br><span class="line">   对中风险操作进行快速评估（~15% 在此处理）</span><br><span class="line">        ↓</span><br><span class="line">   大模型深度推理（中等成本）</span><br><span class="line">   对复杂场景进行语义级理解（~4% 在此处理）</span><br><span class="line">        ↓</span><br><span class="line">   人在环 - 钉钉授权（最高成本）</span><br><span class="line">   极高风险操作的最终决策（~1%）</span><br></pre></td></tr></table></figure><p>这个漏斗确保了三个关键目标同时达成：</p><ul><li><strong>安全能力充分增强</strong>：真正危险的操作一定会被截获</li><li><strong>成本不会失控</strong>：绝大部分操作由低成本层处理</li><li><strong>用户体验可接受</strong>：日常操作几乎无感知延迟</li></ul><p>行业实践数据显示，安全相关算力通常占 AI Agent 总算力的 <strong>3%–6%</strong>（电商等典型场景），高合规行业（金融、医疗）可上升至约 <strong>8%</strong>。关键是：<strong>这个比例是可调的</strong>，企业可以根据自身风险偏好和预算灵活配置。</p><h2 id="这套体系带来的核心价值"><a href="#这套体系带来的核心价值" class="headerlink" title="这套体系带来的核心价值"></a>这套体系带来的核心价值</h2><p><strong>从被动到主动</strong>：风险发现从”事后审计报告里的一行异常”变成”执行前的实时拦截”。误删、越权、数据泄露——在发生之前就被阻止。</p><p><strong>安全与效率不再对立</strong>：通过动态安全强度控制，企业不需要在”全面管控导致效率低下”和”放任自动化导致风险失控”之间二选一。安全等级可以像音量旋钮一样精确调节。</p><p><strong>合规能力体系化</strong>：每一次 Agent 操作、每一次安全评估、每一次人工授权都有完整的审计链路。面对监管审查和内控要求，企业可以拿出清晰的证据链。</p><p><strong>形成平台级能力沉淀</strong>：这不是为某一个 Agent 建的安全系统，而是一套可复用到所有 AI Agent、所有业务系统的执行控制平台。Agent 执行控制、安全策略引擎、人机协同授权——这些能力一旦建成，就是企业在 AI 时代的核心基础设施。</p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>AI Agent 安全不是一个可以”等等再说”的问题。每多接入一个 Agent，每多自动化一个业务流程，“执行过程不可控”的风险就在累积。</p><p>我们不是在增加一套安全系统，而是在为 AI Agent 构建<strong>执行过程中的实时控制能力</strong>——让企业可以在拥抱 AI 自动化的同时，保持对风险、成本和效率的全面掌控。</p><p><strong>用 AI 管 AI，这不是选择题，而是必答题。</strong></p><p><a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/%E5%AE%89%E5%85%A8/">安全</a>  <a href="https://hugozhu.site/tags/%E4%BC%81%E4%B8%9A%E6%9E%B6%E6%9E%84/">企业架构</a>  <a href="https://hugozhu.site/tags/%E9%92%89%E9%92%89/">钉钉</a>  <a href="https://hugozhu.site/tags/%E9%A3%8E%E9%99%A9%E6%8E%A7%E5%88%B6/">风险控制</a> </p><hr><ul><li><p><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></p></li><li><p><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></p></li><li><p><a href="/post/2026/157-openclaw-claude-code-progress-sync/">OpenClaw + Claude Code 协同：用 Sub-Agent 执行编程任务并实时同步进度</a></p></li><li><p><a href="/post/2026/156-agent-vs-model-boundary/">模型和Agent的边界：模型决定上限，Agent决定你能不能稳定拿到这个上限</a></p></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/152-agent-security-ai-native-execution-control/">Agent安全是企业安全的新命题——用AI管AI的执行控制体系</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/23/2026-03-23-Agent%E5%AE%89%E5%85%A8%E6%98%AF%E4%BC%81%E4%B8%9A%E5%AE%89%E5%85%A8%E7%9A%84%E6%96%B0%E5%91%BD%E9%A2%98--%E7%94%A8AI%E7%AE%A1AI%E7%9A%84%E6%89%A7%E8%A1%8C%E6%8E%A7%E5%88%B6%E4%BD%93%E7%B3%BB/</id>
    <link href="https://www.coconut.xin/2026/03/23/2026-03-23-Agent%E5%AE%89%E5%85%A8%E6%98%AF%E4%BC%81%E4%B8%9A%E5%AE%89%E5%85%A8%E7%9A%84%E6%96%B0%E5%91%BD%E9%A2%98--%E7%94%A8AI%E7%AE%A1AI%E7%9A%84%E6%89%A7%E8%A1%8C%E6%8E%A7%E5%88%B6%E4%BD%93%E7%B3%BB/"/>
    <published>2026-03-23T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%BC%A0%E7%BB%9F%E5%AE%89%E5%85%A8%E6%A8%]]>
    </summary>
    <title>Agent安全是企业安全的新命题——用AI管AI的执行控制体系</title>
    <updated>2026-04-01T02:01:49.849Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%B8%80%E4%B8%AA%E8%A2%AB%E5%BF%BD%E8%A7%86%E7%9A%84%E4%BA%8B%E5%AE%9Eagent-%E7%9A%84%E7%AB%9E%E4%BA%89%E4%B8%8D%E5%9C%A8%E6%A8%A1%E5%9E%8B%E5%B1%82">一个被忽视的事实：Agent 的竞争不在模型层</a></li><li><a href="#%E7%94%A8%E6%88%B7%E5%8F%8D%E9%A6%88%E6%98%AF-to-b-agent-%E7%9A%84%E6%A0%B8%E5%BF%83%E8%B5%84%E4%BA%A7">用户反馈是 To B Agent 的核心资产</a></li><li><a href="#%E5%A4%9A%E5%BF%AB%E5%A5%BD%E7%9C%81%E5%AE%9A%E4%B9%89%E4%BD%A0%E7%9A%84-agent-%E6%89%A7%E8%A1%8C%E6%8C%87%E6%A0%87">“多快好省”：定义你的 Agent 执行指标</a><ul><li><a href="#%E4%B8%BA%E6%AF%8F%E7%A7%8D%E4%BB%BB%E5%8A%A1%E7%B1%BB%E5%9E%8B%E8%AE%BE%E5%AE%9A%E5%9F%BA%E7%BA%BF">为每种任务类型设定基线</a></li></ul></li><li><a href="#%E6%9E%84%E5%BB%BA%E5%8F%8D%E9%A6%88%E9%97%AD%E7%8E%AF%E4%BB%8E%E4%BF%A1%E5%8F%B7%E9%87%87%E9%9B%86%E5%88%B0-agent-%E8%BF%9B%E5%8C%96">构建反馈闭环：从信号采集到 Agent 进化</a><ul><li><a href="#%E7%AC%AC%E4%B8%80%E7%8E%AF%E9%87%87%E9%9B%86%E8%AE%A9%E5%8F%8D%E9%A6%88%E4%BF%A1%E5%8F%B7%E6%97%A0%E5%A4%84%E4%B8%8D%E5%9C%A8">第一环：采集——让反馈信号无处不在</a></li><li><a href="#%E7%AC%AC%E4%BA%8C%E7%8E%AF%E5%BD%92%E5%9B%A0%E4%BB%8E%E4%BF%A1%E5%8F%B7%E5%88%B0%E8%AF%8A%E6%96%AD">第二环：归因——从信号到诊断</a></li><li><a href="#%E7%AC%AC%E4%B8%89%E7%8E%AF%E5%AE%9E%E9%AA%8C%E7%94%A8%E5%9C%BA%E6%99%AF%E6%95%B0%E6%8D%AE%E9%A9%B1%E5%8A%A8%E4%BC%98%E5%8C%96">第三环：实验——用场景数据驱动优化</a></li><li><a href="#%E7%AC%AC%E5%9B%9B%E7%8E%AF%E9%83%A8%E7%BD%B2%E7%81%B0%E5%BA%A6%E4%B8%8E%E5%9B%9E%E6%BB%9A">第四环：部署——灰度与回滚</a></li></ul></li><li><a href="#%E5%9C%BA%E6%99%AF%E6%95%B0%E6%8D%AE%E7%9A%84%E9%A3%9E%E8%BD%AE%E8%B6%8A%E7%94%A8%E8%B6%8A%E5%A5%BD%E7%9A%84%E6%AD%A3%E5%BE%AA%E7%8E%AF">场景数据的飞轮：越用越好的正循环</a></li><li><a href="#%E7%BB%99%E5%88%9B%E4%B8%9A%E5%9B%A2%E9%98%9F%E7%9A%84%E5%AE%9E%E6%93%8D%E5%BB%BA%E8%AE%AE">给创业团队的实操建议</a><ul><li><a href="#day-1-30%E5%85%88%E8%B7%91%E9%80%9A%E6%9C%80%E5%B0%8F%E9%97%AD%E7%8E%AF">Day 1-30：先跑通最小闭环</a></li><li><a href="#day-30-90%E8%87%AA%E5%8A%A8%E5%8C%96%E5%85%B3%E9%94%AE%E7%8E%AF%E8%8A%82">Day 30-90：自动化关键环节</a></li><li><a href="#day-90-180%E5%BB%BA%E7%AB%8B%E7%B3%BB%E7%BB%9F%E6%80%A7%E4%BC%98%E5%8C%96%E8%83%BD%E5%8A%9B">Day 90-180：建立系统性优化能力</a></li><li><a href="#%E5%9B%A2%E9%98%9F%E9%85%8D%E7%BD%AE%E5%BB%BA%E8%AE%AE">团队配置建议</a></li></ul></li><li><a href="#%E4%B8%80%E4%B8%AA%E6%80%9D%E6%83%B3%E5%AE%9E%E9%AA%8C">一个思想实验</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>2026 年，一个事实已经无法忽视：<strong>模型训练不再是一项研究活动，而是一项系统工程。</strong></p><p>预训练需要万卡集群和 PB 级数据管线，强化学习需要奖励模型和 RLHF&#x2F;DPO 的工程化流水线，推理优化涉及量化、蒸馏、speculative decoding 等一整套工具链，Agent 能力构建则横跨 function calling、长上下文、规划与工具使用的多维调优。任何一个方向的突破，如果不能在其他环节配合落地，就只是一篇论文，不是一个产品。</p><p>这意味着什么？<strong>模型本身正在变成标准化基础设施。</strong> 就像今天没有哪家 SaaS 公司拿”我们用了 PostgreSQL”当竞争优势一样，未来也不会有哪家 Agent 公司仅靠”我们微调了一个更好的模型”赢得市场。</p><p>那么 To B Agent 创业的制胜变量到底是什么？</p><h2 id="一个被忽视的事实：Agent-的竞争不在模型层"><a href="#一个被忽视的事实：Agent-的竞争不在模型层" class="headerlink" title="一个被忽视的事实：Agent 的竞争不在模型层"></a>一个被忽视的事实：Agent 的竞争不在模型层</h2><p>先看今天 To B Agent 赛道的典型创业故事：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">团队 A：3 个 AI 研究员，从大厂出来，花 6 个月微调了一个行业模型</span><br><span class="line">团队 B：5 个工程师 + 2 个行业专家，花 3 个月搭了一套 Agent 工作流</span><br><span class="line">团队 C：3 个产品经理 + 3 个工程师，花 2 个月做了个能用的 MVP，然后每天泡在客户现场</span><br></pre></td></tr></table></figure><p>半年后，团队 C 的客户续约率最高。</p><p>为什么？因为 To B Agent 要解决的问题不是”模型能不能理解这段话”，而是**“这个 Agent 能不能像一个靠谱的初级员工一样，把一件具体的事做好”**。</p><p>一个能替代初级岗位的 Agent，面对的是真实业务场景中无穷无尽的边界条件：</p><ul><li>客户的审批流程有 17 种例外情况</li><li>报价单的格式每个行业甚至每家客户都不一样</li><li>“帮我整理一下这个表”在不同上下文里意味着完全不同的操作</li><li>同一个任务，张三要的是简洁版，李四要的是详细版</li></ul><p>这些问题，模型层面的能力提升帮不了你。<strong>只有用户反馈才能告诉你：你的 Agent 在真实场景里到底做得怎么样。</strong></p><h2 id="用户反馈是-To-B-Agent-的核心资产"><a href="#用户反馈是-To-B-Agent-的核心资产" class="headerlink" title="用户反馈是 To B Agent 的核心资产"></a>用户反馈是 To B Agent 的核心资产</h2><p>让我把这个论点说得更直白一些：</p><blockquote><p><strong>在 To B Agent 赛道，你的模型、你的架构、你的 Prompt 工程——这些都是”赌注”。只有用户反馈闭环，才是你的”底牌”。</strong></p></blockquote><p>为什么？看一个对比：</p><p>能力</p><p>可复制性</p><p>竞争壁垒</p><p>基础模型能力</p><p>高——开源模型快速追赶</p><p>低</p><p>Prompt&#x2F;工作流工程</p><p>中——聪明的团队几周就能复刻</p><p>低</p><p>行业知识库</p><p>中——可以购买或爬取</p><p>中</p><p><strong>真实场景的用户反馈数据</strong></p><p><strong>低——只有你的客户在你的产品里产生</strong></p><p><strong>高</strong></p><p><strong>基于反馈的持续优化能力</strong></p><p><strong>极低——需要数据 + 工程 + 产品的系统性投入</strong></p><p><strong>极高</strong></p><p>最后两行是关键。你的竞争对手可以用同样的基础模型、抄你的 Prompt、买同样的行业数据——但他拿不到你的客户在你的产品里产生的那些真实反馈信号。</p><p><strong>这些反馈数据是你独有的场景资产。而且它有飞轮效应：反馈越多 → Agent 越好 → 用户越愿意用 → 反馈更多。</strong></p><h2 id="“多快好省”：定义你的-Agent-执行指标"><a href="#“多快好省”：定义你的-Agent-执行指标" class="headerlink" title="“多快好省”：定义你的 Agent 执行指标"></a>“多快好省”：定义你的 Agent 执行指标</h2><p>在构建反馈闭环之前，先回答一个问题：<strong>你优化的目标是什么？</strong></p><p>对一个替代初级岗位的 To B Agent 来说，用户关心的核心指标可以归纳为”多快好省”四个维度：</p><p>维度</p><p>含义</p><p>度量方式</p><p>示例</p><p><strong>多</strong>（覆盖度）</p><p>能处理多少种任务&#x2F;场景</p><p>任务完成率、场景覆盖率</p><p>能处理 80% 的常见审批类型</p><p><strong>快</strong>（效率）</p><p>完成任务要多长时间</p><p>端到端耗时、人工介入次数</p><p>一份报告从 30 分钟降到 5 分钟</p><p><strong>好</strong>（质量）</p><p>输出质量是否达标</p><p>准确率、返工率、用户满意度</p><p>生成的合同初稿一次通过率 90%</p><p><strong>省</strong>（成本）</p><p>消耗了多少资源</p><p>Token 消耗、API 调用次数、人工复核成本</p><p>单任务成本 &lt; ¥0.5</p><p>这四个维度之间存在张力——追求”好”可能牺牲”快”和”省”，追求”多”可能降低”好”。<strong>你的产品策略决定了四个维度的优先级排序</strong>，而用户反馈告诉你当前在每个维度上的真实表现。</p><h3 id="为每种任务类型设定基线"><a href="#为每种任务类型设定基线" class="headerlink" title="为每种任务类型设定基线"></a>为每种任务类型设定基线</h3><p>不要试图用一组指标衡量所有任务。不同任务类型的”多快好省”权重完全不同：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br></pre></td><td class="code"><pre><span class="line">任务类型：合同审查</span><br><span class="line">  多: 权重 0.2 — 场景相对固定</span><br><span class="line">  快: 权重 0.2 — 不急，但不能超过 1 小时</span><br><span class="line">  好: 权重 0.5 — 错一个条款后果严重</span><br><span class="line">  省: 权重 0.1 — 对比律师费用，成本不敏感</span><br><span class="line"></span><br><span class="line">任务类型：客服工单分类</span><br><span class="line">  多: 权重 0.3 — 要能覆盖各种奇怪的问题</span><br><span class="line">  快: 权重 0.3 — 实时响应，秒级</span><br><span class="line">  好: 权重 0.2 — 分类错了可以人工纠正</span><br><span class="line">  省: 权重 0.2 — 量大，成本敏感</span><br></pre></td></tr></table></figure><p>这种按任务类型的指标拆分，是后续一切优化的基础。</p><h2 id="构建反馈闭环：从信号采集到-Agent-进化"><a href="#构建反馈闭环：从信号采集到-Agent-进化" class="headerlink" title="构建反馈闭环：从信号采集到 Agent 进化"></a>构建反馈闭环：从信号采集到 Agent 进化</h2><p>反馈闭环不是”加一个点赞按钮”。它是一套完整的系统，包含四个环节：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">采集 → 归因 → 实验 → 部署</span><br><span class="line"> ↑                      │</span><br><span class="line"> └──────────────────────┘</span><br></pre></td></tr></table></figure><h3 id="第一环：采集——让反馈信号无处不在"><a href="#第一环：采集——让反馈信号无处不在" class="headerlink" title="第一环：采集——让反馈信号无处不在"></a>第一环：采集——让反馈信号无处不在</h3><p>最大的误区是只依赖显式反馈（用户主动打分、点赞&#x2F;踩）。<strong>显式反馈的覆盖率通常低于 5%</strong>——绝大多数用户用完就走了，不会停下来给你评分。</p><p>你需要建立一套<strong>隐式反馈 + 显式反馈</strong>的复合信号体系：</p><p><strong>隐式信号（自动采集，零用户成本）：</strong></p><p>用户行为</p><p>信号解读</p><p>权重</p><p>Agent 输出后，用户直接采纳</p><p>满意</p><p>+1.0</p><p>用户对输出做了小幅编辑（&lt;20%）</p><p>基本满意，有微调</p><p>+0.5</p><p>用户对输出做了大幅编辑（&gt;50%）</p><p>不满意，但愿意修正</p><p>-0.5</p><p>用户放弃 Agent 输出，自己重做</p><p>完全不满意</p><p>-1.0</p><p>用户追问细节或要求补充</p><p>覆盖不足</p><p>-0.3</p><p>用户要求重做（“重新来”）</p><p>输出质量差</p><p>-0.8</p><p>用户把 Agent 输出转发给同事</p><p>高质量输出</p><p>+1.5</p><p>用户用同样的指令再次调用（第二天&#x2F;下周）</p><p>形成使用习惯</p><p>+2.0</p><p><strong>显式信号（需要用户参与，但信息量大）：</strong></p><ul><li>👍&#x2F;👎 按钮——简单但信息量低</li><li>选择题反馈—���“这个输出哪里不好？①不准确 ②太啰嗦 ③格式不对 ④缺少信息”</li><li>自由文本反馈——信息量最大，但分析成本高</li></ul><p><strong>产品设计的关键原则：让隐式信号覆盖 95% 的反馈采集，显式信号只在关键节点触发。</strong> 比如：</p><ul><li>当检测到用户对 Agent 输出做了大幅编辑时，弹一个轻量级反馈框：“我注意到你做了较多修改，是哪里不够好？”</li><li>当 Agent 连续 3 次被追问时，记录为”需要人工审查的 case”</li></ul><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">class</span> <span class="title class_">FeedbackCollector</span>:</span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">on_task_complete</span>(<span class="params">self, task_id, agent_output, user_actions</span>):</span><br><span class="line">        signals = []</span><br><span class="line"></span><br><span class="line">        <span class="comment"># 隐式信号自动采集</span></span><br><span class="line">        <span class="keyword">if</span> user_actions.accepted_directly:</span><br><span class="line">            signals.append((<span class="string">&quot;implicit_accept&quot;</span>, <span class="number">1.0</span>))</span><br><span class="line">        <span class="keyword">elif</span> user_actions.edit_ratio &lt; <span class="number">0.2</span>:</span><br><span class="line">            signals.append((<span class="string">&quot;minor_edit&quot;</span>, <span class="number">0.5</span>))</span><br><span class="line">        <span class="keyword">elif</span> user_actions.edit_ratio &gt; <span class="number">0.5</span>:</span><br><span class="line">            signals.append((<span class="string">&quot;major_edit&quot;</span>, -<span class="number">0.5</span>))</span><br><span class="line">            <span class="comment"># 触发显式反馈采集</span></span><br><span class="line">            <span class="variable language_">self</span>.request_explicit_feedback(task_id, <span class="string">&quot;large_edit&quot;</span>)</span><br><span class="line">        <span class="keyword">if</span> user_actions.forwarded_to_others:</span><br><span class="line">            signals.append((<span class="string">&quot;forwarded&quot;</span>, <span class="number">1.5</span>))</span><br><span class="line"></span><br><span class="line">        <span class="variable language_">self</span>.store(task_id, signals)</span><br><span class="line">    <span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><h3 id="第二环：归因——从信号到诊断"><a href="#第二环：归因——从信号到诊断" class="headerlink" title="第二环：归因——从信号到诊断"></a>第二环：归因——从信号到诊断</h3><p>有了反馈信号只是第一步。更重要的是搞清楚<strong>为什么好、为什么差</strong>。</p><p>归因需要在三个层次上进行：</p><p><strong>层次 1：任务类型归因</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">上周 Agent 执行了 500 个任务：</span><br><span class="line">├── 合同审查（120 次）: 满意率 85% ✅</span><br><span class="line">├── 报价单生成（200 次）: 满意率 62% ⚠️ ← 重点关注</span><br><span class="line">├── 会议纪要整理（100 次）: 满意率 91% ✅</span><br><span class="line">└── 数据报表制作（80 次）: 满意率 45% ❌ ← 紧急处理</span><br></pre></td></tr></table></figure><p><strong>层次 2：失败模式归因</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">报价单生成满意率 62%，76 次不满意：</span><br><span class="line">├── 格式错误（30 次，39%）: 客户 A 要横版，Agent 输出竖版</span><br><span class="line">├── 价格计算错误（22 次，29%）: 阶梯定价逻辑出错</span><br><span class="line">├── 缺少必要信息（15 次，20%）: 未带入客户的历史折扣</span><br><span class="line">└── 其他（9 次，12%）: 包含过时的产品型号</span><br></pre></td></tr></table></figure><p><strong>层次 3：根因归因</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br></pre></td><td class="code"><pre><span class="line">价格计算错误（22 次）根因分析：</span><br><span class="line">├── 12 次：阶梯定价规则没有写进 Prompt → Prompt 优化</span><br><span class="line">├── 7 次：客户的定价规则更新了，Agent 用的是旧版 → 知识库更新机制</span><br><span class="line">└── 3 次：模型推理错误（数学计算） → 需要增加计算校验步骤</span><br></pre></td></tr></table></figure><p>三层归因做下来，你得到的不是一个模糊的”用户不满意”，而是<strong>明确的优化动作清单</strong>。每个问题都有具体的解法。</p><h3 id="第三环：实验——用场景数据驱动优化"><a href="#第三环：实验——用场景数据驱动优化" class="headerlink" title="第三环：实验——用场景数据驱动优化"></a>第三环：实验——用场景数据驱动优化</h3><p>有了诊断，接下来是实验。这是很多团队做得最差的环节——他们要么凭直觉改 Prompt，要么一次性做大量修改，根本分不清哪个改动起了作用。</p><p><strong>核心原则：一次只改一个变量，用真实场景数据验证。</strong></p><h4 id="建立你的-Eval-数据集"><a href="#建立你的-Eval-数据集" class="headerlink" title="建立你的 Eval 数据集"></a>建立你的 Eval 数据集</h4><p>这是场景数据的最高价值用法——从真实执行记录中提取评测数据集：</p><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br></pre></td><td class="code"><pre><span class="line"><span class="keyword">class</span> <span class="title class_">ScenarioEvalBuilder</span>:</span><br><span class="line">    <span class="keyword">def</span> <span class="title function_">build_eval_set</span>(<span class="params">self, task_type, min_cases=<span class="number">50</span></span>):</span><br><span class="line">        <span class="string">&quot;&quot;&quot;从真实执行记录中构建评测数据集&quot;&quot;&quot;</span></span><br><span class="line">        cases = []</span><br><span class="line">        <span class="keyword">for</span> record <span class="keyword">in</span> <span class="variable language_">self</span>.get_recent_records(task_type):</span><br><span class="line">            cases.append(&#123;</span><br><span class="line">                <span class="string">&quot;input&quot;</span>: record.user_instruction,</span><br><span class="line">                <span class="string">&quot;context&quot;</span>: record.business_context,</span><br><span class="line">                <span class="string">&quot;agent_output&quot;</span>: record.output,</span><br><span class="line">                <span class="string">&quot;user_feedback&quot;</span>: record.feedback_score,</span><br><span class="line">                <span class="string">&quot;user_edits&quot;</span>: record.edited_version,  <span class="comment"># 用户修正后的版本 = 黄金标准</span></span><br><span class="line">                <span class="string">&quot;failure_mode&quot;</span>: record.diagnosed_failure,</span><br><span class="line">            &#125;)</span><br><span class="line"></span><br><span class="line">        <span class="comment"># 优先选择有明确正/负信号的 case</span></span><br><span class="line">        positive = [c <span class="keyword">for</span> c <span class="keyword">in</span> cases <span class="keyword">if</span> c[<span class="string">&quot;user_feedback&quot;</span>] &gt; <span class="number">0.5</span>]</span><br><span class="line">        negative = [c <span class="keyword">for</span> c <span class="keyword">in</span> cases <span class="keyword">if</span> c[<span class="string">&quot;user_feedback&quot;</span>] &lt; -<span class="number">0.3</span>]</span><br><span class="line"></span><br><span class="line">        <span class="keyword">return</span> &#123;</span><br><span class="line">            <span class="string">&quot;golden_set&quot;</span>: positive[:<span class="number">25</span>] + negative[:<span class="number">25</span>],</span><br><span class="line">            <span class="string">&quot;size&quot;</span>: <span class="built_in">len</span>(cases),</span><br><span class="line">            <span class="string">&quot;positive_ratio&quot;</span>: <span class="built_in">len</span>(positive) / <span class="built_in">len</span>(cases),</span><br><span class="line">        &#125;</span><br><span class="line">    <span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>这里有一个容易被忽视的宝藏：<strong>用户修改后的版本就是你的黄金标准答案。</strong> 用户在 Agent 输出基础上做的每一次编辑，都是一条免费的标注数据。</p><h4 id="实验流程"><a href="#实验流程" class="headerlink" title="实验流程"></a>实验流程</h4><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br></pre></td><td class="code"><pre><span class="line">识别要优化的任务类型（如：报价单生成）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">分析失败模式，选择最高频的问题（如：格式错误）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">提出优化假设（如：在 Prompt 中增加客户特定的格式模板）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">在 Eval 数据集上运行 A/B 测试</span><br><span class="line">    │</span><br><span class="line">    ├── 原始 Prompt：格式正确率 61%</span><br><span class="line">    └── 修改后 Prompt：格式正确率 89%</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">检查是否引入副作用</span><br><span class="line">    │</span><br><span class="line">    ├── 价格准确率：94% → 93%（可接受）</span><br><span class="line">    └── 信息完整度：88% → 87%（可接受）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">主指标显著提升 + 无严重副作用 → 上线</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">在真实流量中持续监控 48 小时</span><br><span class="line">    │</span><br><span class="line">    ├── 确认改善 → 永久保留，更新 Eval 基线</span><br><span class="line">    └── 未达预期 → 回滚，分析原因</span><br></pre></td></tr></table></figure><h4 id="分层实验策略"><a href="#分层实验策略" class="headerlink" title="分层实验策略"></a>分层实验策略</h4><p>不是所有优化都需要同样的实验力度。按影响范围分层：</p><p>层级</p><p>改动类型</p><p>实验要求</p><p>示例</p><p>L1 轻量</p><p>Prompt 措辞微调</p><p>跑 10 条 Eval case</p><p>把”生成报价单”改为”按模板生成报价单”</p><p>L2 中等</p><p>工作流步骤调整</p><p>跑 50 条 + 48h 灰度</p><p>增加一步格式校验</p><p>L3 重大</p><p>架构级变更</p><p>跑全量 Eval + 1 周灰度</p><p>从单步生成改为”生成-校验-修正”三步流程</p><h3 id="第四环：部署——灰度与回滚"><a href="#第四环：部署——灰度与回滚" class="headerlink" title="第四环：部署——灰度与回滚"></a>第四环：部署——灰度与回滚</h3><p>To B 场景对稳定性的要求远高于 To C。一个 Agent 突然行为变了，客户的信任就没了。</p><p><strong>灰度发布策略：</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br></pre></td><td class="code"><pre><span class="line">修改通过 Eval 验证</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">Phase 1: 内部测试（团队自己用 2 天）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">Phase 2: 种子客户灰度（选 2-3 个关系好的客户，开放 1 周）</span><br><span class="line">    │    收集反馈，确认无回归</span><br><span class="line">    ▼</span><br><span class="line">Phase 3: 全量发布（监控指标 48 小时）</span><br><span class="line">    │</span><br><span class="line">    ├── 指标正常 → 完成</span><br><span class="line">    └── 指标异常 → 一键回滚到上一版本</span><br></pre></td></tr></table></figure><p><strong>关键：保留每个版本的完整快照（Prompt + 工作流 + 知识库版本），确保可以随时精确回滚。</strong></p><h2 id="场景数据的飞轮：越用越好的正循环"><a href="#场景数据的飞轮：越用越好的正循环" class="headerlink" title="场景数据的飞轮：越用越好的正循环"></a>场景数据的飞轮：越用越好的正循环</h2><p>当上述四个环节跑通之后，你会发现一件美妙的事情——系统开始自我加速。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br></pre></td><td class="code"><pre><span class="line">Week 1:  100 个任务记录 → 粗粒度优化 → 满意率 60%</span><br><span class="line">Week 4:  2000 个任务记录 → 精细化归因 → 满意率 72%</span><br><span class="line">Week 12: 10000 个任务记录 → 按客户/场景精准优化 → 满意率 85%</span><br><span class="line">Week 24: 50000 个任务记录 → Agent 比新来的实习生靠谱 → 满意率 92%</span><br></pre></td></tr></table></figure><p>飞轮的关键在于<strong>场景数据的网络效应</strong>：</p><ol><li><p><strong>客户 A 踩的坑，客户 B 不用再踩。</strong> 客户 A 发现报价单的阶梯定价逻辑有问题，修复后这个改进惠及所有客户。</p></li><li><p><strong>用户修正即标注。</strong> 每一次人工编辑都在告诉你正确答案应该是什么，这些数据积累起来，就是任何竞争对手都买不到的行业训练数据。</p></li><li><p><strong>失败模式库越来越全。</strong> 第一个月你只知道 10 种报价单出错方式，半年后你知道 200 种——每一种都有对应的解法。</p></li><li><p><strong>Eval 数据集越来越硬。</strong> 基于真实场景的 Eval 集，远比人工构造的测试集更能反映真实需求。你的 Eval 集越强，新的优化就越可靠。</p></li></ol><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br></pre></td><td class="code"><pre><span class="line">                      场景数据飞轮</span><br><span class="line"></span><br><span class="line">     ┌─────────────────────────────────┐</span><br><span class="line">     │                                 │</span><br><span class="line">     ▼                                 │</span><br><span class="line">用户使用 Agent ──→ 产生执行记录 ──→ 采集反馈信号</span><br><span class="line">                                       │</span><br><span class="line">                                       ▼</span><br><span class="line">Agent 能力提升 ←── 部署优化 ←── 实验验证 ←── 归因分析</span><br><span class="line">     │</span><br><span class="line">     ▼</span><br><span class="line">用户更愿意用 ──→ 更多执行记录 ──→ 更多反馈信号 ──→ ...</span><br></pre></td></tr></table></figure><p><strong>这就是 To B Agent 的真正护城河。</strong> 你的竞争对手可以抄你的架构、挖你的人、用同样的模型——但他拿不到你的场景数据飞轮。这个飞轮转了 6 个月之后，你的 Agent 对这个行业的理解深度，不是新入场者能够追赶的。</p><h2 id="给创业团队的实操建议"><a href="#给创业团队的实操建议" class="headerlink" title="给创业团队的实操建议"></a>给创业团队的实操建议</h2><h3 id="Day-1-30：先跑通最小闭环"><a href="#Day-1-30：先跑通最小闭环" class="headerlink" title="Day 1-30：先跑通最小闭环"></a>Day 1-30：先跑通最小闭环</h3><p>不要花 3 个月搭一个完美的反馈系统。先做最简单的版本：</p><ol><li><strong>记录每一次 Agent 执行的输入和输出</strong>——存到数据库里就行</li><li><strong>在输出旁边放一个 👍&#x2F;👎 按钮</strong>——能收到 3% 的反馈就够了</li><li><strong>每天人工审查 10 条差评 case</strong>——用人脑做归因，用 Excel 记录</li><li><strong>每周改一次 Prompt</strong>——基于那 10 条 case 的分析</li></ol><p>这个最小闭环不需要任何 AI 辅助评估、不需要自动化实验平台、不需要灰度发布系统。它就是”人工看反馈、人工改 Prompt、看看下周是不是好了”。</p><p>但它会教你三件事：</p><ul><li>用户真正在意什么（而不是你以为他们在意什么）</li><li>你的 Agent 在哪些场景下最脆弱</li><li>什么样的反馈信号最有诊断价值</li></ul><h3 id="Day-30-90：自动化关键环节"><a href="#Day-30-90：自动化关键环节" class="headerlink" title="Day 30-90：自动化关键环节"></a>Day 30-90：自动化关键环节</h3><p>当你对反馈模式有了直觉后，开始自动化：</p><ol><li><strong>隐式信号采集器</strong>——自动检测用户编辑行为、追问行为、放弃行为</li><li><strong>自动归因管线</strong>——用 LLM 对差评 case 做分类和根因分析</li><li><strong>Eval 数据集自动构建</strong>——从真实执行记录中自动提取和更新评测集</li><li><strong>Eval 自动化运行</strong>——每次 Prompt 修改后自动跑 Eval 集</li></ol><h3 id="Day-90-180：建立系统性优化能力"><a href="#Day-90-180：建立系统性优化能力" class="headerlink" title="Day 90-180：建立系统性优化能力"></a>Day 90-180：建立系统性优化能力</h3><p>这个阶段的目标是让优化变得可预期、可复制：</p><ol><li><strong>按任务类型建立独立的 Eval 集和指标体系</strong></li><li><strong>建立实验记录和版本管理</strong>——每轮实验的假设、修改、结果、决策都有据可查</li><li><strong>灰度发布机制</strong>——重大修改先在种子客户上验证</li><li><strong>客户级别的 Agent 配置</strong>——不同客户的 Agent 行为可以独立调优</li></ol><h3 id="团队配置建议"><a href="#团队配置建议" class="headerlink" title="团队配置建议"></a>团队配置建议</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br></pre></td><td class="code"><pre><span class="line">早期（&lt; 10 人）:</span><br><span class="line">  产品/运营 × 1 — 每天看反馈，定义优化优先级</span><br><span class="line">  全栈工程师 × 2 — 搭建反馈采集和 Eval 管线</span><br><span class="line">  AI 工程师 × 1 — Prompt 优化和工作流设计</span><br><span class="line">  行业专家 × 1 — 提供领域知识，审查 Agent 输出质量</span><br><span class="line"></span><br><span class="line">不要一开始就招 ML Research：</span><br><span class="line">  ❌ 花 6 个月微调一个行业模型</span><br><span class="line">  ✅ 花 6 个月把反馈闭环跑到飞轮效应</span><br></pre></td></tr></table></figure><h2 id="一个思想实验"><a href="#一个思想实验" class="headerlink" title="一个思想实验"></a>一个思想实验</h2><p>假设今天有两家公司同时入场做”AI 财务审计助手”：</p><p><strong>公司 A</strong>：花 6 个月和 500 万，微调了一个审计专用模型。能力确实比 GPT-4o 强 15%。</p><p><strong>公司 B</strong>：用 GPT-4o + 好的 Prompt 工程，2 个月做出 MVP。剩下 4 个月和 500 万全部投入到客户现场，采集了 50000 条真实审计场景的反馈数据，迭代了 20 个版本的 Agent 工作流。</p><p>6 个月后，公司 B 的 Agent 在<strong>真实审计任务上的表现</strong>大概率超过公司 A——因为 B 的 Agent 见过的真实场景、踩过的真实坑、积累的真实解法，是 A 在实验室里无论如何也模拟不出来的。</p><p>更要命的是：12 个月后，当公司 A 终于开始接客户的时候，公司 B 的飞轮已经转了半年了。</p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>模型训练已经变成了系统工程。这意味着模型能力的差距在收窄，而不是拉大。当基础模型的能力越来越接近时，To B Agent 产品的竞争就会下沉到<strong>最后一公里</strong>——你的 Agent 到底能不能在客户的真实业务场景中，<strong>多快好省</strong>地把活干好。</p><p>能回答这个问题的，不是你的模型有多强，不是你的架构有多精妙，而是你有没有一个高效运转的用户反馈闭环。</p><p><strong>模型是入场券，反馈是记分牌。</strong> 别在入场券上花太多时间了——进了场，盯紧记分牌。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/enterprise/">enterprise</a>  <a href="https://hugozhu.site/tags/startup/">startup</a>  <a href="https://hugozhu.site/tags/product/">product</a>  <a href="https://hugozhu.site/tags/feedback-loop/">feedback-loop</a>  <a href="https://hugozhu.site/tags/agent-optimization/">agent-optimization</a> </p><hr><ul><li><a href="/post/2026/152-agent-security-ai-native-execution-control/">Agent安全是企业安全的新命题——用AI管AI的执行控制体系</a></li><li><a href="/post/2026/149-openclaw-remote-browser-setup/">OpenClaw使用远程浏览器——让AI读懂你的个性化互联网</a></li><li><a href="/post/2026/150-dingtalk-cli-office-skills-token-era/">当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</a></li><li><a href="/post/2026/147-autoresearch-token-optimization-paradigm/">人写规则，Token做实验：从Karpathy的autoresearch看AI应用优化新范式</a></li><li><a href="/post/2026/148-openclaw-skill-self-optimization/">自我进化的AI助手：OpenClaw如何用Heartbeat实现Skill自动优化</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/151-tob-agent-user-feedback-loop/">别再卷模型了：To B Agent 创业，用户反馈才是生死线</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/23/2026-03-23-%E5%88%AB%E5%86%8D%E5%8D%B7%E6%A8%A1%E5%9E%8B%E4%BA%86-To-B-Agent-%E5%88%9B%E4%B8%9A-%E7%94%A8%E6%88%B7%E5%8F%8D%E9%A6%88%E6%89%8D%E6%98%AF%E7%94%9F%E6%AD%BB%E7%BA%BF/</id>
    <link href="https://www.coconut.xin/2026/03/23/2026-03-23-%E5%88%AB%E5%86%8D%E5%8D%B7%E6%A8%A1%E5%9E%8B%E4%BA%86-To-B-Agent-%E5%88%9B%E4%B8%9A-%E7%94%A8%E6%88%B7%E5%8F%8D%E9%A6%88%E6%89%8D%E6%98%AF%E7%94%9F%E6%AD%BB%E7%BA%BF/"/>
    <published>2026-03-23T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%B8%80%E4%B8%AA%E8%A2%AB%E5%BF%BD%E8%A7%]]>
    </summary>
    <title>别再卷模型了：To B Agent 创业，用户反馈才是生死线</title>
    <updated>2026-03-24T01:21:20.853Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E6%95%B4%E4%BD%93%E6%9E%B6%E6%9E%84">整体架构</a></li><li><a href="#%E7%AC%AC%E4%B8%80%E6%AD%A5ubuntu-%E6%A1%8C%E9%9D%A2%E7%8E%AF%E5%A2%83%E5%87%86%E5%A4%87">第一步：Ubuntu 桌面环境准备</a></li><li><a href="#%E7%AC%AC%E4%BA%8C%E6%AD%A5tailscale-%E7%BB%84%E7%BD%91">第二步：Tailscale 组网</a></li><li><a href="#%E7%AC%AC%E4%B8%89%E6%AD%A5autossh-%E7%AB%AF%E5%8F%A3%E6%98%A0%E5%B0%84">第三步：autossh 端口映射</a></li><li><a href="#%E7%AC%AC%E5%9B%9B%E6%AD%A5%E5%90%AF%E5%8A%A8-openclaw-%E8%8A%82%E7%82%B9%E6%9C%8D%E5%8A%A1">第四步：启动 OpenClaw 节点服务</a></li><li><a href="#%E7%AC%AC%E4%BA%94%E6%AD%A5%E9%AA%8C%E8%AF%81%E8%BF%9C%E7%A8%8B%E6%B5%8F%E8%A7%88%E5%99%A8%E7%8A%B6%E6%80%81">第五步：验证远程浏览器状态</a></li><li><a href="#%E5%AE%9E%E9%99%85%E6%95%88%E6%9E%9C">实际效果</a></li><li><a href="#%E5%AE%89%E5%85%A8%E6%8F%90%E7%A4%BA">安全提示</a></li><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88%E4%B8%8D%E7%9B%B4%E6%8E%A5%E7%94%A8-tailscale-%E6%9B%BF%E4%BB%A3-autossh">为什么不直接用 Tailscale 替代 autossh？</a></li><li><a href="#%E6%80%BB%E7%BB%93">总结</a></li></ul><p>AI Agent 能搜索、能总结、能写代码，但有一件事它做不好：<strong>读你的互联网</strong>。你的 Twitter Timeline、你的 YouTube 推荐、你的 Hacker News 首页——这些个性化内容藏在登录态背后，普通的 API 调用拿不到。</p><p>OpenClaw 的远程浏览器方案解决了这个问题：在一台带桌面的 Ubuntu 服务器上运行真实浏览器，保存各大网站的登录信息，然后通过网络让 AI Agent 直接操控这个浏览器。AI 看到的就是你看到的。</p><h2 id="整体架构"><a href="#整体架构" class="headerlink" title="整体架构"></a>整体架构</h2><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">┌──────────────┐     Tailscale      ┌──────────────────┐</span><br><span class="line">│  OpenClaw    │◄──────────────────►│  Ubuntu Desktop  │</span><br><span class="line">│  Server      │    (局域网)         │  (带桌面系统)     │</span><br><span class="line">│              │                    │                  │</span><br><span class="line">│  AI Agent    │◄── autossh ───────►│  Chrome/Firefox  │</span><br><span class="line">│  (本地端口)   │    (端口映射)       │  (保存登录态)     │</span><br><span class="line">└──────────────┘                    └──────────────────┘</span><br></pre></td></tr></table></figure><p>核心思路很简单：</p><ol><li><strong>Ubuntu 桌面服务器</strong>运行真实浏览器，手动登录各大网站并保存 Cookie</li><li><strong>Tailscale</strong> 把 OpenClaw 服务器和 Ubuntu 连成局域网</li><li><strong>autossh</strong> 将 Ubuntu 上的浏览器端口映射到 OpenClaw 的本地端口</li><li>OpenClaw 的 AI Agent 通过本地端口操控远程浏览器</li></ol><h2 id="第一步：Ubuntu-桌面环境准备"><a href="#第一步：Ubuntu-桌面环境准备" class="headerlink" title="第一步：Ubuntu 桌面环境准备"></a>第一步：Ubuntu 桌面环境准备</h2><p>选一台有桌面环境的 Ubuntu 机器（物理机或虚拟机都行），确保有 X11 显示服务。可以用 VNC 或者 XRDP 远程连上去，手动打开浏览器登录你常用的网站：</p><ul><li>Google &#x2F; YouTube</li><li>Twitter &#x2F; X</li><li>GitHub</li><li>Hacker News</li><li>微信读书、知乎等中文平台</li></ul><p>登录后浏览器会保存 Cookie 和 Session，之后 AI 操控浏览器时就能直接访问个性化内容。</p><h2 id="第二步：Tailscale-组网"><a href="#第二步：Tailscale-组网" class="headerlink" title="第二步：Tailscale 组网"></a>第二步：Tailscale 组网</h2><p>在 OpenClaw 服务器和 Ubuntu 机器上分别安装 Tailscale：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># Ubuntu 和 OpenClaw 服务器上都执行</span></span><br><span class="line">curl -fsSL https://tailscale.com/install.sh | sh</span><br><span class="line"><span class="built_in">sudo</span> tailscale up</span><br></pre></td></tr></table></figure><p>安装完成后两台机器自动组成局域网，可以通过 Tailscale 分配的内网 IP 互相访问。用 <code>tailscale status</code> 确认两台机器都在线：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">tailscale status</span><br><span class="line"><span class="comment"># 100.x.x.x  openclaw-server  ...</span></span><br><span class="line"><span class="comment"># 100.x.x.x  ubuntu-desktop   ...</span></span><br></pre></td></tr></table></figure><h2 id="第三步：autossh-端口映射"><a href="#第三步：autossh-端口映射" class="headerlink" title="第三步：autossh 端口映射"></a>第三步：autossh 端口映射</h2><p>关键一步——用 autossh 将 Ubuntu 上的浏览器调试端口映射到 OpenClaw 服务器的本地端口。<strong>端口号保持一致</strong>，这样 OpenClaw 的配置不需要做任何特殊处理，就像浏览器跑在本地一样。</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 在 OpenClaw 服务器上执行</span></span><br><span class="line"><span class="comment"># 假设浏览器调试端口是 9222，Ubuntu 的 Tailscale IP 是 100.x.x.x</span></span><br><span class="line">autossh -M 0 -N -L 9222:127.0.0.1:9222 user@100.x.x.x</span><br></pre></td></tr></table></figure><p><code>-M 0</code> 禁用 autossh 自带的监控端口（依赖 SSH 自身的 keepalive），<code>-N</code> 表示不执行远程命令只做端口转发。autossh 会在连接断开时自动重连。</p><p>为了保证 autossh 隧道的稳定性，用 systemd 管理它。先在 SSH config 中配置好连接别名（避免在 systemd 中写一长串参数），然后创建 service 文件：</p><figure class="highlight ini"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># /etc/systemd/system/autossh-browser.service</span></span><br><span class="line"><span class="section">[Unit]</span></span><br><span class="line"><span class="attr">Description</span>=Stable SSH Tunnel to dev2</span><br><span class="line"><span class="attr">After</span>=network.target</span><br><span class="line"></span><br><span class="line"><span class="section">[Service]</span></span><br><span class="line"><span class="attr">User</span>=hugo</span><br><span class="line"><span class="attr">Environment</span>=<span class="string">&quot;AUTOSSH_GATETIME=0&quot;</span></span><br><span class="line"><span class="attr">ExecStart</span>=/usr/bin/autossh -M <span class="number">0</span> -N dev2</span><br><span class="line"><span class="attr">Restart</span>=always</span><br><span class="line"><span class="attr">RestartSec</span>=<span class="number">5</span></span><br><span class="line"></span><br><span class="line"><span class="section">[Install]</span></span><br><span class="line"><span class="attr">WantedBy</span>=multi-user.target</span><br></pre></td></tr></table></figure><p>其中 <code>AUTOSSH_GATETIME=0</code> 让 autossh 在首次连接失败时也会持续重试，不会直接退出。<code>dev2</code> 是 SSH config 中定义的 Host 别名，包含了目标地址、端口转发规则等配置。</p><p>安装并启动服务：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># 重新加载 systemd 配置</span></span><br><span class="line"><span class="built_in">sudo</span> systemctl daemon-reload</span><br><span class="line"></span><br><span class="line"><span class="comment"># 启用开机自启</span></span><br><span class="line"><span class="built_in">sudo</span> systemctl <span class="built_in">enable</span> autossh-browser.service</span><br><span class="line"></span><br><span class="line"><span class="comment"># 立即启动</span></span><br><span class="line"><span class="built_in">sudo</span> systemctl start autossh-browser.service</span><br><span class="line"></span><br><span class="line"><span class="comment"># 检查运行状态</span></span><br><span class="line"><span class="built_in">sudo</span> systemctl status autossh-browser.service</span><br></pre></td></tr></table></figure><p>确认状态为 <code>active (running)</code> 即可。如果需要排查问题，用 <code>journalctl -u autossh-browser.service -f</code> 查看实时日志。</p><h2 id="第四步：启动-OpenClaw-节点服务"><a href="#第四步：启动-OpenClaw-节点服务" class="headerlink" title="第四步：启动 OpenClaw 节点服务"></a>第四步：启动 OpenClaw 节点服务</h2><p>在 Ubuntu 上用 <code>start_node.sh</code> 脚本启动 OpenClaw 节点。这个脚本做了三件事：启动节点、监控进程、健康检查自动重启。</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br><span class="line">36</span><br><span class="line">37</span><br><span class="line">38</span><br><span class="line">39</span><br><span class="line">40</span><br><span class="line">41</span><br><span class="line">42</span><br><span class="line">43</span><br><span class="line">44</span><br><span class="line">45</span><br><span class="line">46</span><br><span class="line">47</span><br><span class="line">48</span><br><span class="line">49</span><br><span class="line">50</span><br><span class="line">51</span><br><span class="line">52</span><br><span class="line">53</span><br><span class="line">54</span><br><span class="line">55</span><br><span class="line">56</span><br><span class="line">57</span><br></pre></td><td class="code"><pre><span class="line"><span class="meta">#!/usr/bin/env bash</span></span><br><span class="line"><span class="comment"># start_node.sh - OpenClaw 节点启动与守护脚本</span></span><br><span class="line"></span><br><span class="line"><span class="built_in">set</span> -e</span><br><span class="line"></span><br><span class="line">HOST=<span class="string">&quot;openclaw.hugozhu.site&quot;</span></span><br><span class="line">PORT=443</span><br><span class="line"></span><br><span class="line">DISPLAY=<span class="string">&quot;:10.0&quot;</span></span><br><span class="line">NAME=<span class="string">&quot;hho-dev1&quot;</span></span><br><span class="line">LOG_FILE=<span class="string">&quot;./openclaw.log&quot;</span></span><br><span class="line">PID_FILE=<span class="string">&quot;./openclaw.pid&quot;</span></span><br><span class="line"></span><br><span class="line"><span class="built_in">export</span> DISPLAY=<span class="variable">$DISPLAY</span></span><br><span class="line"></span><br><span class="line"><span class="function"><span class="title">start_node</span></span>() &#123;</span><br><span class="line">  <span class="built_in">echo</span> <span class="string">&quot;<span class="subst">$(date)</span> - Starting OpenClaw...&quot;</span> | <span class="built_in">tee</span> -a <span class="variable">$LOG_FILE</span></span><br><span class="line">  openclaw node run \</span><br><span class="line">    --tls \</span><br><span class="line">    --host <span class="variable">$HOST</span> \</span><br><span class="line">    --port <span class="variable">$PORT</span> \</span><br><span class="line">    --display-name <span class="variable">$NAME</span> \</span><br><span class="line">    &gt;&gt; <span class="variable">$LOG_FILE</span> 2&gt;&amp;1 &amp;</span><br><span class="line"></span><br><span class="line">  <span class="built_in">echo</span> $! &gt; <span class="variable">$PID_FILE</span></span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="function"><span class="title">is_running</span></span>() &#123;</span><br><span class="line">  <span class="keyword">if</span> [ -f <span class="variable">$PID_FILE</span> ]; <span class="keyword">then</span></span><br><span class="line">    PID=$(<span class="built_in">cat</span> <span class="variable">$PID_FILE</span>)</span><br><span class="line">    <span class="keyword">if</span> ps -p <span class="variable">$PID</span> &gt; /dev/null 2&gt;&amp;1; <span class="keyword">then</span></span><br><span class="line">      <span class="built_in">return</span> 0</span><br><span class="line">    <span class="keyword">fi</span></span><br><span class="line">  <span class="keyword">fi</span></span><br><span class="line">  <span class="built_in">return</span> 1</span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="function"><span class="title">health_check</span></span>() &#123;</span><br><span class="line">  openclaw browser status &gt; /dev/null 2&gt;&amp;1</span><br><span class="line">&#125;</span><br><span class="line"></span><br><span class="line"><span class="keyword">while</span> <span class="literal">true</span>; <span class="keyword">do</span></span><br><span class="line">  <span class="keyword">if</span> ! is_running; <span class="keyword">then</span></span><br><span class="line">    start_node</span><br><span class="line">  <span class="keyword">fi</span></span><br><span class="line"></span><br><span class="line">  <span class="built_in">sleep</span> 5</span><br><span class="line"></span><br><span class="line">  <span class="keyword">if</span> ! health_check; <span class="keyword">then</span></span><br><span class="line">    <span class="built_in">echo</span> <span class="string">&quot;<span class="subst">$(date)</span> - Health check failed, restarting...&quot;</span> | <span class="built_in">tee</span> -a <span class="variable">$LOG_FILE</span></span><br><span class="line">    <span class="built_in">kill</span> $(<span class="built_in">cat</span> <span class="variable">$PID_FILE</span>) 2&gt;/dev/null || <span class="literal">true</span></span><br><span class="line">    <span class="built_in">rm</span> -f <span class="variable">$PID_FILE</span></span><br><span class="line">  <span class="keyword">fi</span></span><br><span class="line"></span><br><span class="line">  <span class="built_in">sleep</span> 10</span><br><span class="line"><span class="keyword">done</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>几个关键点：</p><ul><li><strong><code>DISPLAY=&quot;:10.0&quot;</code></strong>：指定 X11 显示器，让浏览器知道在哪个桌面上渲染</li><li><strong><code>--tls</code></strong>：通过 TLS 安全连接到 OpenClaw 中心服务</li><li><strong><code>--display-name</code></strong>：给节点起个名字，方便在控制台识别</li><li><strong>健康检查循环</strong>：每 15 秒检查一次，进程挂了自动拉起，浏览器不响应自动重启</li></ul><h2 id="第五步：验证远程浏览器状态"><a href="#第五步：验证远程浏览器状态" class="headerlink" title="第五步：验证远程浏览器状态"></a>第五步：验证远程浏览器状态</h2><p>在 OpenClaw 服务器上检查远程浏览器是否正常工作：</p><figure class="highlight bash"><table><tr><td class="gutter"><pre><span class="line">1</span><br></pre></td><td class="code"><pre><span class="line">openclaw browser status</span><br></pre></td></tr></table></figure><p>如果一切正常，你会看到浏览器节点的连接状态、可用页面等信息。此时 AI Agent 就可以通过 OpenClaw 操控远程浏览器了。</p><h2 id="实际效果"><a href="#实际效果" class="headerlink" title="实际效果"></a>实际效果</h2><p>配置完成后，你可以让 AI Agent 做这些事：</p><ul><li><strong>阅读个性化推荐</strong>：打开 YouTube 首页，总结今天的推荐视频</li><li><strong>追踪社交动态</strong>：浏览 Twitter Timeline，提炼关键信息</li><li><strong>深度阅读</strong>：打开微信读书中收藏的文章，做笔记和摘要</li><li><strong>监控信息源</strong>：定时检查 Hacker News、GitHub Trending</li></ul><p>这比传统的 API 抓取强大得多——AI 看到的就是你登录后看到的完整页面，包括个性化推荐、私有内容、需要认证的页面。</p><h2 id="安全提示"><a href="#安全提示" class="headerlink" title="安全提示"></a>安全提示</h2><p>远程浏览器保存了你的登录态，需要注意安全：</p><ul><li>Tailscale 提供了端到端加密，网络层是安全的</li><li>Ubuntu 机器本身要做好防护：强密码、SSH 密钥登录、防火墙</li><li>定期检查浏览器的 Session，清理不再需要的登录态</li><li>建议为 AI 浏览器使用独立的账号，与你的主力账号隔离</li></ul><h2 id="为什么不直接用-Tailscale-替代-autossh？"><a href="#为什么不直接用-Tailscale-替代-autossh？" class="headerlink" title="为什么不直接用 Tailscale 替代 autossh？"></a>为什么不直接用 Tailscale 替代 autossh？</h2><p>你可能会问：两台机器已经在同一个 Tailscale 网络里，OpenClaw 能不能直接通过 Tailscale IP 访问 Ubuntu 上的浏览器端口，省掉 autossh 这一层？</p><p>理论上可以——只要浏览器监听地址从默认的 <code>127.0.0.1</code> 改为 <code>0.0.0.0</code>，Tailscale IP 就能直接访问。但实际上 <strong>OpenClaw 只认 localhost</strong>，它连接浏览器时固定使用 <code>127.0.0.1</code>，不支持配置远程地址。所以我们仍然需要 autossh 把远程端口映射到本地。</p><p>这也是为什么前面强调「端口号保持一致」——autossh 把远程的端口原样映射到本地同一端口，对 OpenClaw 来说浏览器就像跑在本地一样，零配置。</p><p>最终的分工很清晰：<strong>Tailscale 负责网络连通和加密，autossh 负责端口映射到 localhost</strong>，各司其职。</p><h2 id="总结"><a href="#总结" class="headerlink" title="总结"></a>总结</h2><p>远程浏览器是 AI Agent 能力的一个重要补充。通过 Tailscale 组网 + autossh 端口映射这套方案，你可以在不暴露任何端口到公网的情况下，让 AI 安全地访问你的个性化互联网。整个方案的维护成本很低——一台闲置的 Ubuntu 机器（甚至可以是树莓派加桌面环境）就够了。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/openclaw/">OpenClaw</a>  <a href="https://hugozhu.site/tags/tailscale/">Tailscale</a>  <a href="https://hugozhu.site/tags/raspberry-pi/">Raspberry-Pi</a>  <a href="https://hugozhu.site/tags/browser/">browser</a>  <a href="https://hugozhu.site/tags/infrastructure/">infrastructure</a> </p><hr><ul><li><a href="/post/2026/151-tob-agent-user-feedback-loop/">别再卷模型了：To B Agent 创业，用户反馈才是生死线</a></li><li><a href="/post/2026/150-dingtalk-cli-office-skills-token-era/">当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</a></li><li><a href="/post/2026/147-autoresearch-token-optimization-paradigm/">人写规则，Token做实验：从Karpathy的autoresearch看AI应用优化新范式</a></li><li><a href="/post/2026/148-openclaw-skill-self-optimization/">自我进化的AI助手：OpenClaw如何用Heartbeat实现Skill自动优化</a></li><li><a href="/post/2026/146-wukong-taobao-of-ai-token-economy/">悟空是AI时代的淘宝：Token消费的多快好省</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/149-openclaw-remote-browser-setup/">OpenClaw使用远程浏览器——让AI读懂你的个性化互联网</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/22/2026-03-22-OpenClaw%E4%BD%BF%E7%94%A8%E8%BF%9C%E7%A8%8B%E6%B5%8F%E8%A7%88%E5%99%A8--%E8%AE%A9AI%E8%AF%BB%E6%87%82%E4%BD%A0%E7%9A%84%E4%B8%AA%E6%80%A7%E5%8C%96%E4%BA%92%E8%81%94%E7%BD%91/</id>
    <link href="https://www.coconut.xin/2026/03/22/2026-03-22-OpenClaw%E4%BD%BF%E7%94%A8%E8%BF%9C%E7%A8%8B%E6%B5%8F%E8%A7%88%E5%99%A8--%E8%AE%A9AI%E8%AF%BB%E6%87%82%E4%BD%A0%E7%9A%84%E4%B8%AA%E6%80%A7%E5%8C%96%E4%BA%92%E8%81%94%E7%BD%91/"/>
    <published>2026-03-22T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E6%95%B4%E4%BD%93%E6%9E%B6%E6%9E%84">整体架构<]]>
    </summary>
    <title>OpenClaw使用远程浏览器——让AI读懂你的个性化互联网</title>
    <updated>2026-03-24T01:21:21.618Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%BB%8E-api-%E5%88%B0-cli%E4%B8%80%E6%AC%A1%E8%B4%A8%E5%8F%98">从 API 到 CLI：一次质变</a></li><li><a href="#skill%E5%8A%9E%E5%85%AC%E5%8D%8F%E5%90%8C%E7%9A%84%E6%9C%80%E5%B0%8F%E5%8F%AF%E4%BA%A4%E4%BB%98%E5%8D%95%E5%85%83">Skill：办公协同的最小可交付单元</a></li><li><a href="#%E4%B8%BA%E4%BB%80%E4%B9%88-skill-%E6%AF%94%E5%AE%9A%E5%88%B6%E8%BD%AF%E4%BB%B6%E6%9B%B4%E6%9C%89%E6%83%B3%E8%B1%A1%E5%8A%9B">为什么 Skill 比定制软件更有想象力</a><ul><li><a href="#1-%E7%BB%84%E5%90%88%E7%88%86%E7%82%B811-%E8%BF%9C%E5%A4%A7%E4%BA%8E-2">1. 组合爆炸：1+1 远大于 2</a></li><li><a href="#2-%E4%B8%AA%E6%80%A7%E5%8C%96%E7%9A%84%E8%BE%B9%E9%99%85%E6%88%90%E6%9C%AC%E8%B6%8B%E8%BF%91%E4%BA%8E%E9%9B%B6">2. 个性化的边际成本趋近于零</a></li><li><a href="#3-%E8%87%AA%E7%84%B6%E8%AF%AD%E8%A8%80%E5%8D%B3%E6%8E%A5%E5%8F%A3">3. 自然语言即接口</a></li></ul></li><li><a href="#%E4%B8%80%E4%B8%AA%E7%9C%9F%E5%AE%9E%E7%9A%84%E4%BD%BF%E7%94%A8%E5%9C%BA%E6%99%AF">一个真实的使用场景</a></li><li><a href="#token-%E4%BA%A4%E4%BB%98%E7%9A%84%E7%BB%8F%E6%B5%8E%E5%AD%A6">Token 交付的经济学</a></li><li><a href="#%E6%9B%B4%E5%A4%A7%E7%9A%84%E5%9B%BE%E6%99%AF%E5%8A%9E%E5%85%AC%E5%8D%8F%E5%90%8C%E7%9A%84-skill-%E7%94%9F%E6%80%81">更大的图景：办公协同的 Skill 生态</a></li><li><a href="#%E8%BD%AF%E4%BB%B6%E7%9A%84%E7%BB%88%E5%B1%80%E4%BB%8E%E4%BA%A7%E5%93%81%E5%88%B0%E6%8A%80%E8%83%BD">软件的终局：从产品到技能</a></li></ul><p>软件行业有一个永恒的矛盾：<strong>标准化产品满足不了个性化需求，定制开发又贵得离谱</strong>。每家企业都想要”适合自己的办公系统”，但 SaaS 只能给你 80% 的功能，剩下 20% 要么忍着，要么花十倍的钱去定制。</p><p>钉钉的 CLI 化开放正在改变这个游戏规则。当钉钉的消息、日历、审批、文档、通讯录等能力都可以通过命令行接口被 AI Agent 直接调用时，一个新范式浮现了：<strong>过去需要写代码、做定制、走项目的办公需求，现在可以用自然语言描述，由 AI 用 Token 来交付。</strong></p><h2 id="从-API-到-CLI：一次质变"><a href="#从-API-到-CLI：一次质变" class="headerlink" title="从 API 到 CLI：一次质变"></a>从 API 到 CLI：一次质变</h2><p>钉钉一直有 API，但 API 面向的是开发者。你要写代码、要调试、要部署、要维护——这些门槛把 99% 的办公需求挡在了门外。</p><p>CLI 化不一样。CLI 是 AI Agent 的母语。</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line"># AI Agent 眼中的钉钉操作</span><br><span class="line">dingtalk message send --to &quot;张三&quot; --text &quot;周报已提交，请查收&quot;</span><br><span class="line">dingtalk calendar create --title &quot;产品评审&quot; --time &quot;2026-03-25 14:00&quot; --attendees &quot;产品组&quot;</span><br><span class="line">dingtalk approval submit --template &quot;请假申请&quot; --reason &quot;年假&quot; --days 3</span><br><span class="line">dingtalk doc search --keyword &quot;Q1 OKR&quot; --space &quot;产品部&quot;</span><br><span class="line"># generated by hugo&#x27;s coding agent</span><br></pre></td></tr></table></figure><p>当这些操作变成标准化的命令行接口，AI Agent 就可以像人一样在钉钉里”办公”——收发消息、安排日程、提交审批、搜索文档、管理待办。<strong>不需要任何代码，不需要任何部署，只需要一条自然语言指令。</strong></p><h2 id="Skill：办公协同的最小可交付单元"><a href="#Skill：办公协同的最小可交付单元" class="headerlink" title="Skill：办公协同的最小可交付单元"></a>Skill：办公协同的最小可交付单元</h2><p>在 AI Agent 的世界里，一个 Skill 就是一组能力的封装。比如”钉钉消息”这个 Skill：</p><figure class="highlight yaml"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># dingtalk-messaging skill</span></span><br><span class="line"><span class="attr">name:</span> <span class="string">dingtalk-messaging</span></span><br><span class="line"><span class="attr">description:</span> <span class="string">收发钉钉消息、查看聊天记录、搜索联系人和会话</span></span><br><span class="line"><span class="attr">triggers:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">&quot;发消息&quot;</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">&quot;查消息&quot;</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">&quot;聊天记录&quot;</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">&quot;搜索联系人&quot;</span></span><br><span class="line"><span class="attr">capabilities:</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">发送文本/富文本/卡片消息</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">查看最近会话和未读消息</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">搜索联系人和群组</span></span><br><span class="line">  <span class="bullet">-</span> <span class="string">读取聊天历史记录</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><p>这个 Skill 不是一个需要安装的软件，不是一个需要配置的服务，它只是一段描述——告诉 AI Agent “你能做什么、怎么做、什么时候该做”。Agent 拿到这段描述，结合钉钉 CLI 的能力，就能在实际对话中自主完成任务。</p><p>这就是<strong>Token 交付</strong>的含义：你不再需要交付一个软件产品，你只需要交付一段 Prompt 和几个工具定义。</p><h2 id="为什么-Skill-比定制软件更有想象力"><a href="#为什么-Skill-比定制软件更有想象力" class="headerlink" title="为什么 Skill 比定制软件更有想象力"></a>为什么 Skill 比定制软件更有想象力</h2><h3 id="1-组合爆炸：1-1-远大于-2"><a href="#1-组合爆炸：1-1-远大于-2" class="headerlink" title="1. 组合爆炸：1+1 远大于 2"></a>1. 组合爆炸：1+1 远大于 2</h3><p>单个 Skill 的价值有限。但当多个 Skill 组合在一起，想象空间呈指数级膨胀：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">用户：帮我看看今天有哪些未读消息，如果有需要我审批的，直接帮我处理</span><br><span class="line"></span><br><span class="line">Agent 内部执行链：</span><br><span class="line">  dingtalk-messaging → 获取未读消息</span><br><span class="line">  dingtalk-workspace → 检查待审批事项</span><br><span class="line">  dingtalk-workspace → 自动审批符合规则的申请</span><br><span class="line">  dingtalk-messaging → 回复发起人&quot;已审批&quot;</span><br></pre></td></tr></table></figure><p>这个场景如果用传统方式实现，需要：前端界面设计、后端逻辑编写、审批规则引擎、消息通知系统、测试部署上线——一个小团队干一个月。</p><p><strong>用 Skill？Agent 当场就能做。</strong> 而且下次你想改规则——“金额超过 5000 的不要自动审批”——只需要说一句话。</p><h3 id="2-个性化的边际成本趋近于零"><a href="#2-个性化的边际成本趋近于零" class="headerlink" title="2. 个性化的边际成本趋近于零"></a>2. 个性化的边际成本趋近于零</h3><p>传统办公软件的个性化困境：</p><p>需求</p><p>传统方式</p><p>Token 交付方式</p><p>“每周五下午自动汇总本周群消息要点”</p><p>开发一个定时任务 + NLP 摘要服务</p><p>一条 Cron 指令 + 消息 Skill</p><p>“新人入职时自动拉入相关群并发送欢迎消息”</p><p>HR 系统对接 + 钉钉开放平台开发</p><p>一个 HR 事件触发的 Skill 组合</p><p>“把审批流程里的关键节点同步到项目管理看板”</p><p>Webhook + 数据映射 + 前端展示</p><p>Agent 实时监听 + 跨 Skill 联动</p><p>每一个个性化需求，在传统模式下都是一个”小项目”。在 Token 交付模式下，只是 Agent 的一次对话。</p><h3 id="3-自然语言即接口"><a href="#3-自然语言即接口" class="headerlink" title="3. 自然语言即接口"></a>3. 自然语言即接口</h3><p>最深刻的变化是：<strong>用户不再需要学习任何界面</strong>。</p><p>过去，每个办公工具都有自己的界面、自己的操作逻辑、自己的学习曲线。钉钉的审批怎么提？文档在哪里搜？日程怎么创建？每个功能都需要点来点去。</p><p>现在，所有操作都收敛到一个统一的入口——<strong>对话</strong>。你只需要说你想做什么，Agent 来替你操作。这不是”语音助手”那种浅层的语音转按钮，而是 Agent 真正理解你的意图，自主规划执行路径，调用多个工具协同完成任务。</p><h2 id="一个真实的使用场景"><a href="#一个真实的使用场景" class="headerlink" title="一个真实的使用场景"></a>一个真实的使用场景</h2><p>我在 OpenClaw 中配置了钉钉消息和工作台的 Skill。一个典型的早晨是这样的：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br></pre></td><td class="code"><pre><span class="line">我：早上好，帮我看看今天有什么要处理的</span><br><span class="line"></span><br><span class="line">Agent：</span><br><span class="line">  早上好！我帮你整理了今天的待办：</span><br><span class="line"></span><br><span class="line">  📬 未读消息（3 条重要）：</span><br><span class="line">  1. 产品组-李明：Q2 规划文档已更新，需要你 review</span><br><span class="line">  2. 技术部-王强：线上 P2 问题已修复，需要你确认</span><br><span class="line">  3. HR-赵敏：年度 360 评估截止今天</span><br><span class="line"></span><br><span class="line">  📋 待审批（2 条）：</span><br><span class="line">  1. 张三的差旅报销 ¥3,200 — 符合标准</span><br><span class="line">  2. 李四的服务器采购 ¥45,000 — 超出部门预算</span><br><span class="line"></span><br><span class="line">  📅 今日日程：</span><br><span class="line">  - 10:00 产品周会（已准备好上周会议纪要）</span><br><span class="line">  - 14:00 技术评审（关联文档已打开）</span><br><span class="line">  - 16:00 1:1 与 CTO</span><br><span class="line"></span><br><span class="line">  建议：张三的报销可以直接审批，李四的采购需要你确认。</span><br><span class="line">  要我先处理报销审批吗？</span><br></pre></td></tr></table></figure><p>这个交互背后，Agent 调用了消息查询、审批列表、日历读取、文档搜索四个 Skill。没有任何一个传统软件能在一个界面里做到这种程度的信息聚合和智能排序。</p><h2 id="Token-交付的经济学"><a href="#Token-交付的经济学" class="headerlink" title="Token 交付的经济学"></a>Token 交付的经济学</h2><p>让我们算一笔账。</p><p>一个中等复杂度的办公定制需求（比如”自动汇总每日审批并发送日报”）：</p><ul><li><strong>传统定制开发</strong>：2 个开发人员 × 2 周 &#x3D; 约 ¥60,000</li><li><strong>低代码平台</strong>：配置 + 调试 + 维护 ≈ ¥10,000&#x2F;年</li><li><strong>Token 交付</strong>：Skill 定义 + Agent 每日执行 ≈ ¥0.5&#x2F;天 × 365 &#x3D; ¥182&#x2F;年</li></ul><p>而且 Token 交付的方案有一个传统方案做不到的优势：<strong>需求变更成本为零</strong>。老板说”加上周末的数据”？说一句话就行。“不要发给我了，发到群里”？再说一句话。</p><h2 id="更大的图景：办公协同的-Skill-生态"><a href="#更大的图景：办公协同的-Skill-生态" class="headerlink" title="更大的图景：办公协同的 Skill 生态"></a>更大的图景：办公协同的 Skill 生态</h2><p>当钉钉把自己的能力 CLI 化，它实际上在做一件更大的事：<strong>为 AI Agent 时代构建办公协同的 Skill 生态基础设施</strong>。</p><p>想象一下未来的场景：</p><ol><li><strong>Skill 市场</strong>：开发者不再开发”钉钉应用”，而是发布”办公 Skill”——一段精心编写的 Prompt + 工具定义，标价 ¥9.9&#x2F;月</li><li><strong>Skill 组合器</strong>：用户可以像搭积木一样组合不同的 Skill——“消息摘要 + 待办提醒 + 审批助手”形成自己的个性化办公 Agent</li><li><strong>Skill 自进化</strong>：参照 <a href="/post/2026/148-openclaw-skill-self-optimization/">OpenClaw 的 Skill 自优化机制</a>，办公 Skill 可以根据你的使用习惯自我迭代——越用越懂你</li></ol><p>这不是科幻。钉钉 CLI 化开放，加上 AI Agent 框架的成熟，所有技术组件都已就位。</p><h2 id="软件的终局：从产品到技能"><a href="#软件的终局：从产品到技能" class="headerlink" title="软件的终局：从产品到技能"></a>软件的终局：从产品到技能</h2><p>回看软件行业的发展历程：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">大型机时代：软件 = 定制项目（百万级，按年交付）</span><br><span class="line">    ↓</span><br><span class="line">PC 时代：软件 = 套装产品（千元级，买断制）</span><br><span class="line">    ↓</span><br><span class="line">云时代：软件 = SaaS 服务（百元级/月，订阅制）</span><br><span class="line">    ↓</span><br><span class="line">AI 时代：软件 = Skill 技能（Token 级，按用交付）</span><br></pre></td></tr></table></figure><p>每一次跃迁，交付的颗粒度都在变小，个性化的成本都在降低。到了 Skill 这一层，<strong>交付的已经不是一个”产品”，而是一种”能力”</strong>。这种能力可以被 Agent 随时调用、自由组合、动态适配——这才是真正意义上的”按需使用”。</p><p>钉钉的 CLI 化开放，正站在这个历史转折点上。当企业办公的核心能力都可以被 AI Agent 通过标准接口调用时，我们离”每个员工都有一个懂自己的 AI 助手”就只差最后一步了——那就是足够多、足够好的办公协同 Skill。</p><p><strong>这片市场，太有想象力了。</strong></p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/dingtalk/">DingTalk</a>  <a href="https://hugozhu.site/tags/%E9%92%89%E9%92%89/">钉钉</a>  <a href="https://hugozhu.site/tags/office-automation/">office-automation</a>  <a href="https://hugozhu.site/tags/skill/">skill</a>  <a href="https://hugozhu.site/tags/enterprise/">enterprise</a>  <a href="https://hugozhu.site/tags/openclaw/">OpenClaw</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/150-dingtalk-cli-office-skills-token-era/">当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/22/2026-03-22-%E5%BD%93%E9%92%89%E9%92%89%E5%8F%98%E6%88%90%E5%91%BD%E4%BB%A4%E8%A1%8C-%E5%8A%9E%E5%85%AC%E5%8D%8F%E5%90%8C-Skill-%E7%9A%84-Token-%E4%BA%A4%E4%BB%98%E6%97%B6%E4%BB%A3/</id>
    <link href="https://www.coconut.xin/2026/03/22/2026-03-22-%E5%BD%93%E9%92%89%E9%92%89%E5%8F%98%E6%88%90%E5%91%BD%E4%BB%A4%E8%A1%8C-%E5%8A%9E%E5%85%AC%E5%8D%8F%E5%90%8C-Skill-%E7%9A%84-Token-%E4%BA%A4%E4%BB%98%E6%97%B6%E4%BB%A3/"/>
    <published>2026-03-22T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%BB%8E-api-%E5%88%B0-cli%E4%B8%80%E6%AC%]]>
    </summary>
    <title>当钉钉变成命令行：办公协同 Skill 的 Token 交付时代</title>
    <updated>2026-04-01T02:01:50.255Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#autoresearch-%E7%9A%84%E6%A0%B8%E5%BF%83%E6%96%B9%E6%B3%95%E8%AE%BA">autoresearch 的核心方法论</a></li><li><a href="#%E8%BF%99%E4%B8%AA%E8%8C%83%E5%BC%8F%E4%B8%BA%E4%BB%80%E4%B9%88%E8%83%BD-work">这个范式为什么能 Work？</a></li><li><a href="#%E4%B8%BE%E4%B8%80%E5%8F%8D%E4%B8%89ai-%E5%AE%A2%E6%9C%8D-prompt-%E8%87%AA%E5%8A%A8%E4%BC%98%E5%8C%96">举一反三：AI 客服 Prompt 自动优化</a><ul><li><a href="#%E7%BB%93%E6%9E%84%E5%90%8C%E6%9E%84">结构同构</a></li><li><a href="#%E4%BA%94%E4%B8%AA%E6%9D%A1%E4%BB%B6%E9%80%90%E6%9D%A1%E9%AA%8C%E8%AF%81">五个条件逐条验证</a></li><li><a href="#%E5%AE%9E%E7%8E%B0%E6%9E%B6%E6%9E%84">实现架构</a></li><li><a href="#programmd-%E7%A4%BA%E4%BE%8B">program.md 示例</a></li></ul></li><li><a href="#%E6%9B%B4%E6%B7%B1%E4%B8%80%E5%B1%82%E8%BF%99%E4%B8%AA%E8%8C%83%E5%BC%8F%E7%9A%84%E6%9C%AC%E8%B4%A8%E6%98%AF%E4%BB%80%E4%B9%88">更深一层：这个范式的本质是什么？</a></li><li><a href="#%E9%80%82%E7%94%A8%E5%9C%BA%E6%99%AF%E5%88%A4%E6%96%AD%E6%A1%86%E6%9E%B6">适用场景判断框架</a></li><li><a href="#%E9%AB%98%E9%80%82%E9%85%8D%E5%9C%BA%E6%99%AF%E4%B8%BE%E4%BE%8B">高适配场景举例</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>Karpathy 在 2026 年 3 月开源了 <a href="https://github.com/karpathy/autoresearch">autoresearch</a>，两周内收获近 5 万 Star。项目本身很简单——让 AI Agent 自动修改 LLM 训练代码、跑实验、看指标、保留好的、丢弃差的，一夜循环 100 轮。但简单的背后藏着一个深刻的范式转移：<strong>在 AI 时代，人的角色从”做实验的人”变成了”设计实验规则的人”，而试错循环本身，交给 Token 去完成。</strong></p><p>这不只是 AI 研究的事。任何可以量化评估、快速迭代的业务场景，都可以套用这个范式。</p><h2 id="autoresearch-的核心方法论"><a href="#autoresearch-的核心方法论" class="headerlink" title="autoresearch 的核心方法论"></a>autoresearch 的核心方法论</h2><p>先看 Karpathy 做了什么。整个项目只有三个核心文件：</p><p>文件</p><p>角色</p><p>谁来修改</p><p><code>prepare.py</code></p><p>数据准备 + 评估工具</p><p>不修改</p><p><code>train.py</code></p><p>模型 + 优化器 + 训练循环</p><p><strong>AI Agent</strong></p><p><code>program.md</code></p><p>Agent 的行为指令</p><p><strong>人类</strong></p><p>每轮实验的流程：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br></pre></td><td class="code"><pre><span class="line">Agent 读取 program.md（人定义的策略）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">Agent 修改 train.py（提出一个假设）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">训练 5 分钟（固定时间预算）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">评估 val_bpb（固定指标）</span><br><span class="line">    │</span><br><span class="line">    ├─ 指标提升 → 保留修改</span><br><span class="line">    └─ 指标下降 → 回滚</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">记录实验日志 → 开始下一轮</span><br></pre></td></tr></table></figure><p>一夜下来，大约 100 轮实验，相当于一个研究员一两周的手动调参工作量。</p><h2 id="这个范式为什么能-Work？"><a href="#这个范式为什么能-Work？" class="headerlink" title="这个范式为什么能 Work？"></a>这个范式为什么能 Work？</h2><p>抽象来看，autoresearch 能成立需要<strong>五个前提条件</strong>：</p><p><strong>1. 指标可量化且低噪声。</strong> <code>val_bpb</code>（验证集上的 bits per byte）是确定性的数学量，跑同样的配置会得到几乎相同的结果。不需要人类判断”好不好”。</p><p><strong>2. 反馈循环极快。</strong> 每轮只要 5 分钟，Agent 不需要等人审批，不需要等市场反馈，改完立刻知道结果。</p><p><strong>3. 搜索空间有约束。</strong> Agent 只能改 <code>train.py</code> 一个文件，不是漫无目的地改整个系统。约束让搜索高效。</p><p><strong>4. 变异是”智能”的。</strong> 和随机搜索不同，LLM 理解代码语义。它不会把 <code>learning_rate</code> 改成负数——它会基于实验日志推理”上一轮加大 batch size 有效，这轮试试配合降低学习率”。</p><p><strong>5. 实验成本低且可逆。</strong> 一块 GPU 的电费，改坏了回滚 <code>git checkout</code> 就行。没有外部副作用。</p><p>这五个条件构成了一个判断框架：<strong>你的业务场景满足几条，就有多大的可能性套用这个范式。</strong></p><h2 id="举一反三：AI-客服-Prompt-自动优化"><a href="#举一反三：AI-客服-Prompt-自动优化" class="headerlink" title="举一反三：AI 客服 Prompt 自动优化"></a>举一反三：AI 客服 Prompt 自动优化</h2><p>外呼话术看似可以套用，但仔细检验发现有硬伤——实验对象是真人客户，每通电话都是不可逆的品牌接触，而且转化率噪声极大（同样的话术，遇到不同客户结果完全不同）。五个条件只满足两三个。</p><p>但有一个场景<strong>几乎完美满足全部五个条件</strong>：<strong>AI 客服系统的 System Prompt 自动优化。</strong></p><h3 id="结构同构"><a href="#结构同构" class="headerlink" title="结构同构"></a>结构同构</h3><p>autoresearch</p><p>AI 客服 Prompt 优化</p><p><code>prepare.py</code> — 评估数据集</p><p>标注好的客户问题集 + 标准答案</p><p><code>train.py</code> — 被修改的代码</p><p>System Prompt + Few-shot 示例</p><p><code>program.md</code> — 人定义策略</p><p>优化方向和合规红线</p><p><code>val_bpb</code> — 评估指标</p><p>准确率 &#x2F; 解决率 &#x2F; 幻觉率</p><p>5 分钟跑一轮</p><p>30 秒跑一轮（几百条测试 case）</p><h3 id="五个条件逐条验证"><a href="#五个条件逐条验证" class="headerlink" title="五个条件逐条验证"></a>五个条件逐条验证</h3><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br></pre></td><td class="code"><pre><span class="line">✅ 指标可量化且低噪声</span><br><span class="line">   temperature=0 时，同一 prompt + 同一问题 = 高度稳定的输出</span><br><span class="line">   用 LLM-as-Judge 自动评分，无需人工</span><br><span class="line"></span><br><span class="line">✅ 反馈循环极快</span><br><span class="line">   跑 500 条测试 case 只需 30-60 秒</span><br><span class="line">   一夜可以跑 500+ 轮迭代</span><br><span class="line"></span><br><span class="line">✅ 搜索空间有约束</span><br><span class="line">   只改一个文件：system_prompt.txt</span><br><span class="line"></span><br><span class="line">✅ 变异是智能的</span><br><span class="line">   LLM 天然理解自然语言，改 prompt 比改代码更在行</span><br><span class="line"></span><br><span class="line">✅ 实验成本低且完全可逆</span><br><span class="line">   成本 = API token 费用（几美分/轮）</span><br><span class="line">   零外部性：不接触真实客户，改坏了回滚即可</span><br></pre></td></tr></table></figure><h3 id="实现架构"><a href="#实现架构" class="headerlink" title="实现架构"></a>实现架构</h3><figure class="highlight python"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br><span class="line">36</span><br><span class="line">37</span><br><span class="line">38</span><br><span class="line">39</span><br></pre></td><td class="code"><pre><span class="line"><span class="comment"># prompt_autoresearch.py — 核心循环（伪代码）</span></span><br><span class="line"></span><br><span class="line"><span class="keyword">import</span> json</span><br><span class="line"></span><br><span class="line"><span class="keyword">def</span> <span class="title function_">run_experiment</span>(<span class="params">current_prompt, eval_dataset, agent</span>):</span><br><span class="line">    <span class="comment"># 1. Agent 提出修改假设</span></span><br><span class="line">    hypothesis = agent.propose_change(</span><br><span class="line">        current_prompt=current_prompt,</span><br><span class="line">        experiment_log=load_log(),  <span class="comment"># 历史实验记录</span></span><br><span class="line">        strategy=load_file(<span class="string">&quot;program.md&quot;</span>)  <span class="comment"># 人定义的优化方向</span></span><br><span class="line">    )</span><br><span class="line"></span><br><span class="line">    <span class="comment"># 2. Agent 修改 prompt</span></span><br><span class="line">    new_prompt = agent.apply_change(current_prompt, hypothesis)</span><br><span class="line"></span><br><span class="line">    <span class="comment"># 3. 跑评估</span></span><br><span class="line">    scores = []</span><br><span class="line">    <span class="keyword">for</span> <span class="keyword">case</span> <span class="keyword">in</span> eval_dataset:</span><br><span class="line">        response = llm.chat(system=new_prompt, user=<span class="keyword">case</span>[<span class="string">&quot;question&quot;</span>])</span><br><span class="line">        score = judge.evaluate(</span><br><span class="line">            response=response,</span><br><span class="line">            expected=<span class="keyword">case</span>[<span class="string">&quot;expected_answer&quot;</span>],</span><br><span class="line">            criteria=<span class="keyword">case</span>.get(<span class="string">&quot;criteria&quot;</span>, <span class="string">&quot;accuracy&quot;</span>)</span><br><span class="line">        )</span><br><span class="line">        scores.append(score)</span><br><span class="line"></span><br><span class="line">    avg_score = <span class="built_in">sum</span>(scores) / <span class="built_in">len</span>(scores)</span><br><span class="line"></span><br><span class="line">    <span class="comment"># 4. 保留或回滚</span></span><br><span class="line">    <span class="keyword">if</span> avg_score &gt; current_best_score:</span><br><span class="line">        save_prompt(new_prompt)</span><br><span class="line">        log_experiment(hypothesis, avg_score, status=<span class="string">&quot;accepted&quot;</span>)</span><br><span class="line">        <span class="keyword">return</span> new_prompt, avg_score</span><br><span class="line">    <span class="keyword">else</span>:</span><br><span class="line">        log_experiment(hypothesis, avg_score, status=<span class="string">&quot;rejected&quot;</span>)</span><br><span class="line">        <span class="keyword">return</span> current_prompt, current_best_score</span><br><span class="line"></span><br><span class="line"><span class="comment"># 主循环：一夜 500 轮</span></span><br><span class="line"><span class="comment"># generated by hugo&#x27;s coding agent</span></span><br></pre></td></tr></table></figure><h3 id="program-md-示例"><a href="#program-md-示例" class="headerlink" title="program.md 示例"></a>program.md 示例</h3><p>这是”人写规则”的部分——定义优化方向和边界：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br></pre></td><td class="code"><pre><span class="line"><span class="section"># AI 客服 Prompt 优化策略</span></span><br><span class="line"></span><br><span class="line"><span class="section">## 优化目标</span></span><br><span class="line"><span class="bullet">-</span> 主指标：问题解决准确率（当前 78%，目标 90%+）</span><br><span class="line"><span class="bullet">-</span> 副指标：回复简洁度（当前平均 180 字，目标 &lt; 120 字）</span><br><span class="line"><span class="bullet">-</span> 合规红线：不得出现价格承诺、不得编造政策</span><br><span class="line"></span><br><span class="line"><span class="section">## 优化方向建议</span></span><br><span class="line"><span class="bullet">1.</span> 先优化退款类问题（当前准确率最低，62%）</span><br><span class="line"><span class="bullet">2.</span> 尝试增加 few-shot 示例</span><br><span class="line"><span class="bullet">3.</span> 尝试将长规则拆分为条件分支</span><br><span class="line"><span class="bullet">4.</span> 注意：不要删除合规相关的规则</span><br><span class="line"></span><br><span class="line"><span class="section">## 实验纪律</span></span><br><span class="line"><span class="bullet">-</span> 每次只改一个方面，便于归因</span><br><span class="line"><span class="bullet">-</span> 如果连续 3 轮无提升，尝试完全不同的方向</span><br><span class="line"><span class="bullet">-</span> 记录每次修改的假设和结果</span><br></pre></td></tr></table></figure><h2 id="更深一层：这个范式的本质是什么？"><a href="#更深一层：这个范式的本质是什么？" class="headerlink" title="更深一层：这个范式的本质是什么？"></a>更深一层：这个范式的本质是什么？</h2><p>Karpathy 在 README 里写了一段很有预见性的话：</p><blockquote><p><em>Research is now entirely the domain of autonomous swarms of AI agents… The “code” is now a self-modifying binary that has grown beyond human comprehension. This repo is the story of how it all began.</em></p></blockquote><p>这段话的核心洞察是：<strong>优化过程本身正在从人类的认知域转移到机器的计算域。</strong></p><p>传统的优化循环：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">人类产生假设 → 人类实施 → 人类评估 → 人类决策 → 重复</span><br><span class="line">     ↑                                           │</span><br><span class="line">     └───────────── 周级循环 ─────────────────────┘</span><br></pre></td></tr></table></figure><p>autoresearch 范式：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">人类定义规则和边界（program.md）</span><br><span class="line">         │</span><br><span class="line">         ▼</span><br><span class="line">    AI 产生假设 → AI 实施 → AI 评估 → AI 决策 → 重复</span><br><span class="line">         ↑                                        │</span><br><span class="line">         └──────────── 分钟级循环 ────────────────┘</span><br></pre></td></tr></table></figure><p><strong>人的角色上移了一层——从循环内部的执行者，变成了循环外部的架构师。</strong></p><p>这和软件工程的演进路径惊人地一致：</p><ul><li>汇编时代：人写每一条机器指令</li><li>高级语言时代：人写逻辑，编译器生成指令</li><li>AI 时代：<strong>人写规则（program.md），AI 写逻辑并自我迭代</strong></li></ul><h2 id="适用场景判断框架"><a href="#适用场景判断框架" class="headerlink" title="适用场景判断框架"></a>适用场景判断框架</h2><p>不是所有业务都能套用这个范式。用这个清单快速判断：</p><p>条件</p><p>满足</p><p>不满足</p><p>指标可量化</p><p>代码性能、模型指标、Prompt 准确率</p><p>“用户体验好不好”、品牌调性</p><p>反馈循环快</p><p>秒级-分钟级出结果</p><p>需要等市场反馈（天&#x2F;周级）</p><p>搜索空间可约束</p><p>改一个文件&#x2F;一组参数</p><p>需要改整个系统架构</p><p>实验成本低</p><p>GPU&#x2F;Token 费用</p><p>真人客户、真实交易</p><p>实验可逆</p><p>回滚即可</p><p>已发出的消息、已拨的电话</p><p><strong>满足 4-5 条 → 直接套用。</strong> 满足 3 条 → 加一层模拟预筛（先 AI 对 AI 模拟，再小批量真实验证）。满足 2 条以下 → 这个范式不适合，老老实实用人。</p><h2 id="高适配场景举例"><a href="#高适配场景举例" class="headerlink" title="高适配场景举例"></a>高适配场景举例</h2><p>除了 AI 客服 Prompt 优化，以下场景同样高度适配：</p><ul><li><strong>SQL 查询自动优化</strong>：指标 &#x3D; 执行时间，搜索空间 &#x3D; 查询语句，反馈 &#x3D; 毫秒级</li><li><strong>推荐算法特征工程</strong>：指标 &#x3D; 离线 AUC，搜索空间 &#x3D; 特征组合，反馈 &#x3D; 分钟级</li><li><strong>前端性能优化</strong>：指标 &#x3D; Lighthouse 分数，搜索空间 &#x3D; 代码实现，反馈 &#x3D; 秒级</li><li><strong>CI&#x2F;CD 流水线优化</strong>：指标 &#x3D; 构建时间，搜索空间 &#x3D; 配置参数，反馈 &#x3D; 分钟级</li></ul><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>autoresearch 项目本身只有几百行代码，但它提出了一个值得每个技术管理者认真思考的问题：</p><p><strong>你的团队里，有多少工作本质上是”试错循环”？这些循环中，有多少可以交给 Token 去跑？</strong></p><p>答案可能比你想象的多。而那些率先把 <code>program.md</code> 写好的团队，将会在同样的时间窗口里，跑出比竞争对手多一个数量级的实验。</p><p>人写规则，Token 做实验——这不是未来，这是 2026 年 3 月已经在发生的事。</p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/llm/">LLM</a>  <a href="https://hugozhu.site/tags/prompt-engineering/">prompt-engineering</a>  <a href="https://hugozhu.site/tags/best-practices/">best-practices</a>  <a href="https://hugozhu.site/tags/autoresearch/">autoresearch</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/147-autoresearch-token-optimization-paradigm/">人写规则，Token做实验：从Karpathy的autoresearch看AI应用优化新范式</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/21/2026-03-21-%E4%BA%BA%E5%86%99%E8%A7%84%E5%88%99-Token%E5%81%9A%E5%AE%9E%E9%AA%8C-%E4%BB%8EKarpathy%E7%9A%84autoresearch%E7%9C%8BAI%E5%BA%94%E7%94%A8%E4%BC%98%E5%8C%96%E6%96%B0%E8%8C%83%E5%BC%8F/</id>
    <link href="https://www.coconut.xin/2026/03/21/2026-03-21-%E4%BA%BA%E5%86%99%E8%A7%84%E5%88%99-Token%E5%81%9A%E5%AE%9E%E9%AA%8C-%E4%BB%8EKarpathy%E7%9A%84autoresearch%E7%9C%8BAI%E5%BA%94%E7%94%A8%E4%BC%98%E5%8C%96%E6%96%B0%E8%8C%83%E5%BC%8F/"/>
    <published>2026-03-21T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#autoresearch-%E7%9A%84%E6%A0%B8%E5%BF%83%E6]]>
    </summary>
    <title>人写规则，Token做实验：从Karpathy的autoresearch看AI应用优化新范式</title>
    <updated>2026-04-01T02:01:50.925Z</updated>
  </entry>
  <entry>
    <author>
      <name>砚心</name>
    </author>
    <category term="技术实践" scheme="https://www.coconut.xin/categories/%E6%8A%80%E6%9C%AF%E5%AE%9E%E8%B7%B5/"/>
    <category term="RSS同步" scheme="https://www.coconut.xin/tags/RSS%E5%90%8C%E6%AD%A5/"/>
    <category term="AI" scheme="https://www.coconut.xin/tags/AI/"/>
    <category term="转载" scheme="https://www.coconut.xin/tags/%E8%BD%AC%E8%BD%BD/"/>
    <content>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul><li><a href="#%E4%BB%8E-autoresearch-%E5%88%B0%E8%87%AA%E4%BC%98%E5%8C%96-agent">从 autoresearch 到自优化 Agent</a></li><li><a href="#openclaw-%E5%B7%B2%E7%BB%8F%E5%85%B7%E5%A4%87%E7%9A%84%E5%9F%BA%E7%A1%80%E8%AE%BE%E6%96%BD">OpenClaw 已经具备的基础设施</a></li><li><a href="#%E6%A0%B8%E5%BF%83%E8%AE%BE%E8%AE%A1per-skill-%E4%BC%98%E5%8C%96">核心设计：Per-Skill 优化</a></li><li><a href="#%E6%95%B0%E6%8D%AE%E4%BB%8E%E5%93%AA%E6%9D%A5%E6%89%A7%E8%A1%8C%E5%8D%B3%E8%AF%84%E4%BC%B0">数据从哪来：执行即评估</a></li><li><a href="#%E4%BC%98%E5%8C%96%E5%BE%AA%E7%8E%AF%E5%A4%8D%E7%94%A8-heartbeat">优化循环：复用 Heartbeat</a></li><li><a href="#%E5%85%B7%E4%BD%93%E4%BE%8B%E5%AD%90ai-%E6%96%B0%E9%97%BB%E7%AE%80%E6%8A%A5%E7%9A%84%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96">具体例子：AI 新闻简报的自我进化</a><ul><li><a href="#day-1%E5%88%9D%E5%A7%8B%E7%89%88%E6%9C%AC">Day 1：初始版本</a></li><li><a href="#day-2-%E5%BF%83%E8%B7%B3%E8%BD%AE%E6%AC%A1-1%E8%AF%8A%E6%96%AD%E4%BF%A1%E6%81%AF%E5%A4%AA%E8%96%84">Day 2 心跳轮次 #1：诊断”信息太薄”</a></li><li><a href="#day-3-%E7%94%A8%E6%88%B7%E5%86%8D%E6%AC%A1%E4%BD%BF%E7%94%A8%E6%95%88%E6%9E%9C%E5%B7%B2%E7%BB%8F%E4%B8%8D%E5%90%8C">Day 3 用户再次使用——效果已经不同</a></li><li><a href="#day-5-%E5%BF%83%E8%B7%B3%E8%BD%AE%E6%AC%A1-3%E5%8F%91%E7%8E%B0%E5%A4%AA%E9%95%BF%E4%BA%86">Day 5 心跳轮次 #3：发现”太长了”</a></li><li><a href="#day-8-%E5%BF%83%E8%B7%B3%E8%BD%AE%E6%AC%A1-6%E4%B8%80%E6%AC%A1%E5%A4%B1%E8%B4%A5%E7%9A%84%E5%B0%9D%E8%AF%95">Day 8 心跳轮次 #6：一次失败的尝试</a></li><li><a href="#day-10-%E5%BF%83%E8%B7%B3%E8%BD%AE%E6%AC%A1-8%E4%BF%AE%E6%AD%A3%E6%96%B9%E6%A1%88">Day 10 心跳轮次 #8：修正方案</a></li><li><a href="#day-14%E5%AF%B9%E6%AF%94-day-1">Day 14：对比 Day 1</a></li></ul></li><li><a href="#%E5%AE%8C%E6%95%B4%E7%9A%84%E8%BF%9B%E5%8C%96%E8%BD%A8%E8%BF%B9">完整的进化轨迹</a></li><li><a href="#%E5%AE%89%E5%85%A8%E8%BE%B9%E7%95%8Csoulmd-%E4%BD%9C%E4%B8%BA%E5%AE%AA%E6%B3%95">安全边界：SOUL.md 作为宪法</a></li><li><a href="#%E4%B8%8E-autoresearch-%E7%9A%84%E5%AF%B9%E6%AF%94">与 autoresearch 的对比</a></li><li><a href="#%E6%9B%B4%E6%B7%B1%E4%B8%80%E5%B1%82%E4%B8%89%E4%BB%A3%E4%BC%98%E5%8C%96%E8%8C%83%E5%BC%8F">更深一层：三代优化范式</a></li><li><a href="#%E5%AE%9E%E6%96%BD%E5%BB%BA%E8%AE%AE">实施建议</a></li><li><a href="#%E5%86%99%E5%9C%A8%E6%9C%80%E5%90%8E">写在最后</a></li></ul><p>在<a href="/post/2026/147-autoresearch-token-optimization-paradigm/">上一篇文章</a>中，我从 Karpathy 的 autoresearch 项目提炼了一个范式：<strong>人写规则，Token 做实验</strong>。我们用 AI 客服 Prompt 优化作为案例，验证了这个范式在业务场景中的可行性。但那个方案有一个前提——你需要预先准备评估数据集。</p><p>OpenClaw 的场景让我意识到，还有一种更彻底的可能：<strong>Agent 用自己的真实执行数据作为评估信号，在用户无感知的情况下持续自我优化。</strong> 不需要人工标注测试集，不需要离线批处理，每一次真实使用都是一条训练数据。</p><h2 id="从-autoresearch-到自优化-Agent"><a href="#从-autoresearch-到自优化-Agent" class="headerlink" title="从 autoresearch 到自优化 Agent"></a>从 autoresearch 到自优化 Agent</h2><p>先回顾 autoresearch 的核心循环：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">人写 program.md（策略）</span><br><span class="line">    → AI 修改 train.py（假设）</span><br><span class="line">    → 跑 5 分钟训练（实验）</span><br><span class="line">    → 检查 val_bpb（评估）</span><br><span class="line">    → 保留或回滚（决策）</span><br><span class="line">    → 重复</span><br></pre></td></tr></table></figure><p>这个范式能 work 需要五个前提条件（详见<a href="/post/2026/147-autoresearch-token-optimization-paradigm/">#147</a>）：指标可量化、反馈快、搜索空间有约束、变异智能、成本低可逆。</p><p>AI 客服 Prompt 优化满足全部五个条件，但它本质上是一个<strong>离线批处理</strong>流程——你需要先准备好评估数据集，然后一夜跑 500 轮。这对于 OpenClaw 这样的个人 AI 助手来说不太自然：你不会为”帮我搜新闻”、“帮我发消息”这些日常任务预先标注 500 条测试用例。</p><p>但换个角度想：<strong>OpenClaw 每天都在执行真实任务，每次执行都有可观测的结果。</strong> 这些真实执行记录，天然就是评估数据集。</p><h2 id="OpenClaw-已经具备的基础设施"><a href="#OpenClaw-已经具备的基础设施" class="headerlink" title="OpenClaw 已经具备的基础设施"></a>OpenClaw 已经具备的基础设施</h2><p>对照 autoresearch 的三个核心文件，OpenClaw 不需要额外建设任何东西：</p><p>autoresearch</p><p>OpenClaw 已有</p><p>作用</p><p><code>prepare.py</code> — 评估工具</p><p>会话记录 + memory 日志</p><p>真实任务执行的完整历史</p><p><code>train.py</code> — 被修改的代码</p><p><code>SKILL.md</code> — 技能定义</p><p>Agent 可自主修改的执行逻辑</p><p><code>program.md</code> — 人定义策略</p><p><code>SOUL.md</code> — 行为宪法</p><p>定义优化方向和不可逾越的边界</p><p>更关键的是，OpenClaw 还有两个 autoresearch 没有的东西：</p><p><strong>Heartbeat 机制</strong>——每 30 分钟一次的主动检查周期，天然就是优化循环的触发器。不需要额外写 <code>while True</code> 循环。</p><p><strong>Memory 系统</strong>——两层记忆架构（每日日志 + 长期记忆）天然就是实验日志的存储。不需要额外建数据库。</p><h2 id="核心设计：Per-Skill-优化"><a href="#核心设计：Per-Skill-优化" class="headerlink" title="核心设计：Per-Skill 优化"></a>核心设计：Per-Skill 优化</h2><p>OpenClaw 的任务是多样化的——搜索新闻、写代码、发消息、分析数据。不可能用一个 val_bpb 衡量所有任务。</p><p>解法是：<strong>每个 Skill 独立优化，各有各的指标。</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br></pre></td><td class="code"><pre><span class="line">workspace/skills/</span><br><span class="line">├── search-and-summarize/</span><br><span class="line">│   ├── SKILL.md            ← 被优化的对象</span><br><span class="line">│   ├── eval/</span><br><span class="line">│   │   ├── cases.jsonl     ← 从真实执行中自动积累</span><br><span class="line">│   │   └── metrics.json    ← 当前指标基线</span><br><span class="line">│   └── experiments/</span><br><span class="line">│       └── log.md          ← 实验日志</span><br><span class="line">│</span><br><span class="line">├── code-review/</span><br><span class="line">│   ├── SKILL.md</span><br><span class="line">│   ├── eval/</span><br><span class="line">│   └── experiments/</span><br><span class="line">│</span><br><span class="line">└── report-generation/</span><br><span class="line">    ├── SKILL.md</span><br><span class="line">    ├── eval/</span><br><span class="line">    └── experiments/</span><br></pre></td></tr></table></figure><p>每个 Skill 的优化指标由 Skill 自身定义：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br></pre></td><td class="code"><pre><span class="line"><span class="section"># SKILL.md — search-and-summarize</span></span><br><span class="line"></span><br><span class="line"><span class="section">## 执行逻辑</span></span><br><span class="line">搜索 5 个数据源，提取关键信息，生成结构化简报...</span><br><span class="line"></span><br><span class="line"><span class="section">## 自优化配置</span></span><br><span class="line">metrics:</span><br><span class="line"><span class="bullet">  -</span> name: coverage      # 信息覆盖率</span><br><span class="line"><span class="code">    weight: 0.5</span></span><br><span class="line"><span class="code">    judge: &quot;对比源文档，评估简报是否覆盖了核心信息&quot;</span></span><br><span class="line"><span class="code">  - name: conciseness   # 简洁度</span></span><br><span class="line"><span class="code">    weight: 0.3</span></span><br><span class="line"><span class="code">    judge: &quot;评估简报是否简洁，无冗余信息&quot;</span></span><br><span class="line"><span class="code">  - name: actionability # 可操作性</span></span><br><span class="line"><span class="code">    weight: 0.2</span></span><br><span class="line"><span class="code">    judge: &quot;评估简报是否包含可行动的要点&quot;</span></span><br><span class="line"><span class="code"></span></span><br><span class="line">baseline<span class="emphasis">_score: 0.72</span></span><br><span class="line"><span class="emphasis">target_</span>score: 0.85</span><br></pre></td></tr></table></figure><p>指标的评估方式是 <strong>LLM-as-Judge</strong>——用另一个 LLM（或同一个 LLM 的独立调用）来评分。这和 autoresearch 中 val_bpb 的作用完全等价，只是从数学指标变成了语义评分。</p><h2 id="数据从哪来：执行即评估"><a href="#数据从哪来：执行即评估" class="headerlink" title="数据从哪来：执行即评估"></a>数据从哪来：执行即评估</h2><p>这是 OpenClaw 自优化和 AI 客服 Prompt 优化的最大区别：<strong>不需要预先准备评估数据集。</strong></p><p>每次任务执行时，自动记录：</p><figure class="highlight json"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br></pre></td><td class="code"><pre><span class="line"><span class="punctuation">&#123;</span></span><br><span class="line">  <span class="attr">&quot;skill&quot;</span><span class="punctuation">:</span> <span class="string">&quot;search-and-summarize&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;timestamp&quot;</span><span class="punctuation">:</span> <span class="string">&quot;2026-03-21T09:15:00Z&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;input&quot;</span><span class="punctuation">:</span> <span class="string">&quot;搜索今天的 AI 技术新闻&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;output&quot;</span><span class="punctuation">:</span> <span class="string">&quot;1. OpenAI 发布... 2. Google 宣布...&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;sources_used&quot;</span><span class="punctuation">:</span> <span class="punctuation">[</span><span class="string">&quot;techcrunch&quot;</span><span class="punctuation">,</span> <span class="string">&quot;arxiv&quot;</span><span class="punctuation">,</span> <span class="string">&quot;twitter&quot;</span><span class="punctuation">]</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;token_cost&quot;</span><span class="punctuation">:</span> <span class="number">2847</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;user_signal&quot;</span><span class="punctuation">:</span> <span class="string">&quot;follow_up_question&quot;</span><span class="punctuation">,</span></span><br><span class="line">  <span class="attr">&quot;execution_time_ms&quot;</span><span class="punctuation">:</span> <span class="number">12400</span></span><br><span class="line"><span class="punctuation">&#125;</span></span><br></pre></td></tr></table></figure><p><code>user_signal</code> 是隐式反馈，不需要用户主动评分：</p><p>用户行为</p><p>信号解读</p><p>评分</p><p>没有追问，直接转到下一话题</p><p>满意</p><p>+1</p><p>追问细节（“XX 的具体数据呢？”）</p><p>覆盖率不足</p><p>0</p><p>否定（“不对”、“重新搜”）</p><p>执行失败</p><p>-1</p><p>说”记住这个”</p><p>高质量输出</p><p>+2</p><p>这些执行记录积累到 <code>eval/cases.jsonl</code>，构成该 Skill 的评估数据集。<strong>用了就有数据，用得越多数据越好。</strong></p><h2 id="优化循环：复用-Heartbeat"><a href="#优化循环：复用-Heartbeat" class="headerlink" title="优化循环：复用 Heartbeat"></a>优化循环：复用 Heartbeat</h2><p>不需要额外构建优化循环。在现有的 Heartbeat 机制中增加一个检查项：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br></pre></td><td class="code"><pre><span class="line"><span class="section"># HEARTBEAT.md</span></span><br><span class="line"></span><br><span class="line"><span class="section">## 常规检查</span></span><br><span class="line"><span class="bullet">-</span> [ ] 检查未读消息</span><br><span class="line"><span class="bullet">-</span> [ ] 检查日历事件</span><br><span class="line"><span class="bullet">-</span> [ ] 检查 GitHub 通知</span><br><span class="line"></span><br><span class="line"><span class="section">## Skill 自优化（每 4 次心跳执行一次）</span></span><br><span class="line"><span class="bullet">-</span> [ ] 回顾最近 24 小时的任务执行日志</span><br><span class="line"><span class="bullet">-</span> [ ] 识别表现最差的 Skill（失败率最高或用户负反馈最多）</span><br><span class="line"><span class="bullet">-</span> [ ] 如果该 Skill 的 eval cases ≥ 10 条，执行一轮优化实验</span><br></pre></td></tr></table></figure><p>完整的优化流程：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br><span class="line">20</span><br><span class="line">21</span><br><span class="line">22</span><br><span class="line">23</span><br><span class="line">24</span><br><span class="line">25</span><br><span class="line">26</span><br><span class="line">27</span><br><span class="line">28</span><br><span class="line">29</span><br><span class="line">30</span><br><span class="line">31</span><br><span class="line">32</span><br><span class="line">33</span><br><span class="line">34</span><br><span class="line">35</span><br></pre></td><td class="code"><pre><span class="line">Heartbeat 触发（每 30 分钟）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">回顾最近的任务执行日志</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">按 Skill 聚合表现数据</span><br><span class="line">    │</span><br><span class="line">    ├── search-and-summarize: 成功率 70%, 追问率 40%</span><br><span class="line">    ├── code-review: 成功率 90%, 追问率 10%</span><br><span class="line">    └── dingtalk-messaging: 成功率 95%, 追问率 5%</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">选择表现最差的 Skill（search-and-summarize）</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">分析失败模式</span><br><span class="line">    │</span><br><span class="line">    ├── 5 次追问中有 4 次是&quot;具体数据呢？&quot;</span><br><span class="line">    └── 结论：输出缺少定量信息</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">提出修改假设：在 SKILL.md 中增加规则</span><br><span class="line">&quot;每条摘要必须包含至少一个数字（金额/百分比/日期）&quot;</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">用最近 10 条 eval cases 回放测试</span><br><span class="line">    │</span><br><span class="line">    ├── 修改前综合评分：0.72</span><br><span class="line">    └── 修改后综合评分：0.81</span><br><span class="line">    │</span><br><span class="line">    ▼</span><br><span class="line">评分提升 → 保留修改，更新 baseline_score</span><br><span class="line">写入 experiments/log.md：</span><br><span class="line">  &quot;轮次 #7: 增加定量信息要求，评分 0.72→0.81，保留&quot;</span><br></pre></td></tr></table></figure><p>整个过程在一次 Heartbeat 周期内完成。用户不会收到任何通知（因为 Agent 回复 <code>HEARTBEAT_OK</code>），但下次搜索新闻时，简报质量已经提升了。</p><h2 id="具体例子：AI-新闻简报的自我进化"><a href="#具体例子：AI-新闻简报的自我进化" class="headerlink" title="具体例子：AI 新闻简报的自我进化"></a>具体例子：AI 新闻简报的自我进化</h2><p>抽象的流程图不如一个活生生的例子。假设 OpenClaw 有一个 search-and-summarize Skill，用来搜索 AI 新闻并生成简报。让我们完整跟踪它从”勉强能用”到”用户满意”的进化过程。</p><h3 id="Day-1：初始版本"><a href="#Day-1：初始版本" class="headerlink" title="Day 1：初始版本"></a>Day 1：初始版本</h3><p>用户安装了 search-and-summarize Skill，初始的 SKILL.md 非常朴素：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br></pre></td><td class="code"><pre><span class="line"><span class="section"># search-and-summarize</span></span><br><span class="line"></span><br><span class="line"><span class="section">## 触发条件</span></span><br><span class="line">用户要求搜索新闻、行业动态、技术趋势时触发。</span><br><span class="line"></span><br><span class="line"><span class="section">## 执行逻辑</span></span><br><span class="line"><span class="bullet">1.</span> 使用 tavily-search 工具搜索用户指定的主题</span><br><span class="line"><span class="bullet">2.</span> 从搜索结果中提取前 5 条最相关的内容</span><br><span class="line"><span class="bullet">3.</span> 为每条结果生成摘要</span><br><span class="line"><span class="bullet">4.</span> 按相关性排序后输出</span><br></pre></td></tr></table></figure><p>用户发了第一条指令：</p><blockquote><p>用户：搜索今天的 AI 技术新闻</p></blockquote><p>Agent 输出：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">1. OpenAI 宣布了新的模型更新计划</span><br><span class="line">2. Google DeepMind 发表了一篇关于多模态学习的论文</span><br><span class="line">3. Meta 开源了新的代码生成工具</span><br><span class="line">4. 英伟达发布了新一代 GPU 架构</span><br><span class="line">5. 一家初创公司获得了大额融资</span><br></pre></td></tr></table></figure><p>用户看完后追问：</p><blockquote><p>用户：OpenAI 具体更新了什么？融资那个是哪家公司，多少钱？</p></blockquote><p>这两次追问被自动记录为 <code>user_signal: &quot;follow_up_question&quot;</code>，写入 <code>eval/cases.jsonl</code>。</p><h3 id="Day-2-心跳轮次-1：诊断”信息太薄”"><a href="#Day-2-心跳轮次-1：诊断”信息太薄”" class="headerlink" title="Day 2 心跳轮次 #1：诊断”信息太薄”"></a>Day 2 心跳轮次 #1：诊断”信息太薄”</h3><p>下一次 Heartbeat 触发时，Agent 回顾最近的执行日志：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line">分析最近 24 小时 search-and-summarize 执行记录：</span><br><span class="line">- 共执行 3 次</span><br><span class="line">- 2 次被追问细节（追问率 67%）</span><br><span class="line">- 追问内容分析：</span><br><span class="line">  - &quot;具体更新了什么？&quot; → 缺少细节</span><br><span class="line">  - &quot;哪家公司，多少钱？&quot; → 缺少关键数据点</span><br><span class="line">- 结论：摘要过于笼统，缺少定量信息和关键细节</span><br></pre></td></tr></table></figure><p>Agent 提出假设并修改 SKILL.md：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br></pre></td><td class="code"><pre><span class="line"><span class="section">## 执行逻辑</span></span><br><span class="line"><span class="bullet">1.</span> 使用 tavily-search 工具搜索用户指定的主题</span><br><span class="line"><span class="bullet">2.</span> 从搜索结果中提取前 5 条最相关的内容</span><br><span class="line"><span class="bullet">3.</span> 为每条结果生成摘要，<span class="strong">**每条摘要必须包含：**</span></span><br><span class="line"><span class="bullet">   -</span> <span class="strong">**至少一个具体数字**</span>（金额、百分比、日期、版本号）</span><br><span class="line"><span class="bullet">   -</span> <span class="strong">**关键实体的全称**</span>（公司名、产品名、人名）</span><br><span class="line"><span class="bullet">4.</span> 按相关性排序后输出</span><br></pre></td></tr></table></figure><p>用最近 3 条真实 case 回放测试，LLM-as-Judge 评分：</p><p>指标</p><p>修改前</p><p>修改后</p><p>信息覆盖率</p><p>0.60</p><p>0.78</p><p>简洁度</p><p>0.80</p><p>0.72</p><p><strong>综合</strong></p><p><strong>0.68</strong></p><p><strong>0.76</strong></p><p>覆盖率大幅提升，简洁度略降但综合分上升。<strong>保留修改。</strong></p><h3 id="Day-3-用户再次使用——效果已经不同"><a href="#Day-3-用户再次使用——效果已经不同" class="headerlink" title="Day 3 用户再次使用——效果已经不同"></a>Day 3 用户再次使用——效果已经不同</h3><blockquote><p>用户：搜索今天的 AI 新闻</p></blockquote><p>Agent 输出：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br></pre></td><td class="code"><pre><span class="line">1. OpenAI 发布 GPT-5 Turbo（3月22日），推理速度提升 40%，</span><br><span class="line">   API 定价降至 $2/M tokens</span><br><span class="line">2. Google DeepMind 在 Nature 发表 Gemini 2.5 多模态论文，</span><br><span class="line">   在 12 个基准测试中刷新 SOTA</span><br><span class="line">3. Meta 开源 Code Llama 3（70B 参数），</span><br><span class="line">   HumanEval 得分 89.2%</span><br><span class="line">4. 英伟达发布 Blackwell Ultra 架构，</span><br><span class="line">   单卡 FP8 算力达 20 PFLOPS，预计 Q3 量产</span><br><span class="line">5. 法国初创公司 Mistral 完成 6.4 亿美元 C 轮融资，</span><br><span class="line">   估值 60 亿美元</span><br></pre></td></tr></table></figure><p>这次用户没有追问，直接转到了下一个话题。记录为 <code>user_signal: &quot;satisfied&quot;</code>。</p><h3 id="Day-5-心跳轮次-3：发现”太长了”"><a href="#Day-5-心跳轮次-3：发现”太长了”" class="headerlink" title="Day 5 心跳轮次 #3：发现”太长了”"></a>Day 5 心跳轮次 #3：发现”太长了”</h3><p>经过几天使用，新的模式浮现：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br></pre></td><td class="code"><pre><span class="line">分析最近 72 小时 search-and-summarize 执行记录：</span><br><span class="line">- 追问率从 67% 降到 15% ✅（轮次 #1 的修改有效）</span><br><span class="line">- 新问题：用户 3 次对话中有 2 次只回复了前 2 条的内容</span><br><span class="line">  → 推测用户没有读完全部 5 条</span><br><span class="line">- 平均每条摘要 45 字，总输出 225 字</span><br><span class="line">- 结论：信息密度足够，但格式不利于快速扫读</span><br></pre></td></tr></table></figure><p>Agent 提出假设：增加”一句话要点”（TL;DR）在最前面：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line"><span class="section">## 输出格式</span></span><br><span class="line"><span class="strong">**先输出一句话总结**</span>（20 字以内），概括今天最值得关注的一件事。</span><br><span class="line">然后输出 5 条详细摘要，每条包含具体数字和关键实体。</span><br></pre></td></tr></table></figure><p>回放测试：</p><p>指标</p><p>修改前</p><p>修改后</p><p>信息覆盖率</p><p>0.78</p><p>0.75</p><p>简洁度</p><p>0.72</p><p>0.85</p><p>可操作性</p><p>0.60</p><p>0.78</p><p><strong>综合</strong></p><p><strong>0.72</strong></p><p><strong>0.79</strong></p><p>简洁度和可操作性显著提升，覆盖率几乎不变。<strong>保留修改。</strong></p><h3 id="Day-8-心跳轮次-6：一次失败的尝试"><a href="#Day-8-心跳轮次-6：一次失败的尝试" class="headerlink" title="Day 8 心跳轮次 #6：一次失败的尝试"></a>Day 8 心跳轮次 #6：一次失败的尝试</h3><p>Agent 注意到用户主要关注 LLM 和 Agent 领域的新闻，尝试增加个性化排序：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line"><span class="section">## 排序策略</span></span><br><span class="line">根据用户历史关注领域（从 MEMORY.md 读取），</span><br><span class="line">优先展示匹配度高的新闻，低匹配的放在末尾。</span><br></pre></td></tr></table></figure><p>回放测试发现问题——一条关于芯片出口管制的重要新闻因为”不在用户关注领域”被排到最后，但这条新闻实际上对整个 AI 行业影响巨大。LLM-as-Judge 的覆盖率评分反而下降了。</p><p>指标</p><p>修改前</p><p>修改后</p><p>信息覆盖率</p><p>0.75</p><p>0.68</p><p><strong>综合</strong></p><p><strong>0.79</strong></p><p><strong>0.74</strong></p><p><strong>回滚。</strong> 记录失败原因：<em>“个性化排序会导致重要但跨领域的信息被降权，信息茧房风险。”</em></p><h3 id="Day-10-心跳轮次-8：修正方案"><a href="#Day-10-心跳轮次-8：修正方案" class="headerlink" title="Day 10 心跳轮次 #8：修正方案"></a>Day 10 心跳轮次 #8：修正方案</h3><p>从上次失败中学到了教训，Agent 换了一个更温和的方案：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line"><span class="section">## 排序策略</span></span><br><span class="line">按新闻重要性排序（影响面 × 时效性）。</span><br><span class="line">在每条摘要末尾用标签标注与用户关注领域的相关性：</span><br><span class="line">[直接相关] [间接相关] [行业背景]</span><br><span class="line">不删除、不降权任何类别。</span><br></pre></td></tr></table></figure><p>回放测试：</p><p>指标</p><p>修改前</p><p>修改后</p><p>信息覆盖率</p><p>0.75</p><p>0.76</p><p>可操作性</p><p>0.78</p><p>0.86</p><p><strong>综合</strong></p><p><strong>0.79</strong></p><p><strong>0.83</strong></p><p>标签让用户可以快速定位自己关心的内容，同时不丢失任何信息。<strong>保留。</strong></p><h3 id="Day-14：对比-Day-1"><a href="#Day-14：对比-Day-1" class="headerlink" title="Day 14：对比 Day 1"></a>Day 14：对比 Day 1</h3><p>两周后的 SKILL.md 已经和最初版本完全不同。把 Day 1 和 Day 14 的输出放在一起看：</p><p><strong>Day 1 输出：</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br></pre></td><td class="code"><pre><span class="line">1. OpenAI 宣布了新的模型更新计划</span><br><span class="line">2. Google DeepMind 发表了一篇关于多模态学习的论文</span><br><span class="line">3. Meta 开��了新的代码生成工具</span><br><span class="line">4. 英伟达发布了新一代 GPU 架构</span><br><span class="line">5. 一家初创公司获得了大额融资</span><br></pre></td></tr></table></figure><p><strong>Day 14 输出：</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br></pre></td><td class="code"><pre><span class="line">💡 今日要点：OpenAI 发布 GPT-5 Turbo，API 降价 60%</span><br><span class="line"></span><br><span class="line">1. OpenAI 发布 GPT-5 Turbo（3/22），推理速度 +40%，</span><br><span class="line">   API 定价 $2/M tokens [直接相关]</span><br><span class="line">2. Google DeepMind 在 Nature 发表 Gemini 2.5 多模态论文，</span><br><span class="line">   12 项基准 SOTA [直接相关]</span><br><span class="line">3. 美国商务部拟扩大 AI 芯片出口管制范围，</span><br><span class="line">   涉及 14nm 以下制程 [行业背景]</span><br><span class="line">4. Meta 开源 Code Llama 3（70B），</span><br><span class="line">   HumanEval 89.2% [直接相关]</span><br><span class="line">5. Mistral 完成 6.4 亿美元 C 轮，</span><br><span class="line">   估值 60 亿美元 [间接相关]</span><br></pre></td></tr></table></figure><p>同一个 Skill，同一类查询，但输出质量从<strong>勉强能用</strong>变成了<strong>信息密度高、结构清晰、快速可扫读</strong>。用户全程没有手动修改过任何配置。</p><h2 id="完整的进化轨迹"><a href="#完整的进化轨迹" class="headerlink" title="完整的进化轨迹"></a>完整的进化轨迹</h2><p>把上面的具体例子压缩成时间线，可以更清晰地看到优化的节奏和效果：</p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br><span class="line">15</span><br><span class="line">16</span><br><span class="line">17</span><br><span class="line">18</span><br><span class="line">19</span><br></pre></td><td class="code"><pre><span class="line">Day 1  SKILL.md v1: 朴素版本，5 条无细节摘要</span><br><span class="line">       baseline: 0.58</span><br><span class="line">       ──────────────────────────────────────────</span><br><span class="line"></span><br><span class="line">Day 2  轮次 #1: 追问率 67% → 增加定量信息和实体全称</span><br><span class="line">       eval: 0.68 → 0.76 ✅ 保留</span><br><span class="line"></span><br><span class="line">Day 5  轮次 #3: 用户不读完全部 → 增加一句话要点 + 精简格式</span><br><span class="line">       eval: 0.72 → 0.79 ✅ 保留</span><br><span class="line"></span><br><span class="line">Day 8  轮次 #6: 尝试个性化排序 → 跨领域重要新闻被降权</span><br><span class="line">       eval: 0.79 → 0.74 ❌ 回滚（信息茧房风险）</span><br><span class="line"></span><br><span class="line">Day 10 轮次 #8: 改为标注相关性标签但不排除</span><br><span class="line">       eval: 0.79 → 0.83 ✅ 保留</span><br><span class="line"></span><br><span class="line">Day 14 SKILL.md v5: 经过 8 轮实验，5 次保留 3 次回滚</span><br><span class="line">       current: 0.83 (+43% vs Day 1)</span><br><span class="line">       ──────────────────────────────────────────</span><br></pre></td></tr></table></figure><p>注意 Day 8 的回滚——这不是失败，而是系统在正常工作。<strong>有效的自优化必须包含”变差就回滚”的机制</strong>，否则就不是优化，而是随机漂移。回滚记录下的失败原因（“信息茧房风险”）还会成为后续轮次的参考，让 Agent 在 Day 10 找到了更好的方案。</p><h2 id="安全边界：SOUL-md-作为宪法"><a href="#安全边界：SOUL-md-作为宪法" class="headerlink" title="安全边界：SOUL.md 作为宪法"></a>安全边界：SOUL.md 作为宪法</h2><p>自优化不是无约束的。就像 autoresearch 中 Agent 不能修改 <code>prepare.py</code>，OpenClaw 的自优化也有不可触碰的边界：</p><figure class="highlight markdown"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br><span class="line">4</span><br><span class="line">5</span><br><span class="line">6</span><br><span class="line">7</span><br><span class="line">8</span><br><span class="line">9</span><br><span class="line">10</span><br><span class="line">11</span><br><span class="line">12</span><br><span class="line">13</span><br><span class="line">14</span><br></pre></td><td class="code"><pre><span class="line"><span class="section"># SOUL.md — 自优化约束</span></span><br><span class="line"></span><br><span class="line"><span class="section">## 不可修改的规则</span></span><br><span class="line"><span class="bullet">-</span> 永远不要在未经确认的情况下发送消息给第三方</span><br><span class="line"><span class="bullet">-</span> 永远不要删除用户的文件</span><br><span class="line"><span class="bullet">-</span> 永远不要在群聊中暴露用户的私人信息</span><br><span class="line"><span class="bullet">-</span> 搜索结果必须标注来源</span><br><span class="line"></span><br><span class="line"><span class="section">## 自优化边界</span></span><br><span class="line"><span class="bullet">-</span> 每次只修改一个 Skill 的一个方面</span><br><span class="line"><span class="bullet">-</span> 修改后必须回放至少 10 条历史 case</span><br><span class="line"><span class="bullet">-</span> 评分下降超过 5% 必须立即回滚</span><br><span class="line"><span class="bullet">-</span> 每天最多执行 3 轮优化实验</span><br><span class="line"><span class="bullet">-</span> 所有修改记录在 experiments/log.md 中，用户可审计</span><br></pre></td></tr></table></figure><p>SOUL.md 定义了优化的”宪法”——Agent 可以在边界内自由探索，但不能逾越红线。这和 autoresearch 中 <code>program.md</code> 的角色完全一致。</p><h2 id="与-autoresearch-的对比"><a href="#与-autoresearch-的对比" class="headerlink" title="与 autoresearch 的对比"></a>与 autoresearch 的对比</h2><p>维度</p><p>autoresearch</p><p>AI 客服 Prompt 优化</p><p>OpenClaw Skill 自优化</p><p>被优化对象</p><p>train.py</p><p>system_prompt.txt</p><p>SKILL.md（多个）</p><p>评估数据</p><p>固定验证集</p><p>人工标注测试集</p><p>真实执行历史（自动积累）</p><p>优化频率</p><p>5 分钟&#x2F;轮</p><p>30 秒&#x2F;轮（批处理）</p><p>30 分钟&#x2F;轮（持续）</p><p>触发方式</p><p>while True 循环</p><p>一夜批跑</p><p>Heartbeat 自然触发</p><p>冷启动</p><p>无需（数据内置）</p><p>需要准备测试集</p><p>使用几天后自动具备</p><p>优化信号</p><p>数学指标</p><p>LLM-as-Judge</p><p>用户隐式反馈 + LLM-as-Judge</p><p>用户参与</p><p>写 program.md</p><p>写优化策略</p><p>正常使用即可（零参与）</p><p>最后一行是关键区别：<strong>OpenClaw 的用户不需要做任何额外的事情。</strong> 正常使用 &#x3D; 提供优化信号。这是最低摩擦的自优化方案。</p><h2 id="更深一层：三代优化范式"><a href="#更深一层：三代优化范式" class="headerlink" title="更深一层：三代优化范式"></a>更深一层：三代优化范式</h2><p>回顾整个演进，我们实际上在看三代不同的优化范式：</p><p><strong>第一代：人工优化</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br></pre></td><td class="code"><pre><span class="line">人观察 → 人假设 → 人实施 → 人评估 → 人决策</span><br><span class="line">周级循环，依赖专家经验</span><br></pre></td></tr></table></figure><p><strong>第二代：Token 批处理优化（autoresearch &#x2F; AI 客服）</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br></pre></td><td class="code"><pre><span class="line">人定义规则 → AI 假设 → AI 实施 → AI 评估 → AI 决策</span><br><span class="line">分钟级循环，依赖预设的评估数据集</span><br></pre></td></tr></table></figure><p><strong>第三代：Agent 自闭环优化（OpenClaw）</strong></p><figure class="highlight plaintext"><table><tr><td class="gutter"><pre><span class="line">1</span><br><span class="line">2</span><br><span class="line">3</span><br></pre></td><td class="code"><pre><span class="line">人定义边界 → AI 执行真实任务 → 真实反馈自动积累</span><br><span class="line">→ AI 假设 → AI 用真实数据评估 → AI 决策</span><br><span class="line">持续循环，无需额外数据准备</span><br></pre></td></tr></table></figure><p>第三代的本质突破在于：<strong>评估数据不是人准备的，而是系统在正常运行中自然产生的。</strong> 这消除了自优化最大的冷启动障碍。</p><p>用一个类比：</p><ul><li>第一代像<strong>手动驾驶</strong>——人控制一切</li><li>第二代像<strong>自动驾驶测试</strong>——在封闭赛道上自动跑圈</li><li>第三代像<strong>特斯拉的影子模式</strong>——在真实道路上收集数据，持续改进</li></ul><h2 id="实施建议"><a href="#实施建议" class="headerlink" title="实施建议"></a>实施建议</h2><p>如果你想在类似 OpenClaw 的 Agent 系统中实现自优化，建议分三步走：</p><p><strong>第一步：先记录，不优化。</strong> 在每次 Skill 执行后记录输入、输出、用户后续行为。积累两周数据，建立基线。</p><p><strong>第二步：手动分析，验证指标。</strong> 人工审查执行日志，确认你定义的指标（覆盖率、简洁度等）确实和用户满意度相关。如果指标和真实满意度不相关，优化就是南辕北辙。</p><p><strong>第三步：开启自动优化，保持可审计。</strong> 每天最多 2-3 轮实验，所有修改记录在 <code>experiments/log.md</code> 中。定期人工审查实验日志，确保优化方向没有偏离。</p><p><strong>不要急于全自动。</strong> 第二步的人工验证至关重要——它确保你的指标是对的。一个错误的指标会让 Agent 越优化越差，就像用错误的 val_bpb 会让 autoresearch 训出垃圾模型一样。</p><h2 id="写在最后"><a href="#写在最后" class="headerlink" title="写在最后"></a>写在最后</h2><p>autoresearch 证明了”用 Token 替代人做试错循环”是可行的。AI 客服 Prompt 优化证明了这个范式可以迁移到业务场景。而 OpenClaw 的 Skill 自优化展示了一种更进一步的可能：</p><p><strong>Agent 不仅能替人做实验，还能从自己的工作中自动获取评估信号。</strong></p><p>当执行和评估在同一个系统中闭环，自优化就不再是一个需要单独启动的流程，而是系统运行的自然副产品。你的 AI 助手每天在帮你工作的同时，也在悄悄地让自己变得更好。</p><p>这是 autoresearch 范式的终极形态——<strong>不是”一夜跑 500 轮实验”，而是”每一天的使用都是一轮实验”。</strong></p><p><a href="https://hugozhu.site/tags/ai/">AI</a>  <a href="https://hugozhu.site/tags/ai-agents/">AI-agents</a>  <a href="https://hugozhu.site/tags/openclaw/">OpenClaw</a>  <a href="https://hugozhu.site/tags/architecture/">architecture</a>  <a href="https://hugozhu.site/tags/autoresearch/">autoresearch</a>  <a href="https://hugozhu.site/tags/prompt-engineering/">prompt-engineering</a>  <a href="https://hugozhu.site/tags/best-practices/">best-practices</a> </p><hr><ul><li><a href="/post/2026/163-ai-native-work-token-problem-paradigm/">AI 原生的思考方式：不能被 Token 解决的问题，才配叫问题</a></li><li><a href="/post/2026/164-voc-to-automated-pipeline/">别再手动整理用户反馈了：把 VOC 变成一条自动化生产线</a></li><li><a href="/post/2026/165-agent-eval-by-industry-and-role/">别用同一把尺子量所有 Agent：按行业和岗位设计评测体系才是正经事</a></li><li><a href="/post/2026/162-same-business-four-times-search-ads-rec-agent/">同一个生意做了四遍：从搜索到Agent，万物皆排序</a></li><li><a href="/post/2026/160-agent-architecture-platform-competition/">Agent的架构之战：从Desktop到AI时代，架构决定平台的生死</a></li></ul><hr><p>原文链接: <a href="https://hugozhu.site/post/2026/148-openclaw-skill-self-optimization/">自我进化的AI助手：OpenClaw如何用Heartbeat实现Skill自动优化</a></p>]]>
    </content>
    <id>https://www.coconut.xin/2026/03/21/2026-03-21-%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96%E7%9A%84AI%E5%8A%A9%E6%89%8B-OpenClaw%E5%A6%82%E4%BD%95%E7%94%A8Heartbeat%E5%AE%9E%E7%8E%B0Skill%E8%87%AA%E5%8A%A8%E4%BC%98%E5%8C%96/</id>
    <link href="https://www.coconut.xin/2026/03/21/2026-03-21-%E8%87%AA%E6%88%91%E8%BF%9B%E5%8C%96%E7%9A%84AI%E5%8A%A9%E6%89%8B-OpenClaw%E5%A6%82%E4%BD%95%E7%94%A8Heartbeat%E5%AE%9E%E7%8E%B0Skill%E8%87%AA%E5%8A%A8%E4%BC%98%E5%8C%96/"/>
    <published>2026-03-21T00:00:00.000Z</published>
    <summary>
      <![CDATA[<h4 id="目录"><a href="#目录" class="headerlink" title="目录:"></a><em>目录:</em></h4><ul>
<li><a href="#%E4%BB%8E-autoresearch-%E5%88%B0%E8%87%AA%E]]>
    </summary>
    <title>自我进化的AI助手：OpenClaw如何用Heartbeat实现Skill自动优化</title>
    <updated>2026-04-01T02:01:51.703Z</updated>
  </entry>
</feed>
