一个 Retainer 项目的四种早晨:企业 AI-Native 的四层成熟度
AI-Native 不是把原有组织自动化到什么程度的评级表,而是重新设计人、Agent、信息与决策之间的关系——从四种早晨讲到数字员工凭什么卖 10万—100万一年。

先解释一个词。Retainer 是广告行业的一种长期服务模式:品牌按月或按年支付固定费用,把官号运营、内容生产这类持续性工作长期委托给代理公司,区别于按项目一次性结算的 campaign。一个典型的 Retainer 项目,要求代理公司长期负责品牌的小红书、微博、微信公众号:内容规划、文案和设计、发布、互动、数据复盘。
想象这样一个 Retainer 项目组。同样是「用了 AI」的团队,早晨可以是下面四种样子。
第一层的早晨:员工每天手工点点点
公司没有任何系统,AI 是每个人自己开的一个聊天窗口。文案用 AI 写初稿,设计用 AI 出图,PM 用 AI 总结会议,但所有任务仍然由人主动想起、创建和推动。
PM 凭记忆想起今天要交的内容
人在微信、邮件和会议记录里翻找客户要求
人打开通用大模型,把品牌背景重新贴一遍
人大模型生成一稿文案
AI大幅修改、自己配图、自己管理版本
人手动发布;这套 Prompt 和经验只留在 PM 自己手里
人AI 只出现在第 4 步,而且连品牌背景都要每次现喂——Prompt 和经验随员工流失,AI 能力没有成为组织资产。
第二层的早晨:PM 判断今天要生产什么,再来系统操作
公司上了工作流系统:品牌知识库、内容日历、生成工具一应俱全。但——
PM 早上主动想起今天应该工作
人PM 打开系统检查排期
人PM 判断需要几篇文案和几组图片
人PM 创建或选择任务
人系统生成候选结果
AIPM 选择、拼接和修改
人PM 推动进入下一个环节
人7 步里 6 步由 PM 推动,AI 只出现在第 5 步。
人类是项目发动机,AI 是生产工具和工作台。它转移了执行劳动,却没有转移管理注意力。
第三层的早晨:Agent 已经判断并完成,请 PM 审核
PM 早上看到的不是一个等待操作的软件,而是一条已经推进完的汇报:
今天需要两篇文案和三组图片。我已经全部生产完成,其中一篇涉及明星素材版权,需要你判断;其余内容已经通过内部质检,请集中审核。
人类不需要提前知道今天应该生产几篇内容。这背后是一条由 Agent 自主运转的任务循环(完整 11 步见下文 1.2)。
第四层的早晨:Agent 不仅稳定运转,还产出爆款
第四层的早晨则更进一步:PM 起床拿起手机,发现 Agent 做的内容爆了。
昨晚我监测到品牌评论区里一类用户情绪连续三天升温,判断这个角度有爆发潜力,在授权范围内追加生产并发布了一条内容。它现在是品牌近半年互动量最高的帖子,正在带动品牌搜索和讨论上涨。我已经把这次成功拆解成可复用的内容模式,建议发展为长期栏目——方案和数据附后,请你决策。
爆款本身不是重点。重点是这条内容不在任何约定排期里:机会是系统自己发现的,验证是它自己完成的,成功还被它沉淀成了可复用的模式——把爆款从偶然事件变成可管理能力(能力构成见下文 1.6)。
全文的核心分界线
这四个早晨的差别,就是全文的核心分界线:
第二层里,人每天想起应该让 AI 做什么;第三层里,AI 自己想起应该做什么,并告诉人它已经推进到了哪里;第四层里,AI 不只是完成预期工作,而是持续交付让人感到惊喜的结果。
需要先说清楚一件事:AI-Native 企业不是把原有组织自动化到什么程度的一个评级表,而是重新设计「人、Agent、信息与决策」之间的关系。企业的 AI-Native 水平,不能用「接入了多少模型、上线了多少 Agent、员工使用了多少 AI 工具」来衡量。真正决定层次的是六件事——Context 范围、结果闭环、注意力所有权、持续学习、行动权限、流程与价值重定义(逐项解析见第三部分 · 六个核心维度)。
本文据此把企业 AI-Native 水平分为四级,科技产品对应地也分为四级:
员工自主使用 AI 工具,能力尚未成为组织资产
AI 在原有流程上提效,各部门有自己的 Agent(比较领先的企业已达到)
AI 重新定义工作应该如何发生:数字员工主动、持续承担责任并交付
AI 重新定义什么工作值得发生,主动发现新的价值
图 1 · 企业 AI-Native 四层成熟度阶梯,及各层对应科技产品的出售物。
| 层 | 企业 AI-Native 水平 | 对应科技产品 | 典型定价 |
|---|---|---|---|
| 第一层 | 员工自主使用 AI 工具 | 任意 AI 生图、生文、生视频工具 | 按工具或调用付费 |
| 第二层 | AI 在原有流程上提效,各部门有自己的 Agent | SaaS | 每月 20—200 美元 |
| 第三层 | AI 重新定义工作应该如何发生:数字员工主动、持续承担责任并交付 | 数字员工 | 可以卖 10万—100万元一年 |
| 第四层 | AI 重新定义什么工作值得发生,主动发现新的价值 | 价值发现和实现引擎 | 按带给用户的销售额提升抽成 |
下文先讲 Retainer 这个具体案例,再推广到一般科技产品的价值层次,最后抽象出企业侧的完整框架。
第一部分 · Retainer Agent 专项分析
1.1 Retainer 业务的基本问题
典型 Retainer 项目往往配置 1 名 PM、0.5 名文案、1—2 名设计,以及若干策略和管理人员的共享工时。
其痛点不只是素材生产慢,还包括:
- PM 每天记住大量开放事项
- 客户需求散落在微信、邮件和会议里
- 文案和设计反复修改
- 上下文频繁切换
- 客户反馈难以结构化
- 项目知识依赖个人记忆
- 优秀人才被低价值工作占用
- 同一团队可承载品牌数量有限
换句话说:Retainer 的成本不只是写文案和做图片,更是 PM 持续记住、安排、协调、催促和关闭开放事项的认知负担。
1.2 Retainer 的四个产品层次
第一层:内容生成工具
PM、设计、文案零散使用 AI 工具:写标题、生成文案、生成图片、摘要热点、生成报告提纲。人类负责:想起任务、提供 Context、组织流程、修改输出、管理版本、承担结果。交付的是:单个内容资产。
第二层:Retainer Copilot / 工作流 SaaS
PM 主动输入品牌、月份和产品重点,选择选题,Agent 生成几组文案和设计方向,PM 再进行选择、拼接、修改和审核。系统覆盖了热点、选题、文案、配图、发布和复盘等环节——产品能力包括品牌知识库、月度 Roadmap、选题和内容日历、文案生成、视觉 Brief、审核和版本管理、数据汇总、报告生成——但 PM 仍然是整个项目的发动机。
典型工作方式即开篇「第二层的早晨」的七步。
第三层:Retainer 数字员工
第三层真正的变化不是增加更多生成模块,而是:
数字员工接管官号运营的工作注意力和开放回路。
Agent 主动、持续承担官号运营责任,长期负责例如:
保证未来七天始终有足够数量、达到内部初审标准的内容库存。
它每天或在事件发生时自动检查内容库存、发布排期、客户反馈、审批状态、热点和数据表现,判断今天应该生产几篇文案、几组图片,并自主完成生产、质检和流程推进。一轮完整工作是一条闭环(虚线表示完成后回到第 1 步、等待下一次唤醒):
每天或因事件被唤醒
Agent检查内容库存、排期和审批
Agent检查客户新要求、热点和竞品变化
Agent判断当前存在什么责任缺口
Agent自主创建并排序任务
Agent调用选题、文案、设计和质检工具
Agent完成生产和第一轮审查
Agent只将必要事项推给 PM,由人审核
Agent → 人根据审批继续修改
Agent更新任务状态和经验
Agent达到安全库存后停止
Agent整条循环由 Agent 自主推进,人只在第 8 步出现——PM 不需要提前知道今天应该做什么,而是直接收到通知:「本周还缺两篇内容,我已经完成,其中一篇需要你判断明星素材版权,其他内容可以集中审核。」
这就是注意力的彻底转移:
| 第二层 | 第三层 |
|---|---|
| 人想起应该工作 | Agent 想起应该工作 |
| 人进入系统找任务 | Agent 将必要事项推给人 |
| 人维护待办队列 | Agent 维护待办队列 |
| 人决定生产数量 | Agent 根据责任缺口决定 |
| 人逐步推动流程 | Agent 自主推进到审核节点 |
| AI 提供候选素材 | Agent 交付可验收阶段结果 |
| 人跟踪开放事项 | Agent 负责关闭开放事项 |
第三层交付的是:一个被稳定、低人力介入地运营着的官号矩阵。(第四层是什么样子,见 1.6。)
1.3 第三层是否只是第二层加定时唤醒
从工程结构上看,第三层确实可以建立在第二层之上。可以概括为:
热点工具、选题工具、文案工具、图片工具、发布工具、数据工具。
当前责任是什么;当前状态是什么;距离目标还差什么;是否应该行动;应该创建什么任务;应该调用哪些能力;应该什么时候请求人;什么时候应该停止。
如果系统只是「每天九点固定生成三篇文案」,它仍然只是定时自动化。数字员工应该是:
每天九点检查责任域,根据当前库存、排期、热点、审批和目标判断是否需要生产、生产什么、生产多少以及做到哪里停止。
所以,定时器只负责叫醒 Agent。真正的数字员工能力在于:
Agent 醒来后知道为什么工作、应该做什么,以及什么时候收手。
1.4 Retainer 是否需要持续不断工作
不需要。正确的概念不是「持续执行」,而是:
持续责任,间歇执行。
Retainer Agent 可以在以下情况下醒来:
- 每天检查内容库存
- 每周准备下周内容
- 每月生成 Roadmap
- 每月完成复盘
- 每季度重审内容策略
- 客户发送新反馈
- 新素材上传
- 内容被驳回
- 发布失败
- 新热点出现
- 竞品产生重要动作
- 数据异常
- 敏感评论出现
- 内容库存低于安全线
- 任务即将逾期
- 审批等待过久
- 某类内容连续失败
- 实验积累了足够数据
- 本月指标偏离目标
醒来后,Agent 可以得出三种结论:① 需要立即工作;② 需要等待某项条件;③ 当前没有值得做的事情。
成熟数字员工必须拥有「现在不应该继续工作」的判断能力。它不应为了显得主动而不断制造内容和任务。
1.5 Retainer Agent 的持续学习
先看几个具体的学习内容,再看它们分属哪一层。比如系统应该记住:客户不喜欢夸张 Emoji;「高级」意味着更克制,而不是更复杂;某种产品露出比例总被打回;客户希望一次看两套完整方向——这是客户偏好学习。把这类经验分层,第三层 Retainer 数字员工至少需要四层学习:
记住内容做到哪里、什么正在等待、什么需要恢复、下一步是什么
即上述例子:Emoji、「高级」的含义、产品露出比例、一次看两套方向
将经验上升为 Skill:如何处理模糊客户反馈、如何根据不同平台改写内容、如何识别产品真实性风险、如何决定热点是否值得追、如何在素材缺失时继续推进
根据结果改变:选题权重、内容组合、发布节奏、创意方向、平台分工、实验优先级
第三层至少应完成前三层;第四层必须做到第四层。
1.6 第四层:Retainer 价值发现引擎
品牌最初的要求可能只是:保持 Social Presence、按时发内容、配合 Campaign、不出现公关问题、每月提交报告。
把约定的官号运营工作稳定做完。
发现并实现官号矩阵原本未被品牌意识到的价值。
Agent 不仅帮助品牌维持 Social Presence,而且持续发现并实现官号矩阵更高的价值。它主动发现具有爆发潜力的内容方向、用户情绪和品牌叙事,把一次高表现内容发展成系列栏目、内容 IP 和稳定的品牌人格,让爆款从偶然结果逐渐变成可以学习、复用和管理的能力,并最终对品牌认知、搜索、用户偏好和销售产生可验证的增量。
- 什么内容具有真正的爆发潜力
- 哪类用户情绪值得长期占领
- 品牌可以形成什么独特社交人格
- 什么评论可以发展为内容栏目
- 哪次成功能够复制为系列
- 不同平台应该承担什么角色
- 哪些内容不仅带来互动,还影响搜索和购买
- 哪些日常内容没有价值,应该停止
- 哪种内容可以成为品牌长期资产
- 高表现内容比例持续提升
- 爆款频率明显提高
- 用户主动关注和讨论
- 品牌形成稳定的社交人格
- 建立长期栏目和内容 IP
- 官号之间形成矩阵协同
- 品牌搜索、偏好和讨论增长
- 内容对销售产生可验证增量
「把所有内容都做爆」可以作为内部愿景,但不适合作为逐篇合同承诺。更准确的第四层定义是:
系统能够持续发现、验证并复用高价值内容模式,使爆款和品牌增量从偶然事件逐步变成可管理能力。
1.7 年费 10万—100万元的定价依据
第二层企业 SaaS 也可能卖到每年 10 万元,尤其在包含定制、部署、数据接入和服务时。但如果产品希望以「数字员工」而不是「昂贵 SaaS」的逻辑收费,必须证明三件事:
- PM 不再主动进入系统找工作
- Agent 主动创建必要任务
- Agent 主动推送审核事项
- 开放事项不再依赖人的记忆
- 每品牌每月人工时间明显下降
- 一个 PM 可以监督更多品牌
- 文案和设计减少重复劳动
- 项目知识不再依赖个人
- 同一团队可服务品牌数增加
- 准时交付率
- 未修改进入审核率
- 打回返工率
- 人工接管率
- 高风险错误率
- 客户满意度
- 项目毛利率
建议将以下指标作为数字员工的核心仪表盘:
| 指标 | 衡量目的 |
|---|---|
| 人类主动创建任务比例 | 任务是否仍需人想起来 |
| Agent 主动创建且有效的任务比例 | 主动性是否产生真实价值 |
| 每品牌每周人工管理分钟数 | 注意力负担是否下降 |
| 人类主动进入系统次数 | 产品是 Pull 还是 Push |
| 开放事项自动闭环率 | Agent 是否能持续推进到底 |
| 平均审核前自主步骤数 | Agent 承担了多长责任链 |
| 未修改进入审核率 | 生产结果是否接近交付 |
| 打回返工率 | 质量稳定性 |
| 重复错误率 | 是否真正持续学习 |
| 单 PM 可监督品牌数 | 是否改变组织产能 |
| 单品牌项目毛利率 | 是否形成财务价值 |
一句话总结定价逻辑:
客户不会因为你有七个 Agent 模块而付 10万—100万元;客户会因为自己不再需要每天安排、记忆和推动这批工作而付费。
1.8 不同阶段的资源与人才
角色:1 名 AI-Native 全栈工程师;1 名广告业务或内容产品负责人;设计支持按需加入。
核心目标:验证文案和图片质量;找到高频单点任务;快速形成可用原型。
角色:1 名深懂 Retainer 的产品负责人;1 名资深全栈或 Tech Lead;1—2 名 AI 应用工程师;1 名知识与评测工程师;1 名产品设计或 Agent Operations;PM、文案和设计作为长期共创组。
核心目标:建设品牌知识库;打通内容工作流;降低生成和协作成本;精确测量真实工时变化;找到最适合被数字员工接管的责任循环。
角色:1 名 AI Product Architect;1 名 Agent 系统架构师;2—3 名 AI-Native 全栈工程师;1 名状态、记忆或平台工程师;1 名评测与学习工程师;1—2 名 Agent Operations;1 名资深 Retainer 业务负责人(各角色职责与成本假设见第三部分·人才梯队)。
关键能力:事件驱动系统、持久化状态机、Durable Execution、定时与事件触发、任务队列、动态工作流、前瞻性任务、幂等重试与回滚、人机审批、Agent 可观测性、记忆和 Skill 更新、生产级评测。
最小责任闭环:不建议一开始承诺「完全接管品牌官号」。更现实的第一条责任可以是——持续保证未来七天始终有足够数量、达到内部初审标准的内容库存。它天然包含:每日巡检、任务发现、内容生产、质检、审批、库存补足、停止条件。
在第三层基础上增加:1 名品牌策略负责人;1 名高级创意负责人;1—2 名营销数据科学家;1 名数据工程师;1 名实验平台或增长工程师;1 名多模态内容理解工程师;更多内容质量与 Agent Operations 支持。
- 品牌策略负责人:负责品牌资产、用户文化、平台语境、内容母题、社交人格、长期品牌价值。
- 高级创意负责人:负责将系统发现的信号转化为栏目、系列、内容 IP、创意母题、跨平台矩阵。
- 营销数据科学家:负责内容与销售关联、增量实验、因果分析、内容和人群聚类、内容组合优化、区分虚荣指标和真实价值。
第四层最稀缺的不只是 Agent 工程师,而是:能够将数据异常解释成品牌机会,并将机会转化为长期内容资产的人。
第二部分 · 科技产品的价值层次
Retainer 的四个层次不是这个行业特有的。把「生成工具 → Copilot → 数字员工 → 价值发现引擎」推广开,就是一般科技产品的价值层次:
第一层出售功能,第二层出售流程效率,第三层出售岗位产能和注意力转移,第四层出售增长与价值发现。
| 产品层次 | 形态 | 人与 AI 的分工 | 典型定价假设 | 这一层卖的是 |
|---|---|---|---|---|
| 第一层 · 单点 AI 工具 | 任意 AI 生图、生文、生视频工具,摘要工具、简单聊天机器人、单点自动化插件 | 产品交付一个结果,用户仍持有全部 Context、任务和责任 | 收费对标软件工具、模型调用、使用便利性 | 单点功能 |
| 第二层 · 普通 SaaS / Copilot | 集中管理 Context、标准化流程、AI 生成、审批与数据分析 | 人仍负责想起任务、创建任务、推动流程、承担结果 | 每月 20—200 美元,复杂企业版可更高 | 软件能力和流程效率 |
| 第三层 · 数字员工 | 对明确且持续岗位责任负责的软件主体 | Agent 自主创建任务并推进,人集中审核关键判断 | 每月 1万—5万元,对标岗位成本、产能和管理注意力 | 岗位产能、责任闭环、注意力转移 |
| 第四层 · 价值发现引擎 | 主动发现更值得追求的目标和新机会 | Agent 提出并验证价值假设,企业重新配置资源 | 对标新增营收、毛利提升等增量,可按销售额提升抽成 | 对增长机会的持续发现和实现能力 |
四层的基本单位也不同:
工具的基本单位是功能,工作流的基本单位是流程,Agent 的基本单位是任务,数字员工的基本单位是岗位责任。
第一层:单点 AI 工具
典型产品:文案生成器、图片生成器、视频生成工具、摘要工具、简单聊天机器人、单点自动化插件。产品交付一个结果,但用户仍然持有全部 Context、任务和责任。收费对标:软件工具、模型调用、使用便利性。
第二层:普通 SaaS / Copilot
比较领先企业的内部工作流产品大致就在这一层——Retainer 语境下就是 1.2 的 Copilot 形态。
- 集中管理 Context
- 标准化流程
- 提供 AI 生成
- 提供审批和数据分析
- 减少工具切换
- 提升现有员工产能
- 想起任务
- 创建任务
- 进入系统
- 推动流程
- 追踪开放事项
- 决定下一步
- 承担最终结果
典型定价假设:每月 20—200 美元,复杂企业版可更高。这一层卖的是:软件能力和流程效率。
第三层:数字员工
数字员工的基本定义是:
一个拥有明确且持续岗位责任的软件主体。
长期工作状态、工作日历、开放事项、前瞻性任务、优先级、持久 Context、审批规则、停止条件。
被定时器、业务事件或状态变化唤醒;判断当前是否存在责任缺口;自主创建任务;动态编排工作流;调用工具完成执行;处理常见异常;将必要事项推送给人;从反馈和结果中持续学习;在责任满足时主动收手。
数字员工不要求永远忙碌。它应该:
持续负责、间歇执行、按需唤醒、完成后休眠。
数字员工不是一个会完成任务的 Agent,而是一个持续占据岗位、对长期目标负责,并能不断为自己发现下一项工作的软件主体。数字员工最核心的能力不是自动执行,而是接管工作注意力。真正昂贵的不是生成劳动,而是有人持续把这份工作放在心上。
典型定价假设:每月 1万—5万元,对标岗位成本、产能和管理注意力(凭什么这么收费,见 1.7 的三件必须证明的事)。这一层卖的是:持续岗位产能、责任闭环、管理注意力转移、人力配置改变、交付可靠性。
第四层:价值发现引擎
价值发现引擎不仅承担原有责任,还会主动发现:什么目标更加值得追求、什么工作没有价值、什么机会尚未被企业看到、什么实验可以创造新的收入和利润。
它的收费不再只对标软件和人力,而可能对标:新增营收、毛利提升、成本降低、新业务机会、被避免的错误投入。商业模式可以包括:基础服务费、部署费、持续平台费、增量收入提成、利润改善分成。
这一层卖的是:对增长机会的持续发现和实现能力。
第三部分 · 企业 AI-Native 成熟度
最后回到企业侧:一家公司整体处在哪一层?先看两个部门在四层里各自的样子,再给出四层的完整定义和判断层次的六个核心维度。
3.1 以两个部门为例看四层
以 HR 部门为例
HR 零散使用 AI 工具,例如用 AI 写 JD、总结面试记录、生成面试题,但能力依赖个人,无法沉淀成组织资产。
HR Agent,可以主动进行人岗匹配、筛选简历、沉淀人才池、辅助面试和招聘漏斗分析,但人才标准仍然需要业务部门凭经验提出。业务部门说要招一个资深 PM,Agent 就帮助 HR 更快找到资深 PM。
AI 打通 HR 与销售、运营、交付、财务等全公司信息,重新定义人才需求是如何产生的。它不再等待各部门报招聘需求,而是持续分析项目利润、客户评价、交付质量、员工表现和工作负荷,主动发现真正的组织能力瓶颈。例如,它可能判断公司增长受限并不是因为总人头不足,而是资深 PM 的稀缺能力被大量低价值协调工作占用,于是主动提出「资深 PM + 数字员工 + 初级员工」的新组织结构,并持续推动招聘、培训、岗位重组和 Agent 替代。
AI 从第一性原理重新定义 HR 的价值:HR 不是招人、管人,而是让组织的能力供给持续匹配价值创造的需求。它主动判断什么能力应该招聘、什么能力应该培养、什么能力应该外包、什么能力应该交给 Agent,并不断重新配置组织资源,让稀缺人才始终投入到最有价值的工作中。
以运营部门为例
运营零散使用 AI 工具,例如用 AI 写文案、生图、剪视频、做数据总结,但每个人仍然自行管理任务和上下文。
运营 Agent,沉淀 Prompt 池,自动生产视频和广告素材,回流数据,自动分析并迭代,提高原有内容生产和投放流程的效率。
AI 不再只是等待运营人员输入选题和要求,而是持续承担某个账号、渠道或增长目标的运营责任。它主动观察内容库存、排期、热点、竞品和数据表现,自主创建任务、生产内容、发起审核、跟踪发布和复盘,只把需要人类判断的策略问题和高风险事项推送给运营人员。人类不再每天提醒自己应该生产什么,而是被 Agent 告知今天已经推进了什么、还需要判断什么。
AI 重新定义运营的价值:运营不是持续生产内容,而是持续发现并占据价值缺口。它主动分析用户情绪、竞品空位、平台变化和业务结果,发现新的内容母题、细分人群、传播场景和增长机会,并通过实验验证。内容生产只是价值判断落地后的最后一步。
3.2 四层成熟度定义
第一层:个人工具辅助型企业
员工自行使用通用大模型、AI 编程工具、生成工具和自动化脚本。AI 能力尚未成为组织资产:使用效果依赖个人水平;Prompt 和经验随员工流失;数据没有系统回流;工作流程没有改变;无法衡量对财务结果的贡献。本质上仍然是一家传统企业,只是部分员工使用了 AI。
第二层:部门工作流提效型企业
比较领先的企业大致处在这一层。企业已经能够将不同部门的现有工作流程通过 Agent 提效,并在集团的粗粒度视角中带来成本、产能和财务数字改善——就是上面 HR 和运营例子里的第二层。但这一层的基本前提是:
不重新定义部门价值,只优化部门原本就在做的工作。
- 1—2 名资深开发者,或 AI-Native 的年轻开发者
- 1 名能够对部门业务流程建模的 PM
- 部门负责人愿意提供流程和数据
- 一定程度的 CEO 意志
- 基本的数据接入和权限支持
单任务耗时、人工步骤减少量、生成内容采用率、部门处理能力、单部门人力成本、单位产出成本、对收入和费用的财务影响。
这一层卖的是:把现有事情做得更快、更便宜。
第三层:企业流程重构型 AI-Native
第三层不再把现有部门和现有流程当作不可改变的前提。它从零开始重新定义:企业信息如何流动、工作如何被创建、部门如何协作、人与 Agent 如何分工、什么流程应该保留、什么流程应该取消——就是上面例子里 HR 发现「增长天花板是资深 PM 稀缺」、运营主动承担账号责任的那一层。
打破部门墙,建设企业级 Context。HR 和运营的第三层之所以在第二层做不到,是因为传统企业的信息分散在销售、运营、产品、研发、生产和交付、客服、财务、HR、管理层九个域。每个部门只能看到局部事实,因此只能做局部优化。第三层首先要完成的不是创建更多 Agent,而是建设统一的企业 Context,使系统能够持续理解:
- 客户为什么购买或流失
- 哪些项目收入高但实际亏损
- 哪些员工和能力真正影响交付
- 哪类问题正在不同部门重复出现
- 哪些内部目标彼此冲突
- 哪个环节限制了整个企业的增长
- 哪些业务假设已经失效
这本质上是 CEO 决心和 CTO 视野的问题。CTO 和 AI 产品负责人必须:① 观察全公司各部门真实流程;② 总结信息和效率缺口;③ 重新定义数据结构;④ 配合 CEO 打破部门隔离;⑤ 将信息资产变成 Agent 能够使用的持续 Context。
持续责任与自主任务循环。第三层系统不再依赖人每天进入软件主动创建任务。它的一轮完整工作是(与 Retainer 数字员工的 11 步循环同构):
持续维护目标和工作状态
Agent定时或因业务事件醒来
Agent判断当前状态与责任目标的差距
Agent自主创建并排序任务
Agent动态编排执行流程
Agent调用工具完成任务
Agent请求人类处理高风险例外
Agent → 人验收结果
Agent更新状态和经验
Agent在责任满足时停止并等待下一次唤醒
Agent人只在第 7 步作为高风险例外的处理者出现;虚线表示一轮结束后回到第 1 步。
因此,第三层的核心变化是:
工作注意力从人类转移给系统。
持续自主学习。第三层 Agent 要持续从以下信号中学习:人类修改、内容接受和拒绝、项目成功和失败、客户满意度、业务结果、执行异常、系统自身的错误。学习结果应被写入:长期记忆、业务规则、Prompt、评测集、Skill、模型路由、动态工作流、决策策略。早期不必让模型直接修改自己的权重,但必须确保:
同样的错误不会无限重复,同样的成功能够被稳定复用。
第三层所需人才梯队:
负责:观察全公司流程、定义责任边界、建立业务状态模型、明确人机分工、定义什么叫闭环和可交付、协调各 CXO 的认知。这一角色不能只是收集功能需求。
工作范围:Agent 编排、记忆系统、工具调用、RAG、长任务状态、动态规划、Human-in-the-loop、失败恢复、质量控制、学习闭环。需要建立三层系统:① 接地推理;② 质量检查;③ 经验学习。
核心目标是:把系统做成生产级 95 分闭环,能够自己把活干完,而不是简单调用模型 API。这是最难招聘、也最决定产品护城河的角色之一。
工作范围:提示工程、模型选择和路由、业务评分 Rubric、离线评测、在线质量监控、错误台账、回归评测集、失败原因归因、训练和微调。
最关键的指标包括:闭环度、未修改进入审核率、未修改直发率(仅适用于合同和风险允许的内容)、打回返工率、人工接管率、跨版本回归率。
Eval 在当前市场上仍是非常稀缺的专职能力,而数字员工的定价恰恰建立在是否能证明这些数字上。
工作范围:数据摄取管线、企业信息资产结构化、后端、前端产品工程、权限、审计、基础设施、企业系统集成、生产稳定性。其价值不是只接需求,而是能够亲手 Ship 从数据到底层系统再到用户体验的完整产品。其中,数据摄取和结构化通常是单块工程量最大的部分。
工作范围:原型探索、工具接入、测试、数据标注、例行流程运行、评测样本准备、新模型实验、边缘自动化。他们可以承担高频试验和杂活,但不应成为 Eval 的最终 Owner,也不应独立承担生产系统架构。
负责:检查错误唤醒和漏唤醒、检查无效任务、分析失败轨迹、清理污染记忆、维护客户特有规则、更新 Skill 和评测集、观察 Agent 是否真正减少人类注意力。
在当前阶段,「持续学习」不会完全自动完成。Agent Operations 相当于数字员工的培训、管理和绩效运营部门。
组织条件:CEO 强烈支持;有跨部门视野的 CTO;企业信息资产可接入;部门墙能够被打破;权限和审计体系完善;有真实业务环境作为持续训练场;管理层接受重新设计岗位和流程。
第四层:价值发现与价值创造型 AI-Native
如何让企业以更优的方式持续运转?
企业究竟应该创造什么价值,以及还有什么价值尚未被发现?
第四层不只是将任务交给数字员工,而是从第一性原理出发,重新定义各部门存在的价值——就是上面例子里 HR 变成「企业能力配置系统」、运营变成「市场认知、价值验证和机会占领系统」的那一层。
第四层的企业循环:
持续获取企业内外部信号
发现价值缺口
形成业务假设
设计低成本实验
组织执行
判断真实增量
将成功模式规模化
将经验写回企业认知系统
再次寻找更高价值目标
虚线表示一轮结束后回到第 1 步,形成持续的价值发现循环。
所需条件:第三层人才梯队已经成立;全公司信息资产已经打通;部门墙已经被破除;CEO 愿意重新审视现有业务;CTO 持续跟踪 AI 能力边界;企业允许 Agent 质疑原有任务;企业允许 Agent 推动实验和资源重新配置;绩效从「完成多少任务」转向「创造多少价值」。
3.3 判断 AI-Native 水平的六个核心维度
把前面所有例子抽象掉,真正决定一家企业(或一个产品)处在哪一层的是六件事:
| 决定因素 | 关键问题 |
|---|---|
| 1 · Context 打通到什么范围 | 个人、部门、全企业,还是企业内外部环境 |
| 2 · 结果闭环到什么程度 | 交付素材、辅助流程、承担岗位责任,还是创造经营增量 |
| 3 · 工作注意力由谁持有 | 人是否仍需记住任务、主动进入系统并推动流程 |
| 4 · 系统能否持续学习 | 是否会从反馈、失败和业务结果中改变未来行为 |
| 5 · 系统拥有多大的行动权限 | 能否跨部门、跨系统读取信息并执行动作 |
| 6 · 企业是否重新定义了流程与价值 | 是在旧流程上提效,还是重新决定什么工作值得做 |
六个维度在四层上的递进,可以汇总为一张矩阵:
| 维度 | 第一层 | 第二层 | 第三层 | 第四层 |
|---|---|---|---|---|
| Context 范围 | 用户临时提供的信息 | 一个部门的知识、流程和历史数据 | 全企业前后端信息资产 | 企业内部 + 外部环境持续吸收 |
| 结果闭环 | 交付单个素材 | 交付流程效率 | 交付岗位责任 | 交付业务增量 |
| 注意力所有权 | 人持有全部 Context、任务和责任 | 人想起该让 AI 做什么 | AI 想起该做什么,并告知人 | AI 主动发现更值得做的目标 |
| 持续学习 | 无系统沉淀,经验随员工流失 | 部门内数据回流与素材优化 | 状态 + 偏好 + 技能学习 | 再加结果策略学习 |
| 权限与组织 | 个人工具,无企业权限 | 部门内数据接入 | 跨部门权限,治理结构同步变化 | 全公司信息资产打通,Agent 可质疑任务 |
| 流程与价值定义 | 流程完全不变 | 不重新定义部门价值,只优化现有工作 | 重新定义流程与人机分工 | 重新定义什么工作值得做 |
维度一:Context 范围
第一层,AI 只拥有当前用户临时提供的信息。第二层,AI 能读取一个部门的知识、流程和历史数据。第三层,AI 能连接企业前端销售、运营、产品、交付、研发、客服、财务和 HR 的信息资产。第四层,AI 不只理解企业内部,还能持续吸收市场环境、竞争对手、用户行为、技术变化、社会文化、供应链和行业变化。
维度二:结果闭环与定价类别
决定产品落在哪一层的,不是模型多聪明,而是:
它到底交付了什么结果,以及结果闭环到了多少分。
| 层 | 交付物 | 例子 |
|---|---|---|
| 第一层 | 单个素材 | 生成一篇文案、一张图片或一份摘要 |
| 第二层 | 流程效率 | 帮助 PM 更快完成选题、文案、设计和报告 |
| 第三层 | 岗位责任 | 持续保证未来七天始终有足够的内容进入审核队列 |
| 第四层 | 业务增量 | 将普通官号矩阵做成能够持续带来品牌认知和销售增长的内容资产 |
可以将商业价值理解为:
维度三:工作注意力所有权
这是第二层和第三层最关键的分界——开篇第二、第三种早晨的抽象版本。
人类仍然需要:
- 记住今天应该做什么
- 主动进入系统
- 创建任务
- 判断任务顺序
- 追踪未完成事项
- 决定什么时候继续
AI 节省了执行劳动,但开放回路仍存在于人的脑中。
数字员工负责:
- 工作日历
- 待办队列
- 内容库存
- 未关闭事项
- 下一步动作
- 重新唤醒时间
- 任务优先级
人类不再主动找工作,而是被系统告知。
第二层是人进入系统找任务,第三层是系统把需要人判断的事项推到人面前。工作注意力真正转移的标志,不是 AI 生成了多少内容,而是人不再需要记住任务、维护待办、追踪开放事项和判断何时继续。
这意味着 AI 不只是接管了劳动,也接管了管理注意力。
维度四:持续学习能力
持续学习不能只理解为在线训练模型参数。企业 Agent 的持续学习至少分为五层(Retainer 的四层学习是其中前四层的具体化,见 1.5):
记住工作做到哪里
记住客户和管理者如何修改内容
把成功经验上升为规则、Skill 和工作流
根据业务结果改变未来资源配置和行动方式
直接更新模型参数,同时避免遗忘旧能力
企业数字员工至少应做到前三层;第四层是价值发现引擎的重要基础。第五层仍属于基础模型前沿研究,不是产品成立的必要条件。
维度五:权限与组织结构
Agent 能否创造价值,受制于它拥有的信息和行动权限。如果 HR Agent 只能访问简历,它只能优化筛选。如果它可以访问员工业绩、项目毛利、客户评价、交付质量、岗位协作关系、未来业务规划,它才可能重新定义公司真正缺少的能力。
因此,从第二层进入第三层,本质上不仅是技术升级,也是数据治理、权限治理、部门边界、绩效机制、决策权分配共同发生变化。
维度六:观察、蒸馏、定义
真正的 AI-Native 产品定义不是让业务部门提交功能需求,而是完成三件事:
坐在 PM、文案、设计、HR、销售等岗位旁边,观察真实工作:
- 信息从哪里来
- 人如何做判断
- 什么地方需要反复切换上下文
- 哪些工作只是历史习惯
- 哪些问题真正影响利润
将杂乱劳动蒸馏为:
- 目标
- 状态
- 约束
- 判断标准
- 异常类型
- 责任边界
- 可验证结果
重新定义:
- 什么任务值得保留
- 什么流程应该消失
- 什么责任可以交给 Agent
- 人类应该在哪些节点介入
- 产品最终交付什么结果
最终总结
企业 AI-Native 的四层、科技产品的四层与 Retainer Agent 的层次,可以浓缩为一张表:
| 层 | 企业 AI-Native | 科技产品出售物 | Retainer Agent |
|---|---|---|---|
| 第一层 | 员工使用 AI 工具 | 出售功能 | 员工每天手工点点点 |
| 第二层 | AI 帮助部门更快完成现有工作 | 出售流程和效率 | 人每天想起要生产什么,再来系统操作 |
| 第三层 | AI 接管岗位责任、工作注意力和开放事项,重新设计工作如何发生 | 出售责任闭环、岗位产能和注意力转移 | Agent 每天判断应该生产什么,已经推进完成,再通知人集中审核 |
| 第四层 | AI 从第一性原理重新判断什么工作值得做,并主动发现和创造更大的价值 | 出售增长、利润和价值发现能力 | Agent 不只稳定运营官号,还持续发现和实现官号矩阵远超 Social Presence 的品牌与销售价值 |
因此,数字员工最准确的定义是:
数字员工不是一个会完成任务的 Agent,而是一个持续占据岗位、持有工作注意力、对长期责任负责,并能够从经验中持续学习的软件主体。
而价值发现引擎则是:
它不仅持续完成这份工作,还不断发现这份工作原来能够创造怎样更大的价值。
附录 A · 当前市场与前沿业界如何理解「数字员工」
A.1 市场上并不存在统一定义
旧一代自动化厂商通常把数字员工定义为能够端到端执行企业流程的软件机器人。例如 Automation Anywhere 强调由 AI、机器学习、RPA 和分析能力共同构成的「虚拟员工」,能够顺序完成一组业务任务;UiPath 当前则将单个 AI Agent 描述为能够从头到尾完成一项特定任务的自主数字员工。(Automation Anywhere)
Salesforce 使用「Digital Labor」概念,强调 Agent 具备特定角色、企业知识、行动能力并可全天候工作;Microsoft 则强调,应像管理员工一样管理 Agent:明确角色、限制权限并持续监督。(Salesforce)
因此,目前市场最低标准大致是:
能够自主完成过去由某个岗位负责的一组任务,就可以被包装成数字员工。
但本文采用一个更严格的定义:
数字员工,是一个对明确、持续的岗位责任负责的软件主体。它持续维护工作状态与开放事项,在周期或业务事件发生时主动检查责任域,自主发现并创建任务,动态编排工作流,只将必要判断和最终结果推送给人类;同时,它会从反馈和业务结果中更新记忆、技能与行动策略。
这里的核心不是「24 小时不断运行模型」,而是:
责任持续存在,系统能够在需要时自己恢复工作。
A.2 前沿大模型业界正在补齐什么能力
当前前沿 Agent 研究已经不只是追求更高的单次推理能力,而是在补齐一系列「长期工作主体」所需的能力:
Agent 能否跨越多个小时、多个会话甚至数天,持续推进同一个目标。OpenAI 已将长时程任务、定时恢复和跨天继续工作产品化;Anthropic 也将跨上下文窗口的状态交接、长期任务恢复和 Harness 设计视为长时程 Agent 的关键问题。(OpenAI Developers)
Agent 不只需要知道「过去发生过什么」,还需要知道:工作做到哪一步、当前方案是什么、哪些路径已经失败、为什么暂停、下一步等待什么、什么事项仍未关闭。微软的 STATE-Bench 开始专门评测 Agent 是否能够利用过去经验改善后续企业任务;PlugMem 等工作则尝试将原始交互转化为可复用的长期知识。(Microsoft)
系统能够:按周期醒来、因业务事件醒来、在条件满足后恢复此前暂停的任务、在没有直接 Prompt 时继续承担责任。OpenAI 的 Workspace Agents 和 Codex Automations 已将计划执行、重复运行、保留上下文和未来自动恢复纳入产品能力。(OpenAI)
Google 的 ReasoningBank 试图把成功和失败经历蒸馏为可复用的推理策略;Titans、MIRAS 和 Nested Learning 则探索更长时程的记忆更新与持续学习。(Google Research)
前沿厂商越来越明确地认识到,能力不只来自基础模型,还来自模型外部的:上下文组织、任务状态、工具环境、记忆系统、执行日志、评测集、失败恢复、人类审批。Anthropic 在长时程 Agent 的实践中强调,Harness 设计会显著影响 Agent 跨会话推进工作的能力;OpenAI 也将持久状态和长任务 Harness 作为 Agent 工程的重要组成部分。(Anthropic)
这说明:
数字员工不是一个更大的 Prompt,也不是一个永远运行的模型,而是「模型能力、持久状态、唤醒系统、动态规划、工具执行、评测和持续学习」共同构成的生产系统。
附录 B · 科技产品从需求发现到运营的工作流程
B.1 需求发掘
需求发掘需要 CEO、CMO 或具备深厚市场经验的人参与。目标不是收集功能建议,而是理解:谁最痛苦、问题是否高频、当前如何解决、为什么现有方案失败、谁拥有预算、谁承担失败风险、问题对利润造成多大影响、为什么现在可以被 AI 解决。
最终交付物不是功能列表,而是:一套可验证的价值假设。
B.2 产品定义
产品定义需要 CTO、AI 产品负责人、AI-Native 工程师和业务专家共同完成。核心方法是:观察 → 蒸馏 → 定义(与维度六同一方法,此处为产品定义阶段的操作版)。
- 研读全公司相关信息资产
- 坐在不同岗位旁边观察
- 进行针对性采访
- 组织焦点小组
- 复盘成功和失败案例
- 记录上下文切换和返工
将真实工作蒸馏为:
- 责任
- 输入
- 状态
- 约束
- 判断
- 异常
- 输出
- 验收标准
- 产品承担什么责任
- 人类承担什么责任
- 什么流程需要重构
- 什么流程应该取消
- 什么情况下 Agent 可以自主执行
- 什么情况下必须请人决策
- 产品属于 SaaS、数字员工还是价值发现引擎
这一阶段需要所有 CXO 对产品层次形成一致认知。
B.3 设计研发
需要一个资深产研团队完成四大块:
数据摄取、文档和聊天结构化、权限、知识库、项目状态、长期记忆。
Trigger、Planner、任务队列、工具调用、动态工作流、审批、失败恢复、Evaluator、停止条件。
前端、后端、企业系统集成、审计、可观测性、成本控制、多租户、数据隔离。
质量 Rubric、黄金数据集、错误台账、回归测试、线上抽检、不同模型和工作流对比。
B.4 上线运营
AI-Native 产品上线后,需要持续运营。运营不是只做销售和客服,而是跑:
核心工作包括:测量未修改进入审核率、测量未修改直发率、测量打回返工率、分析失败轨迹、建立错误台账、将重复错误加入回归集、更新品牌记忆规则和 Skill、观察人工接管原因、用真实项目财务结果证明价值。
早期推广应依靠灯塔项目的硬数字,而不是 Agent 演示:人工工时下降多少、每个品牌管理分钟数下降多少、单团队可服务品牌数增加多少、项目毛利率改善多少、交付质量是否稳定。