AI PM 工作操作系统
OS. AI PM 工作操作系统
回答的核心问题:AI PM 日常怎么工作?产出什么文档?和算法工程师怎么对话?功能怎么上线、出事怎么收敛、面试怎么准备?
这不是知识模块,是工作方式模块。前五模块(M0–M5)回答”AI 是什么、怎么设计、怎么度量、怎么拆竞品、怎么判断风险”;本模块回答”作为 AI PM,我每天在干什么、每周要复制出什么交付物”。它横切在所有模块之上——所以叫”操作系统”(底座),不叫”M6”。
与既有专题分工边界
本模块是方法与交付物层,刻意不重写以下专题已成体系的内容,只引用回链:
- OS 协作子系统 vs
0406AI 协作方法论:0406是 instruction / skill 设计与协作哲学的”家”,偏理论层;本模块补的是其下游的现场交付模板层(PRD 段、上线门槛、事故 SOP、权限边界),两者是上下游关系,不重复 instruction/skill 的理论讨论。 - OS / 落地模板 vs
0410AI 公司与产品(公司卡):0410是竞品素材层;本模块只在”面试弹药库”里调用 M4 的方法把 0410 的素材拆成卡,不在此堆砌公司卡。 - 验收指标 vs
0412评测系统化专题:0412是研究侧”怎么测模型/系统”(评测代际、LLM-as-Judge、benchmark 污染);本模块只讲”PRD 验收段该写哪些指标 + 怎么 review 评测可信度”,方法细节回链 0412 总览,不重写。 - 个人滴滴经验 vs
0423自我民族志专题:Rick 个人/滴滴叙事的”家”在 0423。本模块涉及滴滴 PRD 与晋升框架时,只做一句类比 + 回链,不展开个人故事,避免方法论滑成随笔。 - 风险治理模板(红队/事故/合规/审计)与 M5 风险模块:本模块 §5.5 的六个交付模板物理上落在 OS,其中红队、事故 SOP、合规自检、审计字段四块同时被未来 M5 风险模块引用(用别名回链,不重复落盘)。
核心主张(Synthesis)
AI PM 的工作产物有三类,且都需要相对传统 PM 重写:① PRD 要新增模型选型 / 验收指标 / 失败模式 / 数据采集方案四个 AI 专属段;② 与算法工程师的协作需要一套共同语言(不是把需求翻译过去,而是把决策权划分清楚);③ 求职准备不是”刷题”,而是把 M0–M5 的知识压缩成可在面试现场调用的判断力。 三类产物共享同一个底座:对 确定性→概率系统 切换的内化程度。
底座不稳,三类产物都会退化为”传统 PM + AI 包装”——这正是市场上大量伪 AI PM 的样子。
但仅有认知框架还不够。真正进入工作现场的 PM,反复需要的是每周都要能复制出来的交付物模板:一个功能要上线,用什么 Launch Criteria;一个 agent 要开放权限,如何写 HITL 边界;一个事故发生后,SOP 如何收敛;一个高风险场景,合规自检项有哪些。本模块因此分两层:§5.1–5.4 是认知与协作框架(回答”该怎么想、该怎么分工”),§5.5 是落地交付模板库(回答”现在就照着填什么”)。两层缺一不可——只有框架会停在”知道原理却每次从空白页开始”,只有模板会退化为僵硬的 bureaucracy。
5.1 子系统一:AI PRD 写作
滴滴时期的需求文档方法论在 024000怎么写产品文档(属主库 02 区,只读引用)。本节是它在 AI 时代的增量——不是替换,是叠加。
5.1.1 AI PRD 相对传统 PRD 新增的四段
传统 PRD 的骨架(背景 / 目标 / 用户故事 / 功能详述 / 交互稿 / 排期)仍然成立。AI PRD 在此基础上必须新增四段,缺一不可:
| 新增段 | 回答的问题 | 不写的后果 |
|---|---|---|
| 模型选型决策 | 为什么是这个模型/这条路? | 选型全靠算法团队拍脑袋,PM 失去话语权 |
| 验收指标(含失败定义) | “做好了”长什么样?“做坏了”到什么程度算不可接受? | 上线后无法判断成败,改进无依据(接 M2) |
| 失败模式与降级方案 | 模型在哪些场景必然失败?失败时产品怎么兜底? | 边界 case 翻车,信任崩塌(接 p305) |
| 数据采集方案 | 上线后收集什么数据喂回飞轮?埋点埋在哪? | 飞轮转不起来,产品无法迭代(接 p306) |
这四段的共同特征:它们都是”AI PM 独有,传统 PM 经验覆盖不到”的。换句话说,这四段是 AI PM 不可替代性的具体落点——不是”懂 AI”这个虚的能力,是”能写出这四段”的实在产物。
5.1.2 模型选型决策段怎么写
不是列几个模型对比表就完事。要写清楚三个判断:
- 任务性质:是判别任务还是生成任务?是单轮还是多轮?是开放域还是封闭域?——这决定了能用哪类模型、走哪种训练范式(见 c04 与 0415 后训练即产品专题)。
- 能力 vs 成本权衡:用最强模型(贵、慢、好)还是够用模型(便宜、快、可能不够好)?给出 m209 式的 COGS 测算。
- 可控性需求:需要严格遵循 schema 吗?需要可引用吗?需要可解释推理过程吗?——这决定是纯 Prompt、SFT、还是 RAG(见 m203)。
输出格式建议:一张”选型决策表” + 一段”为什么不选 X”的反驳性论证(比”为什么选 Y”更能体现思考深度)。
5.1.3 验收指标段怎么写
核心是同时定义成功标准和失败标准:
- 成功:任务完成率 ≥ X%,P90 延迟 ≤ Y s,单次 COGS ≤ Z(见 M2 §2.1 三层指标)。
- 失败:幻觉率 > A%,或逃逸率 > B%,或任何安全红线触发(接 0419 对齐 / 0429 计算语言学与多语言合规)。
- 灰区:介于成功与失败之间的”可接受但需迭代”区间——上线前就要约定这个区间怎么处理(直接上、灰度、还是打回)。
上面的 X / Y / Z / A% / B% 一律是占位符,PRD 落地时按具体场景填,不要套用任何”行业标准值”——AI 产品的验收阈值高度依赖场景与风险容忍度。
PM 含义:验收指标不是写完 PRD 补的,是定义需求时就要有的。没有验收指标的需求,等于没有定义清楚。
5.1.4 失败模式与降级方案段
枚举三类必然失败:
- 能力边界失败:模型在 OOD(分布外)输入上必然不行。要列”我们已知的 OOD 场景” + 兜底(转人工 / 友好拒绝 / 降级到检索)。
- 对抗输入失败:prompt injection / 越狱(见 0419 对齐哲学)。要列防御措施。
- 成本失控失败:用户滥用导致 COGS 爆炸(见 m209)。要列限流 / 配额。
5.1.5 数据采集方案段
呼应 p306。这里只写 PRD 里该交代的清单,飞轮的工程管道见 M2 §2.4,不在此重画:
- 采集哪些信号(显式/隐式,见 M2 §2.4.1)。
- 埋点位置(前端交互的哪个事件触发记录)。
- 隐私处理(去 PII,见 0429)。
- 数据如何回流到训练(SFT / DPO / RLHF,见 c04 与 0415)。
5.2 子系统二:与算法工程师的协作语言
这是 AI PM 最常被低估的能力。不是”懂技术”就行,是会用算法工程师的语言定义问题、划分决策权。
5.2.1 三类决策的权责划分
| 决策类型 | 谁主导 | 谁提供约束 | 冲突时怎么解 |
|---|---|---|---|
| 产品/业务决策(做什么功能、为谁) | PM | 算法给可行性约束 | PM 定,但要听算法的”做不到” |
| 技术实现决策(用什么模型、什么架构) | 算法 | PM 给体验/成本约束 | 算法定,但 PM 要能 review(见 §5.2.2) |
| 质量取舍决策(准确率 vs 延迟 vs 成本) | 共同 | 互为约束 | 这是协作的真正战场——见 §5.2.3 |
常见失败模式:PM 把第三类决策全推给算法,结果产品变成”算法能做到什么就做什么”,而非”用户需要什么就做什么”。反过来,PM 强行拍第三类决策的技术细节,会失去算法的信任。
5.2.2 PM 要能 review 算法决策的最低技术门槛
不需要会训模型,但必须能看懂:
- 评估报告里的指标含义(accuracy / precision / recall / F1,见 c14)——以及它们的陷阱。
- 成本测算(token 量、QPS、显存,见 m209)——能判断”这个成本合理吗”。
- 评估方法的可信度(测试集有没有污染、是不是 cherry-pick,见 0412)——这是最容易骗 PM 的地方。
这个门槛的真正用途:不是要 PM 提出更好的技术方案,是要 PM 不被算法团队的过度承诺或过度悲观牵着走。
5.2.3 质量取舍的协作框架
准确率 / 延迟 / 成本是三角约束(见 m209 三角)。协作时用这个框架:
- PM 明确”这个场景下哪个最重要”——客服场景准确率优先,创意场景延迟优先,B2B 场景成本优先。
- 算法给出”在某个优先项锁定后,另外两项的可行域”。
- PM 在可行域内做最终取舍。
关键:这个对话要基于数据(M2 的指标),而非”我觉得”。没有数据的取舍会变成立场之争。
5.3 子系统三:面试准备操作系统
接 0404。0404 已有六份文件覆盖 JD 分析、面试问题反推、代差观察、组织问题论证、技术底层逻辑。本节是它们的调度系统——怎么把六份文件变成可执行的准备流。
5.3.1 知识→判断力的压缩
M0–M5 是知识(懂 AI 是什么)。面试要的是判断力(现场能就任何 AI 话题给出有价值的看法)。压缩过程:
- 每个模块提炼 3–5 个”锚定判断”——不是知识点,是观点。例:M1 的锚定判断之一是”概率系统下,‘功能对了’≠‘功能每次都对’,这改变了所有度量设计”。
- 每个锚定判断配一个反诘问题——面试官可能怎么 challenge,我怎么接。见 AI 产品组织问题论证质量拆解 的”预判反驳”方法。
- 锚定判断之间要能串联——面试常问”你怎么看 X”,好回答是从一个锚点自然滑到另一个(M2 的度量 → M4 的竞品 → OS 的工作方式),展示知识的连通性。
5.3.2 三类面试题的应对模板
| 题型 | 示例 | 应对结构 |
|---|---|---|
| 产品判断题 | ”你怎么看 XX 产品?“ | M4 §4.3.1 四段式 |
| 设计题 | ”设计一个 XX AI 功能” | [[#5.1 子系统一 AI PRD 写作]] 四段的口头版——现场展示你会写选型/验收/失败/数据四段 |
| 开放题 | ”AI 的未来你怎么看?“ | 用 0411 代际演化 + 0434 护城河给一个有论据的趋势判断,避免”AGI 要来了”这种空话 |
5.3.3 准备节奏与弹药库
- 弹药库:从 0410 AI 公司与产品 挑 3 个不同生态位产品,用 M4 拆成 3 份深度卡——面试前反复磨这 3 张,比泛泛看 30 家有效。
- 弱点补强:用 AI 技术底层逻辑学习框架的评审与扩展 自测技术盲区,补到”能 review 算法决策”的门槛(§5.2.2)。
- 反推式准备:AI PM 岗位 JD 分析与面试问题反推 的方法——从目标 JD 反推要准备什么,而非盲目覆盖所有知识。
5.4 工作操作系统的自我迭代
OS 不是写一次定终身。每月做一次”工作复盘”:
- 这个月产出的 PRD,四段(选型/验收/失败/数据)写全了吗?哪段总是偷懒?
- 和算法的协作里,有没有该我拍而我没拍的决策?
- 面试/汇报时,哪个锚定判断说不圆?回去补。
- §5.5 的六个模板,这个月真的被拿出来用了吗?哪个总是绕过?
这个复盘节奏呼应滴滴晋升框架(031080晋升框架,主库 03 区只读引用)的”持续产出 + 可被引用”逻辑——AI PM 的成长复利,来自工作操作系统本身的迭代速度。
5.5 落地交付模板库
这一节是 OS 从”认知框架”落到”现场可填表格”的桥。六个模板对应六个高频、重复、可模板化的动作。价值在于被拿来用,先保留为一篇模板中枢,等实际用 2–3 轮后再拆原子页。其中红队 / 事故 SOP / 合规自检 / 审计字段四块,同时是未来 M5 风险模块的引用源(用别名回链,不重复落盘)。
模板里所有阈值字段(如”幻觉率 < A%“)保持占位符,按场景填,不要填死成具体百分比。
5.5.1 Launch Criteria(上线准入清单)
AI 功能上线前最怕”感觉差不多了”。更稳的做法是把上线准入写成检查表,至少覆盖五类信号:质量是否过线、风险是否可控、人工兜底是否准备好、监控是否可观测、回滚条件是否提前写明。
# AI 功能 Launch Criteria
## 上线对象
- 功能名:
- 版本:
- 流量范围:
## 准入条件
- 质量指标达到:
- 护栏指标不低于:
- 高风险 case 抽检通过:
- 人工兜底已接入:
- 监控 / 告警已配置:
## 回滚条件
- 一旦出现以下任一情况立即停:
5.5.2 红队计划卡
高风险功能没有红队计划,所谓”安全”通常只是没被认真攻击过。这里需要的不是理论定义,而是一张执行卡(与 0435 安全攻防 强相关,但视角偏”我这周怎么组织一次红队演练”)。
# 红队计划卡
- 目标系统:
- 攻击面:输入 / 检索 / 工具 / 权限 / 输出
- 测试类型:prompt injection / jailbreak / indirect injection / policy bypass / hallucination / over-refusal
- 成功判据:
- 记录方式:
- 处置优先级:
5.5.3 事故响应 SOP
AI 产品事故最常见的失控点不是第一次出错,而是出错后各方不知道先干什么。最小可运行 SOP 拆成五步:先止损 → 再定级 → 再溯因 → 再修复 → 最后复盘。
# AI 事故响应 SOP
## 事故概况
- 时间:
- 影响范围:
- 事故类型:
## 立即动作(止损)
- 是否停流:
- 是否降级到人工:
- 是否冻结高风险功能:
## 根因排查(溯因)
- 模型层:
- prompt / policy 层:
- 检索 / 数据层:
- 工具 / 权限层:
## 对外动作
- 用户通知:
- 内部同步:
- 是否需要法务 / PR 介入:
5.5.4 合规自检清单
0430 制度与监管 已把合规问题抬到很高,但 PM 现场更需要一张”开会能带、评审能用”的简表。
# AI 功能合规自检
- [ ] 是否涉及个人敏感信息 / 企业机密
- [ ] 是否存在自动决策后果
- [ ] 是否有用户可见的告知与边界说明
- [ ] 是否可审计、可回溯
- [ ] 是否存在高风险国家 / 行业的额外要求
- [ ] 是否涉及跨区域数据流转
5.5.5 HITL / 权限边界表
当系统从 copilot 走向 agent,最难写清楚的不是”功能流程”,而是哪些动作谁能做、谁必须确认、哪些绝不能自动执行。建议把边界表固定下来:
| 动作级别 | 例子 | 默认策略 |
|---|---|---|
| L0 纯阅读 | 查信息、读文档 | 自动执行 |
| L1 低风险写入 | 草稿生成、低影响修改 | 自动执行 + 可撤销 |
| L2 中风险执行 | 发邮件、改配置、批量处理 | 先确认再执行 |
| L3 高风险执行 | 财务、权限、外部发布 | 人工审批必需 |
| L4 不可代理 | 法律承诺、不可逆操作 | AI 不得直接执行 |
逐功能落地用这张可填模板:
# HITL / 权限边界表
| 功能 | 动作 | 风险等级 | 是否需确认 | 审批人 | 日志要求 |
|---|---|---|---|---|---|
5.5.6 审计日志字段最小集
这一层是连接 0430、0435 与工作现场的桥梁。PM 不一定自己设计日志系统,但至少要知道最低应当留下什么字段:
# 审计日志字段最小集
| 字段 | 含义 | 必填 |
|---|---|---|
| event_id | 事件唯一 ID | 是 |
| actor | 用户 / agent / 系统 | 是 |
| action | 做了什么 | 是 |
| object | 作用对象 | 是 |
| approval_state | 是否审批 | 是 |
| result | 成功 / 失败 / 回滚 | 是 |
| trace_ref | 可追溯链路 | 建议 |
| risk_level | 风险分级 | 建议 |
反例与张力
- 反对意见:“工作方式是因人而异的,不该写死成模块。” 反驳:写死的不是”你必须这么工作”,是”AI PM 的工作产物里,哪些是 AI 专属的、不可省的”。具体怎么干可以个性化,但这四段 PRD / 三类决策划分 / 三种面试模板 / 六个交付模板,是 AI PM 区别于传统 PM 的最低标准,不是上限。
- 张力一(PRD 太重):PRD 四段在早期 MVP 阶段可能”太重”。解法:早期可压缩成”一段一句话”的精简版,但心智上不能省——精简是表达形式,不是认知省略。
- 张力二(模板僵化):模板写得过细会很快变成僵硬 bureaucracy;只讲原则不给表格字段,又不会被真正拿去用。解法:模板只锁”最低应当问/记什么”,留白让现场填——既不空泛也不官僚。
衍生问题
- 能否把 AI PRD 四段做成一份可填空模板?(可放
0408AI 工具/或映射到00Meta/0030模板/) - “算法团队过度承诺/过度悲观”的具体识别信号有哪些?值得做一个判断清单。
- Rick 的滴滴安全产品 PRD 经验,哪些能迁移到 AI PRD、哪些是 AI 独有?(跨域复盘,个人叙事部分应落在 0423 自我民族志,方法迁移部分留本模块)
- §5.5 六个模板被验证常用后,可拆为
R01 Launch Criteria/R02 红队计划/R03 事故响应 SOP/R04 合规自检/R05 HITL 权限边界/R06 审计日志字段(注意拆分时文件名用「·」分隔,禁止 ”/”)。
关联节点
本模块内部:本文(OS),含三大子系统 + 落地模板库
底座(被横切的所有模块):
- c01 - 认知重构:从确定性系统到概率系统 — OS 的认知前提
- 度量与实验 — 验收指标段与协作取舍的工具
- 竞品拆解方法论 — 面试弹药库的方法
传统 PM 方法的迁移源(主库只读引用):
- 024000怎么写产品文档 — PRD 传统骨架(本节是它的 AI 增量)
- 031080晋升框架 — 工作复盘/成长的复利逻辑
求职兑现:
- 0404 AI PM 求职与职业发展 — 本模块的求职落点
- AI PM 岗位 JD 分析与面试问题反推
- AI 产品组织问题论证质量拆解
- AI 技术底层逻辑学习框架的评审与扩展
- AI 产品经理面试问题分析
技术 review 门槛:
- c14 - 模型评估体系与 Goodhart 陷阱 / 0412 总览 / m209 - 推理成本控制手册
§5.5 模板库的证据与风险回链:
- m207 - Agent 产品化:场景推演与失败模式 — 失败模式与兜底
- p304 - 防御性 UX:对抗延迟与幻觉 — 产品防御机制
- 0435 总览 — 红队 / 安全攻防
- 0430 总览 — 合规 / 监管 / 审计
- 0406 AI 协作方法论 — instruction/skill 上游,本节是其交付模板下游
来源 / 证据池
02工作/0240需求文档/024000怎么写产品文档.md— 传统 PRD 方法论03产品/0310产品成长/031080晋升框架.md— 成长复利逻辑04AI/0404 AI PM 求职与职业发展/六份文件 — 求职子系统素材04AI/0401AI 基础知识库/0框架.mdv2 工作操作系统底座 — 本文的命题框架来源- 模板库素材并入自 2026-06-16 gapfill 批《03 AI PM Operating System·模板库草稿》
本文为 v2 正典模块定稿(OS 工作操作系统),合并自 2026-06-16 v2-blank-modules 批(认知与协作框架,作底)与 gapfill 批(§5.5 六个落地交付模板)。final_path 独立成 04AI/04OS 工作操作系统/:OS 是底座不是 M6,字母前缀正好表达”非编号模块”,与 04NN 专题、04T 专题库清晰隔离。