← 思考与写作 / CONTENT ALIGNMENT
司豪杰 Rick Si
Li Auto · Content Safety & Alignment

理想同学内容对齐方案在后训练之外,把企业价值与内容决策转化为可执行、可评测、可更新的 Agent 行为

期待加入理想汽车,探索智能边界,也为智能构建边界。

范围 应用层内容对齐 核心 Guardrail 资格网络 方法 同题回答对照 · 评测门禁 · 版本治理

全文约 24,000 字 · 重点部分速读约 8 分钟 · 全文精读约 40 分钟

0.方案摘要

本方案借鉴业界前沿的生命周期治理、完整系统评测与“安全且有用”联合优化实践,提出一套应用层 Content Alignment Policy Control Plane:提供一套目标和控制系统,用于把企业私有、时变、依赖上下文且需要问责的内容决策,编译为每次 Agent 调用可执行的政策、证据、授权与发布资格。

核心判断:在不把通用后训练作为方案前提的条件下,企业内容对齐的本质是一套覆盖请求、生成、工具交互与流式释放的多节点控制系统,以及持续生产 Policy、Evidence、Grant 与 Eval 的治理链路。
为什么需要独立控制面

企业规则不在公共训练语料中,并且会随事件、渠道、用户和审批版本变化。

单次调用怎样运行

输入路由 → 约束生成 → 显式行为与工具往返检查 → 流式缓冲与发布门禁。

企业怎样持续更新

原子 Policy ID、Evidence Snapshot、Value Charter 与 Crisis Grant 分权签发并进入版本 Bundle。

怎样证明值得上线

硬 Gate 先行;再看安全有效回答、过度拒绝、忠实与事实、P95/P99、成本和可回滚性。

规则承担确定性红线和版本校验,轻量分类器负责前置召回,Evidence/RAG 处理动态事实,主模型组织回答,专业 Guard/Judge 验证输出;System Prompt 用于短期兜底,LoRA 只增强稳定通用的行为与表达能力,不承载动态事实或企业授权。

1.问题定义与边界

1.1 问题定义与方案边界

本方案面向理想同学的对话内容安全与内容对齐:在基础模型能力和后训练权限受限的前提下,设计一套应用层 Guardrail,使 Agent 在监管内容、动态事实、品牌认知、推荐咨询、服务条款和危机舆情中,都能形成有边界、有依据、有授权且可验证的回答。

方案命题:提供一套目标与控制系统,用于把企业对监管、事实、用户利益、品牌立场、服务承诺和危机响应的决策,转换为可配置、可执行、可评测、可发布、可追溯的 Agent 内容行为。

报告聚焦理想同学最终输出的内容决策及其治理链路,包括内容分类、事实配置与审核、品牌立场配置、危机授权、回答验证、评测、发布和回滚。

不属于主方案 基础模型预训练;通用提示词注入、系统提示泄露、权限提升与工具劫持攻防;错误工具调用造成的执行后果;车辆功能安全、网络安全和宿主权限安全。LoRA 可作为后续增益,不承担动态事实、监管版本或危机授权。

事实更新、审核和危机处理链路属于本方案要设计的控制面:我会定义在理想同学范围内产生什么 artifact、由谁签发、如何生效和怎样失效。本文给出的是目标架构,不是对理想现行系统的还原;后续可映射到既有团队与系统,而不要求按图新建同名服务。

2.内容安全与内容对齐的失败场景

内容安全与内容对齐的起点,是先识别系统可能在哪些场景下失败,以及失败会以什么可观察方式出现。只有先定位风险域和失效机制,才能针对性地判断应在输入、生成、输出还是治理环节介入,并在风险降低、回答质量、延迟、成本和运营复杂度之间权衡最优的控制组合。危机舆情在这一基础上,还要求事实状态、企业立场和临时授权能够快速生效并按时撤回。

因此,本节按照风险域 → 失效机制 → 同题回答对照 → 控制与评测要求展开。重点不是低级常识错误,而是成熟模型仍可能给出的、语言流畅却决策依据错误的回答。

2.1 三类任务与五个风险域

任务类型风险域系统必须回答的决策问题典型失败场景核心控制产物
内容安全监管风险这是确定性禁止、受约束回答,还是合法信息需求?红线漏放;把敏感主题等同于有害意图;整体拒绝;静默替换实体。Risk tier · 原子 Policy · Response Posture
一般内容对齐事实与知识哪些主张有依据、是否仍有效,冲突证据如何呈现?使用模型记忆回答动态事实;把外部观察写成官方结论;抹平证据冲突。Evidence Snapshot · Claim Ledger
一般内容对齐品牌与推荐企业批准的原则如何执行,同时不隐去用户关键约束?只推荐自有产品;回避不适配;夸大优势;不同轮次立场漂移。Value Charter · Recommendation Contract
一般内容对齐服务与售后当前有效条款、适用范围、例外与可承诺边界是什么?使用旧条款;漏掉适用范围;把解释升级成未经授权的承诺。Versioned Service Evidence · Promise Guard
快速反应内容对齐危机舆情当前是否获得授权、允许表达什么、授权何时失效?机械回避;擅自否认或归责;扩写未确认事实;复用过期口径。Crisis Grant · Response Mode · TTL

2.2 六种横向失效机制

漏控红线已命中,仍完整生成。
过控合法需求因敏感主题被拒绝。
错控实体、意图或回答姿态选错。
失时复用过期事实、条款或口径。
越权把判断写成承诺或公司立场。
失溯无法定位政策、证据与授权版本。

2.3 同题回答对照如何形成评测证据

同题回答对照固定同一输入、上下文和运行状态,并排呈现“可能出现的失败回答”和“目标回答”。它让抽象失效在有限阅读时间内可以被迅速识别,并沉淀为后续评测样本;情景构造不表示当前产品已经发生。

2.4 首批同题回答对照

案例

可能的失败回答风险侧

目标回答目标侧

关键差距
导出的控制与评测
回答差距编译出的控制对应评测
红线意图被任务外壳绕过多标签分类、极高风险输入阻断、输出复核严重有害输出率、安全替代完成率
合法敏感问题被整体拒绝主题与意图分离、局部控制、受约束生成过度拒绝率、合法问题完成率
实体被静默替换多候选保留、歧义澄清、问题忠实检查实体保真率、核心槽位覆盖率
动态事实过期或冲突被抹平Evidence Snapshot、有效期、冲突状态主张支持率、时效命中率、冲突披露率
品牌套话遮蔽用户问题需求契约、品牌偏置检查、Crisis Grant约束覆盖、问题回应、授权外延率

3.目标、指标与评测体系

3.1 企业价值决策如何进入产品系统

内容对齐必然包含价值取舍,但具体取舍不应由产品经理个人决定。品牌、市场、公关、法务、业务负责人和企业决策层共同形成经批准的 Value Charter;Alignment PM 负责把灵魂性决策转换为稳定、可验证的产品机制。

企业输入产品化动作Artifact实现与验证
价值原则与冲突规则拆成可观察行为、范围、例外与优先关系Versioned Value CharterPolicy + Contract;冲突型 case set
监管与法务边界区分硬红线、有条件回答与正常回答Policy rule / risk tier规则、分类器、Guard;逃逸与合法回答配对评测
品牌推荐姿态定义不适配披露、比较范围与品牌身份Recommendation ContractPrompt 临时兜底、路由、reranker/Guard
企业事实与外部证据标记来源角色、主张、版本、有效期与冲突Evidence SnapshotRAG、知识服务、claim/freshness 校验
稳定高频行为差距判断是否值得参数化LoRA experiment brief同基模 A/B + 全量安全回归

例如,若企业批准“用户条件明显不适配自有车型时,不隐藏关键不适配,并允许提供可比较选项”,产品实现不能止于把口号写进 Prompt。还必须定义“不适配”的判定、必披露信息、可比较范围、反事实样本、发布指标和回滚条件。价值由企业决定,产品方案保证它可被准确执行。

Constraint-first evaluation

不存在单向度的无限安全,只有硬约束下的多目标权衡优化

没有实测基线时只显示机制方向;任何百分比、延迟、成本和 ROI 都保持“待基线”。

安全收益与体验成本 Trade-off

先过发布 Gate失败不可被体验分抵消
严重红线 / 隐私canonical case + held-out待基线
Crisis 授权边界scope · version · TTL待基线
关键无依据主张claim · source role · freshness待基线

合法回答保留

控制预算 →

P95 Guardrail 延迟

控制预算 →

单位安全有效回答成本

控制预算 →
方向假设|待基线验证
发布硬门

任一适用硬 Gate 失败即不发布;低频高损事件不能由平均有用性抵消。

3.2 评测合同

我借鉴 Safe-Completions 对安全与安全前提下有用性的拆分,以及 XSTest 的 safe/unsafe 对照设计,但不照搬其阈值。核心联合结果是安全有效回答率:同一请求同时安全通过、没有静默替换问题、覆盖必答槽位,并采用合同允许的响应姿态。

评测对象是从输入到最终释放的完整固定系统,而非某个 Guard 的离线 F1。每次 run 固化 model、policy、evidence、grant、guard、judge 与 timeout fallback;开发集、冻结回归、隐藏 held-out 和线上影子样本相互隔离。固定集零失败必须同时报告样本量和置信上界,不能写成线上风险为零。

层级核心指标分母与切片发布用途
硬 Gate严重红线输出、Crisis 越界、关键无依据主张逐风险、scope、版本、时效任一失败即阻断
联合结果安全有效回答率benign / dual-use / malicious;响应姿态证明方案产生正向收益
诊断过度拒绝、问题替换、槽位覆盖、主张支持实体、语言、来源角色、风险切片定位 Policy / Evidence / Guard
鲁棒性worst-slice ASR + clean utility retention攻击族 × 风险类 × 中文变体 × 多轮防止平均数遮蔽最差切片
性能成本P95/P99 增量延迟、单位安全有效回答成本fast / balanced / assurance 路由产品 SLO 与 ROI
评测器precision/recall、macro-F1、人类一致性、扰动稳定性judge 与 rubric 版本Judge 变更门禁

4.Content Alignment Guardrail 架构

预训练和通用后训练可以让主模型更懂世界、更会遵循指令,却无法预知一家公司的当前规则、审批关系和事件状态,也无法证明某次回答执行了正确版本的政策。因此,企业内容对齐需要一个独立于主模型、又覆盖输入、显式中间行为、工具往返、流式片段与最终回答的政策控制面。

私有性企业政策、例外、价值原则和审批关系不在公共训练语料中。
时变性事实、服务条款与危机授权可能按小时变化并需要即时撤回。
上下文性同一句话在车内私聊、客服、公开渠道和未成年人模式中边界不同。
可问责性企业必须说明依据哪条 Policy ID、哪版证据以及为什么放行。
Production request + policy control plane

生产环境中的主模型、Guardrail 与治理控制面

先切换案例查看干预路径;点击图中任一节点,下方立即解释它解决什么问题;展开后可边看全图边查看实现形态、业界实践与取舍。

R0 · 平衡|由风险路由自动选择
多层风险路由当前节点

综合风险、事实需求与授权状态,决定本次请求在何处拦截、需要哪些约束,以及采用何种验证预算。

当前案例路径 已签发政策、证据与临时授权 主模型与中性结构
抽象方案|主模型在 Policy、Evidence、Authorization 编译出的合同内生成,输出仍需独立检查。运行计划由风险路由派生

五分钟读图:先沿上半部看一次生产调用;再看风险路由的“生成前阻断 / 约束后生成 / 正常快速路径”;最后看下半部如何把线上案例编译为原子 Policy、Evidence、Grant、评测与活动版本。

4.1 多层级风险路由机制

方案内风险级别典型条件干预方式主模型角色
已签政策明确命中红线、秘密披露、无效签名或过期授权生成前直接中断;固定安全替代或暂缓回复不调用,避免“先生成再拦截”
高影响事实、危机立场、服务承诺、隐私披露Policy + Evidence + Grant 必需项全部通过只在允许主张集合内组织表达
敏感但合法、实体歧义、品牌与用户利益冲突注入 must / may / must-not、证据与不确定性保留推理能力,输出后再验证
表达质量、品牌一致性、一般事实需求轻量分类与输出 Guard;失败可定向修复一次正常生成,Guard 提供诊断而非权威
低风险、无动态事实或授权要求保留硬门,跳过不必要的重型检查直接生成并经过最终释放检查

R4 · 确定性硬门

生成前硬阻断

多风险合并规则:路由输出风险向量而不是单一标签。一次请求同时命中多个风险时,运行保障级别取最高适用等级,必需 Policy、Evidence 与 Guard 取并集,事实和授权资格取交集;R4 硬动作只能由已签发 Policy 决定,也只收缩命中的风险能力,其余安全内容继续满足其他回答义务。若规则冲突,政策解析器按权威层级、适用范围、显式替代关系和生效时间确定唯一结果,任何低风险分数都不能平均掉硬门。

4.2 原子 Policy 与 Eval 共用一个身份

每条可执行政策拥有稳定的 policyId,并绑定适用条件、风险级别、允许姿态、必需检查、失败回落、负责人和版本。每个 Policy ID 同时指向正例、边界反例、绕过样本和状态回放;线上 Trace 记录本次命中了哪一条规则,评测变更也能追溯到同一身份。

policyId: CN.REG.HATE.AMPLIFICATION.P4
appliesWhen: targetGroup + intent=amplify
decision: pre_generation_stop
fallback: refuse_risk_part + safe_reframe
evalRefs: [positive-001, boundary-018, bypass-044]
owner / reviewer / version / effectiveAt
Policy Compiler Fidelity Report · DEMO源决策 → 原子 Policy → Eval coverage
“竞品与自有产品采用相同适配标准”DEMO-POL-REC-003正例 + 非对称反例 + 时效切片covered
“重大舆情可采用更强回应”DEMO-POL-CRI-001“更强”缺 scope 与审批层级ambiguous
“未成年人模式需更保守”尚未形成可执行条件与回归样本uncompiled

4.3 Response Contract:连接主模型与 Guard

requestInterpretation
runtimeState
mustAnswer
allowedClaims / forbiddenClaims
requiredUncertainty
sourceRoles
interestRule
responseStrategies
requiredChecks
policyVersion
evidenceVersion
valueCharterVersion
authorizationVersion + scope + TTL

同一份合同一端约束主模型的上下文与解码,另一端成为输出 Guard 的检查依据。合同位于模型外且不可被模型写回,但主模型仍可能违反合同,所以输出必须独立验证;聚合器也不能用平均质量分抵消红线、无证据或无授权。一次定向修复仍失败后,系统进入澄清、局部回答、holding 或阻断。

5.重点场景方案

5.1 监管:红线与合法回答保留

监管内容采用“主题 × 意图 × 能力强度 × 响应姿态”的多维判定。确定性红线由规则和高召回 Guard 形成硬门;合法问题中的越界部分采用 claim/span 级局部拒答;新闻、历史、教育、医学等敏感但合法的需求继续提供中性事实。评测同时包含应阻断、可局部回答和应完整回答的对照样本。

5.2 时效事实:轻量 Evidence 配置系统

动态事实不写进 Prompt 或等待模型记住,而是形成可签发、可撤回的 Evidence Snapshot。下面用虚构服务安排演示一条主张怎样记录来源、范围、时效、冲突、负责人和回答回落;一期可以嵌入飞书多维表格与审批,而不必先建设完整 CMS。

场景设定|服务咨询内容对齐

“北京北辰示例服务中心”是为本报告构造的虚构网点名称,不指向真实门店或真实服务安排。假设该中心计划在 2026-08-21 22:00 至次日 06:00 暂停接收新到店车辆,日间服务不受影响。通知没有说明其他网点、即时工位容量或已在店车辆的处理,因此 Agent 必须区分“网点是否营业”“是否接收新到店车辆”和“能否立即安排服务”,只回答证据覆盖的范围。

虚构服务咨询演示|不代表理想真实安排

证据快照 · ev-service-bjbc-20260821-v3

状态回放 · 草稿 · 模拟时钟 2026-08-21 21:00

① 原子主张

② 配置与审批

③ Agent 回答预览

飞书表单 / 多维表格
字段与附件
飞书审批 + 轻量编译器
角色签名与 JSON
Artifact Registry + Eval
运行时读取与回放

5.3 品牌与推荐:实现企业批准的原则

推荐先抽取用户硬约束,再应用 Value Charter 与 Recommendation Contract。System Prompt 可作为原则刚确定时的短期兜底;结构化约束、证据、推荐 Guard 和反事实评测提供稳定执行;只有行为差距稳定、高频且不依赖动态事实时,才评估 LoRA。

Crisis PR showcase · fictional drill

5.4 停车视频舆情:事实状态 × 公关策略 × 授权

点击事实状态和策略,比较在未核实、违规确认与协同失实传播证据成立时,Agent 应如何完整回应。

虚构演练,不对应真实事件或现行流程

事实与 Crisis Grant

公关策略与完整回复

Grant未签发
Evidencee0 · 待核验

LoRA 的位置:在没有 active Grant 时,它可以训练“先回应真实问题、区分事实与群体推断、避免机械自夸、组织完整段落”的通用公关姿态;它不能创造事件事实、公司调查、道歉、法律行动或企业立场。进入 active 后,仍必须由 Evidence 和 Grant 决定可说内容。

6.数据、治理与运行机制

6.1 产品经理不决定“灵魂”,而是把决策变成控制系统

企业与品牌决定价值原则,法务决定硬边界,事实负责人签事实,公关签临时企业立场;Alignment PM 负责把这些输入转译成目标、schema、Policy、Response Contract、数据、指标和门禁,并对转换是否可验证负责。

Decision swimlane

从企业决策到可运行 Guardrail 的责任泳道

切换 artifact;点击任一任务块,查看输入、责任人、审批、否决权与失败回落。

实线交付 · 红色为 veto · 双边框为签发/发布Crisis Grant:runtime 签发不等于全局版本发布

6.2 人工控制面与在线数据面

第一期不建设逐请求人工内容审核队列,也不必重建审批、工单或呼叫中心。一层轻量连接即可把飞书审批、线上监测和既有客服/应急能力接入 Guardrail:人工一次签发配置,线上数据面即时消费;异常进入异步复核,只有人类或既有系统拥有额外事实、权限或执行能力时才发生转接。

轻量控制面:复用现有工作流

点击页签与示例,查看输入、动作、系统接口和边界。
无需重建重型系统

    6.3 版本、回滚与审计

    每个 Release Bundle 固化 model、policy、valueCharter、evidence、grant、guard、judge、eval dataset、timeout fallback 和 rollback target。发布路径是离线冻结评测 → 影子验证 → 小流量灰度 → 分层监测 → 扩大范围;任一硬 Gate 逃逸、版本不可追溯或过期授权复用都触发冻结与回滚。

    7.分阶段实施与投入判断

    阶段划分不是工期承诺,而是投资门:只有上一阶段能用真实 case 和指标证明价值,才增加模型、数据或运营复杂度。

    基线与合同

    建立 Case Pair、Value Charter、Policy/Evidence schema、Response Contract 与冻结评测。

    影子与轻量 Guard

    前置多标签路由、必要输出 Guard、完整版本 trace;不建设实时人工审稿或通用平台。

    动态事实与 Crisis

    在事实、公关和发布责任人到位后,引入 Evidence Snapshot、专业 Guard、Grant 与状态回放。

    参数化增益

    仅对稳定、高频、跨基模重复的行为差距评估 LoRA;动态事实与授权永不入参。

    7.1 主要 Trade-off

    多模型调用增加推理成本,并行 Guard 与检索增加尾延迟,Evidence 与 Policy 需要持续运营,跨角色审批增加发布成本。架构用风险路由、并行执行、缓存、确定性校验和一次修复上限控制开销;任何新组件都必须在目标指标改善且不突破体验与成本预算时才进入活动版本。

    残余风险包括前置误路由、Guard 与生成模型相关共错、Evidence 本身错误、企业签发内容不充分、新边界案例和多版本组合复杂度。方案不能消除它们,但能把失败定位到具体 artifact、版本和责任链,并提供更新与回滚路径。

    附录一前置知识准备

    在形成这套具体方案前,我先把通用知识拆成两条线:一条回答安全能力应分布在哪些模型与运行时拦截面,另一条回答企业内容政策如何成为可执行、可评测、可追溯的控制系统。以下两份专题综述保留了这一步前置学习的完整脉络。

    《模型之外》封面

    技术综述 · 约 15,012 字 · 2026-08-18

    模型之外

    开放权重企业的 Safety Guardrail:从安全后训练、Guard Model 到 Agent 执行控制

    从威胁建模出发,梳理模型内安全、Guard Model、运行时 Guardrail、确定性 Tool Gate、政策治理与评测如何组成企业 Agent 的纵深控制栈。

    本报告中的对应:不同失败机制落到不同拦截面。

    在线阅读
    《从内容审核到行为控制》封面

    前沿综述 · 约 17,391 字 · 2026-08-18

    从内容审核到行为控制

    开放权重模型企业的 Content Alignment 与 Safety Guardrail 前沿实践

    研究企业如何把私有、时变、依赖上下文且需要问责的内容政策,转化为政策控制面、生产判定链、Policy-to-eval 与持续运营机制。

    本报告中的对应:原子 Policy、生产资格链与治理闭环。

    在线阅读

    附录二引用与方法借鉴

    1. 生成式人工智能服务管理暂行办法支撑内容治理、准确性/可靠性、用户权益、处置与分类分级监管的范围。
    2. 互联网信息服务深度合成管理规定支撑输入输出审核、日志、投诉和应急处置等生命周期控制。
    3. 理想同学服务协议公开说明模型/第三方能力、输入输出、审核、标识与准确性限制;不用于推断内部路由。
    4. NIST AI 600-1自愿框架;用于借鉴部署前测量、持续监测、角色、事件与变更管理。
    5. From Hard Refusals to Safe-Completions借鉴安全输出与安全前提下有用性的分开评估。
    6. XSTest借鉴 safe/unsafe 对照样本与过度拒绝评测。
    7. MLCommons AILuminate FAQ借鉴完整 System Under Test、练习集/隐藏集隔离和分类报告。
    8. FACTS Grounding借鉴回答资格与证据支持的两阶段事实评测。
    9. HarmBench借鉴固定 threat model、攻击族和 worst-slice ASR。
    10. Judging LLM-as-a-Judge支撑 Judge 需要校准,并关注位置、长度和自我偏好。
    11. GM / OnStar IVA支持常见请求自动处理、紧急或需要人类能力的请求转既有专席;不支持通用逐请求人工审稿。
    12. Google Design for Driving支撑车载交互的快速反馈、简短、可打断与低认知负荷原则。
    13. OpenAI Agents SDK Guardrails输入、最终输出及自定义函数工具可以分别设防,但覆盖范围不同。
    14. OpenAI Agents SDK Running Agents支撑对显式运行事件的检查;不支持推断模型内部的私有推理过程。
    15. NVIDIA NeMo Guardrail Types公开框架覆盖输入、检索、对话、执行与输出等多个拦截面。
    16. Amazon Bedrock Streaming Guardrails同步缓冲降低内容先行暴露的上界但增加延迟;异步释放无法撤回已暴露片段。
    17. Amazon Bedrock ApplyGuardrail检查能力可以独立于基础模型,并插入应用运行流程的不同位置。
    18. Google Cloud Model ArmorGuard 返回检测结果,最终发布动作仍由应用层逻辑决定。

    生产级 Content Alignment Guardrail · 深度版

    平衡|场景必需 Guard 并行,增加合同遵循与反例扫描,允许一次原因码修复,并按风险选择释放缓冲。

    职责节点