目录 · 第五章
第五章/28 分钟阅读/06 / 08

好设计的新标准

第四章留下了三路证据:系统 eval、任务角色用户研究、领域或独立专家审查。证据能够说明客户退款 Agent 在什么条件下怎样表现,却不会自动给出验收结论。团队还要回答四个问题:哪些证据足以支持发布,门槛怎样随风险设置,未消除的风险由谁接受,以及什么变化会使本次结论失效。

仍以上一章的客户退款 Agent 为例。它读取订单、物流和现行退款政策,提出退款资格与金额建议,生成对客说明,并在授权后调用支付工具。一次顺利演示可以证明某条路径跑通过,却不能证明政策冲突时一定暂停、支付超时后不会重复退款,也不能证明客服看得懂证据、能够拒绝并接管。

可用性仍是质量的一部分。用户若无法理解信息、完成任务或获得清楚反馈,审计记录和权限机制不能补救这类问题。Agent 产品多出的验收压力来自另一层:系统会在运行时选择路径并改变外部状态,结果还会受到模型、提示、数据、工具和政策版本影响。单独使用操作顺畅度或任务完成率,无法覆盖行为边界、证据、接管与变化。

本章提出一套用于 Agent 产品的质量与验收框架。它是本书的操作化方法,不是所有行业通用的标准。团队需要按任务后果、可逆性、影响范围、适用制度和证据条件调整维度与门槛。第四章回答“怎样取得并关联证据”,本章只回答“怎样用证据作出可追责的验收决定”。

从适用范围和质量主张到证据、门槛、风险决定与重验
从适用范围和质量主张到证据、门槛、风险决定与重验

图 5-1 从质量主张到验收决定

这条链不能倒过来使用:团队不能先决定发布,再挑几项好看的结果补理由。第四章入口门发生在探索之前,决定一个委托应进入、收窄还是停止;本章验收发生在取得证据之后,决定当前版本应通过、限范围试点还是不通过。两次决定处理的是不同阶段的问题。

5.1 把质量主张写成可验收条件

“产品可信”“系统可控”“体验很好”都不能直接验收。它们没有限定用户、任务、版本和环境,也没有说明观察什么、达到多少才算通过。

这里要先分清三个层次。质量维度是检查方向,例如可回溯;质量主张是把一个维度放进具体用户、任务、版本和环境后提出的、可由证据支持或推翻的陈述;验收门槛则是本次决定中判定这条主张是否成立的条件。同一维度可以有多条质量主张,同一条主张也可能同时受到硬门槛、表现门槛与角色门槛约束。维度不能直接替代主张,主张也不能在没有门槛时自动变成“通过”。

本书把一条可验收的质量主张写成六个部分:

  1. 适用范围:哪些用户、任务、数据、工具、权限、环境和版本在结论内。
  2. 质量维度:要证明任务有效、边界稳定、依赖得到校准,还是其他具体质量。
  3. 可观察证据:由哪一路证据观察什么行为、结果或记录。
  4. 验收门槛:什么必须达到,什么绝不能发生,差异怎样分片查看。
  5. 失败动作:未通过时修复、降权、缩小试点还是停止。
  6. 决定与有效期:谁有权作出结论,何时到期,什么变化触发重验。

例如,“退款 Agent 值得信赖”不是可验收主张。更具体的写法是:“在普通境内订单、现行政策库和只生成退款草稿的 v0.9 范围内,Agent 遇到两个同时有效但金额规则冲突的政策版本时,必须保留两份来源、进入等待状态,并在政策负责人判断前阻塞支付工具;任一关键样本出现未阻塞支付,本范围不得通过。”

这条主张把第四章的 H-01 委托主张转成了验收条件:对象、证据、门槛和失败动作都能核对。

5.1.1 可用性仍然成立,但不能单独覆盖委托质量

ISO 9241-11:2018 把可用性放在明确的用户、目标和使用情境中讨论有效性、效率与满意度。1 这个范围并不陈旧,也没有把软件限定为静态工具。问题只在于:若团队只测用户是否顺利完成一次操作,就还没有证明 Agent 的连续行动、权限边界、外部状态、恢复和版本变化满足要求。

因此,本章不把可用性换成一组更时髦的词。更合理的做法,是保留可用性与任务结果,再补上委托成立所需的行为、证据、控制和治理条件。Microsoft 的人机 AI 交互指南也同时涉及能力预期、纠错、恢复、解释与行为随时间变化等问题;这些指南适合作为候选检查项,不能替具体产品给出验收阈值。2

5.1.2 本书的七个质量维度

下面七个维度用于组织验收讨论。本书建议先用前六项筛查会连续行动的 Agent,再按具体任务删除、拆分或增加维度;“必要判断能力保护”只在学习、专业训练或高风险监督等情境中纳入,不要求所有低风险辅助工具都承担同样目标。每一项的证据深度和门槛强度仍要与后果、可逆性和影响范围相称。

表 5-1 本书的 Agent 产品质量维度

质量维度验收要回答的问题可观察证据门槛与失败动作
任务与使用质量声明范围内的任务、结果和外部状态是否正确;特定用户能否在特定情境中有效、高效且满意地达成目标任务结果、业务回执、有效性、效率、满意度、任务角色与受影响者结果按任务、情境与人群分片设门槛;未通过则修复或移出范围
行为稳定与边界重复运行和异常条件下是否遵守数据、工具、权限、停止与恢复约定系统 eval、轨迹、权限记录、失败样本、专家审查越权、重复退款等关键禁行事件采用硬门槛;触发即阻断发布或降权
校准依赖任务角色能否依据系统表现与边界选择接受、核验、拒绝或接管含正确、错误、缺证和冲突结果的任务角色研究不以“更信任”为目标;无法识别关键缺口或没有真实否决权时,相关自主安排不通过
可回溯最终结果能否回到目标、证据、规则版本、工具动作、人工决定和外部回执追踪回放、版本记录、审计抽样、争议处理记录缺失关键来源、版本或外部状态时,不得对相应结果作出完整验收
可接管与恢复暂停/停止、接管/移交、回退/补偿能否按约定生效中断演练、状态核对、交接任务、恢复与补偿记录按后果设响应时间和完整性门槛;接管者无法知道已发生什么时,扩大自主范围不通过
可治理负责人、监测信号、临时控制、重验条件和关闭规则是否明确运行安排、告警演练、事件记录、版本与变更记录找不到处理人、重验触发器或安全降权路径时,不得按原范围发布
必要判断能力保护特定角色长期使用后,是否仍具备完成关键判断或监督 Agent 的能力无辅助任务、错误识别、理由质量、迁移表现、周期性演练仅在明确适用的学习、专业或高风险场景设门槛;不达标时调整目标、训练或自动化范围

“可信”没有单独列成一个让用户打分的维度。第三章已经把目标定义为校准依赖:人在当前任务中的依赖行为,与系统可验证的表现、行动边界和保护机制相匹配。更自然的语言、更多解释或更高信任评分,都不能单独证明这种匹配成立。关于适当依赖的研究也提醒,警告与解释可能没有预期效果,具体设计仍需通过用户行为验证。3

表中的几个相邻维度容易被混用。行为稳定与边界检查单次、重复和异常运行是否遵守行为契约;可回溯检查一项判断或动作能否沿证据链复原;可接管与恢复检查人能否重新取得控制,并处理已经发生、仍在进行或状态不明的影响;可治理则检查监测、降权、变更、重验与事件关闭能否贯穿产品生命周期。它们可以复用同一条日志或演练,却不能互相代替通过。

可回溯也不要求展示模型隐藏的内部推理。验收需要的是可验证事实:系统读取了哪版政策、使用了什么规则、调用了什么工具、外部状态如何、谁批准或修改,以及发生失败后采取了什么动作。生成一段流畅理由,不能替代这条证据链。

可接管则继承第三章的四组区分。暂停不等于停止,接管需要移交,回退不同于补偿,技术追踪也不会自动给出责任结论。验收要分别检查这些机制,不能用一个“人工处理”按钮代表全部恢复能力。

欧盟《人工智能法案》第 14 条只针对该法定义的高风险 AI 系统,其人类监督要求可以为一般产品提供检查方向,但不能据此认定普通退款 Agent 的法律分类或责任。这里所说的“第三章”是该法 Chapter III,不是本书第三章。Regulation (EU) 2026/1744 将该法 Chapter III Sections 1–3 中 Article 6(2) 与 Annex III 对应制度的适用时间推迟至 2027 年 12 月 2 日,将 Article 6(1) 与 Annex I 对应制度推迟至 2028 年 8 月 2 日,Article 6(5) 另有特别安排。4

智能系统质量的七个维度及其相互约束
智能系统质量的七个维度及其相互约束

图 5-2 委托质量不能被单一可用性指标覆盖

5.2 三路证据怎样进入同一个验收决定

第四章把测试对象分成 Agent 系统及其环境、人与系统在具体任务中的协作关系,又把证据来源分成系统 eval、任务角色用户研究、领域或独立专家审查。第五章不再重讲怎样设计这些研究,而是规定三路证据怎样进入验收。

证据路与门槛类型是两条轴,不是一一对应的分类。系统 eval 可以同时触及硬门槛、表现门槛与运行门槛,任务角色研究也可能发现关键禁行事件,专家审查则可能推翻样本覆盖或门槛本身。验收要把三路证据与三类门槛交叉核对;发生冲突时查明适用范围和原因,不能平均成一个分数。

5.2.1 三路证据不能互相代替

三路证据各有职责,也各有边界:

  • 系统 eval带入任务、重复试验、评分、轨迹、结果、版本与分片报告,可以支持系统在声明条件下的表现、边界、工具行为和回归判断;它不能替代真实任务角色是否看懂证据、能否据此接受、核验、拒绝或接管。
  • 任务角色用户研究观察实际承担操作、判断、审批、观察或补救的角色行为与理由,可以支持人能否理解证据、预测影响、拒绝、纠正和接管;它不能替代大量行为组合与版本回归,也不能证明专业标准本身正确。
  • 领域或独立专家审查检查专业正确性、样本覆盖、量表、残余风险与研究方法,可以支持评价标准是否适用于该领域、风险是否遗漏或低估;它不能替代真实使用行为,也不能替组织接受风险。

三路证据可以对同一质量主张给出不同结论。系统 eval 可能显示退款金额正确,但任务角色研究发现客服无法区分政策事实与系统推断;专家也可能指出样本没有覆盖促销叠加与跨境税费。此时不能把三项平均成一个“总体通过分”。差异本身就是验收结果:当前证据只支持更窄范围。

Anthropic 的 Agent eval 工程文章用 task、trial、grader、transcript/trajectory 与 outcome 组织系统评估,并区分自动 eval、生产监控和人工审阅。5 本章只借用这组工程术语说明报告需要可追踪,不把厂商实践当作统一验收标准。

5.2.2 门槛按后果设置,不能只看平均分

同一个总正确率可能隐藏不同的错误分布。把不符合条件的订单误判为可退款,与把符合条件的订单暂时移交人工,影响对象和补救成本不同;重复退款、越权读取和错误对客承诺也不能被大量低风险成功样本抵消。

本书建议把门槛分成三类:

  1. 硬门槛:关键禁行事件不得发生。例如,未授权支付、状态不明时直接重试、读取任务外订单。触发后不能用总体得分换取通过。
  2. 表现门槛:在声明样本和分片上达到组织设定的结果要求。例如,退款资格、金额计算、政策冲突识别和异常移交分别报告。
  3. 角色与运行门槛:实际任务角色能在限定时间和信息条件下理解、拒绝与接管,运行团队也能监测、降权和处理事件。

门槛的严格程度取决于后果、可逆性、影响范围、新颖性和可验证性。低风险、可撤销、容易核验的草稿可以采用抽样和较轻的人工介入;涉及资金、敏感数据、对外承诺或他人权益的动作,需要更强的证据、硬边界和有权签署。这里没有一套适用于所有组织的百分比。

平均分之外还要报告样本来源和关键切片。退款 Agent 至少要区分常规与例外订单、政策一致与冲突、支付成功与状态不明、不同用户角色,以及首次发布与版本变更。只在常规订单上表现稳定,不能推出系统已覆盖全部退款业务。

5.2.3 验收包必须让决定可复查

一次 Demo 只能作为验收包中的一个样本。完整验收包至少包含下列内容。

表 5-2 Agent 产品验收包

验收字段必须记录的内容
范围与版本用户、任务、数据、工具、权限、环境、模型、提示、规则与产品版本;明确非目标
质量主张本次要证明的维度、适用条件和影响对象
任务与使用质量明确用户、目标和使用情境;记录有效性、效率、满意度及相应失败切片
样本与切片样本来源、覆盖范围、失败与边界场景、关键人群和任务分组
三路证据系统 eval、任务角色用户研究、必要的领域或独立专家审查;缺少某一路时说明理由与限制
门槛与结果硬门槛、表现门槛、角色与运行门槛,以及逐项通过/未通过结果
未通过项已知失败、缺失证据、影响范围、临时控制和修复负责人
残余风险已缓解但未消除的风险、受影响者、可能后果与继续运行理由
有权决定人谁能决定通过、限范围试点或不通过;谁有权接受相应残余风险
验收结论通过、限范围试点或不通过;结论不得超出证据覆盖范围
重验触发器与有效期哪些变化、事件或时间节点使结论失效,届时重验哪些质量主张

验收包不是把所有材料堆进一个文件。它的作用是让结论可以沿着“范围—主张—证据—门槛—决定”回查。团队应能回答:这次通过究竟允许 Agent 做什么,不允许做什么;哪些失败仍然存在;谁决定继续;下次什么情况必须重新判断。

5.2.4 接受残余风险需要真实权限

测试无法证明所有未来情境都安全。团队能做的是说明证据覆盖到哪里,识别尚存风险,并由有权角色在组织制度和适用法律下决定接受、收窄或停止。

证据生产者、产品负责人、业务负责人、风险角色和最终签署者可以是不同的人。领域专家提出风险,也不自动拥有替组织接受风险的权力;客服在界面上批准一次退款,更不是替产品、工程或组织接受全部系统风险。

残余风险记录至少要写清:风险是什么,影响谁,发生后如何发现与控制,为什么当前范围仍可继续,接受者拥有什么决定权,以及该决定何时复查。正式验收结论还要记录签署者、签署范围、日期和附带条件。若团队说不清谁有权接受,验收结论只能缩小或暂停,不能把责任留给未来某个使用者。

NIST AI RMF 1.0 支持在具体情境中明确角色、影响、风险容忍、监测与处置,但不替组织指定统一签署人或数值门槛。6 本章的验收包和三种结论属于本书框架。

因此,“由谁签署”不是一张可以跨组织套用的岗位表。每名签署者只能在其正式授权范围内作出决定:产品或工程负责人确认版本与技术控制,业务负责人确认业务范围,风险或合规角色只在组织制度授权下接受相应残余风险。任何人的签名都不能越过适用法律、内部授权或他人的权益。

证据门槛如何随行动后果与可逆性变化
证据门槛如何随行动后果与可逆性变化

图 5-3 验收门槛应按后果设置,而不是只看平均分

5.3 候选生成变快后,验证可能成为瓶颈

生成式 AI 往往能降低候选文案、方案、代码或判断建议的生产成本,但验证成本不一定同步下降。退款 Agent 可以在很短时间内为大量订单生成资格与金额建议,团队仍要确认政策版本、边界行为、角色判断和支付状态。候选越多、行动越远,待验证的范围可能越大。

因此,更准确的说法不是“生产变得便宜,判断必然变得昂贵”,而是:候选生成成本下降后,验证能力可能成为新的交付瓶颈。 这是一种需要用项目数据检查的工作假设,不是所有 AI 产品都已经证实的经济规律。

5.3.1 区分三种吞吐量

团队可以分别记录三种数量:

  • 候选吞吐量:系统生成了多少建议、内容或动作计划。
  • 可验证吞吐量:自动机制与合适角色能够认真核验多少结果。
  • 验收后吞吐量:多少结果满足门槛,并在风险可接受的范围内进入真实使用。

候选吞吐量提高,不代表后两项提高。若退款建议快速积压,客服只能扫一眼结论就批准,系统增加的是待确认结果,不是可交付价值。

5.3.2 “验证债务”是本书的工作类比

本书借用“技术债务”的说法,把长期接受缺少样本、证据、版本或责任记录的 AI 结果称为验证债务。这是帮助团队讨论积压风险的工作概念,不是一个已有统一定义和计量方法的行业术语。

验证债务可能表现为:新政策上线但旧 eval 没有更新;退款建议已经采用却无法回到政策版本;支付工具变更后只测了顺利路径;人工审批长期存在,却没人验证审批者是否看懂证据。它不会因为当前没有投诉而自动消失。

团队若保留这个概念,就要把它写成可关闭的待验项:缺什么证据,影响哪些范围,临时采取什么限制,由谁补齐,超过什么时间必须降权或停止。只把问题放进“已知限制”列表,不算管理验证债务。

5.3.3 输出形状也是验收条件

相同结果可以有不同的审查成本。一段只给“符合退款政策”的结论,迫使客服重新查找全部材料;把资格结论、金额构成、政策版本、冲突、外部回执和本次变更并置,才能支持实际判断。

验收因此还要检查输出是否可审查:关键结论能否回到证据,大结果能否拆成可独立接受或拒绝的部分,异常与低把握内容是否优先呈现,前后版本差异是否可见。这里验收的是任务角色能否在真实压力下完成判断,不是要求所有产品使用同一种界面。

候选生成、验证与验收吞吐量之间的瓶颈和验证债务
候选生成、验证与验收吞吐量之间的瓶颈和验证债务

图 5-4 候选生成加速后,验证可能成为新的瓶颈

5.4 验收结论有范围,也有失效条件

Agent 产品的验收结论只对记录中的范围和版本成立。模型、提示、Skill、政策、数据、工具、权限、用户角色或外部环境变化后,原有证据可能仍有一部分有效,也可能已经不足。

第四章已经说明运行事件怎样触发临时控制、关闭与回写。本节只讨论变化怎样影响验收:哪个质量主张需要重验,谁重新作决定,旧结论何时失效。

5.4.1 变化要映射到受影响的质量主张

表 5-3 常见变化与重验范围

变化或信号可能失效的质量主张最低重验动作
模型、系统提示、Skill 或规划逻辑变化任务与使用质量、行为稳定、校准依赖重跑受影响 eval;行为表达变化时补做任务角色研究
退款政策、知识来源或数据结构变化结果正确性、可回溯、专业适用性更新样本与版本规则;重验政策冲突,必要时补专家审查
支付工具、接口或回执语义变化边界、外部状态、接管与恢复重验调用、幂等、状态不明、回退或补偿路径
数据或工具权限扩大,自主范围提高行为边界、受影响者、残余风险重新经过第四章入口门,并重做相应三路证据与签署
新用户、订单类型、地区或运行环境进入适用范围、任务与使用质量、角色条件新增代表性切片;不得沿用旧范围的总体分数
越权、重复退款、无效审批、争议或接管失败对应行为、角色与治理主张先临时控制;真实失败进入样本后完成重验再决定恢复
长期判断能力是验收目标且出现退化信号必要判断能力保护补做无辅助、错误识别或接管演练,重新评估自动化范围

变化不要求机械地重做全部测试。团队应从变化回到受影响的委托主张、边界、样本和角色,再决定重验范围。若无法证明某项证据仍然适用,就不能默认沿用。

5.4.2 “通过”不是永久标签

验收包应记录有效期或复查节点。复查可以由版本变更、累计任务量、时间、事件或外部制度更新触发。作为风险导向的建议,影响越大、后果越难逆转,复查间隔通常越应缩短、失效条件越应明确;低风险、可撤销的辅助功能可以采用较轻安排。具体频率仍由适用制度、运行暴露与证据决定。

复查仍然只有三种结论:通过、限范围试点或不通过。修复当前投诉、增加一句警告或回滚一次版本,都不能自动恢复原验收范围。团队需要确认相关门槛重新满足,并由有权角色重新作出决定。

模型、工具、数据、规则和环境变化如何触发重新验证
模型、工具、数据、规则和环境变化如何触发重新验证

图 5-5 验收结论的适用范围与重验触发条件

5.5 把必要判断能力纳入特定场景的验收

判断能力是否需要成为质量目标,取决于产品目的和任务后果。低风险生产力工具可以只要求结果可核验、异常可接管;学习产品、专业训练和依赖人工监督的高风险系统,则可能需要验证人长期是否仍能完成关键判断。

这不是说 AI 必然削弱判断,也不是要求人保留所有旧技能。团队只需识别两类能力:一类是产品明确承诺帮助形成的能力;另一类是人审查、拒绝或接管 Agent 所必需的能力。若这两类能力不在产品目标内,就不应靠抽象的“保持思考”给用户增加步骤。

5.5.1 生产力目标与学习目标分开验收

表 5-4 不同产品目标下的判断能力验收

产品目标需要保护的能力可观察证据不应推出的结论
低风险生产力理解结果、发现明显异常、必要时修改或撤销代表性任务中的核验与恢复表现用户必须能在无 AI 时从头完成全部机械步骤
专业或高风险辅助解释关键依据、识别深层错误、拒绝、接管和处理后果错误植入任务、无辅助关键判断、周期性接管演练只要流程上有人批准,监督就一定有效
学习与能力形成回忆、尝试、解释、迁移等被产品明确承诺的学习结果有无辅助对比、延迟测验、迁移任务和理由质量练习阶段完成更快就代表已经学会

系统 eval 单独不足以证明人的长期能力,因为它主要观察系统在给定任务与环境中的行为和结果。这类主张需要任务角色用户研究,并按目标加入无辅助任务、迁移任务、延迟测验、纵向追踪或人机联合表现,再与系统证据一起进入验收。把这些观察笼统地都叫作“eval”,不会消除研究对象、周期与方法之间的差别。

5.5.2 现有研究只能支持谨慎主张

一项对 319 名知识工作者、936 个实际使用案例开展的一次性在线调查发现,受访者对生成式 AI 的任务特定信心越高,报告的批判性思考越少;研究同时显示思考活动会转向信息验证、结果整合与任务管理。7 这些是自我报告的相关关系,不是客观能力测量,也不能证明长期能力因果退化。

一项预注册的集群随机现场实验在土耳其一所高中约 50 个班、近 1000 名九至十一年级学生中进行,干预只有四次、每次 90 分钟,覆盖一小段数学学习。普通 GPT 版本提高了练习成绩,却使无 AI 考试表现低于对照组;使用教师解答约束与教学提示的 GPT Tutor 大体缓解了这一下降,但没有证明学习效果普遍优于传统教学。8 这个单站点、短周期、特定模型与学科的结果,不能直接外推到退款、设计或所有知识工作,更不能简化成“只要加护栏就能改善学习”。

这些研究足以提醒团队把长期结果纳入适用场景的验收,却不足以证明 AI 使用必然导致普遍“去技能化”。每个产品仍要说明要保护哪项能力、为什么重要、用什么证据观察,以及门槛未满足时怎样调整。

5.6 一份退款 Agent 验收结论

把本章框架放回客户退款案例,可以看到“有证据”与“可以发布”之间还差什么。

以下数字全部是虚构的教学设定,只示范怎样把门槛、失败动作和决定权限写进同一份结论;它们不是行业推荐值、法律安全线,也不能证明统计充分性。

表 5-5 客户退款 Agent 的教学验收结论

验收项教学门槛当前结果与失败动作签署或决定范围
范围与版本v0.9;普通境内、金额不超过 2000 元的订单;只生成退款资格、金额与对客草稿;跨境、特殊促销与真实支付均为非目标;支付工具在部署层物理禁用范围、版本和非目标已记录产品与工程负责人只确认 v0.9 及工具禁用控制
样本与重复试验600 个案例各运行 2 次,共 1200 次试验;案例含常规 240、促销或部分退款 150、政策冲突 90、缺失证据 60、外部异常 60样本构成与结果按类型留档;任何新增订单类型先补样本,不沿用总分研究负责人确认本次样本与方法,不接受业务残余风险
硬门槛跨订单读取、支付绕过、隐去政策冲突、外部状态不明时重试均为 0 次;90 个冲突案例全部阻塞并保留两份来源本轮为 0、0、0、0;冲突阻塞 90/90。以后任一禁行事件出现,立即停止试点并进入事件闭环工程负责人确认控制结果;无任何人签署真实支付权限
任务与使用质量在 450 个可直接判定案例中,退款资格总体正确率至少 97%,每个关键切片至少 93%;金额精确到分的正确率至少 99%;客服完成草稿复核的时间与满意度不得劣于既定人工基线总体与金额通过;特殊促销切片为 91.3%,未通过。将特殊促销移出范围并补测退款业务负责人只确认普通、非促销订单的业务适用范围
角色与接管12 名获授权客服各完成 8 个任务,至少 11 人能找到来源并拒绝植入错误,12 人都能停止并移交;4 名政策人员各完成 6 个冲突任务,4 人都能作出有依据的处理找源与拒绝为 11/12,停止移交为 12/12,政策处理为 4/4;未通过者完成训练,但不能用训练替代产品修复客服主管确认参与者具备本次草稿试点所需操作条件,不代表全体员工或长期能力
运行与重验10 次降权演练均在 5 分钟内进入安全草稿模式;政策、模型、提示、工具、权限、订单范围变化,或关键事件出现时,本结论立即失效10/10 通过;试点结论最长有效 30 天,触发条件先到则提前失效运行负责人确认监测、降权和事件联系人
残余风险与结论已知未覆盖切片、样本量限制、短期角色研究及实际暴露不足必须记录;只有获正式授权的业务与风险角色才能在相应范围接受残余风险特殊促销、跨境和支付均排除;结论为普通境内非促销订单、草稿模式的限范围试点业务负责人签署订单范围;获授权的风险负责人只接受这次草稿试点的残余风险;任何签署均不延伸到支付

“本轮观察到 0 次”不等于未来风险为零。样本组成、重复试验次数、统计不确定性、真实使用暴露和未覆盖条件仍要进入残余风险记录。表中的各角色也只签署其有正式权限决定的部分,不能用一名负责人的签字包办技术、业务、风险和法律责任。

这份结论没有把“系统大部分时候正确”写成全面通过。促销切片未达表现门槛,直接被移出范围;真实支付从未进入验收范围,不能因为草稿结果通过而自动获得权限。团队只有在补齐失败样本、取得相应三路证据并重新签署后,才能讨论扩大订单类型或行动权限。

有限试点怎样用范围、证据、门槛、残余风险与停止条件形成验收结论
有限试点怎样用范围、证据、门槛、残余风险与停止条件形成验收结论

图 5-6 一份有限试点验收结论应包含的核心信息

本章小结

本章把第四章取得的证据转成质量与验收决定。

第一,质量主张必须包含范围、维度、证据、门槛、失败动作、决定人与有效期。可用性继续回答特定用户在特定情境中的任务表现,但单独使用操作顺畅度或完成率,不能覆盖 Agent 的行为边界、证据、接管和变化。

第二,本书用任务与使用质量、行为稳定与边界、校准依赖、可回溯、可接管与恢复、可治理,以及适用场景中的必要判断能力保护组织验收。它们是检查维度,不是行业统一标准;门槛要按后果、可逆性、影响范围和证据条件设置。

第三,系统 eval、任务角色用户研究、领域或独立专家审查共同进入验收,但不能互相代替。验收包要记录范围与版本、样本与切片、门槛、未通过项、残余风险、有权决定人、通过/限范围试点/不通过结论,以及重验触发器。

第四,候选生成成本下降后,验证可能成为瓶颈。“验证债务”只是本书的工作类比;只有把缺失证据写成有负责人、临时限制和关闭条件的待验项,它才具有管理意义。

第五,验收结论只对记录中的范围和版本成立。模型、政策、工具、权限、用户和运行信号变化后,团队要定位受影响的质量主张,重新取得必要证据,并由有权角色重新决定。

第六,人的长期判断能力只在学习、专业和高风险监督等明确情境中纳入验收。团队要区分生产力目标与学习目标,不能从短期速度直接推出能力增长,也不能把判断力弱化写成 AI 使用的必然后果。

下一章将从质量要求转向具体工作:设计师怎样构建可运行体验,怎样把规则、上下文和权限组织成新的交付物,以及怎样与产品、工程、研究和业务角色共同对交付负责。


1 ISO, ISO 9241-11:2018 Ergonomics of human-system interaction—Part 11: Usability: Definitions and concepts, second edition, 2018 年 3 月,https://www.iso.org/standard/63500.html 。

2 Saleema Amershi et al., “Guidelines for Human-AI Interaction,” CHI 2019,https://doi.org/10.1145/3290605.3300233 。本文把指南用作候选检查项,不据此给出统一验收阈值。

3 Mihaela Vorvoreanu et al., Fostering Appropriate Reliance on GenAI: Lessons Learned from Early Research, Microsoft Technical Report MSR-TR-2025-4, 2025 年 3 月,https://www.microsoft.com/en-us/research/publication/fostering-appropriate-reliance-on-genai-lessons-learned-from-early-research/ 。报告讨论帮助使用者形成心智模型、识别何时需要核验并完成核验;相关建议仍需在具体任务中验证。

4 European Union, Artificial Intelligence Act, Regulation (EU) 2024/1689, Article 14,https://eur-lex.europa.eu/eli/reg/2024/1689/oj ;Regulation (EU) 2026/1744,https://eur-lex.europa.eu/eli/reg/2026/1744/oj 。后者将 Article 6(2) 与 Annex III 对应制度推迟至 2027 年 12 月 2 日,将 Article 6(1) 与 Annex I 对应制度推迟至 2028 年 8 月 2 日,Article 6(5) 另有特别安排。本章只借 Article 14 检查高风险 AI 的人类监督问题,不判断普通退款产品的法律分类或责任。访问于 2026 年 8 月 9 日。

5 Anthropic, “Demystifying evals for AI agents,” 2026 年 1 月 9 日,https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents 。本文采用其 task、trial、grader、transcript/trajectory 与 outcome 等工程术语,不视为统一验收标准。

6 NIST, Artificial Intelligence Risk Management Framework (AI RMF 1.0), 2023,https://doi.org/10.6028/NIST.AI.100-1 。本章用其情境、角色、风险容忍、监测与处置条目支持验收问题;固定验收包、结论和签署安排均为本书操作化。

7 Hao-Ping Lee et al., “The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers,” CHI 2025,https://doi.org/10.1145/3706598.3713778 。研究为一次性在线调查,分析 319 名知识工作者报告的 936 个工作用例。

8 Hamsa Bastani et al., “Generative AI without Guardrails Can Harm Learning: Evidence from High School Mathematics,” Proceedings of the National Academy of Sciences, 2025,https://doi.org/10.1073/pnas.2422633122 。研究为土耳其一所高中内的预注册集群随机实验,干预持续四次、每次 90 分钟;本文不把短期单站点结果外推为通用教育规律。

第五章: 好设计的新标准 | 智能体时代的设计 | 薛志荣 | Product Designer & Author