大模型安全之十二:AI治理如何从原则走向可审计的实践
引言:20天与35亿欧元
2021年初,韩国AI初创公司Scatter Lab上线了一款基于Facebook Messenger的聊天机器人“李LUDA”。不到20天,这款产品就被迫终止服务,公司公开发布道歉声明。原因令人深思:李LUDA不仅成为网络骚扰的对象,还被发现使用了针对少数群体的歧视性表达,并牵涉出韩国的个人信息保护问题。
这个案例像一记警钟,但它敲响的并非技术本身——而是治理的缺失。
四年后,欧盟给出了一个截然不同的答案。2024年8月1日,《欧盟人工智能法案》正式生效,这是全球首部系统性规制人工智能的综合性法律。对于违反“不可接受风险”禁令的行为,罚款上限高达3500万欧元或全球年营业额的7%,以较高者为准。
从“李LUDA”的仓促收场,到AI法案的雷霆手段,一条清晰的轨迹浮现出来:AI治理正在从“事后道歉”走向“事前问责”,从“道德呼吁”走向“法律义务”。
本文从AI治理的三层架构出发,结合全球主要监管框架和真实案例,给出可落地的治理实践路径。
1、AI治理的三层架构:原则、政策与问责
AI治理不是一句口号,而是一套由三个层次构成的完整体系。
1.1 第一层:原则——道德罗盘
原则是治理的“道德罗盘”,包括公平、透明、问责、隐私和安全。它们不是抽象的理想,而是每一个AI决策背后的价值判断标准。
公平确保模型不歧视;透明确保决策可解释;问责确保“总有人对结果负责”——不是AI,而是监督它的人类或团队。
1.2 第二层:政策——可执行的规则
政策将原则翻译为可操作的规则。四类核心政策构成了AI治理的“操作骨架”:
| 政策类型 | 核心内容 | 关键问题 |
|---|---|---|
| 可接受使用政策 | 定义AI工具可以做什么、不可以做什么 | 哪些内容或操作被禁止? |
| 数据处理政策 | 管理数据从收集到删除的全生命周期 | 哪些数据可用于检索或微调?保留多久? |
| 数据保留政策 | 平衡审计需求与法律风险 | 保留过多增加暴露,过少影响合规 |
| 升级政策 | 定义出问题时的响应流程 | 数据泄露、模型故障时谁负责? |
三星的案例生动说明了政策的必要性。2023年,三星引入ChatGPT不到20天,就发生了3起机密数据泄露事件:员工将半导体设备测量代码、产品良率信息、会议录音内容输入ChatGPT,而这些数据可能被用于训练。三星随后启动紧急措施,将提问限制在1024字节以内。
1.3 第三层:问责——让治理“长出牙齿”
问责是让治理落地的结构。三个核心角色构成“治理三角”:
-
AI负责人:对系统的业务和伦理责任负最终责任,是部署的签字人
-
AI风险经理:在合规、伦理和技术之间协调,维护风险登记册,协调审计
-
AI安全工程师:保护AI基础设施本身,防御提示注入、数据泄露等攻击
“李LUDA”的失败,恰恰是这三个角色全部缺位的典型案例:没有人在部署前做公平性评估,没有人在运营中监控歧视性输出,没有人在出事时承担明确责任。
2、透明度:从“黑盒”到“可审计”
治理的第二根支柱是透明度。在实践中,这通过两类结构化文档来实现。
2.1 模型卡(Model Cards)
模型卡是AI模型的“身份证”,标准化记录模型的用途、性能、局限性。例如,一个语言模型可能在英语上表现优异,但在非西方语言或专业医学术语上表现不佳。记录这些信息,帮助用户和审计者理解“模型能做什么,以及在哪里不应该被信任”。
2.2 数据集数据表(Datasheets for Datasets)
数据是AI的“血液”。数据集数据表记录数据的来源、收集方式、是否获得同意、预处理方法、潜在偏见。这使数据治理变得透明和可追溯,让组织能够证明其AI建立在伦理和法律上可靠的信息之上。
2.3 真实教训:审计缺失的代价
加拿大航空的案例说明了透明度和审计的重要性。2022年,乘客Moffatt依据加航聊天机器人的建议购买了机票,申请退款时却被拒绝。加航在法庭上辩称“聊天机器人是一个独立的法律实体,对自己的行为负责”——这一论证被法庭驳回,加航最终被判赔偿。
这个案例的深层教训是:如果AI系统没有完整的审计日志,组织甚至无法证明“发生了什么”。没有可审计性,问责就无从谈起。
3、全球监管框架:从自愿到强制
AI治理正在从“最佳实践”走向“法律义务”。理解主要框架的差异,是合规的前提。
3.1 欧盟AI法案:全球首部综合性立法
《欧盟人工智能法案》于2024年8月1日生效,采取风险分级管理思路,将AI系统分为四个级别:
| 风险等级 | 典型应用 | 核心义务 |
|---|---|---|
| 不可接受风险 | 社会评分、操纵性技术 | 全面禁止 |
| 高风险 | 关键基础设施、教育、招聘 | 合格评定、技术文档、人工监督、注册 |
| 有限风险 | 聊天机器人、深伪内容 | 透明度义务(如标注AI生成内容) |
| 最小风险 | 垃圾邮件过滤、游戏 | 无额外义务 |
时间线:禁令和处罚条款已于2025年8月2日适用,高风险系统的核心合规要求经调整后,部分延至2027年12月2日及2028年8月2日生效。
3.2 NIST AI风险管理框架(AI RMF)
与欧盟的“法律强制”不同,美国的NIST AI RMF是自愿性指南。其核心是四个功能:治理(Govern)→ 映射(Map)→ 测量(Measure)→ 管理(Manage)。
NIST在2024年7月专门发布了生成式AI配置文件(NIST AI 600-1),识别了12类GAI特有风险,包括虚假内容生成、数据隐私、网络安全、知识产权等。该框架被美国联邦机构和大量私营企业作为内部AI合规的基础。
3.3 ISO/IEC 42001:可认证的管理体系
ISO/IEC 42001:2023是首个针对AI管理体系(AIMS) 的国际标准。与NIST的自愿指南不同,ISO 42001是可认证的——组织可以通过第三方审核获得证书。
AWS和火山引擎等云服务商已获得该认证,这意味着使用其服务的客户在认证过程中可以“更容易进行认证”。
3.4 其他重要框架
-
ISO/IEC 23894:2023:AI风险管理的国际标准,与ISO 27001信息安全体系互补
-
OECD AI原则:首个国际公认的AI伦理指南,强调包容、透明、公平和问责
-
G7广岛AI进程:包括国际指导原则和行为准则,2025年2月启动了报告框架
4、中国AI治理核心法律框架
4.1 法律层面
《网络安全法》(2026年修订)
2025年10月28日通过修改决定,新增第二十条,首次以法律形式将人工智能纳入国家网络安全法律体系,明确“国家支持人工智能基础理论研究和算法等关键技术研发,推进训练数据资源、算力等基础设施建设,完善人工智能伦理规范,加强风险监测评估和安全监管”。
《数据安全法》《个人信息保护法》
为AI训练数据的合规使用提供基础性规制。那家算料公司的罚单,正是《个人信息保护法》第28条(敏感个人信息)和第55条(个人信息保护影响评估)在AI训练数据场景下的首次适用。
4.2 行政法规与部门规章
《生成式人工智能服务管理暂行办法》(2023年8月15日施行)
中国首部针对生成式AI的专项部门规章。核心义务包括:内容安全(不得生成法律禁止内容)、反歧视(防止民族、信仰、性别等歧视)、知识产权尊重、个人信息保护、透明度提升。
适用范围:向境内公众提供生成文本、图片、音频、视频等内容的服务。未向境内公众提供服务的研发活动不适用。
《人工智能生成合成内容标识办法》(2025年9月1日施行)
要求对AI生成合成内容实施显式标识和隐式标识双重制度。网络信息内容传播服务提供者负有核验义务:核验文件元数据中是否含有隐式标识。
《人工智能科技伦理审查与服务办法(试行)》(2026年4月)
由工信部等十部门联合印发,明确需要专家复核的三类AI科技活动:对人机融合系统的研发、具有舆论社会动员能力的算法模型研发、具有高度自主能力的自动化决策系统研发。
4.3 司法层面
最高人民法院《关于依法审理涉人工智能纠纷案件的意见》(2026年9月7日)
这是首部由国家最高审判机构发布的涉人工智能司法裁判规则文件。核心立场是“坚持发展和安全并重,让人工智能这匹千里马既跑得快又跑得稳”。
关键规则:
| 领域 | 规则要点 |
|---|---|
| 人格权保护 | 明确利用AI侵害肖像权、名誉权、隐私权、声音权益的责任追究 |
| 训练数据 | 合理范围内处理已合法公开个人信息且个人未拒绝的,一般不认定为侵权;但对个人权益有重大影响的应取得同意 |
| 消费者保护 | “大数据杀熟”承担侵权责任;“仿冒名人带货”构成欺诈的支持惩罚性赔偿 |
| 产品责任 | “人工智能产品”严格限定为以实物为载体的产品,无实物载体的AI服务排除在外 |
| 刑事责任 | 故意利用AI犯罪坚决严惩;研发应用中的创新性行为依法审慎处理 |
4.4、中国AI治理的核心特征
第一,发展与安全并重。 立法基调以“支持发展”为底色。新增《网络安全法》第20条明确“国家支持人工智能基础理论研究和关键技术研发”。
第二,急用先行、成熟先立。 采取“小快灵”立法策略。正如中国社会科学院研究员支振锋所指出的:“我国聚焦人工智能治理突出问题,采取急用先行、成熟先立、动态完善的立法策略,解决了算法治理、生成式人工智能风险、人脸识别滥用等问题”。2026年国务院立法工作计划和全国人大常委会立法工作计划均已将“人工智能健康发展综合性立法”纳入议程。
第三,多层次协同。 法律、行政法规、部门规章、司法解释共同构成完整规范体系,各层级之间相互衔接、协同发力。
4.5、生成式AI产品上线合规“三部曲”
基于上述法律框架,生成式AI产品向公众提供服务前需完成三项核心合规程序:
4.5.1 算法备案
法律依据:《互联网信息服务算法推荐管理规定》第24条。具有舆论属性或社会动员能力的算法推荐服务提供者,应在提供服务之日起十个工作日内履行备案手续。
4.5.2 安全评估
依据《具有舆论属性或社会动员能力的互联网信息服务安全评估规定》,对AI服务进行安全评估,覆盖内容安全、数据安全、个人信息保护等维度。
4.5.3 内容标注
依据《人工智能生成合成内容标识办法》,对生成合成内容添加显式标识和隐式标识。强制性国家标准《网络安全技术 人工智能生成合成内容标识方法》同步实施,明确文本、图片、音频、视频等不同内容类型的标识方法。
5、可审计性与可追溯性:企业级AI的底线
当AI系统在关键或受监管环境中大规模部署时,可审计性(Auditability) 和可追溯性(Traceability) 成为不可协商的要求。
5.1 可审计性:回答“发生了什么”
可审计性意味着AI系统的每一个重要决策或行动都能被事后重建、审查和解释。如果模型拒绝了一笔贷款申请、推荐了一种治疗方案、标记了一个安全风险,审计者和利益相关方必须能够追溯为什么会产生这个结果。
这要求系统维护详细记录:使用了哪些数据、哪个模型版本做出了决策、应用了哪些参数或提示词、生成了什么输出。
5.2 可追溯性:回答“如何发生的”
可追溯性关注的是追踪数据、模型和决策在整个AI生命周期中的轨迹。它确保从训练数据的源头到最终用户交互的每一个环节,都能被链接成一个连续的证据链。
可审计性回答“What”,可追溯性回答“How”。
5.3 工程实现:透明记录协议
技术层面已有标准化尝试。IETF的透明记录协议(TRP) 是一个应用层协议,通过HTTP头传播AI透明度元数据,实现加密签名的审计追踪和跨组织边界的可验证记录。
TRP使用累积签名链确保防篡改:每个处理步骤追加一个覆盖所有先前内容的签名,任何无效签名都表明篡改。
6、落地检查清单:从原则到实践
✅ 治理架构
- □ 是否明确了AI负责人、风险经理和安全工程师的角色?
- □ 是否建立了审计委员会或内部审查机制?
- □ 是否定义了升级流程和事件响应预案?
✅ 政策体系
- □ 是否有书面的可接受使用政策?
- □ 是否定义了数据分类、加密和匿名化标准?
- □ 是否设置了基于数据类型的保留期限?
✅ 透明度文档
- □ 是否为核心模型维护了模型卡?
- □ 是否为训练数据集维护了数据表?
- □ 是否记录了模型的局限性和不适用场景?
✅ 合规准备
- □ 是否完成了算法备案(如适用)?
- □ 是否进行了安全评估?
- □ 是否对生成合成内容添加了显式/隐式标识?
- □ 是否评估了《生成式AI暂行办法》《算法推荐规定》的适用性?
✅ 可审计性
- □ 是否记录了模型版本、参数和提示词?
- □ 是否实施了不可篡改的审计日志?
- □ 是否能够重建任何一次决策的完整链路?
7、总结:信任是设计出来的,不是声明出来的
从“李LUDA”的20天到欧盟AI法案的3500万欧元罚款,AI治理的进化揭示了一个核心真理:信任不能靠承诺,必须靠结构。
原则告诉我们应该相信什么,政策告诉我们如何做到,问责确保有人对结果负责。透明度让系统可被理解,可审计性让系统可被追责,监管框架让这一切成为义务而非选择。
当AI系统越来越深地融入关键业务、医疗决策和公共服务时,从“便利优先”到“信任优先”的转变,就是AI从实验走向生产的决定性分界线。
速查表:中国AI治理核心规范
| 规范名称 | 效力层级 | 施行时间 | 核心要点 |
|---|---|---|---|
| 《网络安全法》(修订) | 法律 | 2026.1.1 | 新增AI条款,支持发展+安全监管 |
| 《生成式AI服务管理暂行办法》 | 部门规章 | 2023.8.15 | 内容安全、反歧视、训练数据合规 |
| 《算法推荐管理规定》 | 部门规章 | 2022.3.1 | 算法备案(10个工作日内)、安全评估 |
| 《AI生成合成内容标识办法》 | 部门规章 | 2025.9.1 | 显式+隐式标识,传播平台核验义务 |
| 《AI科技伦理审查办法》 | 部门规章 | 2026.4 | 三类活动需专家复核 |
| 最高法《涉AI纠纷案件意见》 | 司法解释 | 2026.9.7 | 人格权保护、训练数据规则、产品责任限定 |
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)