可解释人工智能 - 最新进展与新趋势
龙博文,刘恩杰 SMember,邱仁喜,段艳青
摘要
近年来,人工智能技术在各个领域和行业中的各种应用中表现出色。然而,神经网络中的各种算法使得理解决策背后的原因变得困难。因此,可信赖的人工智能技术开始受到欢迎。可信的概念是跨学科的;它必须符合社会标准和原则,并且技术被用来满足这些要求。在本文中,我们首先调查了各国和地区关于使人工智能算法值得信赖的伦理要素的发展;然后重点调查了人工智能可解释性的最新研究。我们对用于使人工智能可解释的技术和技巧进行了深入调查。最后,我们确定了实现可解释人工智能的新趋势。特别是,我们详细阐述了人工智能的可解释性与自主系统的元推理之间的强烈联系。元推理的概念是“推理的推理”,这与可解释人工智能的意图和目标一致。将这些方法整合起来可以为未来的可解释人工智能系统铺平道路。
索引术语- 可信人工智能,可解释人工智能,人工智能伦理原则,元推理
I. 引言
围绕可信人工智能(TAI)主题的研究正在以前所未有的速度增长,可信人工智能领域的研究数量也在飞速增加。自2019年以来,围绕鲁棒性、可解释性和隐私保护的技术研究持续增长[1]。此外,随着产业界开始实施人工智能,使人工智能值得信赖的探索和实践不断成熟。在整合“以人为中心”的计算元素后,相关的人工智能技术逐年增加。
可信人工智能的概念在2010年代中期开始引起关注,主要是因为对人工智能系统伦理、透明和安全部署的关注日益增加。标准组织,如IEEE引入了框架和标准,如自主和智能系统伦理认证计划(ECPAIS)[2]。然而,由于难以破解黑箱属性以及一些破解方法的成本较高[3],人工智能可解释性领域的问题进展缓慢。缺乏可解释的人工智能技术已成为系统公平性的重要制约因素[4]。由于缺乏具体、完善的场景实践案例,而且相关技术研究仍处于早期阶段,因此在可解释性和公平性方面的专利相对较少。
目前,业界提出从可信人工智能转向更透明的人工智能。这不仅需要技术支持,还旨在创建一种系统化的方法,在保持高性能水平的同时生成更多可解释的方法。美国国防高级研究计划局(DARPA)启动了可解释人工智能(XAI)计划[5],以创建人类用户更容易理解其行为的人工智能系统。
尽管该主题的研究爆炸式增长并非所有领域都受到同等关注。根据中国信息通信研究院[6]的统计数据,截至2022年4月,隐私保护领域的专利占全球人工智能技术专利的63%,而人工智能可解释性和公平性专利分别仅占10%和6%。随着人工智能的普及和人工智能赋能应用的增加,人工智能的信任度和透明度成为人工智能发展中不可避免的问题,因此我们见证了该领域的不断发展。
本文中,我们首先调查了各国和地区关于使人工智能算法值得信赖的伦理要素的发展;我们采用了欧盟人工智能高级别专家组(HELG)[7]的定义,该定义总结了四个基本伦理原则;人工智能HELG还确定了满足伦理原则的七个具体需求。我们专注于伦理人工智能的主要要求之一,即透明度。更具体地说,我们专注于审查提高人工智能可解释性的最新研究。最后,我们还提出了对未来人工智能可解释性技术发展的思考和可能实现它的技术。
- 电子邮件:(bowen.long, enjie.liu, renxi.qiu, yanqing.duan)@beds.ac.uk
-
- 刘恩杰 (Enjie.liu@beds.ac.uk) 是通讯作者

图1 可信人工智能的伦理准则核心要素
II. 人工智能可信度的伦理问题
欧洲委员会在[8]中提出了机器人技术的民事规则,通过2018年4月和12月的两次公开声明[9],明确表达了人工智能领域的三个主要愿景:
- 增加社会各界对人工智能开发的投资;
-
- 为人工智能带来的新经济趋势做好准备;
-
- 确保适当伦理和法律框架的到位,从而使欧洲的人工智能价值观始终以人为中心。
- 为了实现这些共同目标,欧盟召集了52位权威专家或学者,以及权威从业者组成人工智能HLEG,他们一起起草和修订了《人工智能伦理准则》[13]。在这份官方文件中,正式化了可信人工智能的概念。
出于远见和责任感,人工智能HLEG可能已经预见到人工智能治理需要的不仅仅是广泛地概述一个模糊的可信人工智能概念。他们通过以下方面定义了可信人工智能:(1)它应具备的核心要素;(2)它应保护的伦理原则;(3)它应满足的具体要求。这三个方面进行了深入探讨,以找到防止人工智能引发信任危机的方法[6],如图1所示。表1总结了不同国家和地区对伦理问题的调查和进展。
| 地点 | 时间 | 文件/项目 | 要素 |
|---|---|---|---|
| 美国 | 10/2019\begin{aligned} & 10 / 20 \\ & 19 \end{aligned}10/2019 | 人工智能原则:国防部应用人工智能的伦理建议 [10] | 1) 问责制;2) 公平性;3) 可追溯性;4) 可靠性;5) 控制 |
| 02/2020\begin{aligned} & 02 / 20 \\ & 20 \end{aligned}02/2020 | “人工智能指导的伦理标准。” [11] | 按最高标准的公平性、问责制和透明度进行人工智能系统开发、测试和审查 | |
| 07/2021\begin{aligned} & 07 / 20 \\ & 21 \end{aligned}07/2021 | "值得信赖且负责任"的人工智能项目 [12] | 1) 准确性;2) 可解释性;3) 隐私;4) 可靠性;5) 鲁棒性;6) 安全;7) 减少偏见的危害 | |
| 欧盟 | 01/2017\begin{aligned} & 01 / 20 \\ & 17 \end{aligned}01/2017 | 欧洲委员会关于机器人技术的民法规则建议 [9] | 1) 自由;2) 隐私;3) 积极价值和尊严;4) 自主决定和非歧视;5) 个人数据保护 |
| 04/2019\begin{aligned} & 04 / 20 \\ & 19 \end{aligned}04/2019 | 可信人工智能的伦理指南 [13] | 1) 人类监督;2) 技术的鲁棒性和安全性;3) 隐私和数据管理;4) 透明度;5) 多样性、非歧视和公平性;6) 社会和环境福祉;7) 问责制 | |
| 日本 | 03/2017\begin{aligned} & 03 / 20 \\ & 17 \end{aligned}03/2017 | 人工智能学会伦理准则 [14] | 1) 对人类的贡献;2) 遵守法律规则;3) 尊重他人的隐私;4) 公正性;5) 安全;6) 诚实行为;7) 对社会的责任 |
| 07/2017\begin{aligned} & 07 \\ & / 2017 \end{aligned}07/2017 | 人工智能开发计划 | 开发者应尽力排除所有偏见和其他不当歧视措施,包括人工智能系统的学习数据,考虑到技术的本质;开发者应遵守国际人权法、国际人道主义法,并警惕人工智能系统的行为可能与人类价值观不符的情况。 | |
| 03/2019\begin{aligned} & 03 / 20 \\ & 19 \end{aligned}03/2019 | 以人为中心的人工智能社会原则 | 1) 以人为中心;2) 教育应用;3) 隐私保护;4) 安全和保障;5) 公平竞争;6) 平等;7) 问责制和透明度;8) 创新 | |
| 加拿大 | 12/2018\begin{aligned} & 12 / 20 \\ & 18 \end{aligned}12/2018 | 可靠人工智能宣言 | 1) 福祉;2) 自主性;3) 正义;4) 隐私;5) 知识;6) 民主;7) 责任 |
| 澳大利亚 | 11/2019\begin{aligned} & 11 / 20 \\ & 19 \end{aligned}11/2019 | 澳大利亚人工智能伦理框架 | 1) 人类、社会和环境福祉;2) 以人为中心的价值观;3) 公平性;4) 隐私保护和安全;5) 可靠性和安全性;6) 透明性和可解释性;7) 可争议性;8) 问责制 |
| 新西兰 | 03/2020\begin{aligned} & 03 / 20 \\ & 20 \end{aligned}03/2020 | 新西兰可信人工智能指导原则 | 1) 公平和正义;2) 可靠性、安全性和隐私;3) 透明度;4) 人类监督和责任;5) 福祉 |
| 韩国 | 12/2020\begin{aligned} & 12 / 20 \\ & 20 \end{aligned}12/2020 | 国家人工智能伦理标准 | 1) 人权保护;2) 隐私保护;3) 尊重多样性;4) 禁止侵犯;5) 社会倡导;6) 主体合作;7) 数据管理;8) 明确责任;9) 确保安全;10) 透明度 |
| 中国 | 11/2017\begin{aligned} & 11 / 20 \\ & 17 \end{aligned}11/2017 | 香山会议S36 | 可信人工智能由三大主要要素构成:人类、信息和物理。 |
| 08/2019\begin{aligned} & 08 / 20 \\ & 19 \end{aligned}08/2019 | 人工智能产业自律公约 | 1) 安全可控;2) 透明可释放;3) 保护隐私;4) 明确责任;5) 多样包容 | |
| 09/2019\begin{aligned} & 09 \\ & / 2019 \end{aligned}09/2019 | 新一代人工智能伦理规范 | 1) 提高人类福祉;2) 促进公平正义;3) 保护隐私和安全;4) 确保可控性和可信性;5) 加强责任;6) 提升伦理素养。 | |
| 07/2021\begin{aligned} & 07 / 20 \\ & 21 \end{aligned}07/2021 | 可信人工智能白皮书 | 可信性由五个可信要素构成:1) 可靠性和控制,2) 透明度和发布,3) 数据保护,4) 明确责任,5) 多样性和包容性。可信人工智能是从技术和工程实践的角度实现伦理治理要求,从而有效平衡创新发展与风险治理。 |
表1 不同国家对伦理问题的总结(译自[6])
最近,在调查了欧洲伦理科学与新技术小组(EGE)的原则以及其他已提出的36项伦理原则后,AI4People工作组将其总结为九项主要原则[15]。随后,AI HELG针对这些进行了细化,并选择了四项作为可信人工智能应始终遵循的基本伦理原则:
- 尊重人类自主权
-
- 防止伤害
-
- 公平原则
-
- 解释性原则
抽象的伦理原则需要转化为具体的操作要求,以建立坚实的基础。人工智能系统无法脱离相关利益者的参与而实现:a.) 实现和应用于开发过程的开发者;b.) 确保系统和产品及服务符合要求的开发者;c.) 愿意使用它们并给予反馈的用户。鉴于此,AI HELG通过反思利益相关者的位置,总结了七项具体需求来满足伦理原则,如图2所示。
- 解释性原则
图2 七大需求与相应基本原则的关系
III. 透明人工智能,可解释人工智能,和可解释人工智能
可信人工智能是一个涵盖使人工智能在利用和部署时具有社会价值的概念的总称。透明人工智能是七个要求之一,
应该满足可信度。透明研究的重点在于人工智能模型结构和过程的开放性。可解释人工智能的研究重点在于理解人工智能系统的输出。可解释性在构建和维护用户对系统的信任中至关重要。当人工智能系统可以被解释时,它是透明的,因此模型是被信任的。然而,一个系统可以是透明的但不可解释。
A. 人工智能的透明度
透明度包括可追溯性、可解释性和沟通。
a) 可追溯性
这意味着系统依赖于做出决策的数据集和过程——包括数据收集方法、数据标记原因以及使用的算法——应尽可能详细地记录下来。为了实现可追溯性和提高透明度,这也适用于人工智能系统所做的决策。可追溯性有助于审查和解释。
b) 可解释性
它涉及解释人工智能系统的技术过程,要求人工智能系统所做的决策能够被人理解和追踪。此外,可能存在增加系统可解释性或增加其准确性之间的权衡[16]。每当人工智能系统对人们的生活产生重大影响时,个人应能够要求对决策过程作出适当的解释。此外,应解释人工智能系统对组织决策过程的影响程度,以及其设计和部署的理由。
c) 沟通
人类有权被告知他们正在与一个人工智能系统互动。这要求人工智能系统可识别。此外,如果必要,应提供不与人工智能系统互动并切换到与人类互动的基本权利。此外,应以适当的方式向人工智能从业者或最终用户传达人工智能系统的性能和局限性。
B. 可解释人工智能和可解释人工智能
可解释人工智能和可解释人工智能有时互换使用,但有明确的意义区别:可解释人工智能通常用于设计本质上可理解的模型,它从设计阶段使模型变得可理解;可解释人工智能,则通常指的是使结果可理解的技术和方法。
可解释人工智能是透明人工智能的三个属性之一,旨在表明特定领域的人工智能试图实现的目标。人工智能的可解释性早在1970年代中期就开始了[17]。
可解释人工智能首次在2004年提出[18],它涉及社会科学、认知科学、心理学和人机交互等多个视角,旨在使人工智能系统的结果对人类更加可理解。在[19]中,作者总结了机器学习中使用的可解释性方法。
在一些研究中,可解释人工智能被视为可解释人工智能的一个子领域,用于表达在使人工智能系统可解释过程中出现的技术行为。
在本文中,我们无意在我们的调查中区分可解释人工智能和可解释人工智能的区别。我们的目标是对为什么模型会产生特定输出或决策进行解释的最新研究进行调查。所谓的黑箱可能需要多种可解释性措施协同工作,所需的可解释性程度非常依赖于具体情况。在本文中,我们将解释方法分类为基于范围的,其中解释在全球或局部实现,以及基于序列的,其中解释在不同阶段实现。
IV. 基于范围的解释方法
有两种不同的可解释形式,(1)理解整个模型的行为 - 全局可解释性:和(2)理解个别区域预测 - 局部可解释性。
A. 全局可解释性
全局可解释性帮助用户理解模型的整体逻辑。为了全局解释黑盒机器学习模型,[20]中的作者使用了一个紧凑的二叉树和一个解释树,以显式表示黑盒模型中隐含的最重要的决策规则。在这种情况下,全局解释比对特定部分的解释更有帮助。[21]中的作者提出了一种基于激活最大化的深度生成网络形式的事前学习技术。然而,在实践中,对于参数较少的模型,很难实现全局模型可解释性。
B. 局部可解释性
局部解释是最常用的生成深度神经网络(DNN)解释的方法。它解释了某个特定决策或单个预测的原因,意味着可解释性发生在局部。解释性挖掘用于生成个体解释,并通常用于证明模型在特定情况下为何做出给定决策的理由。[23]中的作者提出了局部可解释模型无关解释(LIME)模型。该模型可以在任何感兴趣的预测附近局部近似黑盒模型。[24]中的作者基于[25]的研究提出了一种称为Shapley解释的新技术。此外,由于全局解释不够好,研究人员尝试将局部解释与整体解释联系起来[26-28]。
图3 序列解释方法总结
V. 基于序列的解释方法
通过对以往文献的回顾,研究发现虽然许多文献提出了解释方法的分类[29],但总是缺乏一致性。对于可信人工智能中的解释方法,本研究采用以下两个尺度:(1)基于范围,如前所述;(2)基于序列,将在本节中解释。图3总结了可解释人工智能中的基于序列的解释方法。
人工智能的可解释性可以在三个阶段发生:建模前、建模中和建模后。
A. 建模前
建模前的可解释性意味着它发生在模型开发过程之前,这个阶段主要涉及数据收集、数据分类和模型的事前设计。
(1) 数据收集 许多研究人员使用数据增强来增加数据复杂性。在一系列作品[30-32]和其他作品中,通过应用一系列旋转、翻转和噪声添加到图像上,使用自我监督学习生成了新的样本数据集。
(2) 数据分类 [33]中的作者提出了原型网络来测量数据相似性,并被广泛采用。[34]中的作者从多模态(文本和图像)角度解决了小样本学习问题。论文提出利用强大的表示空间中的最近邻分类器。通过找到与未见过的测试样本最接近的多模态类别原型来进行分类。然而,每个数据类中原型点的独特性导致测试样本分类结果取决于它们与原型点的相似性。这可能导致过度泛化或过拟合,从而导致严重的数据偏差。在[35]中,作者通过提出判别样本生成以及自我节奏策略选择样本子集的方法扩展了这一方法。训练仅使用子集,在后续迭代中模型逐渐成熟时逐步增加。
[36]中的作者试图使用语义辅助视觉分类,但视觉到语义的领域尚未得到验证。
(3) 设计 一般来说,模型越复杂,解释它就越困难。因此,获得可解释的人工智能模型的最佳方法是在模型设置成本下寻找尽可能可解释的算法。
[37]中的作者提出了一种基于决策树的贝叶斯规则列表(BRL)模型,希望通过其简单性和说服力获得相关从业者的信任。[38]中的作者介绍了一种广义求和模型来解决肺炎问题。[39]中的作者介绍了一种基于注意力机制的模型,该模型自动学习描述图像内容。[40]中的作者提出了一种线性模型来创建数据驱动的评分系统。[41]中的作者指出,“准确通常需要更复杂的预测方法,简单的可解释函数并不能成为最准确的预测器”。
正如第四节所述,可解释性可以分为两种主要范式:全局解释和局部解释。表2总结了在建模前实现可解释人工智能所使用的方法在这两个类别下的情况。
B. 建模中
建模中的可解释性指的是开发内在解释模型的措施。在这个阶段,研究人员利用了特定模型的解释方法、注意自我解释联合建模的预测和解释。
(1) 特定模型的可解释方法 这种方法是特定模型的,也是模型独立的,这引起了极大的兴趣。[13]中的作者和其他人研究了卷积和逆卷积中的梯度以探索卷积神经网络中的关系,[42]中的作者简化了卷积神经网络的结构以完成任务的全卷积结构。
| 基于范围 | 方法 | 应用条件 | 技术/算法/模型 | 应用场景 |
|---|---|---|---|---|
| 全局 | 可解释 模型 |
透明参数 | 可解释决策树 [43] | 自动驾驶 |
| 可解释线性回归 [44] | 犯罪预测 | |||
| 解释逻辑回归 [45] | 人力资源管理 | |||
| 解释基于贝叶斯规则的算法 [46] | 垃圾邮件过滤器 | |||
| 可解释支持向量机(SVM) [47] | 制造质量控制 | |||
| 统计学家 | 先验 知识 和 经验 |
因果模糊认知图 [48] | 城市规划与治理 | |
| 基于传感器 | 脉冲神经网络(SNN) [49] | 机器人感知与控制 | ||
| 局部 | 可解释 模型 |
透明参数 | 梯度提升决策树(GBDT) [50] | 电子商务搜索引擎排序 |
| 统计学家 | 概率和因果 | 结构因果模型 [51] | 环境科学研究 | |
| 贝叶斯因果网络 [52] | 生产过程优化 | |||
| 对策解释 | 数据为基础 | 生成对抗网络(GAN) [53] | 数据增强和样本生成 | |
| 场景为基础 | 多样化反事实解释(DiCE) [54] | 个性化推荐系统 | ||
| 不知 | 数据为基础 | 可解释主成分分析(PCA) [55] | 金融分析和客户行为分析 | |
| t分布随机邻居嵌入(t-SNE) [56] | 分析图形文字数据的相似性 | |||
| 统一流形逼近和投影(UMAP) [57] | 分析生物遗传数据 |
表2 可解释人工智能前期建模中使用的技术
(2) 注意力自我解释 它结合了预测与解释。通过为数据分配权重和重要性,基于注意力的方法被认为更有希望。[58]中的作者探讨了回答图像自由形式自然语言问题的视觉问答(VQA)任务,其中VQA模型在问答过程中融入了文本信息。[59]中的作者提出了故障和知识预测指标,发现HIL(人在环路)方法使人能够理解。[60]中的作者扩展了[61]中的方法,通过使用文本解释和相应的视觉区域来解释VQA任务的结果。这个过程在模块间传递注意力掩码,探索跨模态互补性,展示了生成多模态解释的价值和优势。[62]中的研究使用监督注意力模型,以训练生成类似于人类推理的解释。
表3 总结了试图实现可扩展人工智能的建模期间方法的最新发展。
C. 建模后
建模后方法,也常被称为模型无关或事后解释方法
[66-67] 目前在可解释人工智能(XAI)领域中是一种经常引用的分类方法。在本研究中,我们借鉴了[68]及其他文献中关于XAI的模型无关分类,并将分类目录设定为:可视化、知识提取、影响方法和事实描述。
(1) 可视化
可视化技术主要应用于监督学习模型,是探索人工智能系统众多有效方法之一。本研究中介绍的元素按如下分类:
- 替代模型
-
- 控制变量图
-
- 交互方法
a. 替代模型
- 交互方法
它从原始黑箱模型的预测中训练而来。它可以用来解释复杂模型。LIME [67] 方法是一种规定的方式来围绕单一观察值构建局部替代模型。[69] 中的作者使用替代模型方法提取代表模型行为的决策树。另一项研究[70] 提出了一种使用替代模型构造树视图可视化方法的方法。
表3 可解释人工智能建模期间使用的技术
| 基于范围 | 应用条件 | 技术/算法/模型 | 应用场景 |
|---|---|---|---|
| 全局 | 简化基础 | 架构修改技术 [63] | 语音识别信号增强 |
| 全局&局部 | 参数基础 | 基于反向传播的方法 [64] | 成像任务的重要特征化 |
| 局部 | 权重基础 | 注意力机制 [65] | 自然语言处理(NLP) |
b. 控制变量
这种方法指通过展示一个或多个输入变量与黑箱模型预测之间的平均部分关系来建立结果与原因之间的联系。部分依赖图(PDP)和个体条件期望(ICE)用于表达结果与原因之间的关系。部分依赖图是一种使用图形表示目标函数与特征之间关系的方法,有助于可视化变量变化对结果的整体影响。部分依赖图的研究[71]显示了最终预测特征的边际效应。[72] 中的作者演示了使用随机森林和相关PDP准确建模在刑事司法环境中不对称分类成本下的预测响应关系的优势。个体条件期望揭示了基于PDP图表的交互和个体差异。[73] 中的作者提出了ICE的初步理论,并阐明了其相对于PDP的优势。[74] 中的作者提出了基于局部特征重要性的表示方法。
c. 交互方法
交互方法最初是为了利用机器学习的透明性来分析多模态系统的准确性[75],但现在已被广泛用于可解释性研究。[76] 中的作者应用虚拟代理来提高用户信任,发现视觉和语音组合的多模态解释更具说服力。[77] 中的作者提出了一种交互算法,该算法被XAlgo用于通过回答问题来解释系统的内部状态。[78] 中的作者介绍了一种具有“主动注意力”机制的交互模型。通过结合模型解释和注释,模型解释基于用户信任、心理模型和可用性等指标进行评估。这种方法调整模型注意力,并提供用户反馈以纠正不准确的预测,最终提高准确性。基于对话的解释系统通过整合多种感官的交互方法,为用户提供比传统系统更好的解释[79]。
(2) 知识提取
从网络中提取知识的任务是提取神经网络在训练过程中获得的知识,以一种可理解的形式编码成内部表示。本研究设计了两种主要方法
从人工神经网络中提取知识:规则提取和模型精炼。
a. 规则提取
为了深入了解高度复杂的模型,许多研究人员已经开始尝试规则提取[80]。通过提取规则,提供符号化和可理解的描述,这些规则近似了AI网络利用其输入和输出的决策过程。在一项研究[81]中,规则提取策略被分类,并提出了三种规则提取模型:教学规则提取、分解规则提取和妥协规则提取。
b. 模型蒸馏
蒸馏是一种模型压缩类型,它将教师网络(深层网络)学到的知识转移到学生网络(浅层网络)[82, 83]。模型压缩最初用于降低运行模型的计算成本,但现在也被应用于可解释性。[84]中的作者研究了如何使用模型蒸馏将复杂模型蒸馏成尽可能透明的形式。[85]中的作者介绍了一种新的知识蒸馏方法,称为可解释模仿学习(IIL)方法。此后,[86-87]中的研究扩展了这种方法。
(3) 影响水平方法
这种类型的途径通过改变输入或内部组件并记录这些变化对模型性能影响的程度来估计特征或模块的重要性及其相关性。相关方法有:敏感性分析、分层相关传播和特征重要性度量。
a. 敏感性分析
它用于验证当数据被故意扰动或其他变化发生在模拟数据中时,模型行为和输出是否保持稳定[88]。敏感性分析越来越多地被用于解释深度神经网络中的图像分类[89-90]。
| 基于范围 | 方法 | 应用条件 | 技术/算法/模型 | 应用场景 |
|---|---|---|---|---|
| 事后 (局部) |
不知 | 数据为基础 | 局部可解释模型无关解释(LIME)[98] | 数据科学实验 |
| 扰动方法[99] | 保险索赔评估 | |||
| 特征为基础 | SHapley Additive exPlanations (SHAP)[100] | 气候变化预测 | ||
| 特征重要性得分[101] | 评估AI模型的软件 | |||
| 归因方法[102] | 企业业务指标评估 | |||
| 局部扰动技术[103] | 计算机视觉的比较和分类 | |||
| 敏感性/稳定性方法[104] | 自然语言处理中的情感分析 | |||
| 图 示例 为基础 |
图神经网络解释器(GNN Explainer)[105] | 知识推理 | ||
| 基于梯度的技术:类激活映射(CAM)[106] | 安全监控中的异常检测 | |||
| 事后 (全局) |
特定 | 特征为基础 | 特征贡献技术[107] | 房价趋势分析 |
| 简化 -为基础 | 激活映射[108] | 目标检测可视化 | ||
| 替代 | 模型蒸馏[109] | 云计算任务 | ||
| 统计学家 | 概率和因果 | 可解释朴素分层贝叶斯模型[110] | 推荐系统 | |
| 贝叶斯信念网络[111] | 工业设备故障诊断 | |||
| 特征为基础 | 部分依赖图(PDP)[112] | 金融风险管理 | ||
| 回归概念向量(RCV)[113] | 医疗诊断 |
表4 后建模中使用的可解释人工智能技术
b. 分层相关传播
分层相关传播算法(LRP)最早在[91]中提出。该算法执行预测函数的反向再分配,从网络的输出层开始,然后反向传播到输入层。此再分配过程的关键特性称为相关性守恒。
c. 特征重要性
特征重要性量化了每个输入变量对复杂ML模型预测的贡献。[92]中的作者在提出基于决策边界模型来解释数据分类时,使用了特征重要性的定量排名,计算模型预测误差的增加可以用来衡量特征的重要性。类似地,[93]提出了模型无关版本的特征重要性,称为模型类依赖(MCR)。[94]中的作者提出了局部版本的特征重要性,基于排列的Shapley特征重要性(SFIMP),以公平地分配模型性能到特征,并比较不同模型间的特征重要性。
(4) 基于实例的样本
大多数基于示例的解释与模型本身没有直接关系;基于样本的解释方法通过从数据集中选择代表性样本来解释模型。一种常见的方法是反事实解释,它通过假设预测结果的相反情况来推理。
对比式的、基于人类的失败事件反思可以促使人们思考机器为何得出某一结果而非其他可能结果。例如,假如贷款申请被拒绝[95]。在这种情况下,存在哪些步骤和最小变化可以改变不良结果的问题,在[96]中,作者提出了一种无条件反事实解释的新方法,用于自动化决策。基于反事实的多模态解释可以提供可行的见解和建议[97]。
表4 总结了试图实现可扩展人工智能的后期建模方法的最新发展。
VI. 人工智能可解释性的新趋势、机遇与挑战
A. 可解释人工智能与元推理
本文调查的基于序列和基于范围的方法的关键挑战是,由于学习和推理之间的复杂相互作用,可解释性被掩盖,两者都是人工智能系统的基本要求,这使得提取极其困难。我们主张可以通过将问题投射到奖励空间中,以奖励驱动的可解释性来解决人工智能系统的可解释性问题。这种方法专注于使用逻辑推理技术仅在奖励空间中解释人工智能系统的潜在影响,这显著降低了复杂性并提高了可观察性。
元推理的概念是“推理推理”[136],这与可解释人工智能的意图和目标相吻合。将这些方法整合起来可以为未来的可解释人工智能系统铺平道路。
元推理(如图4所示)旨在通过观察奖励模式而不是基于序列或基于范围的因果关系来简化符号接地过程。传统上,人工智能中的逻辑推理被用于对象驱动的知识表示和推理,但在数据驱动模型所需的基础层面往往不足。元推理包括计算活动的元级控制和推理的内省监测[114]。该概念已在神经科学中成功应用,作为元分析的一部分,用于合成来自多个独立模型的定量数据[115]。
与元学习相比,元学习专注于地面层面的数据高效使用,而元推理则强调对象层面计算模型和资源的高效使用,这对人工智能系统的可信度至关重要。我们主张通过将问题投射到奖励空间中,以奖励驱动的可解释性来实现人工智能系统的可解释性是一个新的研究趋势。这种简化避免了难以用还原论观点定义的数据驱动混沌系统,这是可信人工智能所期望的[116,117][116,117][116,117]。
图4 推理与行动的二重性
人工智能的推理和可解释性在元层面共享一个共同目标:在对象层面,解释基础层面(行动-感知)的观察。元层面控制的目标是通过确定要进行多少推理来改进其决策质量,而不是仅仅专注于行动。可解释性的目标是验证模型与其设计的一致性。
在[118]中,作者识别了元推理的变体。假设有一个固定的可能计划(决策)集合供代理选择,代理对每个计划有一些现有的预期。代理可以对每个计划采取一些考虑行动;根据考虑行动的奖励,该计划的预期效用会发生变化。这里的目标是找到一个最大化代理预期效用/奖励的考虑策略。另一个变体是,代理知道有多个状态需要澄清/预测,为了获得非零效用,代理需要通过考虑确定状态。
B. 可信自主系统和领域随机化
实现可解释性的主要挑战涉及在元层面建立数学框架进行监控和控制。基于贝叶斯的网络允许我们学习神经网络可能行为的概率分布,从而在基础层面和对象层面之间架起桥梁。为此,可信自主系统和领域随机化技术被集成以在奖励空间中创建更可解释的人工智能系统。可信自主系统和领域随机化本质上并不是“基于奖励”的,但它们可以涉及基于奖励的机制。
信任是一种可以通过与相应代理互动而建立的心理状态。通过与自主系统互动可以建立对人工智能的信任。鉴于可信自主系统中的人工智能[119]直接暴露在奖励空间中,其可解释性可以通过根据其设计解释相应自主系统的行为来观察和验证。同时,领域泛化使人工智能能够在减少对分布式训练区域依赖的情况下做出决策。其目标是从多个已知源域学习一个可推广的模型,然后直接推广到未知目标域,无需额外适应。这种方法通过在空间域中将源图像转换为不同风格以学习领域无关的特征,已被广泛研究用于创建更健壮的神经网络。这显著减少了网络错误的影响,使可解释性能够专注于基础层面信息生成的真实奖励。
领域随机化已在机器人训练[120-124]和图像澄清[125-127]中使用,获取所需的真实世界数据通常成本高昂或对外部干扰脆弱。不幸的是,由于模拟和现实之间的不匹配,即所谓的“现实差距”,这样的政策往往无法转移到现实世界。领域随机化方法通过根据领域参数分布随机化物理模拟器(源域)来解决这个问题,以获得更能克服现实差距的稳健政策。它根据奖励操纵训练数据,例如在某些特定模拟中学习或故意在训练数据中添加随机噪声,可以提高神经网络的鲁棒性。
在[128]中,作者提出了一种特征级增强策略——风格随机化,可以简单通过多样化源域来增加网络的泛化能力。在[129]中,作者提出了一种方差减少领域随机化(VRDR)方法,用于策略梯度方法,以在实际实现中对方差减少和计算复杂性进行权衡。在[130]中,作者提出了一种通过纹理和风格信息领域随机化实现的遥感图像分割的单域泛化方法。在[131]中,作者提出了一种基于多域随机化的无监督跨域目标检测方法。设计了领域随机化参数回调模块以保留对象的关键检测信息,从而提高模型的稳定性。还结合了源域一致性损失以增强模型的收敛速度并放大特征中嵌入的语义信息。
C. 大型语言模型在可解释人工智能中的应用
近年来,大型语言模型(LLMs)的进展显著增强了人工智能通过自动化和结构化推理能力的可解释性。LLMs在自然语言理解和生成方面的卓越能力对于协调元推理至关重要,这有助于根据观察识别出最适合的人工智能系统解释。这一快速发展的领域在过去一年中取得了实质性进展,并有望在实现可解释人工智能的各种方法中发挥关键作用。
[132]、[133]和[134]中的作者使用链式思维和树状思维将LLMs转化为推理者,从而从问题解决的角度解释人工智能的潜力。尽管这些方法在特定场景中增强了可解释性,但它们在不同任务中实现一致性能的能力尚显不足[135]。这种局限性可以通过元推理来缓解,元推理确保在元层面监控和控制推理范式[116]。因此,将元推理与LLMs集成的一个关键优势是能够根据上下文和具体任务需求调整策略。这对于应对现实世界问题的多样性和复杂性至关重要,并已被应用于元推理提示(MRP),赋予LLMs自适应解释能力[135]。[137]中的作者提出了一种新方法,通过将Shapley加法解释(SHAP)值与LLMs结合,以增强入侵检测中的透明度和信任。在[138]中,作者结合马尔可夫逻辑网络(MLNs)与通过LLMs提取的外部知识,旨在同时提高可解释性和准确性。在[139]中,领域专家被整合到提示工程中,作为人在环路的一部分,作者将解释设计为文本模板,由LLM填充和完成。[140]比较了全局基于规则的模型(LLM和DT)与已建立的黑箱模型。基于规则的模型形状比来自更复杂黑箱模型如支持向量机(SVM)或神经网络的结果更为简单。
VI. 结论
本文首先调查了各国和地区关于使人工智能算法值得信赖的最新标准和发展。然后调查了实现可解释人工智能所使用的技术。最后,我们确定了解释性的新趋势,并列出了潜在解决方案。
参考文献
[1] H. Liu, Y. Wang, W. Fan, X. Liu, Y. Li, S. Jain, Y. Liu, A. Jain, 和 J. Tang, “可信人工智能:计算视角”, ACM Trans. Intell. Syst. Technol. 14, 1, 文章 4, 2023, 59页。 https://doi.org/10.1145/3546872
[2] IEEE ECPAIS: https://oecd.ai/en/catalogue/tools/ieee-ethics-certification-program-for-autonomous-and-intelligent-systems-ecpais
[3] V. Hassija, V. Chamola, A. Mahapatra 等人, “解释黑盒模型:可解释人工智能综述”, Cogn Comput (2023). https://doi.org/10.1007/s12559-023-10179-8
[4] M. Du, F. Yang, N. Zou 和 X. Hu, “深度学习中的公平性:计算视角,” 在 IEEE Intelligent Systems, 卷 36, 第 4期, 第 25-34页, 2021年7月-8月, doi: 10.1109/MIS.2020.3000681.
[5] DARPA: https://www.darpa.mil/program/explainable-artificialintelligence 2850
[6] 采用文本 - 可信人工智能产业生态发展报告 (2022) - 中国信息通信研究院。可在: http://www.caict.ac.cn/sytj/202209/t20220913_408839.htm (访问日期: 2023年10月17日).
[7] 欧盟AI HELG: https://digital-strategy.ec.europa.eu/en/policies/expert-group-ai#: :texts#The%20AI%20HLEG%20has%20worked_society%2C%20EU%20citizens%20and%20policymakers.
[8] 采用文本 - 机器人技术的民法规则 - 星期四,2017年2月16日 europarl.europa.eu. 可在: https://www.europarl.europa.eu/docs/document/TA-8-20170051_EN.html (访问日期: 2023年10月17日).
[9] 欧洲的数字十年:2030年的数字目标 欧洲委员会。可在: https://commission.europa.eu/strategy-and-policy/priorities-2019-2024/europe-fit-digital-age/europes-digital-decade-digital-targets-2030_en (访问日期: 2023年10月18日).
[10] 国防部采用人工智能伦理原则 美国国防部。可在: https://www.defense.gov/News/Releases/release/article/2091996/dod-adopts-ethical-principles-for-artificial-intelligence/ (访问日期: 2023年10月17日)
[11] 国防部采用5项人工智能伦理原则 美国国防部。可在: https://www.defense.gov/News/News-Stories/article/article/2094085/dod-adopts-5-principles-of-artificialintelligence-ethics/ (访问日期: 2023年10月17日).
[12] 可信且负责任的人工智能,NIST。可在: https://www.nist.gov/trustworthy-and-responsible-ai (访问日期: 2023年10月17日).
[13] 可信人工智能的伦理指南 (2019) 塑造欧洲的数字未来。可在: https://digitalstrategy.ec.europa.eu/en/library/ethics-guidelines-trustworthy-ai (访问日期: 2023年10月17日).
[14] 关于日本人工智能学会伦理准则的说明 日本人工智能学会伦理委员会。可在: https://www.ai-gakkai.or.jp/ai-elsi/archives/514 (访问日期: 2023年10月17日).
[15] L. Floridi, J. Cowls, M. Beltrametti, R. Chatila, P. Chazerand, V. Dignum, C. Luetge, R. Madelin, U. Pagallo, F. Rossi, 和 B. Schafer, “构建良好人工智能社会的伦理框架:机遇、风险、原则和建议”. 人工智能中的伦理、治理和政策 / [ed] Luciano Floridi, Springer Nature, 2021, p. 21p. 19-39
[16] W. R. Swartout 和 J. D. Moore, “专家系统中的解释:综述,‘’ Univ. Southern California, Los Angeles, CA, USA, 技术报告 ISJ/RR-88-228, 1988.
[17] D. Gunning 和 D. Aha, “DARPA 的可解释人工智能 (XAI) 计划”, AI Magazine, 40(2), pp. 44-58. doi: 10.1609/aimag.v40i2.2850, 2019
[18] M. van Lent, W. Fisher, 和 M. Mancuso, "一种可解释的人工智能系统用于小队战术行为,’’ in Proc. 16th Conf. Innov. Appl. Artif. Intell., 2004, pp. 900-907.
[19] P. Linardatos, V. Papastefanopoulos, 和 S. Kotsiantis, “可解释的人工智能:机器学习可解释性方法综述”, MDPI Entropy 2021, 23(1), 18; https://doi.org/10.3390/e23010018, 特刊: 理论和应用的信息理论机器学习
[20] C. Yang, A. Rangarajan, 和 S. Ranka. (2018). “全局模型解释通过递归分区.” [在线]. 可用: https://arxiv.org/abs/1802.04253.
[21] A. Nguyen, A. Dosovitskiy, J. Yosinski, T. Brox, 和 J. Clune, “通过深度生成网络合成神经网络中神经元的首选输入,” in Proc. Adv. Neural Inf. Process. Syst. (NIPS), 2016, pp. 3387-3395.
[22] D. Erhan, A. Courville, 和 Y. Bengio, “理解深度架构中学习到的表示,” Dept. d’Informatique Recherche Operationnelle, Univ. Montreal, Montreal, QC, Canada, 技术报告 1355, 2010.
[23] M. T. Ribeiro, S. Singh, 和 C. Guestrin, “‘为什么我应该信任你?’: 解释任何分类器的预测,” in Proc. 22nd ACM SRIKDD Int. Conf. Knowl. Discovery Data Mining, 2016, pp. 11351144.
[24] S. M. Lundberg 和 S. I. Lee, “统一解释模型预测的方法,” in Proc. Adv. Neural Inf. Process. Syst., 2017, pp. 47684777.
[25] R. Fong 和 A. Vedaldi, '通过有意义的扰动解释黑盒子的可解释解释.” [在线]. 2017, 可用: https://arxiv.org/abs/1704.03296
[26] P.-J. Kindermans 等人., “学习如何解释神经网络: PatternNet 和 patternAttribution,” in Proc. Int. Conf. Learn. Represent., 2018, pp. 1-16. 访问日期: 2018年6月6日. [在线]. 可用: https://openreview.net/forum?id=Hka7CBaTW
[27] A. Ross, M. C. Hughes, 和 F. Doshi-Velez, “出于正确原因的正确决定: 通过约束其解释训练可微分模型,” in Proc. Int. Joint Conf. Artif. Intell., 2017, pp. 2662-2670.
[28] R. Guidotti, A. Monreale, S. Ruggieri, D. Pedreschi, F. Turini, 和 F. Giannotti. (2018). “本地基于规则的黑盒决策系统的解释.” [在线]. 可用: https://arxiv.org/abs/1805.10820
[29] A. B., Arrieta, N. Díaz-Rodríguez, J. Del Ser, A. Bennetot, S. Tabik, A. Barbado, S. Garcia, S. Gil-Lopez, D. Molina, R. Benjamins, R. Chatila, 和 F. Herrera, “可解释人工智能 (XAI): 概念、分类、机遇和挑战以及负责任的 A”, Information Fusion, 2020, 58, pp. 82-115 可用: 10.1016/j.inffus.2019.12.012.
[30] Z. Chen, Y. Fu, Y. Wang, L. Ma, W. Liu, 和 M. Hebert, “图像变形元网络用于一次性学习”. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, 2019, pp. 8680-8689
[31] Z. Chen, Y. Fu, K. Chen, 和 Y. Jiang, “图像块增强用于一次性学习”. In Proceedings of the AAAI Conference on Artificial Intelligence, 2019, Vol. 33, No. 01, pp. 3379-3386
[32] Z. Chen, Y. Fu, Y. Zhang, Y. Jiang, X. Xue, 和 L. Sigal, “多层次语义特征增强用于一次性学习”. IEEE Transactions on Image Processing, 2019, 28(9), pp.4594-4605.
[33] J. Snell, K. Swersky, 和 R. Zemel, “原型网络用于少量学习”. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA.
[34] F. Pahde, M.M. Puscas, T. Klein, M. Nabi, “多模态原型网络用于少量学习”, Proceeding of IEEE Winter Conference on Applications of Computer Vision, WACV 2021, Waikoloa, HI, USA, January 3-8, 2021, IEEE, 2021, pp. 2643-2652, http://dx.doi.org/10.1109/WACV48630.2021.00269.
[35] F. Pahde, O. Ostapenko, P. Jähnichen, T. Klein, M. Nabi, “自我节奏对抗训练用于多模态少量学习”, Proceeding of IEEE Winter Conference on Applications of Computer Vision, WACV 2019, Waikoloa Village, HI, USA, January 7-11, 2019, IEEE, 2019, pp. 218-226, http://dx.doi.org/10. 1109/WACV.2019.00029.
[36] C. Xing, N. Rostamzadeh, B. Oreshkin, 和 P. O., Pinheiro, “自适应跨模态少量学习”. Advances in Neural Information Processing Systems, 32. 2019
[37] B. Letham, C. Rudin, T. H. McCormick, 和 D. Madigan, “使用规则和贝叶斯分析的可解释分类器:构建更好的中风预测模型,” Ann. Appl. Statist., vol. 9, no. 3, pp. 1350-1371, 2015.
[38] R. Caruana, Y. Lou, J. Gehrke, P. Koch, M. Sturm, 和 N. Elhadad, “医疗保健领域的可理解模型:预测肺炎风险和医院30天再入院,” in Proc. 21th ACMSIGKDD Int. Conf. Knowl. Discovery Data Mining, 2015, pp. 1721-1730.
[39] K. Xu, J. Ba, R. Kiros, K. Cho, A. C. Courville, R. Salakhutdinov, R. S. Zemel, 和 Y. Bengio, “展示、关注并讲述:具有视觉注意力的神经图像字幕生成”. Proceeding of 32nd International Conference on Machine Learning Research. 37:2048-2057, 2015
[40] B. Ustun 和 C. Rudin, “超稀疏线性整数模型用于优化医学评分系统,” Mach. Learn., vol. 102, no. 3, pp. 349−391,2015349-391,2015349−391,2015.
[41] L. Breiman, “统计建模:两种文化(附评论和作者的回应),” Stat. Sci., vol. 16, no. 3, pp. 199-231, 2001.
[42] J. Tobias Springenberg, A. Dosovitskiy, T. Brox, 和 M. Riedmiller, ‘追求简单:全卷积网络,’ 2014, arXiv:1412.6806. [在线]. 可用: http://arxiv.org/abs/1412.6806.
[43] J. Imanuel, L. Kintanswari, H. Lucky, 和 A. Chowanda, “使用决策树C4.5方法进行印尼新闻平台虚假信息检测的可解释人工智能(XAI)”, 2022国际科学与技术在智能管理中的应用会议, 2022
[44] M. David, E. S. Mhabazi, J. Nakatumba-Nabende 和 G. Marvin, “使用可解释回归技术的犯罪预测”, 第7届电子与信息趋势国际会议论文集, 2023
[45] T. Xiang, P. Z. Wu, S. Yuan, “结合BP神经网络和逻辑回归在人力资源管理系统中的应用分析”, Computational Intelligence and Neuroscience, 2022, pp. 1-11. doi: 10.1155/2022/7425815.
[46] A. K. Panda, B. Kosko, “贝叶斯修剪随机规则泡沫用于XA1”, 2021 IEEE模糊系统国际会议 (FUZZIEEE)
[47] C. A. Escobar, 和 R. Morales-Menendez, “过程监控质量 - 支持向量机模型选择标准”, Procedia Manufacturing, 34, pp. 1010-1017 可用: 10.1016/j.pronfg. 2019.06.094.
[48] A. Nair, D. Reckien, 和 M.F.A.M van Maarseveen, “广义模糊认知图:考虑因果关系的时间动态”, Applied Soft Computing, 92, pp. 106309 可用: 10.1016/j.asoc.2020.106309.
[49] Y. Kim, P. Panda, “尖峰神经网络的视觉解释使用尖峰间隔”. Sci Rep 11, 19037 (2021). https://doi.org/10.1038/s41598-021-98448-0
[50] H. Wu 和 B. Li, “基于改进梯度提升决策树算法的客户购买预测,” 第二届消费电子与计算机工程国际会议 (ICCECE), 广州, 中国, 2022, pp. 795-798, doi: 10.1109/ICCECE54139.2022.9712779.
[51] R. Hatami, “利用因果建模开发环境影响研究协议”, Water research, 138, pp. 206-223 可用: 10.1016/j.watres.2018.03.034.
[52] L. Wang, J. Zhou, J. Wei, M. Pang, 和 M. Sun, M. “基于因果分析的因果贝叶斯网络学习用于分类”, 工程应用人工智能, 114, pp. 105212 可用: 10.1016/j.engappai.2022.105212.
[53] I. S. A. Abdelhalim, M. F. Mohamed, Y. B. Mahdy, “使用基于自注意力的渐进生成对抗网络进行皮肤病变数据增强”, Expert Systems with Applications, 165, pp. 113922 可用: 10.1016/j.ewaa.2020.113922.
[54] P. Rodríguez, M. Caccia, 等. al., “超越平凡的反事实解释:有价值的多样化解释”, 2021 IEEE/CVF国际计算机视觉会议 (ICCV) 论文集, 2021
[55] B. Liu, M. Lai, “高级金融市场的机器学习:PCA-GRU-LSTM方法”. J. Knowl Econ (2024). https://doi.org/10.1007/s13132-024-02108-3
[56] F. Luus, N. Khan, 和 I. Akhalwaya, “交互式监督与tSNE”. 第10届国际知识获取会议 (K-CAP ‘19). 计算机协会, 纽约, NY, USA, 85-92. https://doi.org/10.1145/3360901.3364414, 2019
[57] H. Han, W. Li, J. Wang, G. Qin, 和 X. Qin, “提升流形学习的可解释性”, Neurocomputing, 500, pp. 877-895 可用: 10.1016/j.neucom.2022.05.119.
[58] S. Antol, A. Agrawal, J. Lu, M. Mitchell, D. Batra, C. L. Zitnick, 和 D. Parikh, “VQA:视觉问答,” in Proc. IEEE Int. Conf. Comput. Vis. (ICCV), Dec. 2015, pp. 2425-2433.
[59] A. Chandrasekaran 和 P. Chattopadhyay, “解释是否让VQA模型对人类更具可预测性?” in Proc. Conf. Empirical Methods Natural Lang. Process., 2018, pp. 1036-1042.
[60] D. H. Park, L. A. Hendricks, Z. Akata, A. Rohrbach, B. Schiele, T. Darrell, 和 M. Rohrbach, “多模态解释:证明决策并指向证据,” in Proc. IEEE Conf. Comput.
Vis. Pattern Recognit., Jun. 2018, pp. 8779-8788. [Online]. Available: https://arxiv.org/abs/1802.08129
[61] M. Hind, D. Wei, M. Campbell, N. C. F. Codella, A. Dhurandhar, A. Mojsilović, K. N. Ramamurthy, 和 K. R. Varshney, "TED:教导AI解释其决策,’’ in Proc. AAAI/ACM Conf. AI, Ethics, Soc., 2019, pp. 123-129.
[62] J. Strout, Y. Zhang, 和 R. J. Mooney, '“人类理由是否改善机器解释?” 2019, arXiv:1905.13714. [Online]. Available: http://arxiv.org/abs/1905.13714
[63] S. Becker, M. Ackermann, S. Lapuschkin, K. R. Müller, 和 W. Samek, “解释和解释用于音频信号分类的深度神经网络”. arXiv preprint arXiv:1807.03418, 1. 2018
[64] E. Mohamed, K. Sirlantzis, 和 G. Howells, “卷积神经网络可视化作为解释技术及其评估的综述”, Displays, 73, pp. 102239 可用: 10.1016/j.displa.2022.102239.
[65] N. Dehimi; Z. Tolba, “深度学习中的注意力机制:迈向可解释的人工智能” 2024年第六届国际模式分析与智能系统会议 (PAIS)
[66] R. C. Fong 和 A. Vedaldi, “通过有意义的扰动解释黑箱的可解释解释,” in Proc. IEEE Int. Conf. Comput. Vis. (ICCV), Oct. 2017, pp. 3429-3437.
[67] A. Sharma, R. Rai, Z. Zhang, “制造中的解释模型:机器学习在制造中的理论框架和研究议程”, Intl J. of Production Research, June 2021, DOI: 10.1080/00207543.2021.1930234
[68] A. Adadi 和 M. Berrada, “窥探黑箱内部:可解释人工智能(XAI)的综述,” in IEEE Access, vol. 6, pp. 52138-52160, 2018, doi: 10.1109/ACCESS.2018.2870052.
[69] O. Bastani, C. Kim, 和 H. Bastani, “通过模型提取实现可解释性.” [在线]. Available: https://arxiv.org/abs/1706.09773, 2017
[70] J. J. Thiagarajan, B. Kailkhura, P. Sattigeri, 和 K. N. Ramamurthy. (2016). “TreeView:通过特征空间划分窥探深度神经网络.” [在线]. Available: https://arxiv.org/abs/1611.07429
[71] Z. Liu, Y. Shen, V. B. Lakshminarasimhan, P. P. Liang, A. Zadeh, 和 L. P. Morency, “高效低秩多模态融合与模态特定因素,” Proc. 56th Annu. Meeting Assoc. Comput. Linguistics, 2018, pp. 2247-2256, doi: 10.18653/v1/p18-1209.
[72] R. Berk 和 J. Bleich, “预测犯罪行为的统计程序:比较评估,” Criminol. Public Policy, vol. 12, no. 3, pp. 513-544, 2013.
[73] A. Goldstein, A. Kapelner, J. Bleich, 和 E. Pitkin, “窥探黑箱内部:使用个体条件期望图可视化统计学习,” J. Comput. Graph. Statist., vol. 24, no. 1, pp. 44-65, 2015, doi: 10.1080/10618600.2014.907095.
[74] G. Casalicchio, C. Molnar, 和 B. Biochl. (2018). “可视化黑箱模型的特征重要性.” [在线]. Available: https://arxiv.org/abs/1804.06620
[75] K. Sokol, P. Flach, “一个解释不适合所有人”. Künstl Intell 34, 235-250, 2020. https://doi.org/10.1007/s13218-020-00637-y
[76] K. Weitz, D. Schiller, R. Schlagowski, T. Huber, 和 E. André, “让我解释!”, 探索虚拟代理在可解释人工智能交互设计中的潜力," J. Multimodal User Interfaces, 2020, pp. 1-12.
[77] J. Rebanal, Y. Tang, J. Combitzis, K.-W. Chang, 和 X. Chen, “XAlgo:通过问答解释算法的内部状态,” 2020, arXiv:2007.07407. [在线]. Available: https://arxiv.org/abs/2007.07407
[78] K. Alipour, J. P. Schulze, Y. Yao, A. Ziskind, 和 G. Burachas, ‘"研究多模态和互动解释用于视觉问答,’’ 2020, arXiv:2003.00431
[79] D. Braines 和 D. Harborne, “基于多模态解释的人工智能传感器融合,” in Proc. RSM Artif. Intell. Military Multisensor Fusion Engines, 2018, pp. 1-13.
[80] T. Hailesilassie, “深度神经网络的规则提取算法:综述”. arXiv preprint arXiv:1610.05267. 2016
[81] G. Ras, M. V., Gerven, 和 W. P., Haselager, “深度学习中的解释方法:用户、价值、关切和挑战”. ArXiv, abs/1803.07517. 2018
[82] P. Sadowski, J. Collado, D. Whiteson, 和 P. Baldi, “深度学习、暗知识和暗物质,” Proc. NIPSWorkshop High-Energy Phys. Mach. Learn. (PMLR), vol. 42, 2015, pp. 81-87.
[83] G. Hinton, O. Vinyals, 和 J. Dean. “蒸馏神经网络的知识.” [在线]. Available: https://arxiv.org/abs/1503.02531, 2015
[84] S. Tan, “检测黑箱模型偏差的可解释方法,” in Proc. AAAI/ACM Conf. AI Ethics Soc., 2017, pp. 1-2.
[85] Z. Che, S. Purushotham, R. Khemani, 和 Y. Liu, “从深层网络蒸馏知识及其在医疗领域的应用” arXiv preprint arXiv:1512.03542. 2015
[86] K. Xu, D. H., Park, C. Yi, C. 和 C. Sutton, “通过视觉蒸馏解释深度分类器”. arXiv preprint arXiv:1803.04042. 2018
[87] S. Tan, R. Caruana, G. Hooker, 和 Y. Lou, “十二月. 蒸馏与比较:使用透明模型蒸馏审计黑箱模型”. In Proceedings of the 2018 AAAI/ACM Conference on AI, Ethics, and Society (pp. 303-310).
[88] Y. Zhang 和 B. Wallace. “卷积神经网络在句子分类中的敏感性分析及从业者指南.” [在线]. Available: https://arxiv.org/abs/1510.03820. 2016
[89] P. Cortez 和 M. J. Embrechts, “使用敏感性分析和可视化技术打开黑箱数据挖掘模型,” Inf. Sci., vol. 225, pp. 1-17, Mar. 2013.
[90] P. Cortez 和 M. J. Embrechts, “打开黑箱数据挖掘模型使用敏感性分析,” in Proc. IEEE Symp. Comput. Intell. Data Mining (CIDM), Apr. 2011, pp. 341-348.
[91] S. Bach, A. Binder, G. Montavon, F. Klauschen, K.-R. Müller, 和 W. Samek, “非线性分类器决策的像素级解释通过逐层相关传播,” PLoS ONE, vol. 10, no. 7, p. e0130140, 2015.
[92] A. Delaforge, J. Azé, S. Bringay, C. Mollevi, A. Sallaberry, 和 M. Servajean, “Ebbe-text:通过探索文本分类决策边界解释神经网络”. IEEE Transactions on Visualization and Computer Graphics. Vol. 29, Issue 10, pp 4154 - 4171. 2022
[93] A. Fisher, C. Rudin, 和 F. Dominici. “模型类依赖:任何机器学习模型类别的变量重要性度量,从‘拉什蒙’角度出发.” [在线]. Available: https://arxiv.org/abs/1801.01489. 2018
[94] G. Casalicchio, C. Molnar, 和 B. Biochl. “可视化黑箱模型的特征重要性.” [在线]. Available: https://arxiv.org/abs/1804.06620, 2018
[95] A. Rai, “可解释人工智能:从黑箱到玻璃箱”. J. of the Acad. Mark. Sci. 48, 137-141 (2020). https://doi.org/10.1007/s11747-019-00710-5
[96] S. Wachter, B. D. Mittelstadt, 和 C. Russell, “无需打开黑箱的反事实解释:自动决策和GDPR”. Harvard Journal of Law & Technology, 2017
[97] A. H. Karimi, B. Schölkopf, 和 I. Valera, “算法追索权:从反事实解释到干预”. In Proceedings of the 2021 ACM会议公平性、问责制和透明度, pp. 353362 .
[98] X. Li, H. Xiong, X. Li, X. Zhang, J. Liu, H. Jiang, Z. Chen, Z. 和 D. Dou, “G-LIME:使用全局先验的局部解释统计学习”, Artificial Intelligence, 314, pp. 103823 可用: 10.1016/j.atrint.2022.103823.
[99] X. Xin, G. Hooker, 和 F. Huang, "为什么你不应信任机器学习中的解释:部分依赖图上的对抗攻击, arXiv.org. 可用: https://arxiv.org/abs/2404.18702 (访问日期: 2024年7月6日).
[100] Z. Song, S. Cao, 和 H. Yang, “使用基于树的集成机器学习和Shapley加法解释方法建模全球太阳辐射的可解释框架”, Applied Energy, 364, pp. 123238 可用: 1016/j.apenergy.2024.123238. 2024
[101] T. Clement, N. Kemmerzell, M. Abdelaal, 和 M. Amberg, M. (2023) “XAIR: 可解释人工智能(XAI)与软件开发过程对齐的系统性元评论”, MDPI. 多学科数字出版研究所. 可用: https://www.mdpi.com/2504-4990/5/1/6, 2023, (访问日期: 2024年7月6日).
[102] A. Berkin, W. Aerts, W. 和 T. Van Cuneghem, “机器学习用于绩效相关归属声明的可行性分析”, 国际会计信息系统期刊, 48, pp. 100597 可用: 10.1016/j.accinf.2022.100597. 2023
[103] Y. Zhang, Y., Tan, H. Sun, Y. Zhao, Q. Zhang, 和 Y. Li, “通过感知适应扰动提高对抗样本的隐匿性”, Information Sciences, 635, pp. 126-137 可用: 10.1016/j.ins.2023.03.139. 2023
[104] F. Yin, Z. Shi, C. J. Hsieh, 和 K. W. Chang, “自然语言处理中模型解释的敏感性和稳定性”. arXiv preprint arXiv:2104.08782. 2021
[105] B. Finzel, A. Saranti, A. Angerschmid, 等. “生成概念验证图神经网络的解释:在相关子图上的符号谓词研究”.
Künstl Intell 36, 271-285 (2022). https://doi.org/10.1007/s13218-022(07/81-7
[106] S. Bhakat 和 G. Ramakrishnan. “监控视频中的异常检测”. In Proceedings of the ACM India Joint International Conference on Data Science and Management of Data (CODS-COMAD '19). 计算机协会, 纽约, NY, USA, 252-255. https://doi.org/10.1145/3297001.3297034
[107] K. Chanasit, E. Chuangsuwanich, A. Suchato 和 P. Punyabukkana, “使用增强特征选择的房地产估值模型,” in IEEE Access, vol. 9, pp. 86938-86953, 2021, doi: 10.1109/ACCESS.2021.3089198.
[108] K. Simonyan, A. Vedaldi, 和 A. Zisserman, “深入卷积网络内部:可视化图像分类模型和显著性图”. arXiv preprint arXiv:1312.6034. 2013
[109] Y. Matsubara, D. Callegaro, S. Baidya, M. Levorato 和 S. Singh, “头部网络蒸馏:分割蒸馏深度神经网络以适用于资源受限边缘计算系统,” in IEEE Access, vol. 8, pp. 212177-212193, 2020, doi: 10.1109/ACCESS.2020.3039714.
[110] A. N. Ngaffo, W. E. Ayeb 和 Z. Choukair, “基于贝叶斯推理的混合推荐系统,” in IEEE Access, vol. 8, pp. 101682-101701, 2020, doi: 10.1109/ACCESS.2020.2998824.
[111] Q. Tong, T. Gernay, “使用动态贝叶斯网络评估过程工业设施的弹性”, 过程安全与环境保护, 169, pp. 547-563 可用: 10.1016/j.psep.2022.11.048. 2023
[112] G. Szepannek, K. Lübke, “多少我们能看到?部分依赖图在信用评分中的可解释性”, Argumenta Oeconomica. No 1 (50) 2023. 可用: https://journals.ue.wroc.pl/aoe/article/view/1047 (访问日期: 2024年7月6日).
[113] C. Patrício, J. C. Neves, 和 F. L. Teixeira. “医学图像分类中的可解释深度学习方法综述”. ACM Comput. Surv. 2023, 56, 4, 文章 85 (2024年4月), 41页. https://doi.org/10.1145/3625287
[114] M. T. Cox, 和 A. Raja, “元推理:宣言”. 技术报告, www.mcox.org/Metareasoning/Manifesto.
[115] Gurevitch, J., Koricheva, J., Nakagawa, S. 等. 元分析与研究综合科学. Nature 555, 175-182 (2018). https://doi.org/10.1038/nature25753
[116] Gross C. G. (2002). “祖母细胞”基因谱系. Neuroscientist 8, 512-518 10.1177/107385802237175
[117] Roy A. 对局部表示理论扩展的研究:祖母细胞在大脑中的广泛使用. Front Psychol. 2013年5月24日;4:300. doi: 10.3389/fpsyg.2013.00300. PMID: 23745119; PMCID: PMC3662881.
[118] V. Conitzer, ‘元推理作为正式计算问题’, AAAI研讨会论文 2008
[119] 英国研究与创新可信自主系统(TAS)中心 (最后访问时间 2024) https://tas.ac.uk/
[120] F. Muratore, C. Eilers, M. Gienger, 和 J. Peters, “数据高效领域随机化与贝叶斯优化”, IEEE Robotics and Automation Letters, 卷 6, 第 2期, 2021年4月
[121] A. Shakerimov , T. Alizadeh, H. A. Vatol, “通过领域随机化和领域适配实现强化学习中的高效仿真到真实转移”, IEEE Access, 2023年12月, 数字对象标识符 10.1109/ACCESS.2023.3339568
[122] Y. Wang, L. Qi, Y. Shi, Y. Gao, “基于特征的风格随机化用于领域泛化”, IEEE Trans on Circuits and Systems for Video Technology, 卷 32, 第 8期, 2022年8月
[123] H. Dong, J. Zhou, C. Qiu, D. K. Prasad, I. Chen, “通过椭圆检测进行领域随机化的圆柱体和椭球体机器人操作”, IEEE/ASME Trans on Mechatronics, 卷 28, 第 1期, 2023年2月
[124] J. Tobin, R. Fong, A. Ray, J. Schneider, W. Zaremba, P. Abbeel, “通过领域随机化将深度神经网络从仿真转移到现实世界”, 2017 IEEE/RSJ国际智能机器人与系统会议(IROS), 2017年9月, 加拿大
[125] J. Huang, D. Guan, A. Xiao, S. Lu, “FSDR: 频率空间域随机化用于领域泛化”, 2021 IEEE/CVF计算机视觉与模式识别会议(CVPR)
[126] C. Liu, Y. Dong, W. Xiang, W. 等. “关于图像分类模型鲁棒性的全面研究:基准测试与反思”. 国际计算机视觉杂志 (2024). https://doi.org/10.1007/s11263-024-02196-3
[127] Y. Zhang, S. Nie, S. Liang 和 W. Liu, “通过对抗序列到序列领域适配实现鲁棒文本图像识别,” in IEEE Transactions on Image Processing, 卷 30, pp. 3922-3933, 2021, doi: 10.1109/TIP.2021.3066903
[128] J. Lee, K. Kim, T. Kim, D. Kim, “通过领域特定特征加权改进风格随机化以实现领域泛化”, 2022年欧洲信号处理会议(EUSIPCO)第30届会议论文集
[129] Y. Jiang, C. Li, W. Dai, J. Zou, H. Xiong, “方差减少领域随机化用于具有策略梯度的强化学习”, IEEE 模式分析与机器智能汇刊, 卷 46, 第 2期, 2024年2月
[130] C. Liang , W. Li , Y. Dong , W. Fu, “通过类别一致性实现遥感图像分割的单域泛化方法”, IEEE 地球科学与遥感汇刊, 卷 62, 2024
[131] F. Luo, J. Liu, G. T. Ho, K. Yan, “通过多域随机化实现无监督跨域目标检测”, 2024年第27届国际计算机支持协同工作设计会议论文集
[132] J. Wei, X. Wang, D. Schuurmans, M. Bosma, F. Xia, E. Chi, Q. V. Le, D. Zhou, 等人. “链式思维提示引发大型语言模型中的推理”. Advances in neural information processing systems, 35:24824-24837, 2022
[133] S. Yao, D. Yu, J. Zhao, I. Shafran, T. Griffiths, Y. Cao, 和 K. Narasimhan. “树状思维:利用大型语言模型进行深思熟虑的问题解决”. Advances in Neural Information Processing Systems, 36, 2024
[134] M. Yasunaga, X. Chen, Y. Li, P. Pasupat, J. Leskovec, P. Liang, E. H. Chi, 和 D. Zhou. “大型语言模型作为类比推理器”. arXiv doi.org/10.48550/arXiv.2310.01714, 2023
[135] P. Gao, A. Xie, S. Mao, W. Wu, Y. Xia, H. Mi, F. Wei, “大型语言模型的元推理”, doi.org/10.48550/arXiv.2406.11698, 2024
[136] T. L. Griffiths, F. Callaway, M. B. Chang, E. Grant, P. M. Krueger, F. Lieder, “用更少做更多:人类和机器中的元推理与元学习”, 当代行为科学观点, 第29卷, 2019年, 页24-30, ISSN 2352-1546, https://doi.org/10.1016/j.cobeba.2019.01.005
[137] A. Khediri, H. Slimi, A. Yahiaoui, M. Derdour, H. Bendjenna, C. E. Ghenai, “通过SHAP解释和LLM生成描述增强入侵检测系统中机器学习模型的可解释性”, 2024年第6届国际模式分析与智能系统会议(PAIS)
[138] H. Zhang, J. Li, Y. Wang, Y. Song, “整合自动化知识提取与大型语言模型用于可解释医疗决策制定”, 2023 IEEE生物信息学与生物医学国际会议(BIBM)
[139] H. Abu-Rasheed, C. Weber, M. Fathi, “知识图作为LLM基础解释的学习推荐上下文源”, 2024 IEEE全球工程教育会议(EDUCON)S.
[140] S. Narteni, V. Orani, E. Cambiaso, M. Rucco, M. Mongelli. “可解释与可靠的AI在物理疲劳预测中的交叉点”, IEEE Access, 2022年7月, 数字对象标识符 10.1109/ACCESS.2022.3191907
参考论文:https://arxiv.org/pdf/2505.07005
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)