IBM 人工智能机器人笔记(一)
001:人工智能简介 🧠
在本节课中,我们将要学习人工智能的基本定义、其学习方式、不同类型的划分以及它背后的多学科融合背景。
什么是人工智能?🤖
在IBM,我们将人工智能定义为任何能让机器行为更智能的技术。我们倾向于将AI视为增强智能。我们认为,人工智能不应试图取代人类专家,而应扩展人类的能力,并完成那些单靠人类或机器都无法独立完成的任务。
互联网让我们能更快地获取更多信息。分布式计算和物联网产生了海量数据,而社交网络促使其中大部分数据以非结构化形式存在。借助增强智能,我们将领域专家所需的信息置于他们指尖,并用证据支持,以便他们做出明智的决策。我们希望专家能扩展他们的能力,并让机器去处理耗时的工作。
如何定义智能?💡
人类拥有与生俱来的智能,这种智能支配着我们身体的每一项活动。正是这种智能,使得一颗小橡子能长成参天橡树,一个单细胞生物能发育成一头大象。
那么,人工智能如何学习呢?
人工智能如何学习?📚
机器唯一的“先天智能”是我们赋予它们的。我们赋予机器能力,使其能够检查示例,并根据输入和期望的输出创建机器学习模型。
我们通过不同的方式实现这一点,例如:
-
监督学习
-
无监督学习
-
强化学习
你将在后续课程中更详细地了解这些学习方式。
人工智能的类型 🗂️
根据其能力强度、广度及应用,人工智能可以以不同方式进行描述。
弱人工智能或狭义人工智能是指应用于特定领域的人工智能。例如:
-
语言翻译器
-
虚拟助手
-
自动驾驶汽车
-
人工智能驱动的网络搜索
-
推荐引擎
-
智能垃圾邮件过滤器
应用型人工智能可以执行特定任务,但无法学习新任务。它根据编程算法和训练数据做出决策。
强人工智能或通用人工智能是指能够交互并执行各种独立且不相关任务的人工智能。它可以学习新任务以解决新问题,并通过自我教授新策略来实现这一点。通用智能是多种AI策略的结合,这些策略能从经验中学习,并能达到人类水平的智能。
超级人工智能或意识人工智能是指具有人类意识水平的人工智能。这将要求它具有自我意识。由于我们尚无法充分定义意识是什么,在可预见的未来,我们不太可能创造出有意识的人工智能。
人工智能的多学科融合 🔗
人工智能是许多研究领域的融合。
-
计算机科学和电气工程决定了人工智能如何在软件和硬件中实现。
-
数学和统计学决定了可行的模型并衡量性能。
-
由于人工智能是基于我们对大脑工作方式的理解而建模的,心理学和语言学在理解人工智能如何工作方面发挥着重要作用。
-
哲学则为智能和伦理考量提供了指导。
虽然科幻版本的人工智能可能还很遥远,但我们已经看到越来越多的人工智能参与到我们日常的决策中。多年来,人工智能已被证明在不同领域都很有用,以有意义的方式影响着人们的生活和我们的社会。
总结 📝
本节课中,我们一起学习了人工智能的核心概念。我们了解到,IBM将AI视为增强人类能力的工具。我们探讨了智能的定义、AI通过机器学习模型进行学习的方式,并区分了弱AI、强AI和超级AI等不同类型。最后,我们认识到人工智能的实现离不开计算机科学、数学、心理学等多学科的交叉融合。人工智能已深入日常生活,并持续对社会产生积极影响。
004:生成式AI概述与用例 🧠
在本节课中,我们将要学习生成式人工智能(Generative AI)的基本定义、其重要性以及它在不同领域中的实际应用案例。通过本课,你将能够清晰地定义生成式AI,并理解它如何超越传统AI模型,创造出全新的数据与体验。
什么是生成式AI?🤖
上一节我们介绍了课程目标,本节中我们来看看生成式AI的核心定义。
人工智能(AI)被定义为一种增强智能,它使专家能够扩展其能力,同时让机器处理诸如语音识别、玩游戏和决策等耗时的任务。
另一方面,生成式人工智能(Gen AI)是一种能够创造全新且独特数据的AI技术,其生成范围涵盖图像、音乐、文本乃至整个虚拟世界。
与传统AI模型依赖预定义规则和模式不同,生成式AI模型使用深度学习技术,并依赖海量数据集来生成全新的数据,具有广泛的应用前景。
生成式AI与大语言模型(LLM)的关系 🔗
理解了基本定义后,我们进一步探讨生成式AI与当前热门的大语言模型之间的关系。
生成式AI模型也可以利用大语言模型(LLM)。LLM是一种基于深度学习技术的人工智能,旨在处理和生成自然语言。
例如,生成式AI可以开发出更新、更强大的LLM算法和架构,从而带来更准确或更高效的自然语言处理和生成能力。
或者,生成式AI可以将LLM设计和整合到一个更大、更先进的AI系统中,以执行各种高级任务,例如决策制定、问题解决和创造性工作。
生成式AI的优势 ✨
在了解了其技术基础后,我们来看看生成式AI为何被视为一项战略性技术,它主要具备以下六大优势:
以下是生成式AI的六大核心优势:
-
创造力与创新:能够生成前所未有的内容和解决方案。
-
成本与时间节约:自动化内容生成,减少人力与时间投入。
-
个性化:根据用户偏好和行为生成定制化内容或服务。
-
可扩展性:能够快速生成大量数据,满足大规模应用需求。
-
鲁棒性:在复杂或数据稀缺的情况下仍能有效工作。
-
探索新可能性:开辟传统方法无法触及的新领域和体验。
生成式AI的多样化用例 🌍
掌握了生成式AI的优势后,本节我们将通过具体案例,看看它如何在各行各业中发挥作用。
以下是生成式AI在不同领域的应用示例:
-
医疗保健与精准医疗:协助医生识别导致疾病的基因突变并提供定制化治疗方案;生成医学图像、模拟手术、预测新药特性以辅助医生练习和开发疗法。
-
农业:优化作物产量,并创造出能够抵御环境压力、害虫和疾病的更强健植物品种。
-
生物技术:通过识别潜在药物靶点、模拟药物相互作用和预测药效,帮助开发新疗法和药物。
-
法医学:通过分析DNA证据和识别嫌疑人来帮助破案。
-
环境保护:通过分析濒危物种的遗传数据并提出繁殖和保护策略,来支持保护工作。
-
创意领域:为广告和营销活动生成独特的数字艺术、音乐和视频内容;为电影或视频游戏生成配乐。
-
游戏:通过生成适应玩家行为的新关卡、角色和对象,来创造交互式游戏世界。
-
时尚:为客户设计和生成虚拟试穿体验,并根据客户行为和偏好推荐个性化时尚选择。
-
机器人技术:设计新的机器人动作并使其适应不断变化的环境,从而执行复杂任务。
-
教育:创建适应学生学习风格和进度的定制化学习材料和交互式学习环境。
-
数据增强:为机器学习模型生成新的训练数据,提高其准确性和性能。
总结 📝
本节课中,我们一起学习了生成式人工智能的核心概念。
我们了解到,生成式AI是一种能够创造全新且独特数据的技术。它在创造力、成本与时间节约、个性化、可扩展性、鲁棒性以及探索新可能性方面超越了传统AI模型。
生成式AI有潜力改变各行各业并改善人们的生活,生成以前不可能的数据和体验。它可以用于执行广泛的任务,其灵活性和适应性堪比人类智能。
005:AI的影响与示例 🤖
在本节课中,我们将探讨人工智能(AI)对全球经济、各行各业以及我们日常生活的深远影响,并通过具体示例了解AI在不同领域的应用。
人工智能将持续存在,并有望改变世界的运作方式。普华永道的一项研究预测,从现在到2030年,基于AI的技术将为全球GDP增加16万亿美元。这是前所未有的经济影响规模,且影响范围不仅限于IT行业,几乎触及了每个行业和我们生活的方方面面。
不同的人对AI有不同的理解。对视频游戏设计师而言,AI意味着编写影响游戏机器人行为以及环境如何对玩家做出反应的代码。对编剧而言,AI意味着塑造一个行为像人类、又混合了计算机特征的角色。对数据科学家而言,AI是一种探索和分类数据以实现特定目标的方法。
上一节我们了解了AI的广泛定义,本节中我们来看看AI如何通过具体技术改变人机交互。
自然语言处理的应用 🎤
通过示例学习的AI算法,是我们能够与Watson、Alexa、Siri、Cortana和Google Assistant等智能助手对话,并让它们回应我们的原因。AI的自然语言处理(NLP)和自然语言生成(NLG)能力,不仅使机器和人类能够相互理解和互动,还创造了新的商业机会和运营方式。
以下是基于自然语言处理的聊天机器人在几个关键领域的应用示例:
-
医疗保健:用于询问患者病情并进行类似真实医生的基本诊断。
-
教育:为学生提供易于学习的对话界面和按需在线辅导。
-
客户服务:通过现场解决查询来改善客户体验,并释放客服人员的时间来处理更有价值的对话。
语音技术的进步 🗣️
AI驱动的语音转文本技术进步使得实时转录成为现实。语音合成技术的进步,则让公司能够使用AI语音来增强客户体验,并赋予其品牌独特的声音。
在医学领域,这项技术正在帮助患者,例如肌萎缩侧索硬化症患者,重新获得他们真实的声音,而不是使用计算机合成的声音。
计算机视觉的突破 👁️
正是由于AI的进步,计算机视觉领域才能够在与检测和标记物体相关的任务上超越人类。计算机视觉是汽车能够在街道和高速公路上行驶并避开障碍物的原因之一。
计算机视觉算法能够检测图像中的面部特征,并将其与面部特征数据库进行比较。这使得消费类设备能够通过面部识别来验证机主身份,社交媒体应用能够检测并标记用户,执法机构能够在视频流中识别罪犯。
计算机视觉算法正在帮助自动化诸如在皮肤图像中检测癌性痣、或在X光和MRI扫描中发现症状等任务。
AI的日常与深远影响 💡
AI正日益影响我们的生活质量。我们的Netflix推荐、导航应用、邮箱垃圾邮件过滤以及重要事件提醒中都有AI的身影。
AI在幕后监控我们的投资、检测欺诈交易、识别信用卡欺诈并预防金融犯罪。
AI正以显著的方式影响医疗保健,帮助医生做出更准确的初步诊断、解读医学影像、为患者寻找合适的临床试验。它不仅影响着患者的治疗结果,也使运营流程成本更低。
AI有潜力访问海量信息、模仿人类甚至特定个体、提出关于健康和财务的变革性建议、关联可能侵犯隐私的数据,以及实现更多功能。
本节课中,我们一起学习了人工智能带来的巨大经济影响,并深入探讨了其在自然语言处理、语音技术和计算机视觉等核心领域的具体应用。我们看到,AI已渗透到娱乐、医疗、金融、安防等众多行业,并持续改变着我们的日常生活与工作方式。理解这些影响和示例,是认识AI价值与潜力的重要一步。
007:人工智能的实际应用案例 🚀
在本节课中,我们将通过几个具体案例,了解人工智能技术在不同行业中的实际应用。这些案例展示了AI如何作为辅助工具,提升效率、安全性和决策能力。
上一节我们探讨了人工智能的基本概念,本节中我们来看看它在现实世界中的具体应用场景。
协作机器人在制造业的应用 🤖
我们拥有一个相当大规模的协作机器人项目。目前我们研究的协作机器人主要针对制造业应用。这些应用场景包括制造业、仓储和物流等领域。在这些场景中,通常由人完成的工作可能单调、危险。引入机器人支持或让机器人直接执行这些任务,可以大幅提升安全性、效率和整体效益。
我们致力于开发许多此类应用,特别是那些需要机器人直接与人交互的场景。例如,机器人可以帮助个人抬起沉重的容器,或在货架上移动物品以完成补货任务。
以下是协作机器人可能率先应用的领域:
-
在工业环境中协助完成繁重、重复或危险的任务。
-
未来有望进入家庭,帮助处理洗衣、洗碗等厨房事务。
AI在石油天然气行业的应用 🛢️
在石油天然气领域,阿布扎比国家石油公司提供了一个典型案例。石油公司面临的一个核心问题是:确定最佳的钻井位置。他们需要从数百个不同地点采集岩石样本。
从这些样本中,可能会产生数十万张岩石薄片。传统上,需要依靠训练有素的专家地质学家对这些薄片进行分类。但培养能准确分类的地质学家既困难、耗时,成本也高昂。
一种增强人类能力的方法是使用计算机视觉技术对这些岩石样本进行分类,从而识别出哪些地点最适合开采石油。这就是人工智能在石油天然气领域的应用。
机器学习在医疗协作中的价值 🏥
试想在此技术出现之前的情景。如果迪拜的一位医生遇到一例非常罕见的癌症,而新西兰出现了另一例,他们过去如何能意识到双方在处理同一个罕见病例并开展合作呢?这在过去是不可能的。
但现在,机器学习技术能够将来自众多不同来源的知识聚合到一个集中的云端。它能够理解这些信息,并以可访问、直观、内隐的方式提供。如今,那位新西兰医生可以运用这种机器学习技术发现:“就在几天前,有一位医生遇到了非常相似的病例”,即使不完全相同。
智能听诊器:AI辅助医疗诊断 🩺
我们与许多初创企业和大型企业合作,这里举几个例子。我想重点介绍一家位于加利福尼亚州名为Eko Devices的公司。他们的创新在于改造了一个简单的设备——听诊器。
他们首先通过剪断听诊器的软管并插入一个数字化转换器,将其改造成数字设备。这个转换器将模拟声音信号转化为数字信号,并在过程中进行放大,使得人们更容易听到心脏或肺部工作的声音。
更重要的是,数字化使我们能够通过蓝牙将信号发送到智能手机。在手机上,这些信号可以被绘制成图表,帮助医生不仅通过听觉,更能通过直观的图表来理解心脏的工作状态。
关键在于,这些信息一旦被数字化捕获,就可以发送给机器学习算法进行处理。这正是Eko所做的。机器学习算法可以从这些数据中学习,应用人类医生(心脏病专家)先前的经验知识,从而辅助使用该设备的医生进行当前诊断。
这绝非以任何形式取代医生,而是一种辅助技术。它汲取了前几代人类心脏病专家的经验,助力当前的诊断工作。在我看来,这是一个完美的“X + AI”案例。这里的“X”是听诊器,而加上AI后,他们为其起了一个巧妙的名字——他们称之为“心脏听诊智能监测”。
本节课中,我们一起学习了人工智能在工业制造、能源勘探、医疗协作及诊断辅助等领域的实际应用。这些案例表明,AI的核心价值在于增强人类能力、提升效率与安全性,而非取代人类。通过将传统工具或流程与AI结合,我们可以解决更复杂的问题,并开辟新的可能性。
008:AI实战案例解析 🚀
在本节课中,我们将通过几个真实案例,了解人工智能技术如何在企业中被实际应用。这些案例涵盖了从文档理解到计算机视觉,再到医疗康复的多个领域,展示了AI解决复杂问题的潜力。
AI在企业中的实际应用
上一节我们介绍了AI的基本概念,本节中我们来看看它在企业中的具体应用。以下是几个典型案例:
Woodside能源公司的文档智能系统
Woodside能源公司最初希望IBM构建一个能理解工程师研究报告的系统,让Watson(IBM的AI平台)学习这些非结构化文档内容,甚至替代部分工程师。
IBM成功开发了该应用,Watson确实能够理解这些非结构化内容。但最终结果并非替代工程师,而是公司雇佣了更多工程师。原因有两点:
-
每位工程师的入门门槛降低,因为Watson消化并整理了所有历史研究数据。
-
团队间的知识共享变得更高效。研究报告不再被归档后无人问津,而是被Watson获取、理解,并主动提供给可能需要它的人。
公共安全中的计算机视觉
在影视剧中,我们常看到安保人员为了寻找特定嫌疑人,需要以十倍速浏览成百上千小时的监控录像,直到在剧集末尾找到那辆黑色SUV或绿色汽车。
如果有一套计算机视觉算法持续分析这些视频流,就不再需要人力手动筛查海量 footage。算法可以自动识别和追踪目标车辆或人物。
神经康复医疗中的AI与机器人
我们的一个具体用例是触发大脑形成新的神经通路。人体功能与大脑功能之间的联系、大脑受损区域、未受损区域以及如何通过特定动作触发人体反应以形成新神经通路,这其中涉及海量信息。
我们创建了关于人体运动如何与大脑不同区域响应的大规模数据集。基于这些信息,我们能够通过机器人设备触发特定动作,进而促使大脑形成新的神经通路,最终帮助神经创伤患者恢复健康。
本节课中我们一起学习了AI在能源、公共安全和医疗康复等领域的实际应用案例。我们看到,AI的价值不仅在于自动化,更在于赋能人类,降低门槛、提升效率,并解决诸如神经康复等高度复杂的专业问题。
009:IBM的著名AI应用案例 🏆
在本节课中,我们将了解IBM Watson人工智能系统在几个真实世界中的著名应用。这些案例展示了AI如何分析复杂数据、理解人类语言与情感,并辅助专业决策。
Watson在《危险边缘》游戏中的胜利 🎮
上一节我们介绍了AI的基础概念,本节中我们来看看IBM Watson早期的一个里程碑式成就——在智力竞赛节目《危险边缘》中战胜人类冠军。
我记得那天早上去实验室时在想,这就是最后一场《危险边缘》比赛了。当音乐响起,约翰尼·吉尔伯特宣布“来自纽约约克敦高地的IBM研究院,这里是《危险边缘》”时,这一切对我而言变得无比真实。这一天是所有工作的 culmination。说实话,我当时很激动。
核心交互示例:
主持人提问: "这个1920年代的流行舞蹈以‘踢’动作为特征。"
Watson回答: "What is the Charleston?"
主持人: "正确。"
比赛过程并非一帆风顺。Watson一度取得领先,但也答错了一些问题。例如,它将“leg”和“1920s”作为答案,但都被判定为错误。然而,它最终成功答对了关键问题,例如“什么是禅宗?”,从而与人类选手布拉德战平,并最终赢得了比赛。
他们完全有理由为自己所做的事感到自豪。我曾以为这样的技术还需要多年才能实现,但它现在已经到来了。我认为我们今天看到了重要的一步。哇,等等,这是历史性的时刻。
AI赋能格莱美奖:时尚与情感分析 🎵
在见证了Watson的语言理解能力后,我们来看看它如何被应用于充满创意与情感的娱乐产业。
第60届格莱美奖由IBM Watson提供技术支持。在格莱美周日,我们需要处理海量的非结构化数据。我们与录音学院的合作,重点在于帮助他们优化数字内容生产的工作流程。
我的内容团队不仅负责接收所有原始素材,还要对其进行策展和发布。这包括长达五小时的红毯报道,涉及5,000名艺术家和超过100,000张照片。
以下是Watson在格莱美奖中的两项核心分析工作:
-
时尚趋势分析:Watson利用AI分析每一套经过红毯的服装的颜色、图案和轮廓。我们得以洞察所有主导风格,并将其与往届格莱美秀场进行对比。
-
歌词情感分析:Watson还分析了过去60年来格莱美提名歌曲的歌词情感。它能够识别音乐中的情感主题,并将其分类为喜悦、悲伤等不同类别。这非常酷。
ESPN梦幻足球:数据驱动的决策助手 🏈
从娱乐产业转向体育领域,AI同样能提供强大的决策支持。本节我们将探讨Watson如何帮助数百万体育迷进行更明智的抉择。
梦幻体育是我们服务体育迷的一种极其重要且有趣的方式。我们的梦幻游戏极大地促进了ESPN数字平台的流量,并拉动了赛事和演播室节目的收视率。
但我们的用户有很多方式可以消磨时间,因此我们必须持续改进游戏,以吸引他们选择与我们共度时光。今年,ESPN与IBM合作,为其梦幻足球平台增加了一项强大的新功能。
梦幻足球产生了海量的内容,包括文章、博客、视频、播客,我们称之为非结构化数据,即那些无法整齐放入电子表格或数据库的数据。而Watson正是为分析这类信息并将其转化为可用见解而构建的。
我们使用数百万篇梦幻足球故事、博客文章和视频来训练Watson。我们教会它:
-
为数千名球员开发一个得分范围,评估他们的上升空间和下行风险。
-
估算球员表现超过其上升空间或低于其下行风险的概率。
-
甚至评估球员的媒体热度及其上场可能性。
核心价值公式:
玩家决策收益 = Watson数据洞察 + 专家分析意见 - 不确定性风险
这对于我们的梦幻足球玩家来说是一个巨大的胜利。它是帮助玩家决定每周让哪位跑卫或四分卫首发的又一个工具,并且是对球迷所信赖的获奖分析师们的绝佳补充。
与任何机器学习系统一样,该系统会变得越来越智能。这意味着洞察会更准确,用户能做出更好的决策,每周都有更好的机会赢得比赛。我们的梦幻玩家越成功,他们花在我们平台上的时间就越多。
ESPN与IBM的合作是一个绝佳的载体,向数百万人展示了企业级AI的强大能力。不难想象,同样的技术如何应用于现实生活。在商业场景中,有成千上万的场合需要评估价值和权衡取舍。这就是未来决策的模样:人与机器协同工作,评估风险与回报,共同处理艰难的决定。IBM正是运用同样的技术来帮助医生挖掘数百万页的医学研究,以及帮助投资银行发现影响市场的洞察。
总结
本节课中我们一起学习了IBM Watson人工智能系统的三个著名应用案例。我们看到,从在《危险边缘》中展示的深度语言理解,到格莱美奖中的视觉与情感分析,再到ESPN梦幻足球里的数据挖掘与预测,AI技术已经能够处理复杂的非结构化数据,将其转化为 actionable insights,并最终辅助人类在娱乐、体育乃至医疗、金融等专业领域做出更优的决策。这些案例清晰地揭示了“人机协同”的未来工作模式。
010:生成式AI应用 🚀
在本节课中,我们将学习生成式人工智能(Generative AI)的各种实际应用。通过了解这些应用,你将能够列举生成式AI在不同领域的使用案例,并探索每个应用的具体用途。
生成式AI已成为一项强大的技术,它使软件应用能够创造、生成和模拟新的内容,从而增强其能力并提供独特的体验。与传统软件遵循预定义规则和算法不同,生成式AI利用机器学习和深度学习技术来学习模式,并根据其在训练中获得的知识生成原创内容。
由于其能够创造前所未有的、个性化的新内容,生成式AI已被应用于多个领域,催生了许多引人入胜且广受欢迎的应用。
以下是生成式AI的一些流行应用:
-
生成式预训练变换模型(GPT):这是由OpenAI开发的一个大型语言模型家族,能够生成类人文本。GPT-3.5和GPT-4是该模型家族的迭代版本,更未来的模型正在开发中。其应用范围广泛,包括由GPT驱动的聊天机器人(如ChatGPT)、自动化新闻写作甚至创意写作。
- 核心模型:
GPT-n(n代表版本号,如3.5, 4)
- 核心模型:
-
ChatGPT:这是OpenAI开发的一款聊天机器人或对话式AI工具,允许用户与底层语言模型进行基于文本的对话。该模型在多样的互联网文本上进行训练,能生成类人回应,提供信息、回答问题、协助完成任务、进行创意写作并就各种主题提供建议。
-
Bard:这是谷歌推出的AI写作助手,旨在帮助用户为电子邮件和社交媒体帖子等沟通文档生成高质量文本。Bard使用一个名为LaMDA(对话应用语言模型)的大型语言模型来生成文本,并能适应用户对风格和语调的偏好。
-
Watson X:来自IBM,这是一个AI和数据平台,包含用于模型部署的Watson X.ai、用于可扩展分析的Watson X.data以及用于负责任AI工作流的Watson X.governance。它有助于大规模构建、部署和管理AI应用,提升AI在整个组织中的影响力。
-
DeepDream:这是一种生成模型,可以从真实图像生成超现实和迷幻风格的图像。它已被用于艺术和娱乐领域,创造出一些独特且视觉震撼的图像。
-
StyleGAN:这是一种能够生成现实中不存在的高质量人脸图像的生成模型。它已被用于多种应用,包括创建逼真的视频游戏头像以及为医学研究模拟人脸。
-
AlphaFold:这是一种可以预测蛋白质结构的生成模型。它有可能改变药物发现领域,使开发更有效的疾病治疗方法成为可能。
-
Magenta:这是谷歌的一个项目,利用生成式AI创作音乐和艺术。它已经产生了一些有趣且令人印象深刻的结果,例如由人类和AI生成的钢琴进行的二重奏。
-
Google AI的PaLM 2:这是一个强大的大型语言模型,其训练数据量是前代的10倍。它在理解细微差别、生成连贯的文本和代码、翻译以及回答问题方面表现出色。其持续发展有望彻底改变人机交互,提高准确性、效率、创造力和沟通能力。
-
GitHub Copilot:这是由OpenAI和GitHub联合开发的AI编程助手,旨在帮助开发者更高效地编写代码。它使用深度学习算法来分析代码,并为开发者生成建议,例如自动补全代码片段或根据代码上下文建议函数。
- 核心功能:代码分析与智能建议。
上一节我们介绍了生成式AI的基本概念,本节中我们具体了解了它的多样化应用。可以看到,从文本生成到图像创作,从蛋白质结构预测到辅助编程,生成式AI正在深刻改变多个行业。
生成式AI是一个快速发展的领域,预计在未来几年将显著增长。然而,也需要关注其相关的伦理问题,包括AI生成内容的潜在滥用以及对知识产权和版权法的影响。
本节课中我们一起学习了生成式AI如何使应用能够创造、生成和模拟新内容。它利用机器学习和深度学习技术来学习模式并生成原创内容。我们还介绍了一些生成式AI的具体应用,包括GPT-4、ChatGPT、Bard、GitHub Copilot和PaLM 2等。理解这些应用是探索和利用生成式AI潜力的重要第一步。
011:感知、学习与推理 🤖
在本节课中,我们将要学习认知计算的核心概念。我们将了解它与传统计算的根本区别,以及它如何通过模仿人类的认知过程——感知、学习和推理——来处理海量、复杂的信息,从而创造新的价值。
概述:什么是认知计算?
人工智能正处于一个新时代——认知计算时代的前沿。
这是一种全新的计算模式,它与之前的可编程系统截然不同,其差异之大,就如同那些可编程系统与一个世纪前的制表机之间的区别。
上一节我们提到了人工智能的广阔前景,本节中我们来看看实现这一前景的一种关键技术:认知计算。
传统计算 vs. 认知计算
传统的计算解决方案基于20世纪40年代衍生的数学原理。它们依据规则和逻辑进行编程,旨在得出数学上精确的答案,通常遵循刚性决策树方法。
传统计算的核心可以概括为:
if (条件A) {
执行操作X;
} else if (条件B) {
执行操作Y;
}
然而,面对当今海量的大数据以及对更复杂的、基于证据的决策的需求,这种僵化的方法常常会失效,或者无法跟上可用信息的步伐。
认知计算则使人们能够创造一种深刻的新型价值,从海量数据中找出隐藏的答案和洞察。
认知计算的应用场景
无论是医生诊断病人、理财经理为客户提供退休投资组合建议,还是厨师创造新食谱,他们都需要新的方法来处理日常接触的大量信息,并将其置于具体情境中,从而从中获得价值。
这些过程旨在增强人类的专业知识。
模仿人类认知过程 🧠
认知计算模仿了人类专业知识的一些关键认知要素。这些系统能像人类一样对问题进行推理。
当我们人类试图理解某事并做出决定时,会经历四个关键步骤。以下是这些步骤的详细说明:
-
观察:我们观察可见的现象和证据体。
-
解读:我们运用已知知识来解读所见,生成关于其含义的假设。
-
评估:我们评估哪些假设是正确的或错误的。
-
决策:我们选择看似最佳的选项并采取相应行动。
正如人类通过观察、评估和决策的过程成为专家一样,认知系统使用类似的过程来推理它们所读取的信息,并且能够以极快的速度和巨大的规模做到这一点。
处理非结构化数据
与传统计算解决方案不同,认知计算解决方案能够理解非结构化数据。
-
传统计算:通常只能处理整齐组织的结构化数据(例如数据库中存储的数据)。
-
认知计算:可以理解非结构化数据,这类数据占当今数据的80%,主要是人类为其他人类消费而产生的所有信息。
这包括从文学文章、研究报告到博客文章和推文的一切内容。
结构化数据由定义明确的字段(包含规范信息)管理,而认知系统依赖于自然语言,它受语法、上下文和文化规则的约束。
自然语言是隐含的、模糊的、复杂的,处理起来具有挑战性。
虽然所有人类语言都难以解析,但某些习语在英语中尤其具有挑战性。例如,我们可能会因为“下着倾盆大雨”而感到“忧郁”,同时还在填写别人要求我们填写的表格。
认知系统的三大核心能力
了解了认知系统处理的数据类型后,我们来看看它的三个核心运作方式。
1. 像人一样阅读与解释
认知系统像人一样阅读和解释文本。它们通过从语法、关系和结构上分解句子,从书面材料的语义中辨别含义来实现这一点。
2. 理解上下文
这与简单的语音识别非常不同。语音识别是计算机将人类语音转换为一组词语的过程。
而认知系统试图理解用户语言的真实意图,并利用这种理解,通过一系列广泛的语言模型和算法进行推理。
3. 持续学习与适应
认知系统会学习、适应并变得越来越智能。它们通过从与我们的互动中,以及从自身的成功和失败中学习来做到这一点,就像人类一样。
总结
本节课中,我们一起学习了认知计算的核心要义。我们了解到:
-
认知计算是一种全新的计算范式,旨在处理大数据时代的复杂、非结构化信息。
-
它通过模仿人类的观察、解读、评估、决策认知过程来进行推理。
-
与传统计算相比,它能理解占数据总量80%的非结构化数据(如文本、图像)。
-
认知系统具备三大关键能力:像人一样阅读解释、理解上下文以及持续学习与适应。
认知计算的目标不是取代人类,而是增强人类专家能力,帮助我们从海量信息中发现隐藏的价值和洞察。
012:人工智能核心术语与概念解析 🤖
在本节课中,我们将学习人工智能领域中几个紧密相关但含义不同的核心术语:人工智能、机器学习、深度学习、神经网络以及数据科学。明确这些概念的区别,是深入理解AI工作原理及其应用的基础。
在深入探讨人工智能的工作原理、各种应用场景之前,我们首先需要区分几个紧密相关的术语和概念:人工智能、机器学习、深度学习和神经网络。这些术语有时会被混用,但它们所指的并非同一事物。
什么是人工智能?🧠
人工智能是计算机科学的一个分支,致力于模拟智能行为。AI系统通常会展现出与人类智能相关的行为,例如:
-
规划
-
学习
-
推理
-
解决问题
-
知识表示
-
感知
-
运动与操控
-
以及程度稍弱的社交智能和创造力
什么是机器学习?📈
上一节我们介绍了人工智能的宽泛定义,本节中我们来看看它的一个重要子集。
机器学习是人工智能的一个子集,它使用计算机算法分析数据,并根据所学内容做出智能决策,而无需进行显式编程。机器学习算法使用大量数据集进行训练,它们从示例中学习,不遵循基于规则的算法。机器学习使机器能够自主解决问题,并利用提供的数据做出准确预测。
其核心思想可以概括为:让计算机从数据中学习规律,而非直接编写规则。公式可表示为:
模型 = 算法(数据)
什么是深度学习与神经网络?🔗
理解了机器学习后,我们进一步聚焦于其中一种强大的方法。
深度学习是机器学习的一个专门子集,它使用分层的神经网络来模拟人类决策。深度学习算法能够标记和分类信息,并识别模式。它使得AI系统能够在工作中持续学习,并通过判断决策是否正确来提高结果的质量和准确性。
人工神经网络(通常简称为神经网络)的灵感来源于生物神经网络,尽管其工作方式有很大不同。AI中的神经网络是由许多称为“神经元”的小计算单元组成的集合,这些神经元接收输入数据,并随着时间的推移学习做出决策。
神经网络通常是多层的、深度的,这也正是“深度学习”名称的由来。与数据量增加时可能达到性能瓶颈的其他机器学习算法不同,深度学习算法会随着数据集体积的增长而变得更高效。
以下是神经网络的一个简化结构示意:
# 伪代码示例:一个简单的神经网络层计算
输出 = 激活函数(权重 · 输入 + 偏置)
人工智能 vs. 数据科学 📊
现在你已经对几个关键AI概念的区别有了大致了解。还有一个重要的区分需要理解,那就是人工智能和数据科学之间的关系。
数据科学是从大量异构数据中提取知识和洞察的过程与方法。它是一个跨学科领域,涉及数学、统计分析、数据可视化、机器学习等。数据科学使我们能够处理信息、发现模式、从海量数据中找到意义,并利用它做出推动业务的决策。
数据科学可以使用许多AI技术从数据中获取洞察。例如,它可以使用机器学习算法甚至深度学习模型从数据中提取意义并得出推论。人工智能和数据科学之间存在一些交叉,但两者并非子集关系。更准确地说,数据科学是一个广义术语,涵盖了整个数据处理方法论;而人工智能则包含了让计算机学习如何解决问题并做出智能决策的一切技术。两者都可能涉及使用大数据,即体量巨大的数据集。
在接下来的课程中,术语“机器学习”、“深度学习”和“神经网络”将被更详细地讨论。
本节课中我们一起学习了人工智能领域的核心术语。我们明确了人工智能是模拟智能行为的广阔领域;机器学习是其子集,让计算机从数据中学习;深度学习是机器学习的一种,依靠深层神经网络实现复杂模式识别;而数据科学是一个更广泛的数据处理方法论,与AI既有交叉又各自独立。理解这些概念的区别与联系,是进一步探索AI世界的重要基石。
013:机器学习核心概念 🧠
在本节课中,我们将要学习机器学习的基本概念,了解它与传统编程的区别,并认识三种主要的机器学习类型。
什么是机器学习?
机器学习是人工智能的一个子集。它使用计算机算法分析数据,并基于学习到的信息做出智能决策,而不是遵循基于规则的算法。机器学习通过构建模型来对数据进行分类和预测。
为了理解这个概念,我们可以探索一个可能用机器学习解决的问题。
假设我们想判断心脏是否会衰竭。这是否能用机器学习解决?答案是肯定的。假设我们拥有一些数据,例如每分钟心跳次数、身体质量指数、年龄、性别,以及结果——心脏是否衰竭。
利用机器学习,给定这些数据,我们能够学习并创建一个模型。该模型在给定输入后可以预测结果。
机器学习与传统编程的区别
那么,这与使用统计分析创建算法有何不同?
算法是一种数学技术。在传统编程中,我们获取数据和规则,并用它们来开发一个能给出答案的算法。
在上一个例子中,如果使用传统算法,我们会获取如每分钟心跳次数和身体质量指数等数据,并用这些数据创建一个算法来判断心脏是否会衰竭。本质上,这将是一个 if-then-else 语句。当我们提交输入时,会根据我们确定的算法得到答案,而这个算法本身不会改变。
传统编程流程:
数据 + 规则 -> 算法 -> 答案
另一方面,机器学习则采用数据和答案来创建算法。我们最终得到的不是答案,而是一组决定机器学习模型形态的规则。模型在获得输入时,会自行确定规则和 if-then-else 逻辑。
机器学习流程:
数据 + 答案 -> 算法(模型)
本质上,模型所做的是确定传统算法中的参数。我们不是武断地决定“每分钟心跳次数 + 身体质量指数 = 某个结果”,而是使用模型来确定逻辑是什么。与传统算法不同,这个模型可以持续训练,并在未来用于预测新值。
机器学习依赖于通过检查和比较大型数据集来发现共同模式,从而定义行为规则。
机器学习的三种主要类型
机器学习主要分为三种类型:监督学习、无监督学习和强化学习。
1. 监督学习 👁️
例如,我们可以向机器学习程序提供大量鸟类图片,并训练模型在提供鸟类图片时返回标签“鸟”。我们也可以为“猫”创建一个标签,并提供猫的图片进行训练。
当机器学习模型看到一张猫或鸟的图片时,它会以一定的置信度给图片贴上标签。这种类型的机器学习被称为监督学习,即算法在人类标记的数据上进行训练。
你为监督学习算法提供的样本越多,它在分类新数据时就变得越精确。
2. 无监督学习 🔍
另一种机器学习类型是无监督学习。它依赖于向算法提供未标记的数据,并让它自行发现模式。你提供输入,但不提供标签,让机器推断特征。
算法接收未标记的数据,进行推断并发现模式。这种学习对于数据聚类很有用,即根据数据与邻近数据的相似性以及与其他所有数据的差异性进行分组。
数据聚类后,可以使用不同的技术来探索这些数据并寻找模式。例如,你可以向机器学习算法提供持续的网络流量数据流,让它独立学习基线正常网络活动,以及网络上可能发生的异常和恶意行为。
3. 强化学习 🎮
第三种机器学习算法是强化学习。它依赖于向机器学习算法提供一组规则和约束,并让它学习如何实现目标。你定义状态、期望目标、允许的动作和约束。
算法通过尝试不同的允许动作组合来找出如何实现目标,并根据决策的好坏获得奖励或惩罚。算法在提供的约束范围内尽力最大化其奖励。你可以使用强化学习来教机器下国际象棋或穿越障碍路线。
总结
本节课中,我们一起学习了机器学习的核心概念。我们了解到机器学习是让计算机从数据中学习并做出决策,这与传统基于固定规则的编程有本质区别。我们重点探讨了三种主要的机器学习范式:
-
监督学习:使用带标签的数据进行训练,用于分类和预测。
-
无监督学习:使用未标记的数据自行发现模式和结构,如聚类。
-
强化学习:通过与环境的交互和奖惩机制来学习达成目标的最佳策略。
机器学习模型就是用于发现数据中模式的算法,而无需程序员显式地编程这些模式。理解这些基础是进一步探索人工智能应用的重要一步。
014:机器学习技术与训练 🧠
在本节课中,我们将学习机器学习的基本分类、核心概念以及模型训练与评估的过程。我们将探讨监督学习、无监督学习和强化学习的区别,并深入了解分类、回归等具体任务。
机器学习是一个广泛的领域,我们可以将其分为三个不同的类别:监督学习、无监督学习和强化学习。我们可以用这些技术解决许多不同的任务。
监督学习指的是数据中包含类别标签,我们利用这些标签来构建分类模型。这意味着当我们接收数据时,数据带有说明其含义的标签。
在之前的例子中,我们有一个包含“年龄”或“性别”等标签的表格。
对于无监督学习,我们没有类别标签,必须从非结构化数据中发现类别标签。这可能涉及深度学习等技术,例如通过查看图片来训练模型。
这类任务通常通过一种称为“聚类”的方法来完成。
强化学习是另一个子集,它使用奖励函数来惩罚不良行为或奖励良好行为。
监督学习的细分 📊
上一节我们介绍了机器学习的三大类别,本节中我们来看看监督学习的具体细分。
监督学习可以进一步分为三个类别:回归、分类和神经网络。
回归模型通过观察特征 X 与结果 Y 之间的关系来构建,其中 Y 是一个连续变量。
本质上,回归用于估计连续值。
神经网络指的是模仿人脑结构的模型。
理解分类任务 🏷️
了解了回归之后,我们来看看分类任务。
分类则侧重于离散值。它根据许多输入特征 X 来分配离散的类别标签 Y。
在之前的例子中,给定一组特征 X,如每分钟心跳次数、身体质量指数、年龄和性别,算法将输出 Y 分类为两个类别:真或假,以预测心脏是否会衰竭。
在其他分类模型中,我们可以将结果分为两个以上的类别。例如,预测一个食谱是属于印度菜、中国菜、日本菜还是泰国菜。
以下是几种常见的分类形式:
-
决策树
-
支持向量机
-
逻辑回归
-
随机森林
特征与训练过程 ⚙️
在分类中,我们可以从数据中提取特征。在这个例子中,特征就是每分钟心跳次数或年龄。
特征是输入模式的独特属性,有助于确定输出的类别。每一列是一个特征,每一行是一个数据点。
分类是预测给定数据点类别的过程。我们的分类器使用一些训练数据来理解给定的输入变量与该类别之间的关系。
那么“训练”具体指什么呢?训练指的是使用学习算法来确定和开发模型的参数。虽然有许多算法可以实现这一点,通俗地说,如果你正在训练一个模型来预测心脏是否会衰竭(即真或假值),你会向算法展示一些标记为“真”的真实数据,然后再向算法展示一些标记为“假”的数据,并重复这个过程,数据带有真或假值(即心脏是否真的衰竭了)。
算法会修改其内部值,直到学会从指示心脏衰竭(真)或未衰竭(假)的数据中进行区分。
数据集划分与模型评估 📈
在机器学习中,我们通常将一个数据集分成三个部分:训练集、验证集和测试集。
以下是每个部分的作用:
-
训练子集:用于训练算法的数据。
-
验证子集:用于验证我们的结果并微调算法的参数。
-
测试数据:模型从未见过的数据,用于评估我们的模型有多好。
然后,我们可以使用准确率、精确率和召回率等术语来表明模型的好坏。
总结 ✨
本节课中,我们一起学习了机器学习的主要分类:监督学习、无监督学习和强化学习。我们深入探讨了监督学习下的回归与分类任务,理解了特征的含义以及模型训练的基本过程。最后,我们了解了如何将数据集划分为训练集、验证集和测试集,并利用测试集来评估模型的性能。掌握这些基础概念是构建有效AI模型的第一步。
015:深度学习 🧠
在本节课中,我们将要学习深度学习的核心概念、工作原理及其在人工智能领域的重要应用。深度学习是机器学习的一个专门子集,它通过模拟人脑的神经网络结构,使AI系统能够从非结构化数据中持续学习并提升性能。
什么是深度学习?
机器学习是人工智能的一个子集,而深度学习是机器学习的一个专门子集。
深度学习通过分层算法构建神经网络,这是一种对大脑结构和功能的人工模拟。这种结构使得AI系统能够在工作中持续学习,并提高结果的质量与准确性。
正是这种能力,使得系统能够从照片、视频和音频文件等非结构化数据中学习。
深度学习如何工作?
上一节我们介绍了深度学习的基本定义,本节中我们来看看它的工作原理。
深度学习算法并非直接将输入映射到输出。相反,它们依赖于多层处理单元。每一层将其输出传递给下一层,由下一层进行处理后再继续传递。正是由于存在许多层,它才被称为“深度”学习。
在创建深度学习算法时,开发者和工程师需要配置网络的层数以及连接各层输入与输出的函数类型。
其核心结构可以抽象为以下公式:
输出 = 层_n( ... 层_2( 层_1(输入) ) ... )
然后,他们通过提供大量带标注的示例来训练模型。例如,如果你给一个深度学习算法成千上万张图片以及对应每张图片内容的标签,该算法会将这些示例通过其分层的神经网络运行,并调整神经网络每一层中变量的权重,以便能够识别出具有相似标签的图片所共有的模式。
以下是深度学习训练过程的简要步骤:
-
准备数据:收集并标注大量数据。
-
构建网络:确定层数、每层的神经元数量及激活函数。
-
前向传播:输入数据通过网络层层传递,得到预测输出。
-
计算损失:比较预测输出与真实标签,计算误差(损失)。
-
反向传播:将误差从输出层向输入层反向传播,计算各层参数的梯度。
-
更新权重:使用优化算法(如梯度下降)根据梯度调整网络权重。
深度学习的优势
深度学习解决了一个存在于早期学习算法中的主要问题。当数据集增长时,传统机器学习算法的效率和性能会达到瓶颈,而深度学习算法随着被喂入更多数据,性能会持续提升。
这一点可以直观地理解为:更多的数据 → 更准确的模型。
深度学习的应用
深度学习已被证明在各种任务中非常高效,其应用广泛。
以下是深度学习的一些主要应用领域:
-
图像标注:自动为图片生成描述性文字。
-
语音识别与转录:将语音转换为文本。
-
人脸识别:识别和验证个人身份。
-
医学影像分析:辅助诊断疾病(如分析X光片、MRI图像)。
-
语言翻译:实现高质量、上下文相关的机器翻译。
此外,深度学习也是无人驾驶汽车的主要技术组件之一。
总结
本节课中我们一起学习了深度学习。我们了解到深度学习是机器学习的一个强大分支,它利用多层神经网络结构来模拟人脑的学习过程。这种结构使其能够处理复杂的非结构化数据,并随着数据量的增加而不断改进性能。从图像识别到自动驾驶,深度学习正在推动人工智能技术在许多领域取得突破性进展。
016:神经网络 🧠
在本节课中,我们将要学习人工智能的核心技术之一——神经网络。我们将了解它的基本构成、工作原理以及几种重要的网络类型。
什么是人工神经网络? 🎼
人工神经网络是由许多被称为“神经元”的小型计算单元组成的集合。这些神经元模仿人脑处理信息的方式进行建模。人工神经网络借鉴了生物大脑神经网络的一些思想,以近似实现其部分处理结果。
这些神经元像生物神经网络一样接收输入数据,并随着时间学习如何做出决策。
神经网络如何学习? 🔄
神经网络通过一个称为“反向传播”的过程进行学习。反向传播使用一组训练数据,这些数据将已知输入与期望输出相匹配。
以下是反向传播的基本步骤:
-
前向传播:首先,将输入数据输入网络,并确定输出。
-
计算误差:然后,一个误差函数会计算当前输出与期望输出之间的差距。
-
调整参数:最后,对网络内部的参数(如权重)进行调整,以减少误差。
这个过程会不断重复,直到网络的预测达到可接受的准确度。
神经网络的层结构 🏗️
上一节我们介绍了神经元如何工作,本节中我们来看看它们是如何组织起来的。
一组神经元被称为一个“层”。一个层接收输入并提供输出。任何神经网络都会有一个输入层和一个输出层。它还会有一个或多个“隐藏层”,这些隐藏层模拟了人脑中进行的活动类型。
隐藏层接收一组加权的输入,并通过一个“激活函数”产生输出。拥有多个隐藏层的神经网络被称为深度神经网络。
以下是神经网络中不同层的功能:
-
输入层:将输入值乘以权重并求和,然后将结果传递给下一层。
-
隐藏层与输出层:接收来自其他节点的输入,并将输出传递给其他节点。它们具有一个称为“偏置”的属性,这是一种特殊的权重,在其他输入被考虑后应用于节点。
-
激活函数:决定节点如何响应其输入。该函数对输入和偏置的总和进行计算,然后将结果作为输出转发。激活函数可以有不同的形式(如Sigmoid, ReLU),选择何种激活函数是神经网络成功的关键组成部分。
卷积神经网络(CNN) 🖼️
了解了基础的网络结构后,我们来看看一种专门用于处理图像等网格状数据的网络——卷积神经网络。
卷积神经网络(CNN)是一种多层神经网络,其灵感来源于动物的视觉皮层。CNN在图像处理、视频识别和自然语言处理等应用中非常有用。
“卷积”是一种数学运算,其中一个函数应用于另一个函数,结果是两个函数的混合。在卷积网络中,这个过程发生在一系列层上,每一层都对前一层的输出进行卷积操作。
CNN擅长从简单的结构中检测特征,并将这些简单特征组合起来构建更复杂的特征。
循环神经网络(RNN) ⏳
最后,我们来看一种用于处理序列数据的网络——循环神经网络。
循环神经网络(RNN)之所以是“循环”的,是因为它对序列中的每个元素执行相同的任务,并且将先前的输出作为后续阶段的输入。
在普通的神经网络中,输入通过若干层处理,然后产生输出,并假设两个连续的输入是彼此独立的。但在某些场景下,这种假设可能不成立。例如,当我们需要考虑一个单词被说出时的上下文时,就必须依赖之前的观察结果来产生输出。
RNN可以利用长序列中的信息。网络的每一层都代表了在某个特定时间的观察。
总结 📝
本节课中我们一起学习了神经网络的基础知识。我们首先了解了人工神经网络的基本单元——神经元,以及它通过反向传播进行学习的过程。接着,我们探讨了神经网络的层状结构,包括输入层、隐藏层和输出层,并介绍了激活函数的作用。最后,我们学习了两种重要的专门化网络:用于图像处理的卷积神经网络(CNN)和用于序列数据的循环神经网络(RNN)。理解这些概念是构建更复杂AI应用的基础。
017:🤖 AI中的关键应用领域
在本节课中,我们将探讨人工智能的几个主要应用领域。我们将从最复杂的自然语言处理开始,逐步了解计算机视觉、音频数据处理以及传统的结构化数据分析。这些领域共同构成了现代AI技术的基础。
上一节我们介绍了人工智能的广阔前景,本节中我们来看看AI具体在哪些关键领域发挥作用。虽然AI的应用范围非常广泛,但我们可以从宏观上将其归纳为几个主要类别。
📝 自然语言处理
我首先要从自然语言开始,因为我认为自然语言是机器学习需要处理的最复杂的数据类型。
如果你观察各种数据,无论是基因序列、音频还是图像,它们都存在某种可辨别的模式。例如,汽车的声音或人声都有其特定模式。然而,自然语言从根本上说是一项非常“人类”的任务,是一种非常“人类”的数据源。它是我们人类发明出来供人类理解的。
这里有一个关于自然语言复杂性的著名例子。假设有一本书,书名是:“这本书的标题里有两个错误”。实际上,这个标题里只有一个错误(“Therere”的语法错误)。人类大脑可能不会立刻意识到:第二个“错误”就是“实际上只有一个错误”这个事实本身。这体现了自然语言的内在复杂性。
人类并非从字面意义上理解语言,而是从概念上理解。例如,如果我写“a3”来代替字母“E”,你也能理解,因为我们不把“3”当作字面上的数字,而是将其视为代表“E”这个概念的符号。你能根据上下文推断出“3”指的是字母“E”而不是数字三。这些是计算机目前难以直接做到的事情。
因此,在机器学习领域,自然语言是我最感兴趣的首要领域。
👁️ 计算机视觉
其次,我认为最流行的领域是视觉数据理解,即计算机视觉。因为它使我们能够实现许多功能。作为人类,我们的主要感官是视觉。事实上,在任何时刻,你大脑的大部分处理能力都用于理解你所看到的事物,无论是人脸、电脑、文本还是其他任何东西。
🔊 音频数据处理
第三,我会说是基于音频的数据处理。因此,文本转语音和语音转文本是非常复杂的任务。
其复杂性在于它结合了许多挑战。首先,你必须支持多种语言,不能只支持英语就万事大吉。你必须支持其他语言和其他人群。
另一个挑战是,即使在同一种语言内部,人类表达语言的方式也几乎是无限的。每个人都会有不同口音,每个人对某些单词的发音方式都不同。不存在一个让每个人都完全一样地读出“ice cube”的标准方式。
此外,音频数据本身处理起来就非常困难。因为音频数据存在于自然界中。什么是音频?它是空气分子的振动,而这种振动非常快。音频通常以超过44千赫兹的频率被录制,这意味着每秒会产生大量数据点。
公式示例: 采样率 44 kHz = 每秒 44,000 个数据点。
一个低分辨率的图像通常也只有大约44,000个数据点。因此,在处理音频数据时,确实存在许多需要克服的挑战。但像IBM、谷歌、微软这样的公司已经设法应对了这些挑战,并致力于创建不同的服务来让开发者的工作变得更轻松。
📊 结构化数据分析
当然,还有传统的表格数据理解领域,这本质上是结构化数据的分析。
本节课中我们一起学习了人工智能的四个关键应用领域:自然语言处理、计算机视觉、音频数据处理以及结构化数据分析。每个领域都面临着独特的挑战,但也为AI技术的创新和应用提供了广阔的空间。理解这些领域是构建有效AI解决方案的第一步。
018:人工智能的三大应用领域 🧠
在本节课中,我们将学习人工智能最常见的三个应用领域:自然语言处理、语音技术和计算机视觉。我们将了解它们的基本概念、工作原理以及它们如何改变我们与数字世界的交互方式。
自然语言处理 📝
人工智能最常见的应用领域包括自然语言处理、语音和计算机视觉。现在,让我们逐一了解它们。
人类拥有最先进的交流方式,即自然语言。虽然人类可以使用计算机互相发送语音和文本消息,但计算机本身并不知道如何处理自然语言。
自然语言处理是人工智能的一个子集,它使计算机能够理解人类语言的含义。自然语言处理使用机器学习和深度学习算法来辨别词语的语义。
它通过语法、关系和结构上解构句子,并理解其使用语境来实现这一点。例如,根据对话的上下文,NLP可以判断“cloud”一词是指云计算,还是指天空中漂浮的大量凝结水蒸气。
NLP系统还可能理解意图和情感,例如判断你的提问是出于沮丧、困惑还是恼怒。为了理解用户语言的真实意图,NLP系统通过一系列广泛的语言学模型和算法进行推断。
语音技术 🎤
上一节我们介绍了自然语言处理,本节中我们来看看语音技术。自然语言处理被分解为许多与音频和视觉任务相关的子类别。
为了让计算机用自然语言交流,它们需要能够将语音转换为文本,从而使交流更自然、更容易处理。它们还需要能够将文本转换为语音,使用户无需盯着屏幕即可与计算机交互。
以下是语音转文本技术的发展历程:
-
传统方法:早期的语音转文本技术需要程序员经历一个繁琐的过程,即发现并编码规则,以对语音样本进行分类并将其转换为文本。
-
神经网络方法:使用神经网络时,无需编码规则。你只需提供语音样本及其对应的文本。神经网络会找出单词发音之间的共同模式,然后学习将新的语音录音映射到其对应的文本。
语音转文本技术的这些进步,是我们能够实现实时转录的原因。谷歌在其“来电筛选”功能中使用AI驱动的语音转文本技术来处理诈骗电话并向你显示通话内容文本。YouTube也使用此技术来提供自动字幕。
语音转文本的另一面是文本转语音,也称为语音合成。
以下是文本转语音技术的发展:
-
过去:创建一个语音模型需要数百小时的编码工作。
-
现在:在神经网络的帮助下,合成人声已成为可能。其过程通常涉及两个神经网络:
-
第一个神经网络(分类器)摄入一个人的大量语音样本,直到它能够判断一个新的语音样本是否属于同一个人。
-
第二个神经网络(生成器)生成音频数据,并将其通过第一个网络,以查看其是否验证该音频属于目标人物。如果不通过,生成器会修正其样本并再次通过分类器运行。
-
这两个网络重复此过程,直到生成听起来自然的样本。公司使用AI驱动的语音合成来增强客户体验,并赋予其品牌独特的声音。在医学领域,这项技术正在帮助肌萎缩侧索硬化症患者重获他们真实的声音,而不是使用计算机合成的声音。
计算机视觉 👁️
上一节我们探讨了语音技术,本节我们将聚焦于计算机视觉。
计算机视觉领域专注于复制人类视觉系统的部分复杂性,并使计算机能够像人类一样识别和处理图像及视频中的物体。计算机视觉是使数字世界能够与物理世界交互的技术之一。
近年来,由于深度学习和神经网络的进步,计算机视觉领域取得了巨大飞跃,在检测和标记物体等相关任务上甚至超越了人类。
这项技术使自动驾驶汽车能够理解周围环境。它在人脸识别应用中扮演着至关重要的角色,使计算机能够将人脸图像与其身份匹配。它也在增强现实和混合现实中发挥着关键作用,这项技术允许智能手机、平板电脑和智能眼镜等计算机设备在真实世界图像上叠加和嵌入虚拟物体。
像谷歌相册这样的在线照片库使用计算机视觉来检测物体,并根据其包含的内容类型对图像进行分类。
总结 📚
本节课中,我们一起学习了人工智能的三大核心应用领域。
-
自然语言处理:使计算机能够理解、解释和生成人类语言,关键在于理解语境和意图。
-
语音技术:包括语音转文本和文本转语音,它们让人机交互更加自然便捷,其核心进步源于神经网络。
-
计算机视觉:赋予计算机“看”和理解视觉世界的能力,广泛应用于自动驾驶、人脸识别和增强现实等领域。
这些技术共同构成了现代AI应用的基础,正在深刻地改变我们的生活和工作方式。
020:探索当今的AI关注点 🔍
在本节课中,我们将探讨当前人工智能领域的热点话题。我们将了解可信AI的重要性,并考察AI在面部识别、招聘、社交媒体营销以及医疗保健等具体领域的应用与挑战。
可信AI:当今的核心议题
上一节我们介绍了课程概述,本节中我们来看看当前AI领域的核心议题。人们常问我AI的当前热点是什么,我的回答是,今天所说的内容很可能在下周甚至明天就会有所不同。AI世界极具活力,这是一件好事。它是一项新兴技术,拥有惊人的可能性,并有潜力以前所未有的速度解决众多问题。
然而,正如我们所见,在某些情况下,AI也可能产生有害后果。因此,我认为AI的热点议题是:我们如何负责任地运用它?IBM提出了五大支柱来应对这一问题,概括了负责任AI的理念,即可解释性、透明度、稳健性、隐私和公平性。我们可以更深入地探讨这些主题。
但我想在此强调两点:
第一,这不是一项一劳永逸的工作。如果你打算使用AI,如果我们打算将其应用于社会,这不是你仅在开始或结束时才需要处理的事情,而是必须在AI的整个生命周期中持续关注的问题。无论你是在规划阶段、设计AI、训练AI、部署AI,还是作为与AI交互的最终用户,都需要不断思考这五大支柱。
第二,我认为更重要的是,这是一项团队运动。我们都需要意识到AI带来的潜在好处和潜在危害,并鼓励每个人提出问题,为人们保持对AI工作原理及其行为的好奇心留出空间。只有这样,我们才能真正利用它来解决有益的问题,取得巨大成果,并减轻任何潜在的危害。所以,请保持好奇心。
AI在面部识别技术中的应用
在围绕人工智能设计解决方案时,面部识别已成为一个永久性的用例。目前设计和应用的模型与算法主要有三种典型类别。
以下是三种主要的面部识别类别:
-
面部检测:仅检测一个物体是否是人脸,而不是狗或猫等其他物体。这种识别不涉及唯一识别该面孔属于谁。
-
面部认证:你可能使用这种面部识别来解锁iPhone或安卓设备。在这种情况下,我们通过将面部图像特征与预先存储的单一图像进行比较,提供一对一的身份验证。这意味着你实际上只将图像与设备所有者的特定图像进行比较。
-
面部匹配:在这种情况下,我们将图像与其他图像或照片数据库进行比较。这与前一种类别的不同之处在于,模型试图在包含属于其他人的图像或照片的数据库中,确定与个体身份相匹配的面部。
面部识别有许多不同的例子,其中许多无疑是你日常活动中正在体验的。有些已被证明是有益的,而另一些则被证明不那么有益,甚至还有一些被证明具有犯罪性质,因为某些人群因这些系统的使用而受到伤害。
我们看到,AI系统中的面部识别技术和解决方案在诸如机场导航、通过安检线,或者我们之前讨论过的使用面部识别解锁iPhone、家门或汽车门等场景中提供了重要价值。这些都是面部识别技术的有益用途。
但是,也存在一些必须禁止的明确示例和用例。这些可能包括在未经本人明确许可的情况下在人群中识别个人,或对个人或群体进行大规模监控。这类技术使用方式,如果被错误的人以错误的方式使用,会引发严重的隐私、公民权利和人权问题。面部识别技术无疑可能被用来压制异议、侵犯少数群体权利,或者仅仅剥夺你对隐私的基本期望。
AI在招聘中的应用
AI正越来越多地被引入到劳动力发展的各个阶段,包括招聘、入职、职业发展(如晋升和奖励)以及处理人员流失等。以招聘为例,考虑一个收到成千上万份职位申请的组织,申请人应聘各种职位,包括前台、后台、季节性、永久性等。
AI可以帮助你对申请者进行排名和优先级排序,针对目标职位空缺,向招聘经理呈现一份顶级候选人名单。AI解决方案可以处理简历中的文本,并将其与其他结构化数据结合,以辅助决策。
现在,我们需要谨慎地设置防护措施。我们需要确保AI在招聘中的使用不会在性别、种族等敏感属性上产生偏见。即使这些属性没有被AI直接使用,也可能通过代理属性(如邮政编码或之前从事的工作类型)悄然渗入。
AI在社交媒体营销中的应用
当今AI的一个热点话题是其在社交媒体营销中的应用。它彻底改变了品牌在TikTok、LinkedIn、Twitter、Instagram、Facebook等社交媒体平台上与受众互动的方式。
以下是AI在社交媒体营销中的主要应用:
-
AI可以为你创建广告。
-
AI可以为你创建社交媒体帖子。
-
AI可以帮助你精准定位这些广告。
-
AI可以使用情感分析为你识别新的受众。
所有这些都为营销人员带来了惊人的效果,提高了营销活动的有效性,同时降低了运营这些活动的成本。
然而,AI为在社交媒体平台上进行营销所提供的技术和能力也引发了一些伦理问题。营销之所以成功,很大程度上归功于社交媒体平台从其用户那里收集的所有数据。表面上,收集这些数据是为了给终端用户提供更个性化的体验。但平台并不总是明确告知收集了哪些数据,以及你是否同意他们使用这些数据。
现在,那些对品牌营销活动非常有效的技术,同样可以用于生成错误信息、阴谋论,无论是政治上的还是科学上的错误信息。这对我们的整个社会产生了可怕的影
响。这就是为什么所有企业都必须遵守一些明确的原则,围绕透明度、可解释性、信任和隐私,来规范他们如何使用AI或将AI构建到他们的解决方案和平台中。
AI在医疗保健中的应用
AI的使用正在所有医疗保健领域(如医疗服务提供者、支付方、生命科学等)不断增加。支付方组织正在使用利用理赔数据的AI和机器学习解决方案,并经常将其与社会健康决定因素等其他数据集相结合。
一个顶级的用例是用于协调护理的疾病预测。例如,预测会员群体中谁可能在未来三个月内出现不良状况(如急诊就诊),然后提供正确的干预和预防形式。在这种情况下,公平护理变得非常重要。我们需要确保AI在年龄、性别、种族等所有敏感属性上没有偏见。
当然,在所有领域中,对话式AI(包括虚拟代理以及帮助人类更好地服务会员群体的系统)已成为标配。在医疗保健中所有这些AI用例中,我们看到了一些共同点:能够从组织拥有的丰富数据集中解锁洞察、改善会员或患者体验,以及设置防护措施以确保AI是可信的。
总结
本节课中,我们一起探索了当前人工智能领域的几个关键关注点。我们了解到,构建可信赖的AI(涵盖可解释性、透明度、稳健性、隐私和公平性)是贯穿AI生命周期的核心议题。我们具体考察了AI在面部识别、招聘、社交媒体营销和医疗保健等领域的应用,认识到AI在带来效率提升和全新可能性的同时,也伴随着偏见、隐私和伦理等方面的挑战。负责任地开发和使用AI,需要持续的关注、团队的协作以及明确的原则与防护措施。
021:探索人工智能与伦理 🤖⚖️
在本节课中,我们将要学习人工智能伦理的概念、重要性以及如何在实践中应用它。我们将探讨为何AI伦理是一个社会技术挑战,以及组织如何通过原则、治理和具体操作来构建和使用合乎伦理的人工智能。
人工智能的普遍性与社会影响
人工智能在我们的生活中无处不在,即使我们常常没有意识到它。当我们使用信用卡在线购物、在网络上搜索信息、在社交平台上发布内容或关注他人,甚至是在使用基于AI的导航支持和驾驶辅助功能时,我们都在使用人工智能。
这种普遍性给我们的生活以及社会的结构和公平性带来了快速而重大的转变。正因如此,人工智能除了是一门技术和科学学科外,还具有非常重要的社会影响力。这引发了许多关于AI应如何被设计、开发、部署、使用和监管的伦理问题。
人工智能的社会技术维度与包容性
人工智能的社会技术维度要求我们努力识别所有利益相关者,这远远超出了技术专家的范畴,还包括社会学家、哲学家、经济学家、政策制定者以及受这项技术部署影响的所有社群。
在定义生态系统、在AI开发和部署的所有阶段、以及在AI对部署场景的影响中,包容性都是必要的。没有包容性,我们就有风险创造出只为少数人服务的AI,而将许多其他人抛在后面,使其处于不利地位。每个人都需要参与定义我们想要利用AI和其他技术(作为手段而非目的)构建的未来愿景。
为了实现这一愿景,需要适当的指导方针来引导AI的创造和使用朝着正确的方向发展。技术工具是必要且有用的,但它们应该辅以原则、保障措施、定义明确的流程和有效的治理。我们不应认为所有这些会减缓创新。
伦理作为创新的加速器
我们可以将AI伦理比作交通规则。交通信号灯、停车标志和速度限制看似让我们慢下来。然而,如果没有它们,我们并不会开得更快,反而会因为对其他车辆和行人的状态完全不确定而开得更慢。
AI伦理识别并解决了这项技术引发的社会技术问题,确保支持并促进正确的创新,从而使通往我们期望的未来的道路更加顺畅。
正如IBM首席执行官所言,信任是我们运营的许可证。我们通过我们的政策、计划、合作伙伴关系以及对技术负责任使用的倡导赢得了这种信任。一百多年来,IBM一直处于创新的前沿,为我们的客户和社会带来利益。
这种方法无疑适用于人工智能的开发、使用和部署。因此,伦理应嵌入到设计和开发流程的生命周期中。
构建伦理基础:原则与支柱
伦理决策不仅仅是一种技术问题解决方法。相反,应基于原则、价值观、标准、法律和对社会的益处,采取一种伦理、社会学、技术和以人为本的方法。因此,建立这个基础是重要且必要的,但从哪里开始呢?
一个很好的起点是一套指导原则。在IBM,我们将我们的原则称为“信任与透明原则”,共有三条:
-
AI的目的是增强而非取代人类智能。
-
数据和洞察力属于其创造者。
-
包括AI系统在内的新技术必须是透明且可解释的。
最后一条原则建立在我们的五大支柱之上:
-
透明:通过分享AI的用途和运作方式来增强信任。
-
可解释:系统能够解释其决策过程。
-
公平:当系统经过适当校准时,它应能协助做出更好的选择,并确保公平性。
-
稳健:系统应该是安全的。
-
隐私保护:保障隐私和权利。
我们知道,仅有原则和支柱是不够的。我们拥有一套广泛的工具和才华横溢的从业者,他们可以帮助诊断、监控、促进我们所有的支柱,并进行持续监控,以减轻风险和意外后果。
将AI伦理付诸实践的三步法
上一节我们介绍了AI伦理的原则与支柱,本节中我们来看看如何将它们付诸实践。将AI伦理付诸行动可以分为三个关键步骤。
第一步:建立理解与意识
将AI伦理付诸实践的第一步,与任何事情一样,是建立理解和意识。这意味着要让你的团队具备思考AI伦理的能力,并理解将其付诸实践意味着什么。
无论你正在构建和部署什么解决方案,都需要持续反思伦理问题。以下是一个思考示例,假设你正在公司内部构建和部署一个学习解决方案:
-
这个解决方案是否以用户为中心进行设计?
-
我们是否与用户共同创建了这个解决方案?
-
它如何确保不同群体的所有员工都能平等地获得机会?
对AI伦理的深刻理解,并持续反思这些问题,是至关重要的基础。
第二步:建立治理结构
在建立了理解和意识,并且每个人都在反思这个主题之后,付诸实践的第二步骤是建立治理结构。这里的关键在于,这是一个旨在规模化推广AI伦理实践的治理结构,而不是在某个市场或业务单元中孤立地进行。
因此,我们讨论了作为基础的“理解与意识”,第二步是“治理”,这是领导者建立结构的责任。
第三步:实现规模化运营
一旦具备了前两个要素,第三步就是实现运营化。你如何确保在马来西亚或波兰的开发人员、数据科学家或供应商知道如何将AI伦理付诸实践,以及这对他们意味着什么?
在全球层面建立结构是一回事,但如何确保它在各个市场以及每个用户、每个数据科学家、每个开发人员那里都能规模化地运营,让他们知道自己需要做什么?
这完全取决于对可信AI支柱的清晰理解。对IBM而言,这些支柱是:透明、可解释、公平、稳健和隐私保护。回到我们的学习解决方案例子,每个数据科学家、开发人员和供应商都需要以非常具体、可操作的方式理解这些支柱的含义。
总结
本节课中,我们一起学习了人工智能伦理的核心概念。我们了解到AI的普遍性带来了重大的社会影响和伦理挑战,解决这些挑战需要包容性的社会技术方法。我们探讨了IBM的信任与透明原则及其五大支柱(透明、可解释、公平、稳健、隐私保护),并学习了将AI伦理付诸实践的三个步骤:建立理解与意识、建立治理结构以及实现规模化运营。记住,合乎伦理的AI不仅是技术需求,更是构建可信、可持续未来的基石。
022:定义AI伦理 🤖⚖️
在本节课中,我们将要学习人工智能伦理的定义及其重要性。我们将探讨为什么在构建和使用AI时,必须将伦理置于核心位置,并详细介绍构成AI伦理的五大支柱。
人类依赖文化上公认的道德和行为标准(即伦理)来指导其决策,尤其是那些影响他人的决策。
随着人工智能越来越多地被用于自动化和增强决策过程,将伦理置于AI构建的核心变得至关重要,以确保其结果符合人类的伦理和期望。
什么是AI伦理?🧐
上一节我们提到了伦理在AI中的核心地位,本节中我们来看看AI伦理的具体定义。
AI伦理是一个多学科领域,旨在研究如何最大化AI的积极影响,同时减少其风险和负面影响。它探讨诸如数据责任与隐私、包容性、道德能动性、价值对齐、问责制和技术滥用等问题,以理解如何以符合人类伦理和期望的方式构建和使用AI。
AI伦理的五大支柱 🏛️
了解了AI伦理的总体目标后,我们接下来深入探讨其具体构成。以下是构成AI伦理基础的五个核心支柱。
-
可解释性
AI具有可解释性,是指它能够展示其如何以及为何得出特定结果或建议。你可以将可解释性理解为AI系统“展示其工作过程”。
-
公平性
AI具有公平性,是指它能够公平地对待个人或群体。AI可以通过抵消人类偏见来帮助人类做出更公平的选择。但需注意,AI本身也可能存在偏见,因此必须采取措施来减轻这种偏见。
-
鲁棒性
AI具有鲁棒性,是指它能够有效处理异常情况,例如异常输入或对抗性攻击。鲁棒的AI旨在能够抵御有意和无意的干扰。
-
透明度
AI具有透明度,是指向人类适当地分享有关AI系统如何设计和开发的信息。透明度意味着人类能够获取相关信息,例如用于训练AI系统的数据是什么、系统如何收集和存储数据,以及谁有权访问系统收集的数据。
-
隐私
由于AI会摄入大量数据,其设计必须优先考虑并保护人类的隐私和数据权利。为尊重隐私而构建的AI,仅收集和存储其运行所需的最少量数据,并且在未经用户同意等考虑下,收集的数据绝不应被用于其他目的。
总结 📝
本节课中,我们一起学习了AI伦理的定义及其重要性。我们了解到,AI伦理旨在确保AI的发展与人类价值观一致。具体而言,我们探讨了构成AI伦理基础的五大支柱:可解释性、公平性、鲁棒性、透明度和隐私。这五大支柱共同帮助我们更合乎伦理地设计、开发、部署和使用AI,并理解如何以符合人类伦理和期望的方式构建和使用AI。
023:🤖 了解AI中的偏见
在本节课中,我们将要学习人工智能中的偏见问题。你将了解到偏见如何在AI系统中产生,它如何影响AI的决策结果,以及如何开始着手减轻AI中潜在的偏见。
什么是AI中的偏见?
人工智能中的偏见,指的是在关键决策任务中,AI系统表现出的、对某些群体或个人造成系统性不利的、非预期的行为。这些任务可能涉及贷款审批、招聘,甚至刑事司法。
一个例子是,一个用于决定谁应获得额外预防性医疗保健的AI系统,分配给白人的机会多于黑人。另一个例子是招聘算法,AI系统让符合条件的男性获得面试的机会多于同等条件的女性。
偏见是如何产生的?
上一节我们介绍了AI偏见的概念,本节中我们来看看偏见产生的多种来源。AI或机器学习系统是基于人类决策者过去所做的历史决策进行训练的。
以下是偏见产生的主要途径:
-
历史数据中的偏见:过去的决策者可能自身就存在隐性的或显性的偏见,这些偏见会通过数据中的成见反映在训练数据中。
-
数据采样偏差:在特定数据集中,某些群体可能被过度代表或代表不足。
-
数据处理阶段的偏差:在数据科学项目的数据处理或准备阶段,即使进行特征工程也可能引入新的偏见。
例如,在医疗保健的例子中,如果我将住院、门诊和急诊费用分开作为特征,那么对非裔美国人引入的偏见会少得多。而如果我将它们合并为一个单一特征,实际上会对非裔美国人产生更大的偏见。这可以用一个简单的选择来描述:
特征 = 合并(住院费用, 门诊费用, 急诊费用)vs特征集 = {住院费用, 门诊费用, 急诊费用} -
问题定义本身的偏差:可能我们预测的目标本身就是错误的。例如,如果我试图预测“犯罪性”或“未来犯罪”,那么使用“逮捕记录”作为依据是不合适的。因为警察在某些社区更活跃,逮捕率更高,并且被逮捕不等于有罪。
如何减轻AI中的偏见?
正如我们所讨论的,偏见有多种来源,因此我们需要采取行动来消除这些来源。
以下是一些关键的缓解方法:
-
组建多元化团队:认识到偏见的存在是第一步。拥有具备不同生活经验的团队,有助于识别这些危害以及其他可能存在的偏见。
-
寻找更少偏见的数据集:使用本身偏见较少的数据集,是抵消偏见的一种方式。
-
采用技术方法:如果我们在有偏见的数据上训练机器学习模型,可以引入额外的约束或其他统计度量来减轻偏见。
例如,IBM开发了多种此类算法,其中许多已在名为 AI Fairness 360 (AIF360) 的开源工具包中提供。其核心思想是为模型训练过程添加公平性约束。
我们的目标是确保技术对社会产生积极影响。
IBM的实践:将伦理融入AI
作为IBM AI伦理委员会的成员,我致力于通过“好技术”实现有意识的包容。我们的AI伦理委员会代表了多元化的IBM员工,致力于研究和消除偏见,并在此领域建立标准。
IBM在多个方面运用AI和数据技能来应对偏见:
-
开发技术资产:利用我们的技术开发工具来应对偏见。
-
推动包容性语言:围绕我们的“语言至关重要”倡议,解决技术术语中的包容性语言问题。
-
加强解决方案测试:确保对我们的解决方案进行测试,以降低偏见出现的概率并最小化其潜在影响。
在多元化与包容性领域,我们使用AI、数据分析和洞察来为决策提供支持,同时应对并最小化偏见的潜在影响。
在人力资源领域,这意味着利用AI和数据洞察来增强决策支持,为薪酬、留任、招聘和晋升决策提供信息。这在协助我们满足全球合规要求并采取主动行动方面发挥着重要作用。
总结
本节课中,我们一起学习了人工智能中偏见的核心概念。我们了解到偏见表现为AI系统对特定群体的系统性不公,其来源包括历史数据偏差、采样问题、数据处理方式以及问题定义本身。为了应对这些挑战,我们可以通过组建多元化团队、选用更好的数据以及应用如AIF360这样的技术工具来减轻偏见。最后,我们也看到了IBM如何将伦理实践融入其AI开发和应用的各个环节。理解并积极管理AI中的偏见,对于构建负责任、可信赖的人工智能至关重要。
024:AI伦理与法规 📜⚖️
在本节课中,我们将要学习什么是人工智能法规,AI法规与AI伦理有何关联,以及为什么对于从事AI相关工作的人来说,理解AI法规至关重要。
上一节我们介绍了AI伦理的基本概念,本节中我们来看看与之紧密相关的AI法规。
什么是AI法规?
法规是由政府制定、具有法律强制执行力的规则。围绕人工智能的法规环境正在迅速发展。为了合法且合乎道德地设计、开发、部署和使用AI,理解关键的法规内容非常重要。
IBM的立场:精准监管
IBM的立场是呼吁对人工智能进行精准监管。我们支持有针对性的政策,以增加公司开发和运营可信赖AI的责任。
精准监管指的是基于风险、结合具体情境,并将责任分配给最接近风险一方的监管方式。这种责任方可能在AI生命周期的不同阶段发生变化。
IBM的精准监管框架
具体而言,IBM提出了一个精准监管框架,该框架为提供和/或使用AI系统的组织包含了五项政策要务。
以下是这五项核心要务:
-
指定AI伦理官员:任命一名负责确保符合可信赖AI标准的首席官员。
-
针对不同风险制定不同规则:即根据具体情境监管AI的应用,而非监管技术本身。
-
不要隐藏你的AI:使其透明化。
-
解释你的AI:换句话说,使其具有可解释性,而非一个“黑箱”决策。
-
测试你的AI是否存在偏见。
本节课中,我们一起学习了AI法规的定义、IBM倡导的精准监管理念,以及一个包含五项要务的具体监管框架。理解这些内容,是负责任地开发和应用人工智能的重要基础。
025:AI伦理、治理与ESG 🧭
在本节课中,我们将学习人工智能治理(AI Governance)的概念及其目标,了解环境、社会和治理(ESG)框架的含义与作用,并探讨治理、ESG与AI伦理之间的紧密联系。
什么是AI治理?🎯
上一节我们概述了本课内容,本节中我们来看看AI治理的具体定义。治理是指组织通过其公司指令、员工、流程和系统进行管理的行动,旨在指导、评估、监控并在整个AI生命周期中采取纠正措施,以确保AI系统的运作符合组织的意图、利益相关者的期望以及相关法规的要求。
治理的目标是通过建立对问责制、责任和监督的要求,来提供值得信赖的AI。治理能带来诸多益处,以下是其主要优势:
-
信任:当AI活动与价值观保持一致时,组织可以构建透明、公平且值得信赖的系统,从而提升客户满意度和品牌声誉。
-
效率:当AI活动实现标准化和优化后,开发过程可以更高效地进行,从而加速产品上市时间。
-
合规:当AI活动已得到管理和监控时,调整它们以符合新的及即将出台的行业法规和法律要求就会变得不那么繁琐。
一个成功的治理计划需要综合考虑人员、流程和工具。它明确定义了人员在构建和管理可信AI中的角色和职责,包括制定政策和建立问责制的领导者。它建立了用于构建、管理、监控和沟通AI的流程,并利用工具在整个AI生命周期中获得对AI系统性能更高的可见性和一致性。
理解ESG框架 🌱
了解了AI治理后,我们进一步探讨一个更广泛的框架——ESG。ESG代表环境(Environmental)、社会(Social)和治理(Governance),这些是用于衡量公司所有非财务风险和机遇的因素。
在IBM,这体现为“IBM影响力”(IBM Impact),即我们在ESG方面的战略和理念。IBM影响力由三大支柱构成,我们相信这些支柱将创造一个更可持续的未来:
-
环境影响:致力于对环境产生积极影响。
-
公平影响:致力于推动社会公平。
-
道德影响:致力于坚持高标准的商业道德。
我们通过在世界、商业道德、环境以及我们工作和生活的社区中产生持久积极的影响来实现这些目标。
治理、ESG与AI伦理的联系 ⛓️
现在,我们已经分别了解了治理和ESG,本节我们将探讨它们如何与AI伦理相互关联。ESG中的治理方面涉及创建优先考虑道德、信任、透明,尤其是问责制的创新、政策和实践。
AI伦理是我们治理计划的重要组成部分。例如,在2022年,我们的目标是让1000个生态系统合作伙伴接受科技伦理培训。这个目标很重要,因为我们相信AI的益处应该惠及大众,而不仅仅是少数人,并且培养可信AI的文化必须无处不在,而不仅仅是在IBM内部。
我们正引领AI伦理的发展,致力于创造一个更加合乎道德的未来。
总结 📝
本节课中,我们一起学习了AI治理的核心定义及其在确保AI系统负责任运行中的关键作用。我们探讨了ESG框架的三大支柱及其对可持续未来的贡献。最后,我们明确了治理、ESG与AI伦理之间的深刻联系,认识到通过建立强有力的治理和伦理框架,是推动AI技术向善、实现广泛社会价值的基础。
026:AI的演变与未来 🚀
在本节课中,我们将探讨人工智能的发展历程、关键突破以及未来方向。我们将了解AI如何从解决规则明确的游戏问题,演进到处理现实世界中复杂、非结构化的挑战,特别是在医疗等关键领域的应用。
早期的AI研究者对游戏非常感兴趣。游戏虽然规则简单,但可能性极其复杂,存在大量的走位与得分可能。然而,游戏在某种程度上又是简单的,因为其移动规则和目标定义明确,因此无需一次性解决所有问题。
在IBM“深蓝”的国际象棋项目中,计算机展现出的能力是:利用巨大的计算资源进行更深度的搜索,探索比以往更多的棋步可能性。
上一节我们看到了AI在规则明确问题上的突破,本节中我们来看看AI在理解与推理上的跨越。
“沃森”在智力竞赛节目《危险边缘》中获胜,这是AI和认知计算发展史上的另一个交叉点。IBM能够回答的《危险边缘》问题,并非简单地从数据库中查找答案。
相反,它需要从大量不同的信息资源中进行信息检索,然后利用机器学习将这些信息结合起来,得出超越简单文本记录的答案。
如今,我们的技术已经更加先进,足以应对更具挑战性的问题,这些问题通常具有定义不明确或杂乱无章的特性。
从石油天然气到医疗保健,从媒体娱乐到零售,每个行业都正被非结构化数据的海啸所淹没。这些数据可能是多媒体、图像、视频或文本。
核心能力在于理解这些数据,这正变得至关重要。
认知计算最有价值的应用领域之一是在医疗健康领域。医疗服务提供者,如医生、护士和助理,面临着巨大的挑战:如何利用所有可用的信息。
以下是医疗领域面临的数据挑战:
-
医学文献每年增加约70万篇文章,现有文献已达数百万篇。
-
现代影像技术产生非常丰富的信息,一次特定的扫描可能包含5000张图像。
将图像分析与自然语言理解和文本分析相结合,利用医学文献和患者的病史,医生就能掌握更多的信息和知识,帮助他们做出尽可能准确的诊断。
显然,计算机的能力与人的能力在此交汇,产生了超越两者单独作用的效果。真正有趣的是,如何找到最佳方式,让它们实现真正的共生式互动,利用彼此的优势共同解决问题。
“沃森”探索了智能的另一个方面,也是更困难的方面——语言。它必须能够解读问题并得出正确答案,无论话题是什么。
因此,我认为现代世界中AI的理想场景,不是试图开发一个能完全自主处理问题所有方面的系统。
理想模式是:机器做它们最擅长的事,人做他们最擅长的事,双方协作。
我可以想象,这种组合的效果将优于任何一方单独行动。
我们始终在寻找下一个可以攻克的重大挑战性问题。它可能近在咫尺,也可能还需一年,但这需要多方共同努力。当我们成功时,我们将为世界创造有价值的东西。
本节课总结:我们一起回顾了AI从解决棋盘游戏到理解自然语言和复杂数据的演变过程。我们看到了“深蓝”和“沃森”等里程碑,并探讨了AI,特别是认知计算,在医疗等关键领域处理非结构化数据的巨大潜力。最后,我们明确了AI未来的发展方向并非完全取代人类,而是实现人机协作,各自发挥优势,共同解决更复杂的现实世界问题。
028:AI梯度——成功采用AI的旅程 🧗
在本节课中,我们将学习企业如何通过一个被称为“AI梯度”的规范性步骤,将采用人工智能的愿望转化为实际成果。我们将探讨从数据现代化到AI全面融合的完整旅程。
在剧烈的数字化转型世界中,企业正寻求人工智能来帮助塑造工作的未来。
人工智能可以预测并告知未来的结果,它使人们能够在企业中从事更高价值的工作,并构想新的商业模式。
它可以自动化决策、流程和体验,但人工智能并非魔法。
事实是,没有信息架构,就没有人工智能。
但许多组织无法开始,因为他们80%的数据被锁在孤岛中,且未达到业务就绪状态。
那么,如何将抱负转化为成果呢?
通过一套我们称之为“AI梯度”的规范性步骤。
它始于在可运行于任何云端的单一平台上,将所有数据现代化。
在梯度本身,包含四个步骤。
以下是实现AI价值的四个核心步骤:
-
收集数据,使其变得简单且易于访问。认真思考需要训练的模型。
-
组织数据,为那些AI模型创建一个业务就绪的分析基础。
-
分析数据,同时确保信任和透明度。因为如果无法解释结果、检测偏见或证明其准确性,应用和扩展人工智能就毫无用处。
-
融合。一旦真正信任你的数据和部署的AI,就可以在控制日常工作的应用程序和流程中实现其全部价值。换句话说,最后一步是融合。
或者可以说,你开始在整个业务中实现人工智能的运营化。
我们通过在这个AI和多云世界中释放其数据的价值,帮助成千上万的企业让人工智能发挥作用。
通过为员工提供合适的技能组合。
并通过在人工智能中建立信任和透明度。
这就是AI梯度的概要,让我们开始攀登吧。
本节课中,我们一起学习了“AI梯度”框架。该框架为企业成功采用人工智能提供了一个清晰的路径:首先在统一平台上实现数据现代化,然后依次完成收集、组织、分析和融合四个步骤。这个过程强调以可信的数据为基础,最终将AI价值全面注入业务流程。
030:AI创新热点 🌍
在本节课中,我们将了解全球人工智能(AI)创新与机会的主要热点城市与地区。课程内容基于对当前AI领域机会分布的观察与分析。
根据我近期对AI顶尖城市的调研(主要通过分析我收件箱中的机会信息),AI机会实际上分布相当广泛。许多不同地区都存在大量机会。
以下是当前AI创新与机会较为集中的主要地区:
-
美国旧金山湾区:这里持续是AI与机器人领域初创企业的温床,预计将继续发展。
-
美国波士顿:同样拥有大量初创企业。
-
美国西雅图:也是重要的AI中心之一。
上一节我们介绍了美国的主要AI热点,本节中我们来看看加拿大的发展情况。
在加拿大,多伦多和蒙特利尔在建设强大且繁荣的AI生态系统方面取得了显著成就。这个生态系统预计将继续发展和壮大,令人感到兴奋。
此外,在欧洲和亚洲的许多地区也存在机会。中国和印度当然也拥有一些机会。
总的来说,如果你身处这些地区中任何一处的主要城市中心附近,那么你便具备了开启AI职业生涯的有利条件。
多伦多的AI领域正在迅猛发展。能够见证并参与其中令人惊叹。我们拥有杰弗里·辛顿(Geoffrey Hinton)——他显然是因对深度学习的重大贡献而获得图灵奖的三位奠基人之一。围绕多伦多大学过去几十年取得的卓越进展,整个向量研究所(Vector Institute)及其生态系统已经建立起来。
因此,我们在该地区看到了优秀的孵化器和初创企业。它们正大力投资于AI技术与能力。我们看到大型公司在此设立研究实验室,并将其直接安置在大学附近。我们还看到,专门针对多伦多AI研究的大量资金正在涌入。
我认为,多伦多在与全球任何最佳AI学习和工作地点的竞争中都具有优势。
我认为加拿大实际上表现非常出色。总体而言,我们在集中一些真正杰出的AI人才方面做得非常出色。
以下是加拿大主要的AI中心:
-
多伦多与蒙特利尔:这两个城市尤为突出。
-
温哥华、埃德蒙顿等加拿大多个不同城市也已发展成为非常强大的AI中心,并且持续增长。
我们正在吸引大量优秀的AI人才。我相信这一趋势将持续下去。因此,加拿大正逐渐成为进行AI研究和从事AI工作的绝佳之地。
本节课中,我们一起学习了全球AI创新热点分布。主要内容包括:美国(如旧金山湾区、波士顿、西雅图)和加拿大(如多伦多、蒙特利尔)是当前的核心区域,欧洲与亚洲(如中国、印度)也存在发展机会。多伦多凭借其顶尖人才、研究机构与资金投入,已成为全球竞争力的AI中心之一。加拿大整体在汇聚AI人才与构建生态系统方面表现突出,是AI研究与工作的理想地点之一。
033:生成式AI专业化简介 🚀
在本节课中,我们将一起了解生成式AI专业化的整体概览。我们将探讨生成式AI的广泛应用、市场前景,并详细介绍一个由五门课程组成的专业化学习路径。通过本课程,你将了解如何从零开始,系统地掌握生成式AI的核心概念、工具和应用,为你的职业发展赋能。
你是否知道,全球的营销人员已经在使用生成式AI来创作内容、撰写文案、激发创意、分析市场数据以及生成图像?
根据彭博社的预测,生成式AI市场预计到2032年将达到1.3万亿美元。
在这种情况下,你肯定希望更好地了解生成式AI。
那么,生成式AI适合所有人吗?是的,它适合。
你可以利用它的潜力,为自己创造更好的职业和生活。
这个专业化课程适合任何对探索生成式AI力量充满热情的人,不需要具备先前的AI技术知识或背景。
即使是初学者也能从这个专业化中受益,因为它提供了对生成式AI基本概念、模型、工具和应用的全面理解。
在本专业化课程结束时,你将能够:
-
解释生成式AI的基本概念、能力、模型、工具、应用和平台。
-
描述基础模型和提示工程,并应用强大的提示工程技术来编写有效的提示,从而从AI模型中生成期望的结果。
-
讨论生成式AI的局限性,并解释其伦理关切和负责任使用的考量。
-
认识到生成式AI在提升你职业生涯和帮助你在工作场所实施改进方面的能力。
该专业化包含五门自定进度的核心课程,每门课程需要3到5小时完成。
课程一:生成式AI导论与应用 🌐
上一节我们概述了整个专业化,本节中我们来看看第一门课程的具体内容。
课程一是你理解生成式AI能力的第一步,其能力涵盖文本、图像、音频、视频、虚拟世界、代码和数据等多个领域。
你将了解不同行业和领域如何应用常见的生成式AI模型和工具,例如:
-
GPT
-
DALL-E
-
Stable Diffusion
-
IBM Granite
-
Synthesia
课程二:提示工程的艺术与科学 🛠️
在了解了生成式AI的广泛应用后,本节我们将深入探讨与之交互的关键技能。
课程二介绍了提示工程的概念,以及它如何帮助你释放像ChatGPT这样的生成式AI工具的全部潜力。
你将探索开发有效提示的技术、方法和最佳实践,并学习使用常用工具,例如:
-
IBM Watsonx.ai
-
PromptLayer
-
Spellbook
-
Dust
课程三:生成式AI的核心概念与平台 🧠
掌握了提示工程后,我们需要理解这些强大工具背后的原理。
课程三专注于生成式AI的核心概念和构建模块,例如:
-
深度学习
-
基于Transformer架构的大语言模型
-
扩散模型
-
基础模型
你还将了解不同的生成式AI平台,如IBM Watsonx.ai和Hugging Face。
课程四:生成式AI的伦理与局限 ⚖️
理解了技术原理,我们必须同时关注其带来的影响和挑战。
在课程四中,你将探讨与生成式AI相关的伦理考量。
它将如何影响数据隐私和安全、版权侵权、劳动力以及环境?
你还将描述其局限性,例如:
-
数据偏见
-
缺乏可解释性、透明度和可理解性
并识别生成式AI的常见滥用,例如深度伪造和幻觉输出。
课程五:生成式AI的未来与你 🚀
探讨了伦理挑战后,让我们展望未来,看看它如何塑造你的职业道路。
最后,课程五讨论了生成式AI的未来。你难道不想知道在那个未来里,你的职业机会是什么吗?
你将学习生成式AI如何影响和增强不同行业和领域的现有职能、技能和工作角色。
以及你如何能使用生成式AI来构建自己的应用程序,以创造新的商业机会。
学习方式与收获 📈
本专业化课程的内容旨在吸引并赋能你。
通过观看精选的概念视频、聆听AI专家分享他们的见解和技巧,以及在实践实验室和项目中练习技术,你将在日常生活中使用生成式AI工具和应用程序时感到更加自信。
目前,65%的生成式AI用户是千禧一代或Z世代,72%是在职人士。
通过这个专业化学习,你将准备好加入生成式AI变革者的行列。
生成式AI属于每个人。
本节课总结
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)