强化学习是否言过其实?
译者 | 李睿
审校 | 孙淑娟
可以想象一下,你正准备和朋友一起下国际象棋,但他并不是人类,而是一个不了解游戏规则的计算机程序。但这个应用程序却明白自己致力实现一个目标,就是在游戏中获胜。
因为计算机程序不知道规则,所以开始下棋的招数是随机的。其中有些招数完全没有意义,而对你来说获胜很容易。在这里假设你非常喜欢和这个朋友下国际象棋,以至于沉迷于这个游戏。
但计算机程序最终会获胜,因为它会逐渐学会击败你的方法和招数。虽然假设的这个场景看起来有些牵强,但它应该能让你对强化学习(机器学习的一个领域)的大致工作原理有一个基本的了解。
强化学习到底有多智能?
人类智力包含许多特征,包括获得知识、扩展智力能力的愿望和直觉思维。当国际象棋冠军加里·卡斯帕罗夫在输给IBM公司的一台名为“深蓝”(Deep Blue)的电脑时,人类的智能受到了很大的质疑。除了吸引公众的注意力之外,描绘机器人在未来统治人类的世界末日场景也占据了主流意识。
然而,“深蓝”并不是一个普通的对手。与这个计算程序下棋就像与一个千岁的老人进行比赛,而他一生一直在不停地下国际象棋。但“深蓝”擅长玩一种特定的游戏,而不是其他智力活动,如演奏乐器、撰写著作、进行科学实验、抚养子女或修理汽车。
这绝不是想贬低“深蓝”所取得的成就。与其相反,计算机在智力能力上超越人类的想法需要仔细的检验,首先要分析强化学习的工作机制。
强化学习是如何工作的
如上所述,强化学习是机器学习的一个子集,它涉及智能代理在环境中如何行动以最大化累积奖励的概念。
简单地说,强化学习机器人接受奖惩机制的训练,它们做出正确的动作会得到奖励,做出错误的动作会受到惩罚。强化学习机器人不会“思考”如何采取更好的行动,它们只是让所有的行动成为可能,以最大限度地提高成功的机会。
强化学习的缺点
强化学习的主要缺点是它需要采用大量的资源来实现它的目标。强化学习在围棋游戏中的成功就说明了这一点。这是一款流行的双人游戏,其目标是使用棋子在棋盘上占据最大区域,同时避免丢子。
AlphaGo Master是一款在围棋比赛中击败人类棋手的计算机程序,它耗费大量的资金和人力,其中包括许多工程师,非常丰富的游戏经验以及256个GPU和128000个CPU。
在学习如何在比赛获胜的过程中,需要投入大量的资源和精力。这就引出了一个问题:设计不能凭直觉思考的人工智能是否合理?人工智能研究不是应该尝试模仿人类智能吗?
支持强化学习的一个论点是,人们不应该期望人工智能系统像人类一样行动,它用于解决复杂问题需要进一步发展。另一方面,反对强化学习的观点是,人工智能研究应该专注于让机器做目前只有人类和动物才有能力做的事情。从这个角度来看,人工智能与人类智能的比较是恰当的。
量子强化学习
强化学习是一个新兴的领域,据说可以解决上述的一些问题。量子强化学习(QRL)是一种加速计算的方法。
首先,量子强化学习(QRL)应该通过优化探索(发现策略)和开发(选择最佳策略)阶段来加速学习。目前的一些应用和提出的量子计算改进了数据库搜索,将大数分解为质数,等等。
尽管量子强化学习(QRL)还没有以突破性的方式出现,但它有望解决常规强化学习的一些重大挑战。
强化学习的业务案例
正如以上提到的,强化学习研究和开发至关重要。以下是来自麦肯锡公司的一份调查报告中的有关强化学习的一些实际应用示例,强化学习可以:
- 优化半导体和芯片设计,优化制造工艺,提高半导体行业的产量。
- 提高工厂产量,优化物流以减少浪费和成本,提高农业利润。
- 缩短航空航天和国防工业新系统的上市时间。
- 优化设计流程,提高汽车行业的生产效率。
- 通过实时交易和定价策略增加收入,改善客户体验,并在金融服务中为客户提供先进的个性化服务。
- 优化矿山设计,管理发电,应用整体物流调度,优化作业,降低成本,提高产量。
- 通过实时监测和精确钻井提高产量,优化油轮行进路线,实现预测性维护,防止油气行业的设备故障。
- 促进药物发现,优化研究流程,自动化生产和优化制药行业的生物方法。
- 优化供应链,实施先进的库存建模,为零售部门的客户提供先进的个性化服务。
- 优化和管理网络,在电信行业应用客户个性化。
- 优化运输物流的路线、网络规划、仓库操作。
- 使用下一代代理从网站提取数据。
强化学习的反思
强化学习的能力可能是有限的,但它不会被高估。此外,随着强化学习研究和开发项目的增加,几乎每个经济部门的潜在用例也在增加。
大规模采用强化学习依赖于几个因素,其中包括优化算法设计、配置学习环境和计算能力的可用性。
原文标题:Is reinforcement learning overhyped?,作者:Aleksandras Šulženko
以上是强化学习是否言过其实?的详细内容。更多信息请关注PHP中文网其他相关文章!

热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

AI Hentai Generator
免费生成ai无尽的。

热门文章

热工具

记事本++7.3.1
好用且免费的代码编辑器

SublimeText3汉化版
中文版,非常好用

禅工作室 13.0.1
功能强大的PHP集成开发环境

Dreamweaver CS6
视觉化网页开发工具

SublimeText3 Mac版
神级代码编辑软件(SublimeText3)

热门话题

图像标注是将标签或描述性信息与图像相关联的过程,以赋予图像内容更深层次的含义和解释。这一过程对于机器学习至关重要,它有助于训练视觉模型以更准确地识别图像中的各个元素。通过为图像添加标注,使得计算机能够理解图像背后的语义和上下文,从而提高对图像内容的理解和分析能力。图像标注的应用范围广泛,涵盖了许多领域,如计算机视觉、自然语言处理和图视觉模型具有广泛的应用领域,例如,辅助车辆识别道路上的障碍物,帮助疾病的检测和诊断通过医学图像识别。本文主要推荐一些较好的开源免费的图像标注工具。1.Makesens

在机器学习和数据科学领域,模型的可解释性一直是研究者和实践者关注的焦点。随着深度学习和集成方法等复杂模型的广泛应用,理解模型的决策过程变得尤为重要。可解释人工智能(ExplainableAI|XAI)通过提高模型的透明度,帮助建立对机器学习模型的信任和信心。提高模型的透明度可以通过多种复杂模型的广泛应用等方法来实现,以及用于解释模型的决策过程。这些方法包括特征重要性分析、模型预测区间估计、局部可解释性算法等。特征重要性分析可以通过评估模型对输入特征的影响程度来解释模型的决策过程。模型预测区间估计

通俗来说,机器学习模型是一种数学函数,它能够将输入数据映射到预测输出。更具体地说,机器学习模型就是一种通过学习训练数据,来调整模型参数,以最小化预测输出与真实标签之间的误差的数学函数。在机器学习中存在多种模型,例如逻辑回归模型、决策树模型、支持向量机模型等,每一种模型都有其适用的数据类型和问题类型。同时,不同模型之间存在着许多共性,或者说有一条隐藏的模型演化的路径。将联结主义的感知机为例,通过增加感知机的隐藏层数量,我们可以将其转化为深度神经网络。而对感知机加入核函数的话就可以转化为SVM。这一

本文将介绍如何通过学习曲线来有效识别机器学习模型中的过拟合和欠拟合。欠拟合和过拟合1、过拟合如果一个模型对数据进行了过度训练,以至于它从中学习了噪声,那么这个模型就被称为过拟合。过拟合模型非常完美地学习了每一个例子,所以它会错误地分类一个看不见的/新的例子。对于一个过拟合的模型,我们会得到一个完美/接近完美的训练集分数和一个糟糕的验证集/测试分数。略有修改:"过拟合的原因:用一个复杂的模型来解决一个简单的问题,从数据中提取噪声。因为小数据集作为训练集可能无法代表所有数据的正确表示。"2、欠拟合如

20世纪50年代,人工智能(AI)诞生。当时研究人员发现机器可以执行类似人类的任务,例如思考。后来,在20世纪60年代,美国国防部资助了人工智能,并建立了实验室进行进一步开发。研究人员发现人工智能在许多领域都有用武之地,例如太空探索和极端环境中的生存。太空探索是对宇宙的研究,宇宙涵盖了地球以外的整个宇宙空间。太空被归类为极端环境,因为它的条件与地球不同。要在太空中生存,必须考虑许多因素,并采取预防措施。科学家和研究人员认为,探索太空并了解一切事物的现状有助于理解宇宙的运作方式,并为潜在的环境危机

C++中机器学习算法面临的常见挑战包括内存管理、多线程、性能优化和可维护性。解决方案包括使用智能指针、现代线程库、SIMD指令和第三方库,并遵循代码风格指南和使用自动化工具。实践案例展示了如何利用Eigen库实现线性回归算法,有效地管理内存和使用高性能矩阵操作。

译者|李睿审校|重楼人工智能(AI)和机器学习(ML)模型如今变得越来越复杂,这些模型产生的输出是黑盒——无法向利益相关方解释。可解释性人工智能(XAI)致力于通过让利益相关方理解这些模型的工作方式来解决这一问题,确保他们理解这些模型实际上是如何做出决策的,并确保人工智能系统中的透明度、信任度和问责制来解决这个问题。本文探讨了各种可解释性人工智能(XAI)技术,以阐明它们的基本原理。可解释性人工智能至关重要的几个原因信任度和透明度:为了让人工智能系统被广泛接受和信任,用户需要了解决策是如何做出的

机器学习是人工智能的重要分支,它赋予计算机从数据中学习的能力,并能够在无需明确编程的情况下改进自身能力。机器学习在各个领域都有着广泛的应用,从图像识别和自然语言处理到推荐系统和欺诈检测,它正在改变我们的生活方式。机器学习领域存在着多种不同的方法和理论,其中最具影响力的五种方法被称为“机器学习五大派”。这五大派分别为符号派、联结派、进化派、贝叶斯派和类推学派。1.符号学派符号学(Symbolism),又称为符号主义,强调利用符号进行逻辑推理和表达知识。该学派认为学习是一种逆向演绎的过程,通过已有的
