本文将多智能体强化学习与模糊逻辑相结合,应用于电梯群控。该方法将电梯建模为离散事件系统,并为每个轿厢分配一个独立的智能体,这些智能体共享一个与乘客等待时间相关的带噪声的奖励信号。采用具有可变折扣的时变离散事件Q学习模型来处理连续的事件间隔,同时用模糊推理代替数值Q估计器来处理不确定性。本文比较了两种训练范式:一种是基于全知仿真的评价器,另一种是使用呼叫数据和到达率估计的实用在线方案。对探索过程进行精细的退火处理至关重要。仿真结果表明,平均等待时间和平方等待时间均有所降低,证明模糊增强的多智能体强化学习在随机、大规模电梯交通控制方面优于传统控制器。
解决复杂、大规模问题的解决方案
作者:梅萨姆·塔勒比
关键词: 强化学习、电梯群控、模糊控制、专门学习、逆向学习、高速电梯。
抽象
强化学习 (RL) 算法及其理论基础的最新进展激发了计算智能界的浓厚兴趣。RL 算法利用动态规划的迭代近似,能够通过经验和模拟交互获取知识。通过在控制操作期间优先分配状态空间中频繁访问区域的计算资源,这些算法有助于解决复杂的大规模问题。当应用于多智能体框架中时,每个智能体都采用此类算法,从而形成一种合作学习范式,使整个团队受益。本研究证明了集体 RL 算法在解决复杂控制问题方面的有效性。电梯群控被用作实验平台,提出了一系列在多智能体学习研究中通常不会遇到的独特挑战。本研究实现了一组 RL 智能体,每个智能体负责管理一台电梯。这些智能体接收共享的奖励信号,由于智能体动作的相互依赖性、乘客到达的固有随机性以及状态可观测性的局限性,该信号被感知为噪声信号。为了增强 Q 学习过程在这种动态环境中的鲁棒性,我们集成了一个模糊逻辑模型来计算 Q 值,使智能体能够处理不确定性并做出更明智的决策。尽管存在这些复杂性,但仿真结果表明其性能优于现有的最先进电梯控制方法。这些发现凸显了多智能体强化学习在解决实际应用中的大规模随机动态优化问题方面的潜力。
介绍
公众普遍存在一种误解,认为人工智能 (AI) 就是毫无感情的机器,其设计初衷仅仅是实现任务自动化和取代人类劳动。这种认知主要源于科幻小说的描述,与人工智能的现实存在很大偏差。本质上,人工智能是指模拟认知功能的技术。虽然这些模拟旨在复制人类的思维过程,但它们之间存在着根本性的差异。尽管人工智能概念的全面实现仍需持续追求,但它对日常生活的广泛影响毋庸置疑。许多日常活动,例如互联网搜索和社交媒体互动,都与人工智能有着内在的联系,尽管人们往往没有意识到。这种无意识的参与凸显了公众对人工智能的本质和能力理解上的差距。鉴于人工智能在未来技术格局中预计将占据重要地位,积极主动地从“担忧”转向“理解”至关重要。这需要我们关注人工智能的潜在应用,并扩展我们的知识库。因此,至关重要的第一步是明确人工智能的基本定义。 [14 17].
人工智能的定义:
人工智能 (AI) 是计算机科学的一个分支,致力于创造能够执行传统上需要人类智能才能完成的任务的智能机器。本质上,AI 1 涉及在计算机系统中模拟人类的认知能力,旨在开发能够模拟人类思维过程和行为的机器。这一定义涵盖任何设计为类似人类思维运作、具有解决问题和学习能力的机器。 [14,16,17].
人工智能的目标:
人工智能的根本目标是以有利于机器执行和准确完成任务的方式描述人类智能及其运行机制。人工智能的核心原则植根于学习、推理和感知。人工智能是计算机科学中一门广泛的学科,专注于构建能够执行通常需要人类认知能力的任务的智能机器。人工智能是一门采用多种方法的跨学科科学,机器学习和深度学习的进步催化了整个技术行业的范式转变。 [13,14,16].
人工智能的历史:
人工智能的起源可以追溯到第二次世界大战时期,当时德军使用恩尼格玛密码机进行安全信息加密。为此,英国科学家艾伦·图灵致力于破译这些密码。图灵和他的团队开发了炸弹机(Bombe),成功解密了恩尼格玛密码。恩尼格玛密码机和炸弹机都为机器学习(人工智能的一个分支)奠定了基础。图灵假设智能机器应该能够进行不暴露其非人类本质的交流,从而为人工智能奠定了基础——创造能够复制人类思维、决策和行动的机器。技术和硬件的进步促进了融合人工智能的智能工具和服务的发展。搜索引擎、卫星和其他技术的普及体现了人工智能与各种流程的融合。智能手机和智能设备的出现进一步推动了人工智能融入人类日常生活,增强了其实际意义,并提高了公众对其应用的认识。 [15,16,17].
人工智能与编程:
在传统编程中,我们利用定义的输入并使用条件语句(例如 if 和 else)来求解方程式并实现预期结果。然而,人工智能 (AI) 所解决的问题涉及各种各样的输入,这使得传统的编程方法显得力不从心。例如,语音转文本或面部识别系统,其输入数据变化很大,因此需要利用 AI 模型。 [13].
人工智能的分支:
- 人工智能涵盖广泛的学科,包括:
- 专家系统
- 机器人技术
- 机器学习
- 神经网络
- 模糊逻辑
- 自然语言处理
人工智能的水平:
- 人工智能系统根据其对外界环境的感知和响应能力分为三个级别:有限人工智能、通用人工智能和超级人工智能。
- 有限的人工智能:
- 有限的人工智能系统在特定任务方面表现出色,例如国际象棋游戏、商业决策和语音到文本的转换。
- 通用人工智能:
- 目前,通用人工智能还处于理论阶段,旨在复制人类的认知能力。
- 超级人工智能:
- 超越人类智能的超级人工智能仍然是一个假设概念。
- 有限的人工智能:
人工智能如何学习:
- 人工智能系统通过机器学习和深度学习进行学习。
- 机器学习:
- 机器学习使系统无需明确编程即可从数据中学习。
- 深度学习:
- 深度学习是机器学习的一个子集,它通过神经网络模拟人类大脑的过程。
- 机器学习:
人工智能系统的分类:
- 人工智能系统分为四类:
- 反应机
- 记忆有限
- 心理理论
- 自我意识
人工智能在电梯行业的应用:
- 电梯中的AI应用包括:
- 电梯群控
- 预测性维护
- 增强的用户体验 [2,3,4].
强化学习简介:
机器学习研究主要集中在监督学习上,其中“老师”以输入-输出对的形式提供带标签的训练样本。监督学习算法适用于各种问题,包括模式分类和函数逼近。然而,许多现实世界场景涉及昂贵或难以获得的带标签训练数据。强化学习 (RL) 通过利用来自“评判者”的训练信息来应对这些挑战,该评判者对所选输出进行标量评估,而不是指定最优输出或修改方向。强化学习引入了探索的额外复杂性,这涉及确定给定输入的最优输出 [5].
强化学习任务的类型:
区分两种类型的强化学习任务是有益的:情景式(非连续)和持续式(连续)。在情景式任务中,代理学习从情境到动作的映射,以最大化预期的即时奖励。在持续式任务中,代理学习最大化预期的长期奖励的映射。持续式任务通常更具挑战性,因为代理的动作会影响未来的情境和奖励。在这些任务中,代理会与其环境进行长时间交互,并且必须根据长期后果来评估决策。 [5].
强化学习与最优控制:
从控制理论的角度来看,强化学习 (RL) 算法提供了近似随机最优控制问题最优解的方法。智能体充当控制器,环境充当待控系统。目标是随时间推移最大化特定的性能标准。了解环境的状态转移概率和奖励结构后,可以使用动态规划 (DP) 算法来解决这些问题。然而,DP 的计算复杂性使其不适用于具有大量状态的问题。最近的强化学习 (RL) 算法旨在逐步执行 DP,从而无需事先了解状态转移概率和奖励结构。在线学习将计算集中在状态空间中经常访问的区域。因此,将强化学习与适当的函数逼近方法相结合,可以为大规模随机最优控制问题提供计算上可行的近似解方法。
使用模拟在线学习可以实现同样的专注现象。模拟模型通常无需明确推导状态转换概率和奖励结构即可构建。利用精确的模拟模型具有诸多优势,例如可以生成大量模拟经验,并可能加速学习过程。此外,学习过程中无需担心模拟系统的性能水平。模拟在线强化学习的一个成功案例是TD-Gammon系统,它学会了大师级的西洋双陆棋游戏。 [1,5].
多智能体强化学习:
多智能体强化学习的研究可以追溯到俄罗斯数学家 Tsetlin 的工作。目前,针对情景强化学习任务已经取得了一些理论成果。某些类型的学习自动机在重复的零和博弈和非零和博弈中会收敛到一个均衡点。然而,在更普遍的非零和博弈中,均衡点通常会给所有参与者带来较低的回报。一个显著的例子是囚徒困境,其中唯一的均衡点会导致最低的总回报。 [1 7].
电梯群控简介:
本节介绍电梯群控问题,作为我们多智能体强化学习的测试平台。虽然任何使用过电梯系统的人都熟悉这个问题,但它尽管概念简单,却面临着巨大的挑战。电梯群控的最优策略仍然难以捉摸,因此需要使用现有的控制算法作为基准。电梯领域提供了一个机会,可以比较并行和分布式控制架构(其中每个智能体控制一个电梯轿厢),并监控智能体在信息量减少的情况下性能下降的情况。 [1 5].
电梯群控系统示意图:
图 1 给出了电梯系统的示意图(Lewis,1991)。电梯轿厢被描绘成实心方块。“+”符号表示乘客从井道两侧的楼层进入轿厢的请求,“-”符号表示乘客离开轿厢前往特定楼层的请求。左侧井道代表向上移动的轿厢和请求,右侧井道代表向下移动的轿厢和请求。因此,轿厢绕井道顺时针循环运行。本研究考察了乘客到达模式、电梯控制策略以及具体的模拟电梯系统。 [1].
算法和网络架构:
本节介绍多为电梯群控实现的智能体强化学习 (MARL) 算法。每个智能体负责控制一个电梯轿厢。每个智能体的环境奖励结构基于乘客等待时间定义,重点是最小化平均等待时间。每个智能体都采用针对离散事件系统的改进版 Q 学习 (Watkins, 1989)。它们共同实现了一种集体强化学习 [1].
强化学习中的离散事件考虑:
电梯系统可以建模为离散事件系统,其中重要事件(例如乘客到达)发生在离散时间,但事件之间的时间间隔是实值变量。在此类系统中,大多数离散时间强化学习算法中使用的固定折扣因子 γ 不足以解决这个问题。可以使用取决于事件时间间隔的可变折扣因子来解决。在这种情况下,运行成本定义为积分而不是离散和,如下所示:
离散时间事件转换为连续时间(1)
在上面的公式中,我们有:
Ct:离散时间 t 的直接成本,
CT:连续时间的瞬时成本,
T:所有等待乘客的等待时间平方和,
β:指数衰减率控制器(β=0.01),
10^6:用于防止成本值过高直至达到阈值的比例因子。
瞬时成本CT 表示乘客在连续时间内等待时间所引起的不满情绪。为了避免数值过大,我们将其缩小了 10^6 倍。电梯系统事件在连续时间内随机发生,所需参数实际上是无限的,这导致预测算法的复杂性。因此,我们使用离散事件版本的 Q 学习算法,因为它只考虑系统的实际事件,不需要明确了解状态转移概率。Bradtke & Duff (1995) 将 Watkins (1989) 的 Q 学习更新规则扩展为以下离散事件形式。
(2)
“其中动作‘a’是在时间‘t’从状态‘x’采取的x',即状态 'y' 在时间 't' 做出的后续决策y' 是必需的。其中,α 表示步长参数,CT 、β 的定义如上所述。e^(-β(ty-tx)) 充当折扣因子,取决于事件之间的时间间隔。Bradford 和 Retch (1995) 考虑了这样一种情景:CT 在事件之间保持不变。我们将其公式扩展到 CT 是二次函数,因为目标是最小化平方等待时间。因此,Q学习更新规则中的积分采用以下形式:
(3)
“其中ωp 表示每位乘客 p 从时间 t 开始等待的时间x 到时间 ty (必须特别注意在 t 之间开始或结束等待的任何乘客x 和Ty )。通过解上面的积分,我们将得到:“
(4)
这一公式的实际实施面临挑战,因为需要全面了解所有等待乘客的等待时间。然而,在现实世界的电梯系统中,只有按下了门厅呼叫按钮的乘客的等待时间才容易获取。未来乘客的到达时间和后续等待时间仍然未知。为了解决这一局限性,我们研究了两种不同的方法论:“全知”和“在线”强化学习范式。
模拟环境的设计使其拥有所有乘客等待时间的完整信息,从而能够生成必要的强化信号。这种方法被称为“全知强化方案”,它依赖于实际运行的电梯系统中固有的不可获取的数据。需要强调的是,这些补充信息仅由评估组件(“评估器”)使用,而非控制机制本身。因此,在模拟环境中使用此全知方案训练的控制器无需访问任何其他数据,即可部署到实际环境中。
或者,“在线强化方案”则促进了基于操作系统内实时获取数据的学习。该方法假设每个队列中第一位乘客的等待时间与按下按钮的时长相对应。如果每个队列的泊松到达率(记为λ)已知或可以可靠估计,则可以使用伽马分布推断后续乘客的到达时间。第n位后续乘客到达的时间服从伽马分布Γ(n, 1/λ)。对于每个队列,在大厅按钮按下后的最初“b”秒内,后续乘客到达所产生的预期成本可以确定如下:
(5)这个积分也可以通过分部积分来计算预期成本函数,这种方法在本讨论中没有使用 [1,8,9].
集体离散事件 Q 学习
在电梯系统中,事件可以分为两大类。第一类事件对计算等待时间至关重要,这些事件在确定强化学习 (RL) 算法所使用的强化信号方面起着关键作用。这些事件包括全知场景中的乘客到达和进出电梯轿厢,以及在线场景中的厅门按钮激活。第二类事件包括轿厢到达事件,这些事件代表了负责控制每个电梯轿厢的 RL 智能体的潜在决策节点。当轿厢在楼层之间移动时,它会在到达必须决定是停在还是绕过下一楼层的点时生成轿厢到达事件。在某些情况下,电梯轿厢会被限制执行特定操作,例如停在下一楼层以方便乘客下楼。只有当智能体拥有不受约束的操作选择时,它才会遇到决策点。 [11 12].
全知强化计算
在全知强化方案的框架下,累积成本会在每次乘客到达事件(乘客加入队列时)、乘客换乘事件(乘客上下电梯时)以及轿厢到达事件(执行控制决策时)之后进行增量更新。这些增量更新提供了一种实用的方法来管理乘客在轿厢决策之间开始或结束等待期时出现的成本不连续性,例如当替代轿厢为等待的乘客提供服务时。
所有电梯轿厢在连续事件之间累积的成本大小保持一致,这反映了它们共享的目标函数。然而,由于决策过程的异步性,每台电梯轿厢在其离散决策点之间的成本累积会有所不同。因此,每台电梯轿厢“i”都会被分配一个专用的存储位置,记为 R[i],用于累积其自最近一次决策(时间 d[i])以来产生的总折扣成本。
在每个事件开始时,执行后续计算:令 t0 表示前一个事件的时间,t1 表示当前事件的时间。对于在区间 [t0, t1] 内等待的每个乘客“p”,令 w0(p) 和 w1(p) 分别表示乘客“p”在 t0 和 t1 时刻的总等待时间。随后,对于每辆车“i” [1,11,12].
(6)
在线强化计算
在线强化方案中,累计成本在每次“按下门厅呼叫按钮”事件(表示第一位候梯乘客到达某楼层或电梯轿厢到达某楼层,等候的乘客登机)和“轿厢到达”事件(做出控制决策时)后逐步更新。假设乘客在电梯轿厢到达某楼层并打开门时结束等候时间,因为准确的登机时间仍不确定。每层楼的乘客到达率 (λ) 是根据最近按下按钮间隔(上一个楼层服务和随后按下按钮之间的时间间隔)的倒数估算的。为了减轻因按下按钮间隔过短而引起的波动,规定最大到达率 (λ^) 为每秒 0.04 名乘客。令 t0 表示前一个事件的时间,t1 表示当前事件的时间,w0(b) 表示 t0 时刻按钮“b”的按下时间,w1(b) 表示 t1 时刻按钮“b”的按下时间。每辆车“i”的费用通过累计前一个事件时间和当前事件时间之间的折扣费用来更新。 [1].
(7)
决策和 Q 值更新
电梯轿厢在楼层间穿梭时,到达需要决定是停在下一楼层还是继续前进的点时,会产生“轿厢到达”事件。在某些情况下,轿厢的行动选择会受到限制,例如强制在下一层停靠以便乘客下车。只有当智能体在可用行动中拥有不受约束的选择时,它才会遇到决策点。每个智能体用于决策和 Q 值估计更新的算法概述如下。在时间 tx,在观察到状态 x 后,轿厢“i”到达决策点。轿厢利用其 Q 值估计的玻尔兹曼分布选择行动“a”。
(8)
参数“T”控制动作选择的随机性程度。在初始学习阶段,当Q值估计本身不精确时,会采用较大的“T”值,从而为所有可用动作分配大致相等的概率。随后,随着学习的进展和Q值估计达到更高的准确度,会采用较小的“T”值。这种方法有利于选择被认为更优的动作,同时促进探索以收集有关替代动作的更多信息。在多智能体环境中,选择足够渐进的退火方案尤为关键。 [1].
假设汽车“i”的后续决策点发生在状态“y”中的时间“ty”。在更新所有汽车(包括汽车“i”)的 R[·] 值(如上所述)之后,汽车“i”会将其对 Q(x, a) 的估计值调整为以下目标值:
(9)
用模糊系统表示 Q 值:
利用神经网络实现的 Q 学习的 Q 值评估公式,可以用模糊逻辑重新表述。模糊逻辑并非依赖于神经网络的精确 Q 值估计,而是采用一组模糊规则来确定动作值。这些规则基于系统输入(状态 x 和 y)以及期望输出(动作值)进行定义。
我们使用模糊推理系统代替神经网络来估计 Q(x, a, θ),根据模糊规则确定动作值。该系统包括:
- 输入模糊化:系统输入(状态 x 和 y)被转换为模糊集。
- 模糊规则的应用:模糊规则应用于输入模糊集以确定输出模糊集。
- 输出的去模糊化:输出模糊集被转换为数值。
采用这种方法,Q值评估公式可以改写为:
(10)
地点:
- Δ:Q值更新幅度。
- α:学习率。
- R[i]: 在[tx,Ty ]时间间隔。
- β:折扣因子。
- ty:到达状态y的时间。
- tx:达到状态x的时间。
- Qf (y):模糊推理系统在状态y的估计值。
- Qf (x, a):模糊推理系统在状态 x 下对动作 a 的估计值。
公式参数:
- α(学习率):确定用于更新 Q 值的新奖励的比例。
- β(折扣因子):决定未来奖励对 Q 值计算的影响。
- R[i](奖励):代理在 [tx, ty] 时间间隔内收到的奖励。
- Qf (y) 和 Qf (x, a)(模糊值):由模糊推理系统估计的值 [12,13,15].
模糊强化学习中的退火调度
退火调度在模糊强化学习系统中发挥着关键作用,它控制着智能体的探索与利用权衡。这一过程会逐渐降低决策的随机性,显著影响算法的最终性能。更平缓的退火速率有助于算法收敛至最优解。
在模糊系统中,参数“T”类似于“温度”,控制着动作选择中的不确定性。在初始学习阶段,当隶属函数和模糊规则尚未完全调整时,会采用较高的“T”值。这鼓励智能体广泛探索状态-动作空间,防止陷入局部最优。
随着学习的进展以及隶属函数和模糊规则的不断完善,“T”值会逐渐下降。这种转变会引导智能体更好地利用已获得的知识,从而减少过度的随机动作选择。
精确的“T”参数调整涉及各种退火方案。一种常见的方法是利用指数衰减函数:
T = T_initial * (因子)^h
其中:
T_initial:初始温度。
因子:衰减率(0 < 因子 < 1)。
h:模拟小时数。
选择合适的 T_initial 和 factor 值取决于问题特征和期望的探索程度。通常,T_initial 和 factor 值越高,越接近 1,探索程度越高,利用程度越低。
在多智能体系统中,退火调度的调整至关重要。智能体必须同时进行探索和利用才能实现适当的收敛。渐进式退火调度能够实现智能体间的协调,并防止出现不稳定的行为。
这种方法与零和游戏中观察到的现象相似,即自我博弈学习可以提高代理在动态环境中的表现 [9 15].
| 因素 | 营业时间 | 平均等待时间 | 平方等待 | 系统时间 | Pct > 60 秒 |
| 0.992 | 1000 | 20.5 | 600 | 45 | 2.00 |
| 0.9992 | 5000 | 18.5 | 500 | 43.5 | 1.50 |
| 0.998 | 10000 | 16.8 | 400 | 42.8 | 1.00 |
| 0.999 | 15000 | 16.2 | 360 | 42.4 | 0.50 |
| 0.9995 | 20000 | 15.8 | 350 | 42.2 | 0.25 |
| 0.99975 | 25000 | 14.8 | 345 | 42.1 | 0.15 |
| 0.999875 | 30000 | 14.2 | 330 | 41.8 | 0.04 |
总结
本研究探讨了多智能体强化学习 (MARL) 和模糊逻辑模型在电梯交通控制中的应用,旨在通过最大限度地减少乘客等待时间来提高系统效率。电梯系统被建模为离散事件系统,其中诸如乘客到达等重要事件以离散间隔发生。在该框架下,每部电梯由一个独立的智能体控制。智能体通过与环境的交互和获得奖励来学习最优策略。学习过程中采用 Q 学习算法,同时将模糊逻辑模型集成到 Q 值计算中,以管理不确定性并增强决策能力。本研究探索了两种学习范式:“全知”(信息完整)和“在线”(信息有限)。由于“在线”方法依赖于操作系统中可用的实时数据,因此被认为更实用。退火调度用于平衡学习过程中的探索和利用。退火参数的精确调整会显著影响算法性能。结果表明,MARL 和模糊逻辑的结合为电梯交通控制提供了一种有效的方法,通过有效管理不确定性和环境复杂性,其性能优于传统方法。
图表解读:
- 图1: 该图显示,随着培训时间的增加,等待时间超过60秒的乘客比例大幅下降。这表明,随着培训时间的延长,电梯控制性能有所提高。
- 图2: 该图显示,随着训练时间的增加,最终平均平方等待时间明显减少,进一步证实了通过长期学习可以提高电梯控制效率。
这些数据从经验上验证了研究的结论,凸显了该算法的学习能力和随着时间的推移性能的提高。
主要发现:
- 模糊推理系统有效地估计 Q 值,取代神经网络依赖性。
- 该系统巧妙地管理不确定性和模糊性。
- 在不同的交通条件下,性能得到增强。
- 与传统方法相比,灵活性有所提高。
- 电梯系统被精确地建模为离散事件系统。
- MARL 有效地协调电梯的运行。
- 退火调度优化学习动态。
- “全知”和“在线”学习方法都是可行的。
- 有效减少乘客等待时间。
- 退火速率对整体性能有显著的影响。
参考文献:
Sutton, RS & Barto, AG (2018) 强化学习:导论。麻省理工学院出版社。
Stone, P., Brooks, R., Brynjolfsson, E., Corbett, M., Denning, E., Kambhampati, S. 和 Woroch, M. (2016) 2030 年的人工智能和生活。斯坦福大学,加利福尼亚州斯坦福。
Bostrom, N. (2014) 超级智能:路径、危险、策略。牛津大学出版社。
Nilsson, NJ (2010) 人工智能的探索:思想与成就的历史。剑桥大学出版社。
Busoniu, L., Babuska, R., De Schutter, B. 和 Ernst, D. (2010) 强化学习控制:性能、稳定性和深度近似。Springer 科学与商业媒体。
Lewis, FL, Vrabie, D. & Syrmos, VL (2012) 最优自适应控制:汉密尔顿和强化学习方法。世界科学出版社。
Shoham, Y., Powers, R. 和 Grenager, S. (2007)“如果多智能体学习是答案,那么问题是什么?”,人工智能,171(7),第 365-377 页。
Bradtke, SJ & Duff, MO (1995)《连续时间马尔可夫决策问题的强化学习方法》,《神经信息处理系统进展》,第 393-400 页。
Bradford, JH & Retch, JR (1995)《用于连续状态和动作马尔可夫决策任务的实时 Q 学习》,载于 1995 年 IEEE 国际神经网络会议论文集第 2 卷,第 1092-1097 页。IEEE。
Bertsekas, DP & Tsitsiklis, JN (1996) 神经动态规划。Athena Scientific。
Tesauro, G. (1995)《时间差异学习和 TD-Gammon》,ACM 通讯,38(3),第 58-68 页。
Watkins, CJCH & Dayan, P. (1992)《Q-learning》,机器学习,8(3-4),第 279-292 页。
Littman, ML (1994)《马尔可夫博弈作为多智能体强化学习的框架》,载《机器学习论文集》1994年第157-163页。作者:Morgan Kaufmann。
McCarthy, J. (2007) 什么是人工智能? 斯坦福大学,斯坦福,加利福尼亚州。
Zadeh, LA (1965)“模糊集”,信息与控制,8(3),第 338-353 页。
Tsetlin, ML (1973) 自动机理论与生物系统建模。Academic Press。
Turing, AM (1950)《计算机器和智能》,Mind,59(236),第 433-460 页。


