AI

每天吃透一个 AI 知识点 — 强化学习

转载:小红书 AI产品赵哥

前言 🔖


在开始今天的话题前,请你回想一下,你是如何学会一项新技能的?比如骑自行车、打游戏,或者做一道新菜。

这个过程,通常不是靠看书或者听课(监督学习),也不是靠自己琢磨 “这堆零件里有什么规律”(无监督学习),而是通过一个无比真实的过程:不断地尝试、犯错、感受结果、然后调整策略。

  • 学骑车时,你第一次可能会摔倒(得到一个负反馈),于是你下次会调整身体的平衡;当你成功骑出几米远时,那种兴奋感(得到一个正反馈)会让你记住刚才的感觉。
  • 打游戏时,你走错一步被 Boss 秒杀(负反馈),下次你就会绕开那个陷阱;你打出一个漂亮的连招,秒掉小怪(正反馈),你就会更频繁地使用这个技巧。

这种通过与环境互动,根据 “奖励” 和 “惩罚” 来学习如何做出最优决策的机制,是生命体学习的核心方式,也是我们今天要深入探讨的,机器学习领域最迷人、最具潜力的分支 ——强化学习 (Reinforcement Learning, RL)

它不是教 AI “答案是什么”,而是为 AI 设定一个 “目标”,然后放手让它在虚拟世界里,像一个蹒跚学步的孩子一样,通过亿万次的试错,自己去探索、去领悟,最终成长为一代宗师。

这篇笔记将是你理解 AI 如何从 “被动学习” 走向 “主动探索”,从 “数据拟合” 走向 “策略优化” 的终极指南。它非常长,但将为你揭开从 AlphaGo 到自动驾驶,许多前沿 AI 技术背后的共同哲学!

  

一、机器学习的 “三大家族”— RL 到底站在什么位置?🔖


要理解强化学习的独特性,我们必须先把它放到整个机器学习的版图中,看看它和另外两个 “大家族”—— 监督学习和无监督学习 —— 到底有什么根本不同。

这三者,构成了机器学习的基石,它们解决问题的思路截然不同。

🔹 1. 监督学习 (Supervised Learning) – “手把手教学的严格导师”

  • 核心思想:“给你标准答案,照着学!” 这是我们最熟悉、应用也最广泛的一种学习方式。
  • 学习过程:你需要准备海量的、已经被人为打好标签的数据集。比如,成千上万张图片,每一张都标好了 “这是猫” 或 “这是狗”。然后,你把这些 “问题(图片)” 和 “标准答案(标签)” 一起喂给模型。模型的目标,就是学习到一个函数,能够尽可能准确地拟合这种 “问题 – 答案 ” 的映射关系。
  • 生活中的比喻:就像我们小时候做数学练习册,每一道题后面都有标准答案。我们通过不断地做题、对答案、订正错误,来学会解题的方法。
  • 典型应用
    • 图像分类:识别图片里的物体(猫、狗、汽车)。
    • 垃圾邮件过滤:判断一封邮件是 “垃圾邮件” 还是 “正常邮件”。
    • 房价预测:根据房子的面积、地段等特征,预测其价格。
  • 局限性:极度依赖高质量的、海量的标注数据。获取这些 “标准答案” 的成本非常高昂(数据标注师的人力成本)。而且,对于很多问题,根本就不存在唯一的 “标准答案”,比如下棋。

  

🔹 2. 无监督学习 (Unsupervised Learning) – “自由探索的博物学家”

  • 核心思想:”给你一堆东西,自己去发现里面的规律。” 这种学习方式,不给任何 “标准答案”。
  • 学习过程:你给模型的是一堆没有标签的原始数据。模型的目标,是在这堆看似杂乱的数据中,自己去寻找隐藏的结构、模式或相似性。
  • 生活中的比喻:就像一个图书管理员,拿到了一万本新书,没有人告诉他该如何分类。他通过自己阅读、比较,最终可能会把这些书按照 “小说”、”历史”、”科学” 等类别分门别类地放好。他自己定义了 “类别” 这个概念。
  • 典型应用
    • 聚类 (Clustering):将用户群体根据其购买行为,自动分为 “高价值用户”、“潜力用户”、“流失用户” 等。
    • 降维 (Dimensionality Reduction):从复杂的数据中提取出最重要的核心特征。
    • 异常检测 (Anomaly Detection):在信用卡交易中,发现与用户通常消费模式不符的异常交易。
  • 局限性:它能发现 “是什么”,但无法直接告诉你 “该怎么做”。它能帮你把客户分类,但不能直接告诉你该对哪类客户采取什么样的营销策略。

  

🔹 3. 强化学习 (Reinforcement Learning) – “在实践中成长的探险家”

  • 核心思想:“不给你答案,只给你目标和规则,你自己去闯,做得好有奖,做不好有罚。”
  • 学习过程:RL 不依赖于一个静态的数据集。它关注的是一个智能体 (Agent) 如何在一个环境 (Environment) 中,通过采取行动 (Action) 来最大化它能获得的累计奖励 (Cumulative Reward)。
  • 生活中的比喻:这就是我们开篇提到的学骑车或打游戏。你(智能体)在道路上(环境)做出 “向左倾斜” 或 “向前蹬” 的动作(行动)。摔倒了(负奖励),你会感到疼;骑稳了(正奖励),你会感到开心。你的目标,就是学会一套能让你获得最多 “开心”、最少 “疼痛” 的骑行策略 (Policy)。
  • 典型应用
    • 游戏 AI:AlphaGo 下围棋,DeepMind 的 AI 玩星际争霸和雅达利游戏。
    • 机器人控制:训练机器狗学会走路、跑步、开门。
    • 自动驾驶:在仿真环境中,训练车辆学会如何在复杂的交通流中进行博弈和决策。
    • 资源调度:优化数据中心的能源消耗,或者调度一个城市的交通信号灯。
  • 独特之处
    • 没有 “正确答案”,只有 “好坏评价”:环境不会告诉你 “这一步应该走在 A 点”,而只会告诉你 “你走了 B 点,结果掉血了(-10 分)”。
    • 决策的 “延迟回报”:你现在走的一步棋,可能要到 50 步之后,才能决定这盘棋的胜负。如何评估当前这一步的 “长期价值”,是 RL 的核心挑战。
    • 需要在 “探索” 与 “利用” 之间进行权衡:是继续使用当前已知的最好策略(利用),还是去尝试一些未知的、可能有风险但也许回报更高的策略(探索)?

总结一下三者的核心区别:

监督学习无监督学习强化学习
学习信号明确的标签 / 标准答案数据自身的内在结构环境反馈的奖励 / 惩罚信号
数据形式静态的、已标注的数据集静态的、未标注的数据集动态的、通过与环境交互产生的数据流
核心目标学习一个从输入到输出的映射函数(分类 / 回归)发现数据中的隐藏模式(聚类 / 降维)学习一个最优的行动策略,以最大化长期累计奖励
问题类型“这是什么?”“它们有何不同 / 相同?”“接下来我该怎么做?”
AI 角色一个模仿者 (Imitator)一个分析师 (Analyst)一个决策者 (Decision Maker)

  

二、强化学习的 “世界观”—— 五大核心元素 🔖


要深入理解 RL,我们必须先熟悉它的 “世界观”。任何一个 RL 问题,都可以被抽象成五个核心元素,它们共同构成了一个名为马尔可夫决策过程 (Markov Decision Process, MDP)的数学框架。

别被这个名字吓到,我们用 “打怪升级” 的游戏来解释,你会秒懂。

🔹 1. 智能体 (Agent) – “你,玩家”

  • 定义:这就是我们的学习者和决策者,是整个故事的主角。
  • 在游戏中:就是你控制的游戏角色。
  • 在自动驾驶中:就是那辆搭载了 AI 算法的汽车。

  

🔹 2. 环境 (Environment) – “游戏世界”

  • 定义:智能体所处在的、并与之互动的所有外部事物。
  • 在游戏中:就是整个游戏地图,包括里面的怪物、宝箱、地形、规则。
  • 在自动驾驶中:就是道路、其他车辆、行人、交通信号灯、天气等构成的整个交通系统。

  

🔹 3. 状态 (State, S) – “你当前的情况”

  • 定义:在某个特定时刻,对环境的一个完整描述。
  • 在游戏中:就是你角色当前的位置、血量、蓝量、装备,以及周围怪物的分布情况。
  • 在自动驾驶中:就是车辆当前的位置、速度、方向,以及通过传感器感知到的周围车辆的位置、速度,和红绿灯的状态。

  

🔹 4. 行动 (Action, A) – “你选择的操作”

  • 定义:智能体根据当前状态,可以做出的一系列选择。
  • 在游戏中:就是你可以按下的技能键 ——”前进”、”后退”、”攻击”、”放技能”、”喝药水”。
  • 在自动驾驶中:就是车辆可以执行的操作 ——”加速 10%”、”刹车 20%”、”方向盘左转 5 度”。

  

🔹 5. 奖励 (Reward, R) – “你得到的即时反馈”

  • 定义:在某个状态下,智能体采取了一个行动后,环境给出的一个即时的、标量的反馈信号。这个信号有好(正奖励)有坏(负奖励 / 惩罚)。
  • 在游戏中
    • 正奖励:击败一个怪物(+10 经验值),打开一个宝箱(+100 金币),到达终点(+10000 分)。
    • 负奖励:被怪物打中(-20 血量),掉进陷阱(-50 血量)。
  • 在自动驾驶中
    • 正奖励:平稳、高效地前进(+1 分 / 秒),成功到达目的地(+1000 分)。
    • 负奖励:发生碰撞(-1000 分),紧急刹车(-10 分),违反交规(-50 分)。

RL 的整个过程,就是这样一个无限循环的 “互动游戏”:

智能体在 t 时刻观察到环境的状态 S (t),基于此,它决定采取一个行动 A (t)。环境接收到这个行动后,会转移到一个新的状态 S (t+1),并给智能体一个即时的奖励 R (t+1)。

而智能体的终极目标,不是最大化某一个时刻的即时奖励,而是最大化从现在到未来,所能获得的 “累计奖励总和”!这被称为回报 (Return)。为了眼前的 100 金币,而忽略了旁边即将秒杀你的大 Boss,是 “短视” 的,在 RL 里是不可取的。

  

三、AI 如何 “思考”?—— 策略、价值函数与 Q-Learning 🔖


我们知道了 RL 的目标,那么 AI 究竟是如何学习,才能达成这个目标的呢?它的 “大脑” 里,到底在想什么?这里面主要有三个核心概念。

🔹 1. 策略 (Policy, π) – “我的行动指南 / 条件反射”

  • 定义:这就是我们最终想要学到的东西!策略,就是一个从 “状态” 到 “行动” 的映射函数。它告诉智能体,在某个特定的状态下,应该采取什么行动。
  • 比喻:就像一本武功秘籍,上面写着:“当敌人从左边攻来时(状态),你应该向右闪避(行动)。”
  • 分类
    • 确定性策略:在状态 S,一定采取行动 A。
    • 随机性策略:在状态 S,有 70% 的概率采取行动 A,有 30% 的概率采取行动 B。(在学习初期,保留一定的随机性有助于 “探索”)

  

🔹 2. 价值函数 (Value Function, V/Q) – “这个局面对我多有利?”

  • 定义:价值函数,是对未来回报的期望。它评估的是,处于某个状态(状态价值函数),或者在某个状态下采取某个行动(动作价值函数),从长远来看,有多好。这是 RL 中最核心的 “远见” 的体现。
  • 两种价值函数:
    • 状态价值函数 V (s):回答的是 “我现在处于状态 s,如果接下来一直按照最优策略走,我未来能获得的总回报大概是多少?” 它评估的是一个状态的好坏。比如,在棋局中,“将军” 对方的状态,其 V 值就非常高。
    • 动作价值函数 Q (s, a):回答的是 “我现在处于状态 s,如果我选择采取行动 a,然后接下来一直按照最优策略走,我未来能获得的总回报大概是多少?” 它评估的是在一个状态下,采取某个具体行动的好坏。这对于决策至关重要!

想象一下,如果你拥有了一个完美的 Q 函数,那么决策就变得异常简单:在当前状态 s,你只需要遍历所有可以采取的行动 a,计算出每一个 a 对应的 Q (s, a) 值,然后选择那个能让 Q 值最大的行动,就一定是最优的!

  

🔹 3. Q-Learning 算法 – “在实践中更新我的小本本”

那么,这个神奇的 Q 函数是如何学到的呢?Q-Learning 就是最经典、最基础的学习算法之一。

  • 核心思想:我们初始化一个 Q 表(一个小本本),里面记录了所有 (状态,行动) 对的 Q 值(初始可以是 0)。然后,我们让智能体在环境中不断地探索,并根据它得到的真实体验,来不断地、迭代地更新这个小本本上的 Q 值。
  • 更新公式(贝尔曼方程的变种):新Q(s, a) = (1-α) * 旧Q(s, a) + α * [ R + γ * max Q(s’, a’) ]
    • 别怕这个公式,我们把它翻译成人话:“我现在在状态s,采取了行动a。我得到的新经验是:我立刻拿到了一个即时奖励R,并且我进入了新状态s’。在新状态s’里,我能采取的最好行动的未来价值是 max Q(s’, a’)。”
    • “所以,我现在对Q(s, a)的新估计,应该是我这次得到的真实奖励R,加上对未来最好情况的一个折扣(γ)后的期望。”
    • α是学习率,控制我这次的新经验在多大程度上覆盖我的旧观念。γ是折扣因子,表示我对未来的重视程度(未来的奖励要打个折)。
  • 学习过程:智能体就像一个勤奋的学生,带着这个可以随时更新的小本本,在环境中不断地“冒险-碰壁-获得奖励-更新笔记”。只要探索的次数足够多,Q表里的值就会逐渐收敛,逼近真实的Q值。
    • 深度强化学习 (Deep Reinforcement Learning, DRL):当状态和行动空间变得巨大时(比如围棋、自动驾驶),我们不可能用一张“表”来记录所有的Q值。于是,科学家们用一个深度神经网络来代替这张Q表,去拟合这个Q函数。这就是深度学习与强化学习的伟大结合,也是AlphaGo等现代RL系统的核心。这个神经网络,我们称之为DQN (Deep Q-Network)。

  

四、强化学习的 “流派” 与前沿 🔖


RL 的世界博大精深,除了基于价值函数(如 Q-Learning)的这一派,还有其他重要的流派,它们从不同的角度解决问题。

  • 基于策略的 (Policy-Based):
    • 思路:这一派认为,何必那么麻烦去学价值函数呢?我们直接学习策略函数 Policy (π) 本身不好吗?它们的目标,是直接用一个神经网络,来输出在某个状态下,应该采取各个行动的概率。
    • 代表算法:Policy Gradients, REINFORCE。
    • 优点:在连续的行动空间(比如方向盘转动角度)中表现更好。
  • 演员 – 评论家 (Actor-Critic, AC):
    • 思路:这是目前最主流、最强大的流派,它结合了以上两派的优点。它包含两个神经网络:
      • 演员 (Actor):就是一个策略网络,负责根据状态输出行动。
      • 评论家 (Critic):就是一个价值网络,负责对演员输出的行动进行打分和评价。
    • 学习过程:演员在 “舞台” 上表演(做出决策),评论家在台下观看并给出 “评价”(这个动作好不好)。演员根据评论家的反馈,来调整自己的表演策略。两者相互促进,共同进步。
    • 代表算法:A2C, A3C, DDPG, SAC, PPO(PPO 是目前应用最广泛的算法之一)。

  

五、终极展望:从 “游戏” 到 “现实”,RL 的机遇与挑战 🔖


强化学习描绘了一幅令人激动的未来图景,它让 AI 摆脱了对静态数据集的依赖,走向了在与真实世界交互中自主学习的康庄大道。

  • 机遇:
    • 解决 “无最优解” 的决策问题:在自动驾驶的复杂博弈、金融交易的动态策略、或者大型系统的资源调度中,不存在固定不变的 “正确答案”,RL 是解决这类问题的最佳工具。
    • 实现超人级别的技能:在规则明确的领域(如棋类、游戏),RL 已经被证明可以发现人类从未想到的、更优的策略,达到 “超人” 水平。
    • 与世界模型结合:当 RL 与我们之前讨论的 “世界模型” 结合时,威力将呈指数级增长。AI 可以在其内部的 “虚拟世界” 中,进行数十亿次的、零成本的强化学习训练,然后再将学到的策略应用到现实中。
  • 挑战:
    • 样本效率低下:RL 通常需要海量的、甚至是天文数字般的交互次数才能学到有效的策略,这在真实世界中(比如机器人训练)是极其昂贵和耗时的。
    • 奖励函数的设计难题:如何设计一个好的奖励函数,来引导 AI 学到我们期望的行为,是一门 “艺术” 而非 “科学”。一个微小的偏差,就可能导致 AI 学会 “钻空子”(比如,为了获得 “到达终点” 的奖励,而选择撞墙抄近路)。
    • 安全与探索:在自动驾驶、医疗等领域,如何保证 AI 在 “探索” 未知策略时的绝对安全,是一个巨大的伦理和技术挑战。

  

总结时刻 🔖


今天,我们进行了一场深入 AI “学习” 本质的伟大探索。现在,让我们来总结一下关于 “强化学习” 的核心宝藏:

  • 核心定义:强化学习是一种让智能体通过与环境的互动,根据获得的奖励 / 惩罚信号,来学习最优行动策略的机器学习范式。
  • 与监督 / 无监督学习的本质区别:它没有标准答案,依赖的是延迟的、稀疏的奖励信号,解决的是序列决策问题,目标是学习 “该怎么做”。
  • 核心五元素 (MDP):智能体 (Agent)、环境 (Environment)、状态 (State)、行动 (Action)、奖励 (Reward)。
  • AI 的 “思考” 核心:通过学习策略 (Policy) 和价值函数 (Value Function),来做出能最大化长期累计回报的决策。Q-Learning 是其经典的学习算法。
  • 前沿发展:从基于价值,到基于策略,再到两者结合的演员 – 评论家 (Actor-Critic) 架构,RL 的能力正在飞速发展。

掌握了 “强化学习”,你就理解了 AI 如何从一个只会 “背书” 的学生,进化为一个能够在复杂世界中,通过实践和反思,自主寻找成功之路的 “探险家”。这,或许才是通往真正通用人工智能(AGI)的、更具启发性的道路。