Python强化学习入门教程_Q-learning与策略优化实践

舞夢輝影

发布时间：2025-12-30 19:23:54

824人浏览过

来源于php中文网

原创

q-learning是一种无模型强化学习算法，通过q表存储状态-动作价值，按贝尔曼方程迭代更新：q(s,a)←q(s,a)+α[r+γmaxₐ′q(s′,a′)−q(s,a)]，结合ε-greedy策略实现探索与利用平衡。

python强化学习入门教程_q-learning与策略优化实践

Q-learning 是强化学习中最经典、最易上手的无模型（model-free）算法之一，适合初学者理解“试错—奖励—价值更新”的核心逻辑。它不依赖环境动态模型，仅靠与环境交互产生的状态-动作-奖励序列，就能逐步学习最优策略。

Q-learning 的核心思想：用表格记住“在哪种状态下做哪个动作最值得”

Q-learning 维护一张 Q 表（Q-table），行是状态（state），列是动作（action），每个单元格存的是当前估计的“动作价值”——即从该状态执行该动作后，未来能获得的累计奖励期望值（带折扣）。算法通过贝尔曼方程不断迭代更新：

Q(s, a) ← Q(s, a) + α [r + γ maxₐ′ Q(s′, a′) − Q(s, a)]

其中：
α 是学习率（如 0.1），控制更新步长；
γ 是折扣因子（如 0.99），决定未来奖励的重要性；
r 是即时奖励；
s′ 是执行 a 后到达的新状态。

关键点：
• 每次更新只依赖当前经验（s, a, r, s′），无需完整轨迹；
• maxₐ′ Q(s′, a′) 体现“贪婪选择”，即假设后续都选最优动作；
• 算法本身是 off-policy，行为策略（如 ε-greedy）可探索，但更新始终朝向最优动作价值靠拢。

用 Python 实现一个可运行的 Q-learning 示例（以 FrozenLake 为例）

FrozenLake 是 OpenAI Gym 中的经典网格世界环境：4×4 冰面，有起点 S、目标 G、陷阱 H 和安全冰块 F。智能体需在不掉进陷阱的前提下走到目标，每步奖励为 0，成功抵达得 +1，掉坑得 0。

立即学习“Python免费学习笔记（深入）”；

人声去除

用强大的AI算法将声音从音乐中分离出来

下载

代码要点（精简版）：

初始化 Q 表：np.zeros((env.observation_space.n, env.action_space.n))
ε-greedy 策略：以概率 ε 随机选动作，否则选当前 Q 值最大的动作
训练循环中，对每条 (s, a, r, s′) 经验执行一次 Q 更新
ε 随训练衰减（如 ε = max(0.01, ε * 0.995)），平衡探索与利用
每轮训练后测试策略胜率，观察收敛趋势

运行 10000 轮后，典型表现是胜率从接近 0% 稳步升至 70–85%，说明 Q 表已学到较稳健路径。

策略优化不是终点：常见改进方向与实用技巧

基础 Q-learning 在简单环境效果好，但面对高维状态（如图像）、连续动作或稀疏奖励时会失效。实际应用中常结合以下优化：

状态抽象/特征工程：对原始状态降维或映射为有意义特征（如距离目标的曼哈顿距离），缓解维度灾难
函数逼近替代查表：用神经网络拟合 Q 函数（即 DQN），支持像素输入和大规模状态空间
经验回放（Experience Replay）：把历史经验存入缓冲池，随机采样打破数据相关性，提升训练稳定性
目标网络（Target Network）：用独立网络计算 maxₐ′ Q(s′, a′)，避免 Q 值震荡，DQN 的关键设计
奖励塑形（Reward Shaping）：在原奖励基础上增加辅助信号（如靠近目标+0.1），加速稀疏奖励下的学习

动手前的小提醒：别跳过环境理解与超参调试

很多初学者卡在“Q 表不收敛”或“策略始终乱走”，问题往往不在代码，而在：

没看懂环境的 reward 设计（比如 FrozenLake 默认 step reward=0，成功才+1；某些版本默认每步−0.1，逻辑完全不同）
γ 设太高（0.999）导致早期错误长期影响，太低（0.5）又忽略长远目标
ε 衰减太快，还没探索完就锁死在次优策略；或太慢，后期仍频繁随机扰动
学习率 α 固定为 0.1 —— 更稳妥的做法是随训练轮数缓慢下降（如 α = 1/√t）

建议先打印中间 Q 表、记录每轮总奖励、可视化策略热力图，比盲目调参更有效。

如何将 CSV 文件逐行读取为字典（纯 Python，无需第三方模块）

AWS S3 版本化存储桶中精准区分对象与文件夹版本的 Python 实践指南

Python数据类怎么用_dataclass使用场景解析

Python常见面试题解析_高频问题解题思路

Python继承还是组合_设计取舍分析

相关专题

页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章，大家可以免费体验。

485

2023.08.14

C++高性能网络编程与Reactor模型实践

本专题围绕 C++ 在高性能网络服务开发中的应用展开，深入讲解 Socket 编程、多路复用机制、Reactor 模型设计原理以及线程池协作策略。内容涵盖 epoll 实现机制、内存管理优化、连接管理策略与高并发场景下的性能调优方法。通过构建高并发网络服务器实战案例，帮助开发者掌握 C++ 在底层系统与网络通信领域的核心技术。

2026.03.03

Golang 测试体系与代码质量保障：工程级可靠性建设

Go语言测试体系与代码质量保障聚焦于构建工程级可靠性系统。本专题深入解析Go的测试工具链（如go test）、单元测试、集成测试及端到端测试实践，结合代码覆盖率分析、静态代码扫描（如go vet）和动态分析工具，建立全链路质量监控机制。通过自动化测试框架、持续集成（CI）流水线配置及代码审查规范，实现测试用例管理、缺陷追踪与质量门禁控制，确保代码健壮性与可维护性，为高可靠性工程系统提供质量保障。

2026.02.28

Golang 工程化架构设计：可维护与可演进系统构建

Go语言工程化架构设计专注于构建高可维护性、可演进的企业级系统。本专题深入探讨Go项目的目录结构设计、模块划分、依赖管理等核心架构原则，涵盖微服务架构、领域驱动设计(DDD)在Go中的实践应用。通过实战案例解析接口抽象、错误处理、配置管理、日志监控等关键工程化技术，帮助开发者掌握构建稳定、可扩展Go应用的最佳实践方法。

2026.02.28

Golang 性能分析与运行时机制：构建高性能程序

Go语言以其高效的并发模型和优异的性能表现广泛应用于高并发、高性能场景。其运行时机制包括 Goroutine 调度、内存管理、垃圾回收等方面，深入理解这些机制有助于编写更高效稳定的程序。本专题将系统讲解 Golang 的性能分析工具使用、常见性能瓶颈定位及优化策略，并结合实际案例剖析 Go 程序的运行时行为，帮助开发者掌握构建高性能应用的关键技能。

2026.02.28