zehua

强化学习基础笔记

强化学习与监督学习的区别: (1) 训练数据中没有标签,只有奖励函数 (Reward Function)。 (2) 训练数据不是现成给定,而是由行为 (Action) 获得。 (3) 现在的行为 (Action) 不仅影响后续训练数据的获得,也影响奖励函数 (Reward Function) 的取值

Administrator Administrator 发布于 2026-09-09

论文报告:基于双 Q 学习的深度强化学习(Double DQN)

介绍 这篇论文解决的是强化学习中一个非常重要但长期被忽视的问题:Q学习算法会系统性地高估动作的真实价值。 强化学习的目标是让智能体通过与环境交互,学习到一个能够最大化累积奖励的策略。Q学习是实现这一目标的核心算法之一,它通过学习每个"状态-动作"对的价值来指导决策。Q-learning算法由Watk

Administrator Administrator 发布于 2026-09-09

强化学习 TP1:多臂老虎机问题

强化学习实验1:多臂老虎机问题 问题的本质 多臂老虎机问题是强化学习中最基础的问题类型。想象你面前有 k 台老虎机,每台机器拉动手臂后会给你一个随机奖励,但你不知道每台机器的奖励规律。你有有限的尝试次数(比如1000个硬币),目标是最大化总收益。 这个问题的核心难点在于探索与开发的权衡。如果你花太多

Administrator Administrator 发布于 2026-09-09

强化学习(整合版):从多臂老虎机到 DQN

强化学习基础导论 经典控制与强化学习的对比 控制系统的核心思想是通过反馈机制来调节系统行为。具体来说,系统接收控制器发出的输入信号 u(t),然后产生输出 y(t)。系统还有一个目标输出 y_{ref}(t)(参考信号或期望输出)。控制器的作用就是比较当前系统的实际输出 y(t) 和我们期望的输出

Administrator Administrator 发布于 2026-09-09