介绍 这篇论文解决的是强化学习中一个非常重要但长期被忽视的问题:Q学习算法会系统性地高估动作的真实价值。 强化学习的目标是让智能体通过与环境交互,学习到一个能够最大化累积奖励的策略。Q学习是实现这一目标的核心算法之一,它通过学习每个"状态-动作"对的价值来指导决策。Q-learning算法由Watk
背景问题: 扩散模型:生成质量高,但存在两个缺点:① 缺乏低维、可解释的潜在空间;② 生成速度较慢。 VAE:具有低维潜在空间,可以解释和操控生成,但生成图像质量较差。 因此提出了 DiffuseVAE,将VAE嵌入到扩散模型框架中,并设计了新的条件参数化方法,使扩散模型能够利用VAE推导的低维潜在