HOME
  • 文章
  • 随笔
  • 分类
  • Archive
  • |

强化学习基础公式全解析:从 Policy 到 Q-Learning

2026年8月22日 · 3237 字 · 7 分钟 · RL 强化学习 Bellman Q-Learning SARSA TD

强化学习(Reinforcement Learning, RL)的核心是 agent 在环境(Environment)中通过试错(trial and error)学习最优策略。本文系统梳理 RL 最基础、最核心的公式,从 Policy、Return 出发,经过 V/Q 函数、Bellman 方程,最终到 TD 学习和 Q-Learning,形成一条完整的公式链。

GSPO:Group Sequence Policy Optimization 详解

2026年8月18日 · 7398 字 · 15 分钟 · GSPO GRPO RL 强化学习 LLM MoE

GSPO(Group Sequence Policy Optimization)是 Qwen 团队在 2025 年提出的一种用于 LLM 强化学习后训练的策略优化算法。它直接建立在 GRPO 的框架之上,但做了一个非常关键的改变:

© 2026 Zihan Wang's blog Powered by Hugo️️ Ladder ️