HOME
  • 文章
  • 随笔
  • 分类
  • Archive
  • |

GSPO:Group Sequence Policy Optimization 详解

2026年8月18日 · 7398 字 · 15 分钟 · GSPO GRPO RL 强化学习 LLM MoE

GSPO(Group Sequence Policy Optimization)是 Qwen 团队在 2025 年提出的一种用于 LLM 强化学习后训练的策略优化算法。它直接建立在 GRPO 的框架之上,但做了一个非常关键的改变:

© 2026 Zihan Wang's blog Powered by Hugo️️ Ladder ️