GSPO:Group Sequence Policy Optimization 详解2026年8月18日 · 7398 字 · 15 分钟 · GSPO GRPO RL 强化学习 LLM MoEGSPO(Group Sequence Policy Optimization)是 Qwen 团队在 2025 年提出的一种用于 LLM 强化学习后训练的策略优化算法。它直接建立在 GRPO 的框架之上,但做了一个非常关键的改变: