AI教程2026年8月24日视觉语言模型微调与强化学习实践指南深入探讨在微调 9B 到 35B MoE 视觉语言模型(VLM)过程中,使用监督微调(SFT)和 GRPO 强化学习遭遇的真实踩坑记录与解决方案。阅读全文 →
AI教程2026年8月5日深度解析安德烈·卡帕斯 nanochat 中的 GRPO 强化学习循环深入探讨 Andre Karpathy 在 nanochat 中实现的 300 行 GRPO 代码,分析如何通过简化的强化学习算法显著提升大语言模型在 GSM8K 等数学逻辑任务中的表现。阅读全文 →