从 Q-Learning 到 GRPO:强化学习算法、网络角色与部署选择
梳理 Q-Learning、DQN、PPO、SAC 与 GRPO,分清策略、价值、奖励和参考模型的职责,以及训练时谁更新、部署时保留谁。
#强化学习#Q-Learning#DQN#PPO#SAC#GRPO#RLHF
写作与记录
博客以介绍为主,不求甚解:先认识一个概念、方法或工具,建立大致的理解。
博客目录 →梳理 Q-Learning、DQN、PPO、SAC 与 GRPO,分清策略、价值、奖励和参考模型的职责,以及训练时谁更新、部署时保留谁。
从 Chunk-based Masking 出发,理解流式语音识别如何限制未来信息、复用历史缓存,并比较 Conformer、Emformer、U2/U2++ 和 Zipformer 的延迟与精度取舍。
记录一次 QQ、百度手机浏览器页面样式异常的排查过程:从 Tailwind CSS 兼容性、Cloudflare 构建日志,到 npm ci 与 package-lock.json 不同步的修复和线上验证。
从混合精度 Adam 的显存账本出发,拆解 ZeRO 三阶段如何逐步切分优化器状态、梯度和参数,并用 7B、13B 例子估算显存与通信代价。
从 LLaVA 的视觉编码器、投影层和语言模型,到两阶段训练、GQA 数据集、LLaVA-1.5 以及它对后续开源多模态模型的影响。