模型参数量怎么算:CNN、Transformer、ViT、LoRA 与 Adapter
从卷积核、注意力投影和前馈网络,到 ViT 的 patch embedding、LoRA 与 Adapter,掌握主流模型参数量的估算方法。
#模型参数量#CNN#Transformer#ViT#LoRA#Adapter
写作与记录
博客以介绍为主,不求甚解:先认识一个概念、方法或工具,建立大致的理解。
博客目录 →从卷积核、注意力投影和前馈网络,到 ViT 的 patch embedding、LoRA 与 Adapter,掌握主流模型参数量的估算方法。
从跨层金字塔、双向路径、可学习加权,到层内多尺度上下文和全局依赖,理解五种经典视觉特征融合模块的差异与适用边界。
从重要性剪枝、相似度合并到可学习压缩率,理解视觉 token 压缩的位置、训练要求,以及 FLOPs 降低为何不等于推理同比加速。
从 OpenVLA、Octo 到 π0,理解动作量化、连续生成、动作分块,以及数据适配、微调和真实机器人部署中的关键边界。
从视觉编码器到跨模态连接器,梳理图文预训练、视觉特征融合与语言模型对齐,并延伸到 VLA 的离散动作和连续动作生成。