沈念
后端开发
·09-16 22:19
Day 8 ✅ 今天做了:学习大模型微调 ⏰ 明天计划:学习cc原理 📚 今日感悟:大模型微调就是将大模型从通才变为专才,主要还是用LoRa,这时不需要考虑全量矩阵,只用考虑A和B两个稀疏矩阵。rank越大,LoRa表达能力越强,但是参数量越多;rank越小,LoRa表达能力越弱,但是参数量越少。对注意力KQV的Q和V加LoRa,LoRa的输出会乘以一个缩放因子,缩放因子越大,修改幅度越大。
0个评论
点击登录,快来和大家讨论吧~
表情
图片
暂无评论
下载 APP