在笔记本上自制多模态小语言模型指南
在笔记本上从零搓个多模态小模型,多大点事?这位博主上篇自制小语言模型上了热榜,趁热打铁出了多模态指南。目标不大:小参数、快出原型,笔记本能跑。跟着他的三阶段走,你也能攒一个会看图的模型。
先花三分钟搞懂核心:图片是怎么变成模型能懂的东西。答案叫对齐,工具叫双塔编码器。给图片编码器一张图,它吐一个向量;给文本编码器一句话,它也吐一个向量。小猫图和小猫词的向量挨着,小狗图和小狗词的向量挨着,图文就对上了。早期很多热门多模态模型,本质就是大语言模型后面接了这么个编码器,图片转成向量喂进去,模型再做一点指令微调。现在很多模型一起训练了,但小参数快速出原型,经典方案依然最稳。
整体分三阶段。第一阶段训语言模型,让它会说话;第二阶段训个翻译官,把编码器的向量翻译成自家模型的语言;第三阶段做问答微调,对齐作答方式。架构不大:五百多维、十来层、几千万参数,显存峰值五个多 G,笔记本扛得住。
第一阶段:先让它会说话。用的公开文本数据集,新闻百科网页都有。先训分词器,再把文章切成小块喂进去。花四个半小时训完,语法对了,但毛病明显:不断重复,逻辑乱,不开抑制没法用。作者很坦荡:不指望它写长文,后面再救。
第二阶段:训翻译官。自家模型和编码器不兼容,中间加个两层小网络做翻译,输入输出维度对齐就行。用图文对训练,几十分钟搞定。编码器把一张图切成近两百小块,输出向量,翻译官转成隐藏层,齐活。
第三阶段:问答微调。用一万条问答小子集,对齐作答格式。完事验货:给张图问 Sentence 总结,答长颈鹿在公园散步;问运动项目,答网球;问室内室外,答室外。有翻车也有高光:问多了会蹦出食物很好之类的话,作者复盘是第一阶段语料不纯,很多权重浪费了,下次换更干净的语料。
抄作业指南:架构照抄小的,数据先小后大,每阶段都留检查点。翻车记录比成功更有用,作者把坑全写出来了,照着避,省一周时间。笔记本玩家别贪大,先跑通,再谈强。
来源|博客园《在笔记本上自制多模态小语言模型指南》,https://www.cnblogs.com/duoia/p/23134279
评论(0)
暂无评论,来抢第一条。