閱界資訊

在筆記本上自制多模態小語言模型指南

閱閱界編輯部2閱讀2分鐘

在筆記本上從零搓個多模態小模型,多大點事?這位博主上篇自制小語言模型上了熱榜,趁熱打鐵出了多模態指南。目標不大:小參數、快出原型,筆記本能跑。跟着他的三階段走,你也能攢一個會看圖的模型。

先花三分鐘搞懂核心:圖片是怎麼變成模型能懂的東西。答案叫對齊,工具叫雙塔編碼器。給圖片編碼器一張圖,它吐一個向量;給文本編碼器一句話,它也吐一個向量。小貓圖和小貓詞的向量挨着,小狗圖和小狗詞的向量挨着,圖文就對上了。早期很多熱門多模態模型,本質就是大語言模型後面接了這麼個編碼器,圖片轉成向量喂進去,模型再做一點指令微調。現在很多模型一起訓練了,但小參數快速出原型,經典方案依然最穩。

整體分三階段。第一階段訓語言模型,讓它會說話;第二階段訓個翻譯官,把編碼器的向量翻譯成自家模型的語言;第三階段做問答微調,對齊作答方式。架構不大:五百多維、十來層、幾千萬參數,顯存峯值五個多 G,筆記本扛得住。

第一階段:先讓它會說話。用的公開文本數據集,新聞百科網頁都有。先訓分詞器,再把文章切成小塊喂進去。花四個半小時訓完,語法對了,但毛病明顯:不斷重複,邏輯亂,不開抑制沒法用。作者很坦蕩:不指望它寫長文,後面再救。

第二階段:訓翻譯官。自家模型和編碼器不兼容,中間加個兩層小網絡做翻譯,輸入輸出維度對齊就行。用圖文對訓練,幾十分鐘搞定。編碼器把一張圖切成近兩百小塊,輸出向量,翻譯官轉成隱藏層,齊活。

第三階段:問答微調。用一萬條問答小子集,對齊作答格式。完事驗貨:給張圖問 Sentence 總結,答長頸鹿在公園散步;問運動項目,答網球;問室內室外,答室外。有翻車也有高光:問多了會蹦出食物很好之類的話,作者覆盤是第一階段語料不純,很多權重浪費了,下次換更乾淨的語料。

抄作業指南:架構照抄小的,數據先小後大,每階段都留檢查點。翻車記錄比成功更有用,作者把坑全寫出來了,照着避,省一週時間。筆記本玩家別貪大,先跑通,再談強。

來源|博客園《在筆記本上自制多模態小語言模型指南》,https://www.cnblogs.com/duoia/p/23134279

程式員技術場技术后端

評論(0)

暫無評論,來搶第一條。