大模型 Scaling 法則:參數、數據、算力加到哪最划算,一次講清
訓模型最怕的不是沒錢,而是把錢花錯地方。同樣的預算,有人蔘數翻倍效果平平,有人數據加三成指標大漲。這篇把 Scaling 的三條擴展方向和收益規律講清楚,幫你在選型和訓練時少交學費。
先說結論:三個方向裏,短板決定收益。模型參數、訓練數據、算力投入三者是乘法關係,哪塊最短補哪塊最賺。很多團隊死磕參數量,數據卻又髒又少,結果就是大馬拉小車。動手之前先做一次小規模試探:固定兩個變量,只動第三個,看指標漲幅,漲得最猛的就是你的短板。
參數擴展的收益是先陡後平。幾億到幾十億這個區間,每翻一倍都能感到明顯變聰明;過了某個點,同樣的錢換來的提升越來越薄,還附帶推理變慢、顯存翻倍的代價。所以選型別只盯最大那個,先問自己的場景要不要那最後幾個點的提升,要就加,不要就把錢留給數據和評測。
數據擴展是最容易被低估的一條。同樣參數下,乾淨、多樣、和任務對得上的數據,漲點經常超過加參數。做法上記住三件事:去重和清洗優先於堆量,難例和長尾優先於重複灌水,評測集和訓練分佈對齊優先於刷榜。數據做好了,小模型也能在自家任務上打敗大模型,這事已經被驗證過很多次。
訓練配置是把前兩者的投入真正變成績的關鍵。學習率、批量大小、訓練步數的配合,決定了 scaling 曲線能不能爬上去。實用建議是:小模型上先掃出穩定的配置區間,再等比放大;每一次放大都留一份訓練日誌和中間檢查點,方便回頭定位是數據問題還是配置問題。配置不穩時加的每一分算力,都可能白燒。
落地三步走:第一步,用最小的預算跑三組對照,找到你的短板;第二步,把大頭預算壓在短板上,留一成做評測和難例挖掘;第三步,模型上線後繼續拿真實壞案例迴流數據,這比下一次加參數便宜得多。記住,Scaling 拼的不是誰更大,而是誰的每一分錢都花在短板上。 來源|博客園 GlenTt《大語言模型的 Scaling:擴展方向、收益規律與訓練配置》,https://www.cnblogs.com/GlenTt/p/23197545.html
評論(0)
暫無評論,來搶第一條。