第404期:你需要知道的 AI 內存知識
自己在家運行 AI 模型,可以選擇兩種硬件。一種是獨立顯卡,目前最頂級的消費級顯卡是英偉達的 RTX 5090,帶有 32GB 顯存,售價3萬元人民幣左右。另一種是採用板載芯片組(CPU + 板載顯卡 + 板載內存)的家用電腦,比如採用 AMD 公司 Strix Halo 芯片組(具體型號 Ryzen AI Max+ 395)的迷你電腦,自帶 128GB 內存,售價2萬元人民幣左右。我問大家,哪種硬件更好?
大部分人可能不假思索,就會選擇獨立顯卡,畢竟獨立顯卡的算力遠大於板載芯片組。根據我查到的資料,下面是兩者的單精度32位浮點數算力(FP32)。- 獨立顯卡(RTX 5090):104.8 TFLOPS- 板載芯片組(AMD Ryzen AI Max+ 395):14.8 TFLOPS可以看到,獨立顯卡的算力,足足是板載芯片組的7倍。如果是更小位數的浮點數計算(比如 FP16 和 FP4),算力差距就更大了。
但是,我告訴你,正確的答案其實是“不確定”。很多時候,板載芯片組的迷你 PC,纔是更好的本地 AI 模型解決方案。原因很簡單,大多數的 AI 模型(只要參數規模稍大),RTX 5090 根本運行不了。問題出在它的 32GB 顯存實在太少了。一個 70B 參數的模型,如果每個參數使用4位精度,那麼將所有參數的權重讀入內存,大約需要 32.6GB 的內存,這超出了 RTX 5090 的顯存大小,它根本跑不起來。
相比之下,AMD 迷你電腦的板載內存有 128GB,載入模型毫無困難。板載芯片組的內存是顯卡和 CPU 共用的,所以稱爲“統一內存”。它的好處是可以分出儘可能多的內存給單個處理器,所以能處理內存消耗量很大的 AI 模型。
蘋果的 M 系列芯片一直是這種“統一內存”架構,其他廠商現在也跟進了,AMD 的 Strix Halo、NVIDIA 的 DGX Spark、Intel 的 Core Ultra 和高通的 Snapdragon X 都採用這種架構。除了內存容量大,它的價格也比獨立顯卡低。讀到這裏,你可能會問,既然板載芯片組有這些優點,還有必要購買獨立顯卡嗎?
回答是,內存有兩個指標,除了容量大小,還有一個指標“內存帶寬”。板載芯片組的弱點,恰恰就是內存帶寬。所謂“內存帶寬”,指的是內存向處理器傳送數據的速度。雖然 RTX 5090 顯存不多,但是內存帶寬極大,達到了 1792GB/s,而 AMD 的內存帶寬只有 256GB/s。
AI 模型每生成一個 Token,需要處理器從內存中讀取整個模型,進行計算。如果內存帶寬是 256GB/s,那麼 40GB 大小的模型,處理器一秒只能讀取6次(256除以40),也就是說每秒只能生成6個 Token(這是理論值,實際可能還達不到)。這樣的龜速,誰能忍受?即使是內存帶寬最大的蘋果 M3 Ultra 芯片,帶寬爲 819GB/s,每秒可以生成20個 Token,遠不如 RTX 5090 的 1792GB/s。
所以,內存大小和內存帶寬,兩者都是 AI 模型的瓶頸。這也是高帶寬內存(HBM)價格漲瘋了的原因。如果你選擇板載芯片組的迷你電腦,就要做好心理準備,忍受非常慢的 Token 生成速度。好在爲了節省計算量,出現了“混合專家模型(MoE)”這種架構,它計算 Token 時,不需要讀取全部參數,只需要激活一部分參數即可。
以 Qwen3-30B-A3B 模型爲例,它包含 30B 個參數,但每次只激活 3B 個參數,因此每個 Token 需要讀取的數據量不是 20GB,而是 2GB。那麼在 AMD 迷你電腦上,每秒理論上可以生成100多個 Token,這樣的速度就相當不錯了。因此,如果你用“統一內存”模式的迷你電腦,就選用 MoE 模型吧。另外,迷你電腦還有一個很大的缺點,跟內存無關,而跟它的算力慢有關。
我們知道,模型必須先處理用戶的提示詞,然後才能生成 Token。因爲迷你電腦的算力慢,所以它處理提示詞也很慢。根據實際測算,AMD 迷你電腦使用 70B 的模型,提示詞處理速度是每秒95個 Token。那麼,用戶提交4000個 token 的一個文檔,大約需要40秒才能處理完,然後才能輸出第一個 Token。可以想象,一旦用戶往上下文窗口塞入更多的內容,單單是處理提示詞,就會變成幾分鐘到幾十分鐘。
總之,現階段想在本地電腦運行大模型,無論是獨立顯卡還是板載芯片組,都有缺陷。你最多隻能運行一些中等規模的 MoE 模型,而且提示詞不能很長。
來源|阮一峯科技愛好者週刊第 404 期,
評論(0)
暫無評論,來搶第一條。