閱界資訊

大模型推理入門:從原理到實踐

閱閱界編輯部1閱讀6分鐘

《大模型推理入門:從原理到實踐》是近期博客園技術區的好帖,信息密度大。下面分段講清它的核心內容,看到結尾你就知道該怎麼做了。

大模型推理入門:從原理到實踐 寫給誰看的? 聽說過 ChatGPT、DeepSeek、通義千問,想搞明白"大模型到底是怎麼回答問題的"、想了解本地部署和推理框架區別的同學。不要求你有 AI 背景,我儘量用人話講清楚。 一、先搞懂:什麼是"推理"? 你用 ChatGPT 提問,它"思考"幾秒鐘後給你一段回答——這個過程就叫 推理(Inference) 。 "推理"這個詞聽起來很玄,其實本質就是: 輸入一段文本,輸出一段文本 。和你在鍵盤上打字差不多,只是大模型"打字"的速度是每秒鐘幾十到幾百個字。 一次推理 = 兩個階段:預填充 + 解碼 很多人以爲模型"回答"是一步完成的,其實內部被切成了兩個畫風完全不同的階段。

大模型推理入門:從原理到實踐 寫給誰看的? 聽說過 ChatGPT、DeepSeek、通義千問,想搞明白"大模型到底是怎麼回答問題的"、想了解本地部署和推理框架區別的同學。不要求你有 AI 背景,我儘量用人話講清楚。 一、先搞懂:什麼是"推理"? 你用 ChatGPT 提問,它"思考"幾秒鐘後給你一段回答——這個過程就叫 推理(Inference) 。 "推理"這個詞聽起來很玄,其實本質就是: 輸入一段文本,輸出一段文本 。和你在鍵盤上打字差不多,只是大模型"打字"的速度是每秒鐘幾十到幾百個字。 一次推理 = 兩個階段:預填充 + 解碼 很多人以爲模型"回答"是一步完成的,其實內部被切成了兩個畫風完全不同的階段。理解這兩個階段,後面所有內容(優化技術、選框架、買服務器)都會豁然開朗。

大模型推理入門:從原理到實踐 寫給誰看的? 聽說過 ChatGPT、DeepSeek、通義千問,想搞明白"大模型到底是怎麼回答問題的"、想了解本地部署和推理框架區別的同學。不要求你有 AI 背景,我儘量用人話講清楚。 一、先搞懂:什麼是"推理"? 你用 ChatGPT 提問,它"思考"幾秒鐘後給你一段回答——這個過程就叫 推理(Inference) 。 "推理"這個詞聽起來很玄,其實本質就是: 輸入一段文本,輸出一段文本 。和你在鍵盤上打字差不多,只是大模型"打字"的速度是每秒鐘幾十到幾百個字。 一次推理 = 兩個階段:預填充 + 解碼 很多人以爲模型"回答"是一步完成的,其實內部被切成了兩個畫風完全不同的階段。理解這兩個階段,後面所有內容(優化技術、選框架、買服務器)都會豁然開朗。 階段一:預填充(Prefill)——"讀題" 你發過去的所有內容(提示詞 + 對話歷史 + 問題),模型要 一次性全部讀完 ,理解上下文,並"想好"第一個字該輸出什麼。

大模型推理入門:從原理到實踐 寫給誰看的? 聽說過 ChatGPT、DeepSeek、通義千問,想搞明白"大模型到底是怎麼回答問題的"、想了解本地部署和推理框架區別的同學。不要求你有 AI 背景,我儘量用人話講清楚。 一、先搞懂:什麼是"推理"? 你用 ChatGPT 提問,它"思考"幾秒鐘後給你一段回答——這個過程就叫 推理(Inference) 。 "推理"這個詞聽起來很玄,其實本質就是: 輸入一段文本,輸出一段文本 。和你在鍵盤上打字差不多,只是大模型"打字"的速度是每秒鐘幾十到幾百個字。 一次推理 = 兩個階段:預填充 + 解碼 很多人以爲模型"回答"是一步完成的,其實內部被切成了兩個畫風完全不同的階段。理解這兩個階段,後面所有內容(優化技術、選框架、買服務器)都會豁然開朗。 階段一:預填充(Prefill)——"讀題" 你發過去的所有內容(提示詞 + 對話歷史 + 問題),模型要 一次性全部讀完 ,理解上下文,並"想好"第一個字該輸出什麼。 特點: 並行計算 ,幾千上萬個 Token 同時處理,喫的是 算力(FLOPS) 決定的指標: TTFT(首字延時) ——你按下回車後,等待第一個字蹦出來的時間 你輸入越長(比如貼一篇 8 萬 Token 的文檔),預填充越久,首字等得越久 階段二:解碼(Decode)——"答題" 想好第一個字之後,模型開始 一個 Token 接一個 Token 往外蹦 ,直到生成結束。

大模型推理入門:從原理到實踐 寫給誰看的? 聽說過 ChatGPT、DeepSeek、通義千問,想搞明白"大模型到底是怎麼回答問題的"、想了解本地部署和推理框架區別的同學。不要求你有 AI 背景,我儘量用人話講清楚。 一、先搞懂:什麼是"推理"? 你用 ChatGPT 提問,它"思考"幾秒鐘後給你一段回答——這個過程就叫 推理(Inference) 。 "推理"這個詞聽起來很玄,其實本質就是: 輸入一段文本,輸出一段文本 。和你在鍵盤上打字差不多,只是大模型"打字"的速度是每秒鐘幾十到幾百個字。 一次推理 = 兩個階段:預填充 + 解碼 很多人以爲模型"回答"是一步完成的,其實內部被切成了兩個畫風完全不同的階段。理解這兩個階段,後面所有內容(優化技術、選框架、買服務器)都會豁然開朗。 階段一:預填充(Prefill)——"讀題" 你發過去的所有內容(提示詞 + 對話歷史 + 問題),模型要 一次性全部讀完 ,理解上下文,並"想好"第一個字該輸出什麼。 特點: 並行計算 ,幾千上萬個 Token 同時處理,喫的是 算力(FLOPS) 決定的指標: TTFT(首字延時) ——你按下回車後,等待第一個字蹦出來的時間 你輸入越長(比如貼一篇 8 萬 Token 的文檔),預填充越久,首字等得越久 階段二:解碼(Decode)——"答題" 想好第一個字之後,模型開始 一個 Token 接一個 Token 往外蹦 ,直到生成結束。 特點: 串行生成 ,每生成一個 Token 都要把模型權重從顯存裏讀一遍,喫的是 顯存帶寬(GB/s) 決定的指標: TPS(輸出吞吐) ——你看到回答往外"打字"的快慢 模型越大,每次要讀的權重越多,單流速度越慢 💡 一句話心法(後面反覆用到) : 算力決定首字延時,帶寬決定輸出速度。

行動建議:收藏這篇,下次碰到同類問題先翻出來對照做一遍。好經驗的價值,在於用起來。你最近被這類問題卡過嗎? 來源|博客園《大模型推理入門:從原理到實踐》,https://www.cnblogs.com/xiaobaiysf/p/22957090.html

程式員技術場技术后端

評論(0)

暫無評論,來搶第一條。