大模型推理入门:从原理到实践
《大模型推理入门:从原理到实践》是近期博客园技术区的好帖,信息密度大。下面分段讲清它的核心内容,看到结尾你就知道该怎么做了。
大模型推理入门:从原理到实践 写给谁看的? 听说过 ChatGPT、DeepSeek、通义千问,想搞明白"大模型到底是怎么回答问题的"、想了解本地部署和推理框架区别的同学。不要求你有 AI 背景,我尽量用人话讲清楚。 一、先搞懂:什么是"推理"? 你用 ChatGPT 提问,它"思考"几秒钟后给你一段回答——这个过程就叫 推理(Inference) 。 "推理"这个词听起来很玄,其实本质就是: 输入一段文本,输出一段文本 。和你在键盘上打字差不多,只是大模型"打字"的速度是每秒钟几十到几百个字。 一次推理 = 两个阶段:预填充 + 解码 很多人以为模型"回答"是一步完成的,其实内部被切成了两个画风完全不同的阶段。
大模型推理入门:从原理到实践 写给谁看的? 听说过 ChatGPT、DeepSeek、通义千问,想搞明白"大模型到底是怎么回答问题的"、想了解本地部署和推理框架区别的同学。不要求你有 AI 背景,我尽量用人话讲清楚。 一、先搞懂:什么是"推理"? 你用 ChatGPT 提问,它"思考"几秒钟后给你一段回答——这个过程就叫 推理(Inference) 。 "推理"这个词听起来很玄,其实本质就是: 输入一段文本,输出一段文本 。和你在键盘上打字差不多,只是大模型"打字"的速度是每秒钟几十到几百个字。 一次推理 = 两个阶段:预填充 + 解码 很多人以为模型"回答"是一步完成的,其实内部被切成了两个画风完全不同的阶段。理解这两个阶段,后面所有内容(优化技术、选框架、买服务器)都会豁然开朗。
大模型推理入门:从原理到实践 写给谁看的? 听说过 ChatGPT、DeepSeek、通义千问,想搞明白"大模型到底是怎么回答问题的"、想了解本地部署和推理框架区别的同学。不要求你有 AI 背景,我尽量用人话讲清楚。 一、先搞懂:什么是"推理"? 你用 ChatGPT 提问,它"思考"几秒钟后给你一段回答——这个过程就叫 推理(Inference) 。 "推理"这个词听起来很玄,其实本质就是: 输入一段文本,输出一段文本 。和你在键盘上打字差不多,只是大模型"打字"的速度是每秒钟几十到几百个字。 一次推理 = 两个阶段:预填充 + 解码 很多人以为模型"回答"是一步完成的,其实内部被切成了两个画风完全不同的阶段。理解这两个阶段,后面所有内容(优化技术、选框架、买服务器)都会豁然开朗。 阶段一:预填充(Prefill)——"读题" 你发过去的所有内容(提示词 + 对话历史 + 问题),模型要 一次性全部读完 ,理解上下文,并"想好"第一个字该输出什么。
大模型推理入门:从原理到实践 写给谁看的? 听说过 ChatGPT、DeepSeek、通义千问,想搞明白"大模型到底是怎么回答问题的"、想了解本地部署和推理框架区别的同学。不要求你有 AI 背景,我尽量用人话讲清楚。 一、先搞懂:什么是"推理"? 你用 ChatGPT 提问,它"思考"几秒钟后给你一段回答——这个过程就叫 推理(Inference) 。 "推理"这个词听起来很玄,其实本质就是: 输入一段文本,输出一段文本 。和你在键盘上打字差不多,只是大模型"打字"的速度是每秒钟几十到几百个字。 一次推理 = 两个阶段:预填充 + 解码 很多人以为模型"回答"是一步完成的,其实内部被切成了两个画风完全不同的阶段。理解这两个阶段,后面所有内容(优化技术、选框架、买服务器)都会豁然开朗。 阶段一:预填充(Prefill)——"读题" 你发过去的所有内容(提示词 + 对话历史 + 问题),模型要 一次性全部读完 ,理解上下文,并"想好"第一个字该输出什么。 特点: 并行计算 ,几千上万个 Token 同时处理,吃的是 算力(FLOPS) 决定的指标: TTFT(首字延时) ——你按下回车后,等待第一个字蹦出来的时间 你输入越长(比如贴一篇 8 万 Token 的文档),预填充越久,首字等得越久 阶段二:解码(Decode)——"答题" 想好第一个字之后,模型开始 一个 Token 接一个 Token 往外蹦 ,直到生成结束。
大模型推理入门:从原理到实践 写给谁看的? 听说过 ChatGPT、DeepSeek、通义千问,想搞明白"大模型到底是怎么回答问题的"、想了解本地部署和推理框架区别的同学。不要求你有 AI 背景,我尽量用人话讲清楚。 一、先搞懂:什么是"推理"? 你用 ChatGPT 提问,它"思考"几秒钟后给你一段回答——这个过程就叫 推理(Inference) 。 "推理"这个词听起来很玄,其实本质就是: 输入一段文本,输出一段文本 。和你在键盘上打字差不多,只是大模型"打字"的速度是每秒钟几十到几百个字。 一次推理 = 两个阶段:预填充 + 解码 很多人以为模型"回答"是一步完成的,其实内部被切成了两个画风完全不同的阶段。理解这两个阶段,后面所有内容(优化技术、选框架、买服务器)都会豁然开朗。 阶段一:预填充(Prefill)——"读题" 你发过去的所有内容(提示词 + 对话历史 + 问题),模型要 一次性全部读完 ,理解上下文,并"想好"第一个字该输出什么。 特点: 并行计算 ,几千上万个 Token 同时处理,吃的是 算力(FLOPS) 决定的指标: TTFT(首字延时) ——你按下回车后,等待第一个字蹦出来的时间 你输入越长(比如贴一篇 8 万 Token 的文档),预填充越久,首字等得越久 阶段二:解码(Decode)——"答题" 想好第一个字之后,模型开始 一个 Token 接一个 Token 往外蹦 ,直到生成结束。 特点: 串行生成 ,每生成一个 Token 都要把模型权重从显存里读一遍,吃的是 显存带宽(GB/s) 决定的指标: TPS(输出吞吐) ——你看到回答往外"打字"的快慢 模型越大,每次要读的权重越多,单流速度越慢 💡 一句话心法(后面反复用到) : 算力决定首字延时,带宽决定输出速度。
行动建议:收藏这篇,下次碰到同类问题先翻出来对照做一遍。好经验的价值,在于用起来。你最近被这类问题卡过吗? 来源|博客园《大模型推理入门:从原理到实践》,https://www.cnblogs.com/xiaobaiysf/p/22957090.html
评论(0)
暂无评论,来抢第一条。