閱界資訊

第408期:你需要知道的 AI 緩存知識

閱閱界編輯部2閱讀3分鐘

大模型的價格,主要是 Token 的輸入價格和輸出價格,這個很容易理解。但是,還有一項“輸入 Token 的緩存命中價格”,這是什麼東西?上圖是 DeepSeek V4 Flash 模型的定價,可以看到緩存命中的輸入價格只有2分錢,足足是未命中的輸入價格的五十分之一!爲什麼相差這些大?我們能不能充分利用緩存,來降低費用呢?我對於這些問題,以前也不是很瞭解,最近看了一篇文章,終於理清了思路,今天就來分享。(1)模型輸入的收費原因

大家知道,使用大模型的時候,需要先有提示詞。大模型會將提示詞分解成 Token,再將 Token 轉成向量值,然後計算所有 Token 之間的注意力關係。這一步非常消耗算力,因此模型公司會對輸入 Token 收費。你的提示詞越多,輸入 Token 的費用就越高。(2)輸入緩存的作用對於多輪對話和長程任務,每一輪都需要把以前步驟的輸入輸出結果,提交給模型。

我們可以想到,這些每一輪額外增加的提示詞是不變的,以前都已經處理過了。模型完全不必要對這些“前綴”每次進行重複計算,只要把以前的計算結果緩存起來,下一次再取出來用就行了。這就是爲什麼需要緩存,它可以大大節省不必要的算力消耗,加快模型處理。這也是它便宜的原因,因爲只要命中緩存,基本不消耗算力,收取的費用實際上是儲存空間的費用。(3)緩存的時間期限緩存有時間期限,長期保存並無意義。如果一段時間沒有用到這些緩存,服務器就會把緩存刪除。

根據前面引用文章的測試,各家公司的緩存保存時間不一樣。- Anthropic:5分鐘- DeepSeek:10分鐘- OpenAI:10分鐘~30分鐘逐步失效- Google:1小時內逐步失效以 DeepSeek 爲例,在10分鐘以內,緩存就是有效的,命中緩存只收取2分錢。如果對話的間隔特別久,下一次輸入跟上一次之間超過了10分鐘,緩存就被刪除了,模型收到上一輪的提示詞,就不得不重新計算,收取的費用就變成了1元。(4)保持緩存有效

由於緩存命中與未命中之間,有巨大的價差。用戶的 AI Agent 工具往往會想辦法,儘可能延長緩存的保存時間。當用戶長時間不操作、也不退出的時候,大多數 AI Agent 會每隔30秒,自動向服務器發送一個請求,讓緩存保存激活狀態。有些模型有專門的緩存激活接口,還有一些沒有。這時可以用笨辦法,Agent 自動重複發送一次以前的提示詞,確保緩存激活。

不過,激活請求也會產生費用。每隔30秒發送一次,如果10分鐘沒有輸入,就會發送20個激活請求。時間一長,費用也不低。前面說過了,現在各家模型的實際緩存期限,最短也有5分鐘,因此30秒一次的激活請求,似乎頻率太高了。所以,最新的建議是,可以改成每4分鐘自動激活一次緩存。

來源|阮一峯科技愛好者週刊第 408 期,

每週精選周刊头条

評論(0)

暫無評論,來搶第一條。