閱界資訊

第410期:你需要知道的 AI 三種機制

閱閱界編輯部2閱讀3分鐘

這是“AI 小知識系列”的第三篇,前兩篇分別是《大模型需要多少內存》和《AI 緩存是什麼》。我分享一些自己的學習筆記,用來理清對於 AI 技術的理解。我儘量寫得通俗,希望對大家有用。今天談一個基本問題:AI 爲什麼能夠回答我們的提問,它怎麼會知道答案?你可以找到很多這方面的論文和書籍,詳細解釋大模型的運作,通常非常難懂。但是,對於非專業人士,只要簡單知道 AI 的三個機制,就可以了。(1)參數機制

在宏觀層面,所有大模型都是對人類知識的建模。它建立了一個數學模型,用來描述所有的人類知識。怎麼描述呢?它使用的是一種參數機制,將知識分解成一個個“詞元”(token),然後計算所有詞元之間的數學關係。這個過程稱爲“訓練”。

這種數學關係使用無數個參數來表示。舉例來說,大模型 GLM 5.3 有7440億個參數,這些參數用來構建所有詞元之間的關係(也就是權重)。所謂“訓練”,其實就是找出這個7440億個權重,描述人類知識的構成,也就是所有詞元之間的關聯。一旦訓練完成,我們向大模型提問時,它就會根據這些權重,找出最可能的詞元,從而生成符合概率的答案。所以,大模型本質上是一種“壓縮-生成”機制,將人類知識抽象在無數參數之中,後期再生成出來。(2)推理機制

不難理解,參數越多,模型的效果越好。因爲更多的參數意味着,可以更精確地描述各種知識,從而可以更準確地將其還原出來。但是,一方面,參數不可能無限增加,訓練和使用成本將直線上升,使用時的運算時間也會變長。另一方面,也沒有必要包含所有的知識,很多知識不需要包含在參數之中,完全可以通過邏輯推理獲得。舉例來說,只需要知道某個城市的人口出生率和死亡率,就馬上知道了人口的淨增長率。這不需要記憶,可以通過推理得到。

大模型就依靠推理機制,根據參數包含的知識,從邏輯規則出發,推斷出那些它沒有包含的知識。(3)聯網機制不管模型有再多的參數、再強的推理,它不可能包含所有的知識,總有一些問題它回答不了。比如,你問大模型,今天股票的收盤指數是多少,它就回答不了。參數裏面不包含這個知識,也無法推理得到。這時,模型就要依靠 Agent 或應用框架提供的聯網機制,自動去互聯網搜索那些它不知道的知識。(4)總結正是有了以上三種機制,AI 才能正確回答我們的問題。

首先,參數機制提供了大模型的基本知識;其次,推理機制產生通過推理得到的知識;最後,聯網機制用來獲取前兩種機制都無法得到的知識。

來源|阮一峯科技愛好者週刊第 410 期,

每週精選周刊头条

評論(0)

暫無評論,來搶第一條。