閱界資訊

第390期:沒有語料,大模型就是智障

閱閱界編輯部2閱讀2分鐘

如果現在做一個問卷調查,問大家“你覺得大模型是否具有智能?”我相信,大多數人會是肯定的回答。哪怕現在只是 AI 的初級階段,大模型已經能夠替代很多的人類智力勞動,確實非常神奇。但是,我們不要忘記真實情況,大模型不是魔法,更不是具有自主智能的“硅基智能體”,而是基於統計規律的語言模型,它的一切行爲都基於數學計算。最好的證據就是,如果讓它解決沒有訓練過的題目,也就是不存在統計規律的話,它根本解不出來。這就是我今天想分享的一個實驗。

兩位國外的研究者找了五個主流的大模型:GPT-5.2、O4-mini、Gemini 3 Pro、Qwen3-235B、Kimi K2。他們讓大模型使用五種小衆的編程語言——Brainfuck、Befunge-98、Whitespace、Unlambda 和 Shakespeare——來編程解決各種問題。這些小衆語言的共同特徵是,網上很少有它們的資料,因此不能用來訓練大模型。大家猜猜看,結果怎麼樣?

實驗結果用一句話總結,就是大模型的表現一塌糊塗。這五個大模型的平均答題正確率僅爲3.8%,即100道題可以答對3.8道。相比之下,它們處理 Python 問題的正確率可以達到90%。更尷尬的是,僅有的那幾道答對的題目,都是入門級。更難的級別(初級、中級、高級),所有五個大模型的正確率都爲0。

這個實驗充分說明了,大模型的表現(智能程度)首先由訓練材料決定:訓練的語料越多,表現越好,比如 Python 的語料遍地都是,大模型因此極其擅長解決 Python 問題;訓練的語料越少,大模型表現就越差,簡直跟智障一樣,沒什麼用處。那麼,一個讓人好奇的問題就來了:如果某種冷門語言沒有語料,但有一本很詳盡的《使用手冊》,我們讓大模型學習這本手冊,它是否就能學會這種冷門語言編程呢?

來源|阮一峯科技愛好者週刊第 390 期,

每週精選周刊头条

評論(0)

暫無評論,來搶第一條。