閱界資訊

第381期:一、唐傑的發言

閱閱界編輯部2閱讀3分鐘

1、智譜的起源2019年,我們開始研究,能不能讓機器像人一樣思考,當時就從清華成果轉化,在學校的大力支持下,成立了智譜這麼一家公司,我現在是智譜的首席科學家。那個時候,我們實驗室在圖神經網絡、知識圖譜方面,在國際上做的還行,但我們堅定地把這兩個方向暫停了,暫時不做了,所有的人都轉向做大模型。2、泛化和 Scaling

我們希望機器有泛化能力,我教它一點點,它就能舉一反三。就和人一樣,教小孩子的時候,我們總希望教三個問題,他就會第四個、第十個,甚至連沒教過的也會。怎麼讓機器擁有這種能力?目前爲止,我們主要通過 Scaling(規模化)達到這個目標,在不同層面提高泛化能力。

(1)我們最早期用 Transformer 訓練模型,把所有的知識記憶下來。訓練數據越多、算力越多,模型的記憶能力就越強,也就是說,它把世界上所有的知識都背下來了,並且有一定的泛化能力,可以抽象,可以做簡單的推理。比如,你問中國的首都是什麼?這時候模型不需要推理,它只是從知識庫裏拿出來。

(2)第二層是把模型進行對齊和推理,讓它有更復雜的推理能力,以及理解我們的意圖。我們需要持續的 Scaling SFT(Supervised Fine-Tuning,監督式微調),甚至強化學習。通過人類大量的數據反饋,不斷 Scaling 反饋數據,可以讓模型變得更聰明、更準確。

(3)今年是 RLVR(強化學習與可驗證獎勵)爆發年。這裏的“可驗證”是什麼意思?比如,數學可以驗證、編程可能可以驗證,但更廣泛地,網頁好不好看,就不大好驗證了,它需要人來判斷。這就是爲什麼這個事情很難做,我們原來只能通過人類反饋數據來做,但人類反饋的數據裏面噪音也非常多,而且場景也非常單一。如果我們有一個可驗證的環境,這時候我們可以讓機器自己去探索、自己去發現這個反饋數據,自己來成長。這是我們面臨的一個挑戰。

3、從 Chat 到做事:新範式的開始大家可能會問,是不是不停地訓練模型,智能就越來越強?其實也不是。2025年初,DeepSeek 出來,真是橫空出世。大家原來在學術界、產業界都沒有料到 DeepSeek 會突然出來,而且性能確實很強,一下子讓很多人感到很震撼。

我們當時就想一個問題,也許在 DeepSeek 這種範式下,Chat(對話)差不多算是解決了。也就是說我們做得再好,在 Chat 上可能做到最後跟 DeepSeek 差不多。或許我們可以再個性化一點,變成有情感的 Chat,或者再複雜一點,但是總的來講,這個範式可能基本到頭了,剩下更多的反而是工程和技術的問題。

那麼,AI 下一步朝哪個方向發展?我們當時的想法是,讓每個人能夠用 AI 做一件事情,這可能是下一個範式,原來是 Chat,現在是真的做事了。當時有兩個方向,一個是編程,做 Coding、做 Agent;另一個是用 AI 來幫我們做研究,類似於 DeepResearch,甚至寫一個複雜的研究報告。我們現在的選擇是把 Coding、Agentic、Reasoning 這三個能力整合在一起。

來源|阮一峯科技愛好者週刊第 381 期,

每週精選周刊头条

評論(0)

暫無評論,來搶第一條。