第381期:二、林俊暘的發言
4、千問是怎麼開源的千問的開源模型比較多,很多人問這是爲什麼?這起源於2023年8月3日,我們開源了一個小模型,它是我們內部用來做實驗的 1.8B 模型。我們做預訓練,資源畢竟有限,你做實驗的話不能通通用 7B 的模型來驗,就拿 1.8B 的來驗。
當時我的師弟跟我說,我們要把這個模型開源出去。我非常不理解,我說這個模型在2023年幾乎是一個不可用的狀態,爲什麼要開源出去?他跟我說 7B 很消耗機器資源,很多碩士生和博士生沒有機器資源做實驗,如果 1.8B 開源出去的話,很多同學就有機會畢業了,這是很好的初心。
幹着幹着,手機廠商跑來跟我們說 7B 太大,1.8B 太小,能不能給我們幹一個 3B 或 4B 的,這個容易,沒有什麼很難的事情。一路幹下來,型號類型越來越多,跟服務大家多多少少有一點關係。5、我們的追求是多模態模型我們自己內心追求的,不僅僅是服務開發者或者服務科研人員,而是能不能做一個 Multimodal Foundation Agent(多模態基礎智能體)。
我特別相信這件事情,2023年的時候大模型是一個大家都不要的東西,多多少少有那麼幾分大鍊鋼鐵的成分,多模態是我們從那時就一直想做的事情。
爲什麼呢?我們覺得如果你想做一個智能的東西,天然的應該是 Multimodal(多模態),當然帶有不同看法,各個學者都有一些看法,多模態能不能驅動智力的問題。我懶得吵這個架,人有眼睛和耳朵可以做更多的事情,我更多的考慮是 Foundation(基礎智能體)有更多的生產力,能不能更好地幫助人類,毫無疑問我們應該做視覺,我們應該做語音。
更進一步,我們要做什麼東西呢?Omni 的模型(全模態模型)不僅僅是能夠理解文本、視覺、音頻,我們可能還讓它生成文本、音頻。今天我們已經做到了,但是我們還沒有做到把視覺生成結合在一起。如果做到三進三出,我覺得至少是我個人喜歡的東西。
來源|阮一峯科技愛好者週刊第 381 期,
評論(0)
暫無評論,來搶第一條。