閱界資訊

1318 讚的靈魂拷問:真有人把 Claude 換成本地模型當主力嗎

閱閱界編輯部1閱讀2分鐘

6 月中旬 HN 上有個帖子,標題問得特別實在:真有人把 Claude 或 GPT 換成本地模型當日常主力嗎?1318 個贊,上百條回覆,清一色是帶着配置單來的實測。這篇把最高讚的幾派答案捋出來,幫你省下爬樓的兩小時。

先說換成的。最高贊之一來自 Qwen 3.6 27B 用戶:效果約等於 Haiku 4.5,看任務能摸到 Sonnet 的邊。另一位壕配了兩張 RTX Pro 6000,跑 DeepSeek V4 Flash,160 token 每秒,代碼讓它寫,另起一套系統自動審,偶爾接 Pi 工具,速度快到飛起,留在雲端純屬習慣。還有位玩 Strix Halo 的,minimax 2.7 量化版跑 30 token 生成、220 token 提示詞處理,慢但能斷網幹活,幸福感拉滿。

翻車的同樣精彩。M4 上跑 Gemma 4 的,速度比雲端差一截,還缺企業級選型工具,不知道哪款模型配哪種活。最逗的是一位拿 AVX512 矩陣轉置考模型的:雲端模型玩一樣輕鬆,Kimi 2.6 和 GLM 5.1 全軍覆沒。他的測試機是傲騰加大內存,整夜跑大模型只有 0.7 token 每秒,行爲藝術本術了。

評論區還吵出三個方法論。細節派要求報參數必須報全:量化版本、llama 參數、上下文長度、顯卡和顯存,缺一個都是耍流氓。偷懶派支招:直接把 OpenRouter 接到編程 Agent 上,開源權重全在那,自己試比看一百條回覆管用。腦洞派已經想到下一步:給常用模型做 RLHF 微調,甚至搞分佈式 AI,SETI 找外星人能衆包,推理爲什麼不行。

國內讀者抄作業指南,按預算分三檔。蘋果黨:M 系先從 Qwen 3.6 27B 這類甜點尺寸試起,別一上來就啃 400B 的大傢伙,128G 內存都塞不下。顯卡黨:N 卡直接上量,量化版加 OpenRouter 路由,雲端當備胎。極客黨:Strix Halo 玩家去扒那個工具箱項目,家庭实验室方案帖裏也有現成的。記住細節派的忠告:曬成績先曬配置,否則等於沒說。

一句話總結這場討論:能換,但得看活。寫單測、改小函數、斷網場景,本地已經能打;重構大倉、啃硬核算法,雲端繼續值回票價。先拿 OpenRouter 把開源模型全試一遍,你的答案和別人的答案,大概率不一樣。

來源|Ask HN 討論,1318 分,https://news.ycombinator.com/item?id=48542100

海外技術譯文本地模型HN讨论实测

評論(0)

暫無評論,來搶第一條。