阅界资讯

1318 赞的灵魂拷问:真有人把 Claude 换成本地模型当主力吗

阅阅界编辑部2阅读2分钟

6 月中旬 HN 上有个帖子,标题问得特别实在:真有人把 Claude 或 GPT 换成本地模型当日常主力吗?1318 个赞,上百条回复,清一色是带着配置单来的实测。这篇把最高赞的几派答案捋出来,帮你省下爬楼的两小时。

先说换成的。最高赞之一来自 Qwen 3.6 27B 用户:效果约等于 Haiku 4.5,看任务能摸到 Sonnet 的边。另一位壕配了两张 RTX Pro 6000,跑 DeepSeek V4 Flash,160 token 每秒,代码让它写,另起一套系统自动审,偶尔接 Pi 工具,速度快到飞起,留在云端纯属习惯。还有位玩 Strix Halo 的,minimax 2.7 量化版跑 30 token 生成、220 token 提示词处理,慢但能断网干活,幸福感拉满。

翻车的同样精彩。M4 上跑 Gemma 4 的,速度比云端差一截,还缺企业级选型工具,不知道哪款模型配哪种活。最逗的是一位拿 AVX512 矩阵转置考模型的:云端模型玩一样轻松,Kimi 2.6 和 GLM 5.1 全军覆没。他的测试机是傲腾加大内存,整夜跑大模型只有 0.7 token 每秒,行为艺术本术了。

评论区还吵出三个方法论。细节派要求报参数必须报全:量化版本、llama 参数、上下文长度、显卡和显存,缺一个都是耍流氓。偷懒派支招:直接把 OpenRouter 接到编程 Agent 上,开源权重全在那,自己试比看一百条回复管用。脑洞派已经想到下一步:给常用模型做 RLHF 微调,甚至搞分布式 AI,SETI 找外星人能众包,推理为什么不行。

国内读者抄作业指南,按预算分三档。苹果党:M 系先从 Qwen 3.6 27B 这类甜点尺寸试起,别一上来就啃 400B 的大家伙,128G 内存都塞不下。显卡党:N 卡直接上量,量化版加 OpenRouter 路由,云端当备胎。极客党:Strix Halo 玩家去扒那个工具箱项目,家庭实验室方案帖里也有现成的。记住细节派的忠告:晒成绩先晒配置,否则等于没说。

一句话总结这场讨论:能换,但得看活。写单测、改小函数、断网场景,本地已经能打;重构大仓、啃硬核算法,云端继续值回票价。先拿 OpenRouter 把开源模型全试一遍,你的答案和别人的答案,大概率不一样。

来源|Ask HN 讨论,1318 分,https://news.ycombinator.com/item?id=48542100

海外技术译文本地模型HN讨论实测

评论(0)

暂无评论,来抢第一条。