1250 亿参数的大模型,在家用游戏 PC 上跑起来了:国产 Qwen,一键安装断网能用
阅阅界编辑部2阅读2分钟
以前觉得,大模型是巨头的玩具,动不动 A100 起步。但这个叫 Strata 的开源项目把这件事干成了:一台普通游戏 PC,12G 显存的显卡,就能跑起 1250 亿参数的 Qwen3.8-Flash-Next。GitHub 一周 1.1 万 star,HN 685 分,今天技术圈最火的项目之一。
它好在哪?第一,门槛低到离谱。Windows、Linux 都行,一键安装,N 卡 A 卡都吃,作者实测 RTX 5070、RX 9070 XT 全能跑,显存越大越快,RTX 3090 这种老卡反而更香。第二,跑的是国产 Qwen 系模型,中文天然好,项目自带简体中文说明,读图、写代码、接 coding agent 都行。第三,跑完之后,它在你本机开了个兼容 OpenAI 和 Anthropic 的接口,什么 Cherry Studio、CLI 工具,直接连 localhost 就能用。
速度呢?实测数据都摆出来了。5070 上回答生成每秒 50–90 个 token,比你阅读速度快;吃进去的提示词更快,几千 token 的文档秒读。12G 显存就用最小量化版,24G 直接起飞。注意 HN 标题里那个 100T/s,说的是读提示词的峰值,别当成打字速度,实际体验看生成那档就行。
国内用户怎么玩?三步:按 README 装、选个量化版本、下好权重断网跑。M 系 Mac 用户先别急,这是给 N/A 卡和 Windows/Linux 的,Mac 玩本地大模型继续用 llama.cpp 那套。宿舍、家里有台游戏 PC 的,这个周末就能折腾起来。
来源|Hacker News 热议,项目 Strata,https://github.com/Niko1221/Strata
评论(0)
暂无评论,来抢第一条。