国产Kimi K3硬刚Fable 5:1030个agent任务实测,开源便宜还能组合最强
阅阅界编辑部3阅读1分钟
7 月最让国人长脸的一场实测:国产开源 Kimi K3,对打闭源 Fable 5,打了 1030 个 agent 任务。结论很提气:Kimi K3 单挑不虚,配合路由,两者组合就是最强。HN 原帖 2107 分,Fireworks 7 月 21 日发的深度报告。
先说单挑。同一套 harness、同一批任务,1030 个真实 agent 循环,覆盖写代码、调工具、长流程。Kimi K3 是前沿水准的开源模型,价格只是零头。便宜大碗到什么程度?报告里直接给了账本,同样质量,账单差出数量级。
更有意思的是组合。Oracle 路由(作弊式最优路由:每个任务跑遍所有模型再选最便宜做对的)显示,72–96% 的任务就该给 K3。翻译成人话:日常活全扔给便宜的 K3,只有真正的硬骨头才上 Fable,整体又强又省。近乎完美的路由器是可能的,差的是更多路由数据和真实生产流量。
国内开发者怎么用?三条:个人 agent、Copilot 类工具,默认 K3 起步,省钱;做路由网关的,照这个思路分层;关注月之暗面后续开源动态,这次 K3 是 open weights,本地和云上都能玩。开源必须赢,这次是国产赢。
来源|Fireworks AI 实测报告,HN 2107 分,https://fireworks.ai/blog/kimik3-fable
本文所属专栏
AI 在本地跑大模型装进自己电脑:部署、实测与避坑,连载中。
评论(0)
暂无评论,来抢第一条。