← 返回博客

从第 18 到第 1:开源 Kimi K3 压过付费旗舰,然后呢

从第 18 到第 1:开源 Kimi K3 压过付费旗舰,然后呢

用 AI 的人,上星期都听到同一声巨响:一个免费开源的模型,把付费旗舰从单项榜首拉了下来。

7 月 16 日,Moonshot AI(月之暗面)开源发布 Kimi K3。上线数小时,它在 Frontend Code Arena 的排名由第 18 位跳上第 1,得分 1679,压过 Claude Fable 5;七个分项赢了六个,只有 Gaming 一项屈居第二。开源模型在单项榜压过美系顶级闭源旗舰,这是第一次。

K3 是什么

三个数字看懂这个模型:

- 约 2.8 万亿参数,MoE(mixture of experts)架构,号称史上最大的开源模型;

- 1M token 的 context window,长文件与长任务是设计重点;

- 权重免费下载,可自行部署;kimi.com 免费档每日限量可用,API 按用量收费,定价约为 Fable 级旗舰的三分之一。

「开源」在这里的意思:模型的权重文件公开,任何人可以下载、研究、部署到自己的机器。好比餐厅把整本食谱连配方公开——照着做不收钱,上门吃他煮的才收钱。

冷静看:单项登顶,不是全面超越

两件事要分开。

第一,Frontend Code Arena 是「前端网页生成」的单项对战榜,名次由使用者投票决定。K3 在这个单项确实登顶,但综合能力榜上它排第 3,仍在 Claude Fable 5 与 GPT-5.6 Sol 之后,大致与 Claude Opus 4.8 同级。百米跑赢了,不等于十项全能冠军。

第二,榜单本身有局限。对战式榜单量度的是「观感上谁做得好」,与你手上任务的实际要求未必重叠;模型也可以刚好在榜单擅长的题型上特别强。榜单值得参考,但判准永远是你自己的任务。

即使打了这两个折扣,趋势仍然清楚:开源与闭源的差距,缩到了史上最窄。一年前「免费模型只是玩具」的说法,已经不成立。

选模型进入「按任务」时代

「一个模型通吃所有工作」的时代结束了。往后的理性用法,是按任务选模型:

任务合理选择
前端页面、快速原型K3 这类开源新贵值得一试
长文推理、严谨写作、复杂多步任务顶级闭源模型仍然明显领先
大批量、要求不高的机械工序便宜档模型或开源自部署,成本最低

这个转变对香港与中国用户反而有利。开源模型不设地区门槛,官方入口与自行部署都用得上;至于 Claude、GPT 系列这些顶级闭源模型,官方虽然不支持香港与中国,经稳定直连网关同样可以一个账户按用量使用——萃灵 Essevin 做的正是这件事:多个顶级模型一个账户,用多少付多少。开源的归开源,闭源的归闭源,各取所长,成本各自算得清清楚楚。

收尾

榜单每个月都在变,K3 不会是最后一个搅局者。与其追着榜单换工具,不如记住两条:判准是你的任务,不是排名;成本按用量算,不按品牌算。

*本文资料截至发稿日(2026 年 7 月 20 日),仅供一般参考,不构成任何建议;第三方产品之功能、价格与政策,以其官方最新公布为准;Essevin 服务详情以官网与 console 实际显示为准。