跳到正文
首页文章Kimi K3 2.8 万亿、Qwen3.8 2.4 万亿,开源对我意味着什么

Kimi K3 2.8 万亿、Qwen3.8 2.4 万亿,开源对我意味着什么

Kimi K3 和 Qwen3.8 先后开源,参数量分别是 2.8 万亿和 2.4 万亿。我部署过的开源模型只有 SD 1.5 这类图像模型,推理服务器是四张 4090,今年没用开源语言模型做过任何事。现在看开源模型,我第一看许可证;可当年用 SD 1.5 时,许可证其实没人专门确认过。

开源模型KimiQwen
Kimi K3 2.8 万亿、Qwen3.8 2.4 万亿,开源对我意味着什么 封面图

7 月 17 日 Kimi K3 开源,2.8 万亿参数;三天后 Qwen3.8 也开源了,2.4 万亿。

我部署过的,只有图像模型

我自己下载、部署过的开源模型,只有 SD 1.5 这一类图像模型。Smart Photo 的基座就是它,推理跑在四张 4090 上,我们在上面训过品类 LoRA。

开源语言模型,今年我什么都没做。一直在关注,但没有一个真的放到自己机器上跑过。

所以看到 2.8 万亿和 2.4 万亿参数,第一反应是跑不动。这样的参数规模,不是几张 4090 的事。

四张 4090,能跑什么

Smart Photo 的推理服务器是四张 4090,一张 24G 显存,加起来 96G。四张卡平时白天跑生成,夜里基本空着。

跑 SD 这类图像模型,这个配置很宽裕,生成、训练 LoRA 都够用。2.4 万亿到 2.8 万亿参数的语言模型,就是另一个世界了。就算压缩到很小,光权重就要上千 G,四张 4090 连装都装不下。

如果要在这四张卡上跑一个语言模型,该从哪个量级试起,我其实没想过。今年没碰开源语言模型,这个问题也就一直没冒出来。

所以 2.8 万亿和 2.4 万亿这两个数字,对我来说不是能不能跑的问题,是离得有多远的问题。

看开源模型,先看许可证

不过我看开源模型,第一看的其实不是参数量,是许可证,能不能商用。

说来有点不好意思,这个习惯不是当年用 SD 1.5 的时候就有的。那时候许可证没人专门确认过,开源,大家都在用,就用了。后来生成的图要上架、要投广告,回头想才觉得,这一关应该放在最前面。

当年没确认,也不是谁偷懒。那时候大家都在试,关注的是能不能出图,许可证那一页,没人想到要翻。

SD 1.5 的许可证允许商用,只是列了一些不能拿来做的事。我们算是运气好,不是做对了。模型再好,许可证不让商用,对要上架、要投广告的图来说,后面都不用谈。

开源这两个字,落到许可证上差别很大。有的完全开放,有的限制用途,有的规模到了一定程度要另外申请。每次看到开源,我都要先翻到许可证那一页。

在 Hugging Face 上看

开源模型,我主要在 Hugging Face 上看。

一个模型页面点进去,我先翻许可证那一栏,再看模型卡上写的用途和限制,最后才看参数和成绩。这个顺序和页面的设计是反着的,页面上最显眼的是成绩,许可证往往在不起眼的地方。

有些许可证写得很清楚,完全开放;有些看着开放,细读下来有条件,比如用户规模超过多少要另外申请,或者不能拿来训练别的模型。对大公司是条款里的细节,对要把结果拿去商用的人,是前提。

这两个开源模型,我能用上的是什么

那 Kimi K3 的 2.8 万亿和 Qwen3.8 的 2.4 万亿参数,对我这样的人意味着什么。

它本身我拿不动。能用上的,是它带来的东西:有人拿它蒸馏出小模型,有人把它放到云上按量卖,价格比闭源低。权重公开,这些才有可能。

但这些二手的东西,也得再看一遍许可证。蒸馏出来的模型能不能商用,云上服务的条款怎么写,都不一定和原模型一样。

蒸馏出来的小模型,才可能是四张 4090 装得下的那一类。所以对我来说,这两个模型开源最实际的意义,是它可能让某个几十 B 的模型变得更好。

今年,开源语言模型我什么都没做

一直在关注,却什么都没做,原因很简单:手上没有一件非它不可的事。

我日常用的语言模型,都是订阅的服务,够用,也方便。内部知识问答走的是云厂商的接口,想过搬回内网,也还没动。开源语言模型要自己部署、自己维护,没有一件事逼着,关注就停在关注。

这大概也是很多人和开源模型的关系:知道它在那里,知道它越来越好,等哪天真需要了,再去翻许可证。

同一条新闻,三件事

对训基座的公司,开放这两个模型的权重,是能拿来接着训的底子;对做应用的公司,是多了几家更便宜的云服务可选;对我这种只部署过图像模型的人,是一个信号,开源和闭源的差距又小了一点。

三种人看的是同一条新闻,得到的是三件事。

里程碑在别处

所以对我来说,今年值得关注的开源,不是参数最大的,是那些能进内网、许可证干净、商用没有顾虑的。

等哪天真要用,我大概会先看许可证,再看四张 4090 装得下多大的,最后才看成绩。顺序和看新闻的时候,正好反过来。

2.8 万亿和 2.4 万亿,是新闻里醒目的数字。对一个不训基座、今年还没碰过开源语言模型的人,里程碑在别处。

问问 KANG AI

想了解我什么?