跳到正文
首页文章国产模型调用量反超那周,我想起了当时选 GPT-4o mini 的理由

国产模型调用量反超那周,我想起了当时选 GPT-4o mini 的理由

OpenRouter 和斯坦福 HAI 的数据说,中国模型的周调用量首次超过美国,我不意外。去年给文案模块选 GPT-4o mini,主要是因为英文 Listing 的质量,当时拿十来条文案和 DeepSeek 比过,英文偏直译。如果重新考虑旧模块的选型,我最没把握的是 Shopee 上的东南亚语言。

模型选型国产模型文案
国产模型调用量反超那周,我想起了当时选 GPT-4o mini 的理由 封面图

这个月看到一组数据,OpenRouter 和斯坦福 HAI 联合发的:中国模型的周调用量首次超过美国。

我不意外。便宜、中文好、接口稳,这一年早有感觉。

去年选 GPT-4o mini,是因为英文

去年在上一家公司,给 Smart Photo 接文案模块,选的是 GPT-4o mini。主要理由只有一条:英文 Listing 的质量。

文案模块写的是多语言 Listing,量最大的是亚马逊英文。英文 Listing 要读起来像本地卖家写的,不能像翻译过去的。这一条在跨境电商里很实际,买家看得出来。

当时正式比过国产模型,比的是 DeepSeek,拿了十来条文案。中文没问题,英文写出来偏直译:句子是对的,但语序和用词,像是在中文里想好了再换成英文。GPT-4o mini 那边自然一些。就这一条,定了。

十来条,够看出什么

十来条不多。现在回头看,它够看出一件事,不够看出另一件。

够看出的是风格。直译的毛病,不需要很多条,读几条就能感觉到,每一条都带着同样的痕迹:先按中文的顺序想好,再一个词一个词换成英文。十来条里,这个痕迹是一致的。

不够看出的是稳定。一个模型在十来条里表现一致,不代表在几千条里也一致。去年那次,我们其实只回答了它写得像不像,没回答它每次都写得一样不一样。

那时候风格差得明显,前一个问题就够做决定了。今年如果再比,差距小了,后一个问题就躲不开。

调用量反超说明了什么

调用量反超说明的,主要是觉得便宜、好用、够用的人多了。这和英文 Listing 像不像本地卖家,是两个问题。调用量里有大量中文场景,有大量代码和对话,这些国产模型确实强。

而且调用量是一个总数。总数反超,不代表每一类任务都反超。写英文 Listing,是一类很窄的任务,窄到在总数里几乎看不见。

所以我不会因为这组数据,就觉得当时选错了。但它是一个信号:一年过去,差距可能已经不是去年那样了,值得认真再比一次。

回看旧模块,如果换,最担心的是多语言

假如重新做那次选择,我最担心的不是英文,是多语言。

当时的文案模块除了亚马逊英文,还覆盖 Shopee、TikTok Shop 的几种语言。英文是量最大的,也是最好比的,拿一批出来,好坏一眼就能看出来。其他几种语言不一样,写得好不好,不容易找人判断,往往要靠平台和运营的反馈,一轮下来要很久。

换一个模型,英文也许比完就能定;其他语言的质量稳不稳,要跑一段时间才知道。这段时间里出的文案,都在平台上挂着。文案挂上去以后,买家不会告诉你这段话读着别扭,只会少下单。

最没把握的,是东南亚语言

几种语言里,我最没把握的是 Shopee 上的东南亚语言。

那时英文好坏,团队里有人能读,读几条就有个大概。东南亚那几种语言,写得地道不地道,判断只能靠别人:靠平台的反馈,靠当地的运营,或者靠买家的反应。每一种都来得慢,而且不一定准。

所以换模型这件事,在英文上是一次比较,在东南亚语言上更像一次赌。赌输了,不会马上知道,会在一段时间里悄悄地让商品页变差。

我自己偶尔用

我自己平时,也偶尔用国产模型。

这组数据里的反超,大概不是我这样的人贡献的,更多来自在意价格的、做中文场景的、自己部署的人。

一个人平时用什么,和一个模块该用什么,是两件事。前一件看习惯,后一件看质量。我个人偶尔用,不影响认真比;认真比完换了,也不影响我个人照旧。调用量说的是一大群人的选择,换不换,要看的是这一个模块的质量。

比的方式

所以这组数据对我来说,不是换的理由,是比的理由。

真比的话,我大概会分开来:英文拿同一批商品,两边各跑一轮,这次条数要比去年多,多到能看出稳不稳,不只是看直译的问题还在不在;其他语言不急,先挑一个量小的平台试,跑够时间再说。

去年那次比较,理由是对的。假如今年再比一次,理由可能还对,也可能不对了。

问问 KANG AI

想了解我什么?