便宜四十倍的模型,和四百兆的翻译模型,同一天
智谱开源 GLM-5.3-Flash,定价是 Opus 4.8 的四十分之一,我拿写代码试过,够用;腾讯把翻译模型压到四百多兆,已经用在 B 站直播弹幕上。我之前那家跨境电商,十来个人的客服看外语评论用平台自带翻译,最头疼的是翻译不准。便宜模型跑审校规则,我最怕该退的没退;端侧翻译最可能有用的,是客服离线用。

今天两条消息放在一起看。智谱开源了 GLM-5.3-Flash,定价是 Opus 4.8 的四十分之一。腾讯把翻译模型压到四百多兆,能跑在手机上,已经用在了哔哩哔哩的直播弹幕翻译里。
便宜和小,今年一直在往这个方向走,今天又走了一步。两件事放在同一天,正好一件关于钱,一件关于地方。
便宜的那个,我试过
GLM-5.3-Flash 我试过,拿的是写代码,够用,便宜也是真的便宜。四十分之一的价格,已经便宜到不用算账,只用想怎么用。
试完自然想到以前做的文案审校。那几十条规则,当时跑在一个不便宜的模型上。四十分之一的价格,意味着同样的钱可以跑很多遍,或者拿两个模型各审一遍,取交集。
写代码够用,不等于审校够用
拿写代码试,够用。可写代码够用,和审校够用,是两回事。
写代码有一个很好的检验:跑一下。能跑,基本就对;跑不起来,错在哪一行,报错会告诉你。一个便宜的模型写的代码好不好,很快就知道。
审校没有这个检验。一句文案放过去了,不会报错,要等上了架,被平台发现,或者被买家看到,才知道放错了。便宜模型在写代码上的够用,搬不到审校上。
所以试写代码的结论,只能说明它的能力大致在哪个水平,不能说明它在审校上靠不靠得住。
最怕的是该退的没退
可审校这件事,我最怕的是该退的没退。
审校会犯两种错。一种是不该退的退了,误伤一句本来没问题的文案,重写一遍就好,多花一点时间。另一种是该退的没退,一句违规的话、一个平台禁用的词被放过去,上了架,被平台发现,就是另一回事了。
两种错的代价不对等。第二种还有一个麻烦:它是安静的。不该退的退了,会有人来问为什么;该退的没退,没有人会来问。便宜的模型如果在第一种错上多一点,我能接受;在第二种上多一点,就不行。所以换不换,看的不是它平均审得怎么样,是它放过了哪几句。
真要比,得拿一批已经审过的文案让它再跑一遍,专门看它漏掉了什么。漏掉的里面有没有真正要命的,比总的准确率重要。
客服看评论,用的是平台自带翻译
小的那个,我想到的是客服。
我之前那家跨境电商,客服十来个人,看外语评论和买家消息,用的是平台自带的翻译。能用,但要在平台的页面里用,要联网,翻得怎么样也由平台说了算,不同平台之间还不一样。
几百兆的翻译模型能跑在手机上,意味着客服可以离线翻译。不依赖某个平台的页面,几个平台的消息都能用同一个翻译来看,内容也不用传出去。
对客服来说,这是一个很具体的改善:在哪看都行,翻得一致。当然,前提是它翻得比平台准。小,不等于准,这件事也得先试。
客服最头疼的,是翻译不准
客服最常遇到的困难,是翻译不准。
一句抱怨翻过来,语气没了;一个具体的问题翻过来,意思走了样。客服按翻过来的意思回,买家那边读到的,可能是另一件事。一来一回,问题没解决,火气先上来了。
平台自带的翻译不准,客服没有别的选择,只能将就,或者自己再想办法对照。十来个人,那时候每天都在碰这件事。
离线的小模型如果翻得准一些,省下的不只是来回切工具的时间,是那些因为翻错多出来的来回。
客服那件,为什么风险小
客服翻译翻错了,后果是一次沟通不顺。客服还能追问,买家还能再说一遍,错了能马上改。
审校放过了,后果是一条违规的文案挂在平台上,不会有人来追问,要等出了事才知道。
同样是换一个便宜的、小的模型,放在能马上发现错误的地方,风险小;放在发现不了错误的地方,风险大。先做哪个,看的不是哪个省钱多,是哪个出了错能被看见。
从想想,到可以排期
这两件事我都没做成,现在也不在那边了。写下来,更像是留给那边的两个建议:审校要先拿旧文案试它漏了什么,翻译要拿客服每天的消息试它准不准。但今天以后,它们从想想变成了可以排期的事。
便宜和小变成默认以后,问题就不再是能不能,而是先做哪个。审校那件要小心,先拿旧文案试;客服那件风险小,可以先做。