跳到正文
首页文章两周里四家发新模型,我把日常换成了 Astra

两周里四家发新模型,我把日常换成了 Astra

9 月初两周,Anthropic、Google、OpenAI、DeepSeek 先后发新模型。以前我日常用的是 Claude,这次拿手上的活试了一轮,试的主要是写代码,把日常换成了 Astra,到现在还在用。它好在想得更深,不满意的是额度不够。OpenAI 终止和 Cursor 的合作,我觉得离我远。判断一个模型值不值得换,我只做一件事:拿手上的活试。

模型发布工具链依赖
两周里四家发新模型,我把日常换成了 Astra 封面图

这两周的发布密度,大概是今年最高的。9 月 2 日 Anthropic 发了 Claude Fable 5.1 和 Mythos 5.1,3 日 Google 发了 Gemini 3.8 Flash,4 日 OpenAI 发了 GPT-6 Astra,11 日 DeepSeek 发了 V4.1-Flash,还降了价;同一天 OpenAI 开了 Agents API 和全双工的 GPT-Live-1。中间还夹着一条:OpenAI 8 月底宣布终止和 Cursor 的合作,11 月生效。

我把日常换成了 Astra

这两周我实际换掉的,是日常用的模型。以前日常用的是 Claude,现在换成了 Astra,到现在还在用。

今年我很少因为一次发布就换掉日常的东西。春天国内几家挤在一周里发模型,我一样都没换。这一次是例外。

怎么判断的

判断值不值得换,我只做一件事:拿手上的活试。

不先看跑分,也不先看别人的评测。Astra 出来以后,我先用它做了一个很小的游戏 Demo,写过一篇。之后又拿日常的活去试,试的主要是写代码,试下来觉得顺,就换了。

拿手上的活试,结论只对我有效,但对我是真的有效。跑分高的模型,未必在我那几件活上更好;评测里夸的能力,也未必是我每天要用的那一种。拿手上的活试,还有一个好处:试完就知道换过来以后每天是什么样,包括额度够不够。跑分不会告诉我这个。

好在想得更深

Astra 比原来好的地方,一句话说,是想得更深。

写代码的时候最能感觉出来:动手之前,它会先把要动的地方想一遍,想到的比原来多。问它一个方案,它会先说这个方案在什么情况下会出问题,再开始写。

想得深,意味着我要交代的少了。以前我得替它多想一些,现在它自己能想到更多,我补剩下的。

这对写代码的人来说,是很实在的差别。省下的不是打字的时间,是来回纠正的时间。

不满意的,是额度

Astra 让我不满意的地方,是额度不够。

想得深,用得就多。一个问题它想得越周全,消耗得越快。日常的活换过来以后,额度见底得比我预想的快。

这个问题我不陌生。春天 Claude 改成月度额度的时候,我就开始算着用。现在换到 Astra,又回到了算着用的状态,只是算的对象换了一个。

好的模型都贵,这不奇怪。只是日常换过来,意味着每天都在这个额度里过日子。想得深是好事,可每天都要惦记额度还剩多少,这件事本身有点累。

其他几个,没动

Fable 5.1、Gemini 3.8、DeepSeek V4.1,这几个我看了说明,没有专门去试。

不是它们不好,是换日常这件事,一次只能换一个。Astra 刚换上,还在适应,没必要同时再比几个。等用稳了,再看别的有没有值得试的。Fable 5.1 是 Claude 这边的新模型,要是日常还在 Claude 上,我大概会先试它;换到 Astra 以后,它就排到了后面。

从 Claude 换走,没那么容易

以前日常用的是 Claude,换走没那么容易。

Claude 那边有我攒了很久的东西:项目里的规则文件,写作和代码风格的要求,做事的习惯。换到 Astra,规则文件照着给就行,习惯要重新磨。

所以这次换,不是觉得 Claude 不好了,是 Astra 在我最常做的写代码这件事上,好得足够明显,明显到值得付这笔换的成本。

Cursor 那条,离我远

OpenAI 终止和 Cursor 的合作,新闻很大,我觉得离我远。

Cursor 我用过一阵,后来换了,现在不在我的工具里。一个编码工具的模型供应商说不供了,影响的是它的用户。我的代码在 GitHub,编码工具手上有备选,真有一个不能用,第二天就能接着干。

发布是它们的节奏

两周四家发布,我的结论还是那句:发布是它们的节奏,使用是我的节奏。

区别是这一次,它们的节奏里有一个正好踩中了我的。踩中的这一个,也有它的代价,额度就是。踩中了就换,没踩中就看看。至于怎么知道踩没踩中,还是那一条,拿手上的活试。

问问 KANG AI

想了解我什么?