跳到正文
首页文章小红书那个图像编辑模型,裁剪拼接好用,融合不行

小红书那个图像编辑模型,裁剪拼接好用,融合不行

在上一家公司做一轮五六家工具的竞品调研时,顺手试了小红书的 FireRed-Image-Edit-1.1,拿十来张服装图放进新场景。裁剪拼接和我们自己的抠图比,普通面料不差,薄纱和透明面料差得最多;融合露在光上。结论自己留了底:预处理没必要换。

商品图图像编辑小红书
小红书那个图像编辑模型,裁剪拼接好用,融合不行 封面图

小红书前几天发了一个图像编辑模型,FireRed-Image-Edit-1.1。宣传里有两件事:十几种元素可以自由融合,Agent 会自己裁剪拼接。

我试它不是专门去的。这是我在上一家公司做商品图工具时的一轮竞品调研,前后看了五六家能处理商品图的工具,想知道外面做到哪一步了。它刚好在那个时候发布,就顺手放进了名单。这个月我换到了弃疾数智科技,开始做餐参AI。

为什么要做这一轮调研

当时 Smart Photo 跑了两年多,基座还是 SD 1.5 加按品类训练的 LoRA。那两年外面的图像模型换了好几代,我需要隔一段时间看一次:我们的做法还站不站得住,哪一步已经有了更好的替代。

这一轮没有人布置,结论也是给自己留底的。不用汇报,看的时候反而能看得细一点,不只看宣传图,拿我们自己的商品去试。

拿的是服装图

FireRed 试的以服装为主,十来张,都是当时在用的商品原图,挂拍的、平铺的都有。做法很简单,给它一张商品图、一张场景图,让它把商品放进场景里。

选服装是有原因的。服装是容易露馅的品类,面料的褶皱、垂感、颜色,稍微一动就不像原来那件。拿难的试,差距最容易看出来。

裁剪拼接比我想的顺

先说好用的部分。它会自己把商品从原图里抠出来,按场景的比例放好,位置也大致合理。普通面料的领口、袖口这些边缘,抠得挺干净。

我把它和我们自己的抠图放在一起比。我们当时的流程里,商品图进来要先做一轮预处理:抠图、统一尺寸、清背景,这是单独的一步。它把抠和放两件事一次做完,在大部分图上,结果不比我们的差,操作上还省了一道。

差距最大的,是薄纱和透明面料

差距最大的,是薄纱和透明面料。

这类衣服本来就难抠。料子是半透的,边缘和背景混在一起,哪里算衣服、哪里算背景,本身就模糊。在我们自己的流程里,这类面料也不好处理。

FireRed 在这几张上,边缘处理得比我们粗。透的地方,要么被抠掉了一块,要么把原来背景的颜色带了进来。放进新场景以后,这些毛病被放大,一眼就能看出来。

所以对比下来是这样一个结果:普通面料,它和我们差不多;难的面料,它比我们差。难的那部分,恰恰是商品图里最容易出问题、也最需要做好的部分。

融合露在光上

融合就不行了,而且问题很集中:光影方向对不上。

场景里的光从一边来,桌面上的影子往另一边倒。商品放进去以后,衣服身上的光还是原图拍摄时的光,亮的那一侧和场景是反的。远看不一定注意到,放在商品页上多看两眼,就知道是贴上去的。

商品和场景不在同一束光下,是生成商品图时最常见的一种不像。Smart Photo 后来按品类训练 LoRA,花了很多功夫才让这类图少一些。换一个新模型,第一个露出来的还是这里。

预处理不换

看完,我对自己流程的判断是:预处理没必要换。

普通面料上,它省的那一道操作,放到我们当时每天的量里,省下的时间有限;难的面料上,它不如我们。再加上它是外部服务,商品图要传出去,而未上市的商品图不出去,这条线是做 Smart Photo 时就定下的。几样放在一起,换的理由不够。

五六家看下来,这一家在调研表里被我放在预处理那一栏,不在生成那一栏。它是一个更好的拼接工具,不是一个更好的生成工具。拼好的图,商品是真的,背景是真的,只是两者没被同一束光照着。

调研表换了一种列法

这一轮做下来,调研表的列法也变了。以前我按工具来列,一行一家,写它能做什么、效果怎么样。看完 FireRed 以后,我改成按环节来列:预处理一栏,生成一栏,编辑一栏,每一栏里放能做这一步的工具。

按工具列,容易被宣传带着走。一家说自己什么都能做,表里就什么都记上,看起来每家都很全。按环节列,每一家只落在它真正做得像样的那一栏,哪一栏还空着,也一眼能看出来。

对当时拿来比较的商品来说,这一轮里,最难做的那一栏,还没有哪一家能直接替掉我们自己的做法。

这张表我留在了自己手里。当时想的是,过几个月再做一轮,看看这一栏里的名字有没有变。

宣传里最吸引人的那个词,往往正好是做得最不到位的那一步。这次是融合。

问问 KANG AI

想了解我什么?