跳到正文
首页文章第一次跟 Stable Diffusion 打交道,我拿不准的是三件事

第一次跟 Stable Diffusion 打交道,我拿不准的是三件事

今年年中转到 AI 项目,第一次认真用 AI,就是 Stable Diffusion。在自己电脑上装了 WebUI,第一批图能用的很少。我给自己定的第一件事是先搞懂它能做什么,和算法同事聊,发现他们也在摸索。拿不准的是三件事:它能不能稳定用在业务里,我不懂模型该怎么跟算法同事说话,产品经理在这种项目里到底该做什么。

个人思考SmartPhotoAI
第一次跟 Stable Diffusion 打交道,我拿不准的是三件事 封面图

今年年中转到了 AI 项目,第一次认真跟 AI 打交道,就是 Stable Diffusion。之前对 AI 的了解停留在看别人的演示,这回是要拿它做商品图,图出来了要给运营用。

图确实能出来。有时候还挺好看。可看着那些图,我拿不准的不是画面,是三件事。

先在自己电脑上装了 WebUI

真正开始,是在自己电脑上装了一个 WebUI。

装好以后,第一件事是乱试。写一句提示词,出几张图;改一个参数,再出几张。界面上一排排的选项,大部分我不知道是干什么的,只能一个个动,看图怎么变。

第一批出的图,我自己觉得能用的很少。

很少,不是因为画面丑。有些挺好看,光影、构图都像那么回事。问题是放到商品上看:商品的形状不对,细节变了样。当成一张图,它及格;当成一张商品图,它不能用。

这是我第一次清楚地感到,好看和能用,是两件事。

给自己定的第一件事

那时给自己定的第一件事,是先搞懂它能做什么。

不急着判断能不能用在业务里,也不急着想产品怎么做。先把它的边界摸一遍:它擅长什么,不擅长什么,哪些问题是提示词能改的,哪些是怎么改都改不了的。

这个顺序是故意的。不知道它能做什么,就去想它该做什么,很容易想出一个它根本做不到的产品。

摸下来,大致有了个印象。场景、光影、氛围,它做得不错;让商品本身保持不变,它做得很差。偏偏这是做商品图最要紧的那一件。

它能不能稳定用在业务里

演示里挑一张好看的很容易,业务里要的是每天都能出、每次都能用。同一件商品,这一张商品还在,下一张形状、材质说变就变。一次两次好看不算数,我需要知道的是一百次里有几十次能用,这个数字现在没人能告诉我。外面那些商拍工具试过一圈,画面都能出,商品保不住,我们自己做,会不会也是这样?

摸清边界这件事,没有捷径。别人演示里放出来的,都是挑过的成功图,失败的那些不会出现。想知道它在哪里会坏,只能自己一张张试出来,把坏掉的也认真看一遍。

从自己电脑到业务,中间差着什么

在自己电脑上试,和放进业务里用,是两种条件。

自己试,出十张挑一张,挑到满意的就算成功。慢一点没关系,失败的九张删掉就是。放进业务里,运营每天要出很多张,每一张都要能用,失败的那几张不会被悄悄删掉,而是变成运营要重新做的工作。

还有速度。在 WebUI 上等一张图出来,慢一点也就等了。运营上新的时候,等图是在等上架。

所以自己电脑上跑出来的那几张好图,只能说明它有这个能力,不能说明它扛得住业务。能力和稳定中间差着的那一段,就是第一件事要回答的。

我不懂模型,怎么和算法同事说话

我做过设计,做过 B 端和 C 端产品,没做过模型。算法同事说 LoRA、说训练集、说步数,我能听懂词,接不上话。图不好,我能说哪里不好,说不出为什么,也不知道让他们改什么。这种时候很容易退到一句“效果再好一点”,而这句话对谁都没用。我得找到一种自己能说、他们也能用的说法:商品哪里变了,哪类商品更容易坏,哪张图运营会直接扔掉。

第一次和算法同事认真聊,才发现他们也在摸索。

SD 那时出来一年左右,开源社区里隔几天就有新东西,新的模型、新的插件、新的训练方法。算法同事有底子,知道原理,可具体到我们的商品上怎么训、训多少、效果能到哪,他们也没做过,也在边查边试。

这反而让事情简单了一点。大家都在同一个起点,拿不准的地方可以直接摆出来,不用假装懂。我说不清为什么的时候,他们也未必说得清,那就一起拿图来看。

产品经理在这种项目里到底该做什么

以前做产品,需求、流程、界面,我知道自己负责哪一段。这个项目里,模型是算法的,效果是模型的,运营要的是图,中间我站在哪?写一份 PRD 说“支持生成商品图”,等于什么都没说。我现在的猜测是,我该负责把“能用”说清楚:什么样的图算能用,谁来判断,判断不过的图去哪里。这些不定下来,算法可以一直往好看的方向优化,业务那边还是觉得不能用。

很少能用,说明了什么

回到第一批图,能用的很少,这件事本身也在回答问题。

它说明通用模型直接拿来做我们的商品图,差得还远。换提示词能让画面更好看,商品保不住的问题却一直在,差距不在提示词写得好不好。

它也说明,这个项目不会是接一个现成的模型、包一层界面就能交付的事。中间要补的那一段,可能是训练,可能是数据,可能是流程,现在还说不清是哪一种。

但至少知道了,要补。

三件事里,第三件最让我不安。前两件,总有人比我懂,可以去问;第三件,只能我自己回答。这也是为什么我先问自己,再去问别人。

眼下能先做的

三件事都没答案,但有几件事现在就能做。

一是把好看和能用分开记。每次试完,不只挑出好看的,也把能用的单独数一数,哪怕很少。这个数以后会变成判断稳不稳定的起点。

二是把坏图留着。坏在哪里,比好在哪里更能说明它的边界,也更方便拿去和算法同事讨论。

三是去问运营,什么样的商品图他们会直接用,什么样的会直接扔掉。能用的标准,不该由我一个人坐在电脑前定。

三件事现在都没有答案。写下来,是想过一阵回来看看,哪些是刚开始不熟,哪些是这类项目本来就要一直面对的。

问问 KANG AI

想了解我什么?