跳到正文
首页文章两年多的 Smart Photo,最费心的不是出图

两年多的 Smart Photo,最费心的不是出图

Smart Photo 跑了两年,两百多个运营每天在用,每月出几万张图。上传、选场景、点生成,三句话能讲完的流程,背后是判定标准、几百张训练图、拆品类、收参数、一轮轮试用和一张一直没对齐的结果表。这篇把它们接起来。

SmartPhoto项目复盘AI 产品
两年多的 Smart Photo,最费心的不是出图 封面图
目录

整理 Smart Photo 的时候,最容易写的是操作流程。上传商品图,选一个场景,点击生成。几句话就能讲完,看起来也很清楚。但如果只留下这个,项目里真正花时间的部分几乎都不见了。

这个工具现在跑了两年,两百多个运营每天在用,每月稳定出几万张图。我们最初要解决的是商品图制作:跨境电商不断上新,图片制作有自己的排期,运营等图,设计有一批重复工作要处理。AI 出图提供了一个可以试的方向,却没有直接给出一个能让同事每天用的产品。

前面已经单独记过失败图片、模板和试用,这次想把它们接起来。不是把每一件事再讲一遍,是回头看看,为什么解决一个问题以后,还会出现下一段工作。

先有一张图能用,才谈得上工具

开始直接用基座模型试,我们自己的商品结果并不稳定。画面可以生成,商品却未必保持得好。判定一张图可用,不能只看它像不像一张商业摄影作品,还得看商品的形态、结构有没有变,材质、颜色和原图一不一致,能不能直接交给上新使用。

这一步把产品和模型连起来了。没有这个判断,算法侧可以一直优化看起来更漂亮的地方,业务侧却可能还是觉得不能用。我们要先把什么算可用讲明白,再看训练后的变化。

接下来才是数据。已有图片不是拿过来就都适合训练,有水印、尺寸和背景的问题,需要清理;质量也有差异,要有取舍。我们做了规范和 A、B 分级,一两个运营同事一起准备,第一批整理出来也就几百张。产品侧参与这些事情,不是为了把自己写成做算法的人,是数据里留下什么,会影响最后得到什么。

训练后,问题仍然没有完全解决。立项那年秋天,可用率从三成做到五成,然后停住了。我把失败图片拉出来逐张看,整理成一张表,一边是服装、3C、家居、家纺,一边是形态、材质、场景,能看到按品类集中的情况。于是把分类后的情况带去和算法同事讨论,后面改成分品类的 LoRA,年底做到了七成多。

这段容易被写成发现规律、提出方案、结果提升,三句话结束。实际作判断时没有那么稳。分开训练会增加工作,效果还没出来,不能保证一定值得。算法侧原来考虑继续补数据,这也有它的理由,不能为了突出自己的判断,把另一种方案写得毫无道理。后来结果改善了,我也不想把这写成一个模型永远学不了多个品类的技术结论。它是这次项目条件下,我们选择并验证过的一种调整。换模型、换数据和任务,结论都可能变。

模型能用了,同事还不一定能用

我们没有在模型结果改善后立刻把定制平台做完,而是先用 WebUI 让运营试。这个步骤现在看仍然很有价值。如果现有界面已经能满足日常工作,未必需要再开发一层产品。

试出来的困难不只是一个难用。提示词、反向提示词、采样步数、CFG、采样器、种子,那一排参数运营看不懂、调不明白,有人直接说“我要是会用这个,我还做什么运营”。结果出来以后还要花时间筛选。这几种反馈最后指向了不同的改动,不能靠给界面换一套样式一起解决。

参数收进后台,让运营不用先理解生成细节。场景和风格留在前面,因为他们知道商品图准备怎么用。常见需求做成模板,上线时十几二十个,现在有一百多个。生成的候选再做排序,先把更接近场景的结果放在前面。

这里面我现在会特别区分排序和判断。图文语义接近,不能证明商品局部细节一定正确。我们用的 CLIP 可以帮助筛选,最后是否可用,仍然需要看图。不能因为系统排了第一,就让它承担本来没有验证过的质量承诺。

简单的三步操作,是这些安排做完以后呈现出来的样子。操作少了,背后的模板、默认配置和检查并没有少。用户不用碰的部分,总要有人继续负责。这也是我对产品化更具体的一点理解。不是在模型外面套一个上传框,是把原来需要使用者自己摸索的事情,提前处理掉一部分,同时留住他确实需要表达的空间。

小范围试用没有一次解决所有事

后来分批让更多人用,每一轮暴露的问题不完全一样。

先是七八个运营用,碰到香水和化妆品瓶这类透明材质的抠图问题,补了手动调整;扩到二十多人,场景覆盖要增加,排队和并发变成需要处理的事情。这些都有记录,不是为了写出完整过程补出来的阶段。

我觉得值得记的是,它们不能互相代替。少量用户把流程走通,不能证明更多人一起用也没问题;系统扛得住,也不能证明模板足够符合需求。每一轮其实都在回答一个更具体的问题。

模板后来也没有一直封闭。去年年底,一些资深运营为了年货节和圣诞氛围,需要在现有场景之外补一点要求,产品增加了追加描述的方式,同时没有重新开放全部技术参数。最初适合的限制不需要永远保留原样。人用熟了,需求会继续长。

用起来和节省多少,是两套需要说清楚的事

项目材料里有不少结果数字。现在整理,我更在意它们是否回答了同一个问题。

图片可用率描述生成结果,现在八成左右;使用率描述有多少人在用;覆盖率又可能在说多少商品经过这套流程。这几个数都上升当然让人高兴,但不能摆在一起,就当作它们互相证明了效果。分母是什么、统计哪个阶段,会影响理解。

时间也一样。现在十几秒出四张图,和从提出需求到拿到能用的图,范围不同。新流程拿机器运行时间,旧流程拿整个制作周期,一张图原来要排期三到五天,直接放在一起,差距会非常大,读者却不一定知道中间省略了哪些工作。生成以后挑图、修改和确认花的时间,也该看见。它们没出现在运行日志里,不代表没有发生。

成本需要分开看得更细。外包或拍摄支出减少,是一类变化;设计同事可以处理更多上新和创意工作,是另一类。后者很有价值,却不能直接当作现金已经省出来了。硬件、算力和维护也需要纳入同一套范围,才好比较。材料里的不同阶段数字尚未完全对齐,这篇没有拼出一个累计收益。不能因为是自己的复盘,就把需要核对的部分跳过。

图片之后为什么接了文字

图片能力稳定以后,我们又去看运营上新的后续工作。商品图准备好了,标题、卖点、多语言描述还要做。文案模块的起点在这里,不是看见模型能写字,就想给产品再加一项能力。

这一步的难处也变了。图片能看见商品的一部分信息,却不等于具备所有写文案需要的事实。容量、规格、材质,不能因为画面像某种东西就推断出来。我们在流程里先整理 Product Fact Sheet,再据此生成文案,后面接另一个模型的审校和四个维度的评分,最后人看。

生成、审校、评分串起来,比一个空白输入框多了一些安排,但也不能因此认定结果都可靠。商品事实有没有填对,缺信息时是否停下来,人怎样核对,仍然影响交付。多个步骤各自看着完整,最后也可能继承同一个错误前提。新增一种能力,也会新增一段责任。从商拍工具到图文内容生产,名字可以写得很大,真正推进的是同一批使用者手头的工作。

现在想留下的项目记录

回看 Smart Photo,我不觉得能用一句经验把它收起来。模型效果、实际操作、持续使用和结果核算,哪一段都不能省。前面做成了,不保证后面自动成立,反而常常要因为后面的反馈回头调整。

自己在里面作过判断,也有没把握的时候。能把失败图片整理出来,不等于一个人解决了训练;能提出产品方案,不等于运营就会用。很多工作要和算法、开发、设计、运营一起做,写成个人文章,也不该把别人都藏到结果后面。

有些地方当时只求先跑起来,现在再看会想换一种处理。也有些安排在原来的条件下是合适的,不必因为后来工具更新了,就否定过去每一步。比起给整个项目一个始终正确的评价,我更愿意把每次选择依赖的条件留下来。

下次再做类似的产品,可以回来看这一段。不是照着三步操作重做一次,是提醒自己,用户点完生成以后,事情还没有结束。

问问 KANG AI

想了解我什么?