跳到正文
首页文章语音终于能打断了,我以前因为打断不了放弃过

语音终于能打断了,我以前因为打断不了放弃过

OpenAI 发了全双工的 GPT-Live,说话时能随时打断,我试了,随便聊的时候最能看出差别。我平时偶尔用语音和 AI 对话,多半在开车或走路时,以前因为打断不了放弃过。做贪杯熊时,大屏上最常见的打断是看一半被朋友叫走,我们没专门为它做过设计,那是一个漏掉的问题。

语音打断贪杯熊
语音终于能打断了,我以前因为打断不了放弃过 封面图

ChatGPT 上个月上了双向语音模型,昨天 OpenAI 又发了 GPT-Live,全双工,它说话的时候你可以随时插进去,它会停下来听。我试了。

以前因为打断不了,放弃过

我平时偶尔用语音和 AI 对话,多半是在开车或者走路的时候,不算常用。不常用的原因之一,是以前因为打断不了放弃过。当时用的是哪一个语音助手,我已经记不清了,只记得那种插不上话的感觉。

问一个问题,它开始回答,说到第二句我就知道方向不对,想打断它,插不进去。只能等它说完,或者点停止,再重新问。几次以后,就回去打字了。打字至少能在它输出的时候直接停掉。打字的时候,我可以一边看它输出,一边决定要不要停;语音只能听,听到第二句才知道方向不对,前面那一句已经过去了。

语音对话本来应该比打字自然。可一个插不上话的对话,比打字还累。

开车和走路,最需要能打断

开车或者走路的时候用语音,本来就是因为手和眼睛都占着。

这种场合,最需要的就是能打断。看不了屏幕,没法点停止;它说偏了,只能听着,等它说完。一段不对的回答,在屏幕上可以扫一眼跳过,在耳朵里只能从头听到尾。

所以打断不了,在打字的时候是一点不方便,在开车走路的时候,就是没法用。我放弃的,大概就是这个场合。

试了 GPT-Live

试 GPT-Live,最想试的就是这一点。问的东西没什么讲究,就是随便聊。

它说话的时候,我直接插进去说不对,换个方向。它停下来了,接着我的话往下说。这是第一次,我觉得和一个语音助手的对话,像是两个人在说话,而不是轮流发言。

能打断,改变的不只是体验,是我敢不敢用语音去问一个还没想清楚的问题。以前不敢,问歪了要等它说完;现在敢,问歪了随时拉回来。

随便聊,最考验打断

随便聊,反而最考验能不能打断。

问一个具体的问题,答案有个方向,它说偏了,我知道往哪拉。随便聊没有方向,话题说着说着就拐了,我想接一句,它也想接一句,谁先停下来,谁接着说,正是全双工要处理的事。

这一点它处理得比我预想的自然。我插进去,它停得快;我说完,它接得上,接的是我刚才那句,不是它自己没说完的那半句。

能接住我刚才那句,比停得快更难。停下来是一个动作,接上是一个理解。

贪杯熊的大屏,没为打断做过设计

打断这件事,让我想起了贪杯熊。

第一次去 SOLO CLUB 看大屏,有人刚拿起手机,转头就被朋友叫走了。酒吧里的注意力,随时会被打断。

可贪杯熊的大屏互动,并没有专门为用户被打断做过设计。现场最常见的打断,是看屏幕看到一半,被朋友叫走。一条要上墙的消息写到一半被叫走,回来是什么样,我们没有专门想过。当时关注的是互动能不能发出去、能不能上墙,没关注发到一半就走开的人。

这不是一个致命的问题,但它是一个漏掉的问题。

看一半被叫走,回来看到的是什么

看屏幕看到一半被叫走,回来的时候,屏幕上已经是别的内容了。

大屏是滚动的,表白、红包雨、聊天,一条接一条,不会等谁。一个人被叫走半分钟,回来就接不上了:刚才那条表白是谁发的,红包雨抢到没有,这个人不知道,也没地方看。

如果当时想过这件事,也许会在手机那一侧留一个刚才错过了什么,让被叫走的人回来还能接上。这不难做,只是当时没想到要做。

现在想,产品里很多被打断的时刻,都是这样:不是做不到,是没被当成一个要设计的时刻。

注意力不在产品上

语音助手花了这么久才学会被打断,贪杯熊当年也没想到要为打断做设计。两件事背后是同一个默认:用户的注意力在产品上。

实际上不是。酒吧里的人,注意力在朋友身上;问语音助手的人,说着说着就改了主意。开车走路时插一句话,酒吧里看到一半被叫走,是同一种情况:人没走,注意力先走了。产品要做的,是承认这一点。

全双工对我来说,不只是一个技术指标,是一个产品第一次承认,用户随时会走开,随时会改口。

问问 KANG AI

想了解我什么?