MEJE BOOKS Knowledge Library

KIM DONG-EUN · FTUE:首次用户体验 (30 章)

第27章 AI时代的FTUE

Kim Dong-eun WhtDrgon. · 章 27

第27章 AI时代的FTUE

即使AI改变了首个画面,用户要支付的费用也不会消失。

AI搭建的首个画面很顺滑。为每个人量身定制的角色会主动站到面前,连说话方式都能贴合那个人的气质。然而,即使面对如此顺滑的画面,初来者依旧要花时间阅读、动脑学习,还会犹豫是否该相信第一次见到的东西。因为无论是谁搭建了画面,第11章讨论的时间费、注意力费与信任负担都会照常收取。

过去,首个画面是所有人看到同一内容的场景。我们编排好一个场景,无论谁进入都会遇见它。可是,机器自动为每个人搭建不同首个画面的事情已经开始了。它读取来者选择什么、被怎样的气质吸引,再为他分别呈现合适的角色、说话方式与第一个动作。于是,有的用户收到温暖的首个画面,有的用户收到锋利的首个画面。明明是同一款游戏,两人的“第一次”却不一样。

这里出现了一个微妙的问题。如果首段体验因人而异地生成,那么“首次”究竟是谁的首次?我们编排的唯一首次消失了,取而代之的是与用户数量同样多的首次。本章将俯瞰这种变化,但把AI的多种使用方式及其深层伦理留到附录C再谈,并先明确一点:AI确实会改变首段体验,却不会改变本书建立的原则。八层结构、体验费用以及审查玩家常识的工作都依然有效。AI不是重写这些原则,而只是更快、更细致地落实原则的工具。

机器为每个人搭建不同的首个画面

AI进入首段体验的方式大致有三种。第一种是为每个人调整不同画面:读取来者的气质,让适合他的角色站到面前,并优先推荐他可能喜欢的第一个动作。就像视频服务为每个人铺设不同的首页一样,游戏的首个画面也会因人而异。第二种是与用户对话:不用固定教程,而由用户提问、机器回答,按照那个人的速度进行引导。第三种是当场生成内容:按照用户所选的气质,即时创造角色外形或台词。以贯穿第五部的那款虚构游戏来说,就是读取粉丝在第26章选中的颜色与纹样,当场创造下一个角色。

这里需要分清这三条路线的年龄。第一条,也就是推荐与个性化,已有二十多年的历史,视频、音乐与电商已经用它运转了一代。这个时代真正新出现的是第二与第三条,也就是对话式引导和即时生成。但费用原则对三者的作用完全相同。从老路线学到的教训同样适用于新路线,这就是本章的基础。因此,即使本章很多案例早于生成式AI,也并不过时。

三种方式瞄准的,正是我们此前已经看到的地方。初来者接近一张白纸,而揣测这张白纸一直是首段体验设计的老难题。第26章用用户的第一次选择来解决它,AI则用另一种方式处理同一难题。它不仅收集用户选了什么,还收集停留时长、手指停住的位置以及相似人群的行为,从而更快地揣测那个人。也就是说,它更擅长在白纸上写下第一行了。

但更善于揣测,并不意味着每次都能猜对。对于初来者,AI最终知道的也很少,只能因为相似的人曾经这样做,便推测你大概也会如此。一旦推测落空,首个画面就会把你当成另一个人。读错白纸,可能比让它保持空白造成更差的第一印象。“为每个人量身定制”的承诺,总会带来另一重风险:一旦配错,错位感会更强。

第二条路线有它特有的失败。用对话进行引导的机器即使不知道,也会自信地回答。初来者问“这个要怎么做”,引导却用清晰肯定的语气教了错误操作,他便会照着按,并在首个会话中经历“根本行不通”。人类引导员的迟疑至少能成为怀疑的线索,机器顺滑的错误回答却连线索都没有。初来者最缺乏质疑错误引导所需的知识,因此会为自信的错误支付最高费用。

第二条路线在失败之前还有一道门槛。对话式引导的首个画面往往只有一个空输入框。面对一个写着“什么都可以问”、声称“什么都能做”的空白栏,初来者却不知道该先输入什么,只能僵住。正如第26章所见,深度自由对初来者不是游乐场,而是试卷;承诺无限自由的空白栏,正是这张试卷最极端的形态。因此,对话式首个画面也要采用相同处方:不要只放一个空栏,先摆出两三个可以点击的首问,再随着用户熟悉对话的程度逐步开放自由。

第三条路线的失败,会破坏世界的气质。即时生成的角色外形或台词一旦偏离世界观的调性,就会出现明明承诺温暖世界,首个画面却冒出冷言冷语角色的错位。首个画面等于亲手违背了自己的承诺。因此,生成画面发布前要抽取样本,执行第18章的第一印象检查。画面与用户数量同样多,不可能逐一审查,抽样就成了现实可行的质检手段。处理这三类失败的详细工具见附录C。

从MEJE爱动世界来看,可能与风险会同时显现。AI可以读取粉丝所选颜色和手势的气质,即时创造适合这位粉丝的爱动。匹配成功时,粉丝会遇见世界上独一无二的本命爱动;读取错误时,却会有一个违背粉丝心意的爱动冒出来,自称是他的本命。有人会带着遗憾接受没那么准的推荐,但粉丝在与自己心意相悖的东西被硬说成本命的瞬间就会转身离开。定制能力越强,错位时的失望也越大。

“个性化一定更好”这个诱人的假设

既然本章讨论AI,就把一个不知不觉变成常识的假设置于检查站:“个性化一定更好,越能因人定制,体验就越好。”

先看这个假设把什么视为理所当然。它认为,给所有人同样内容是懒惰的设计,为每个人量身定制更亲切、更有效;定制越精密,用户就越满意、停留越久。这个前提成长于定制奏效的案例,其中一半是对的。准确匹配的首个画面,当然比错位的首个画面更好。

可是,从初来者的位置看,就能看到缺口。“为他定制”也意味着已经把那个人定义成了某种人:根据一次选择判定他属于哪一类,再按这个判定铺设后续。判得准会很方便,判错了,他就会被当作一个并非自己的他人。而且,如果一直只接受定制后的体验,用户会失去遇见未知气质的机会。因为选过温暖,就只收到温暖,他便被困在其中。为一个人打造的首次,可能不是拓宽他,反而缩窄他。个性化只在准确时有益;一旦错位或困住人,还不如不做。定制的精密程度并不等于体验的优劣。

更深的缺口呈现为悖论。首段体验按定义就是我们对那个人一无所知的位置,也就是推荐系统所谓的冷启动。换句话说,看上去最需要个性化的地方,恰恰是个性化最无能为力的地方。机器对数据充足的老顾客很会匹配,在第一印象成形的关键瞬间却最笨拙。如果不理解这一悖论,就从首个画面开始追求精密匹配,机器只会给不足的猜测披上确定无疑的外衣。

保留本质,改写假设。读取不同气质、给予每个人更适合的首段体验这一目标应当保留,但要丢掉“一定更好”的断言。个性化在匹配准确时是好工具,却不是它本身就代表善。因此,我们既要定制,也要同时设计错位时用户逃出的路,以及我们察觉错位的眼睛。八层结构、体验费用和惯例检查都原样应用于AI搭建的首个画面。画面由AI生成,费用也不会消失;匹配错误的首个画面,反而会收取更高的注意力费。原则没有改变,AI只是工作在原则之上的工具。

个性化的首次,既难测量,也难守护

每个人的首段体验若都不同,对它进行测量并承担责任就会变得棘手。第五部把首个画面拆成不同阶段,观察用户在哪里流失;可是当画面因人而异,所有人不再经过同一画面,就很难比较某个位置的离开率。也无法把一套首段体验做好后统一审查。画面等同于有用户多少就有多少,有时甚至难以回看某位用户究竟收到了怎样的首个画面。测量与质检都会变难。

公平问题也随之而来。定制机器可能给某种气质的人优质首个画面,却给另一种气质的人贫乏画面。即使没有这种意图,也会出现常见群体匹配得准、少见群体匹配得差的偏斜。如果某个人的首次被精心搭建,另一个人的首次却被草草应付,这就等于从第一次见面开始歧视人。个性化首次有多甜蜜,错位与偏斜的风险就有多大。实际如何处理测量、质检和公平性,属于正文以外的工作(→附录C)。

还有另一项费用。所有人经历同样首次的时代,首段体验会成为共同记忆。初次见面的人只要说一句“那一段大家都迷路了吧”,就能一起发笑;共同的首次像社区的篝火一样发挥作用。因人而异的首次可能缩小这堆篝火,因为经历过同一场景的人少了,共同回忆也会减少。不过,不同的首个画面也可能成为比较、炫耀和争论的新话题。第24章把社区列为想要产生的输出,那么我们还要一起衡量:个性化究竟在削弱原有的共同记忆,还是在创造一堆分享不同体验的新篝火。

因此,AI搭建的首段体验需要一道信任护栏,由三根支柱组成。第一,让用户知道为什么会看到这个:他至少要隐约看见自己收到的首个画面来自哪里、系统依据什么这样揣测他。第二,可以关闭:定制令人不适或匹配错误时,用户要有一个把它停下、回到普通首个画面的把手。第三,出错时可以纠正:机器读错用户时,他能够说“我不是那种人”,而且纠正会被采纳。为什么显示、能否关闭、错了能否纠正。少了其中任何一项,量身定制的亲切就会变成用户无法控制的干涉。

音乐应用把这道护栏做成了把手。据了解,Spotify允许用户从用于推荐的个人品味资料中直接排除不喜欢的歌曲或列表,也可以调整希望减少哪些倾向。也就是让用户亲自修正机器读出的“自己”。即使推荐错位,只要用户有直接纠正的路径,一次错位就不会立刻导致离开。把AI放进游戏首个画面时,也应一并设计同样的把手。

▶ 套用到自己画面的三个问题

  1. AI只改变了工具,还是连原则也改变了?
  2. 生成的画面是否仍在使用普通人不知道的约定?
  3. 即使交给AI,三个检查站是否仍由人亲自执行? 只要有一项含糊,AI就不是减少了费用,而只是把费用遮掩得更加顺滑。

所以,先建立原则,再把AI放到原则之上

设计AI时代的首段体验时,顺序很容易颠倒。新工具一到手,我们往往先问能用它做什么,但问题的顺序应该相反。首先确定这段体验要达成什么、在对哪个层级说话、要节省哪种费用、要审查哪种惯例;原则确立后,再寻找AI可以更好落实它的位置。不要让工具决定目标,而要让目标决定工具的位置。因此,把AI放入首段体验时,第一个问题不是“能用AI做什么”,而是“落实这项原则时,AI真的更好吗”。

这个决定也要通向测量。AI定制的首个画面是否真的更好,只有与未定制的普通画面对照才知道。因此,要故意让一部分用户看到关闭定制的画面,把两者并排比较。前面说过,因人而异的画面既难测量也难审查,而保留对照组正是突破测量难题的标准解法。比较收到定制画面的人是否比看到普通画面的人留存更好,还是因为错位反而离开更快;还要看有多少人因定制令人不适而关闭它,以及哪些群体尤其难以匹配。当个性化不再是炫耀,而成为验证对象时,AI才真正成为搭建首段体验的可靠工具。

参考内容

其他媒介和领域中体现本章概念的案例。

推荐系统的原理

  • 冷启动问题:初来者没有数据,机器也无法准确匹配。揣测一张白纸这个首段体验的老难题依然存在。

个性化产品的常见模式

  • Spotify的“从品味资料中排除”:在歌曲菜单中提供把某首歌或某个列表排除在推荐计算之外的把手。功能最初开放到播放列表,之后扩展到单曲,让用户亲自纠正“只在那时听过的歌”,避免它扭曲个人品味。机器读出的“我”可以由我自己修改,一次错位就不会立刻导致离开。
  • 过滤气泡:服务越是按我的品味过滤,我越难遇见自己气质之外的内容,最终被困在看不见的气泡中。这一诊断警告,定制越精密,围困也越牢固,因此要有意留下走出推断的道路。

信任与透明原则

  • Meta的“为什么我会看到这则广告”:用户可以在信息流广告的三点菜单中亲自展开,查看为什么会看到它。界面按主题说明哪些活动和兴趣促成了这次展示,并允许用户当场隐藏广告主或调整设置。

游戏案例

  • 《哈迪斯》的神力模式:用户开启后受到的伤害会降低,每次死亡都会进一步提高少量减伤,让被卡住的人最终得以通过。用户可以自行开关并控制调整,是由用户掌控定制的一种范例。

其余参考内容收录在本文末尾的“第27章附录”中(单行本汇编为附录D)。


设计笔记 ▶ 亲手试一试

从我们游戏的首段体验中,只选一个交给AI会变得更好的位置。它可以是为每个人定制首个画面的地方,可以是与用户对话进行引导的地方,也可以是当场生成内容的地方。

针对这个位置提问:如果AI在这里读错用户,会发生什么?我们如何发现这次错位?然后写下信任护栏的三行:用户能否知道为什么收到这个画面?能否关闭定制?出错时能否纠正?只要有一行空白,就先建立护栏,再把AI放进这个位置。(关于让AI介入到什么程度,以及如何处理其风险与伦理的精密工具,见附录C。)

最后用一句话判断:如果AI只改变工具,仍支撑八层结构、体验费用与惯例检查的原则,就让它通过;如果是工具取代原则决定了首个画面,就从原则重新建立。

一句话总结:AI能更快揣测白纸般的初来者,为每个人搭建不同首个画面,但更善于揣测不等于每次都能猜对。“个性化一定更好”的假设只对了一半:匹配时很好,错位或困住人时还不如不做。个性化首次既难测量也难质检,还存在公平风险,因此要建立“为什么显示、能否关闭、错了能否纠正”的护栏。最重要的是,八层结构、体验费用与惯例检查的原则从未改变,AI只是落实原则的工具。不要让工具决定目标。 下一章:从第1章到这里,我们让熟悉停下脚步,把首次拆成一道道门槛,把用户分成不同层级,检查体验的费用、冲突和仪表盘,最后确认所有原则在新工具之上仍然成立。现在该把散落的表格、问题与决定收在一起了。附录A汇集设计与用户工具,附录B汇集世界与体验工具,附录C汇集仪表盘与参照工具,附录D汇集各章参考内容,最终完成一本只属于你游戏的首段体验设计书。

第27章附录:参考内容集

正文的参考内容一节只保留与本章论证直接相关的几个核心案例,其余内容按媒介汇集于此。从推荐系统原理开始,经过个性化产品的常见模式、对话式引导、信任与透明、工具与目标的顺序、道路与酒店等线下场景,最后以影视和游戏图景收尾。具体产品功能变化很快,因此这里主要选择不易过时的原则与失败模式。阅读时把本章的三个论点放在旁边:看似最需要个性化的初次见面,其实因为缺乏数据而最难匹配的冷启动悖论;个性化、对话式引导与即时生成三条路线各自不同的失败模式;以及说明为何显示、允许关闭、出错后可以纠正的信任护栏。这样就能看清每项“观察要点”与何处相连。

推荐系统的原理

  • TikTok推荐信息流的初期探索:系统对刚进入的账号所知很少,首个会话几乎等于探索,信息流也尚未充分定制。它迅速读取用户在每条短视频上的停留时间和手指停住的位置,加快在白纸上写下第一行。观察要点:不靠提问而靠行为观察解决冷启动的速度,以及这种速度也可能更快困住人的两面性。
  • 非个性化兜底:一无所知时先展示稳妥的热门内容,认为普通首个画面也比错误定制好。观察要点:我们的首个画面是否也有“不把不足的猜测披上确定外衣”的判断标准。
  • 注册后立即询问品味:用几次最初选择在白纸上写下第一行,是一种常见方法,以另一种手段解决第26章第一次选择所面对的同一难题。观察要点:问题的数量与分量越过哪条线后,解决白纸的工具会重新变成试卷。
  • 注册Spotify后立即选择歌手:首次启动时让用户选择几位喜欢的歌手,在无数据的白纸上写下第一行。仅凭几次选择,就立即按照那个人的气质编排首页与首份推荐列表。观察要点:最初几次选择直接成为首个画面气质的冷启动标准实现。
  • 协同过滤的“相似人群”推断:根据相似人群的行为揣测用户,但一旦推断落空,从第一印象起就会错位。观察要点:个性化失败并非始于技术缺陷,而是始于推断的本性,所以纠正把手必须始终伴随。
  • 把一次性行为固化成品味的推荐:为了送礼买过一次婴儿车,之后却长期只收到婴儿车推荐,这种失败在各种电商中都可观察到。行为是诚实信号,但把一次行为固化为身份,信号反过来就会困住人。观察要点:第26章“把选择当作假设而非结论”的原则同样适用于机器,并检查是否有“这不是我的品味”的纠正把手。

个性化产品的常见模式

  • Netflix的作品缩略图个性化:同一部作品会因人显示不同的代表图片。例如,看过乌玛·瑟曼作品的人,可能看到以瑟曼镜头作为《低俗小说》的缩略图。首个画面本身按那个人的气质重新搭建。观察要点:这是“同一服务却有因人而异的首次”最清晰的实现,要同时考察匹配与错位时的振幅。
  • Microsoft Office的Clippy(1997):文档看起来像一封信时,它就会插话说“看来你在写信”,却经常读错情境、反复干预,关闭路径也不清晰,最终因遭人厌烦而从后续版本中消失。观察要点:早在生成式AI之前,技术就已证明,缺少“为何显示、能否关闭、错了能否纠正”三根支柱,亲切就会变成干涉。
  • Target孕期预测优惠券轶事:2012年的一篇文章让这个故事广为流传——美国零售商Target根据购买模式推测顾客怀孕并寄送相关优惠券,导致一位父亲比商店更晚知道女儿怀孕。也有人指出轶事细节难以核实。观察要点:即使个性化猜对了,如果隐藏展示理由,亲切也会被理解为监视,这正是透明支柱的依据。

对话式引导的原理

  • 航空公司聊天机器人的自信错误与赔偿裁决:加拿大一家航空公司的聊天机器人错误告知,丧亲优惠票价可以在旅行后申请。2024年,当地争议解决机构裁定聊天机器人也是网站的一部分,公司应为其话语负责,并赔偿差价。观察要点:顺滑错误最终由公司支付费用;引入对话式画面时,也必须同时设计错误回答的责任。

信任与透明原则

  • 说明为何显示:用户至少要隐约看见收到的画面从何而来,定制才是亲切而非干涉。观察要点:这是护栏第一根支柱的一般原则,检查首个画面的推荐旁是否显示一行来源说明。
  • 个性化的公平偏斜:常见群体匹配得准,少见群体匹配得差,从第一次见面起就可能区别对待。观察要点:是否分组测量哪些人尤其难以匹配,以及首次质量是否因群体而异。

工具与目标的顺序

  • 不让工具决定目标:即使新技术到手,也要先确定要实现什么,再寻找AI更优的位置。观察要点:第一个问题是否不是“能用AI做什么”,而是“落实这项原则时,AI真的更好吗”。

线下与日常

  • 盲信导航与自动化偏误:多个国家都报道过人们毫不怀疑地跟随导航,驶入封闭道路或水域的事故。面对机器笃定的引导,人的怀疑会减弱,这种倾向被称为自动化偏误。观察要点:为什么机器顺滑的错误比人类迟疑的引导更危险,以及初来者最缺少质疑知识这一警告如何同样发生在道路上。
  • 酒店礼宾接待初次来客:老练的礼宾不会立即断定来客是怎样的人,而会通过两三个轻量问题建立假设,观察反应后逐渐收窄推荐;不知道就坦承不知道,并主动查明。观察要点:这是人类处理冷启动的原型,机器引导应以“从问题而非确定开始,错位就立即修正”的态度为基准。

电影、剧集与动画的图景

  • 电影《少数派报告》(2002)的GAP门店场景:门店扫描仪读取主人公的眼睛,称他为“山本先生”并询问过去的购物。然而那双眼睛来自他人移植,系统却信心十足地把他当成另一个人。观察要点:确信自己读对了,与事实上是否读对,是两回事;观察自信误认会带来怎样的对待。
  • 《黑镜》的《琼糟透了》(2023):流媒体公司自动制作以每一位订阅者为主角的剧集。它展现了机器为每个人创造不同首次的极端未来,同时也呈现生成的“我”与真实的我错位时产生的背叛感。观察要点:即时生成走到尽头会变成什么,以及错位生成收取怎样的信任费。
  • 动画《心理测量者》(2012)的西比拉系统:扫描所有市民的潜在犯罪指数,用数值划分并区别对待人。然而也有分类错误的例外,即使犯罪当下仍被读出低数值。观察要点:分类越精密,一旦落空,错位越大;把这一警告放大到由分类决定人之待遇的世界。

游戏案例

  • 《求生之路》(2008)的AI导演:不把敌人固定放在某处,而是读取这一局中用户的生命、弹药、进度和紧张程度,分别配置敌人与补给。即使同一地图,也会根据当下状况进行推断,为不同玩家搭建不同体验。观察要点:早在生成式AI之前,游戏就已为不同人创造不同体验,只是它读取的是当下状态,而非品味。
  • 《极限竞速》系列的Drivatar:学习真实玩家刹车与过弯的方式,创造一个像那个人一样驾驶的AI分身,并让它出现在其他人的游戏中。观察要点:当个性化发展到模仿一个人,被模仿的“我”会出现在他人的首段体验里,由此产生新的责任。