MEJE PROCESS · MEJE 知识库化工作流程白皮书 (21 章)
第4章 抽出所有关键词——第一次提取的姿态
第4章 抽出所有关键词——第一次提取的姿态
想想第一次展开 IP 文档的瞬间。一本规则书、几篇短篇、一叠企划书放在眼前,而你必须从中取出这个 IP 的整个关系网。该从哪里开始,又该先抓住什么?
“第一次提取”这个名称看似简单,这个阶段采取的姿态却决定了 Librarying 整体的质地。第一阶段一旦模糊,后面三个阶段都会模糊;第一阶段扎实,后面三个阶段便会轻松得多。
统治整个阶段的原则只有一个:先收集,后整理。 科学家若一边验证假设一边收集资料,就会落入确认偏误;第一次提取也一样。若在拉出关键词时,同时开始判断“这是 hub 还是 leaf”“第二次整合会如何归并”,便会错过真正好的关键词。因此第一次只专注于抽出,其他判断交给后续阶段。
这正是牛津英语词典(OED)编纂者在 1860 年代采取的姿态。他们把数万本书分给数千名志愿者,要求每逢一个单词出现,便在宽十厘米的一张卡片上写下单词与一行出处。约五百万张卡片积累后,整理与整合才开始。一张张卡片成为一行;开始整理前堆成山的卡片堆,就是第一次提取的成果物。Librarying 的第一次也完全遵循这个姿态。
这就是第一次合格线设为 60% 的理由。即使有重复、同一人物以不同写法进入两次、分类稍有偏差,在第一次都无妨;分类不清楚的项目先放进最接近的分类,将决定延后到下一阶段。
核心是不遗漏。因为一旦漏掉的关键词,后续阶段不会再发现;已进入的关键词中不必要者可在第二次整合时整理删除,但一开始未能进入的,就永远不会进入。
一页里有几个关键词
先做一个简单实验。拿出读者所经营 IP 的一本规则书、短篇或企划书,翻开一页。那一页里有几个关键词?
每个人的答案不同。有人会说五个,有人会说二十个。差异来自于你把关键词抓到什么程度。
以某本规则书的一页为例。假设该页用一段描写现代猎人题材世界观“共同”的一个场面:“姜时宇在 13 号 Gate 前拿出等级卡。身为无属性的他,卡上的等级栏仍是空白。猎人协会审查官尹瑞京向他举起浓度计测器,指针却指向空白,宣告无法测量。尹瑞京想起十八年前的集体再觉醒事故。当裂隙之光从 Gate 的另一端漏出时,时宇的视野中始终没有亮起系统窗口的蓝光。”
平常读来像是一段自然的描写;以第一次提取的视线来看,这一段至少含有十二个关键词:两个人物名(姜时宇、尹瑞京)、一个职称(审查官)、两个场所(13 号 Gate、猎人协会)、两个物件(等级卡、浓度计测器)、一个时点(十八年前)、一个事件(集体再觉醒事故)、两个固有词汇(无属性、无法测量)、一个运行原理(系统窗口)。
还可能更多。若裂隙之光是在这个 IP 里每个 Gate 都反复出现的视觉影像,它既是埋在场所中的描写,也属于场面调度。若等级卡的空栏反复象征无属性,它既是物件,也属于场面调度。一页可以抽出的关键词数量,取决于抽取姿态的深度。Librarying 的第一次提取追求的是尽可能深的抽取姿态。
看看这十二个关键词在九分类中位于何处。“无属性”与“无法测量”是必须向不熟悉 IP 的人说明的固有词汇,因此是专门术语;姜时宇与尹瑞京作为行动者运作,因此是人物;“审查官”在正文中也指实际人物,所以也是人物。但若它用作协会职位体系的抽象,便是概念。13 号 Gate 与猎人协会是背景空间,所以是场所;等级卡与浓度计测器是可拿在手上的物,所以是物件。“十八年前的集体再觉醒事故”是发生在特定时点的事,所以是事件;“系统窗口”是显示能力与等级的运行原理,所以是装置;“裂隙之光”是每座 Gate 都反复出现的氛围元素,所以是场面调度。
分配上有三点值得指出。第一,“审查官”归为人物,是因为正文中它指实际人物;若作为协会职位体系的抽象,便是概念。第二,等级卡是物件,但若空栏反复成为无属性的象征,第一次也应重复登记在场面调度中,于第二次再决定。第三,分类不明确时,因合格线为 60%,第一次先放在最接近的分类并继续前进。这是把一段的关键词变成五列 CSV 一组行的第一个练习。
九分类:按叙事功能分类
Librarying 将关键词抽入九个分类,本书称之为九分类:专门术语、人物、场所、物件、事件、装置、场面调度、概念、价值。一个 IP 的任何关键词都被安排进其中一类,必要时进入两类。
九分类都以“这个关键词在叙事里发挥什么功能”为准,这种划分法称为叙事功能分类。字母顺序等形式分类、重要度分类、出现频率分类,无法说明“为什么这些关键词在同一组”;叙事功能分类则有清楚根据:同组关键词在故事中都扮演相同角色。人物分类的所有关键词都作为行动者运作,场所分类的所有关键词都作为背景运作。这种共同功能,无论撰写标题词叙述或出口工作使用 Vault,都有帮助。
第六章介绍的世界观轴是第二个分类基准。两个基准各自独立地为一个关键词定位:九分类若是叙事功能的 X 轴,世界观轴便是 IP 设计的 Y 轴。暂时只需记得,九分类是叙事功能分类。
九个分类可以三个一组地展开。
固有词汇与人的类别。 专门术语是只存在于 IP 的固有词汇。“黑空”“棺材”“神器”“植入物”“次元移动”等,所有必须向不了解该 IP 的人说明的词汇都在这里。它是第一次最先要填到饱和的分类,也常占据 hub 的核心。人物是 IP 中出现的所有人格体:主角、配角、跑龙套角色、回忆中的人物、无名职称呼号全都包括;不只人,作为人格体运行的 AI、灵魂、神也包括在内。同一人物若以多个写法出现,每个写法各自提取,归并工作放在第二次。家门、势力、教团等人的集合,若像单一人格体般运行则为人物,若像抽象体系般运行则为概念;跨两类时以两行登记。
空间与物件的类别。 场所是从城市、地域、次元界、建筑到一间房的一切空间。直接出现或仅被提到的场所都要抽出。有从国家到城市、到一座宅邸、再到其中餐厅的层级时,第一次先平面抽出,层级留在第二次整理。物件是一切可拿在手上的东西:工具、装备、道具、食物、材料、家具、饰品、标记物都在此处。看似微小的物件也可能后来成为重要象征,不能遗漏。装置是 IP 的运行原理与叙事装置:游戏机制、魔法规则、系统功能,以及伏笔、反复母题、叙述者介入方式等叙事运行原理。这是 hub 标题词比重很大的分类。若物件与装置混淆,例如魔杖,运行原理为核心时归装置,形状、材质、持有经历为核心时归物件;两者皆有则两者皆登记。
时间、氛围与抽象的类别。 事件是作品中发生的事:带有时点、结果与相关人物的情节、闪回与各种发生。事件分类是在整理 IP 的时间轴;第一次若毫不遗漏地抽出,第二次便能排列事件主表,让 IP 的时间线一览无遗。
场面调度是构成 IP 氛围的元素:视觉与听觉的气氛、反复的背景影像、象征性出现的色彩与声音。若下雨天在角色每个转折点出现,“雨”便是场面调度关键词。它不是以实体对象出现在正文,而是融入氛围,因此常在第一次提取漏掉。给 AI 工作伙伴九分类指南时,若充分附上场面调度范例,准确度会提高。
概念是抽象概念:世界的设定原理、规范、法则、社会体系、制度,以及正文预设的运行原则都在此处。“她的嫁妆是五千英镑”这句话预设了婚姻经济学;“他没有获授贵族爵位的资格”预设了贵族爵位体系。含意关键词常被 AI 工作伙伴漏掉,所以人在宏观验收时要再看一次。
价值是 IP 所传达的东西:主题意识、情感、关系性、反复母题,以及“复仇”“牺牲”“自由”“家族”等构成核心讯息的抽象层次。概念是“世界如何运行”,价值则是“在那个世界里什么重要、什么正确”。
分类边界模糊时,第一次同时放进两类、在第二次再决定,这个原则始终一致。第一次的合格线是 60%,而遗漏的损失更大。
五列 CSV 的一行
九分类抽出的关键词会逐行整理到五列 CSV。一个关键词一行,信息分布于五格。
IDX 是行序号与区分各行的唯一编号;分类 表示九分类中的哪一类;关键词照原文出现的韩语或英语写法记录;说明是一两行定义;出处记录它出现于哪份文件的哪个位置。
一个 IP 的第一次提取结果,是五千至一万五千行这种五列资料集合而成的一张表。
关键词栏保留原文写法,因此同一关键词若以“黑空”与“黑色烟雾”出现,两行各自保存其写法;两者是否同义留给第二次整合决定。英文名、罗马字等翻译候选不在此栏决定,而在第二次的十三列决定。说明栏是一两行定义,若不清楚,只写“推定为○○”并在第二次修整;出处栏则必须最准确,因为出处一旦模糊,下一阶段就无法从原文重新找到该关键词。
人必须直接抽出的东西
第一次提取由 AI 工作伙伴承担核心,但仍有几类必须由人直接抽出。第一是细微的分类判断,例如物件还是装置、事件还是概念。把九分类指南交给 AI 工作伙伴,大体能分得好;但在真正模糊的地方,哪一侧适合本 IP,只有人知道。开始工作时先订出“本 IP 的魔杖类归装置”“职称呼号归人物”等标准,写进九分类指南一并交付,第一次提取便会保持一致的质地。
初次辨认新领域也是人的工作。若新出现的关键词没有一类完全吻合,由人决定是否新设分类;但实务上第一次先放进最接近的一类,是否新设留在第二次整合筛选。
接着人要追踪仅以代词或指示词出现的关键词:如“他进来了”的他、“在那里见面”的那里。依语境推定分类并抽出,且在关键词栏标明“他(推定:人物)”“那里(推定:场所)”,第二次再确认。
一部作品里只以代词出现的人物或场所,常在另一部作品才得到名称:第一部的“他”可能在第五部才被命名为姜时宇。第一次漏掉这个“他”,第五部的姜时宇便永远无法与第一部连起来。AI 工作伙伴常漏掉此处,因此第一次提取后,人要再扫读同一文件一次,标示代词与指示词关键词;每份文件约需十五至三十分钟。
最后留给人的是宏观验收。第一次完成后,扫一眼结果表,查看九分类中是否某一类异常空白——AI 可能整类漏掉;或某一类异常膨胀——那是该类需要再细分的信号。这不是精读整张表,而是看分类合计来抓异常值,约三十分钟即可完成。
委派给 AI 工作伙伴
此处开始的是 AI 工作伙伴承担的第一次提取主工作。过去做法是人把大原稿切成适当行数后再让它读;目前标准不同。输入文字先整体规范化一次,准备成可确认关键词出自哪个文件、哪个行范围的形式。AI 工作伙伴不会因担心篇幅上限而只读前半就停下,而是集中从提供的完整文字做全量提取。
无论规则书的一章、短篇一篇、企划书一份,都以一个区块为单位。把九分类指南与五列 CSV 格式一起交付,AI 工作伙伴便阅读文件,按九分类抽出关键词并回传五列 CSV。短篇小说的正文、作品说明、术语集、作者笔记不采用同一方法:正文以用例为中心,作品说明作为设定密度高的来源,术语集作为术语与说明的配对,后设评论通常排除。规则书的规则定义作为专门术语与装置;数值与表格不只抽数字,也抽单位与脉络。这就是为何要先说明输入种类。
委派以并行方式进行。若一个 IP 有五十份输入文件,多位 AI 工作伙伴同时处理:五位同时做五份文件,会在一人做一份需三十分钟的同样三十分钟内完成五份;五十份每五份一组,十轮三十分钟即可收尾。人可在其间做其他工作。这种并行处理是 Librarying 能在九至十六小时完成的重要原因;人手通读五十份文件要一个月,并行委派给 AI 工作伙伴约可缩为两小时。但不能只因快速完成就满足;提取后须确认出处没有只集中在输入文件前段。若后段行范围几乎没有出处,便表示提取中途停止。
以协作四轴整理此委派:输入是一份文件区块与九分类指南(定义及本 IP 的细微决定)、五列 CSV 格式、第一次合格线的姿态;此姿态容许重复与错字,不执着于整理。输出是一张五列 CSV;意图是缩短时间。人通读提取需一小时的工作,约五至十分钟完成;五十份并行执行时,人的实际投入大幅下降。预期在三十分钟至两小时取得五千至一万五千行。
委派的限制是它碰不到的领域:未明示而隐含于正文前提、常属概念与价值的含意关键词;仅以代词出现的人物、物件、场所;时点与年代标记(“那年春天”究竟是 IP 的哪一年,第一次照写法抽出,第二次决定);以及 IP 固有的玩笑与引用,例如一部作品引用另一部、某人物一句话如镜般呼应另一人物。这四项只存在于读完五年作品之人的脑中,必须由人在第一次再通过一次。合计每 IP 约一至两小时,即使如此,第一次提取仍在约一两小时内完成。
将文字移入知识结构
以创作现场的感觉来说,第一次提取是挑出关键词;从更广的角度看,它是把文字移入知识结构的工作。数字人文使用的 TEI 等体系长期处理的问题也近似于此:不把文学文字中混杂的人名、地名、日期、注释、引文、版本信息埋在句子里,而是标示为日后可再找出、可比较的结构。
Librarying 不像 TEI 那样制作 XML 标记,而是在更低的层面阅读作品正文、设定集、作者笔记、术语表,把它们转成角色、场所、事件、装置、概念等标题词候选。正文提供用例,设定集提供定义,作者笔记提供意图,术语表提供既有命名决定。输入种类不同,能抽出的知识也不同。
有了这个观点,第一次提取的态度就清楚了。我们不是摘要原文,而是在取出原文中散落的知识单位,把它们变成日后可连接的材料。因此要仔细留下出处与行范围,不能把正文、作品说明、术语集、作者笔记用同一方式压平。第一次的产物不是单纯清单,而是从文字跨入知识结构的第一张转换表。
第一次提取的产物
第一次结束时,手上会有一个 IP 的五列 CSV 表:五千至一万五千行,依九分类排序,每行一个关键词。行数到一万时,人无法一次全部读完。幸而第一次不必全部读;宏观验收只确认分类合计即可,细看从第二次整合才开始。
第一次结束后,从九分类挑一类,扫读前五十行左右,就能感觉这个 IP 的第一次是以何种姿态进行;看见 AI 工作伙伴哪一类抽得好、哪一类抽得生硬。读五十行约十五分钟,而这段时间会让第二次整合的决定轻松许多。
常见的担心是:AI 工作伙伴若抽错关键词怎么办?若五千行五列资料不精确怎么办?答案很简单。第一次只需 60% 准确度,所以其中一部分分类错误也无妨,因为第二次人会再作决定。实际上 AI 工作伙伴第一次的准确率超过 80%,九分类指南若修订完善并一同交付,接近 90%。需要 60% 的阶段得到 80% 至 90%,因此第一次能稳定通过。但 60% 合格线只属于第一次;下一阶段第二次整合要求更严格的 95%。各阶段设不同合格线,就是为了不让第一次的宽松原样流入下一阶段。
结束第一次提取
先收集,后整理。 目标不是完美整理;目标是不遗漏任何东西,整理由后续阶段来做。
第五章进入第二次整合:第一次的五千至一万五千行如何被归并为一千至两千个标题词。合格线严格为 95%,人的决定成为核心。
© 2026 MEJE WORKS Corp. & 김동은WhtDrgon. All rights reserved.