MEJE PROCESS · MEJE 知识库化工作流程白皮书 (21 章)
第5章 归并为 Wiki 标题词——第二次整合的决定
第5章 归并为 Wiki 标题词——第二次整合的决定
第一次提取结束后,留下的是五千至一万五千行的一张表。行数很多,分类分成九种,但不能把这张表原样放进 Vault。因为同一人物以三个不同名称散在三行,同一场所也以两种写法各自出现,而且一个关键词与其他关键词如何连接尚未整理。
把这些分散行整理成一本词典的工作,就是第二次整合。
第二次整合是 Librarying 四阶段中人手介入最深的阶段,合格线也从第一次的 60% 提升至 95%。
什么是标题词:辞书编纂学的基础概念
要理解第二次整合,必须先准确掌握标题词(headword、lemma)这个概念。
翻开一般国语词典,在“去”这个标题词下,“去了”“去着”“正在去”“将去”等活用形不会各自另立条目,而是全在同一条目中处理。标题词是代表一个词汇所有形式的标准形式,这个原则正是词典之所以是词典的核心。若活用形各自都是独立条目,词典篇幅会膨胀数十倍,读者在找到信息前,还得先知道应用哪个形式搜索。标题词把所有形式收在一处。
Librarying 的第二次整合所做的正是这件事。若“星罗江湖”的一位人物在第一次中以本名、汉字写法、职称、系统称呼四种写法分散,第二次便把四者收进一个标题词。无论以哪种形式搜索或遇见,都能在一个标题词取得全部信息。
辞书编纂学有选定代表写法的原则:最常用的形式、最基本的形式,或规范拼写所定的形式成为标题词。IP Librarying 也遵循相同原则,将本 IP 出现最频繁的写法,或 IP 制作人正式确定的写法定为代表关键词。此时标题词选定不是任意决定“用哪种写法”,而是所有未来 IP 参照皆会以此标题词为基准的基础决定。它一旦定下,整个 Vault 都会以该标题词为中心组织。
取《龙与地下城》的“被遗忘国度”一个标题词,原理就很清楚。人物 Elminster 的本名为 Elminster Aumar,称号有 Shadowdale 的贤者、老魔法师,以及变装时的多个假名。“被遗忘国度 Wiki”的 Elminster 单一页面将这些写法收在一起,以本名为代表,无论用哪个称号搜索都通往该页。这正是 Librarying 第二次整合在一千至两千个标题词尺度上建立的结构。
标题词与知识组织体系
区分标题词与别名的感觉,也是图书馆学与知识组织体系长期处理的问题。W3C 的 SKOS 是表达同义词表、分类表、主题标目表等受控词汇的模型:它为一个概念附上代表标记,另置替代标记与隐藏搜索词,并区分更广、更窄与相关概念。
Librarying 的十三列也有相同感觉。代表关键词是标题词的优先写法;异称与别称是让人找到同一对象的替代写法;相关关键词是标题词在意义上彼此依靠的连接。较广与较窄范畴明确时可读作上下位关系;两者并非上下时,保留为相关关系更合适。
但 Librarying 并不是实现 SKOS 的工作。它不发布 RDF,也不试图与外部知识体系做机械映射,而是在创作 IP 的 Vault 中以较低层次使用同样原理。这个比较之所以有用,是因为它说明了“为何别称要另置”“为何相关关键词不能随意加入”“同一写法指两个概念时为何必须分开”。标题词不是单词表,而是受控词汇的第一单位。
第一次结果的结构
再打开第一次的结果表。以“星罗江湖”人物分类为例,一名剑客被分散放进四行:本名(“徐云卿”)、汉字写法(“徐雲卿”)、系统称呼(“天剑手剑客”)、江湖评语(“从凶日里挖出吉日的剑客”)。一个人物以本名、汉字、系统、别号出现,无论韩语 IP 或外语作品都是相同情况。
其他分类也有同样样貌。装置分类的“天机”“乘着星光的气”“从天而降的气”分开进入;场所分类中一个官署的正式名称、简称、作品内称呼分开;物件分类中一个组织的正式名称、缩写、口语称呼分开。这种分散正是第一次提取方式的结果:第一次照原样拉出写法,将是否同义的决定延后。本章便做这个决定。
把同义行归并为一体,是第二次整合的起点。将徐云卿的四行归为一个标题词就缩成一行:代表关键词定为“徐云卿”,其余写法收进别称栏,定义则把四行的短说明合成一行。这种归并是第二次整合的本质,其结果让五千至一万五千行缩为一千至两千个标题词。每个标题词容纳所有同义写法,IP 资料才开始接近词典的样貌。
看一个存在同时有多种写法的作品,就能明白为何需要这样归并。在《全知读者视角》中,“星座”不以真名而以“修饰语”别号被称呼、隐藏身份;解读修饰语便会揭露真正的神话人物。例如修饰语“如恶魔般的火之审判者”即为大天使 Uriel。一个存在同时有修饰语、真名、神话出处,必须放在同一标题词下,读者才不会把同一人物误认为不同人物。
为何合格线是 95%
第一次合格线为 60%,第二次却跳到 95%,必须看清差异从何而来。
第一次即使有分类错误的行也无妨,因为同一行本来会在第二次再通过一次。无论它进入人物或物件,人都会在第二次再看一遍并决定,分类因而被修正。但第二次若归并错误,下一步第三次骨架构建会原样制成 .md 文件。若两个不同人物被归为一个标题词,两人的信息便混入一个 .md 文件。错误会原样进入第四次叙事写作,直到验证才发现;一旦错误归并,修复成本很高。
因此第二次的合格线是 95%。不是 100%,因为人的决定偶尔也会偏差,剩下的 5% 会在最后验证抓出;95% 是人能达到的最严格线。正因这种严格性,第二次整合由人主导;AI 工作伙伴即使快速编出同义词候选,最终决定仍由人下达。
十三列标题词的结构
第一次的产物是五列(IDX、分类、关键词、说明、出处),第二次的产物则是十三列。第一次带来的基础信息(IDX、分类、出处清单)保留,并新增八列。
确立标题词身份的字段。 代表关键词是已归并同义词中代表该标题词的写法,选本 IP 的正式名称或最常出现的写法。此代表关键词成为标题词的文件名,Vault 内其他标题词以[[代表关键词]]形式引用它。
代表关键词一旦确定,Vault 内所有参照皆以此写法为准。若某 IP 制作团队正式更改一个装置名称,只要将代表关键词改为新名称、旧名称降为别称,Vault 内所有 wikilink 都会自动更新。这就是单一真实来源的力量。
世界观轴是与九分类正交的第二分类基准,回答“这个关键词属于我们世界观的哪个结构”;第六章会详谈。异称、别称是代表关键词之外指同一对象的写法。它是为搜索而设的字段:必须登记在此,读者才能在自己 IP 的 Wiki 用别称搜索而抵达标题词。姐妹工作检查新短篇原稿时,也只有别称已登记,才能自动识别该写法是哪个标题词。
多语言字段。 英文名是为翻译提议的英文写法;罗马字是依韩语罗马字标记法(RR)的写法。人名使用“Min-ji”般带连字号的罗马字;场所专名使用“Haewon Restaurant”般罗马字加类型;文化固有语使用“Han (lingering resentment)”般音译加说明。准备多语言出版的 IP 中,这两列是核心资料;翻译者初次打开 Vault 最先确认它们,可减少翻译者自行决定写法的无谓时间。
正文字段。 定义是最压缩地说明该标题词是什么的一两句核心定义,不放[[链接]],要能自足。
详细说明是包含运行原理、历史、结构、与其他标题词关系的两至八句正文。它最终会有[[链接]],但工作者不从一开始手工插链接。先以纯文字写详细说明,在第二次合并时按代表关键词与异称、别称清单自动将相关标题词处理为 wikilink。如此便不会混入[[X|Y]]类任意别称链接,整个 Vault 也以代表关键词为基准整理。这两列初稿在第二次达 80% 即可;与同义词归并等必须跨过 95% 的核心决定不同,定义与详细会在第四次叙事写作重新修整,只要方向正确、包含核心即可。
相关关键词是与此标题词连接的其他标题词清单。此列填妥后,第三次骨架构建会自动注入 wikilink,在 Obsidian 内画出节点间的线。关键词云的连接网由此列编成;没有相关关键词的标题词会在图谱视图留作孤立节点。连接网越密,Vault 越好。
时期与翻译元数据。 版本状态是标题词的时期状态。“现行”是 IP 现在使用的标题词,多数属于此处;“过去”是某时期曾使用、现在写法或意义已变的标题词。某 IP 第一版使用的地名在第三版改为另一地名时,第一版旧地名就是例子。
“废弃”是不再使用的标题词;若在翻译笔记写下废弃原因,后人便不会再次使用同一写法而造成混乱。“双重标记”是两种写法刻意共存,例如同一事物依地区有不同称呼。“未定”则是尚未确认的标题词。过去与废弃标题词不删除而保存,是因阅读过去作品仍会看见该写法;读者看第一版后搜索,不能因没有标题词而找不到信息。
翻译笔记记录翻译时应注意的文化与脉络事项。对“恨”等文化固有语记下音译方式与说明;对巫俗术语采用“Mudang (Korean shaman)”般音译加说明;对时代语记下翻译时要留意的脉络。它像写给未来翻译者的信,使下一次翻译无须重作同样决定。
这十三列构成一个标题词的一行。当一千至两千个标题词排好,一个 IP 的整体词汇就收进一张表。
人所做的决定
先确认十三列中由人直接决定的部分。
最棘手的是同义词归并。若“星罗江湖”的徐云卿以本名、汉字写法、系统称呼、江湖别号出现,就要决定四者是否收进一个标题词,或其中一种写法是否其实指另一人。熟悉 IP 的人会觉得理所当然,但相同的系统称呼也可能指不同人物。“天剑手剑客”既用于徐云卿,也用于沙木:一方是在吉星的吉日拔剑的正派剑客,另一方同时承受凶星的质地而流入邪派。若把同样以天剑手为命名性的两人归成一个标题词,正派剑客的定义便会混入邪派剑客的定义。人必须决定“天剑手剑客”这一写法属于两个标题词中的哪一个。
也有随时期改变意义的写法。第一版某装置名称指一种东西,第三版同样称呼却指另一装置时,必须决定两个时点的写法要合并成一个标题词还是分成两个。本书建议分开,并在版本状态标示“仅第一版/仅第三版”;合并会让两种意义在一个文件冲突。
同名人物若在第一季是配角、第三季成为主角,适合保留为一个标题词,并在正文整理各时期的变迁。这类判断只有读完五年作品的人脑才能准确作出。
标题词命名是在多个同义写法归并后,决定其中哪个写法成为代表。韩语 IP 选韩语正式名称;处理外语作品的韩语出版时,选出版所用的韩语写法;未定正式写法时,选出现最频繁者。代表一旦确定,其他写法都成为别称。别称可供搜索,却不作为标题词标题出现;Vault 内 wikilink 归并至代表关键词。
世界观轴决定与版本状态决定也是人的工作。世界观轴允许值(每 IP 五至七轴)在第一次提取前的配置阶段先定好。AI 可提议候选,哪个轴符合本 IP 结构仍由人判断。版本状态也只能由熟悉 IP 时期流动的人决定;第一版出现的写法在第三版被废弃,这件事存在于读完两个版本之人的脑中。即使 AI 读了两版,也可能无法区分是刻意废弃或单纯写法改变。
定义合格线判断也由人负责。人衡量由多行短说明合为一行的定义是否过线:太短没有标题词轮廓,太长便成为长叙述而非定义。一至三行较合适。
委派给 AI 工作伙伴
AI 工作伙伴在辅助人的决定之处快速工作。同义词候选提取接收第一次的五千至一万五千行,建立可能同义的行组候选:写法相近、同一出处出现、带有相同定义的行被归为一组。这些候选约有 70% 至 80% 可直接通过,人只需修整 20% 至 30%。一行定义初稿在别称组确定后产生,将第一次收集的短说明合并压缩为一两行,人以约 80% 水准验收。AI 可提议相关关键词,但最终 wikilink 注入以全局标题词清单自动处理较稳定。世界观轴候选则取得配置预定的允许值,为各标题词附上最接近的轴候选,再由人验收确定。
以输入与输出展开,输入是第一次五列 CSV 一块、本 IP 的同义词归并指南、世界观轴允许值清单、十三列整合 CSV 格式。输出是十三列整合 CSV,其中自动附上同义词组候选、填入一行定义初稿、自动注入相关关键词 wikilink、附上世界观轴候选。委派的意图既是缩时也是一致性。人完整读五千行再建立同义词候选要一周,现在约三十分钟便有候选,人的决定时间缩为两三小时。预期二至四小时内取得一千至两千个标题词排好的十三列 CSV。限制在同义词最后决定、是否新设世界观轴、定义语调、版本状态,这四项都必须由人决定。
决定的流程
第二次整合的流程如下。先把第一次五列 CSV 整体交给 AI 工作伙伴,同时交付同义词归并指南、十三列格式、配置确定的世界观轴允许值清单。AI 用约三十分钟至一小时编出同义词候选组、一行定义初稿、相关关键词候选、世界观轴候选。接着在合并阶段,详细说明内的标题词依代表关键词与别称清单自动成为[[代表关键词]]链接,超出允许世界观轴的值会被抓为错误。
收到结果的人以严格的 95% 合格线开始验收:逐组查看同义词是否正确、是否应拆开、是否应再加入一行;验收并确定世界观轴候选;填入版本状态;验收定义初稿。
验收约需两至三小时,相当于让一个 IP 的 1,500 个标题词各通过一次。但通过深度依标题词不同:100 至 150 个 hub 标题词每个要一至两分钟决定,1,000 个 leaf 标题词每个约十秒即可;自动计数准确时,leaf 多半只需放行。
验收结束,十三列整合 CSV 跨过合格线。第一次的五千至一万五千行被归并、排成一千至两千个标题词,IP 资料终于抵达一本词典的形态。
第二次结束后看见的东西
第二次整合后会出现一个有趣结果:按标题词被引用次数排序十三列 CSV。被引用次数是一个标题词出现在其他标题词相关关键词列的次数,由自动计算取得。由最高到最低排好,查看前十名,便能一眼看见本 IP 的中心放在哪里。
“星罗江湖”如此排序时,第一是区分武功威力的核心资源“天机”,第二是天机秩序唯一例外的主角“逆天者”,第三是控制历法的权力中心“武林盟”,第四是将江湖二分的“正邪派”。本 IP 的身份浓缩为四个标题词;运营五年后才显露,原来从未以如此压缩的方式确认过这个身份。1,500 个标题词整理好,IP 身份便在 hub 排名显现,这也是 Librarying 的预期效果之一。
其中藏着把同义词组抓得太宽的陷阱。以外语作品《傲慢与偏见》为例:Bennet 家有五姐妹,依作品称呼惯例任何人都可能被叫作“Miss Bennet”,因此一处出现“Miss Bennet”并不保证指长女 Jane。建议第一次遇到称号时先分开保留,仅在正文明确是哪个人之处才作同义词归并;未明确者留作“Miss Bennet(不特定)”,在第四次叙事或验证再作决定。错误归并会让一人的定义侵入另一人的定义。
同一称号随时点指不同人物也是同样陷阱。《我独自升级》中“影之君主”是职责名称;第一代影之君主本名 Ashborn,主角成振宇继承其力量而成为第二代影之君主。一个称号依作品时点指 Ashborn 或成振宇两人,所以标题词需同时记录职责、固有名与继承关系,才能分辨各段“影之君主”指谁。
自动计数也有极限。它数标题词出现在其他相关关键词列的次数,次数高就标为 hub 候选,但出现次数不等于 IP 核心。在“星罗江湖”,几乎用于计算所有武人强弱的“历法”被引用极高,却更像背景资料而非 IP 精髓;反过来,引用少的标题词也可能决定 IP 身份。不属于任何星座的“无名星”就是如此:出现频率虽低,那份空白本身却构成 IP 精髓。因此自动计数标示 hub 候选后,人再从候选中确认真正属于 IP 核心者为 hub。第八章会详谈此判断。
结束第二次整合
上下扫过十三列 CSV 一次,一个 IP 的全部词汇便可进入一个画面。1,500 个标题词排列着,各自属于哪个分类与世界观轴、拥有何种别称都看得见。这是第一次一眼确认本 IP 整体词汇地图的时刻。
第六章将正式讨论世界观轴。本章只先掌握概念的世界观轴,如何依 IP 设计,并如何与九分类正交来描出 Vault 的地形,将在下一章细看。
© 2026 MEJE WORKS Corp. & 김동은WhtDrgon. All rights reserved.