MEJE PROCESS · MEJE 知识库化工作流程白皮书 (21 章)
第1章.从词汇表到云端:我们处理的资料如何改变
第1章.从词汇表到云端:我们处理的资料如何改变
不可能用一个词解释《星球大战》。
当我们说“以宇宙为背景的善恶对决”时,真正重要的东西便漏掉了:首先是原力。没有原力的《星球大战》很难称为《星球大战》。但放进原力,绝地武士团自然随之而来;放进绝地,光剑随之而来;放进光剑,达斯・维达随之而来;放进达斯・维达,“我是你父亲”那句台词也会一串串跟来。
有反抗军和银河帝国,有死星和千年隼号。这些事物不是各自分离存在,而是彼此扣合:绝地和达斯・维达相连,原力和光剑相连,反抗军和银河帝国相连。
星球大战就是这整张连接网。 它不是一个词,而是这些词编织而成的关系网。
读者的 IP 也是同样道理。无论小说、游戏、网络漫画或规则书,把一个 IP 用一个词说明就会变成谎言。构成那个 IP 的所有词如何相互连接,这本身就是那个 IP。
我们称为“图书馆化(librarying)”的工作,是有意识地建造这张关系网。它将只活在创作者脑中的关系网取出来,变成看得见、摸得着的资料;本书将用十四章引导这项工作。
资料没有连接这件事
经营一个 IP 约五年的人,桌面通常是这种样子。
若有规则书,大概堆了七本:本篇分成第一版、第二版、第三版,中间夹着两本左右辅助资料集,还留着一本曾想全面重做却半途而废的第零版。如果短篇累积起来,文件夹轻易超过一百篇;外部维基也会开在一边屏幕。五年前有人开始却停手的页面接近一千页,但活着的页面不到两百;打开策划书文件夹,同名文件以不同版本放了约三十份:v1.0、v1.1、v1.1_修正、v1.2_最终、v1.2_最终_再最终。
想在这种桌前写一篇新短篇,马上会被琐碎问题绊住:三年前规则书出现的那个人物叫什么?那个人物所属势力写在策划书哪里?与那势力敌对的集团在哪篇短篇初次登场?要回答这些问题,只能逐一翻找七本规则书和一百篇短篇。因为不能搜索,没有连接,同一个词也没有在任何资料中被一致整理。
最后作者会创造名字相近的新人物,或稍微改设定把既有人物拿来用,或干脆跳过。于是 IP 里开始堆积小矛盾:一个人物有两个名字,一件事件的日期在两本书中不一致,一个地点的描述在前篇和后篇不同。IP 越大,矛盾也一起膨胀。
这就是资料散落问题的实体。不是因为没有术语,而是因为没有关系。
一个老问题
这个问题并不新。托尔金数十年间留下大量手写笔记,但资料未被系统化管理,死后儿子克里斯托弗又花了数十年才整理完。弗兰克・赫伯特的《沙丘》世界观,也在儿子延续系列时遇到不少重新建构的困难。
到了网络小说和网络漫画时代,问题以大得多的规模浮现。连载数百话期间,必须一致管理数十名人物和数百个专有术语。粉丝可能先站出来建立维基,但那终究是读者的资料,不会成为作者的内部资料。它必然混入读者的诠释和误读,更重要的是,它无法作为作者写下一话时放在身边参照的工具。
一个 IP 的资料没有整理在同一处。 这个问题至今仍未解决。
词汇表这个第一个答案
对此问题的第一个答案,是词汇表(glossary)。把一部作品出现的专有名词、专业术语、世界观关键词依序列出,并在每个项目旁附上短定义的一张表,就是词汇表。
制作词汇表的工作方式本身对每个人都很熟悉。开始一部作品时,在作者笔记的一角另留一张词汇表页面,每出现一个新词便多加一行。只看一部作品的边界内,这种方式已足够有效率;打开词汇表就能一眼确认哪些人物漏了、哪些机制还没定义。
但作品变成两部的瞬间,景色开始改变。第二部的新项目必须加进第一部的词汇表,而其中可能有人物已在第一部被一行提及,因此得先决定是否同一人。若判断为同一人,就要用第二部信息补强第一部的一行;作品变成五部、十部时,这类决定量会爆炸性增加。
词汇表失败的原因,不只是量太多。列表这种形式本身,在结构上不适合 IP 知识的性质。
列表形式有两项缺陷。
第一,无法容纳项目和项目之间的关系。 一个人物生于哪个地点、在某事件扮演什么角色等关系,可以写成“相关:A、B、C”,但要再次确认 A、B、C 分别是什么项目,仍得从头翻列表。关系即使被储存,要沿着关系移动却不方便。
这点重要,是因为 IP 知识的核心不在事实而在关系。“某人物有某个名字”的事实,远不如“那个人物为何在这个事件与那个人物冲突”重要。无法舒服追随关系的资料形式,正会在表达此核心时暴露限制。
第二,列表是单向的。 即使人物 A 的项目写着“相关:地点 B、事件 C”,走到地点 B 的项目时,“与此地点相关的人物:A、D、E”的反向信息也不会自动出现。要维持反向信息,就得在人物 A 与地点 B 两边亲手写上相同内容;项目越多,这种手动管理越不现实。
看看这两项缺陷如何在实务中显现。假设某 IP 要修正名为“亨斯福教区牧师宅”的地点,于是在词汇表找到该项目并改正。然而要找出在亨斯福教区牧师宅发生的事件、以它为背景的场景、出现它的人物故事,并使它们全都一致,最后仍只能从头重读整份词汇表,因为项目之间没有连接。
没有连接时,改动一边后很难确认变化对另一边有何影响。这就是 IP 越大,作者越感到窒碍的结构性原因。
容纳关系的格式
从词汇表的失败出发的替代方案,是直接连接项目和项目的想法。
翻开百科全书时会看到“→参见:项目名”之类的标示,像这样直接连接项目的想法其实很早就存在。读者读 A 时转到 B,再从 B 转到 C 的连锁,纸质百科全书也曾以自己的方式尝试实现。
把这个想法完全实现的是互联网。万维网的核心想法是用链接把文档和文档接起来,维基百科则是把这个想法套用到百科全书格式的结果。读“拿破仑战争”时可点到“特拉法加海战”,再转到“纳尔逊上将”;任一项目也会显示“参照这份文档的文档”,连反向链接都能确认。
有趣的是,热门 IP 越成长,最后越接近这种链接的词典形状。我常以《全知读者视角》为例:原作网络小说、网络漫画、电影各自分成大项目,并以链接相接;从一个人物可立刻跳到他所属的事件和世界观设定。热门韩国网络小说终究会长成标题词彼此链接的词典。游戏方面,《英雄联盟》的制作公司直接经营名为 Universe 的官方剧情网站,备有从一位英雄立刻跳到其所属地区和事件的链接式正典资料库。
将这个想法套用到 IP 资料管理,画面会是如此:在一个人物页面内,他相关的事件、常出现的地点、所使用的机制都用链接相连;事件页面列出牵涉该事件的其他人物,地点页面再以链接列出以该地为背景的事件。
这就是把 IP 资料不当作列表而当作网络管理的想法;这张相连的网络称为关键词云。如果词汇表是没有链接的列表,关键词云便是那些关键词相互连接的关系网。
在这里,链接本身就是信息。两个项目之间有链接,包含编辑者判断二者在 IP 中以某种方式相关。因此链接密度高的项目位于 IP 核心,几乎没有链接的项目位于外围。沿着链接走,IP 的地形会自然显露。
第一次打开图谱视图的那天
有一种实现这个想法的工具,叫做 Obsidian 的笔记工具。
Obsidian 将用户建立的所有笔记以 .md 文件保存在同一个工作文件夹。.md 是 Markdown 格式的扩展名,这种格式只在纯文本加上几个轻量符号,便能标示标题、强调和链接。它不像 Word 文件那样沉重,而是连记事本都能打开的轻量文本。
Obsidian 可以用 [[项目名称]] 的表示法自由连接这些 .md 文件,这种表示通常称为 wikilink。Obsidian 会在称为图谱视图的画面中一次展开 wikilink 所连的关系网,让你看见点浮在画面上、点与点之间有线相连的图。
曾有一天,我把五年份资料搬进 Obsidian,第一次打开图谱视图。
此前,连资料到底有多少都无法估计。我知道词汇表记载的项目数量,却无法得知这些项目如何相连、哪个人物是 IP 实际中心、哪个人物意外位于外围、哪个事件接到最多标题词、哪个概念最深地支撑世界观。
打开图谱视图后,这些东西才开始可见。IP 哪个区域密集、哪个区域空白;哪个人物比预期连接更多标题词、哪个人物孤立无援——词汇表始终看不见的资料风景,一眼就进入视野。
那正是我从词汇表走向云端的瞬间。
名为图书馆化的工作
把一个 IP 的资料建造成云端的这项工作,我们称为 〈图书馆化〉。
若 library 意指图书馆或词典,librarying 就是把建造那部词典的工作变为动词形。建造一个 IP 的图书馆,就是我们所称的图书馆化。
这个称呼包含小小的意图。图书馆不是建好一次便结束,图书馆化也不是建造一次便完结的工作。新书进来时,要查看分类系统决定放在哪里;书架满了,要添新书架;分类混乱时,要重新整理。就像图书馆运营一样,一个 IP 的关键词云也是活着、行动的资料。
图书馆这个比喻还有另一层意义。图书馆不只是堆放书,而是分类,依固定标准替每本书编号并指定位置。没有分类,图书馆只是仓库;书再多,找不到便等同于没有。
图书馆化也是同样。目标不是堆积关键词,而是分类、连接、使其可以找到;朝向这个目标的四阶段工作,就是图书馆化的本体。
它不是做维基
这里先切断一个误解。用 Obsidian 做维基的方法已很普遍,搜索便会出现数十种;但图书馆化不是那种做维基。差别不在容器,而在切分方式。
图书馆化不依韩文字母顺序或出场顺序排列关键词,而依叙事功能区分。先问这个词是人物、装置还是价值;再交叉 IP 各自设计的世界观轴,便可做双坐标搜索,例如在《共同》中只找“与协会纠缠的人物标题词”,或只找“附属于地下城的物体标题词”。只有一种分类标准的词典做不到这些事。
因此成果的位阶不同。粉丝维基是读者的参考资料,笔记应用的 Vault 是个人的记忆辅助;图书馆化建造的 Vault 则是制作人运营整个 IP 的唯一原本。新短篇、新角色、外语翻译、百科全书都通过这一本。容器同样是 Obsidian,收纳什么、如何收纳却不同。
人读的图和机器读的图
到了这里,图书馆化会碰到知识图谱这个更大的潮流。看看 Wikidata 与其基础工具 Wikibase,许多人共同修正相同知识,结果却保留为机器也能读的结构化数据。人读项目的名称和说明,机器读项目的属性和关系;同一份资料被人和机器以不同方式阅读。
图书馆化的 Vault 并非要立刻建立这样的结构化数据库。Obsidian .md 文件更接近容易被人阅读的一侧,制作人创作时必须能直接打开查看。不过,一旦把标题词、别名、九分类、世界观轴、相关关键词、出处分成固定字段,这个 Vault 也开始逐渐具有机器可读知识图谱的性质。
所以把图书馆化称为“做维基”太小,称为“完成的知识图谱系统”又太过。它准确地位于两者之间:从贴合人手的 Obsidian Vault 开始,却以长期可走向结构化数据与知识图谱的形式整理 IP 的关系网。
四阶段流程
图书馆化的输入包含规则书、短篇、策划书、外部维基、剧本等散落文档,输出则是 Obsidian 维基。连接两端的是 一次提取、二次整合、三次骨架构建、四次叙述写作四个阶段。
一次提取是从所有输入拉出关键词的阶段。依九种分类,逐一记录规则书出现的所有人物、地点、物品、事件、装置、概念、价值;不在意重复,即使同一人物以不同写法出现,也先原样拉出。一个 IP 的一次提取结果会成为 5,000 到 15,000 行的巨大表格。
表格进入二次整合后,相同意义的东西会被并入一个标题词。标题词指的是关键词像词典项目般正式登记的形式。例如将“黑雾”“黑色烟”“Tenebre”三种写法并成一个标题词,该行便会整齐排列英文、韩文、定义、相关关键词、翻译候选。结果是 5,000~15,000 行缩减为 1,000~2,000 个标题词。
标题词表完成后,三次骨架构建将其转换为 1,500 个 Obsidian .md 文件。一个标题词成为一个 .md 文件,文件内有定义、详细说明、相关关键词的 wikilink,并保留尚未写入文字的写作空间。
最后的四次叙述写作,将各标题词的文章写进这个空间。每个标题词篇幅介于 200 至 1,000 字。以现代猎人题材世界观《共同》为例,它不止于“浓度是从闸门渗出的魔力密度”这一句定义,而是用一段流动文字说明该概念在 IP 世界中具有什么意义。1,500 个写作空间都填入这类叙述后,一个 IP 的关键词云才完成。
一次、二次、三次的本质是机械式整理,四次的本质是写作。两种本质的差异划分工作性质,也正是本书最重要主题——与 AI 工作伙伴协作的质地——所由来。
用两只手建造的工作
一个人能建好全部 1,500 个 .md 文件吗?
可以。但若只靠一人双手推进,要花数个月。只靠手工作业的时代,一个 IP 的图书馆化接近要六个月。要六个月的工作终究不会常做;不常做,资料便不更新;不更新的资料最终会成为死资料。
如今能定期运营图书馆化,背景有两个变化。第一是程序的整理:建立四阶段流程,预先定下各阶段的输入、输出、合格线。第二是引入 AI 工作伙伴。
没有 AI,图书馆化也能运作。 方法论本身与 AI 无关,四阶段管线、九分类体系、双坐标轴设计、十三列标题词结构皆然。陌生词一次出现很多,但现在不必背;第4章至第9章会逐一拆解。重要的是,这些是 AI 出现前也能手工实现的方法,且实际上长久以来都是这样做的。
但目前的运营型工作流程,以 AI 工作伙伴和自动化约定为前提。现在的图书馆化,将人手可行的方法放进可重复的时间内,并能再套用到多个 IP。AI 不取代方法论,而是把方法论拉进可持续的运营时间。
AI 承担的工作很具体:一次提取的大量处理、同义词候选提取、四次叙述写作的初稿。人手要数月的工作,和 AI 协作可在一两天内完成。
但决定性判断始终是人的责任:哪些写法指同一人物、标题词要如何命名、世界观轴怎么设计、写作是否跨过合格线,最后决定的不是 AI 而是人。
说 AI 会写 1,500 个项目,听起来像量产物,实情正好相反。制作人直接写的几篇代表 hub 决定其余标题词的声音。AI 是手,制作人是声音。手只是快,写什么、用什么调性,是声音决定。
两种角色一起前进时,那一两天实际是 9~16 小时工作。老实说,第一个循环更久;还不熟手时大约是预期的 1.4 倍,从第二、三个循环起才落在这范围。即便如此,半年已缩成几天。
本书在每个阶段逐行指出交接什么、为何委任、改善什么、哪里必须由人直接决定。它不是“用 AI 很好”这种模糊劝告,而是清楚区分 人在哪里停下、工具从哪里开始 的文章。
与姊妹文章的关系
与本书相连的姊妹文章有两篇:〈西燕阁〉与〈新角色构建〉。
〈西燕阁〉处理深入阅读外语作品的工作。它拿起简・奥斯汀《傲慢与偏见》这类作品,在进入翻译和改编前,精密分析并文档化人物、事件、世界观、语言的六阶段工作,用十四章展开。〈新角色构建〉则处理从零塑造一个人物的工作。
本书处理的是建立两篇姊妹文章共同使用的资料基础。若〈西燕阁〉是深入阅读作品,〈新角色构建〉是塑造人物,〈图书馆化〉便是建造一本让深读和人物塑造都必须通过的词典。即使尚未读过姊妹文章,也能独立跟随本书。
接下来的流程
先展开十四章的流程。
第1章抓住从词汇表到云端、从列表到网络、从一个人到两只手移动的方向。接着第2章更仔细看制作人和 AI 工作伙伴的角色,第3章一次展开四阶段流程全貌。
第4章开始正式工作:第4章谈一次提取的方法,第5章谈二次整合,第6章谈两个分类标准——九分类和世界观轴。第7、8、9章谈 Vault 的形状:第7章谈三次骨架构建,第8章谈 hub 和 leaf 的区分。本书高潮的第9章,用整章详看四次叙述写作规格:制作人直接写的几篇代表 hub 决定其余项目的调性,AI 工作伙伴以此调性填入标题词。
第10、11、12章处理验证和运营,第13章是实战回顾,第14章是收尾章。
回到关系网
回到开头的《星球大战》。
原力、绝地、光剑、达斯・维达、反抗军、银河帝国如何相互连接,就是《星球大战》。这张关系网先存在乔治・卢卡斯脑中,脑中的关系网成为规则书、电影剧本、角色设定集。资料被充分整理,才使《星球大战》即使过了一代,仍能在不同制作人手中一致地活着。
若 v1.2_最终_再最终 还在文件夹某处,关系网尚未整理于一处,走过十四章后终于会有些东西显现:哪个人物是此 IP 的实际中心,哪个概念最深地支撑世界观。
现在开始有意识建造那张关系网的十四章。
© 2026 MEJE WORKS Corp. & 김동은WhtDrgon. All rights reserved.