MEJE BOOKS Knowledge Library

MEJE PROCESS · MEJE 知识库化工作流程白皮书 (21 章)

第3章 从输入到 Vault——四阶段流程

MEJE Works · 章 3

第3章 从输入到 Vault——四阶段流程

为什么不能一次处理所有资料?摊开 IP 文档后,不能直接制作最终成果吗?在 Obsidian 里,这个最终成果称为 Vault。这是本章第一次出现这个名称,它的确切样貌会在稍后的“输出的景观”中介绍。Librarying 之所以有四个阶段,正是对这个问题的回答。

Librarying 从输入开始,经过第一次提取、第二次整合、第三次骨架构建和第四次叙事写作,最后形成 Vault。我们将依次查看每个阶段接收什么、产出什么,其间有哪些决策介入,以及人与 AI 工作伙伴在哪里、如何分工。

输入的景观

想象开始工作的桌面:第一版到第三版的规则书堆在一起;有一个收集五年短篇的文件夹;有某人建立后便停止更新的外部 Wiki;还有一个只在协作聊天中出现过一次便消失的命名候选。Librarying 接收的输入,就是这些分散资料的全部。一个 IP 的所有文档都原样进入输入端。

本章不一路追随某个特定 IP,而是在每个阶段短引最合适的案例。案例中的人物、装置、事件都以匿名的“某个 IP”处理,避免与任何读者的 IP 直接重合。若阅读时那幅桌面景象与自己的桌面重叠,这份重叠就是将此程序移入自己 IP 的通道。

若有规则书,第一、二、三版全都是输入,连废弃的第零版也包括在内。因为源自废弃资料的名词或视角,可能流入仍在使用的短篇;要抓住这些痕迹,就必须让废弃版本至少通过一次。短篇、小说与剧本等 IP 运营过的所有作品都是输入,外语作品也连原文一同放入。企划书与设计书同样是输入:企划书整理作品的大图景与意图,设计书则收录角色创伤、事件因果链、装置运行原理等未直接呈现于作品的决定。

外部 Wiki 也要通过。有人五年前开始建立后便放手的页面,无论持续更新或已被搁置,都包含在输入中。搁置页面保留了五年前的名词与视点;要确认它们是否与现行作品错位,就必须至少检查一次。

若作品是影像或游戏,按场景整理的对白资料、过场动画脚本、游戏内文字皆为输入。桌旁夹着的纸本笔记、临时文件夹的文字、协作聊天记录里仅出现一次的命名候选也都先通过,即使不是正式资料也一样,因为第一次提取的合格线相当宽松。

输入量依 IP 而异。若是运营五年的中型 IP,正文文字总量约在一百万到五百万韩文字元之间。以一本韩语单行本平均三十万字元计算,相当于三到十七本书的文字;一个人光是完整通读一次,就需要一个月。Librarying 从这些输入提取关键词,却不让人去通读;若由人以通读方式提取,工作又会膨胀成六个月。

整理输入时最先做的是建立位置目录。在一张表中整理哪个目录有哪些文档、文档属于 IP 的哪个时期、属于哪个领域(规则、短篇、企划、外部)。此目录是第一次提取的起点,由人做决定。可以把目录树交给 AI 工作伙伴并取回目录,但哪份文档属于哪个领域仍由人判断。此判断一旦模糊,下一阶段的提取也会模糊。

输出的景观

Librarying 的输出是 Obsidian Vault。Vault 在 Obsidian 中指一组 .md 文件:同一工作文件夹里存放 .md 文件,文件之间以 wikilink 连接。初次使用 Obsidian 的读者,可以把 Vault 想成一座 IP 的图书馆——馆内放着 1,500 本书,书与书之间通过引文相互连接。

第一次打开一个 IP 的 Vault 时,左侧栏会按字母或韩文字母顺序列出 1,000 到 2,000 个 .md 文件;上方有搜索栏,旁边有打开图谱视图的按钮。点选一份文件后,正文由五部分构成:开头的 frontmatter(YAML 元数据)、一两行定义、两三段详细说明、多语言翻译候选,以及 AI 工作伙伴写成的二百至一千字元叙述。

frontmatter 是以冒号配对键和值的一组行。代表关键词、分类、世界观轴、英文名、罗马字、版本状态、出处、相关关键词等信息分行放入。其中的世界观轴是本书第二个分类基准的名称,第六章会用一整章讨论。人几乎不会直接读 frontmatter,而是让搜索与自动化读取它来处理工作。定义是一两行;详细说明短则一段、长则两三段;翻译候选是英文与罗马字等多语言标记;叙述区块则依条目的重要性放入二百至一千字元的叙述。这就是一个 .md 文件的样貌,1,500 个文件全以相同格式整理。

按下 Obsidian 的图谱视图按钮,画面会展开 1,500 个点与其间的连线。点对应一个标题词,线对应一个 wikilink。连线大量汇集的点是 hub,连线较少的是 leaf。这幅如星座般展开的图,就是 Librarying 的最终成果。

成果一旦完成,Vault 就成为 IP 的真实来源。外语作品的深度阅读工作会引用 Vault 里的人物与装置标题词;从零塑造角色的工作会参照 Vault 的世界观关键词;出版 LOREBOOK 的制作则把 1,500 个标题词转为百科条目。第十二章会详细说明此出口的景观。

流程不是线性的。出口工作中新产生的词汇、新确定的写法、新增加的设定,都会回流到 Vault;这称为逆流。每有逆流,第一次提取与第二次整合的小循环便重复,第三次骨架构建也增量更新。因此 Vault 并非做完即止,而是在 IP 存活期间持续成长。第十一章会详谈逆流与运营循环。

为什么必须是这个顺序

在介绍四个阶段之前,先回答一个问题:为什么一定要四个阶段?不能缩成两个或三个吗?

理解每个阶段为何置于这个顺序,就能看见把 Librarying 套用到自己 IP 时,可以如何调整各阶段。

各阶段解决的是不同层次的问题。第一次问“有什么”,从输入文档拉出关键词本身;第二次走向“同类事物是否被归在一起”,把同义写法合并为一个标题词并选定代表写法;到第三次,问题变为“是否是工具可处理的格式”,把 CSV 的行转成 Obsidian .md 文件;最后第四次问“这是不是活的信息”,填入解开标题词在 IP 内所处位置的叙述。

层次不同,所以顺序不能调换。从第二次整合开始,没有可整合的材料,工作无法出发;跳过第二次,把第一次的五千行直接交给第三次,同一对象会散落为三个 .md 文件,彼此不会相互引用;跳过第三次,两千个标题词只会排在 CSV 里,没有 .md 文件提供第四次叙述的空间;跳过第四次,虽有 frontmatter、定义与详细说明,却没有解释其在 IP 内位置的叙述,出口工作得到的便是有信息却没有脉络的词典。

数据工程有一副称为 ETL 的骨架:Extract、Transform、Load,意即提取、转换、加载数据的三个阶段,是数据工程数十年来打磨的资产。Librarying 的第一次提取对应 Extract,第二次整合对应 Transform,第三次骨架构建则精确对应 Load。

这里常让人想说:“所以 Librarying 前三个阶段不过是 ETL 的应用。”我反而认为相反。数据工程把这副骨架用于交易记录、日志、传感数值等结构化与半结构化数据;然而 IP 叙事资料是从未有人放入此骨架的材料。规则书、短篇、废弃版本、外部 Wiki 等资料,混杂着人的手感、矛盾与时期变化;第一次、第二次、第三次正是把这些材料首次锻入提取—转换—加载框架的工作。它不是相似之物,而是借用已验证的骨架,为新材料专门化的结果。

而第四次不在 ETL 里。数据工程止于加载,Librarying 却在整理好的资料上再叠一层活的叙述。不止于整理、而在其上书写的第四次,正是 Librarying 的独特之处;任何数据管线都没有与之对应的阶段。

四个阶段产出什么

先简要查看每个阶段接收什么输入、制作什么产出。第四章到第九章会逐一展开。

第一次提取从输入文档拉出所有关键词,整理为五列 CSV。CSV 是以逗号分隔字段的表格式文本文件,电子表格和自动化工具都能处理,适合作为中间产物。这里使用 IDX、分类、关键词、说明、出处五列;一个 IP 的结果可达五千至一万五千行。合格线宽松,允许重复、错字和未整理状态。若一开始就要求精确,每拉出一个关键词都得同时判断它是否与既有标题词重复、属于哪个分类、该归于哪种代表写法;一个决定等待下一个决定的瓶颈,会让第一次提取慢上数十倍。它像数码摄影的 RAW 工作:先全部拍下,再在下一阶段筛选和校正。AI 工作伙伴承担核心工作,多位伙伴并行自动提取九分类表;人负责修订九分类指南、决定新分类、宏观验收,以及确认代词、视点、废弃名词的痕迹。第四章会详细讨论。

第二次整合把第一次的五千至一万五千行归并为一千至两千个标题词,并组成十三列 CSV。错误决定会让整部 Wiki 偏移,因此合格线严格要求 95%。最常见的是同义词组:把第一次的“黑色空洞”“黑色烟雾”“黑暗雾气”归为一个标题词,并确定代表写法。同音异义词、随时期改变意思的关键词、同名的不同人物等判断,只有读完五年作品的人脑才能准确作出。AI 工作伙伴快速制作同义词候选、定义初稿、相关链接、世界观轴候选;人作最后决定。十三列 CSV 约在两至四小时内整理完成。第五章和第六章详述此阶段。

第三次骨架构建把第二次 CSV 转换为 1,500 个 Obsidian .md 文件。它几乎完全自动化,是确定性的转换,人的手几乎不介入。

一行中的一个标题词成为一个 .md 文件;行的字段放入 frontmatter 字段;定义和详细字段变成正文段落;相关关键词自动注入为 wikilink;正文最后保留一个供叙述填入的空位。此时打开 Obsidian 图谱视图,1,500 个节点和 wikilink 连成的网络便铺满一个画面。不过写作空间仍是空的。

构建本身约五分钟,人工验收约三十分钟。验收对象是称为 manifest 的构建结果摘要文件,其中包含文件数、分类统计和进度状态(第七章详谈)。若转换规则有缺陷,1,500 个文件都会带着同一缺陷,因此构建后的人为验收是强制的。第七章和第八章详述此点。

第四次叙事写作是 Librarying 的创作阶段。若前三次在建立骨架,第四次便是在骨架上写下让 IP 世界活起来的叙述。每个标题词写二百至一千字元,hub 为五百至一千字元,leaf 为二百至三百字元。AI 工作伙伴可在约五至十小时内写出 1,500 则叙述(人手写作则超过一千小时),人再验收格式、链接、篇幅、语调与项目脉络,拉到合格线。leaf 可以短,却不表示可以空白;运营用 Vault 的目标是整体 LLM 完成率 95% 以上。第九章详谈。

第一、二、三次的本质;第四次的本质

把四个阶段展开为一条流程后,有一点需要指出:第一次、第二次、第三次与第四次的本质不同。

前三次的本质是机械性的整理:从输入拉出关键词,聚合相同意义,转换成 Obsidian 格式。有清楚规则,按规则处理结果便可确定。人也会作决定,但范围狭窄而明确。

第四次的本质是叙事式写作:把一个标题词解开为一段流动的叙述。它无法化约为清楚规则;一个标题词的合格线也不等于下一个。语调、脉络与 IP 特有的细微处都会介入。

这两种本质的差异决定协作的质感。前三次把输入交给 AI 工作伙伴、收回结果后几乎原样送往下一阶段;第四次则收下第一次初稿后往返两三轮。

时间预算

把第一次、第二次、第三次、第四次的时间相加,一个 IP 的 Librarying 约在九至十六小时内完成。这个数字正是本文要向读者展示的缩时本质。

分配如下:配置(世界观轴、分类指南、参考目录)三十至六十分钟;第一次提取三十分钟至两小时(AI 并行);第二次整合两至四小时(人的决定加 AI 辅助);第三次骨架构建五至十分钟(确定性自动化);故事摘要准备三十至六十分钟。此摘要不是为避免每次阅读全稿的简单概述,而是从制作人的观点诠释原稿、剧本、规则书,压缩为第四次散文脉络的文件。第四次叙事写作需五至十小时(AI 工作伙伴为核心),验证需一至三小时(人的验收加自动检查)。合计九至十六小时,这是以第一次循环为基准的数字。

第一次循环是初次为一个 IP 进行 Librarying 的时间。其后新短篇进入、进行增量更新时,时间会短得多。一篇短篇通常有三十至五十个新标题词,前三次的小循环约三十分钟,加上第四次叙述约一小时,一篇短篇的更新在总计 1.5 至 2 小时即可收尾。第十一章会详谈此运营循环。

两双手的分工图

把这张图整理成一条流程,便能一眼看见第四至第九章各自细看哪个位置。

配置是人的工作:决定世界观轴、修订分类指南、建立参考文件目录。第一次提取由 AI 工作伙伴自动提取九分类表,人负责宏观验收与新分类决定,合格线为 60%。第二次整合由人负责同义词组、标题词命名、世界观轴确定,AI 产出同义词候选、定义初稿、世界观轴候选,合格线为 95%。第三次骨架构建在执行脚本后,由人确认 manifest 与自动验证结果,合格线为 100%。第四次叙事写作由 AI 为每个标题词制作第一次初稿,人负责语调指南、五阶段验收与合格判断;hub 写得长而深,leaf 写得短而准。验证由自动检查产出违规报告,人进行人工抽样与集成构建判断,合格线为 100%。

这张图是十四章的指南。第四至第九章逐章细看上述各行;第十章是验证,第十一章是运营循环,第十二章是出口,第十三章回顾五年运营,第十四章收束全文。

简要说明图中的 hub 与 leaf。1,500 个标题词的重要性并不相同。置于 IP 核心的标题词会被其他标题词频繁引用;这种常被引用的标题词称为 hub,引用较少的称为 leaf。1,500 个之中,hub 通常有一百至一百五十个。两者适用不同的叙述篇幅与验收合格线:hub 长而深,leaf 短而简洁。第八章将详谈 hub 的自动判定与人的决定。

手持这张图

第一次收集材料,第二次整理材料,第三次把整理好的材料转为工具可处理的格式,第四次在这个格式上填入 IP 的叙述。倒转顺序,工作就会崩解;遵循顺序,便能得到九至十六小时的结果。

从下一章第四章起,我们进入第一个阶段——第一次提取。整整一章将细看九分类分开什么、不归并什么,五列 CSV 的一行如何构成,以及 AI 工作伙伴对规范化输入文件进行全量提取时会发生什么。


© 2026 MEJE WORKS Corp. & 김동은WhtDrgon. All rights reserved.