MEJE BOOKS Knowledge Library

MEJE PROCESS · MEJE 知識庫化工作流程白皮書 (21 章)

第5章 歸併為 Wiki 表題語——第二次整合的決定

MEJE Works · 章 5

第5章 歸併為 Wiki 表題語——第二次整合的決定

第一次擷取結束後,留下的是五千至一萬五千列的一張表。列數很多,分類分成九種,但不能把這張表原樣放進 Vault。因為同一人物以三個不同名稱散在三列,同一場所也以兩種寫法各自出現,而且一個關鍵字與其他關鍵字如何連結尚未整理。

把這些分散列整理成一本辭典的工作,就是第二次整合。

第二次整合是 Librarying 四階段中人手介入最深的階段,合格線也從第一次的 60% 提升至 95%。

什麼是表題語:辭書編纂學的基礎概念

要理解第二次整合,必須先準確掌握表題語(headword、lemma)這個概念。

翻開一般國語辭典,在「去」這個表題語下,「去了」「去著」「正在去」「將去」等活用形不會各自另立條目,而是全在同一條目中處理。表題語是代表一個詞彙所有形式的標準形式,這個原則正是辭典之所以是辭典的核心。若活用形各自都是獨立條目,辭典篇幅會膨脹數十倍,讀者在找到資訊前,還得先知道應用哪個形式搜尋。表題語把所有形式收在一處。

Librarying 的第二次整合所做的正是這件事。若「星羅江湖」的一位人物在第一次中以本名、漢字寫法、職稱、系統稱呼四種寫法分散,第二次便把四者收進一個表題語。無論以哪種形式搜尋或遇見,都能在一個表題語取得全部資訊。

辭書編纂學有選定代表寫法的原則:最常用的形式、最基本的形式,或規範拼寫所定的形式成為表題語。IP Librarying 也遵循相同原則,將本 IP 出現最頻繁的寫法,或 IP 製作人正式確定的寫法定為代表關鍵字。此時表題語選定不是任意決定「用哪種寫法」,而是所有未來 IP 參照皆會以此表題語為基準的基礎決定。它一旦定下,整個 Vault 都會以該表題語為中心組織。

取《龍與地下城》的「被遺忘國度」一個表題語,原理就很清楚。人物 Elminster 的本名為 Elminster Aumar,稱號有 Shadowdale 的賢者、老魔法師,以及變裝時的多個假名。「被遺忘國度 Wiki」的 Elminster 單一頁面將這些寫法收在一起,以本名為代表,無論用哪個稱號搜尋都通往該頁。這正是 Librarying 第二次整合在一千至兩千個表題語尺度上建立的結構。

表題語與知識組織體系

區分表題語與別名的感覺,也是圖書館學與知識組織體系長久處理的問題。W3C 的 SKOS 是表達同義詞表、分類表、主題標目表等受控詞彙的模型:它為一個概念附上代表標記,另置替代標記與隱藏搜尋詞,並區分更廣、更窄與相關概念。

Librarying 的十三欄也有相同感覺。代表關鍵字是表題語的優先寫法;異稱與別稱是讓人找到同一對象的替代寫法;相關關鍵字是表題語在意義上彼此依靠的連結。較廣與較窄範疇明確時可讀作上下位關係;兩者並非上下時,保留為相關關係更合適。

但 Librarying 並不是實作 SKOS 的工作。它不發佈 RDF,也不試圖與外部知識體系做機械對映,而是在創作 IP 的 Vault 中以較低層次使用同樣原理。這個比較之所以有用,是因為它說明了「為何別稱要另置」「為何相關關鍵字不能隨意加入」「同一寫法指兩個概念時為何必須分開」。表題語不是單字表,而是受控詞彙的第一單位。

第一次結果的結構

再打開第一次的結果表。以「星羅江湖」人物分類為例,一名劍客被分散放進四列:本名(「徐雲卿」)、漢字寫法(「徐雲卿」)、系統稱呼(「天劍手劍客」)、江湖評語(「從凶日裡挖出吉日的劍客」)。一個人物以本名、漢字、系統、別號出現,無論韓語 IP 或外語作品都是相同情況。

其他分類也有同樣樣貌。裝置分類的「天氣」「乘著星光的氣」「從天而降的氣」分開進入;場所分類中一個官署的正式名稱、簡稱、作品內稱呼分開;物件分類中一個組織的正式名稱、縮寫、口語稱呼分開。這種分散正是第一次擷取方式的結果:第一次照原樣拉出寫法,將是否同義的決定延後。本章便做這個決定。

把同義列歸併為一體,是第二次整合的起點。將徐雲卿的四列歸為一個表題語就縮成一列:代表關鍵字定為「徐雲卿」,其餘寫法收進別稱欄,定義則把四列的短說明合成一行。這種歸併是第二次整合的本質,其結果讓五千至一萬五千列縮為一千至兩千個表題語。每個表題語容納所有同義寫法,IP 資料才開始接近辭典的樣貌。

看一個存在同時有多種寫法的作品,就能明白為何需要這樣歸併。在《全知讀者視角》中,「星座」不以真名而以「修飾語」別號被稱呼、隱藏身分;解讀修飾語便會揭露真正的神話人物。例如修飾語「如惡魔般的火之審判者」即為大天使 Uriel。一個存在同時有修飾語、真名、神話出處,必須放在同一表題語下,讀者才不會把同一人物誤認為不同人物。

為何合格線是 95%

第一次合格線為 60%,第二次卻跳到 95%,必須看清差異從何而來。

第一次即使有分類錯誤的列也無妨,因為同一列本來會在第二次再通過一次。無論它進入人物或物件,人都會在第二次再看一遍並決定,分類因而被修正。但第二次若歸併錯誤,下一步第三次骨架建置會原樣製成 .md 檔。若兩個不同人物被歸為一個表題語,兩人的資訊便混入一個 .md 檔。錯誤會原樣進入第四次敘事撰寫,直到驗證才發現;一旦錯誤歸併,修復成本很高。

因此第二次的合格線是 95%。不是 100%,因為人的決定偶爾也會偏差,剩下的 5% 會在最後驗證抓出;95% 是人能達到的最嚴格線。正因這種嚴格性,第二次整合由人主導;AI 工作夥伴即使快速編出同義詞候選,最終決定仍由人下達。

十三欄表題語的結構

第一次的產物是五欄(IDX、分類、關鍵字、說明、出處),第二次的產物則是十三欄。第一次帶來的基礎資訊(IDX、分類、出處清單)保留,並新增八欄。

確立表題語身分的欄位。 代表關鍵字是已歸併同義詞中代表該表題語的寫法,選本 IP 的正式名稱或最常出現的寫法。此代表關鍵字成為表題語的檔案名,Vault 內其他表題語以[[代表關鍵字]]形式引用它。

代表關鍵字一旦確定,Vault 內所有參照皆以此寫法為準。若某 IP 製作團隊正式更改一個裝置名稱,只要將代表關鍵字改為新名稱、舊名稱降為別稱,Vault 內所有 wikilink 都會自動更新。這就是單一真實來源的力量。

世界觀軸是與九分類正交的第二分類基準,回答「這個關鍵字屬於我們世界觀的哪個結構」;第六章會詳談。異稱、別稱是代表關鍵字之外指同一對象的寫法。它是為搜尋而設的欄位:必須登錄在此,讀者才能在自己 IP 的 Wiki 用別稱搜尋而抵達表題語。姊妹工作檢查新短篇原稿時,也只有別稱已登錄,才能自動辨識該寫法是哪個表題語。

多語言欄位。 英文名是為翻譯提議的英文寫法;羅馬字是依韓語羅馬字標記法(RR)的寫法。人名使用「Min-ji」般帶連字號的羅馬字;場所專名使用「Haewon Restaurant」般羅馬字加類型;文化固有語使用「Han (lingering resentment)」般音譯加說明。準備多語言出版的 IP 中,這兩欄是核心資料;翻譯者初次打開 Vault 最先確認它們,可減少翻譯者自行決定寫法的無謂時間。

本文欄位。 定義是最壓縮地說明該表題語是什麼的一兩句核心定義,不放[[連結]],要能自足。

詳細說明是包含運作原理、歷史、結構、與其他表題語關係的兩至八句本文。它最終會有[[連結]],但工作者不從一開始手工插連結。先以純文字寫詳細說明,在第二次合併時按代表關鍵字與異稱、別稱清單自動將相關表題語處理為 wikilink。如此便不會混入[[X|Y]]類任意別稱連結,整個 Vault 也以代表關鍵字為基準整理。這兩欄初稿在第二次達 80% 即可;與同義詞歸併等必須跨過 95% 的核心決定不同,定義與詳細會在第四次敘事撰寫重新修整,只要方向正確、包含核心即可。

相關關鍵字是與此表題語連結的其他表題語清單。此欄填妥後,第三次骨架建置會自動注入 wikilink,在 Obsidian 內畫出節點間的線。關鍵字雲的連結網由此欄編成;沒有相關關鍵字的表題語會在圖譜檢視留作孤立節點。連結網越密,Vault 越好。

時期與翻譯中繼資料。 版本狀態是表題語的時期狀態。「現行」是 IP 現在使用的表題語,多數屬於此處;「過去」是某時期曾使用、現在寫法或意義已變的表題語。某 IP 第一版使用的地名在第三版改為另一地名時,第一版舊地名就是例子。

「廢棄」是不再使用的表題語;若在翻譯筆記寫下廢棄原因,後人便不會再次使用同一寫法而造成混亂。「雙重標記」是兩種寫法刻意共存,例如同一事物依地區有不同稱呼。「未定」則是尚未確認的表題語。過去與廢棄表題語不刪除而保存,是因閱讀過去作品仍會看見該寫法;讀者看第一版後搜尋,不能因沒有表題語而找不到資訊。

翻譯筆記記錄翻譯時應注意的文化與脈絡事項。對「恨」等文化固有語記下音譯方式與說明;對巫俗術語採「Mudang (Korean shaman)」般音譯加說明;對時代語記下翻譯時要留意的脈絡。它像寫給未來翻譯者的信,使下一次翻譯無須重作同樣決定。

這十三欄構成一個表題語的一列。當一千至兩千個表題語排好,一個 IP 的整體詞彙就收進一張表。

人所做的決定

先確認十三欄中由人直接決定的部分。

最棘手的是同義詞歸併。若「星羅江湖」的徐雲卿以本名、漢字寫法、系統稱呼、江湖別號出現,就要決定四者是否收進一個表題語,或其中一種寫法是否其實指另一人。熟悉 IP 的人會覺得理所當然,但相同的系統稱呼也可能指不同人物。「天劍手劍客」既用於徐雲卿,也用於沙木:一方是在吉星的吉日拔劍的正派劍客,另一方同時承受凶星的質地而流入邪派。若把同樣以天劍手為命名性的兩人歸成一個表題語,正派劍客的定義便會混入邪派劍客的定義。人必須決定「天劍手劍客」這一寫法屬於兩個表題語中的哪一個。

也有隨時期改變意義的寫法。第一版某裝置名稱指一種東西,第三版同樣稱呼卻指另一裝置時,必須決定兩個時點的寫法要合併成一個表題語還是分成兩個。本書建議分開,並在版本狀態標示「僅第一版/僅第三版」;合併會讓兩種意義在一個檔案衝突。

同名人物若在第一季是配角、第三季成為主角,適合保留為一個表題語,並在本文整理各時期的變遷。這類判斷只有讀完五年作品的人腦才能準確做出。

表題語命名是在多個同義寫法歸併後,決定其中哪個寫法成為代表。韓語 IP 選韓語正式名稱;處理外語作品的韓語出版時,選出版所用的韓語寫法;未定正式寫法時,選出現最頻繁者。代表一旦確定,其他寫法都成為別稱。別稱可供搜尋,卻不作為表題語標題出現;Vault 內 wikilink 歸併至代表關鍵字。

世界觀軸決定版本狀態決定也是人的工作。世界觀軸允許值(每 IP 五至七軸)在第一次擷取前的設定檔階段先定好。AI 可提議候選,哪個軸符合本 IP 結構仍由人判斷。版本狀態也只能由熟悉 IP 時期流動的人決定;第一版出現的寫法在第三版被廢棄,這件事存在於讀完兩個版本之人的腦中。即使 AI 讀了兩版,也可能無法區分是刻意廢棄或單純寫法改變。

定義合格線判斷也由人負責。人衡量由多列短說明合為一行的定義是否過線:太短沒有表題語輪廓,太長便成為長敘述而非定義。一至三行較合適。

委派給 AI 工作夥伴

AI 工作夥伴在輔助人的決定之處快速工作。同義詞候選擷取接收第一次的五千至一萬五千列,建立可能同義的列組候選:寫法相近、同一出處出現、帶有相同定義的列被歸為一組。這些候選約有 70% 至 80% 可直接通過,人只需修整 20% 至 30%。一行定義初稿在別稱組確定後產生,將第一次收集的短說明合併壓縮為一兩行,人以約 80% 水準檢收。AI 可提議相關關鍵字,但最終 wikilink 注入以全域表題語清單自動處理較穩定。世界觀軸候選則取得設定檔預定的允許值,為各表題語附上最接近的軸候選,再由人檢收確定。

以輸入與輸出展開,輸入是第一次五欄 CSV 一塊、本 IP 的同義詞歸併指南、世界觀軸允許值清單、十三欄整合 CSV 格式。輸出是十三欄整合 CSV,其中自動附上同義詞組候選、填入一行定義初稿、自動注入相關關鍵字 wikilink、附上世界觀軸候選。委派的意圖既是縮時也是一致性。人完整讀五千列再建立同義詞候選要一週,現在約三十分鐘便有候選,人的決定時間縮為兩三小時。預期二至四小時內取得一千至兩千個表題語排好的十三欄 CSV。限制在同義詞最後決定、是否新設世界觀軸、定義語調、版本狀態,這四項都必須由人決定。

決定的流程

第二次整合的流程如下。先把第一次五欄 CSV 整體交給 AI 工作夥伴,同時交付同義詞歸併指南、十三欄格式、設定檔確定的世界觀軸允許值清單。AI 用約三十分鐘至一小時編出同義詞候選組、一行定義初稿、相關關鍵字候選、世界觀軸候選。接著在合併階段,詳細說明內的表題語依代表關鍵字與別稱清單自動成為[[代表關鍵字]]連結,超出允許世界觀軸的值會被抓為錯誤。

收到結果的人以嚴格的 95% 合格線開始檢收:逐組查看同義詞是否正確、是否應拆開、是否應再加入一列;檢收並確定世界觀軸候選;填入版本狀態;檢收定義初稿。

檢收約需兩至三小時,相當於讓一個 IP 的 1,500 個表題語各通過一次。但通過深度依表題語不同:100 至 150 個 hub 表題語每個要一至兩分鐘決定,1,000 個 leaf 表題語每個約十秒即可;自動計數準確時,leaf 多半只需放行。

檢收結束,十三欄整合 CSV 跨過合格線。第一次的五千至一萬五千列被歸併、排成一千至兩千個表題語,IP 資料終於抵達一本辭典的形態。

第二次結束後看見的東西

第二次整合後會出現一個有趣結果:按表題語被引用次數排序十三欄 CSV。被引用次數是一個表題語出現在其他表題語相關關鍵字欄的次數,由自動計算取得。由最高到最低排好,查看前十名,便能一眼看見本 IP 的中心放在哪裡。

「星羅江湖」如此排序時,第一是區分武功威力的核心資源「天氣」,第二是天氣秩序唯一例外的主角「逆天者」,第三是控制曆法的權力中心「武林盟」,第四是將江湖二分的「正邪派」。本 IP 的身分濃縮為四個表題語;營運五年後才顯露,原來從未以如此壓縮的方式確認過這個身分。1,500 個表題語整理好,IP 身分便在 hub 排名顯現,這也是 Librarying 的預期效果之一。

其中藏著把同義詞組抓得太寬的陷阱。以外語作品《傲慢與偏見》為例:Bennet 家有五姊妹,依作品稱呼慣例任何人都可能被叫作「Miss Bennet」,因此一處出現「Miss Bennet」並不保證指長女 Jane。建議第一次遇到稱號時先分開保留,僅在本文明示是哪個人之處才作同義詞歸併;未明示者留作「Miss Bennet(不特定)」,在第四次敘事或驗證再作決定。錯誤歸併會讓一人的定義侵入另一人的定義。

同一稱號隨時點指不同人物也是同樣陷阱。《我獨自升級》中「影之君主」是職責名稱;第一代影之君主本名 Ashborn,主角成振宇繼承其力量而成為第二代影之君主。一個稱號依作品時點指 Ashborn 或成振宇兩人,所以表題語需同時記錄職責、固有名與繼承關係,才能分辨各段「影之君主」指誰。

自動計數也有極限。它數表題語出現在其他相關關鍵字欄的次數,次數高就標為 hub 候選,但出現次數不等於 IP 核心。在「星羅江湖」,幾乎用於計算所有武人強弱的「曆法」被引用極高,卻更像背景資料而非 IP 精髓;反過來,引用少的表題語也可能決定 IP 身分。不屬於任何星座的「無名星」就是如此:出現頻率雖低,那份空白本身卻構成 IP 精髓。因此自動計數標示 hub 候選後,人再從候選中確認真正屬於 IP 核心者為 hub。第八章會詳談此判斷。

結束第二次整合

上下掃過十三欄 CSV 一次,一個 IP 的全部詞彙便可進入一個畫面。1,500 個表題語排列著,各自屬於哪個分類與世界觀軸、擁有何種別稱都看得見。這是第一次一眼確認本 IP 整體詞彙地圖的時刻。

第六章將正式討論世界觀軸。本章只先掌握概念的世界觀軸,如何依 IP 設計,並如何與九分類正交來描出 Vault 的地形,將在下一章細看。


© 2026 MEJE WORKS Corp. & 김동은WhtDrgon. All rights reserved.