字库里藏着 12 个幽灵汉字:没人知道它们念什么

打开一台电脑的字符表,往冷僻处翻,会碰到一批极其古怪的汉字:妛、挧、暃、椦、槞、蟐、袮、閠、駲、墸、壥、彁。它们能正常显示,也能被复制粘贴,却没有公认的读音,更说不清是什么意思。日语里给这批字起了个名字——幽霊文字,中文可以直译为幽灵文字。它们的来历,是计算机字符编码史上最著名的悬案之一。近日一篇考据文章在 Hacker News 上被重新翻出讨论,把这段经过又摆回了台面。

标准发布之后,才发现有些字没人认识

1978 年,日本经济产业省确立了后来被称为 JIS X 0208 的编码标准。这套标准至今仍是各种日文编码的重要参照。标准公布后,有人发现其中若干新增字符找不到明显出处:没人能说出它们的含义,也没人知道该怎么读,更查不到它们究竟从何而来。

按照规则,JIS 标准里的每个字符都应该留有来源记录。问题在于,「来源」这两个字的含金量并不高——即便记录存在,通常也只写明取自哪份文献,不会精确到页。

1997 年,一项专门的调查启动,目标就是查清这些字到底从哪儿来。调查者面对的第一道难关是文献体量。幽灵文字较常见的来源之一是《国土行政区画总览》,一份覆盖日本全国地名的资料。它听起来像一本厚点的地图册,实际上最新版是七卷本,每卷约九百页,而且没有页码线索。要在这样一套书里定位某一个字的出处,难度可想而知。

一条多出来的笔画,其实是两张纸的接缝

调查最终基本查清了这些字的来历,答案比想象中更朴素:相当一部分字是编目过程中的失误造出来的。

以「妛」为例。日本某处地名中用到一个「山」在「女」上方的字,符合收入 JIS 标准的条件。当时的排印条件无法把它作为一个整体印出来,工作人员的办法是把「山」和「女」分别印出来,剪下、拼贴到一张纸上,再复印一份。到了读取复印件的环节,两张纸拼接处留下的那道细线被当成了一笔,就这么写进了字形。而原本那个真正存在的字(𡚴),要到很久以后才被补进 JIS 与 Unicode,直到今天在不少网页上仍无法正常显示。

这批字里,最后只剩一个既查不到明确来源、也找不到任何历史用例,就是「彁」。目前最可能的解释是它源自「彊」字的误认,但具体是在哪一环出的错,调查没能给出答案。

错误一旦进了标准,就成了既成事实

JIS 系列标准被普遍采用之后,这些字随之全部进入 Unicode。而 Unicode 在中日韩统一汉字(CJK 统一汉字)的整合过程中,也产生了属于自己的另一批幽灵汉字。

原作者的总结相当克制:1978 年,一连串小小的失误凭空造出了几个字;错误没被及时发现,时间一长便板上钉钉;如今这些幽灵至少在理论上已是全球每一台计算机的一部分,潜伏在字符表的角落里,照这个势头,恐怕会一直陪着人类。

这件事的意义不止于猎奇。字符集不是凭空设计出来的整齐产物,而是历史层层沉积的结果,其中既有考据严谨的部分,也封存着当年技术条件与工作流程留下的痕迹——剪刀、胶水和复印机,同样是编码史的一部分。对今天做输入法、字体和文本处理的人来说,这也是一个提醒:字符集里的每一个码位背后都可能藏着一段说不清的来历,删不掉,也改不了。

来源:dampfkraft.com《A Spectre is Haunting Unicode》,经 Hacker News 讨论