<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>汉字编码 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%b1%89%e5%ad%97%e7%bc%96%e7%a0%81/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 15 Aug 2026 19:47:01 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>字库里藏着 12 个幽灵汉字：没人知道它们念什么</title>
		<link>https://mylogs.cn/unicode-ghost-cjk-characters-unknown-pronunciation/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 15 Aug 2026 19:46:41 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Hacker News]]></category>
		<category><![CDATA[Unicode]]></category>
		<category><![CDATA[字库]]></category>
		<category><![CDATA[幽灵文字]]></category>
		<category><![CDATA[汉字编码]]></category>
		<category><![CDATA[编码标准]]></category>
		<guid isPermaLink="false">https://mylogs.cn/unicode-ghost-cjk-characters-unknown-pronunciation/</guid>

					<description><![CDATA[打开一台电脑的字符表，往冷僻处翻，会碰到一批极其古怪的汉字：妛、挧、暃、椦、槞、蟐、袮、閠、駲、墸、壥、彁。它 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">打开一台电脑的字符表，往冷僻处翻，会碰到一批极其古怪的汉字：妛、挧、暃、椦、槞、蟐、袮、閠、駲、墸、壥、彁。它们能正常显示，也能被复制粘贴，却没有公认的读音，更说不清是什么意思。日语里给这批字起了个名字——幽霊文字，中文可以直译为幽灵文字。它们的来历，是计算机字符编码史上最著名的悬案之一。近日一篇考据文章在 Hacker News 上被重新翻出讨论，把这段经过又摆回了台面。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a80c2a1d60ee&quot;}" data-wp-interactive="core/image" data-wp-key="6a80c2a1d60ee" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1000" height="795" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/93c85858bffd2b94cd8caa485b94d03a_header.webp" alt="字库里藏着 12 个幽灵汉字：没人知道它们念什么" class="wp-image-5008" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/93c85858bffd2b94cd8caa485b94d03a_header.webp 1000w, https://mylogs.cn/wp-content/uploads/2026/08/93c85858bffd2b94cd8caa485b94d03a_header-300x239.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/93c85858bffd2b94cd8caa485b94d03a_header-768x611.webp 768w" sizes="(max-width: 1000px) 100vw, 1000px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：dampfkraft.com</figcaption></figure>





<h2 class="wp-block-heading">标准发布之后，才发现有些字没人认识</h2>



<p class="wp-block-paragraph">1978 年，日本经济产业省确立了后来被称为 JIS X 0208 的编码标准。这套标准至今仍是各种日文编码的重要参照。标准公布后，有人发现其中若干新增字符找不到明显出处：没人能说出它们的含义，也没人知道该怎么读，更查不到它们究竟从何而来。</p>



<p class="wp-block-paragraph">按照规则，JIS 标准里的每个字符都应该留有来源记录。问题在于，「来源」这两个字的含金量并不高——即便记录存在，通常也只写明取自哪份文献，不会精确到页。</p>



<p class="wp-block-paragraph">1997 年，一项专门的调查启动，目标就是查清这些字到底从哪儿来。调查者面对的第一道难关是文献体量。幽灵文字较常见的来源之一是《国土行政区画总览》，一份覆盖日本全国地名的资料。它听起来像一本厚点的地图册，实际上最新版是七卷本，每卷约九百页，而且没有页码线索。要在这样一套书里定位某一个字的出处，难度可想而知。</p>



<h2 class="wp-block-heading">一条多出来的笔画，其实是两张纸的接缝</h2>



<p class="wp-block-paragraph">调查最终基本查清了这些字的来历，答案比想象中更朴素：相当一部分字是编目过程中的失误造出来的。</p>



<p class="wp-block-paragraph">以「妛」为例。日本某处地名中用到一个「山」在「女」上方的字，符合收入 JIS 标准的条件。当时的排印条件无法把它作为一个整体印出来，工作人员的办法是把「山」和「女」分别印出来，剪下、拼贴到一张纸上，再复印一份。到了读取复印件的环节，两张纸拼接处留下的那道细线被当成了一笔，就这么写进了字形。而原本那个真正存在的字（𡚴），要到很久以后才被补进 JIS 与 Unicode，直到今天在不少网页上仍无法正常显示。</p>



<p class="wp-block-paragraph">这批字里，最后只剩一个既查不到明确来源、也找不到任何历史用例，就是「彁」。目前最可能的解释是它源自「彊」字的误认，但具体是在哪一环出的错，调查没能给出答案。</p>



<h2 class="wp-block-heading">错误一旦进了标准，就成了既成事实</h2>



<p class="wp-block-paragraph">JIS 系列标准被普遍采用之后，这些字随之全部进入 Unicode。而 Unicode 在中日韩统一汉字（CJK 统一汉字）的整合过程中，也产生了属于自己的另一批幽灵汉字。</p>



<p class="wp-block-paragraph">原作者的总结相当克制：1978 年，一连串小小的失误凭空造出了几个字；错误没被及时发现，时间一长便板上钉钉；如今这些幽灵至少在理论上已是全球每一台计算机的一部分，潜伏在字符表的角落里，照这个势头，恐怕会一直陪着人类。</p>



<p class="wp-block-paragraph">这件事的意义不止于猎奇。字符集不是凭空设计出来的整齐产物，而是历史层层沉积的结果，其中既有考据严谨的部分，也封存着当年技术条件与工作流程留下的痕迹——剪刀、胶水和复印机，同样是编码史的一部分。对今天做输入法、字体和文本处理的人来说，这也是一个提醒：字符集里的每一个码位背后都可能藏着一段说不清的来历，删不掉，也改不了。</p>



<p class="has-small-font-size wp-block-paragraph">来源：dampfkraft.com《A Spectre is Haunting Unicode》，经 Hacker News 讨论</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
