第二节、自然码的形码编码规则
一、基本原理
在汉语中,一种发音有很多同音字。如“tian”这个发音,就有“天、田、添、
填、甜、恬、舔、掭、腆……”等,在普通拼音或双拼输入法中,要输入其中的一
个字需要选择,有时还要翻页,是比较麻烦的。自然码为了解决这个问题采用了形
码辅助输入方式,引入汉字的偏旁部首发音的声母作为编码的补充部分,较好地解
决了音码方案中的重码问题。
1997年,自然码在6.0B以后的新版本中采用了新的辅助形码,这种新方案是在
原来的辅助形码的基础上进行改造完成的,新方案完全遵照国家语委和国家新闻出
版署联合公布的《信息处理用GB13000.1 字符集汉字部件规范》。新方案比旧方案
更加简单,二义性也更少,而增加的重码并不太多。新的形码方案中采用了最直观
的切分方法“切形”,按汉字“形声字”和“会意字”组字的原则。将汉字全部视
为由两个部件(半边字)组成,然后分别用这两个字的双拼声母作编码。对于不可
拆分的独体字,拆分按照书写的顺序读取笔画的读音。
拼音加形的方式可以用于自然码软件中所有的编码方案:
自然码的形码拆分非常简单,只取两个部分(“部首”和“部件”),基本都
是发音的声母,所以一般不需要记忆。
二、特殊情况
多数汉字都比较容易分成两部分,但也有个别比较复杂,不能简单拆分。下面
的内容是针对复杂汉字的拆分规则:
1 .象形字(独体字)
一般是部首汉字,如:“金、木、水、火、土、辶、皿、马、皮、日、月、目、
衣、耳”等。独体字全部看成部首,不进行进一步划分,只能看成由多笔画构成
(《规范》要求)。
自然码的笔画码只有三种:
①以横竖起笔全部在a 键上:“一丨亅レ乛フㄥヨ彑”;
②以点起笔的在d 键上:“丶冫氵水”;
③以撇起笔的在p 键上:“丿彡”;
2 .形声字
有明显部首(义部)的汉字,如:“极、版、码、程、想、福、袋、鳌、游、
洪、递”等。这类汉字所占的比例最高,这些汉字很容易分成部首和部件两部分,
编码就是部首的声母。
需要注意的是,自然码的部首基本是以新华字典的部首为标准,并非“从上到
下,从左到右”。比如“架”的部首是“木”;“郸”的部首是“阝”。
3 .会意字和转意字
一般有两个明显部首的汉字,如:“思、杏、岙、岛”等。这类汉字所占的比
例也较高,也很容易分成两个部分。因为两个部分都可以被看作部首,所以其先后
顺序可以模糊。
4 .非整体合成字
含有不认识或不是整体字部件的汉字,如“录、芈、暨、释、稽、躅、摭、谧、
荔”等。这类字的部首或部件可以用首笔画(尾部用末笔画)或能认识的汉字代替。
6 .部首隐蔽的字
有些形声字的部首不在明显部位,如“荧、萤、鹰、磨、裁、载、鸿、视、颖、
武、爨”等,这些汉字可以按多种理解方法拆分。
三、要特殊记忆的部件