这次更新做了什么
16.8 版本是一次「单点突破」型更新。相比前面几个版本同时调整多个模块,这次的重点只放在一件事上:把生僻字字库做全。
具体来说,这次更新的对象是 2022 年发布的强制性国家标准 GB 18030-2022《信息技术 中文编码字符集》。这个标准规定了中文信息处理中使用的全部汉字字符集,包括常用的基础汉字,也包括大量平时几乎见不到的生僻字。
更新后,搜狗输入法的字库收录了该标准及其第 1 号修改单规定的全部 97,908 个汉字,成为目前行业内唯一全端支持全部新国标汉字的输入法。
16.8 版本收录的汉字总量,覆盖 GB 18030-2022 及其第 1 号修改单全部字符
97,908 这个数字意味着什么
光看数字不太直观。把这个数字拆开,就比较容易理解它为什么重要。
| 字集分组 | 占比示意 | 字数 |
|---|---|---|
| GB 2312 基础汉字 | 6,763 | |
| CJK 扩展 A 区 | 6,582 | |
| CJK 扩展 B 区 | 42,720 | |
| CJK 扩展 C/D/E/F 区 | 25,865 | |
| CJK 扩展 G/H 区 + 修改单 | 15,978 |
如果把常用的 3,500 个一级汉字和 3,000 个二级汉字算作「日常用字」,那这 97,908 个汉字中的绝大部分,都是平时几乎不会在屏幕上看到的生僻字。它们的数量,是常用字的 15 倍。
为什么要在意这些字?因为它们总会在某个具体场景里出现——比如一个人的姓氏、一个古镇的地名、一味中药材的名称、一段古籍的引用。
生僻字支持带来的实际变化
举几个典型的场景,就能看出这类更新在实际使用中的价值。
除了上面这些示例,更新对以下三类场景的帮助最明显:
1. 姓名录入
中国有大量生僻姓氏和名字用字。比如「缑」「逯」「郗」等姓氏,或者「翀」「烜」「頔」等名字用字,之前在很多输入法里都打不出来。用户只能手写或粘贴,非常不方便。16.8 版本之后,这些字都能通过拼音直接输入。
2. 古籍和学术引用
研究历史、文学、语言学的人,经常需要引用原文。古籍中的异体字、通假字、人名用字,很多都是生僻字。以前遇到这类字只能截图或标注「此处缺字」,现在可以直接输入。
3. 地名和行业术语
地名方面,比如「甪直」「邳州」「婺源」这类地名中的特殊字;行业方面,比如中药材的「芎」「芪」、化学元素名中的特殊用字。这些字的支持直接提升了内容录入的准确性。
一个值得留意的细节:生僻字的支持不止是「能不能打出来」。它还包括拼音标注是否准确、拆字数据是否完整、笔画顺序是否正确。16.8 版本同步更新了这四类数据,所以输入体验与常用字是一致的。
技术上是如何实现的
生僻字支持不只是「收录字库」这么简单。为了让这些字能够正常显示和输入,需要同时解决四层数据问题。
- 字符编码:每个汉字对应一个唯一的 Unicode 码位。扩展区的生僻字码位在 U+20000 以上,需要输入法、操作系统、字体三方都支持才能正常显示。
- 字体库:输入法自带覆盖全部 97,908 个汉字的字体。不依赖系统字体,避免不同设备显示不一致。
- 拼音标注:为每个生僻字标注拼音。这需要参考《汉语大字典》《中华字海》等多部工具书,部分字存在多个读音,需要按通用用法确定主读音。
- 拆字数据:为每个字提供可拆解的部件信息,让用户可以通过「部件组合」的方式输入不认识的生僻字。比如输入「三个龍」可以定位到「龘」。
这四层数据需要保持版本一致。任何一层的数据缺失,都会导致这个字无法正常输入或显示。
怎么输入生僻字
16.8 版本提供三种生僻字输入方式,可以根据自己的情况选择。
方法一:拼音输入
如果这个生僻字有拼音标注(大部分都有),直接输入拼音即可。例如输入 dá 会出现「龘」,输入 yǎn 会出现「䶮」。这是最直接的方式。
方法二:笔画输入
如果知道字怎么写但不知道怎么读,可以在输入法状态栏切换到笔画模式,用横、竖、撇、点、折五种基本笔画依次输入。笔画输入适合结构清晰、笔画数不多的生僻字。
方法三:拆字输入
如果字的结构明确,可以用拆字输入。例如输入「三个龍」会出现「龘」,输入「一个马一个尧」可能出现「骁」。拆字输入适合由常见部件组合成的生僻字,对结构复杂但部件常见的字尤其有效。
三种方式可以配合使用。如果一种方法找不到目标字,换另一种方法通常能解决问题。
与其他输入法的对比
生僻字支持是一个「有或无」的能力——支持就是支持,不支持就完全打不出来。以下是几款主流输入法在 GB 18030-2022 支持上的横向对比。
| 对比项 | 搜狗输入法 16.8 | Windows 系统输入法 | macOS 系统输入法 |
|---|---|---|---|
| 汉字收录总量 | 约 27,000+ | 约 28,000+ | |
| GB 18030-2022 全覆盖 | 是 |
部分覆盖 |
部分覆盖 |
| 拆字输入 | 支持 |
不支持 | 不支持 |
| 笔画输入 | 支持 |
支持(部分版本) | 支持(部分版本) |
| 全端一致性 | Windows / macOS / 手机端字库版本相同 | 仅 Windows | 仅 macOS |
| 字体自带 | 是,不依赖系统字体 | 依赖系统字体 | 依赖系统字体 |
需要说明的是,「收录总量」的差异不是简单的数字游戏。收录一个生僻字,意味着输入法要同时提供它的编码、字体、拼音、拆字、笔画数据,任何一项缺失都会让这个字「打不出来」或者「显示成方块」。这也是为什么不同输入法在生僻字支持上的差别会这么大。
如何升级到 16.8
已经安装搜狗输入法的用户,可以通过以下方式升级:
- 打开输入法状态栏,点击设置图标进入「关于」页面
- 如果有新版本,会显示「发现新版本」提示,点击「立即升级」
- 等待下载完成,输入法会自动重启并应用更新
如果状态栏没有显示升级提示,也可以直接到官网下载页下载 16.8 版本的安装包,覆盖安装即可。用户词库、自定义短语、快捷键设置会自动保留,不需要重新配置。
几点说明
关于这次更新,有几点需要说明清楚,避免理解偏差:
- 字库扩容不等于「所有场景都能显示」。输入法可以输出这些生僻字,但如果接收端(比如某些网站、聊天工具、文档格式)不支持这些字符,仍然可能显示为方块。这是编码兼容性问题,不是输入法的问题。
- 部分生僻字的拼音标注存在多个版本。对于有多个读音的字,输入法选取的是《通用规范汉字表》或《汉语大字典》中的主读音。如果需要其他读音,可以通过拆字或笔画输入。
- 字库更新不会影响常用字的输入体验。常用字的候选词排序规则不变,日常打字的速度和准确率与之前版本一致。
- macOS 版和手机端同步更新。三个平台的字库版本号相同,字符覆盖一致,输入方式也一致。
关于 16.8 版本的常见问题
下面 5 个问题是读者反馈中最常被问到的
16.8 版本主要更新了什么?
16.8 版本的核心更新是生僻字字库扩容。收录新国标 GB 18030-2022 及第 1 号修改单含生僻字共 97,908 个汉字,同步更新了字体库、拆字数据、拼音标注和笔画数据。
此外还优化了候选词排序,生僻字在候选词中的展示优先级有所提升。日常常用字的输入体验没有变化。
97,908 个汉字是怎么算出来的?
97,908 是 GB 18030-2022《信息技术 中文编码字符集》及其第 1 号修改单收录的汉字总量。
包含:GB 2312 基础汉字 6,763 个、CJK 统一汉字扩展 A 至 H 区的全部汉字,以及新国标新增的 1.7 万余个生僻字。相比之前的字库版本,本次新增约 1.7 万个汉字。
生僻字怎么输入?
三种方式:一是用拼音输入,例如输入 dá 会出现「龘」;二是用笔画输入,在输入法状态栏切换到笔画模式,用横竖撇点折依次输入;三是用拆字输入,例如输入「三个龍」会出现「龘」。
具体方式取决于汉字的编码数据完整度。三种方式可以配合使用,一种找不到就换另一种。
旧版本能直接升级到 16.8 吗?
可以。所有 16.x 及更高版本的用户都可以通过输入法内置的升级提示或官网下载页直接升级到 16.8,无需卸载旧版本。
用户词库、自定义短语、快捷键设置会自动保留,不需要重新配置。如果是更早的版本(15.x 及以下),建议先备份自定义短语再升级。
macOS 版同步更新了吗?
是的。16.8 版本的生僻字库同步更新到 macOS 版和手机端,实现全端一致的字符覆盖。
三个平台的字库版本号相同,输入体验一致。在 macOS 上可以通过相同的拼音、笔画、拆字三种方式输入生僻字。