GB18030-2022 L1/L2/L3 是什么(官方实现分级) 所属栏目:国家标准 26年07月18日 标签:

一、先讲 GB18030-2022 L1/L2/L3 是什么(官方实现分级)

GB18030-2022 强制规定3个兼容递进的实现级别,下级包含上级全部字符,字符量逐级暴涨:

L1(基础强制级,所有产品必须达标)

  • 收录:GB2312 + GBK + CJK扩展A
  • 总汉字:27584个
  • 覆盖:日常简体、繁体、基础日韩汉字,普通办公、网页够用
  • 适用:小程序、普通APP、轻量字体

L2(系统标配级,操作系统/数据库强制要求)

= L1 全部字符 + 《通用规范汉字表》剩余未收录字

  • 总汉字:27780个(仅比L1多196个规范生僻字)
  • 覆盖:全国通用规范汉字全覆盖,户籍、公文、政务基础场景够用
  • 硬性规定:Windows/macOS、数据库、中间件、管理系统必须满足L2

L3(全汉字完整版,政务/公安/古籍专用)

= L2 全部字符 + 国标内所有CJK扩展B/C/D/E/F/G/H、康熙部首、古籍、地名、人名极生僻字

  • 总汉字:87887个,接近9万字
  • 覆盖:公安户籍、古籍出版、方志、生僻人名地名、古汉字、异体字
  • 硬性要求:政务、人口信息、公共服务系统强制L3

极简对比表

级别 汉字总量 核心覆盖范围 使用场景
L1 27584 GBK+扩展A,常用字 普通APP、网页、轻量字体
L2 27780 L1+全部通用规范汉字 操作系统、办公、常规政务
L3 87887 L2+全部古籍/生僻/扩展汉字 户籍、档案、方志、出版

二、如何支持 L2 / L3?

1. 默认现状(你当前命令的模式)

一般要用专业的软件,如「曦之」c.ziti163.com免费下载

  • 原生模型仅能稳定产出 L1 常用字
  • 原生不自带 L2 全部196个补充规范字、更不可能原生覆盖L3近9万生僻字;
  • 短板:四字节编码生僻字(CJK扩展B及以后)无训练样本,生成会崩坏、缺笔画、结构错乱。

2. 做到 L2 完整支持的条件(可行,但要改造)

想要输出合规L2字库,必须同时满足三点:

  1. 扩充训练数据集:加入《通用规范汉字表》全部27780字样本;
  2. 推理时加载完整字符列表,批量生成L2全集汉字;
  3. 导出字体文件(OTF/TTF)时填充全部L2码位,补齐196个补充规范字。
    行业成熟AI造字管线(汉仪、阿里普惠体)均可做到完整L2。

3. 做到 L3 完整支持(成本极高,现有小模型很难原生)

L3近9万汉字存在两大难点:

  1. 训练数据体量爆炸:CJK扩展B-H几万古汉字、异体字样本稀缺,普通人很难集齐高质量矢量字形素材;
  2. 显存/算力门槛极高:一次性推理8万+字符,单卡32G显存都会溢出;
  3. 字形难度差异大:极复杂古汉字部件组合极多,小模型容易结构错位、笔画粘连。

只有商用专业字厂的超大算力管线才能完整产出合规L3字体;个人单机Python推理脚本很难原生完整支持L3全集,只能少量单独生成个别生僻字。

三、实操区分:你的造字脚本怎么判断当前支持等级

  1. 仅少量常用字生成 → 只能算 L1 子集;
  2. 能批量生成全部27780个通用规范汉字、导出完整TTF/OTF → 达标 L2;
  3. 可完整覆盖CJK扩展B~H、户籍生僻字、古籍异体字全量码位 → 达标 L3。

四、补充业务建议

  1. 普通UI、印刷、办公场景:做到 L2 完全够用,也是系统强制标准;
  2. 户籍、档案、地方志、古籍出版:必须 L3
  3. 如果你是毕业设计《逐浪羲之》字体项目:
    • 基础交付:至少完成L2全集造字;
    • 加分拓展:单独实现部分L3高频生僻地名/人名字生成,不用强行全量9万字。

要获得 GB18030-2022 实现级别 3(L3) 的完整字符列表

要获得 GB18030-2022 实现级别 3(L3) 的完整字符列表,通常可以通过三种高效的专业途径。由于 L3 总共包含 87,887 个汉字(包含 L1 的 27,584 字和 L2 的 27,780 字,外加康熙部首及大量扩充生僻字),直接通过单篇网页复制全文并不现实。

国内支持L3的字体

目前有阿里普惠体3、MiSans L3、逐浪新宋L3,支持L3字集。
目前阿里普惠体、小米字体、逐浪新宋L3,有L3库,都是与L2\L3分开的,避免文件过大。

支持L3的字体软件

逐浪曦之是目前国内唯一支持L3的字体设计软件。
在这里插入图片描述
在这里插入图片描述