字符处理

字符处理

NFKC 可将全角“2”规范为“2”;中文“二”不是这种全角字符。把“第二区”写成“第2区”需要你明确批准的编号规则,不能假定 Unicode 自动理解栏目含义。

本栏回应什么问题

先复制原始名称;仅在检索副本上试 NFKC,并记录哪些字符发生变化。

适合:目录维护者与内容编辑

学习步骤

  1. 分别比较“第2区”“第二区”“②区”的 NFKC 结果:第2区、第二区、2区。结果相同也不能直接认定对象相同。
  2. 在独立副本填写处理结果,保留原始列。
  3. 将已确认映射与待查记录分别计数。

常见误区

  • 全局替换所有“一、二、十”
  • NFKC 结果相同即删掉一条

本栏学习卡片

相关指南

指南 更新于 2026-09-11

中文和数字混用怎样影响目录一致性?

混用会让同一栏出现多种写法、让字符排序偏离序号顺序,也可能使查重漏掉别名。解决时分别保存原名、显示名、数值排序键和稳定 ID;先确认目录范围与对象身份,再统一编号。

包含 5 个可复现步骤

阅读指南

常见问题

NFKC 能把“二”自动变成“2”吗?

不能。本课本地示例中“2”变成“2”,但“二”仍为“二”。中文数词转序号需要限定字段和批准的映射规则;“一线观察”不能全局替换。