理解一个具体问题
全半角转换,不会把“二”变成“2”
NFKC 可将全角“2”规范为“2”;中文“二”不是这种全角字符。把“第二区”写成“第2区”需要你明确批准的编号规则,不能假定 Unicode 自动理解栏目含义。
| 学习编号 | LEARN-002 |
|---|---|
| 核心问题 | 全半角转换,不会把“二”变成“2” |
| 分类 | 字符处理 |
| 材料性质 | 本站自创教学卡;案例为虚构栏目,技术示例可在本地复现。 |
判断要点
先复制原始名称;仅在检索副本上试 NFKC,并记录哪些字符发生变化。
动手检查
分别比较“第2区”“第二区”“②区”的 NFKC 结果:第2区、第二区、2区。结果相同也不能直接认定对象相同。
适用范围
适合
- 整理栏目、文件清单和知识库目录的读者
- 希望把显示名称与身份标识分开管理的内容维护者
不适合
- 没有原始清单就批量覆盖名称
- 只凭规范化字符串删除疑似重复条目
继续阅读对应指南
指南
中文和数字混用怎样影响目录一致性?
混用会让同一栏出现多种写法、让字符排序偏离序号顺序,也可能使查重漏掉别名。解决时分别保存原名、显示名、数值排序键和稳定 ID;先确认目录范围与对象身份,再统一编号。
包含 5 个可复现步骤
阅读指南接下来可以看
学习卡片
排序键:为什么“第10区”会排在“第2区”前
按字符逐位比较时,字符串“第10区”可先于“第2区”。如果业务含义是序号,单独存整数 sort_number=2 或 10;统一前缀后再比较序号。
- 使用方式
- 阅读与实践
- 内容性质
- 教学材料
学习卡片
八行映射练习:接受六行,保留两行待查
把虚构目录 A 的第一区、第2区、第二区、第10区、第02区、一线观察及目录 B 的第2区、A 的 2区,逐行填写 ID、显示名、排序键与处理状态。
- 使用方式
- 阅读与实践
- 内容性质
- 教学材料
数据透明度
来源与核验状态
- Unicode UAX #15:规范化形式 未核验
- 发布方
- Unicode Consortium
- 访问日期
- 2026-09-11
- 支持字段
- NFC/NFKC 兼容规范化概念;已核对官方摘要并复现本站字符例子,全文读取超时,未完成全文核验;不支持业务编号或身份判断