汉字数字化:从铅字到字库
汉字如何在计算机中安家?从 GB2312 到 GB18030 再到 Unicode,从铅字排版到矢量字库,中文信息化走过半个世纪,让十万汉字得以在屏幕上重现。本篇是理解一切中文技术的前提。
阅读全文 →文字入网,技术赋能
汉字如何进入计算机,汉语又如何被机器理解?技术界以「文档 + 百科」的形式,梳理汉字编码、汉字输入、中文分词、古籍数字化、AI 语文与语音合成六个专题,并附技术名词速查、学习路径与大事记,供随时查阅与检索。
汉字如何在计算机中安家?从 GB2312 到 GB18030 再到 Unicode,从铅字排版到矢量字库,中文信息化走过半个世纪,让十万汉字得以在屏幕上重现。本篇是理解一切中文技术的前提。
阅读全文 →五笔字型的拆字智慧、拼音输入的概率模型、语音与手写识别的兴起——输入法之争,本质是汉字如何在键盘这个西方发明上落脚的问题。
阅读全文 →中文书写不空格,词与词的边界需要机器自己判断。分词是中文信息处理的第一道门槛,也是机器理解汉语、检索语料与训练大模型的起点。
阅读全文 →从《四库全书》电子版到识典古籍,扫描、识别、标点、校勘、检索,图像识别与人工智能让千年典籍在屏幕上重获新生,也为语文研究提供了全新的工具。
阅读全文 →大模型能查字、能解诗、能批改作文、能对话练习,AI 正在成为语文学习的新工具;但它也会出错、也会编造,如何与 AI 共学,是新的语文素养。
阅读全文 →从机械音到拟人声,语音合成让古诗词「开口说话」。朗读、听读、跟读,语音技术正在改变诵读这一最古老的语文学习方式。
阅读全文 →按主题分组的中文技术常用术语,每条附一句话释义与所属专题,便于随手查阅。点击右下链接可跳转至对应文档。
GB2312
1980 年发布的《信息交换用汉字编码字符集·基本集》,收录汉字 6763 个,用两个字节表示一字,是汉字信息化的第一块基石。
→ 汉字数字化 · GB2312、GBK 与 GB18030GB18030
2000 年发布、2005 年修订的国家标准,采用单字节、双字节、四字节混合编码,汉字扩至 7 万余个,覆盖少数民族文字,是我国的法定强制标准。
→ 汉字数字化 · GB2312、GBK 与 GB18030Unicode · CJK
国际统一码标准,为世界上每种文字分配唯一码位;汉字集中在「中日韩统一表意文字」区,实现了跨语言、跨系统的统一编码。
→ 汉字数字化 · Unicode 与中日韩统一表意文字若初次接触中文技术,可按以下顺序阅读:从「字」到「词」再到「篇」与「声」,最后进入与 AI 共学的层面。
先弄清汉字如何被编码、存储与显示。编码是一切中文技术的底层前提,GB2312、GB18030 与 Unicode 的关系务必清楚。
编码如何落到键盘?比较形码与音码两条思路,理解为什么拼音输入最终胜出,以及手写、语音带来的新变化。
从「字」上升到「词」与「句」,看机器如何切分、标注与理解汉语,这是检索与大模型共同的知识基础。
把技术用回语文本身:扫描、识别、标点、校勘与检索,看千年典籍如何在屏幕上重生。
回到「有声的语文」:机器如何读准多音字与古诗,朗读、听读、跟读如何改变诵读的学习方式。
最后理解 AI 的能力与边界:它能提供素材、反馈与陪练,却不能替代人的体验、判断与创造。
半个世纪以来,中文信息化进程中的关键节点。