1. 首页
  2. 技术界

技术界

文字入网,技术赋能

汉字如何进入计算机,汉语又如何被机器理解?技术界以「文档 + 百科」的形式,梳理汉字编码、汉字输入、中文分词、古籍数字化、AI 语文与语音合成六个专题,并附技术名词速查、学习路径与大事记,供随时查阅与检索。

6 篇专题文档 24 个小节 21 条技术词条 1 条学习路径
技术百科 21 条词条

技术百科 · 名词速查

按主题分组的中文技术常用术语,每条附一句话释义与所属专题,便于随手查阅。点击右下链接可跳转至对应文档。

汉字与编码

GB2312

1980 年发布的《信息交换用汉字编码字符集·基本集》,收录汉字 6763 个,用两个字节表示一字,是汉字信息化的第一块基石。

→ 汉字数字化 · GB2312、GBK 与 GB18030

GBK

1995 年发布的汉字内码扩展规范,收录汉字 21003 个,向下兼容 GB2312,解决了人名、地名等常用字不足的问题。

→ 汉字数字化 · GB2312、GBK 与 GB18030

GB18030

2000 年发布、2005 年修订的国家标准,采用单字节、双字节、四字节混合编码,汉字扩至 7 万余个,覆盖少数民族文字,是我国的法定强制标准。

→ 汉字数字化 · GB2312、GBK 与 GB18030

Unicode · CJK

国际统一码标准,为世界上每种文字分配唯一码位;汉字集中在「中日韩统一表意文字」区,实现了跨语言、跨系统的统一编码。

→ 汉字数字化 · Unicode 与中日韩统一表意文字

点阵字库

把字形存放在方格点阵中(如 16×16),占用空间小、生成快,但放大后出现锯齿,是早期计算机显示汉字的主流方式。

→ 汉字数字化 · 从点阵到矢量

矢量字库

用数学曲线(如贝塞尔曲线)描述字形轮廓而非逐点存贮,任意缩放不失真,是当代字体设计与排版的通用形式。

→ 汉字数字化 · 从点阵到矢量

输入与交互

五笔字型

1983 年王永民发明的形码输入方案,按字根与笔画把汉字拆成编码,重码率低、可盲打,是形码输入的代表。

→ 汉字输入法 · 五笔字型

拼音输入法

以汉语拼音为编码的输入方案,依靠大规模词库与概率模型把字母串映射为汉字,是当今最主流的输入方式。

→ 汉字输入法 · 拼音输入法的胜利

双拼

把声母与韵母各映射到一个键位,两键出一字,在保留拼音思维的同时显著减少击键次数。

→ 汉字输入法 · 拼音输入法的胜利

手写识别

通过笔迹轨迹与字形匹配识别汉字,无需记忆编码,是字形输入最自然的一种延伸,也是移动设备的重要输入方式。

→ 汉字输入法 · 手写、语音与未来的输入

中文计算

中文分词

把连续书写的汉字序列切分为词,是中文信息处理的第一步,也是检索、翻译与语言模型的基础环节。

→ 中文分词 · 为什么中文需要分词

序列标注

为字或词逐个打上标签(如词位、词性),隐马尔可夫模型、条件随机场与神经网络是常用方法,是分词的主流建模方式。

→ 中文分词 · 分词的主要方法

命名实体识别

从文本中识别人名、地名、机构名、时间等专名,是分词之上的重要任务,广泛用于信息抽取与知识整理。

→ 中文分词 · 分词之上的中文处理

预训练语言模型

先在大规模语料上学习语言规律,再迁移到具体任务(如 BERT、GPT 系列),是当代中文处理的基本范式。

→ 中文分词 · 从分词到预训练语言模型

古籍与文献

OCR

光学字符识别,把图像中的文字转换为可编辑、可检索的文本,是古籍数字化与档案整理的关键技术。

→ 古籍数字化 · OCR 与版面分析

版面分析

识别扫描页面中的版框、栏线、正文、双行小注、批点与插图,为 OCR 与结构化整理提供版式依据。

→ 古籍数字化 · OCR 与版面分析

全文检索

对数字化文本建立索引,支持按字、词、句快速定位,使历代典籍可被精确检索、比对与统计。

→ 古籍数字化 · 从影印到全文检索

异体字与通假字

古籍中一字多形、借字表义的现象。字形的归并与字义的判定是数字化整理中最需要文献学功底的难点。

→ 古籍数字化 · 人工智能与古籍整理新范式

语音与智能

语音合成 · TTS

把文本转换为语音的技术,波形拼接与神经网络合成是前后两代主流路线,让机器朗读古诗文成为可能。

→ 语音合成 · 技术简史

多音字消歧

依上下文判断多音字的读音(如「行」「长」「乐」),是机器朗读中文的首要难题,也是古诗文诵读的关键。

→ 语音合成 · 读准多音字与古诗

大语言模型

参数量巨大的生成式模型,能对话、写作、解题、批改与解释,成为语文学习的新工具;但它也可能出错与编造,需要使用者判断。

→ AI 与语文学习 · 大模型为什么会「懂」语文
学习路径 建议顺序

技术学习路径

若初次接触中文技术,可按以下顺序阅读:从「字」到「词」再到「篇」与「声」,最后进入与 AI 共学的层面。

  1. 1
    从汉字编码起步

    先弄清汉字如何被编码、存储与显示。编码是一切中文技术的底层前提,GB2312、GB18030 与 Unicode 的关系务必清楚。

  2. 2
    再看汉字输入

    编码如何落到键盘?比较形码与音码两条思路,理解为什么拼音输入最终胜出,以及手写、语音带来的新变化。

  3. 3
    进入中文分词与自然语言处理

    从「字」上升到「词」与「句」,看机器如何切分、标注与理解汉语,这是检索与大模型共同的知识基础。

  4. 4
    延伸到古籍数字化

    把技术用回语文本身:扫描、识别、标点、校勘与检索,看千年典籍如何在屏幕上重生。

  5. 5
    听一听语音合成

    回到「有声的语文」:机器如何读准多音字与古诗,朗读、听读、跟读如何改变诵读的学习方式。

  6. 6
    与 AI 共学

    最后理解 AI 的能力与边界:它能提供素材、反馈与陪练,却不能替代人的体验、判断与创造。

前往 AI 学堂 →
大事记 1974 至今

中文技术大事记

半个世纪以来,中文信息化进程中的关键节点。

  1. 1974 「748 工程」(汉字信息处理系统工程)启动,汉字精密照排、情报检索与通信成为国家项目。
  2. 1980 GB2312 发布,6763 个常用汉字第一次有了统一的数字身份。
  3. 1983 五笔字型问世,形码输入让汉字录入速度大幅提升。
  4. 1995 GBK 发布,汉字扩充至 21003 个,兼容 GB2312。
  5. 2000 GB18030 发布,单双四字节混合编码兼顾兼容与扩充。
  6. 2005 GB18030 修订,汉字扩至 7 万余个,覆盖少数民族文字与大批生僻字。
  7. 2010s 深度学习进入中文处理,分词、识别与语音合成精度显著提升,古籍 OCR 走向实用。
  8. 2020s 大语言模型进入语文学习场景,查字、解诗、批改与对话练习成为日常。