`
micheal19840929
  • 浏览: 163255 次
  • 性别: Icon_minigender_1
  • 来自: 广州
社区版块
存档分类
最新评论

unicode中文范围

 
阅读更多

在网上搜索了一下汉字的Unicode范围,普遍给出了“U+4E00..U+9FA5”。但事实上这个范围是不完整的,甚至连基本的全角(中文)标点也未包含在内。根据最新的Unicode 5.0版整理如下:

注:在绝大多数应用场合中,我们可以仅用(1)、(2)、(3)、(4)、(5)的集合作为CJK判断的依据。

1)标准CJK文字

http://www.unicode.org/Public/UNIDATA/Unihan.html

Code point range

Block name

Release

U+3400..U+4DB5

CJK Unified Ideographs Extension A

3.0

U+4E00..U+9FA5

CJK Unified Ideographs

1.1

U+9FA6..U+9FBB

CJK Unified Ideographs

4.1

U+F900..U+FA2D

CJK Compatibility Ideographs

1.1

U+FA30..U+FA6A

CJK Compatibility Ideographs

3.2

U+FA70..U+FAD9

CJK Compatibility Ideographs

4.1

U+20000..U+2A6D6

CJK Unified Ideographs Extension B

3.1

U+2F800..U+2FA1D

CJK Compatibility Supplement

3.1

2)全角ASCII、全角中英文标点、半宽片假名、半宽平假名、半宽韩文字母:FF00-FFEF

http://www.unicode.org/charts/PDF/UFF00.pdf

3)CJK部首补充:2E80-2EFF

http://www.unicode.org/charts/PDF/U2E80.pdf

4)CJK标点符号:3000-303F

http://www.unicode.org/charts/PDF/U3000.pdf

5)CJK笔划:31C0-31EF

http://www.unicode.org/charts/PDF/U31C0.pdf

6)康熙部首:2F00-2FDF

http://www.unicode.org/charts/PDF/U2F00.pdf

7)汉字结构描述字符:2FF0-2FFF

http://www.unicode.org/charts/PDF/U2FF0.pdf

8)注音符号:3100-312F

http://www.unicode.org/charts/PDF/U3100.pdf

9)注音符号(闽南语、客家语扩展):31A0-31BF

http://www.unicode.org/charts/PDF/U31A0.pdf

10)日文平假名:3040-309F

http://www.unicode.org/charts/PDF/U3040.pdf

11)日文片假名:30A0-30FF

http://www.unicode.org/charts/PDF/U30A0.pdf

12)日文片假名拼音扩展:31F0-31FF

http://www.unicode.org/charts/PDF/U31F0.pdf

13)韩文拼音:AC00-D7AF

http://www.unicode.org/charts/PDF/UAC00.pdf

14)韩文字母:1100-11FF

http://www.unicode.org/charts/PDF/U1100.pdf

15)韩文兼容字母:3130-318F

http://www.unicode.org/charts/PDF/U3130.pdf

16)太玄经符号:1D300-1D35F

http://www.unicode.org/charts/PDF/U1D300.pdf

17)易经六十四卦象:4DC0-4DFF

http://www.unicode.org/charts/PDF/U4DC0.pdf

18)彝文音节:A000-A48F

http://www.unicode.org/charts/PDF/UA000.pdf

19)彝文部首:A490-A4CF

http://www.unicode.org/charts/PDF/UA490.pdf

20)盲文符号:2800-28FF

http://www.unicode.org/charts/PDF/U2800.pdf

21)CJK字母及月份:3200-32FF

http://www.unicode.org/charts/PDF/U3200.pdf

22)CJK特殊符号(日期合并):3300-33FF

http://www.unicode.org/charts/PDF/U3300.pdf

23)装饰符号(非CJK专用):2700-27BF

http://www.unicode.org/charts/PDF/U2700.pdf

24)杂项符号(非CJK专用):2600-26FF

http://www.unicode.org/charts/PDF/U2600.pdf

25)中文竖排标点:FE10-FE1F

http://www.unicode.org/charts/PDF/UFE10.pdf

26)CJK兼容符号(竖排变体、下划线、顿号):FE30-FE4F

http://www.unicode.org/charts/PDF/UFE30.pdf

分享到:
评论

相关推荐

    Unicode汉字编码表(全)

    Unicode汉字编码表是全球计算机系统中用于表示汉字的标准编码之一,它在中文信息处理领域扮演着至关重要的角色。Unicode,全称统一码或万国码,是一个为所有字符集提供唯一数字标识的国际标准,旨在解决不同语言字符...

    各国文字Unicode编码范围.zip

    “各国文字Unicode编码范围.zip”这个压缩包文件包含了关于世界各国文字在Unicode编码体系中的位置和范围的信息。Unicode编码是基于16位的,理论上可以表示65,536个不同的字符,但实际上已经扩展到了21位,能够表示...

    最全的unicode 汉字编码表

    最全的unicode 汉字编码,范围为4e00-9fa5,格式为txt

    unicode汉字编码拼音对照表

    unicode汉字和拼音对照表,按照: 汉字 编码 拼音声标 拼音声调(声调在字母后)声调在拼音后 纯拼音 的格式排列。一共是20902个汉字编码范围是 U4e00 ~ U9fa5.

    所有中文字Unicode编码区间及常用中文字Unicode编码

    所有中文字Unicode编码区间及常用中文字Unicode编码,在生成随机验证码时可能使用到

    常用的java汉字unicode编码

    该文档有常用的java汉字unicode编码

    汉字UNICODE互换工具.exe

    UNICODE覆盖了包括汉字在内的多种语言字符,使得计算机系统能够在全球范围内进行文本处理和交换。在UNICODE中,每个汉字都有一个独一无二的数字代码,通常用十六进制表示,如“汉字”在UNICODE中的编码可能是“6C49...

    汉字与unicode编码(十六进制)对照表

    在Unicode中,汉字通常被分配在BMP的第四区,即所谓的汉文区,范围大致在0x4E00到0x9FFF之间。这个对照表可能就按照这个顺序列出了汉字的一级和二级字库,一级字库包含常用汉字,二级字库则包含较为生僻的汉字。 ...

    unicode和汉字转换

    Unicode 包含了大量的汉字,确保了在国际化的软件和网络中,中文字符能够被正确识别和处理。 汉字转换则涉及到将汉字编码为其他格式,如GBK、GB2312等,这些是中国大陆早期广泛使用的简体汉字编码。这些编码标准的...

    UNICODE汉字对照表,用access存储

    Access数据库支持多种数据类型,对于Unicode码点,通常会使用整数或长整数数据类型来存储,因为Unicode码点的数值范围通常在0至0x10FFFF之间。汉字则可能使用文本数据类型(如Short Text或Long Text),因为每个汉字...

    中文汉字转unicode工具

    例如,在编写网页时,使用 Unicode 编码可以确保浏览器在全球范围内正确显示中文汉字。在编程中,程序员可以利用这些工具处理字符串,确保代码在不同系统下的一致性。 压缩包中的“中文汉字转unicode工具”很可能是...

    java 中文Unicode转换

    每个`char`变量可以存储一个Unicode码点,但需要注意的是,对于超出BMP范围的字符,Java使用代理对(Surrogate Pair)来存储。一个代理对由两个`char`组成,它们共同表示一个码点。 将中文字符转换为Unicode编码,...

    unicode至汉字的批量转换

    汉字,作为中文的主要书写形式,自然也被纳入Unicode编码之中。每个汉字在Unicode中都有一个唯一的编号,称为码点。通过这个码点,我们可以将Unicode编码转换为汉字,以便在计算机系统中显示和处理。 批量转换...

    汉字unicode转换器

    汉字的Unicode码点通常在Unicode的“基本多文种平面”(BMP)内,范围从U+4E00到U+9FFF,其中“我”的Unicode码点是U+6211。在16进制表示下,U+6211转换成十进制就是25105,这就是描述中所说的“我”转换后的结果。 ...

    Unicode11.0汉字标准

    扩展A至E的CJK字符集在Unicode11.0中进一步扩大了对东亚地区汉字的覆盖范围。这些扩展包含了大量罕见的汉字、古汉字、异体字以及部分少数民族文字。对于学术研究、文献整理和文化保护等领域具有重要意义。例如,扩展...

    汉字Unicode互换工具

    由于大部分汉字在UCS-2范围内,因此在日常应用中,UCS-2编码更为常见。 在描述中提到,该工具的使用非常便捷。用户可以输入或者粘贴包含汉字的文本,然后软件会自动将其转换成对应的Unicode码。这对于程序员、网页...

    Unicode的中文汉字和字符编码对应表

    其中,Unicode和GBK是两种广泛使用的字符编码系统,特别针对中文汉字的处理。Unicode是一个全球统一的标准,而GBK是中国特定的编码标准,两者都包含了大量的中文字符,但有各自的特点和适用范围。 **Unicode**,...

    gb18030的汉字编码,Unicode汉字编码表

    在IT行业中,理解和掌握汉字编码对于处理中文字符的存储、传输和显示至关重要。本文将深入探讨GB18030、GBK、Unicode这三种汉字编码以及它们在编程中的应用。 首先,让我们了解一下GB18030编码。GB18030是中国国家...

    unicode-GBK编码对照表

    unicode-GBK编码对照表,支持24068个字转换,这个表格适合运用各个平台,小程序,c语言等。

    汉字转 Unicode 码软件

    4. 如果需要,可以将每个 Unicode 值拆分成两个字节进行发送,因为 Unicode 码点可能超过一个字节的范围。 在压缩包内的“unicode”文件可能是实现这一转换功能的源代码、工具或教程。对于开发者来说,理解这些内容...

Global site tag (gtag.js) - Google Analytics