`
zz563143188
  • 浏览: 2274606 次
  • 性别: Icon_minigender_1
  • 来自: 珠海
博客专栏
77fc734c-2f95-3224-beca-6b8da12debc8
编程工具介绍
浏览量:578629
D9710da2-8a00-3ae6-a084-547a11afab81
Spring Mvc实战(...
浏览量:1087544
D3f88135-07de-3968-a0f0-d2f13428c267
项目开发经验
浏览量:1656826
社区版块
存档分类
最新评论

关于编码ansi、GB2312、unicode与utf-8的区别

阅读更多
关于编码ansi、GB2312、unicode与utf-8的区别

先做一个小小的试验:

在一个文件夹里,把一个txt文本(文本里包含“今天的天气非常好”这句话)分别另存为ansi、unicode、utf-8这三种编码的txt文件。然后,在该文件夹上点击右键,选择“搜索(E)…”。

搜索“天气”二字,可以搜索出ansi和unicode这两种编码的txt文件,搜索不出utf-8编码的文件。

原因:

1.中文操作系统默认ansi编码,生成的txt文件默认为ansi编码,所以,可以搜索出来。

2.unicode是国际通用编码,所以,可以搜索出来。

3.utf-8编码是unicode编码在网络之间(主要是网页)传输时的一种“变通”和“桥梁”编码。utf-8在网络之间传输时可以节约数据量。所以,使用操作系统无法搜索出txt文本。

 
按照utf-8创始人的愿望:

端(unicode)——传输(utf-8)——端(unicode)

 
但是,后来,许多网站开发者在开发网页时直接使用utf-8编码。

端(utf-8)——传输(utf-8)——端(utf-8)


 


所以,在浏览器上看到的编码是:unicode(utf-8)。正因为在浏览器上这么并列地列出unicode(utf-8),造成许多网友(甚至不少程序员)误认为unicode=utf-8。其实,按照utf-8创始人的原意,在开发网页时使用utf-8编码是错误的做法,并且,早期的浏览器也不支持解析utf-8编码。但是,众人的力量是巨大的,微软不得不“趋炎附势”,在浏览器上支持解析utf-8编码。

 
问题是:utf-8编码影响了网站开发者,或者说,网站开发者“扩展”了utf-8编码的使用范围。但是,网站开发者仍然无法影响各类文档的开发者,所以,word文档和一些国际通用的文档仍然使用unicode编码而不使用utf-8编码。

 
比如:“严”的Unicode码是4E25,UTF-8编码是E4B8A5,两者是不一样的。

 
在中文和日文操作系统里生成的(txt和xml)文件的编码虽然都是ansi,但是,在简体中文系统下,ansi 编码代表 GB2312 编码,在日文操作系统下,ansi 编码代表 JIS 编码。不同 ansi 编码之间互不兼容,当信息在国际间交流时,无法将属于两种语言的文字,存储在同一段 ansi 编码的文本中。

 
结论:国际文档(txt和xml)使用unicode编码是正宗做法;操作系统和浏览器都能够“理解”unicode编码。浏览器“迫于压力”才“理解”utf-8编码。但是,操作系统有时只认unicode编码。

Unicode与Unicode big endian的区别:你吃鸡蛋时先吃小头还是先吃大头?Unicode与Unicode big endian的区别就是在编码时小头优先与大头优先的区别。“随波逐流”使用Unicode就OK了。

我(不是程序员)这几年一直因为编码问题,感到非常困惑,查了许多资料,在国际文档的实际应用中也遇到过许多问题,所以,“感性”地总结了上述观点,不一定准确(或者说,不一定正确)。

 

企业级项目实战(带源码)地址http://zz563143188.iteye.com/blog/1825168

收集五年的开发资料下载地址:  http://pan.baidu.com/share/home?uk=4076915866&view=share
 

http://wenku.baidu.com/view/a651b849f7ec4afe04a1df9f.html

 

 

Unicode、UTF-8 和 ISO8859-1到底有什么区别

1.本文主要包括以下几个方面:编码基本知识,java,系统软件,url,工具软件等。 

在下面的描述中,将以"中文"两个字为例,经查表可以知道其GB2312编码是"d6d0 cec4",Unicode编码为"4e2d 6587",UTF编码就是"e4b8ad e69687"。注意,这两个字没有iso8859-1编码,但可以用iso8859-1编码来"表示"。

在下面的描述中,将以"中文"两个字为例,经查表可以知道其GB2312编码是"d6d0 cec4",Unicode编码为"4e2d 6587",UTF编码就是"e4b8ad e69687"。注意,这两个字没有iso8859-1编码,但可以用iso8859-1编码来"表示"。

2. 编码基本知识 

最早的编码是iso8859-1,和ascii编码相似。但为了方便表示各种各样的语言,逐渐出现了很多标准编码,重要的有如下几个。 

2.1. iso8859-1 通常叫做Latin-1

属于单字节编码,最多能表示的字符范围是0-255,应用于英文系列。比如,字母a的编码为0x61=97。 

很明显,iso8859-1编码表示的字符范围很窄,无法表示中文字符。但是,由于是单字节编码,和计算机最基础的表示单位一致,所以很多时候,仍旧使用iso8859-1编码来表示。而且在很多协议上,默认使用该编码。比如,虽然"中文"两个字不存在iso8859-1编码,以gb2312编码为例,应该是"d6d0 cec4"两个字符,使用iso8859-1编码的时候则将它拆开为4个字节来表示:"d6 d0 ce c4"(事实上,在进行存储的时候,也是以字节为单位处理的)。而如果是UTF编码,则是6个字节"e4 b8 ad e6 96 87"。很明显,这种表示方法还需要以另一种编码为基础。

2.2. GB2312/GBK 

这就是汉子的国标码,专门用来表示汉字,是双字节编码,而英文字母和iso8859-1一致(兼容iso8859-1编码)。其中gbk编码能够用来同时表示繁体字和简体字,而gb2312只能表示简体字,gbk是兼容gb2312编码的。

2.3. unicode 

这是最统一的编码,可以用来表示所有语言的字符,而且是定长双字节(也有四字节的)编码,包括英文字母在内。所以可以说它是不兼容iso8859-1编码的,也不兼容任何编码。不过,相对于iso8859-1编码来说,uniocode编码只是在前面增加了一个0字节,比如字母a为"00 61"。 

需要说明的是,定长编码便于计算机处理(注意GB2312/GBK不是定长编码),而unicode又可以用来表示所有字符,所以在很多软件内部是使用unicode编码来处理的,比如java。

2.4. UTF 

考虑到unicode编码不兼容iso8859-1编码,而且容易占用更多的空间:因为对于英文字母,unicode也需要两个字节来表示。所以unicode不便于传输和存储。因此而产生了utf编码,utf编码兼容iso8859-1编码,同时也可以用来表示所有语言的字符,不过,utf编码是不定长编码,每一个字符的长度从1-6个字节不等。另外,utf编码自带简单的校验功能。一般来讲,英文字母都是用一个字节表示,而汉字使用三个字节。 

注意,虽然说utf是为了使用更少的空间而使用的,但那只是相对于unicode编码来说,如果已经知道是汉字,则使用GB2312/GBK无疑是最节省的。不过另一方面,值得说明的是,虽然utf编码对汉字使用3个字节,但即使对于汉字网页,utf编码也会比unicode编码节省,因为网页中包含了很多的英文字符。

3. java对字符的处理 

在java应用软件中,会有多处涉及到字符集编码,有些地方需要进行正确的设置,有些地方需要进行一定程度的处理。 

3.1. getBytes(charset) 

这是java字符串处理的一个标准函数,其作用是将字符串所表示的字符按照charset编码,并以字节方式表示。注意字符串在java内存中总是按unicode编码存储的。比如"中文",正常情况下(即没有错误的时候)存储为"4e2d 6587",如果charset为"gbk",则被编码为"d6d0 cec4",然后返回字节"d6 d0 ce c4"。如果charset为"utf8"则最后是"e4 b8 ad e6 96 87"。如果是"iso8859-1",则由于无法编码,最后返回 "3f 3f"(两个问号)。

3.2. new String(charset) 

这是java字符串处理的另一个标准函数,和上一个函数的作用相反,将字节数组按照charset编码进行组合识别,最后转换为unicode存储。参考上述getBytes的例子,"gbk" 和"utf8"都可以得出正确的结果"4e2d 6587",但iso8859-1最后变成了"003f 003f"(两个问号)。 

因为utf8可以用来表示/编码所有字符,所以new String( str.getBytes( "utf8" ), "utf8" ) === str,即完全可逆。

3.3. setCharacterEncoding() 

该函数用来设置http请求或者相应的编码。 

对于request,是指提交内容的编码,指定后可以通过getParameter()则直接获得正确的字符串,如果不指定,则默认使用iso8859-1编码,需要进一步处理。参见下述"表单输入"。值得注意的是在执行setCharacterEncoding()之前,不能执行任何getParameter()。java doc上说明:This method must be called prior to reading request parameters or reading input using getReader()。而且,该指定只对POST方法有效,对GET方法无效。分析原因,应该是在执行第一个getParameter()的时候,java将会按照编码分析所有的提交内容,而后续的getParameter()不再进行分析,所以setCharacterEncoding()无效。而对于GET方法提交表单是,提交的内容在URL中,一开始就已经按照编码分析所有的提交内容,setCharacterEncoding()自然就无效。

4.iso-8859-1是JAVA网络传输使用的标准 字符集,而gb2312是标准中文字符集,当你作出提交表单等需要网络传输的操作的时候,就需要把 iso-8859-1转换为gb2312字符集显示,否则如果按浏览器的gb2312格式来解释iso-8859-1字符集的话,由于2者不兼容,所以会 是乱码.

 

转自http://hi.baidu.com/libo20475/blog/item/2761afdea8d3105d94ee37f2.html

 

unicode和utf-8是什么关系

 

 

Unicode的最初目标,是用1个16位的编码来为超过65000个字符提供映射。但这还不够,它不能覆盖全部历史上的文字,也不能解决传输的问题(implantation head-ache's),尤其在那些基于网络的应用中。已有的软件必须做大量的工作来实现16位的数据。
  因此,Unicode用一些基本的保留字符制定了三套编码方式。它们分别是UTF-8,UTF-16和UTF-32。正如名字所示,在UTF-8中,字符是以8位序列来编码的,用一个或几个字节来表示一个字符。这种方式的最大好处,是UTF-8保留了ASCII字符的编码做为它的一部分,例如,在UTF-8和ASCII中,“A”的编码都是0x41. UTF-16和UTF-32分别是Unicode的16位和32位编码方式。考虑到最初的目的,通常说的Unicode就是指UTF-16。在讨论Unicode时,搞清楚哪种编码方式非常重要。Unicode:

unicode.org制定的编码机制, 要将全世界常用文字都函括进去.
在1.0中是16位编码, 由U+0000到U+FFFF. 每个2byte码对应一个字符; 在2.0开始抛弃了16位限制, 原来的16位作为基本位平面, 另外增加了16个位平面, 相当于20位编码, 编码范围0到0x10FFFF.

UTF: Unicode/UCS Transformation Format

UTF-8, 8bit编码, ASCII不作变换, 其他字符做变长编码, 每个字符1-3 byte. 通常作为外码. 有以下优点:
* 与CPU字节顺序无关, 可以在不同平台之间交流
* 容错能力高, 任何一个字节损坏后, 最多只会导致一个编码码位损失, 不会链锁错误(如GB码错一个字节就会整行乱码)

UTF-16, 16bit编码, 是变长码, 大致相当于20位编码, 值在0到0x10FFFF之间, 基本上就是unicode编码的实现. 它是变长码, 与CPU字序有关, 但因为最省空间, 常作为网络传输的外码.
UTF-16是unicode的preferred encoding.

UTF-32, 仅使用了unicode范围(0到0x10FFFF)的32位编码, 相当于UCS-4的子集.

UTF与unicode的关系:

Unicode是一个字符集, 可以看作为内码.
而UTF是一种编码方式, 它的出现是因为unicode不适宜在某些场合直接传输和处理. UTF-16直接就是unicode编码, 没有变换, 但它包含了0x00在编码内, 头256字节码的第一个byte都是0x00, 在操作系统(C语言)中有特殊意义, 会引起问题. 采用UTF-8编码对unicode的直接编码作些变换可以避免这问题, 并带来一些优点

 

utf-8与utf-16的区别

UTF8 和 UTF16 都是变长表示的,为啥欧美技术宅会觉得太浪费了咧?因为欧美字符 0x0000 - 0x00FF 就搞定了,UTF8 最小变长是 1 个字节,而 UTF16 变长是 2 个字节,

.utf-8 与 uft-16 表示 'a' a的ascii是0X61 

  utf-8为[0X61]  

  uft-16 [0x00,0X61]

8
3
分享到:
评论
21 楼 it2013 2013-12-31  
转了多谢。
20 楼 xinglan500 2013-10-30  
留爪,备读。
19 楼 zz563143188 2013-04-26  
hhpicaso 写道
留个痕,下来再细看

现在写的例子还没有规范,后面我做一些小功能运用基础知识,这样就有头绪
18 楼 hhpicaso 2013-04-25  
留个痕,下来再细看
17 楼 zz563143188 2013-04-25  
a123159521 写道
zz563143188 写道
zz563143188 写道
a123159521 写道
看了你的2年经历,果然是程序猿的世界,总有一些幼稚的想法,总有苦B,傻B,牛B的日子,多多交流.

说得很好,我把时间都给电脑了。感觉这个世界除了电脑,就没有什么了。

有时感觉搞技术的人,如果没有丰富的业余爱好,还真不行。


给你补充点书
除了<<重构>>,<<设计模式>>
特别推荐<<Effect Java>>
这本书对于程序猿来说也是不错的, 比如程序猿连最基本的代码都不会编写,能重构个鸡蛋出来.

谢谢你的建议,以前我用的是Vb,delhpi在编程风格上有点随意。五一过来好好看你说的那几本书。
16 楼 a123159521 2013-04-25  
zz563143188 写道
zz563143188 写道
a123159521 写道
看了你的2年经历,果然是程序猿的世界,总有一些幼稚的想法,总有苦B,傻B,牛B的日子,多多交流.

说得很好,我把时间都给电脑了。感觉这个世界除了电脑,就没有什么了。

有时感觉搞技术的人,如果没有丰富的业余爱好,还真不行。


给你补充点书
除了<<重构>>,<<设计模式>>
特别推荐<<Effect Java>>
这本书对于程序猿来说也是不错的, 比如程序猿连最基本的代码都不会编写,能重构个鸡蛋出来.
15 楼 zz563143188 2013-04-25  
zz563143188 写道
a123159521 写道
看了你的2年经历,果然是程序猿的世界,总有一些幼稚的想法,总有苦B,傻B,牛B的日子,多多交流.

说得很好,我把时间都给电脑了。感觉这个世界除了电脑,就没有什么了。

有时感觉搞技术的人,如果没有丰富的业余爱好,还真不行。
14 楼 zz563143188 2013-04-25  
a123159521 写道
看了你的2年经历,果然是程序猿的世界,总有一些幼稚的想法,总有苦B,傻B,牛B的日子,多多交流.

说得很好,我把时间都给电脑了。感觉这个世界除了电脑,就没有什么了。
13 楼 a123159521 2013-04-25  
看了你的2年经历,果然是程序猿的世界,总有一些幼稚的想法,总有苦B,傻B,牛B的日子,多多交流.
12 楼 zz563143188 2013-04-25  
xiang37 写道
haohao-xuexi02 写道
张老师,讲的很详细嘛。。

挺活跃

呵呵,这些知识点还没有整合起来,也没有写好注解
11 楼 xiang37 2013-04-25  
haohao-xuexi02 写道
张老师,讲的很详细嘛。。

挺活跃
10 楼 zz563143188 2013-04-24  
albertwxh 写道
期待你整理后的结果,肯定很强大!期待中!整理好了一定要通知我一下昂!
albertwxh@sina.com我的邮箱!

我先要把各个知识整理出来,然后再根据各个知识点整合成一个综合的。预计在五月13号前整理出来,到时关注,也会发邮件给你。
9 楼 albertwxh 2013-04-24  
期待你整理后的结果,肯定很强大!期待中!整理好了一定要通知我一下昂!
albertwxh@sina.com我的邮箱!
8 楼 zz563143188 2013-04-24  
jacking124 写道
不错的,支持你!

现在这些东西都很零散没有整合起来,等我基础整理好出一个系统性的例子出来。目前在整理代理,集合,swing,socket方面的知识,
7 楼 jacking124 2013-04-24  
不错的,支持你!
6 楼 zz563143188 2013-04-24  
albertwxh 写道
谢谢百度云盘的共享!

作为一个靠自学的人,就很明白作为新手需要什么资料。
5 楼 albertwxh 2013-04-24  
谢谢百度云盘的共享!
4 楼 zz563143188 2013-04-24  
xikang19 写道
谢谢百度云网盘的共享

不客气,我是花了很多时间才查看收集到的,希望可以为你们节省时间。
3 楼 xikang19 2013-04-23  
谢谢百度云网盘的共享
2 楼 zz563143188 2013-04-23  
haohao-xuexi02 写道
张老师,讲的很详细嘛。。

记得以前在学校读书的时候,很多班的同学请我去讲课,那时还真有当老师的感。这个例子才实现一点功能,后面的功能我会陆续更新上去。

相关推荐

    文本文件编码转换:ANSI、Unicode、UTF-8相互转换(修改版)

    ANSI --&gt; UTF-8 Unicode --&gt; ANSI Unicode --&gt; UTF-8 UTF-8 --&gt; ANSI UTF-8 --&gt; Unicode UTF-8 --&gt; Unicode big endian ansi转别的,不检验BOM,一律作为ansi编码进行转换 unicode转别的,首先检验BOM,不合格不...

    字符编码转换类,支持 ANSI、Unicode、Unicode big endian、UTF-8、UTF-8+Bom互相转换

    "CharsetConv"类提供了一个工具,帮助开发者在ANSI、Unicode(Little Endian和Big Endian)、UTF-8及UTF-8+BOM之间灵活转换,从而避免编码问题带来的困扰。通过深入学习和实践,开发者可以更好地应对各种编码挑战,...

    编码查询 各种文本转到 unicode utf-8 gb2312 编码 unicode utf-8 gb2312 编码转换到文字

    本文将深入探讨“编码查询”这一主题,包括Unicode、UTF-8和GB2312编码之间的转换,并讨论如何将这些编码转换为可读的文字。 首先,我们要理解编码的基本概念。编码是将字符(如字母、数字、符号)转化为二进制表示...

    utf-8 ansi 字符互转 工具

    本文将深入探讨UTF-8与ANSI字符编码的区别、转换方法以及相关工具。 首先,让我们了解这两种编码的基本概念: 1. **UTF-8**:全称为“Unicode Transformation Format - 8”,是一种变长的字符编码,可以表示...

    UTF-8转ANSI文本文件转换器

    "UTF-8转ANSI文本文件转换器"就是这样一个工具,它能够帮助用户批量将UTF-8编码的文本文件转换为ANSI编码的文本文件。在此,我们将深入探讨UTF-8和ANSI编码的原理以及转换过程中涉及的关键知识点。 **一、UTF-8编码...

    文本文件编码转换程序:ANSI、Unicode、UTF-8三种存储编码相互转换

    文本文件编码转换:ANSI、Unicode、UTF-8三种存储编码相互转换。 Unicode作为源文件同时支持Big endian,作为目标文件不支持Big endian。 UTF-8不支持无BOM的文件。 希望能对新手有帮助,也大家多提宝贵意见。

    VB中ANSI转换成UTF-8

    而UTF-8是一种广泛使用的Unicode编码,能表示世界上几乎所有的字符,具有良好的跨平台性和兼容性。 在VB中进行编码转换,可以使用内置的函数或者第三方库。一个基本的方法是利用`ADODB.Stream`对象,它可以读写文本...

    各种编码UNICODE、UTF-8、ANSI、ASCII、GB2312、GBK详解

    各种编码UNICODE、UTF-8、ANSI、ASCII、GB2312、GBK详解

    封装ANSI,UNICODE,UTF8互相转换类

    - UTF-8到ANSI:与上述相反,这个过程需要先解析UTF-8编码,然后将其转换回ANSI编码。这里可能遇到的问题是,如果原始ANSI字符串不支持某些在UTF-8中出现的字符,那么这些字符可能无法正确显示或丢失。 - UNICODE到...

    TXT编码批量转换 V2.0编码UnicodeANSIUTF-8互转软件功能Unicode转ANSI转UTF-8互转软件.exe

    Txt文件编码批量转换器用于批量转换txt文本文档的编码格式。通常,我们电脑里的txt文件都是ASNI编码,当放到手机或MP3里时,打开看到的往往...目前,它支持ASNI、UTF-8、Unicode和Unicode big endian等编码的相互转换。

    unicode、utf-8、ansi的故事及其相互转换.txt

    要将其转换为 Unicode 编码,首先需要查询 GB2312 到 Unicode 的映射表,找到对应的 Unicode 值(假设为 0x4E2D),然后按照 UTF-8 的编码规则进行编码。 #### 六、小结 综上所述,Unicode、UTF-8 和 ANSI 编码...

    C 编码转换 ,包括ANSI,UNICODE,UTF-8,UniBigEnd 源码下载

    C 编码转换源码,包括ANSI,UNICODE,UTF-8,UniBigEnd 图片演示,可以查看我的博文 http://blog.csdn.net/hizhanyue/article/details/49821231

    字符编码:GBK、GB2312、UTF-8

    在处理不同编码的转换时,通常需要通过Unicode作为中间桥梁,比如GBK或GB2312需要先转换成Unicode,然后再转换成UTF-8。这个过程需要注意的是,不正确的转换可能导致乱码问题。 总的来说,选择哪种编码取决于具体的...

    多字节与UTF-8、Unicode之间的转换

    本篇文章主要探讨的是多字节(MBCS)编码与UTF-8、Unicode编码之间的转换方法,并深入分析了给定代码片段中的六个函数实现细节。 #### 一、基础知识概述 1. **多字节字符集(MBCS)**:多字节字符集是指非固定长度...

    pb9.0 UTF-8 编码转换为Unicode 编码格式

    PowerBuilder9.0开发环境下,可以把UTF-8的编码转换为Unicode的编码格式,在pb9.0环境下测试通过。

    utf-8、ANSI、Unicode相互转化c++实现

    utf-8、ANSI、Unicode相互转化c++实现 std::string ConverANSI2UTF8(const std::string & str); std::wstring ConverANSI2Unicode(const std::string str); std::wstring ConverUTF82Unicode(const std::string str)...

    批量修改文本文件的编码方式至UTF-8或ANSI,可用于批量修改CUE格式文件

    首先,UTF-8是一种广泛使用的多字节字符编码,能够表示Unicode字符集中的所有字符,包括世界各地的多种语言。它的优点在于兼容性好,大多数现代软件和网页浏览器都能很好地支持UTF-8编码,减少了乱码问题的出现。 ...

    Encode-Decode-ANSI-UTF-8.rar

    在这个主题中,我们将深入探讨"Encode-Decode-ANSI-UTF-8.rar"这个工具所涉及的关键概念,包括ANSI编码、UTF-8编码以及它们之间的转换。 首先,让我们了解ANSI编码。在Windows操作系统中,ANSI编码通常指的是...

    PB的utf-8转换

    PB的utf-8转换,包括加码解码等等 aaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaaa

Global site tag (gtag.js) - Google Analytics