计算机编码和乱码问题探析

2018-10-11  本文已影响0人  WHU_GIS_LJ

1. 常见的编码方式

ASCII
ISOLatin-1
UNICODE
UTF-8
GBK
ANSI

2. 乱码产生的原因及解决方案

乱码一般是英文以外的字符才会出现,因为 UTF-8 、GBK 等编码方式对英文都是采用一个字节的编码方式,并且采用了相同的码字,与 ASCII 码保持一致。乱码的根本原因是编码和解码使用的编码方式不一致,解决乱码问题常用方法无非两种:

1. 保证编码、解码使用的编码方式一致。

2. 编码、解码过程中的编码方式不一致的话,进行编码格式转换。

2.1 网页乱码

原因分析

下面这个流程是我们写入文件到展示文件的简单描述:

1. 我们使用编辑器编写 HTML 文件;

2. 保存编写的HTML文件;

3. 使用浏览器打开HTML文件;

4. HTML文件在浏览器展示。

乱码产生的根源就在与第2步骤和第4步。

在第2步保持文件时会把我们写入的文字使用编辑器默认的编码方式进行保存。如果大家使用的是vscode编辑器,默认的编码方式是utf-8。

在第4步浏览器打开网页时,它并不知道你的这个文件是使用什么编码方式,于是自作主张使用了默认解码方式。比如将文件保存为GBK格式,在Chrome打开时默认使用 ISO -8859的解码方式,导致编码和解码不匹配,产生乱码。

解决方案

保证保存浏览器解析html文件用的编码方式和保存html文件时用的编码方式一致。首先,在文件保存的时候你自己要清楚是用哪种编码方式保存的。如果你的文件是保存为utf-8格式,那么一定要在html 的<head>里添加<meta charset="utf-8">,这句话的意思是告诉浏览器在打开这个页面的时候直接用utf-8去解码。 同理,如果你的文件保存为gbk格式,一定在文件里添加<meta charset="gbk">

2.2 Qt 中文乱码

原因分析

从我们在代码编辑器里输入一个UTF8汉字开始,到最终在窗口或控制台上显示出来,整个流程涉及到三个概念,分别是源码字符集,执行字符集,解析字符集,三个字符集保持一样则不会乱码。

综上可知,Qt中乱码的原因是因为MSVC编译器采用GBK编码字符集作为执行字符集,前后字符集不一致导致乱码。

解决方案

要解决乱码问题,其实只要使得MSVC编译器采用UTF-8字符集进行编译即可。在需要使用中文的类的头文件上方加入如下语句:#pragma execution_character_set("utf-8"),即可使得MSVC编译器采用UTF-8字符集进行编译。

2.3 Arcmap 解析 shp 文件乱码

原因分析

一般来说,组成一个 Shapefile,需要包含以下文件:

其中 .shp、.shx、.dbf 三个文件是必需的。

解析shp文件乱码指的是读取或写入 .dbf 文件中的中文属性乱码。值的注意的是,.dbf 文件中的第29个字节表示的是LanguageDriverID,代码编码方式,如 87 代表 ANSI 编码。具体对应关系参看 http://www.autopark.ru/ASBProgrammerGuide/DBFSTRUC.HTM

Arcmap 解析 .dbf 文件的过程如下:

1. 查看 .dbf 文件的LanguageDriverID,如果LanguageDriverID有效,则使用LanguageDriverID对应的编码方式解析.dbf文件;

2. 如果LanguageDriverID无效(LanguageDriverID没有对应的编码方式,如LanguageDriverID为0),则查看是否有 .cpg文件,如果有 .cpg 文件,则根据 .cpg文件中指定的编码方式解析 .dbf 文件;

3. 如果没有 .cpg 文件,则采用默认的编码方式解析 .dbf 文件,Arcmap 10.2之后默认采用UTF-8编码。

因此Arcmap解析shp文件乱码原因是.dbf 文件的LanguageDriverID有误或缺乏正确的.cpg文件。

解决方案

确保.dbf文件的LanguageDriverID正确或添加必要的.cpg文件。

2.4 Gdal 读取写入shp文件乱码

读取shp乱码解决
image.png

经过上图设置:gdal支持中文路径、中文文件名、中文字段和中文属性的读取,但是使用CreateLayer()或者CopyLayer()函数生成的shp文件用arcmap打开中文字段和属性会乱码。


image.png
写入或创建shp乱码

乱码原因如下:gdal默认创建的dbf文件的LanguageDriverID(dbf文件的第29个字节)为87,代表ANSI编码,而shp文件实为UTF-8编码,arcmap解析shp时会先根据dbf确定文件编码,因此会采用ANSI字符集解析shp文件,导致乱码。

解决思路就是使得创建的dbf文件的LanguageDriverID为0,而不是87,为0不表示任何编码,没有编码的情况下,arcmap采用UTF-8字符集解析shp,即可正常显示。查阅源码和对应API文档可知。CreateLayer()或者CopyLayer()函数有个参数可以设置创建的dbf文件LanguageDriverID,如下图所示:

image.png
上一篇下一篇

猜你喜欢

热点阅读