Python中文件编码的检测

2019-07-13 本文已影响16人我爱学python

前言：

文件打开的原则是“ 以什么编码格式保存的，就以什么编码格式打开 ”，我们常见的文件一般是以“ utf-8 ”或“ GBK ”编码进行保存的，由于编辑器一般设置了默认的保存和打开方式，所以我们在记事本或常见文档编辑器如Word中不容易看到乱码的情况发生，但是，当我们要在内存里读取打开一个文件时，如果文档编码方式和计算机内存默认读取文件的编码不同，或者我们打开文件时未设置正确的编码打开规则，则很有可能出现一堆乱码，无法正常读取文件内容，影响接下来的工作。

其实，这些情况早就有大佬想到了，所以开发了一个类似机器学习的第三方Python包，名为“ chardet ”，通过分析文件的内容，来推断文档的编码格式，然后返回一个报告，提示我们检测的文档最有可能的编码格式和语言。今天我们一起来学习一下，这个很有意思的小技巧。

一、文件打开模式

这里介绍一下待会涉及到的文件打开方式，一个是 “ r ” ,即只读模式，只对文档进行读取，不作修改；另一种是 “ rb ” ,即二进制模式，读取的文档以二进制字符串表示（一般文档、图片和视音频等文件为了便于储存、传输的需要，在硬盘上以二进制字符串的形式存在），更直观的说，就是把文件原封不动的从硬盘里读出来，不进行解码，难以阅读。

二、文件打开方法

　　文件打开一般会遇到以下两种情况

　1、已知文件保存的编码格式，则读取时，指定对应的编码格式即可正常读取。

首先我们先新建一个文档，命名为 “ word1.txt ”,以“ utf-8 ”编码格式保存，内容如下：

你好，明天！

　　文件打开一般方法如下：

f = open(file="filename",mode="r",encoding="utf-8")#文件名最好带后缀，编码格式按已知的文件编码填，此处以 utf-8 为例

实例如下：已知一个文件是以 utf-8 编码的，则打开时的编码也是 utf-8。