返回顶部

收藏

两种python 判断网页编码的方法

更多

这段时间在用python处理网页抓取这块,互联网很多网页的编码格式都不一样,大体上是GBK,GB2312,UTF-8几种。我们在获取网页的的数据后,先要对网页的编码进行判断,才能把抓取的内容的编码统一转换为我们能够处理的编码。比如beautiful soup内部的编码就是unicode的编码。

下面介绍两种python 判断网页编码的方法:

import urllib
f = urllib.urlopen('http://outofmemory.cn/').info()

print f.getparam('charset')

2 import chardet 你需要安装一下chardet第3方模块判断编码

data = urllib.urlopen('http://outofmemory.cn/').read()

print chardet.detect(data)

希望对你有帮助!

标签:python,爬虫,编码

收藏

1人收藏

支持

0

反对

0