python2.7 urllib2 抓取房天下网页乱码

from跬步to千里 2016-09-06 04:30:16
在抓取房天下页面时,查看房天下的网页编码为gb2312:
<meta charset="gb2312">
使用代码如下:
#coding='utf-8'

import urllib2
url="http://esf.xian.fang.com/"
headers={"User-Agent":"Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1"}
req = urllib2.Request(url,headers=headers)
response= urllib2.urlopen(req)
html = response.read().decode('gb2312','ignore').encode('utf-8')
print html


打印结果为乱码,

请问是为什么?
...全文
465 5 打赏 收藏 转发到动态 举报
写回复
用AI写文章
5 条回复
切换为时间正序
请发表友善的回复…
发表回复
from跬步to千里 2016-09-13
  • 打赏
  • 举报
回复
引用 3 楼 mudye 的回复:
你用requests爬吧,它会帮你自动帮你处理页面编码问题
嗯,尝试过了,问题已解决,感谢~
from跬步to千里 2016-09-09
  • 打赏
  • 举报
回复
引用 3 楼 mudye 的回复:
你用requests爬吧,它会帮你自动帮你处理页面编码问题
好的,我去试试。谢谢~
mudye 2016-09-09
  • 打赏
  • 举报
回复
你用requests爬吧,它会帮你自动帮你处理页面编码问题
from跬步to千里 2016-09-08
  • 打赏
  • 举报
回复
引用 1 楼 ligengyong2010 的回复:
html = response.read().decode('gb2312','ignore').encode('utf-8') 先看看搜房网是不是gb2312编码的


网站的编码格式确实属于gb2312,使用转码后为什么还是乱码呢?
关山路遥 2016-09-06
  • 打赏
  • 举报
回复
html = response.read().decode('gb2312','ignore').encode('utf-8') 先看看搜房网是不是gb2312编码的

37,737

社区成员

发帖
与我相关
我的任务
社区描述
JavaScript,VBScript,AngleScript,ActionScript,Shell,Perl,Ruby,Lua,Tcl,Scala,MaxScript 等脚本语言交流。
社区管理员
  • 脚本语言(Perl/Python)社区
  • WuKongSecurity@BOB
加入社区
  • 近7日
  • 近30日
  • 至今

试试用AI创作助手写篇文章吧