【请教】为什么百度爬虫请求UTF-8网站的网站URL里的中文参数是乱码?

anoxia 2010-09-13 03:18:08
如题:
网页request和response都设成了UTF-8

网页中有很多链接如下所示:
http://localhost:3255/keywords/%e9%85%b76.html
http://localhost:3255/keywords/%e6%b1%9f%e5%8d%97%e6%98%a5.html
http://localhost:3255/keywords/%e8%bf%aa%e5%a3%ab%e5%b0%bc.html
在站内统计时看到百度请求的地址是类似:
http://localhost:3255/keywords/閲戝北姣掗湼.html
http://localhost:3255/keywords/浼犲獟.html
因此记录关键字keywords被访问的情况时,就都成了乱码
查站内访问统计时间,出现乱码的时候都是百度爬虫(我日了)
Baiduspider+(+http://www.baidu.com/search/spider.htm)

目的:
希望在任何访问http://localhost:3255/keywords/******.html页面的时候将******记录,且保证记录的时候不是乱码。
PS:不要建议我屏蔽百度爬虫,谢谢!
...全文
348 10 打赏 收藏 转发到动态 举报
写回复
用AI写文章
10 条回复
切换为时间正序
请发表友善的回复…
发表回复
Dhoopu 2011-04-19
  • 打赏
  • 举报
回复
gb2312 ?
自然框架 2011-04-19
  • 打赏
  • 举报
回复
/%e9%85%b76.html
这个是编码

閲戝北姣掗湼.html
这个是解码解错了。
blue999ice 2011-04-18
  • 打赏
  • 举报
回复
网结构里尽量避免中文目录和中文文件名
子夜__ 2011-04-18
  • 打赏
  • 举报
回复
编码要统一
mianmian2323 2011-04-18
  • 打赏
  • 举报
回复
百度乱码很严重的问题。。。
Canny 2010-09-13
  • 打赏
  • 举报
回复
你如果选用中文 最好不要用url
lishuai1030 2010-09-13
  • 打赏
  • 举报
回复
嘿嘿 帮顶 应该是编码的问题了
ruiandli 2010-09-13
  • 打赏
  • 举报
回复
应该是编码的问题,最好把带有中文的URL进行下编码
wwfgu00ing 2010-09-13
  • 打赏
  • 举报
回复
是不是编码的问题
jshi123 2010-09-13
  • 打赏
  • 举报
回复
最好不要用中文url,如果是百度过来的请求,可以用Encoding.UTF8.GetString(Encoding.GetEncoding("gb2312").GetBytes(url))转换编码

62,272

社区成员

发帖
与我相关
我的任务
社区描述
.NET技术交流专区
javascript云原生 企业社区
社区管理员
  • ASP.NET
  • .Net开发者社区
  • R小R
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告

.NET 社区是一个围绕开源 .NET 的开放、热情、创新、包容的技术社区。社区致力于为广大 .NET 爱好者提供一个良好的知识共享、协同互助的 .NET 技术交流环境。我们尊重不同意见,支持健康理性的辩论和互动,反对歧视和攻击。

希望和大家一起共同营造一个活跃、友好的社区氛围。

试试用AI创作助手写篇文章吧