社区
Java SE
帖子详情
网络爬虫网页禁止
maoruiwen
2013-10-11 01:22:31
各位大侠:
我们老大让我写个爬虫弄一个网站的数据,但是我写好了,网站阻止爬虫,我该怎么解决。谢谢。跪求。
...全文
376
5
打赏
收藏
网络爬虫网页禁止
各位大侠: 我们老大让我写个爬虫弄一个网站的数据,但是我写好了,网站阻止爬虫,我该怎么解决。谢谢。跪求。
复制链接
扫一扫
分享
举报
写回复
配置赞助广告
用AI写文章
5 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
maoruiwen
2015-05-09
打赏
举报
回复
谢谢大家,最近一直忙。忘记csdn上面的帖子了。
maoruiwen
2013-10-11
打赏
举报
回复
应该怎么操作?
tony4geek
2013-10-11
打赏
举报
回复
这个估计很难了。。
maoruiwen
2013-10-11
打赏
举报
回复
urlconnection.addRequestProperty("User-Agent", "Mozilla/4.0 (compatible; MSIE 8.0; Windows NT 8.0)"); 这样可以么?
身胖不怕影子歪
2013-10-11
打赏
举报
回复
可否让爬虫模拟 浏览器来访问
爬虫
破解
网页
禁止
F12
本文介绍了一种解决
网页
禁止
使用F12开发者工具的方法。通过特定的按键组合,可以绕过这一限制,从而允许
爬虫
继续进行数据抓取。
使用
网络
爬虫
需要知道的准则——robots协议
本文介绍了robots协议的作用及如何规范
网络
爬虫
的行为,包括如何通过robots.txt文件指定哪些
网页
内容可以被爬取,哪些应该被
禁止
。
抓取
网页
报403错误,
爬虫
解决403
禁止
访问错误方法
本文提供了解决
网页
抓取遇到403
禁止
访问错误的方法,通过实例讲解如何使用Java的wget库和实用技巧来避免
爬虫
被封禁,适合
爬虫
开发者参考。
Robots
爬虫
协议
本文介绍了Robots Exclusion Standard,即
网络
爬虫
排除标准,解释了其作用是指导
爬虫
哪些
网页
可以抓取,哪些
禁止
。内容包括协议的形式——robots.txt文件,以及如何查看和解读该协议,以B站为例进行了具体说明。
python
网络
爬虫
与信息提取-01-requests
本文介绍了Python的Requests库,重点讲解了get和head方法的使用,并提到了Robots协议,即Robots Exclusion Standard,它规定了
网络
爬虫
可以抓取和
禁止
抓取的
网页
。通过阅读网站的robots.txt文件,
爬虫
开发者可以遵循标准,尊重网站的抓取规则。此外,还提及了一个爬取
网页
图片的案例。
Java SE
62,620
社区成员
307,251
社区内容
发帖
与我相关
我的任务
Java SE
Java 2 Standard Edition
复制链接
扫一扫
分享
社区描述
Java 2 Standard Edition
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章