社区
Web 开发
帖子详情
关于爬虫中的URL问题!高手请教
leeking888
2010-10-20 10:18:08
像nutch这样的爬虫 你只要给它一个规则 它就能把站点的所有网页都访问出来 但是这个规则是怎么样定义的呢?
打个比方 http://www.163.com 这个站点 它能把
http://bbs.163.com
http://www.163.com/aaa/aaa.html....等等到
http://www.163.com/1/2/3/4/5/n/nnnn.html 都能挖出来
它的url是怎么样实现的呢?难道是一个一个地穷举配对访问吗??
...全文
232
8
打赏
收藏
关于爬虫中的URL问题!高手请教
像nutch这样的爬虫 你只要给它一个规则 它就能把站点的所有网页都访问出来 但是这个规则是怎么样定义的呢? 打个比方 http://www.163.com 这个站点 它能把 http://bbs.163.com http://www.163.com/aaa/aaa.html....等等到 http://www.163.com/1/2/3/4/5/n/nnnn.html 都能挖出来 它的url是怎么样实现的呢?难道是一个一个地穷举配对访问吗??
复制链接
扫一扫
分享
举报
写回复
配置赞助广告
用AI写文章
8 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
eggno8
2010-10-20
打赏
举报
回复
如果你站点上有www.yoursite.com/seegood?id=xxxxxx
这种带参页面,但是,没有任何一个页面有链接连到www.yoursite.com/seegood?id=518518这个页面或者是页面动态形式链接到(比如id=1这个被链接到,然后seegood页面动态的有get到的id+1的链接),那你这个产品页面是不会被爬虫爬到的,爬虫没事会去给你每个参数来个穷举访问么?
leeking888
2010-10-20
打赏
举报
回复
[Quote=引用 5 楼 eggno8 的回复:]
对网站爬行的过程就是一个对图的遍历过程。
每一个页面看作一个顶点,a页面上一个b页面的链接是看作将ab连通的边。对这个图的遍历,如果有某个或者某几个孤立的顶点,那么这个图无法简单的就遍历完。
假设网站www.163.com下有一个页面http://www.163.com/imalone.html
163.com整个站点上其他页面没有任何一个页面上有指向它的链接,那么作为图的顶点,这个页面是孤……
[/Quote]
那么有一些是需要参数的呢?或者是其他条件的才能进入的页面是不是无法爬虫访问到呢?
谁是莫默的呢
2010-10-20
打赏
举报
回复
学习下,期待高手
eggno8
2010-10-20
打赏
举报
回复
对网站爬行的过程就是一个对图的遍历过程。
每一个页面看作一个顶点,a页面上一个b页面的链接是看作将ab连通的边。对这个图的遍历,如果有某个或者某几个孤立的顶点,那么这个图无法简单的就遍历完。
假设网站www.163.com下有一个页面http://www.163.com/imalone.html
163.com整个站点上其他页面没有任何一个页面上有指向它的链接,那么作为图的顶点,这个页面是孤立的,爬虫是爬不到的~
leeking888
2010-10-20
打赏
举报
回复
[Quote=引用 2 楼 metsys 的回复:]
爬的是站点内容里包含的链接。
要是穷举配对,比算出彩票号码的可能性还小得多。
[/Quote]
谢谢 有点想像的可能了..
那么是在http://www.163.com这个页面中的所有 a 标签的链接和 form的链接吗??那要是使用js打开的url呢?
leeking888
2010-10-20
打赏
举报
回复
[Quote=引用 1 楼 yaoweijq 的回复:]
大概意思是这:
用java的httpclient或urlconnection先把
http://www.163.com这个网页的html代码弄出来,
再分析里面所有的链接,
按照一定规则找出来,
与爬过的所有链接进行比较,
如果爬过了并且没有更新,
就不管,
然后爬没爬过的,
依次类推就行了
[/Quote]
请问 按照你这个想法怎么样实现呢??
这网页的根本就没有个规则嘛
有的东西是我喜欢的 或者有的是用户名 时间什么的 如
http://www.163.com/news/
20101010
/aaa.html
http://www.163.com/news/
usernames/includechinese
/aaa.html
metsys
2010-10-20
打赏
举报
回复
爬的是站点内容里包含的链接。
要是穷举配对,比算出彩票号码的可能性还小得多。
yaoweijq
2010-10-20
打赏
举报
回复
大概意思是这:
用java的httpclient或urlconnection先把
http://www.163.com这个网页的html代码弄出来,
再分析里面所有的链接,
按照一定规则找出来,
与爬过的所有链接进行比较,
如果爬过了并且没有更新,
就不管,
然后爬没爬过的,
依次类推就行了
什么是网络
爬虫
又称为网页蜘蛛,网络机器人,在FOAF社区
中
间,更经常的称为网页追逐者,是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。网络
爬虫
可以根据指定的规则,从互联网上下载网页、图片、视频等内容,并抽取其
中
的有用信息进行处理。网络
爬虫
的工作流程包括获取网页源代码、解析网页内容、存储数据等步骤。根据其目的和工作方式的不同,网络
爬虫
可以分为多种类型。常见的网络
爬虫
包括通用
爬虫
、聚焦
爬虫
、增量式
爬虫
等。
网络
爬虫
解析
网络
爬虫
(也称为网页蜘蛛、网络机器人)是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。网络
爬虫
可以用于从网站提取数据,例如监测社交媒体平台上的活动,或者从网上收集新闻和文章。它们也可以用于搜索引擎,如Google和Bing,来抓取和索引网页,以便在用户进行搜索时提供结果。
URL
通常由多个部分组成,包括协议类型(如HTTP、HTTPS)、主机名(域名或IP地址)、路径(资源在主机上的位置)以及可选的查询参数(用于传递额外的信息)。通过
URL
,用户可以方便地访问和定位到特定的网络资源。
网络
爬虫
详解
网络
爬虫
(web crawler,又称为网页蜘蛛,网络机器人,在FOAF社区
中
间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。 产生背景 随着网络的迅速发展,万维网成为大量信息的载体,如何有效地提取并利用这些信息成为一个巨大的挑战。搜索引擎(Search Engine),例如传统的通用搜索引擎AltaVista,Yahoo!和Google等,作为一个辅助人们检索信息的工具成为用户访问万维网的入口和指南
网络
爬虫
产生背景和面临的
问题
网络
爬虫
(又称为网页蜘蛛,网络机器人,在FOFA社区
中
间,更经常的称为网页追逐者),是一种按照一定的规则,自动地抓取万维网信息的程序或者脚本。另外一些不常使用的名字还有蚂蚁、自动索引、模拟程序或者蠕虫。 产生背景 随着网络的迅速发展,万维网成为大量信息的载体,如何有效地提取并利用这些信息成为一个巨大的挑战。搜索引擎(Search Engine),例如传统的通用搜索引擎AltaVista,Yahoo!和Google等,作为一个辅助人们检索信息的工具成为用户访问万维网的入口和指南。但是,这些..
网络
爬虫
项目实战设计
本文还有配套的精品资源,点击获取 简介:网络
爬虫
,即网页蜘蛛或自动化索引器,是用于遍历Web并抓取信息的自动化程序。本文件“网络
爬虫
.rar”可能包含一个特定的
爬虫
程序,其工作原理涵盖种子
URL
获取、HTTP请求发送、HTML解析、链接提取、内容提取、存储与处理、遵循Robots协议、速率控制和反爬策略,以及分布式
爬虫
架构等步骤。此外,文件还可能包含一些反反爬策略和速率控制...
Web 开发
81,108
社区成员
341,721
社区内容
发帖
与我相关
我的任务
Web 开发
Java Web 开发
复制链接
扫一扫
分享
社区描述
Java Web 开发
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章