社区
Java EE
帖子详情
heritrix中怎么设置只抓取文本数据,不抓取其它数据
dreamw
2009-12-13 10:04:18
比如不抓取图片、MP3、软件等等,我只要HTLM的文本数据。
现在heritrix什么链接都抓取下来,呵呵,请问在哪里有设置,我找不到。
...全文
353
6
打赏
收藏
heritrix中怎么设置只抓取文本数据,不抓取其它数据
比如不抓取图片、MP3、软件等等,我只要HTLM的文本数据。 现在heritrix什么链接都抓取下来,呵呵,请问在哪里有设置,我找不到。
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
6 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
dreamw
2009-12-14
打赏
举报
回复
。。。。。。。。。。。
当然是爬前过滤掉。呵呵,花这么多的时间去下载,又花时间去删除干嘛。
crazylaa
2009-12-14
打赏
举报
回复
噢,你是想抓取之前就过滤掉啊?那可能得改你抓文件得那个机器人程序了。
我以为你抓下来之后,把不想要得删掉呢
dreamw
2009-12-14
打赏
举报
回复
兄弟,怎么过滤,是要修改源代码,还是直接在WEB页面里配置?
dreamw
2009-12-14
打赏
举报
回复
呃尔陀佛,善哉善哉。。。我再等等,如果没有好的方法,我就结贴啦。。。
crazylaa
2009-12-14
打赏
举报
回复
[Quote=引用 4 楼 dreamw 的回复:]
。。。。。。。。。。。
当然是爬前过滤掉。呵呵,花这么多的时间去下载,又花时间去删除干嘛。
[/Quote]
啊哈,准备改程序吧。
crazylaa
2009-12-13
打赏
举报
回复
可以过滤掉不想要的标签。
基于
Heritrix
的增量
抓取
探讨了增量
抓取
在搜索引擎
中
的重要性及其实施难点,包括如何快速定位变化内容及判断网页实质变化,介绍了
Heritrix
实现这一功能的具体方法。
Heritrix
提高
抓取
效率的若干尝试
本文介绍了提高
Heritrix
抓取
效率的三种方法。一是利用ELFHash策略多线程
抓取
网页,通过修改代码使
Heritrix
开多个线程同时
抓取
,速度大幅提升;二是只
抓取
HTML对象,依据官方文档
设置
规则;三是取消Robots.txt的限制,修改相关函数以避免判断文件是否存在耗时。
heritrix
抓取
网页!
本文详细介绍
Heritrix
爬虫的安装配置流程及个性化
设置
,包括域名正则表达式匹配、文件类型限制与编码修改等内容,并分享了网页
抓取
经验与PageRank计算方法。
Heritrix
抓取
高级篇
本文介绍如何使用
Heritrix
进行高效网页
抓取
,包括定制
抓取
规则、解决单线程问题、调整内存限制、忽略robots.txt限制及配置选项等。
Heritrix
控制
抓取
速度
本文详细解析了
Heritrix
通过三个参数(delay-factor、max-delay-ms、min-delay-ms)控制爬虫
抓取
速度的方法,确保不干扰目标网站性能的同时实现高效的
数据
抓取
。
Java EE
67,535
社区成员
225,849
社区内容
发帖
与我相关
我的任务
Java EE
J2EE只是Java企业应用。我们需要一个跨J2SE/WEB/EJB的微容器,保护我们的业务核心组件(中间件),以延续它的生命力,而不是依赖J2SE/J2EE版本。
复制链接
扫一扫
分享
社区描述
J2EE只是Java企业应用。我们需要一个跨J2SE/WEB/EJB的微容器,保护我们的业务核心组件(中间件),以延续它的生命力,而不是依赖J2SE/J2EE版本。
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章