社区
Java SE
帖子详情
如何抓取动态网页内容
fh2000
2009-12-17 10:01:58
请教下:有一个信息系统是需要用户名和密码才能进入的。进入后点超链接“http://192.168.0.1:8080/mis/show.jsp?id=1000”则显示一个统计表格。
现在要写一个程序,定时读取这个这个页面的内容。应如何做啊。现在我就卡在进入系统这个地方了。
如不通过权限认证的话,在地址栏中键入http://192.168.0.1:8080/mis/show.jsp?id=1000,内容为出错信息
注:权限认证的地方我改动不了
...全文
567
16
打赏
收藏
如何抓取动态网页内容
请教下:有一个信息系统是需要用户名和密码才能进入的。进入后点超链接“http://192.168.0.1:8080/mis/show.jsp?id=1000”则显示一个统计表格。 现在要写一个程序,定时读取这个这个页面的内容。应如何做啊。现在我就卡在进入系统这个地方了。 如不通过权限认证的话,在地址栏中键入http://192.168.0.1:8080/mis/show.jsp?id=1000,内容为出错信息 注:权限认证的地方我改动不了
复制链接
扫一扫
分享
举报
写回复
配置赞助广告
用AI写文章
16 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
wodagezi
2011-08-23
打赏
举报
回复
关注中学习下
求道者
2011-08-22
打赏
举报
回复
学习中。。。
softroad
2011-08-22
打赏
举报
回复
import java.io.BufferedInputStream; import java.io.InputStream; import java.io.InputStreamReader; import java.io.StringReader; import java.net.HttpURLConnection; import java.net.URL; import javax.xml.parsers.DocumentBuilder; import javax.xml.parsers.DocumentBuilderFactory; import org.w3c.dom.Document; import org.xml.sax.InputSource; public class Test { public static void main(String[] args) throws Exception{ String uri="http://www.p5w.net/stock/hydx/bkfx/index_160.xml"; String encoding="gb2312"; URL url = new URL(uri); System.getProperties().setProperty("http.proxyHost", "172.28.88.2"); System.getProperties().setProperty("http.proxyPort", "80"); HttpURLConnection conn = (HttpURLConnection) url.openConnection(); conn.connect(); InputStream in = new BufferedInputStream(conn.getInputStream()); InputStreamReader isr = new InputStreamReader(in,encoding); int str=-1; StringBuffer sb=new StringBuffer(); while((str=isr.read())!=-1) sb.append((char)str); DocumentBuilderFactory dbf=DocumentBuilderFactory.newInstance(); DocumentBuilder db = dbf.newDocumentBuilder(); isr.close(); Document doc=db.parse(new InputSource(new StringReader(sb.toString()))); //这生成一个doc类型 } }
自己format下。
yuyyu2016
2011-08-22
打赏
举报
回复
我的问题是,怎么获取js脚本动态输出内容
青春华航
2010-12-22
打赏
举报
回复
我也有这个问题,某位大侠也给我说要用HttpClient,我还没具体查它的用法,估计可用。
笑是我的药
2010-12-22
打赏
举报
回复
晕,也遇到这个问题
Aniao
2009-12-18
打赏
举报
回复
当然可以,说白了表单还不就是一次HTTP请求
fh2000
2009-12-18
打赏
举报
回复
我需要先使用用户名密码登陆,然后再填写表单,httpclient可以做到吗?
cqznz0
2009-12-18
打赏
举报
回复
关注 中
qx8668
2009-12-18
打赏
举报
回复
每天回帖即可获得10分可用分!
jonay
2009-12-17
打赏
举报
回复
关注
scdn_xx_q
2009-12-17
打赏
举报
回复
zzcwyu
2009-12-17
打赏
举报
回复
http://www.ibm.com/developerworks/cn/opensource/os-httpclient/
zha_zi
2009-12-17
打赏
举报
回复
用js写一个定时器,然后定时去访问这个链接
Aniao
2009-12-17
打赏
举报
回复
用httpclient,里面能够填表单
Python爬虫教程:使用Selenium
抓取
动态
网页内容
Selenium是一个开源的自动化测试工具,用于Web应用的自动化操作。Selenium支持多种编程语言,包括Python、Java、C#等。它能够模拟浏览器中的各种操作,如点击、输入、滚动、
抓取
页面内容等。通过使用Selenium,爬虫可以在实际的浏览器环境中运行,从而获取
动态
加载的数据。在本文中,我们详细介绍了如何使用Selenium
抓取
动态
加载的
网页内容
。通过模拟浏览器的行为,Selenium能够处理JavaScript渲染的页面,
抓取
动态
加载的内容。
如何利用Java和Kotlin实现
动态
网页内容
抓取
动态
网页内容
通常是通过JavaScript
动态
加载的,传统的静态网页
抓取
工具(如简单的HTTP请求)无法直接获取这些内容。:Java和Kotlin编写的程序可以在多种操作系统上运行,具有良好的跨平台性。:通过使用代理服务器,可以隐藏爬虫的真实IP地址,避免被目标网站封禁。:Java和Kotlin的运行效率高,能够处理大规模的数据
抓取
任务。以下是完整的Java和Kotlin实现代码,包含代理服务器的配置。二、Java和Kotlin在
动态
网页
抓取
中的优势。:Java和Kotlin提供了大量的库和框架,如。
后端
抓取
动态
网页内容
selenium本质上是启动一个chrome浏览器来实现的模拟正常发送请求 但是由于启动一个chrome实例十分的消耗资源,我们肯定不能在生产环境频繁的创建chrome实例,这会拖慢整个系统的运行 我们可以参考数据库连接池,线程池的思想,创建一批chrome并复用这些chrome实例。
Objective-C爬虫:实现
动态
网页内容
的
抓取
在当今的互联网时代,数据的获取和分析变得日益重要。无论是进行市场研究、用户行为分析还是产品开发,获取大量数据都是不可或缺的一环。然而,很多有价值的信息都隐藏在
动态
加载的网页中,这些网页通过JavaScript
动态
生成内容,传统的爬虫技术往往难以应对。本文将介绍如何使用Objective-C开发一个爬虫程序,实现对这类
动态
网页内容
的
抓取
。
Crawlee JavaScript渲染:处理
动态
网页内容
抓取
在现代网页开发中,许多网站采用JavaScript
动态
加载内容,这给传统的网页
抓取
工具带来了挑战。Crawlee作为一款强大的Node.js网页
抓取
和浏览器自动化库,提供了全面的JavaScript渲染解决方案,帮助开发者轻松应对
动态
网页内容
的
抓取
需求。 ##
动态
网页
抓取
的挑战 传统的网页
抓取
工具如CheerioCrawler只能获取服务器返回的原始HTML内容,无法处理由JavaScrip...
Java SE
62,620
社区成员
307,251
社区内容
发帖
与我相关
我的任务
Java SE
Java 2 Standard Edition
复制链接
扫一扫
分享
社区描述
Java 2 Standard Edition
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章