社区
Java SE
帖子详情
如何抓取动态网页内容
fh2000
2009-12-17 10:01:58
请教下:有一个信息系统是需要用户名和密码才能进入的。进入后点超链接“http://192.168.0.1:8080/mis/show.jsp?id=1000”则显示一个统计表格。
现在要写一个程序,定时读取这个这个页面的内容。应如何做啊。现在我就卡在进入系统这个地方了。
如不通过权限认证的话,在地址栏中键入http://192.168.0.1:8080/mis/show.jsp?id=1000,内容为出错信息
注:权限认证的地方我改动不了
...全文
562
16
打赏
收藏
如何抓取动态网页内容
请教下:有一个信息系统是需要用户名和密码才能进入的。进入后点超链接“http://192.168.0.1:8080/mis/show.jsp?id=1000”则显示一个统计表格。 现在要写一个程序,定时读取这个这个页面的内容。应如何做啊。现在我就卡在进入系统这个地方了。 如不通过权限认证的话,在地址栏中键入http://192.168.0.1:8080/mis/show.jsp?id=1000,内容为出错信息 注:权限认证的地方我改动不了
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
16 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
wodagezi
2011-08-23
打赏
举报
回复
关注中学习下
求道者
2011-08-22
打赏
举报
回复
学习中。。。
softroad
2011-08-22
打赏
举报
回复
import java.io.BufferedInputStream; import java.io.InputStream; import java.io.InputStreamReader; import java.io.StringReader; import java.net.HttpURLConnection; import java.net.URL; import javax.xml.parsers.DocumentBuilder; import javax.xml.parsers.DocumentBuilderFactory; import org.w3c.dom.Document; import org.xml.sax.InputSource; public class Test { public static void main(String[] args) throws Exception{ String uri="http://www.p5w.net/stock/hydx/bkfx/index_160.xml"; String encoding="gb2312"; URL url = new URL(uri); System.getProperties().setProperty("http.proxyHost", "172.28.88.2"); System.getProperties().setProperty("http.proxyPort", "80"); HttpURLConnection conn = (HttpURLConnection) url.openConnection(); conn.connect(); InputStream in = new BufferedInputStream(conn.getInputStream()); InputStreamReader isr = new InputStreamReader(in,encoding); int str=-1; StringBuffer sb=new StringBuffer(); while((str=isr.read())!=-1) sb.append((char)str); DocumentBuilderFactory dbf=DocumentBuilderFactory.newInstance(); DocumentBuilder db = dbf.newDocumentBuilder(); isr.close(); Document doc=db.parse(new InputSource(new StringReader(sb.toString()))); //这生成一个doc类型 } }
自己format下。
yuyyu2016
2011-08-22
打赏
举报
回复
我的问题是,怎么获取js脚本动态输出内容
青春华航
2010-12-22
打赏
举报
回复
我也有这个问题,某位大侠也给我说要用HttpClient,我还没具体查它的用法,估计可用。
笑是我的药
2010-12-22
打赏
举报
回复
晕,也遇到这个问题
Aniao
2009-12-18
打赏
举报
回复
当然可以,说白了表单还不就是一次HTTP请求
fh2000
2009-12-18
打赏
举报
回复
我需要先使用用户名密码登陆,然后再填写表单,httpclient可以做到吗?
cqznz0
2009-12-18
打赏
举报
回复
关注 中
qx8668
2009-12-18
打赏
举报
回复
每天回帖即可获得10分可用分!
jonay
2009-12-17
打赏
举报
回复
关注
scdn_xx_q
2009-12-17
打赏
举报
回复
zzcwyu
2009-12-17
打赏
举报
回复
http://www.ibm.com/developerworks/cn/opensource/os-httpclient/
zha_zi
2009-12-17
打赏
举报
回复
用js写一个定时器,然后定时去访问这个链接
Aniao
2009-12-17
打赏
举报
回复
用httpclient,里面能够填表单
Python爬虫教程:使用Selenium
抓取
动态
网页内容
本文介绍了使用Python和Selenium
抓取
动态
网页内容
的方法。先阐述
动态
网页加载特点及传统爬虫工具的局限,接着介绍Selenium的原理、组件,然后说明安装配置步骤,通过
抓取
新闻和商品信息实例展示用法,还提及异常处理、等待机制和Headless模式等优化方法。
如何利用Java和Kotlin实现
动态
网页内容
抓取
本文介绍了
动态
网页内容
抓取
的技术背景,指出其面临JavaScript渲染、反爬虫机制、数据格式复杂等挑战,并给出使用HttpURLConnection等的解决方案。阐述了Java和Kotlin在
动态
网页
抓取
中的优势,还详细说明了实现步骤,包括环境准备、添加依赖、代码实现,最后进行代码解析与优化。
后端
抓取
动态
网页内容
本文围绕使用Selenium
抓取
动态
网页内容
展开。因启动Chrome实例耗资源,借鉴数据库连接池等思想创建WebDriver池。介绍了AI提供的使用WebDriver池方案,如用Apache Commons Pool或自定义池,还给出具体实现代码及注意事项,最终实现高效稳定的网页
抓取
。
Objective-C爬虫:实现
动态
网页内容
的
抓取
本文介绍了在互联网时代如何使用Objective-C开发爬虫程序,特别关注如何
抓取
动态
加载的
网页内容
,包括理解
动态
网页工作原理、选择CocoaHTTPEngine和Alamofire框架以及利用WebKit处理JavaScript渲染的页面。
Crawlee JavaScript渲染:处理
动态
网页内容
抓取
本文介绍如何使用Crawlee库解决JavaScript
动态
网页内容
抓取
难题,对比Playwright与Puppeteer的无头浏览器方案及元素等待机制,帮助开发者高效构建可靠的爬虫。
Java SE
62,621
社区成员
307,251
社区内容
发帖
与我相关
我的任务
Java SE
Java 2 Standard Edition
复制链接
扫一扫
分享
社区描述
Java 2 Standard Edition
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章