社区
Java SE
帖子详情
急!HtmlParser提取文本的问题,求教
sjc12
2010-05-12 09:28:34
我用HtmlParser在《开发自己的搜索引擎》基础上想提取
http://product.pconline.com.cn/notebook/lenovo/261638_detail.html 里的参数,把他们存到txt里,但那个类始终有问题,不知有没有牛人能够帮个忙?
...全文
221
4
打赏
收藏
急!HtmlParser提取文本的问题,求教
我用HtmlParser在《开发自己的搜索引擎》基础上想提取 http://product.pconline.com.cn/notebook/lenovo/261638_detail.html 里的参数,把他们存到txt里,但那个类始终有问题,不知有没有牛人能够帮个忙?
复制链接
扫一扫
分享
举报
写回复
配置赞助广告
用AI写文章
4 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
SelfMedicated
2012-03-13
打赏
举报
回复
楼主,http://blog.sina.com.cn/s/blog_3c6ecea90100iub1.html,希望对你有帮助
sjc12
2010-05-12
打赏
举报
回复
希望能帮我弄弄,比较急,我也是初学者,谢谢了
sjc12
2010-05-12
打赏
举报
回复
不好意思 就一个方法
public void extract() {
BufferedWriter bw = null;
//创建属性过滤器
NodeFilter attributes_filter = new AndFilter(new TagNameFilter("td"),
new HasAttributeFilter("WIDTH", "16%"));
//创建标题过滤器
NodeFilter title_filter = new AndFilter(new TagNameFilter("span"),
new HasAttributeFilter("class", "mark")
);
//提取标题信息
try {
//Parser根据过滤器返回所有满足过滤条件的节点
NodeList title_nodes = this.getParser().parse(title_filter);
//遍历所有节点
for (int i = 0; i < title_nodes.size(); i++) {
TableColumn node = (TableColumn) title_nodes.elementAt(i);
//用空格分割节点内胡html文本
String[] names = node.getChildrenHTML().split(" ");
StringBuffer title = new StringBuffer();
//创建要生成的文本文件名
for (int k = 0; k < names.length; k++) {
title.append(names[k]).append("-");
}
title.append((new Date()).getTime());
//创建要生成的文件
bw = new BufferedWriter(new FileWriter(new File(this
.getOutputPath()
+ title + ".txt")));
//获取当前提取页的完整URL地址
int startPos = getInuputFilePath().indexOf("mirror") + 6;
String url_seg = getInuputFilePath().substring(startPos);
url_seg = url_seg.replaceAll("\\\\", "/");
String url = "http:/" + url_seg;
System.out.println(url);
//写入当前提取页的完整URL地址
bw.write(url + NEWLINE);
bw.write(names[0] + NEWLINE);
bw.write(names[1] + NEWLINE);
}
} catch (Exception e) {
e.printStackTrace();
}
//重置Parser
this.getParser().reset();
try {
//Parser根据过滤器返回所有满足过滤条件的节点
NodeList attributes_nodes = this.getParser().parse(attributes_filter);
for (int i = 0; i < attributes_nodes.size(); i++) {
//Parser根据过滤器返回所有满足过滤条件的节点
TableColumn node = (TableColumn) attributes_nodes.elementAt(i);
String text = node.getChildrenHTML();
//提取属性名信息
String result = getProp(
"<TD width=\"16%\" class=\"#FCFCFC\">(.*)</TD>",
node.toHtml(), 1);
//属性里面包含有link标签的情况
if (result.indexOf("<") != -1)
result = getProp(
"<TD CLASS=btd WIDTH=198 BGCOLOR=\"#FCFCFC\"(.*)>(.*)</a></B></TD>",
node.toHtml(), 2);
//提取属性值信息
TableColumn nodeExt = (TableColumn) node.getNextSibling()
.getNextSibling();
bw.write(StringUtils.trim(result) + ":"
+ StringUtils.trim(nodeExt.getChildrenHTML()));
bw.newLine();
continue;
}
} catch (Exception e) {
e.printStackTrace();
}
amdgaming
2010-05-12
打赏
举报
回复
你说的清楚点啊? 比如把你类 发出来
你这样没头没脑 谁 能回答出你的问题啊
java html
提取
纯
文本
_利用
htmlparser
提取
网页纯
文本
[java]代码库package com.test;import org.
htmlparser
.Node;import org.
htmlparser
.NodeFilter;import org.
htmlparser
.Parser;import org.
htmlparser
.filters.TagNameFilter;import org.
htmlparser
.tags.TableTag;impor...
java
htmlparser
使用教程_java使用
htmlparser
提取
网页纯
文本
例子
package com.test;import org.
htmlparser
.Node;import org.
htmlparser
.NodeFilter;import org.
htmlparser
.Parser;import org.
htmlparser
.filters.TagNameFilter;import org.
htmlparser
.tags.TableTag;import org.htm...
使用
HtmlParser
提取
HTML
文本
块
听人介绍说
HtmlParser
(Java版本)在网页预处理方面做得不错,于是最近几日就研究了一番,虽说没有什么大的收获,但是难得能够让我一个对html标签一无所知的人,认识了其树状结构的玄机,并实现了通过文件目录
提取
html的标题,关键词,摘要信息,链接及其锚
文本
,以及主题型网页的正文部分。 以下仅就
提取
正文部分做个简单拙劣的介绍。在
提取
网页正文时,对于不同类型的网页应当采用不同的
提取
策略,...
爬虫实战:基于
HtmlParser
实现网页链接的
提取
通过
HtmlParser
过滤器实现网页链接的过滤与
提取
城市空气质量时空预测与污染源贡献度分析.zip
大气污染是影响公众健康与生态环境的重要
问题
,精准的空气质量时空预测与污染源贡献度量化是精准治污的关键支撑。针对现有研究多源融合不充分、时空关联刻画不足、预测与源解析割裂三方面缺陷,本文设计实现了城市空气质量时空预测与污染源贡献度分析系统,融合监测、气象、工业排放与交通四类数据,构建基于时空注意力的LSTM(STAM-LSTM)预测模型与基于正定矩阵因子分解(PMF)的源解析模型,形成数据融合-特征工程-预测-源解析-可视化闭环。 系统实现四类数据时空对齐与融合,构建时序与空间邻域特征,以普通克里金插值生成1km网格浓度场;STAM-LSTM引入时空注意力自适应学习站点间污染传输时变权重,以72小时输入预测未来24小时逐小时PM2.5浓度;PMF识别交通、工业、燃煤、扬尘与二次生成五个源因子,量化各源全年贡献度并分析时空演变。 实验表明:STAM-LSTM预测RMSE 24.6、MAE 17.8、R² 0.88,相对LSTM基线(30.2)提升18.5%;普通克里金插值误差8.9,优于反距离加权(11.4);源解析显示交通源28.4%、工业源23.1%、燃煤源19.6%为主要贡献源,冬季燃煤源升至27.3%、早高峰交通源达34.8%,下风向工业源贡献高出上风向8~12个百分点;减排情景显示交通源减排20%可使年均PM2.5下降5.7%,与源贡献度排序一致。 系统按五模块14组件实现,功能测试16项用例全部通过,为大气污染预警、源管控与减排政策制定提供了决策依据。 【课程报告内容】 摘要 第1章 绪论 第2章 相关技术与理论 第3章 系统需求分析 第4章 系统总体设计 第5章 系统详细设计与实现 第6章 系统测试与分析 第7章 总结与展望 参考文献 附件-实现指南
Java SE
62,620
社区成员
307,251
社区内容
发帖
与我相关
我的任务
Java SE
Java 2 Standard Edition
复制链接
扫一扫
分享
社区描述
Java 2 Standard Edition
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章