社区
C#
帖子详情
难的来了,用正则表达式匹配网页中所有连接
qinamao
2006-09-29 05:29:13
要求匹配所有 能用鼠标点击的连接
...全文
426
12
打赏
收藏
难的来了,用正则表达式匹配网页中所有连接
要求匹配所有 能用鼠标点击的连接
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
12 条
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
2sanshi
2006-10-31
打赏
举报
回复
学习
qinamao
2006-09-30
打赏
举报
回复
感谢gzdiablo() 以后向你请教,还请多多帮助!
gzdiablo
2006-09-30
打赏
举报
回复
这个就是获取A标签了
你用这个
<(" + 标签名称+ ")[^>]*>(\s*|.)*</\1>
这个是获取需要关闭标签的标签 即 <XXX></XXX> 的标签 不过不支持嵌套支持嵌套的不太好写
实际是
<(a)[^>]*>(\s*|.)*</\1>
这样就能获取全部A标签 其他标签同理
如果有多种标签就这样写 (a|XXX|xxx)
如果是不需要关闭标签的标签 即 <XXX >的 如<img src="xxx" height="xxx" ...>
就简单多了
<(" + 标签名称+ ")[^>]*>
用这个就行了
qinamao
2006-09-30
打赏
举报
回复
gzdiablo() :
21312sfdr<a href="XXXXXX">xxxxxx</a>asdf
结果是返回包含所有连接标记的:
<a href="XXXXXX">xxxxxx</a>
我想获取上述匹配呢?
gzdiablo
2006-09-29
打赏
举报
回复
(?<=((?:src|href|url|background)(?:\s*=\s*(["']?))))(?:[^\s"'>]*)
用这个可以找出除FLASH几乎所有可能存在的连接
FLASH的连接是写在Value里面的
上面这条语句
假设<a href="XXXXXX">xxxxxx</a>
match获取的是 连接内容即 XXXXXX
group 1 获取的是 前缀 href=" 注:上面语句可以分辨是 双引号 单引号 空
group 2 获取的是 包围符号 即 双引号 单引号 空
如果你想获取全部连接内容包括前缀用下面这句
((?:src|href|url|background)(?:\s*=\s*(["']?)))(?:[^\s"'>]*)[\s"']?
match获取的是 全部连接内容即 href="XXXXXX"
group 1 获取的是 前缀 href=" 注:上面语句可以分辨是 双引号 单引号 空
group 2 获取的是 包围符号 即 双引号 单引号 空
cancerser
2006-09-29
打赏
举报
回复
大概是这样
string a="<a href='ftp://topic.csdn.net/t/\'<t";
Regex rex=new Regex("(http|ftp)://.+(?='|\")");
a=rex.Match(a).Value;
//(http|ftp)这个自己扩充如(http|ftp|udp)
一般是以'或"结尾 如有其他也自己扩充
wshuangminlg
2006-09-29
打赏
举报
回复
帮LZ顶
petshop4
2006-09-29
打赏
举报
回复
+号多余了 不要
<(?<sun>(a|iframe)).*?>.*?</?\k<sun>.*?>
petshop4
2006-09-29
打赏
举报
回复
<(?<sun>(a|iframe)+).*?>.*?</?\k<sun>.*?>
里面只写了A和IFRAME的 别的自己添加吧
qinamao
2006-09-29
打赏
举报
回复
基本的如:<a href=*>**</a>
<iframe src=*><iframe>
<a href=# onclick=*>*</a>
等
股神
2006-09-29
打赏
举报
回复
up。。。
petshop4
2006-09-29
打赏
举报
回复
请把所有能被鼠标点击的例子都举出来
而不是让别人帮你做功课
Python爬虫之使用
正则表达式匹配
网页
内容
Python爬虫,除了使用大家广为使用的scrapy架构外,还有很多包能够实现一些简单的爬虫,如BeautifulSoup、Urllib,在使用这些包时,有的网络因为比较复杂,比较
难
以找到自己想要的代码,在这个时候,如果能够使用正则表达式,将能很方便地爬取到自己想要的数据。 何为正则表达式 正则表达式是一种描述字符串排列的一种语法规则,通过该规则可以在一个大字符串
中
匹配出满足规则的子字符串。简单来...
python提取
网页
的特定内容(正则表达式实现)
关于正则表达式参考正则表达式 python可以很方便地抓取
网页
并过滤
网页
的内容,那么,如何从如下的
网页
中
提取csdn文章的标题“《unix网络编程(卷1)源代码的使用方法》”。 window.quickReplyflag = true; 《unix网络编程(卷1)》源代码的使
Python网络爬虫案例实战:解析
网页
:正则表达式解析
网页
正则表达式并不是Python的一部分。正则表达式是用于处理字符串的强大工具,拥有自己独特的语法以及一个独立的处理引擎,效率上可能不如str自带的方法,但功能十分强大。得益于这一点,在提供了正则表达式的语言
中
,正则表达式的语法都是一样的,区别只在于不同的编程语言实现支持的语法数量不同;但不用担心,不被支持的语法通常是不常用的部分。图5-1展示了使用正则表达式进行匹配的流程。正则表达式的大致匹配过程是:依次拿出表达式和文本
中
的字符比较,如果每一个字符都能匹配,则匹配成功;一旦有匹配不成功的字符则匹配失败。
正则表达式匹配
网页
标签内容
推荐一个在线正则表示试测试网站:http://tool.oschina.net/regex/# 1,得到
网页
上的链接地址: string matchString = @"<a[^>]+href=\s*(?:'(?<href>[^']+)'|""(?<href>[^""]+)""|(?<href>[^>\s]+))
正则表达式在
网页
文件
中
文本识别匹配的应用
写在前面 2021年第一篇博客。 博主在编程学习过程
中
,如果说有哪个问题学起来感觉最费劲,那就一定是正则表达式了,其灵活的表达式还有各种限定、扩展让人无比头大,而博主工作
中
用的正则表达式很少,所以总是记不住。 趁着最近在看《Python核心编程》这本书,第一章就是正则表达式,又系统的学习了一遍,虽然还是一知半解,但稍微又理解了那么一点点。顺便拿个例子来练练手,记录一下思路,忘记时再过来翻翻。 编程语言:Python3.7 编译器:Spyder 业务需求 博主的目标是从一个
网页
文档
中
提取一堆经纬度数据,先
C#
111,129
社区成员
642,533
社区内容
发帖
与我相关
我的任务
C#
.NET技术 C#
复制链接
扫一扫
分享
社区描述
.NET技术 C#
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
让您成为最强悍的C#开发者
试试用AI创作助手写篇文章吧
+ 用AI写文章