帮忙,看不懂这个使用 LookBehind 的正则表达式。

CExplorer 2005-03-08 07:23:33
在一本书看到有这么一句正则表达式,目的是要在文本中找到表示网址的部分,并且要求在网址的最不能是(,.!?)等标点符号,它是这么写的:
http:// [-a-z0-9]+(\.[-a-z0-9]+)*\.(com|edu|info)\b(/[-a-z0-9_:\@&?=+,.!/~*'%\$]*(?<![.,?!]))?
这里有两点不明白,
第一:是表达式中的“\b”,这应该是“单词分隔点的意思”,为什么要在网站名和路径加上这个呢?它们中间不是用"\"分开吗?
第二:它使用了一个 LookBehind :(?<![.,?!])表示找到的网址的最后不能包括这四个标点符号。这就有一个问题,我们知道正则表达式是从前向后找并一个一个匹配的,如果它前半段表达式找到了一个包含句号的网址,但是又发现最后一个条件不符,它会再回过头去把找到的标点符号去掉吗,这可就是向前找了啊?
...全文
137 5 打赏 收藏 转发到动态 举报
写回复
用AI写文章
5 条回复
切换为时间正序
请发表友善的回复…
发表回复
CExplorer 2005-03-10
  • 打赏
  • 举报
回复
分端口?还是不懂噢,能不能再详细点?
syeerzy 2005-03-09
  • 打赏
  • 举报
回复
会向前找的。
速马 2005-03-09
  • 打赏
  • 举报
回复
\b表示单词边界(这里似乎就算去掉也可以..)
正则表达式引擎确实存在回逆操作
zyug 2005-03-09
  • 打赏
  • 举报
回复
\b是把端口分开的,不过,这个也写的太复杂了点吧
小写加字母?
CExplorer 2005-03-09
  • 打赏
  • 举报
回复
加上“\b”意味着在任何一个有 网站名 和 路径 的URL中,网站名和路径中间都有一个“单词分隔点”,换句话说,我们平常看到的URL在计算机看来,都是由两个单词组成的吗?

1,979

社区成员

发帖
与我相关
我的任务
社区描述
.NET技术 其他语言讨论
社区管理员
  • 其他语言社区
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧