帮忙,看不懂这个使用 LookBehind 的正则表达式。
在一本书看到有这么一句正则表达式,目的是要在文本中找到表示网址的部分,并且要求在网址的最不能是(,.!?)等标点符号,它是这么写的:
http:// [-a-z0-9]+(\.[-a-z0-9]+)*\.(com|edu|info)\b(/[-a-z0-9_:\@&?=+,.!/~*'%\$]*(?<![.,?!]))?
这里有两点不明白,
第一:是表达式中的“\b”,这应该是“单词分隔点的意思”,为什么要在网站名和路径加上这个呢?它们中间不是用"\"分开吗?
第二:它使用了一个 LookBehind :(?<![.,?!])表示找到的网址的最后不能包括这四个标点符号。这就有一个问题,我们知道正则表达式是从前向后找并一个一个匹配的,如果它前半段表达式找到了一个包含句号的网址,但是又发现最后一个条件不符,它会再回过头去把找到的标点符号去掉吗,这可就是向前找了啊?