【求助】正则表达式匹配的小问题,急!急!急!

sinat_35040668 2016-05-18 04:55:35
最近在写一个微博爬虫,把爬下来的内容存在了page1.txt文档里,其中有一段内容是这样的
<div class=\"WB_from S_txt2\">\n                                <a name=3974702474735730 target=\"_blank\" href=\"\/1195054531\/DvllRjRYK?from=page_1002061195054531_profile&wvr=6&mod=weibotime\" title=\"2016-05-13 15:59\" date=\"1463126379000\" class=\"S_txt2\" node-type=\"feed_list_item_date\" suda-data=\"key=tblog_home_new&value=feed_time:3974702474735730\"> 5月13日 15:59<\/a> 来自 <a class=\"S_txt2\" suda-uatrack=\"key=profile_feed&value=pubfrom_guest\" action-type=\"app_source\" target=\"_blank\" href=\"http:\/\/weibo.com\/\" rel=\"nofollow\">微博 weibo.com<\/a>            <\/div>\n            <div class=\"WB_text W_f14\" node-type=\"feed_list_content\" nick-name=\"博物杂志\">\n                                                                                我们搞了个“《博物》礼品卡”,这个卡适合送礼。你把卡送给朋友后,他一激活,就会免费自动收到12个月的博物杂志。卡本身也挺好看的,是吧。点 <a suda-uatrack=\"key=minicard&value=pagelink_minicard_click\" title=\"网页链接\" href=\"http:\/\/t.cn\/RqdOJWu\" action-type=\"feed_list_url\" target=\"_blank\" ><i class=\"W_ficon ficon_cd_link\">O<\/i>网页链接<\/a> 购买                            <\/div>\n

我的匹配表达式是这样的
#coding=utf-8
import re

fw = open('page1.txt')
s= fw.read()
fw.close()
pattern = re.compile(r'<div class=\\"WB_from S_txt2\\">.*?title=\\"(.*?)\\".*?<div class=\\"WB_text W_f14\\" node-type=\\"feed_list_content\\" nick-name=\\".*?\\">\\n(.*?)<\\/div>',re.DOTALL)
result = re.findall(pattern,s)
for item in result:
print item[0],item[1]

运行 没有报错,程序会卡在findall的地方。但是如果把上面那段复制到一个新的txt文档里,就可以匹配了,这是为什么?
...全文
126 2 打赏 收藏 转发到动态 举报
写回复
用AI写文章
2 条回复
切换为时间正序
请发表友善的回复…
发表回复
关山路遥 2016-05-20
  • 打赏
  • 举报
回复
网页下载下来了吗
屎克螂 2016-05-20
  • 打赏
  • 举报
回复
应该是文件内容不一致的问题,你可以用文件对比工具查看下 或者 将内容放进数组 打印这个数组出来(\n \t等字符能查看到)

37,737

社区成员

发帖
与我相关
我的任务
社区描述
JavaScript,VBScript,AngleScript,ActionScript,Shell,Perl,Ruby,Lua,Tcl,Scala,MaxScript 等脚本语言交流。
社区管理员
  • 脚本语言(Perl/Python)社区
  • WuKongSecurity@BOB
加入社区
  • 近7日
  • 近30日
  • 至今

试试用AI创作助手写篇文章吧