python解析pdf文件,提取文本排序输出

Grese2016 2016-10-10 07:01:11
python解析pdf文件,采用pdfminer获取出来的文本没有按顺序排列,用java的pdfbox包则有一个属性设置排序提取文本,代码如下:
//PDFTextStripper来提取文本
PDFTextStripper stripper = null;
stripper = new PDFTextStripper();
//设置是否排序,这里排序是按行从上到下,从左到右进行提取Text
stripper.setSortByPosition(sort);

sort = True时,提取出来的是按行读取的文本内容,从上到下,从左到右的顺序。

请文python有没有这样的第三方库,可以类似java的pdfbox第三包的解析功能?
...全文
494 回复 打赏 收藏 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

37,737

社区成员

发帖
与我相关
我的任务
社区描述
JavaScript,VBScript,AngleScript,ActionScript,Shell,Perl,Ruby,Lua,Tcl,Scala,MaxScript 等脚本语言交流。
社区管理员
  • 脚本语言(Perl/Python)社区
  • WuKongSecurity@BOB
加入社区
  • 近7日
  • 近30日
  • 至今

试试用AI创作助手写篇文章吧