지역 사회

배우다

도구 라이브러리

AI 도구

여가

한국어

文本处理 - 求教使用python库提取pdf的方法？

怪我咯 2017-04-18 10:24:58

0

1

606

使用过pypdf 对英文pdf文档处理比较简单，但是对中文的支持好像不太好

使用过textract 看文档支持的格式比较多方法也比较简单，但是老师出错

-- coding: utf-8 --

import textract
import pyPdf
import pdf2text
import pdfminer
import chardet

text = textract.process("F:ll.pdf",method = 'pdfminer')
print text

这个出错是编码问题

-- coding: utf-8 --

import textract
import pyPdf
import pdfminer
import chardet

text = textract.process("F:ll.pdf",method = 'pdfminer')
print text

这个出错类型不清楚

少使用了pdf2text库，但是出错情况好像不一样。

pdfminer库还没看过，看着好像麻烦一些，求解一下解析提取中文的pdf的方法。谢谢

怪我咯

走同样的路，发现不同的人生

모든 응답(1)

PHPzhong2017-04-18 10:26:58 1층

이전에 사용했던 pdfminerpip install pdfminer

으아악

좋다 +0

답글 추가

인기 주제

더>

인기 기사

인기 튜토리얼

더>

관련 튜토리얼

인기 추천

최신 강좌

최신 다운로드

더>

웹 효과

웹사이트 소스 코드

웹사이트 자료

프론트엔드 템플릿