python如何提取PDF文本

(*-*)浩
發布: 2019-07-09 10:21:49
原創
6036 人瀏覽過

本文為你展示,如何用Python把許多PDF文件的文本內容批量提取出來.

python如何提取PDF文本

#首先,我們讀入一些模組,以進行文件操作。 (推薦學習:Python影片教學

import glob
import os
登入後複製

示範目錄下,有​​兩個資料夾,分別是pdf和newpdf。

我們指定 pdf 檔案所在路徑為其中的pdf資料夾。

pdf_path = "pdf/"
登入後複製

我們希望獲得所有 pdf 檔案的路徑。用glob,一條指令就能完成這個功能。

pdfs = glob.glob("{}/*.pdf".format(pdf_path))
登入後複製

看看我們獲得的 pdf 檔案路徑是否正確。

pdfs
登入後複製
['pdf/复杂系统仿真的微博客虚假信息扩散模型研究.pdf',
'pdf/面向影子分析的社交媒体竞争情报搜集.pdf',
'pdf/面向人机协同的移动互联网政务门户探析.pdf']
登入後複製

經驗證。準確無誤。

下面我們利用 pdfminer 來從 pdf 檔中抽取內容。我們需要從輔助 Python 檔案 pdf_extractor.py 中讀入函數 extract_pdf_content。

from pdf_extractor import extract_pdf_content
登入後複製

用這個函數,我們嘗試從 pdf 檔案清單中的第一篇文章裡,抽取內容,並且把文字放在 content 變數裡。

content = extract_pdf_content(pdfs[0])
登入後複製

顯然,內容擷取並不完美,頁首頁尾等資訊都混了進來。不過,對於我們許多文本分析的用途來說,這無關緊要。

更多Python相關技術文章,請造訪Python教學欄位學習!

以上是python如何提取PDF文本的詳細內容。更多資訊請關注PHP中文網其他相關文章!

相關標籤:
來源:php.cn
本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn
作者最新文章
熱門教學
更多>
最新下載
更多>
網站特效
網站源碼
網站素材
前端模板
關於我們 免責聲明 Sitemap
PHP中文網:公益線上PHP培訓,幫助PHP學習者快速成長!