首頁 後端開發 Python教學 python爬蟲實作教學轉換成 PDF 電子書

python爬蟲實作教學轉換成 PDF 電子書

Feb 21, 2017 pm 05:06 PM

本文給大家分享的是使用python爬蟲實作把《廖雪峰的Python 教學》轉換成PDF的方法和程式碼,有需要的小夥伴可以參考下

寫爬蟲似乎沒有比用Python 更合適了,Python 社區提供的爬蟲工具多得讓你眼花繚亂,各種拿來就可以直接用的library 分分鐘就可以寫出一個爬蟲出來,今天就琢磨著寫一個爬蟲,將廖雪峰的Python 教程爬下來做成PDF 電子書方便大家離線閱讀。

開始寫爬蟲前,我們先來分析一下該網站1的頁面結構,網頁的左側是教程的目錄大綱,每個URL 對應到右邊的一篇文章,右側上方是文章的標題,中間是文章的正文部分,正文內容是我們關心的重點,我們要爬的資料就是所有網頁的正文部分,下方是使用者的評論區,留言區對我們沒什麼用,所以可以忽略它。

python爬虫实现教程转换成 PDF 电子书

工具準備

弄清楚了網站的基本結構後就可以開始準備爬蟲所依賴的工具包了。 requests、beautifulsoup 是爬蟲兩大神器,reuqests 用於網路請求,beautifusoup 用於操作 html 資料。有了這兩把梭子,幹起活來利索,scrapy 這樣的爬蟲框架我們就不用了,小程式派上它有點殺雞用牛刀的意思。此外,既然是把 html 檔案轉為 pdf,那麼也要有相應的庫支持, wkhtmltopdf 就是一個非常好的工具,它可以用適用於多平台的 html 到 pdf 的轉換,pdfkit 是 wkhtmltopdf 的Python封裝包。首先安裝好下面的依賴包,

接著安裝wkhtmltopdf

#
pip install requests
pip install beautifulsoup
pip install pdfkit
登入後複製

安裝wkhtmltopdf

## Windows平台直接在wkhtmltopdf 官網2下載穩定版的進行安裝,安裝完成之後把程式的執行路徑加入到系統環境$PATH 變數中,否則pdfkit 找不到wkhtmltopdf 就出現錯誤「No wkhtmltopdf executable found」。 Ubuntu 和CentOS 可以直接用命令列進行安裝

python爬虫实现教程转换成 PDF 电子书

$ sudo apt-get install wkhtmltopdf # ubuntu
$ sudo yum intsall wkhtmltopdf   # centos
登入後複製

#爬蟲實作

一切準備就緒後就可以上程式碼了,不過寫程式碼之前還是先整理一下思緒。程式的目的是要把所有 URL 對應的 html 正文部分儲存到本機,然後利用 pdfkit 把這些檔案轉換成一個 pdf 檔。我們把任務拆分一下,首先是把某一個 URL 對應的 html 正文儲存到本地,然後找到所有的 URL 執行相同的操作。 用 Chrome 瀏覽器找到頁面正文部分的標籤,按 F12 找到正文對應的 p 標籤: 

,該 p 是網頁的正文內容。用 requests 把整個頁面載入到本機後,就可以使用 beautifulsoup 運算 HTML 的 dom 元素 來擷取正文內容了。 python爬虫实现教程转换成 PDF 电子书

具體的實作程式碼如下:用 soup.find_all 函數找到正文標籤,然後把正文部分的內容儲存到 a.html 檔案中。

def parse_url_to_html(url):
  response = requests.get(url)
  soup = BeautifulSoup(response.content, "html5lib")
  body = soup.find_all(class_="x-wiki-content")[0]
  html = str(body)
  with open("a.html", 'wb') as f:
    f.write(html)
登入後複製

第二步就是把頁面左邊所有 URL 解析出來。採用相同的方式,找到左側選單標籤 

    #特定程式碼實作邏輯:因為頁面上有兩個uk-nav uk-nav-side的class 屬性,而真正的目錄清單是第二個。所有的 url 獲取了,url 轉 html 的函數在第一步也寫好了。 python爬虫实现教程转换成 PDF 电子书

    def get_url_list():
      """
      获取所有URL目录列表
      """
      response = requests.get("http://www.liaoxuefeng.com/wiki/0014316089557264a6b348958f449949df42a6d3a2e542c000")
      soup = BeautifulSoup(response.content, "html5lib")
      menu_tag = soup.find_all(class_="uk-nav uk-nav-side")[1]
      urls = []
      for li in menu_tag.find_all("li"):
        url = "http://www.liaoxuefeng.com" + li.a.get('href')
        urls.append(url)
      return urls
    登入後複製

    最後一步就是把 html 轉換成pdf檔了。轉換成pdf 檔非常簡單,因為pdfkit 把所有的邏輯都封裝好了,你只需要呼叫函數pdfkit.from_file

    ###
    def save_pdf(htmls):
      """
      把所有html文件转换成pdf文件
      """
      options = {
        'page-size': 'Letter',
        'encoding': "UTF-8",
        'custom-header': [
          ('Accept-Encoding', 'gzip')
        ]
      }
      pdfkit.from_file(htmls, file_name, options=options)
    登入後複製
    #########執行save_pdf 函數,電子書pdf 檔案就生成了,效果圖:##################總結##########總共程式碼量加起來不到50行,不過,而且慢,其實上面給出的程式碼省略了一些細節,例如,如何取得文章的標題,正文內容的img 標籤使用的是相對路徑,如果要想在pdf 中正常顯示圖片就需要將相對路徑改為絕對路徑,還有儲存下來的html 臨時檔案都要刪除###

    更多python爬蟲實作教學轉換成 PDF 電子書相關文章請關注PHP中文網!

本網站聲明
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn

熱AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智慧驅動的應用程序,用於創建逼真的裸體照片

AI Clothes Remover

AI Clothes Remover

用於從照片中去除衣服的線上人工智慧工具。

Undress AI Tool

Undress AI Tool

免費脫衣圖片

Clothoff.io

Clothoff.io

AI脫衣器

Video Face Swap

Video Face Swap

使用我們完全免費的人工智慧換臉工具,輕鬆在任何影片中換臉!

熱工具

記事本++7.3.1

記事本++7.3.1

好用且免費的程式碼編輯器

SublimeText3漢化版

SublimeText3漢化版

中文版,非常好用

禪工作室 13.0.1

禪工作室 13.0.1

強大的PHP整合開發環境

Dreamweaver CS6

Dreamweaver CS6

視覺化網頁開發工具

SublimeText3 Mac版

SublimeText3 Mac版

神級程式碼編輯軟體(SublimeText3)

如何解決Linux終端中查看Python版本時遇到的權限問題? 如何解決Linux終端中查看Python版本時遇到的權限問題? Apr 01, 2025 pm 05:09 PM

Linux終端中查看Python版本時遇到權限問題的解決方法當你在Linux終端中嘗試查看Python的版本時,輸入python...

如何在使用 Fiddler Everywhere 進行中間人讀取時避免被瀏覽器檢測到? 如何在使用 Fiddler Everywhere 進行中間人讀取時避免被瀏覽器檢測到? Apr 02, 2025 am 07:15 AM

使用FiddlerEverywhere進行中間人讀取時如何避免被檢測到當你使用FiddlerEverywhere...

在Python中如何高效地將一個DataFrame的整列複製到另一個結構不同的DataFrame中? 在Python中如何高效地將一個DataFrame的整列複製到另一個結構不同的DataFrame中? Apr 01, 2025 pm 11:15 PM

在使用Python的pandas庫時,如何在兩個結構不同的DataFrame之間進行整列複製是一個常見的問題。假設我們有兩個Dat...

Uvicorn是如何在沒有serve_forever()的情況下持續監聽HTTP請求的? Uvicorn是如何在沒有serve_forever()的情況下持續監聽HTTP請求的? Apr 01, 2025 pm 10:51 PM

Uvicorn是如何持續監聽HTTP請求的? Uvicorn是一個基於ASGI的輕量級Web服務器,其核心功能之一便是監聽HTTP請求並進�...

如何在10小時內通過項目和問題驅動的方式教計算機小白編程基礎? 如何在10小時內通過項目和問題驅動的方式教計算機小白編程基礎? Apr 02, 2025 am 07:18 AM

如何在10小時內教計算機小白編程基礎?如果你只有10個小時來教計算機小白一些編程知識,你會選擇教些什麼�...

在Linux終端中使用python --version命令時如何解決權限問題? 在Linux終端中使用python --version命令時如何解決權限問題? Apr 02, 2025 am 06:36 AM

Linux終端中使用python...

如何繞過Investing.com的反爬蟲機制獲取新聞數據? 如何繞過Investing.com的反爬蟲機制獲取新聞數據? Apr 02, 2025 am 07:03 AM

攻克Investing.com的反爬蟲策略許多人嘗試爬取Investing.com(https://cn.investing.com/news/latest-news)的新聞數據時,常常�...

See all articles