前言

第一次写博客，主要内容是爬取微信公众号的文章，将文章以PDF格式保存在本地。

爬取微信公众号文章（使用wechatsogou）

1.安装

pip install wechatsogou --upgrade

Salin selepas log masuk

wechatsogou是一个基于搜狗微信搜索的微信公众号爬虫接口

2.使用方法

使用方法如下所示

import wechatsogou
# captcha_break_time为验证码输入错误的重试次数，默认为1
ws_api = wechatsogou.WechatSogouAPI(captcha_break_time=3)
# 公众号名称
gzh_name = &#39;&#39;
# 将该公众号最近10篇文章信息以字典形式返回
data = ws_api.get_gzh_article_by_history(gzh_name)

Salin selepas log masuk

data数据结构：

{
    &#39;gzh&#39;: {
        &#39;wechat_name&#39;: &#39;&#39;,  # 名称
        &#39;wechat_id&#39;: &#39;&#39;,  # 微信id
        &#39;introduction&#39;: &#39;&#39;,  # 简介
        &#39;authentication&#39;: &#39;&#39;,  # 认证
        &#39;headimage&#39;: &#39;&#39;  # 头像
    },
    &#39;article&#39;: [
        {
            &#39;send_id&#39;: int,  # 群发id，注意不唯一，因为同一次群发多个消息，而群发id一致
            &#39;datetime&#39;: int,  # 群发datatime 10位时间戳
            &#39;type&#39;: &#39;&#39;,  # 消息类型，均是49（在手机端历史消息页有其他类型，网页端最近10条消息页只有49），表示图文
            &#39;main&#39;: int,  # 是否是一次群发的第一次消息 1 or 0
            &#39;title&#39;: &#39;&#39;,  # 文章标题
            &#39;abstract&#39;: &#39;&#39;,  # 摘要
            &#39;fileid&#39;: int,  #
            &#39;content_url&#39;: &#39;&#39;,  # 文章链接
            &#39;source_url&#39;: &#39;&#39;,  # 阅读原文的链接
            &#39;cover&#39;: &#39;&#39;,  # 封面图
            &#39;author&#39;: &#39;&#39;,  # 作者
            &#39;copyright_stat&#39;: int,  # 文章类型，例如：原创啊
        },
        ...
    ]
}

Salin selepas log masuk

这里需要得到两个信息：文章标题，文章url。

得到文章url以后，就可以根据url将html页面转换成pdf文件了。

生成PDF文件

1.安装wkhtmltopdf

下载地址:https://wkhtmltopdf.org/downloads.html

2.安装pdfkit

pip install pdfkit

Salin selepas log masuk

3.使用方法

import pdfkit
# 根据url生成pdf
pdfkit.from_url(&#39;http://baidu.com&#39;,&#39;out.pdf&#39;)
# 根据html文件生成pdf
pdfkit.from_file(&#39;test.html&#39;,&#39;out.pdf&#39;)
# 根据html代码生成pdf
pdfkit.from_string(&#39;Hello!&#39;,&#39;out.pdf&#39;)

Salin selepas log masuk

如果直接用上面得到的文章url去生成pdf，会出现pdf文件不显示文章图片的问题。

解决办法：

# 该方法根据文章url对html进行处理，使图片显示
content_info = ws_api.get_article_content(url)
# 得到html代码(代码不完整，需要加入head、body等标签)
html_code = content_info[&#39;content_html&#39;]

Salin selepas log masuk

然后根据html_code构造完整的html代码，调用pdfkit.from_string()方法生成pdf文件，这时候会发现文章中的图片在pdf文件中显示出来了。

完整代码

import os
import pdfkit
import datetime
import wechatsogou

# 初始化API
ws_api = wechatsogou.WechatSogouAPI(captcha_break_time=3)


def url2pdf(url, title, targetPath):
    &#39;&#39;&#39;
    使用pdfkit生成pdf文件
    :param url: 文章url
    :param title: 文章标题
    :param targetPath: 存储pdf文件的路径
    &#39;&#39;&#39;
    try:
        content_info = ws_api.get_article_content(url)
    except:
        return False
    # 处理后的html
    html = f&#39;&#39;&#39;
    <!DOCTYPE html>
    <html lang="en">
    <head>
        <meta charset="UTF-8">
        <title>{title}</title>
    </head>
    <body>
    <h2 style="text-align: center;font-weight: 400;">{title}</h2>
    {content_info[&#39;content_html&#39;]}
    </body>
    </html>
    &#39;&#39;&#39;
    try:
        pdfkit.from_string(html, targetPath + os.path.sep + f&#39;{title}.pdf&#39;)
    except:
        # 部分文章标题含特殊字符，不能作为文件名
        filename = datetime.datetime.now().strftime(&#39;%Y%m%d%H%M%S&#39;) + &#39;.pdf&#39;
        pdfkit.from_string(html, targetPath + os.path.sep + filename)


if __name__ == &#39;__main__&#39;:
    # 此处为要爬取公众号的名称
    gzh_name = &#39;&#39;
    targetPath = os.getcwd() + os.path.sep + gzh_name
    # 如果不存在目标文件夹就进行创建
    if not os.path.exists(targetPath):
        os.makedirs(targetPath)
    # 将该公众号最近10篇文章信息以字典形式返回
    data = ws_api.get_gzh_article_by_history(gzh_name)
    article_list = data[&#39;article&#39;]
    for article in article_list:
        url = article[&#39;content_url&#39;]
        title = article[&#39;title&#39;]
        url2pdf(url, title, targetPath)

Salin selepas log masuk

相关学习推荐：python教程

Atas ialah kandungan terperinci 爬取微信公众号文章并保存为PDF文件（Python方法）. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan Laman Web ini

Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn