如何使用 PyMuPDFM 将 PDF 转换为 Markdown 及其评估-Python教程-PHP中文网

首页

后端开发

Python教程

如何使用 PyMuPDFM 将 PDF 转换为 Markdown 及其评估

Linda Hamilton

Oct 07, 2024 pm 06:12 PM

PyMuPDF4LLM 是一个旨在将 PDF 转换为 Markdown 格式的库。在这里，我将分享我测试这个库的经验。

安装

首先使用以下命令安装库：


pip install pymupdf4llm

登录后复制

用法

基本用法非常简单，只需三行代码即可将 PDF 转换为 Markdown：


import pymupdf4llm
md_text = pymupdf4llm.to_markdown("input.pdf")
print(md_text)

登录后复制

您可以指定参数来调整内容的提取方式。

按页提取文本

默认情况下，整个 PDF 会转换为单个文本输出。但是，您可以通过指定 page_chunks=True 逐页提取文本。


md_text = pymupdf4llm.to_markdown("input.pdf", page_chunks=True)

登录后复制

提取图像

要将图像提取为文件，请使用 write_images=True 选项：


md_text = pymupdf4llm.to_markdown("input.pdf", write_images=True)

登录后复制

也可以使用base64编码直接在Markdown中嵌入图像：


md_text = pymupdf4llm.to_markdown("input.pdf", embed_images=True)

登录后复制

转换结果评估

为了进行测试，使用了具有不同 Markdown 元素的各种 PDF。

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation

标头转换

标题已正确转换为 Markdown 格式。这是结果的一部分：


# Sample Markdown Guide

This is a sample markdown file that includes various features for quick reference.

## 1. Headers

...

## 3. Lists

登录后复制

粗体和斜体文本

粗体和斜体格式也已正确转换：


**Bold: **Bold Text****

_Italic: *Italic Text*_

**_Bold and Italic: ***Bold and Italic***_**

登录后复制

列表转换

第一级有序列表转换没有问题，但嵌套列表和无序列表转换不准确。

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


## 3. Lists

### Unordered List

Item 1

Item 2

Sub-item 1

Sub-item 2

### Ordered List

1. First item

2. Second item

1. Sub-item A

2. Sub-item B

登录后复制

链接转换

提取了链接的URL，但包含链接的整行变成了超链接，偏离了原始格式。

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


## 4. Links and Images

[You can add links using [Link Text](URL).](https://www.example.com/)

登录后复制

图像提取

默认情况下不会提取图像，但可以使用 write_images=True 将图像保存在本地。


md_text = pymupdf4llm.to_markdown("input.pdf", write_images=True)

登录后复制

然后在 Markdown 中引用保存的图像，如下所示：


<p>### Image Example</p>

<p>![](input.pdf-1-0.png)</p>

登录后复制

表转换

没有垂直边框的简单表格无法准确转换（可能是因为不明确的列边界导致表格被视为纯文本）。

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


<p>## 5. Tables</p>

<p>**Column 1** **Column 2** **Column 3**</p>

<p>Row 1 Data A Data B</p>

<p>Row 2 Data C Data D</p>

登录后复制

代码转换

代码块已正确转换，但语言规范（例如 python）未保留。内联代码转换也存在问题。

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


<p>## 6. Code</p>

<p>### Inline Code</p>

<p>Use backticks for inline code: print("Hello, world!")</p>

<p>### Code Block</p>

<p>Use triple backticks for code blocks:</p>

<p>```<br>
def greet(name):<br>
  return f"Hello, {name}!"<br>
print(greet("Markdown"))<br>
```</p>

登录后复制

多行文本

对于多行文本，换行符将按照原始 PDF 中的显示方式保留。

How to Convert PDFs to Markdown Using PyMuPDFM and Its Evaluation


<p>Markdown is a lightweight and versatile markup language favored by developers, writers, and bloggers alike</p>

<p>due to its simplicity in formatting text, enabling users to create readable and well-structured documents—</p>

<p>whether for documentation, blog posts, or articles—without the complexity of HTML, while also offering the</p>

<p>ability to convert content seamlessly into other formats like HTML, PDF, and even slideshows, making it an</p>

<p>ideal choice for projects that require both clarity and flexibility in presentation.</p>

登录后复制