


So konvertieren Sie PDFs mit PyMuPDFM und seiner Auswertung in Markdown
PyMuPDF4LLM ist eine Bibliothek zum Konvertieren von PDFs in das Markdown-Format. Hier teile ich meine Erfahrungen beim Testen dieser Bibliothek.
Installation
Beginnen Sie mit der Installation der Bibliothek mit dem folgenden Befehl:
pip install pymupdf4llm
Verwendung
Die grundlegende Verwendung ist recht einfach: Es sind nur drei Codezeilen erforderlich, um eine PDF-Datei in Markdown zu konvertieren:
import pymupdf4llm md_text = pymupdf4llm.to_markdown("input.pdf") print(md_text)
Sie können Argumente angeben, um anzupassen, wie Inhalte extrahiert werden.
Text nach Seite extrahieren
Standardmäßig wird das gesamte PDF in eine einzige Textausgabe konvertiert. Sie können jedoch Text Seite für Seite extrahieren, indem Sie page_chunks=True.
angebenmd_text = pymupdf4llm.to_markdown("input.pdf", page_chunks=True)
Bilder extrahieren
Um Bilder als Dateien zu extrahieren, verwenden Sie die Option write_images=True:
md_text = pymupdf4llm.to_markdown("input.pdf", write_images=True)
Es ist auch möglich, Bilder mithilfe der Base64-Kodierung direkt in den Markdown einzubetten:
md_text = pymupdf4llm.to_markdown("input.pdf", embed_images=True)
Auswertung der Conversion-Ergebnisse
Zum Testen wurden verschiedene PDFs mit unterschiedlichen Markdown-Elementen verwendet.
Header-Konvertierung
Header werden korrekt in das Markdown-Format konvertiert. Hier ist ein Teil des Ergebnisses:
# Sample Markdown Guide This is a sample markdown file that includes various features for quick reference. ## 1. Headers ... ## 3. Lists
Fetter und kursiver Text
Fett- und kursive Formatierungen werden ebenfalls ordnungsgemäß konvertiert:
**Bold: **Bold Text**** _Italic: *Italic Text*_ **_Bold and Italic: ***Bold and Italic***_**
Listenkonvertierung
Geordnete Listen auf der ersten Ebene werden ohne Probleme konvertiert, verschachtelte Listen und ungeordnete Listen werden jedoch nicht korrekt konvertiert.
## 3. Lists ### Unordered List Item 1 Item 2 Sub-item 1 Sub-item 2 ### Ordered List 1. First item 2. Second item 1. Sub-item A 2. Sub-item B
Linkkonvertierung
Die URLs von Links werden extrahiert, aber die gesamte Zeile, die den Link enthält, wird zu einem Hyperlink, was vom ursprünglichen Format abweicht.
## 4. Links and Images [You can add links using [Link Text](URL).](https://www.example.com/)
Bildextraktion
Bilder werden standardmäßig nicht extrahiert, können aber mit write_images=True lokal gespeichert werden.
md_text = pymupdf4llm.to_markdown("input.pdf", write_images=True)
Die gespeicherten Bilder werden dann im Markdown wie folgt referenziert:
<p>### Image Example</p> <p></p>
Tabellenkonvertierung
Einfache Tabellen ohne vertikale Ränder werden nicht genau konvertiert (wahrscheinlich, weil mehrdeutige Spaltengrenzen dazu führen, dass Tabellen als einfacher Text behandelt werden).
<p>## 5. Tables</p> <p>**Column 1** **Column 2** **Column 3**</p> <p>Row 1 Data A Data B</p> <p>Row 2 Data C Data D</p>
Codekonvertierung
Codeblöcke werden korrekt konvertiert, die Sprachspezifikation (z. B. Python) bleibt jedoch nicht erhalten. Bei der Inline-Codekonvertierung gibt es ebenfalls Probleme.
<p>## 6. Code</p> <p>### Inline Code</p> <p>Use backticks for inline code: print("Hello, world!")</p> <p>### Code Block</p> <p>Use triple backticks for code blocks:</p> <p>```<br> def greet(name):<br> return f"Hello, {name}!"<br> print(greet("Markdown"))<br> ```</p>
Mehrzeiliger Text
Bei mehrzeiligem Text bleiben die Zeilenumbrüche so erhalten, wie sie im Original-PDF erscheinen.
<p>Markdown is a lightweight and versatile markup language favored by developers, writers, and bloggers alike</p> <p>due to its simplicity in formatting text, enabling users to create readable and well-structured documents—</p> <p>whether for documentation, blog posts, or articles—without the complexity of HTML, while also offering the</p> <p>ability to convert content seamlessly into other formats like HTML, PDF, and even slideshows, making it an</p> <p>ideal choice for projects that require both clarity and flexibility in presentation.</p>
Fazit
Trotz der Herausforderungen bei der genauen Konvertierung von Listen und Links ist PyMuPDF4LLM ein nützliches Tool zum Konvertieren von PDFs in Markdown. Es kann lokal ohne die Notwendigkeit externer Sprachmodelle arbeiten und eignet sich daher für Umgebungen, in denen kein Internetzugang verfügbar ist.
Das obige ist der detaillierte Inhalt vonSo konvertieren Sie PDFs mit PyMuPDFM und seiner Auswertung in Markdown. Für weitere Informationen folgen Sie bitte anderen verwandten Artikeln auf der PHP chinesischen Website!

Heiße KI -Werkzeuge

Undresser.AI Undress
KI-gestützte App zum Erstellen realistischer Aktfotos

AI Clothes Remover
Online-KI-Tool zum Entfernen von Kleidung aus Fotos.

Undress AI Tool
Ausziehbilder kostenlos

Clothoff.io
KI-Kleiderentferner

Video Face Swap
Tauschen Sie Gesichter in jedem Video mühelos mit unserem völlig kostenlosen KI-Gesichtstausch-Tool aus!

Heißer Artikel

Heiße Werkzeuge

Notepad++7.3.1
Einfach zu bedienender und kostenloser Code-Editor

SublimeText3 chinesische Version
Chinesische Version, sehr einfach zu bedienen

Senden Sie Studio 13.0.1
Leistungsstarke integrierte PHP-Entwicklungsumgebung

Dreamweaver CS6
Visuelle Webentwicklungstools

SublimeText3 Mac-Version
Codebearbeitungssoftware auf Gottesniveau (SublimeText3)

Heiße Themen

Lösung für Erlaubnisprobleme beim Betrachten der Python -Version in Linux Terminal Wenn Sie versuchen, die Python -Version in Linux Terminal anzuzeigen, geben Sie Python ein ...

Wie kann man nicht erkannt werden, wenn Sie Fiddlereverywhere für Man-in-the-Middle-Lesungen verwenden, wenn Sie FiddLereverywhere verwenden ...

Bei der Verwendung von Pythons Pandas -Bibliothek ist das Kopieren von ganzen Spalten zwischen zwei Datenrahmen mit unterschiedlichen Strukturen ein häufiges Problem. Angenommen, wir haben zwei Daten ...

Wie hört Uvicorn kontinuierlich auf HTTP -Anfragen an? Uvicorn ist ein leichter Webserver, der auf ASGI basiert. Eine seiner Kernfunktionen ist es, auf HTTP -Anfragen zu hören und weiterzumachen ...

Fastapi ...

Verwenden Sie Python im Linux -Terminal ...

Wie lehre ich innerhalb von 10 Stunden die Grundlagen für Computer -Anfänger für Programmierungen? Wenn Sie nur 10 Stunden Zeit haben, um Computer -Anfänger zu unterrichten, was Sie mit Programmierkenntnissen unterrichten möchten, was würden Sie dann beibringen ...

Verständnis der Anti-Crawling-Strategie von Investing.com Viele Menschen versuchen oft, Nachrichten von Investing.com (https://cn.investing.com/news/latest-news) zu kriechen ...
