


Fusionner des PDF de manière récursive à l'aide de Python
Introduction
Fusionner plusieurs fichiers PDF en un seul document peut être une tâche fastidieuse, surtout si les fichiers sont répartis dans plusieurs répertoires. Avec Python, cette tâche devient transparente et automatisée. Dans ce didacticiel, nous allons créer un outil d'interface de ligne de commande (CLI) à l'aide de PyPDF2 et cliquer pour fusionner tous les fichiers PDF dans un répertoire (y compris ses sous-répertoires), tout en excluant les répertoires spécifiques comme .venv et .git.
Conditions préalables
Avant de commencer, assurez-vous d'avoir les éléments suivants :
- Python : version 3.7 ou supérieure.
- pip : le gestionnaire de paquets de Python.
-
Bibliothèques requises :
- Installez PyPDF2 pour la manipulation de PDF :
pip install PyPDF2
Copier après la connexion
-
Installer, cliquez pour créer la CLI :
pip install click
Copier après la connexion
Procédure pas à pas du code
Voici le code complet de notre outil CLI :
import click from pathlib import Path from PyPDF2 import PdfMerger import os EXCLUDED_DIRS = {".venv", ".git"} @click.command() @click.argument("directory", type=click.Path(exists=True, file_okay=False, path_type=Path)) @click.argument("output_file", type=click.Path(dir_okay=False, writable=True, path_type=Path)) def merge_pdfs(directory: Path, output_file: Path): """ Merge all PDF files from DIRECTORY and its subdirectories into OUTPUT_FILE, excluding specified directories like .venv and .git. """ # Initialize the PdfMerger merger = PdfMerger() # Walk through the directory tree, including the base directory for root, dirs, files in os.walk(directory): # Exclude specific directories dirs[:] = [d for d in dirs if d not in EXCLUDED_DIRS] # Convert the root to a Path object current_dir = Path(root) click.echo(f"Processing directory: {current_dir}") # Collect PDF files in the current directory pdf_files = sorted(current_dir.glob("*.pdf")) if not pdf_files: click.echo(f"No PDF files found in {current_dir}") continue # Add PDF files from the current directory for pdf in pdf_files: click.echo(f"Adding {pdf}...") merger.append(str(pdf)) # Write the merged output file output_file.parent.mkdir(parents=True, exist_ok=True) merger.write(str(output_file)) merger.close() click.echo(f"All PDFs merged into {output_file}") if __name__ == "__main__": merge_pdfs()
Comment ça marche
-
Parcours de répertoire :
- La fonction os.walk() parcourt récursivement le répertoire spécifié.
- Les répertoires spécifiques (par exemple, .venv, .git) sont exclus à l'aide d'un filtre sur les répertoires.
-
Collection de fichiers PDF :
- Le current_dir.glob("*.pdf") collecte tous les fichiers PDF du répertoire courant.
-
Fusionner des PDF :
- PdfMerger de PyPDF2 est utilisé pour ajouter tous les PDF.
- La sortie fusionnée est écrite dans le fichier spécifié.
-
Intégration CLI :
- La bibliothèque Click facilite la fourniture de chemins de répertoire et de fichiers de sortie comme arguments.
Exécution de l'outil
Enregistrez le code dans un fichier, par exemple merge_pdfs.py. Exécutez-le depuis le terminal comme suit :
python merge_pdfs.py /path/to/directory /path/to/output.pdf
Exemple
Supposons que vous ayez la structure de répertoires suivante :
/documents ├── file1.pdf ├── subdir1 │ ├── file2.pdf ├── subdir2 │ ├── file3.pdf ├── .git │ ├── ignored_file.pdf
Exécutez l'outil comme suit :
python merge_pdfs.py /documents /merged.pdf
Cela fusionnera file1.pdf, file2.pdf et file3.pdf enmerged.pdf, en ignorant .git.
Caractéristiques
-
Fusion récursive :
- L'outil inclut automatiquement les PDF de tous les sous-répertoires.
-
Exclusions d'annuaire :
- Exclut les répertoires comme .venv et .git pour éviter les fichiers non pertinents.
-
Fusion triée :
- Veille à ce que les PDF soient ajoutés dans un ordre trié pour des résultats cohérents.
-
Simplicité CLI :
- Fournit une interface intuitive permettant aux utilisateurs de spécifier les chemins d'entrée et de sortie.
Remarques et limites
-
Fichiers volumineux :
- La fusion d'un grand nombre de PDF peut consommer une mémoire importante. Testez d'abord avec des ensembles de données plus petits.
-
Compatibilité PDF :
- Assurez-vous que tous les PDF d'entrée sont valides et non corrompus.
-
Exclusions personnalisées :
- Modifiez l'ensemble EXCLUDED_DIRS pour exclure des répertoires supplémentaires si nécessaire.
Conclusion
Ce tutoriel montre comment automatiser la fusion de PDF à partir d'une structure de répertoires à l'aide de Python. L'outil CLI fourni est flexible et peut être adapté à des flux de travail plus complexes. Essayez-le et dites-nous comment cela fonctionne pour vous !
Bon codage ! ?
Ce qui précède est le contenu détaillé de. pour plus d'informations, suivez d'autres articles connexes sur le site Web de PHP en chinois!

Outils d'IA chauds

Undresser.AI Undress
Application basée sur l'IA pour créer des photos de nu réalistes

AI Clothes Remover
Outil d'IA en ligne pour supprimer les vêtements des photos.

Undress AI Tool
Images de déshabillage gratuites

Clothoff.io
Dissolvant de vêtements AI

Video Face Swap
Échangez les visages dans n'importe quelle vidéo sans effort grâce à notre outil d'échange de visage AI entièrement gratuit !

Article chaud

Outils chauds

Bloc-notes++7.3.1
Éditeur de code facile à utiliser et gratuit

SublimeText3 version chinoise
Version chinoise, très simple à utiliser

Envoyer Studio 13.0.1
Puissant environnement de développement intégré PHP

Dreamweaver CS6
Outils de développement Web visuel

SublimeText3 version Mac
Logiciel d'édition de code au niveau de Dieu (SublimeText3)

Sujets chauds

Comment éviter d'être détecté lors de l'utilisation de FiddlereVerywhere pour les lectures d'homme dans le milieu lorsque vous utilisez FiddlereVerywhere ...

Fastapi ...

Utilisation de Python dans Linux Terminal ...

Comment enseigner les bases de la programmation novice en informatique dans les 10 heures? Si vous n'avez que 10 heures pour enseigner à l'informatique novice des connaissances en programmation, que choisissez-vous d'enseigner ...

Comprendre la stratégie anti-rampe d'investissement.com, Beaucoup de gens essaient souvent de ramper les données d'actualités sur Investing.com (https://cn.investing.com/news/latest-news) ...

À propos de Pythonasyncio ...

Discussion sur les raisons pour lesquelles les fichiers de pipelines ne peuvent pas être écrits lors de l'utilisation de robots scapisnels lors de l'apprentissage et de l'utilisation de Crawlers scapides pour un stockage de données persistant, vous pouvez rencontrer des fichiers de pipeline ...

Chargement du fichier de cornichon dans Python 3.6 Erreur d'environnement: modulenotFounonError: NomoduLenamed ...
