Bonjour,
Je me permets de recentrer le débat lancé par Benoît, qui a le mérite de poser une vraie question :
Comment transformer un tas de fichiers PDF scannés (images A4) en un document structuré avec pagination, sommaire, repères ?
Et là, Jean-Yves (alias Eselstein pour les intimes), nous sort son tour de passe-passe favori : \includepdf, addtotoc, un pagecommand au rabais, et hop, circulez.
?? Sauf que ça ne marche pas. Ce n’est pas un document, c’est un cache-misère.
?? Problème de fond : un scan n’est pas un document texte
Ce que vous avez, ce sont des images de pages.
Ce que vous voulez, c’est un document structuré, éditable, cherchable, navigable.
Et entre les deux, il n’y a pas un \usepackage{pdfpages}, il y a un gouffre.
??️ La seule méthode propre (avec Tesseract OCR)
- Convertir les PDF en images haute qualité
pdftoppm -r 400 scan.pdf page -png
ou en .pnm si vous préférez :
pdftoppm -r 400 scan.pdf > page-%03d.pnm
- Appliquer l’OCR avec Tesseract
tesseract page-001.pnm page-001 --psm 1 pdf
?? Options recommandées :
--psm 1 pour du document bien structuré ;
--oem 1 ou 3 selon version ;
possibilité d’exporter aussi en .hocr ou .tex pour les acharnés.
- Assembler les pages OCRisées en un seul PDF
pdfunite page-001.pdf page-002.pdf document-final.pdf
ou bien :
qpdf --empty --pages page-*.pdf – document-final.pdf
- Extraire le texte si besoin
pdftotext document-final.pdf > texte.txt
ou mieux : extraire le LaTeX depuis les résultats OCR (tesseract -l fra --dpi 400 scan.png output tex avec l’option -c tessedit_create_tex=1 si activée dans votre build).
?? Et ensuite seulement, vous pouvez :
reconstruire une table des matières ;
ajouter une pagination réelle (pas en surimpression d’image) ;
structurer un document LaTeX ;
générer des signets avec hyperref, etc.
?? Pourquoi je vous dis tout ça ?
Parce que je suis un mécano, pas un agrégé de bidouille textuelle. Et je vois trop de bricoleurs empiler des fichiers scannés comme des palettes bancales, sans jamais reconstruire le contenu.
Ce genre de document est une grenade dégoupillée : le jour où quelqu’un veut le reprendre, c’est injouable.
?? Morale :
Si vous voulez un document fiable, propre, pérenne, ne faites pas du faux PDF enrobé de LaTeX avec trois \addtotoc.
Faites un OCR solide, nettoyez, structurez, puis compilez.
Et s’il faut passer 4 heures à réparer ce que Jean-Yves a “assemblé” avec ses macros en mousse… alors autant balayer le plancher tout de suite.
Amicalement,
Bernard le mécano
(celui qui refait les joints quand les ingénieurs pissent dans le carter)