Haven PDF
Accueil › Pourquoi mon PDF est-il si lourd ?
● Files are never uploaded

Pourquoi mon PDF est-il si lourd ?

Cherchez sur le web et tous les résultats donnent la même réponse : les images. Le conseil n'est pas faux, mais l'ordre l'est — et un mauvais ordre envoie les gens vers le mauvais outil.

Nous avons donc mesuré au lieu de deviner. Nous avons décomposé 22 documents publics — 1 726 pages de formulaires fiscaux, d'articles scientifiques, de rapports d'administrations et de textes normatifs — au niveau des objets, en comptant à quelle catégorie appartient chaque octet. Onze des vingt-deux ne contiennent aucune image.

Ouvrir l’outil →

Comment faire

  1. Vérifiez d’abord les Mo par page. Divisez la taille du fichier par le nombre de pages. Au-delà de ~1 Mo par page, ce sont les images ; bien en dessous, les polices, formulaires ou la structure.
  2. Ouvrez l’outil correspondant. Compresser pour les fichiers riches en images — dans votre navigateur, sans téléversement.
  3. Compressez ou indiquez une taille cible. Choisissez un niveau, ou tapez la taille exacte exigée par un portail.
  4. Comparez avant de valider. L’aperçu montre la qualité à 100 %. Pour un scan couleur d’un document N/B, essayez d’abord les niveaux de gris.

La réponse courte dépend de la taille actuelle du fichier

Nous avons réparti les documents en trois tranches de taille et pris la médiane de chaque catégorie. La médiane plutôt que la moyenne, car un seul document de 6 Mo chargé d'images fausse une moyenne à lui seul.

TailleDoc.ImagesPolicesContenuChampsStructure
Moins de 250 Ko80,0 %11,6 %43,3 %12,8 %19,7 %
250 KB – 1 MB60,0 %52,2 %14,9 %2,8 %5,3 %
Plus de 1 Mo826,0 %6,7 %29,3 %1,1 %10,3 %
Part médiane par tranche de taille (n=22 documents, 1 726 pages). « Contenu » = instructions de dessin de la page ; « structure » = tables de références croisées, en-têtes d'objets et dictionnaires.
Schéma d'un fichier PDF : en-tête, objets numérotés contenant polices, images, flux de contenu et champs de formulaire, puis table de références croisées et trailer.
Où vivent les octets. Un lecteur commence par le trailer, trouve la table de références croisées et saute directement aux objets nécessaires — c'est pourquoi même un PDF énorme s'ouvre instantanément.

Au-delà de 1 Mo, l'idée reçue tient : les images dominent. En dessous de 1 Mo, les octets sont ailleurs — dans les polices intégrées, dans les instructions de dessin, et dans quelque chose que presque aucun guide ne mentionne : les définitions des champs de formulaire.

Cause 1 — la résolution de numérisation (toujours la première cause des gros fichiers)

Les téléphones et les scanners de bureau numérisent par défaut en 300–600 ppp en couleur. Une seule page A4 à 600 ppp en couleur représente environ une image de 35 mégapixels. Pour lire à l'écran, 150 ppp suffisent ; pour archiver du texte, les niveaux de gris divisent encore la taille par deux. C'est le seul cas où le conseil habituel est exactement juste — et nos données le confirment : les documents dominés par l'image atteignaient 85 à 89 %.

Taille du documentPart d'images
6,6 Mo89,0 %
751 Ko85,0 %
3,6 Mo70,9 %
1,5 Mo60,1 %
6,5 Mo31,2 %
Les cinq documents avec la plus forte part d’images.

Solution : passer le fichier par Compresser. Les images de numérisation sont ré-encodées à la résolution du document plutôt qu'à celle du capteur. Un scan de 40 Mo tombe généralement à 2–4 Mo ; si un portail impose une limite stricte, indiquez la taille cible plutôt qu'un niveau de qualité.

Cause 2 — les polices intégrées, la majorité silencieuse

Dans la tranche 250 Ko – 1 Mo, la part médiane des polices est de 52,2 %. Aux extrêmes de notre corpus, elle dépasse 85 % : la quasi-totalité du fichier n'est pas le texte que vous lisez, mais les programmes de police qui le dessinent.

Taille du documentPart de polices
664 Ko87,6 %
821 Ko85,4 %
158 Ko71,2 %
359 Ko65,3 %
185 Ko53,8 %
Les cinq documents avec la plus forte part de polices.

La cause est un sous-ensemble (subsetting) absent ou partiel. Un PDF intègre les polices qu'il utilise ; un bon générateur n'intègre que les glyphes réellement présents. Un mauvais — ou un modèle qui charge chaque graisse séparément — intègre tout le jeu de caractères, une fois par variante. Cinq familles fois quatre graisses font vingt programmes de police intégrés, et aucun ne se compresse davantage car les fichiers de police le sont déjà.

Cause 3 — les champs de formulaire, le poids que personne ne compte

Chaque case, chaque case à cocher et chaque liste déroulante d'un formulaire remplissable existe dans le fichier sous forme d'objet dictionnaire : position, type, valeur par défaut, flux d'apparence, règle de validation. Ce ne sont pas des flux, donc aucun compresseur n'y touche — et aucun guide ne les compte.

DocumentAnnotationsPart
Déclaration fiscale22926,8 %
Formulaire d'information12424,7 %
Guide (142 pages)2 95821,3 %
Annexe de déclaration27521,2 %
Formulaire court8519,2 %
Part des définitions de formulaire et d’annotations dans les documents remplissables.

Un quart d'un formulaire fiscal n'est que la définition des cases que vous devez remplir. Il est tentant d'en conclure qu'aplatir le formulaire — supprimer ces définitions une fois rempli — récupère un quart du fichier. Nous l'avons mesuré aussi : ce n'est pas le cas.

ChampsAvantAprèsVariation
199215 Ko327 Ko+52 % plus lourd
105120 Ko170 Ko+42 % plus lourd
116822 Ko874 Ko+6 % plus lourd
29664 Ko670 Ko+1 % plus lourd
12 360 Ko2 075 Ko−12 % plus léger
Neuf documents remplissables du même corpus, aplatis. Un chiffre négatif signifie que le fichier a grossi. Mesuré avec pdf-lib ; d'autres implémentations diffèrent en ampleur, pas en direction.

Cause 4 — photos et captures d'écran collées en taille d'origine

Un rapport avec cinq photos de téléphone intègre cinq originaux de 12 mégapixels même si chacun est affiché en format timbre-poste : la page montre la petite version, le fichier porte la grande. Les captures d'écran sont pires d'une manière particulière — ce sont des PNG, sans perte et volumineux, et sur un écran Retina ou 4K une capture plein écran fait 4 000 pixels de large.

La compression ré-encode les images à la taille réellement affichée ; c'est pourquoi les rapports riches en photos et les présentations pleines de captures perdent couramment 80 à 90 % sans différence visible à la taille de lecture.

Lequel est votre cas ? Un tableau de décision

Divisez d'abord la taille du fichier par le nombre de pages — ce seul chiffre réduit immédiatement les possibilités.

Ce que vous avezCause dominanteCe qui aide vraiment
Plus de ~1 Mo par page, pages qui ressemblent à des photosImagesCompresser ; niveaux de gris pour les scans N/B
Un formulaire rempliChamps de formulaireL'aplatissement le verrouille — mais ne l'allège pas
Rapport texte, 200 Ko – 1 MoPolices intégréesRé-exporter ; moins de polices
Des centaines de pages de texteFlux de contenuDéjà proche de l’optimum — divisez plutôt
Petit fichier, peu de pages, sans imagesStructure et champsRé-exporter via un éditeur qui réécrit

Tout cela s'exécute dans votre navigateur avec Haven PDF. Un fichier trop lourd n'a pas besoin d'être téléversé où que ce soit pour être allégé — un contrat confidentiel reste donc sur votre machine pendant que vous le réduisez.

Compresser un PDF · Niveaux de gris

Comment nous avons mesuré, et ce que cela ne prouve pas

Nous avons parcouru chaque document au niveau du graphe d'objets et attribué chaque flux à une catégorie selon sa longueur brute — la place qu'il occupe réellement dans le fichier. Les XObjects d'image et les flux portant un filtre JPEG, JPX, CCITT ou JBIG2 comptent comme images ; les flux référencés via FontFile, FontFile2 ou FontFile3 comme polices ; le reste est du contenu. Les octets hors des flux comptés ont été traités comme surcharge structurelle, dont les dictionnaires de formulaire et d'annotation ont été extraits.

Questions fréquentes

Mon PDF ne contient que du texte et reste énorme — pourquoi ?
Très probablement des polices intégrées. Dans nos mesures, les documents texte entre 250 Ko et 1 Mo avaient une part médiane de polices de 52 %, avec un pire cas à 88 %. La compression d’images n’y touche pas ; un ré-export via un éditeur qui réécrit le fichier aide.
La compression rend-elle le texte flou ?
Le vrai texte — saisi, non numérisé — n’est pas affecté par la compression d’images et reste net à tout niveau de zoom. Dans un scan, le texte fait partie de l’image et est donc affecté ; les niveaux moyens le gardent normalement bien lisible.
Pourquoi la compression n’a-t-elle presque rien changé ?
Presque certainement parce qu’il n’y avait pas d’images à compresser. Onze des vingt-deux documents mesurés n’en contiennent aucune. Vérifiez les Mo par page : bien en dessous de 1 Mo par page, les octets sont généralement dans les polices, les champs ou la structure.
Aplatir un formulaire fait-il vraiment gagner autant ?
Non — et nous avons vérifié. Les définitions de champs représentent 19 à 27 % de ces fichiers, mais en aplatir neuf a rendu le fichier médian environ 6 % PLUS LOURD, le pire cas grossissant de 52 %. Aplatissez pour verrouiller un formulaire, pas pour l’alléger.
Existe-t-il une compression maximale sûre ?
Utilisez l’aperçu : compressez, regardez une page dense à 100 %, et n’augmentez que si elle reste confortablement lisible. Avec une taille cible, l’outil choisit automatiquement la meilleure qualité qui rentre.

Sources

  1. ISO 32000-2:2020 — Gestion de documents : Portable Document FormatDéfinition normative de la structure des objets, des filtres de flux et des dictionnaires de champs AcroForm.
  2. PDF 1.7 Reference (Adobe ; contenu identique à ISO 32000-1)Intégration des polices (§9.9), XObjects d’image (§8.9), annotations (§12.5).
  3. Corpus : formulaires et publications de l’IRS, articles arXiv, rapports d’administrations — Uniquement des documents publiquement téléchargeables. Aucun fichier personnel ou privé.

Outils similaires