Haven PDF
Home › Waarom is mijn pdf zo groot?
● Files are never uploaded

Waarom is mijn pdf zo groot?

Zoek erop en elk resultaat geeft hetzelfde antwoord: afbeeldingen. Het advies is niet fout, maar de volgorde wel — en een verkeerde volgorde stuurt mensen naar het verkeerde gereedschap.

Dus hebben we gemeten in plaats van gegokt. We ontleedden 22 openbaar beschikbare documenten — 1.726 pagina’s aan belastingformulieren, wetenschappelijke artikelen, overheidsrapporten en normteksten — op objectniveau en telden tot welke categorie elke byte behoort. Elf van de tweeëntwintig bevatten helemaal geen afbeelding.

Tool openen →

Hoe het werkt

  1. Kijk eerst naar MB per pagina. Deel de bestandsgrootte door het aantal pagina’s. Boven ~1 MB per pagina wijst op afbeeldingen; ruim daaronder op lettertypen, formulieren of structuur.
  2. Open het passende gereedschap. Comprimeren voor afbeeldingzware bestanden — in je browser, zonder uploads.
  3. Comprimeer of geef een doelgrootte op. Kies een niveau, of typ de exacte grootte die een portaal vereist.
  4. Vergelijk voordat je bevestigt. De voorbeeldweergave toont de kwaliteit op 100 %. Bij een kleurenscan van een Z/W-document eerst grijswaarden proberen.

Het korte antwoord hangt af van hoe groot het bestand al is

We verdeelden de documenten in drie groottebanden en namen de mediaan van elke categorie. Mediaan in plaats van gemiddelde, omdat één afbeeldingzware uitschieter van 6 MB een gemiddelde in zijn eentje scheeftrekt.

BestandsgrootteDoc.AfbeeldingenLettertypenInhoudVeldenStructuur
Onder 250 KB80,0 %11,6 %43,3 %12,8 %19,7 %
250 KB – 1 MB60,0 %52,2 %14,9 %2,8 %5,3 %
Boven 1 MB826,0 %6,7 %29,3 %1,1 %10,3 %
Mediaan categorieaandeel per groottebandbereik (n=22 documenten, 1.726 pagina’s). „Inhoud” = tekeninstructies van de pagina; „structuur” = kruisverwijzingstabellen, objectkoppen en woordenboeken.
Schema van een pdf-bestand: kop, genummerde objecten met lettertypen, afbeeldingen, inhoudsstromen en formuliervelden, daarna kruisverwijzingstabel en trailer.
Waar de bytes zitten. Een lezer begint bij de trailer, vindt de kruisverwijzingstabel en springt direct naar de objecten die hij nodig heeft — daarom opent zelfs een enorme pdf meteen.

Boven 1 MB klopt de gangbare aanname: afbeeldingen domineren. Onder 1 MB zitten de bytes ergens anders — in ingesloten lettertypen, in tekeninstructies en in iets dat vrijwel geen gids noemt: de definities van formuliervelden.

Oorzaak 1 — scanresolutie (bij grote bestanden nog steeds de hoofdoorzaak)

Telefoons en kantoorscanners scannen standaard op 300–600 dpi in kleur. Eén A4-pagina op 600 dpi in kleur is ruwweg een afbeelding van 35 megapixel. Om op het scherm te lezen is 150 dpi ruim voldoende; voor tekstarchivering halveert grijswaarden het nog eens. Dit is het ene geval waarin het standaardadvies precies klopt — en onze data zijn het eens: de afbeeldinggedomineerde documenten haalden 85–89 %.

BestandsgrootteAfbeeldingaandeel
6,6 MB89,0 %
751 KB85,0 %
3,6 MB70,9 %
1,5 MB60,1 %
6,5 MB31,2 %
De vijf documenten met het hoogste afbeeldingaandeel.

Oplossing: haal het bestand door Comprimeren. Scanafbeeldingen worden opnieuw gecodeerd op documentresolutie in plaats van sensorresolutie. Een scan van 40 MB komt doorgaans uit op 2–4 MB; dwingt een portaal een harde limiet af, geef dan de doelgrootte op in plaats van een kwaliteitsniveau.

Oorzaak 2 — ingesloten lettertypen, de stille meerderheid

In de band 250 KB – 1 MB is het mediane lettertype-aandeel 52,2 %. Aan de uitersten van onze set gaat het voorbij 85 %: bijna het hele bestand is niet de tekst die je leest, maar de lettertypeprogramma’s die hem tekenen.

BestandsgrootteLettertype-aandeel
664 KB87,6 %
821 KB85,4 %
158 KB71,2 %
359 KB65,3 %
185 KB53,8 %
De vijf documenten met het hoogste lettertype-aandeel.

De oorzaak is ontbrekende of halve subsetting. Een pdf sluit de lettertypen in die hij gebruikt; een goede producent sluit alleen de glyphs in die echt voorkomen. Een slechte — of een sjabloon dat elk gewicht apart laadt — sluit de volledige tekenset in, één keer per variant. Vijf families maal vier gewichten is twintig ingesloten lettertypeprogramma’s, en geen ervan krimpt verder omdat lettertypebestanden al gecomprimeerd zijn.

Oorzaak 3 — formuliervelden, de ballast die niemand meetelt

Elk vak, elk selectievakje en elke keuzelijst in een invulbaar formulier leeft in het bestand als woordenboekobject: positie, type, standaardwaarde, weergavestroom, validatieregel. Dit zijn geen stromen, dus geen enkele compressor raakt ze aan — en geen enkele gids telt ze mee.

DocumentAnnotatiesAandeel
Belastingaangifteformulier22926,8 %
Informatieformulier12424,7 %
Handleiding (142 pagina’s)2.95821,3 %
Bijlage bij aangifte27521,2 %
Kort formulier8519,2 %
Aandeel van formulier- en annotatiedefinities in invulbare documenten.

Een kwart van een belastingformulier is niets anders dan de definitie van de vakken die je moet invullen. Het ligt voor de hand te concluderen dat het afvlakken van het formulier — die definities weggooien zodra het is ingevuld — een kwart van het bestand terugwint. Ook dat hebben we gemeten: dat doet het niet.

VeldenVoorNaVerandering
199215 KB327 KB+52 % groter
105120 KB170 KB+42 % groter
116822 KB874 KB+6 % groter
29664 KB670 KB+1 % groter
12.360 KB2.075 KB−12 % kleiner
Negen invulbare documenten uit dezelfde set, afgevlakt. Negatief betekent dat het bestand groeide. Gemeten met pdf-lib; andere implementaties verschillen in mate, niet in richting.

Oorzaak 4 — foto’s en schermafbeeldingen op originele grootte geplakt

Een rapport met vijf telefoonfoto’s sluit vijf originelen van 12 megapixel in, ook al wordt elk ter grootte van een postzegel getoond: de pagina toont de kleine versie, het bestand draagt de grote. Schermafbeeldingen zijn op een specifieke manier erger — het zijn PNG’s, verliesvrij en groot, en op een Retina- of 4K-scherm is één volledige schermafbeelding 4.000 pixels breed.

Compressie codeert afbeeldingen opnieuw op de grootte waarop ze werkelijk worden getoond; daarom krimpen fotorijke rapporten en presentaties vol schermafbeeldingen routinematig met 80–90 % zonder zichtbaar verschil op leesgrootte.

Welke is die van jou? Een beslistabel

Deel eerst de bestandsgrootte door het aantal pagina’s — dat ene getal beperkt het meteen.

Wat je hebtHoofdoorzaakWat echt helpt
Meer dan ~1 MB per pagina, pagina’s zien eruit als foto’sAfbeeldingenComprimeren; grijswaarden bij Z/W-scans
Een ingevuld formulierFormulierveldenAfvlakken zet het vast — maar maakt het niet kleiner
Rapport met alleen tekst, 200 KB – 1 MBIngesloten lettertypenOpnieuw exporteren; minder lettertypen
Honderden pagina’s platte tekstInhoudsstromenAl bijna optimaal — splitsen is zinvoller
Klein bestand, weinig pagina’s, geen afbeeldingenStructuur en veldenExporteren via een herschrijvende editor

Dit alles draait in je browser met Haven PDF. Een te groot bestand hoeft nergens heen geüpload te worden om kleiner te worden — een vertrouwelijk contract blijft dus op je eigen machine terwijl je het verkleint.

Pdf comprimeren · Grijswaarden

Hoe we hebben gemeten, en wat dit niet bewijst

We doorliepen elk document op het niveau van de objectgraaf en wezen elke stroom toe aan een categorie op basis van zijn ruwe lengte — de ruimte die hij werkelijk in het bestand inneemt. Afbeelding-XObjects en stromen met JPEG-, JPX-, CCITT- of JBIG2-filters tellen als afbeeldingen; stromen waarnaar via FontFile, FontFile2 of FontFile3 wordt verwezen als lettertypen; de rest is inhoud. Bytes buiten de getelde stromen zijn behandeld als structurele overhead, waaruit formulier- en annotatiewoordenboeken zijn afgezonderd.

Veelgestelde vragen

Mijn pdf is alleen tekst en toch enorm — hoe kan dat?
Hoogstwaarschijnlijk ingesloten lettertypen. In onze metingen hadden tekstdocumenten tussen 250 KB en 1 MB een mediaan lettertype-aandeel van 52 %, met 88 % als slechtste geval. Afbeeldingscompressie komt daar niet bij; opnieuw exporteren via een editor die het bestand herschrijft helpt wel.
Wordt tekst wazig door compressie?
Echte tekst — getypt, niet gescand — wordt niet geraakt door afbeeldingscompressie en blijft bij elke zoom scherp. In een scan is de tekst onderdeel van de afbeelding en dus wel; middelste niveaus houden hem normaal goed leesbaar.
Waarom veranderde compressie mijn bestand nauwelijks?
Vrijwel zeker omdat er geen afbeeldingen te comprimeren waren. Elf van de tweeëntwintig gemeten documenten bevatten er geen. Kijk naar MB per pagina: ruim onder 1 MB per pagina betekent meestal lettertypen, formuliervelden of structuur.
Levert een formulier afvlakken echt zoveel op?
Nee — en we hebben het gecontroleerd. Velddefinities zijn 19–27 % van die bestanden, maar negen ervan afvlakken maakte het mediane bestand ongeveer 6 % GROTER, met 52 % als slechtste geval. Vlak af om een formulier vast te zetten, niet om het te verkleinen.
Bestaat er een veilige maximale compressie?
Gebruik de voorbeeldweergave: comprimeer, bekijk een dichte pagina op 100 % en ga alleen verder als die comfortabel leesbaar blijft. Met een doelgrootte kiest het gereedschap automatisch de beste kwaliteit die past.

Bronnen

  1. ISO 32000-2:2020 — Documentbeheer: Portable Document FormatNormatieve definitie van objectstructuur, stroomfilters en AcroForm-veldwoordenboeken.
  2. PDF 1.7 Reference (Adobe; zelfde inhoud als ISO 32000-1)Lettertype-insluiting (§9.9), afbeelding-XObjects (§8.9), annotaties (§12.5).
  3. Set: IRS-formulieren en -publicaties, arXiv-artikelen, overheidsrapporten — Uitsluitend openbaar downloadbare documenten. Geen persoonlijke of privébestanden gebruikt.

Gerelateerde tools