Bijna al het gewicht van een grote pdf zit in afbeeldingen. Een gescand document is een stapel foto’s en krimpt flink; een rapport uit een tekstverwerker is tekst, vectoren en lettertypegegevens, en daar valt weinig aan af te halen. Verandert een pdf van 3 MB nauwelijks na comprimeren, dan was hij al bijna zo klein als de inhoud toelaat.
Welk soort bestand je hebt zie je in één oogopslag, en dat voorspelt de uitkomst voordat je iets probeert.
Wat voor pdf heb je?
Twee families, die zich heel verschillend gedragen.
| Soort | Zo herken je hem | Gebruikelijke besparing |
|---|---|---|
| Gescand | Tekst is niet te selecteren; inzoomen toont pixels | De helft of meer |
| Digitaal gemaakt | Tekst selecteert netjes; blijft scherp bij inzoomen | Een paar procent |
| Gemengd | Selecteerbare tekst plus grote foto’s | Ergens daartussen |
De test is inzoomen. Tekst die op 400 procent scherp blijft, is echte tekst: een paar kilobyte aan tekens plus een ingesloten lettertype. Tekst die in blokjes uiteenvalt, is een foto van tekst, en een foto van één pagina op 300 dpi is al een paar megabyte voordat er iets anders bij komt.
Wat doet comprimeren in de browser eigenlijk?
Drie concrete dingen, en het is goed om de grens scherp te hebben.
- Het hercodeert de ingesloten JPEG’s op de kwaliteit die je kiest, en daar komt de besparing vandaan.
- Het verkleint afbeeldingen die groter zijn dan de doelmaat, want een scan van 4000 pixels breed op een A4-pagina is veel meer detail dan de pagina kan tonen.
- Het herschrijft de bestandsstructuur met objectstreams en haalt metadata weg, wat een kleine, vaste hoeveelheid oplevert.
Wat het niet doet: tekst opnieuw door OCR halen, lettertypen uitdunnen of vervangen, formuliervelden plat slaan of vectortekeningen omzetten in pixels. Desktopprogramma’s doen daar wel een deel van, en elk van die stappen kan informatie kosten: een plat geslagen formulier is niet meer in te vullen, en een uitgedund lettertype kan het kopiëren van tekst breken.
Daarom levert een al gecomprimeerde pdf nog eens comprimeren vrijwel niets op. Zijn de afbeeldingen eenmaal op lagere kwaliteit gehercodeerd, dan vindt een tweede ronde geen ruimte meer en voegt hij alleen nog verlies toe. Een bestand dat al door een compressor is gegaan, maak je beter opnieuw aan vanuit de bron.
Waarom nemen lettertypen zoveel ruimte in?
Omdat een pdf ze insluit, zodat het document er overal hetzelfde uitziet, en een volledig lettertypebestand met meerdere gewichten loopt op tot honderden kilobytes. In een brief van twee pagina’s kan dat bijna het hele bestand zijn.
Het lettertype uitdunnen, alleen de tekens bewaren die echt voorkomen, is de gebruikelijke oplossing en meestal doet het programma dat de pdf maakte het zelf. Is het niet gebeurd, dan sleept het bestand het hele lettertype mee, inclusief tekens die nergens staan, en dat is een van de weinige gevallen waarin een pdf met alleen tekst onverwacht groot uitvalt.
Wat werkt als niets kleiner wordt?
De bron aanpakken in plaats van het resultaat.
- Scan opnieuw op een lagere resolutie. Tweehonderd dpi is voor bijna elk document goed leesbaar en is 44 procent van de gegevens van 300 dpi.
- Scan in grijstinten of zwart-wit als kleur geen informatie toevoegt. Een kleurenscan van een zwart-witte pagina is drie keer de gegevens voor niets.
- Verklein de afbeeldingen voordat je de pdf maakt, als je hem zelf samenstelt.
- Splits het document. Twee bestanden van 4 MB komen vaak door waar één van 8 MB wordt geweigerd.
Die laatste is het onthouden waard, want de grens is meestal een mailbox of een uploadformulier en niet je schijfruimte, en zulke grenzen gelden per bestand.
Worden mijn scans er wazig van?
Bij hoge kwaliteitsinstellingen niet merkbaar. De hercodering raakt afbeeldingen die meestal veel meer resolutie hebben dan de pagina nodig heeft, dus een scan van 4000 pixels terugbrengen naar 1600 en hercoderen op 70 procent kwaliteit geeft doorgaans een document dat er op het scherm identiek uitziet.
Waar je het wel ziet, is in kleine letters en in alles wat je gaat vergroten. Is het document een contract dat iemand met een loep gaat lezen, bewaar dan het origineel en stuur de gecomprimeerde versie alleen waar de groottegrens dat afdwingt.
Vragen die mensen stellen
Werkt het met bestanden met een wachtwoord? Nee. Een versleutelde pdf is zonder wachtwoord niet te lezen, dus de beveiliging moet eerst worden verwijderd door wie het wachtwoord heeft.
Wordt mijn document geüpload? Nee. Het bestand wordt in de browser gelezen en herschreven en verlaat je apparaat niet, en dat is de belangrijkste reden om voor iets vertrouwelijks een browsertool te gebruiken.
Waarom is het de eerste keer trager? Omdat de bibliotheek die pdf’s leest pas laadt als je hem gebruikt, niet bij het openen van de pagina. Een bestaande pdf lezen vraagt echt om een volledige parser, dus die wordt gedownload zodra je een bestand kiest en niet eerder.
En als de tool zegt dat er niets te besparen valt? Dan is het origineel het beste bestand. Een gecomprimeerde versie van dezelfde grootte heeft voor niets kwaliteit ingeleverd, en dat eerlijk zeggen is beter dan een bestand teruggeven dat 2 procent kleiner is.
Kijk wat er in het bestand zit voordat je beslist wat ermee kan. Pdf verkleinen pakt de gevallen vol afbeeldingen aan, png naar pdf maakt documenten die vanaf het begin de goede grootte hebben, en foto verkleinen is waar je de invoer rechtzet.