PDF verkleinen
Je bestand verlaat dit apparaat niet
Het grootste deel van een grote PDF bestaat uit afbeeldingen. Deze tool decodeert elke ingesloten JPEG, verkleint hem als hij groter is dan het doel, codeert hem opnieuw op de kwaliteit die je kiest en herschrijft daarna het bestand met objectstreams en met de documentgegevens leeggemaakt. Gescande documenten worden doorgaans de helft kleiner of meer; een PDF met alleen tekst wint een paar procent. Zet meerdere bestanden tegelijk neer en de resultaten komen terug als ZIP.
Zo verklein je een PDF
Precies weten wat dit doet, is wat je laat voorspellen of het helpt. Het doorzoekt het document op ingesloten afbeeldingen en codeert er precies één soort opnieuw: gewone JPEG-data, in gewone kleur of gewoon grijs, zonder aangepaste decodeertabel. Elke zo’n afbeelding wordt gedecodeerd, verkleind als de langste zijde het doel overschrijdt, opnieuw gecodeerd op de gekozen kwaliteit en alleen teruggezet als het resultaat echt kleiner is. Daarna wordt het hele bestand herschreven met objectstreams, met de velden titel, auteur, onderwerp, trefwoorden, producent en maker leeggemaakt.
Al het andere blijft precies zoals het was. Vectorillustraties, lettertypen, formuliervelden en tekst worden niet aangeraakt. Afbeeldingen die op een andere manier zijn opgeslagen ook niet, en die groep is groter dan je zou denken: verliesvrije afbeeldingen in PNG-stijl binnen een PDF, JPEG 2000-afbeeldingen, afbeeldingen in een CMYK-kleurruimte, en de fax-achtige zwart-witcodering die veel documentscanners voor zwart-witpagina’s gebruiken. Een PDF die alleen daaruit bestaat, komt terug met alleen de structurele winst.
Daardoor is het antwoord op ‘waarom gebeurde er niets’ bijna altijd hetzelfde. Een rapport vol tekst is al efficiënt gecomprimeerd en er zijn geen beeldgegevens om aan te werken. Een grijze scan is een half geval: opnieuw coderen gaat via een kleurencanvas, dus de vervanging is vaak niet kleiner dan het origineel en wordt meteen weggegooid. Als de uitvoer groter zou worden dan de invoer, wordt het hele bestand afgewezen in plaats van aangeboden, omdat een groter bestand met het label ‘verkleind’ erger is dan zeggen dat er niets te doen viel.
Wat het bewust niet doet, is het rijtje dingen dat desktoptools doen en waarbij ongemerkt informatie verloren gaat: het haalt tekst niet opnieuw door OCR, snoeit of schrapt geen lettertypen, maakt formuliervelden niet plat, zet vectorillustraties niet om naar bitmaps en gooit geen lagen weg. Elk daarvan scheelt ruimte, en elk daarvan kan iets weggooien wat je nodig had.
Eén bijeffect lijkt een privacyvoordeel en is dat maar half. Wat wordt leeggemaakt, is het documentinformatiewoordenboek: de zes velden die een lezer onder Eigenschappen toont, inclusief Auteur en Producent. De meeste PDF’s uit een tekstverwerker, een opmaakprogramma of Acrobat hebben dezelfde informatie nog een keer in een XMP-metadatapakket, en dat pakket blijft zoals het was. Het eigenschappenvenster kan dus leeg zijn terwijl de naam nog in de bytes staat. Zie dit als opruimen, niet als anonimiseren.
Uploadlimieten
De meest voorkomende reden om een PDF te verkleinen is een uploadformulier: een portaal van een gemeente, een hypotheekadviseur of een vacaturesite dat per bijlage een maximale grootte hanteert. Een contract of loonstrook die met de telefoon is gescand, zit daar vaak ruim boven, en omdat zo’n bestand bijna helemaal uit JPEG bestaat, is dat precies het geval waarin deze tool het meeste wint.
Waar mensen het voor gebruiken
- Een scan onder de bijlagenlimiet van de mail krijgen
- Voldoen aan de uploadlimiet van een portaal van een instantie of bank
- Een met de telefoon gescand contract verkleinen voordat je het doorstuurt
- Een rapport vol foto’s lichter maken voor een trage verbinding
- Een bestand verkleinen zonder het document aan een webdienst te geven
- De velden Auteur en Producent leegmaken die een lezer onder Eigenschappen toont
Vragen
Omdat hij vooral uit tekst en vectoren bestaat, en die zijn al efficiënt gecomprimeerd. Zonder geschikte beeldgegevens om opnieuw te coderen, blijft alleen de structurele winst van een paar procent over.
Gewone JPEG-data in gewone kleur of gewoon grijs. Al het andere in het bestand blijft ongemoeid.
Veel documentscanners slaan zwart-witpagina’s op met een fax-achtige zwart-witcodering in plaats van als JPEG. Dat is al heel compact en wordt hier niet aangeraakt.
Die worden overgeslagen. Ze opnieuw coderen via een canvas in de browser zou ze naar schermkleur omzetten en veranderen hoe het document wordt afgedrukt, en dat is geen ruil om stilletjes te maken.
Opnieuw coderen gaat via een kleurencanvas, dus de vervanging is vaak niet kleiner dan het grijze origineel. Als dat gebeurt, blijft het origineel staan.
Op kwaliteit 70 en 1600 pixels aan de langste zijde blijft een gescande pagina op het scherm en bij afdrukken op normaal formaat goed leesbaar. Zet beide schuiven hoger als je archiefkwaliteit nodig hebt.
Kwaliteit loopt van 30 tot 95, en de langste zijde van 600 tot 3000 pixels. Als je een van beide verandert, wordt de hele reeks opnieuw verwerkt.
Kwaliteit 85 en minstens 2400 aan de langste zijde, ongeveer 205 dpi over een A4-pagina. De standaard 1600 komt uit rond 137 dpi: prima op het scherm en zichtbaar zacht op papier.
Ja. Zet er zoveel neer als je wilt. Ze worden na elkaar verwerkt en komen terug als één ZIP, omdat browsers een reeks losse downloads tegenhouden.
Dan wordt het weggegooid en krijg je te horen dat het bestand al ongeveer zo klein is als het kan. Je origineel is dan het betere bestand.
Nee. Tekst, lettertypen, vectorillustraties, formuliervelden en de paginageometrie blijven onaangeroerd. Alleen de beeldgegevens en de bestandsstructuur veranderen.
Zes velden uit het documentinformatiewoordenboek: titel, auteur, onderwerp, trefwoorden, producent en maker. Er verdwijnt niets wat op een pagina zichtbaar is.
Nee. Alleen het informatiewoordenboek wordt leeggemaakt. Een PDF uit een tekstverwerker of opmaakprogramma heeft dezelfde gegevens meestal nog een keer in een XMP-pakket, en dat blijft staan.
Het bestand herschrijven maakt elke bestaande handtekening ongeldig, net als bij elke tool die de bytes verandert. Onderteken na het verkleinen, niet ervoor.
Nee. Een versleutelde PDF moet eerst worden ontgrendeld, en dat kun alleen jij.
De bibliotheek die PDF’s leest, wordt gedownload zodra je voor het eerst een bestand kiest. Hij is ongeveer 175 KB, wordt één keer geladen voor de hele reeks en staat daarna in de cache.
Dat rastert het hele document, dus de tekst is geen tekst meer maar een plaatje van tekst. Kleiner, en niet meer doorzoekbaar of selecteerbaar.
De grens is het geheugen, niet een vast getal, omdat het hele document in de browser wordt vastgehouden terwijl het wordt herschreven. Een telefoon geeft het eerder op dan een laptop.
Nee. Alles gebeurt op deze pagina. De parser wordt naar je browser gedownload als je een bestand kiest; het bestand zelf gaat nergens heen.