Por qué tu PDF no se reduce

Casi todo el peso de un PDF grande son imágenes. Un documento escaneado es un montón de fotografías y se comprime muchísimo; un informe maquetado con un procesador de textos es texto, vectores y datos de fuentes, y ahí hay muy poco que quitar. Si un PDF de 3 MB apenas cambia al comprimirlo, es porque ya estaba casi tan pequeño como permite su contenido.

Saber qué tipo de archivo tienes cuesta un vistazo, y predice el resultado antes de probar nada.

¿Qué tipo de PDF tienes?

Dos familias, que se comportan de forma completamente distinta.

Tipo Cómo se reconoce Ahorro típico
Escaneado El texto no se puede seleccionar; al ampliar se ven píxeles La mitad o más
Nativo de texto El texto se selecciona limpio; al ampliar sigue nítido Unos pocos por ciento
Mixto Texto seleccionable más fotografías grandes Algo intermedio

La prueba es ampliar. Un texto que sigue nítido al 400 por ciento es texto de verdad: unos pocos kilobytes de caracteres más una fuente incrustada. Un texto que se convierte en bloques de píxeles es una foto de un texto, y una foto de una página a 300 ppp pesa varios megas antes de añadir nada más.

¿Qué hace de verdad la compresión en el navegador?

Tres cosas concretas, y conviene tener clara la frontera.

  • Recodifica los JPEG incrustados a la calidad que elijas, que es de donde sale el ahorro.
  • Reduce las imágenes que son más grandes que la dimensión objetivo, porque un escaneo de 4000 píxeles de ancho en una página A4 es mucho más detalle del que la página puede mostrar.
  • Reescribe la estructura del archivo con flujos de objetos y quita metadatos, lo que recupera una cantidad pequeña y constante.

Lo que no hace: volver a pasar el texto por OCR, recortar o sustituir fuentes, aplanar campos de formulario ni convertir dibujos vectoriales en mapas de bits. Las herramientas de escritorio hacen algunas de esas cosas, y cada una puede perder información: un formulario aplanado ya no se puede rellenar, y una fuente recortada puede romper la extracción de texto.

Por eso comprimir un PDF ya comprimido no consigue casi nada. Una vez recodificadas las imágenes a menor calidad, repetir el proceso no encuentra margen y solo añade otra ronda de pérdida, así que un archivo que ya pasó por un compresor debería regenerarse desde su origen en lugar de comprimirse otra vez.

¿Por qué ocupan tanto las fuentes?

Porque un PDF las incrusta para que el documento se vea igual en todas partes, y un archivo de fuente completo con varios pesos llega a cientos de kilobytes. En una carta de dos páginas eso puede ser casi todo el archivo.

Recortar la fuente, quedándose solo con los caracteres que se usan de verdad, es la solución habitual y normalmente la aplica el programa que generó el PDF. Cuando no se ha hecho, el archivo lleva la tipografía entera, incluidos caracteres que nunca aparecen, y ese es uno de los pocos casos en que un PDF solo de texto es inesperadamente grande.

¿Qué funciona cuando nada se reduce?

Atacar el origen en lugar del resultado.

  1. Vuelve a escanear a menor resolución. Doscientos ppp son legibles para casi cualquier documento y suponen el 44 por ciento de los datos de 300 ppp.
  2. Escanea en escala de grises o en blanco y negro cuando el color no aporta información. Un escaneo en color de una página en blanco y negro son tres veces los datos a cambio de nada.
  3. Reduce las imágenes antes de crear el PDF, si lo montaste tú.
  4. Divide el documento. Dos archivos de 4 MB suelen pasar donde uno de 8 MB no.

El último conviene recordarlo porque la limitación suele ser un correo o una sede electrónica y no el espacio en disco, y esos límites se aplican por archivo.

¿Me dejará borrosos los escaneos?

Con ajustes de calidad altos, no de forma apreciable. La recodificación se aplica a imágenes que suelen tener mucha más resolución de la que necesita la página, así que pasar un escaneo de 4000 píxeles a 1600 y recodificarlo al 70 por ciento de calidad suele dar un documento que en pantalla se ve idéntico.

Donde se nota es en la letra pequeña y en todo lo que vayas a ampliar. Si el documento es un contrato que alguien va a leer con lupa, guarda el original y manda la versión comprimida solo donde el límite de tamaño lo exija.

Preguntas que hace la gente

¿Funciona con archivos protegidos con contraseña? No. Un PDF cifrado no se puede leer sin la contraseña, así que la protección tiene que quitarla antes quien la tenga.

¿Se sube mi documento? No. El archivo se lee y se reescribe en el navegador y no sale nunca del dispositivo, que es la razón principal para usar una herramienta en el navegador con cualquier cosa confidencial.

¿Por qué la primera vez va más lenta? Porque la biblioteca que lee los PDF se carga la primera vez que se usa y no al abrir la página. Leer un PDF existente necesita de verdad un analizador completo, así que se descarga al elegir un archivo y no antes.

¿Y si la herramienta dice que no hay nada que ahorrar? Entonces el original es el mejor archivo. Una versión comprimida del mismo tamaño que el original ha perdido calidad para nada, y es más honesto decirlo que devolver un archivo un 2 por ciento más pequeño.

Mira qué hay dentro del archivo antes de decidir qué se puede hacer con él. Comprimir PDF se ocupa de los casos llenos de imágenes, PNG a PDF crea documentos del tamaño adecuado desde el principio, y Redimensionar imágenes es donde se arreglan las entradas.