Lo que te compra de verdad la frecuencia de muestreo

Una frecuencia de muestreo capta frecuencias hasta la mitad de sí misma, el límite de Nyquist, así que 44,1 kHz llega a 22,05 kHz, holgadamente por encima del techo del oído humano. Pasar a 96 kHz cuesta el doble de almacenamiento y da un margen que nadie oye directamente. El bitrate sin comprimir es frecuencia de muestreo × profundidad de bits × canales, así que 48 kHz a 24 bits en estéreo son 2.304 kbps y una hora roza el gigabyte.

Eso no hace inútiles las frecuencias altas. Hace que su ventaja sea indirecta, y que convenga decirla con precisión en lugar de darla por supuesta.

¿Qué dice la cuenta?

El tamaño sin comprimir es frecuencia × profundidad de bits × canales × segundos ÷ 8. Las cifras cuentan el mega como 1.048.576 bytes, igual que la calculadora.

Formato Bitrate Una hora
44,1 kHz, 16 bits, estéreo 1.411 kbps ~605 MB
44,1 kHz, 24 bits, estéreo 2.117 kbps ~908 MB
48 kHz, 24 bits, estéreo 2.304 kbps ~988 MB
96 kHz, 24 bits, estéreo 4.608 kbps ~1,93 GB
320 kbps comprimido 320 kbps ~137 MB

El almacenamiento crece de forma lineal con los tres factores, lo que hace la decisión fácil de razonar y fácil de equivocar por un factor de cuatro sin darse cuenta.

¿Cuál es el argumento de verdad para frecuencias altas?

El margen del filtro. Un conversor necesita un filtro antialiasing por debajo de la mitad de la frecuencia de muestreo, y ese filtro no puede ser infinitamente abrupto, así que a 44,1 kHz tiene que hacer su trabajo en la estrecha franja entre unos 20 y 22 kHz.

Una frecuencia más alta lleva ese filtro muy por encima de lo audible, donde su comportamiento de fase y su rizado no pueden interferir con nada que oigas. Con el procesado pasa lo mismo: algunos plugins no lineales generan armónicos por encima de Nyquist que se pliegan de vuelta como aliasing, y trabajar a una frecuencia mayor aparta esos artefactos.

Los dos son argumentos sobre la cadena de producción, no sobre el archivo entregado. Por eso la convención profesional es grabar y mezclar alto y entregar a 44,1 o 48 kHz.

¿Qué cambia la profundidad de bits?

El rango dinámico, no la frecuencia. Cada bit son unos 6 dB, así que 16 bits dan unos 96 dB de rango y 24 bits unos 144.

Noventa y seis decibelios es más que suficiente para un máster terminado. Donde se gana su sueldo el de 24 bits es en la grabación, donde quieres dejar mucho margen por debajo de la saturación y seguir teniendo un suelo de ruido bajo: con 24 bits puedes grabar 20 dB por debajo y no perder nada que importe.

Es el mismo trato que hacer una foto con margen para subir la exposición: la profundidad de más es un seguro durante la captura, no calidad en la entrega.

El número de canales lo multiplica todo y es el factor que más se olvida. Un par estéreo es el doble que un archivo mono; una mezcla 5.1 son seis veces; y una sesión ambisónica o basada en objetos puede tener docenas de canales, y ahí la cuenta del almacenamiento deja de ser un detalle y empieza a mandar sobre la configuración del proyecto.

¿Qué frecuencia debería usar un proyecto?

La del destino, y quedarse ahí. El vídeo es 48 kHz casi sin excepción; la distribución de música es 44,1 kHz; las dos se convierten desde la frecuencia a la que fuera la sesión, y cada conversión es un remuestreo.

Lo que conviene evitar son los cambios de frecuencia repetidos. Cada remuestreo es una interpolación, y aunque uno bueno es transparente, una cadena de cuatro en un flujo de trabajo no le hace ningún favor al material.

¿Qué quita de verdad la compresión?

El detalle que el codificador predice que no vas a echar en falta, elegido por un modelo psicoacústico y no por frecuencia. Los sonidos fuertes enmascaran a los más débiles cercanos en frecuencia y en tiempo, y un códec con pérdida gasta sus bits en lo que sigue siendo audible después de contar ese enmascaramiento.

Por eso el mismo bitrate suena muy distinto según el material. Una mezcla densa esconde muchísimo; un instrumento solo con silencio alrededor no esconde casi nada, y es donde más fácil se oyen los artefactos de bitrate bajo.

Preguntas que hace la gente

¿320 kbps es transparente? Para casi todos los oyentes y casi todo el material, sí. Las diferencias audibles que quedan están en contenidos concretos y difíciles, aplausos, platillos, algunas síntesis, no en general.

¿Una frecuencia de muestreo más alta mejora los graves? No. Los graves no están ni cerca del límite de Nyquist a ninguna frecuencia habitual. Reproducir bien los graves es un problema de monitores y de sala, no de muestreo.

¿Qué es exactamente Nyquist? El teorema según el cual una señal limitada en banda por debajo de la mitad de la frecuencia de muestreo se puede reconstruir exactamente a partir de sus muestras. El matiz práctico está en «limitada en banda»: lo que haya por encima del límite hay que filtrarlo antes de muestrear, no después.

¿Por qué 44,1 y no 44? Viene de meter audio digital en cinta de vídeo durante el desarrollo del CD, donde las líneas y los fotogramas disponibles daban justo esa cifra. Es un vestigio del hardware de los años setenta que ha sobrevivido medio siglo al hardware.

¿Remuestreo al alza una grabación antigua? No gana nada que no se captara. Subir la frecuencia puede hacer que una etapa de procesado posterior se porte mejor, pero no recupera el ancho de banda que el original nunca tuvo.

¿Importa el dithering? Al reducir la profundidad de bits, sí. Truncar 24 bits a 16 produce un error de cuantificación correlacionado que suena peor que el ruido por el que lo cambia el dither, y por eso es el último paso de un máster y no una opción.

La frecuencia fija el ancho de banda, la profundidad fija el rango dinámico, y ninguna de las dos es la razón de que una grabación suene bien. Las dos cuentas salen de una sola página: la calculadora de tamaño de archivo toma una frecuencia, una profundidad y un número de canales, da el bitrate sin comprimir y lo convierte en megas por minuto y por hora. El límite de Nyquist lo haces de cabeza: es la mitad de la frecuencia.