Calculadora de desviación estándar
La desviación muestral divide la suma de desviaciones al cuadrado entre n−1 en lugar de entre n. La media muestral está ajustada a esos mismos datos, así que las desviaciones medidas desde ella son sistemáticamente algo pequeñas; dividir entre uno menos lo compensa. Usa la cifra muestral cuando tus números sean una muestra de algo mayor, que es casi siempre. Usa la poblacional solo cuando la lista sea de verdad el grupo entero.
La desviación estándar mide la dispersión en torno a la media. La cifra muestral divide la suma de desviaciones al cuadrado entre n−1; la poblacional divide entre n. Los siete valores por defecto dan 6,324555 y 5,855400, una diferencia del 8 %, y ambas convergen a medida que la lista crece.
Cómo calcular la desviación estándar
Las dos filas de desviación se diferencian en un factor de √(n ÷ (n−1)) y en nada más. Con los siete valores por defecto eso es √(7/6), así que 5,8554 pasa a 6,3246, una diferencia del 8 por ciento. Con veinte valores la diferencia es del 2,6 por ciento y con quinientos es de una décima de uno por ciento, así que la elección entre las dos deja de importar mucho antes de que la mayoría deje de preocuparse por ella.
Qué repara exactamente el n−1
Repara la varianza, y solo la varianza. Las desviaciones al cuadrado se miden desde la media muestral, y la media muestral es justo el valor que hace su suma lo más pequeña que puede ser para estos datos; medirlas desde la media verdadera daría un total mayor. Dividir entre n−1 en lugar de entre n escala ese defecto con exactitud, y la varianza resultante es insesgada.
Una desviación estándar no lo es, porque sacar la raíz cuadrada no conserva la corrección. En promedio, la desviación muestral se queda por debajo de la verdadera, y el tamaño del defecto es una constante conocida de n: alrededor de un 6 por ciento baja con n = 5, un 2,7 por ciento con n = 10, un 1 por ciento con n = 25 y una vigésima parte de uno por ciento ya con n = 500. La ingeniería de calidad lleva un siglo tabulando esa constante con el nombre de c₄, porque de lo contrario un gráfico de control construido sobre subgrupos de cinco piezas quedaría sistemáticamente demasiado estrecho.
Cuándo el número deja de describir los datos
Una desviación estándar resume en un solo número una dispersión simétrica, así que vale exactamente lo que valga esa simetría. Comparar la media con la mediana es la prueba más barata que existe. Si están cerca, la cifra describe los datos con honestidad. Si la media queda muy por encima de la mediana, unos pocos valores grandes tiran de ella: la renta de los hogares es el ejemplo de manual, donde la media, la desviación estándar y todas las reglas de andar por casa construidas sobre ellas describen una distribución en la que no vive nadie de los datos. Ahí los cuartiles o el rango intercuartílico dicen más que cualquier cifra única de dispersión.
Para qué la usa la gente
- Resumir un conjunto de mediciones
- Comprobar si un proceso está funcionando de forma consistente
- Calcular cuán inusual es un valor concreto
- Leer con criterio una media y una desviación publicadas
Preguntas
El denominador. La muestral divide entre n−1 para compensar que las desviaciones se miden desde una media ajustada a esos mismos datos; la poblacional divide entre n y da por supuesto que la lista es el grupo entero.
La muestral, casi siempre. Tener todos los miembros de una población es lo bastante raro como para que la poblacional sea el valor por defecto equivocado.
En un factor de √(n ÷ (n−1)): un 12 % con n = 5, un 2,6 % con n = 20, un 0,25 % con n = 200 y nada que reportarías más allá de eso.
La distancia típica de un valor a la media. En datos aproximadamente normales, en torno al 68 % de los valores cae dentro de una desviación y el 95 % dentro de dos; en datos que no son normales, no se cumple ninguna de las dos cifras.
La desviación estándar al cuadrado. La varianza es lo que la matemática suma limpiamente; la desviación es lo que se reporta, porque está de vuelta en las unidades originales.
Por la asimetría. Unos pocos valores extremos mueven la media y apenas rozan la mediana, así que el tamaño de la diferencia es una lectura rápida de lo sesgados que están los datos.
La varianza sí. La desviación no, y se queda ligeramente baja: alrededor de un 6 % con n = 5 y por debajo del 1 % pasado n = 25.