La varianza es una medida de dispersión que cuantifica la variabilidad de un conjunto de datos alrededor de su media aritmética. Se define como el promedio de los cuadrados de las desviaciones de cada dato respecto a la media. Es una de las medidas de dispersión más fundamentales y utilizadas en estadística descriptiva e inferencial, proporcionando una idea de cuán dispersos o concentrados están los valores en una distribución. Un valor de varianza alto indica que los datos están muy dispersos, mientras que un valor bajo sugiere que están agrupados cerca de la media.
Para una población completa, la varianza se denota con la letra griega sigma al cuadrado (\(\sigma^2\)). Su fórmula se expresa como \(\sigma^2 = \frac{\sum_{i=1}^{N} (x_i - \mu)^2}{N}\), donde \(x_i\) representa cada valor individual en la población, \(\mu\) es la media poblacional y \(N\) es el tamaño total de la población. Cuando se trabaja con una muestra de datos extraída de una población, la varianza muestral se denota como \(s^2\). Para obtener una estimación insesgada de la varianza poblacional a partir de una muestra, se aplica la corrección de Bessel, dividiendo la suma de los cuadrados de las desviaciones por \(n-1\) (donde \(n\) es el tamaño de la muestra) en lugar de \(n\). Así, la fórmula para la varianza muestral es \(s^2 = \frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n-1}\), siendo \(\bar{x}\) la media muestral.
Una característica importante de la varianza es que sus unidades de medida son el cuadrado de las unidades originales de los datos. Por ejemplo, si los datos se miden en kilogramos, la varianza se expresará en kilogramos cuadrados. Esta propiedad hace que la varianza sea a menudo menos intuitiva de interpretar directamente en el contexto original de los datos. Por esta razón, se recurre frecuentemente a la desviación típica (o estándar), que es la raíz cuadrada positiva de la varianza (\(\sigma = \sqrt{\sigma^2}\) para la población y \(s = \sqrt{s^2}\) para la muestra). La desviación típica devuelve la medida de dispersión a las unidades originales, facilitando una comprensión más directa de la magnitud de la dispersión de los datos.