Estadística Correlacional Interactiva
  • Inicio
  • Inferencia
    • M01. Datos, medición y variabilidad
    • M02. Probabilidad y distribuciones muestrales
    • M03. Curva normal y puntajes Z
    • M04. Teorema del límite central y error estándar
    • M05. Intervalos de confianza
    • M06. Test de hipótesis y lógica de falsación
    • M07. Hipótesis direccionales y no direccionales
  • Asociación bivariada
    • M08. Asociación, covarianza y correlación de Pearson
    • M09. Inferencia y magnitud de la correlación
    • M10. Correlaciones ordinales: Spearman y Kendall
    • M11. Matrices de correlación y casos perdidos
    • M12. Baterías, consistencia e índices
    • M13. Variables categóricas y tablas de contingencia
    • M14. Chi-cuadrado y magnitud de la asociación
  • Glosario

Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 04

M04. Teorema del límite central y error estándar

Cuando estudiamos una población mediante una muestra, observamos solo una parte de sus personas, hogares u organizaciones. Si seleccionamos otra muestra, probablemente incluiremos casos diferentes y obtendremos un resultado distinto.

En este módulo observarás qué ocurre cuando repetimos muchas veces el mismo procedimiento de muestreo. Verás cómo se forma una distribución de medias, qué mide el error estándar y por qué, bajo ciertas condiciones, esa distribución puede aproximarse a una forma normal.

Pregunta social

¿Por qué dos muestras de la misma población pueden entregar promedios distintos?

Dos equipos realizan encuestas para estimar el ingreso mensual promedio de los hogares de una ciudad. El primer equipo obtiene una media de $790.000. El segundo equipo obtiene una media de $812.000. La diferencia entre ambos resultados no significa necesariamente que uno de los equipos se haya equivocado. Aunque utilicen el mismo procedimiento y seleccionen la misma cantidad de hogares, cada muestra puede contener casos diferentes. Una muestra puede incluir, por azar, más hogares con ingresos altos. Otra puede incluir más hogares con ingresos cercanos o inferiores a la media. Por eso, dos muestras correctamente obtenidas pueden producir medias distintas, y esta variación entre resultados es esperable cuando estudiamos una población a partir de muestras.

Variación no significa sesgo: Las medias pueden cambiar porque cada muestra incluye hogares distintos. Esto no implica necesariamente un error, pero tampoco garantiza que la muestra sea representativa. Una muestra puede variar por azar y, al mismo tiempo, provenir de un procedimiento sesgado.

Idea central

Una muestra produce una sola media. Sin embargo, otra muestra de la misma población puede incluir casos diferentes y entregar un resultado distinto.

Para comprender cuánto puede variar la media, imaginamos que repetimos muchas veces el mismo procedimiento de muestreo. Cada muestra produce una media y, al reunirlas, construimos una distribución muestral. El recorrido es el siguiente:

Población → muestra → media muestral → repetición del muestreo → muchas medias → distribución muestral → error estándar

La distribución muestral permite observar cómo cambian las medias entre muestras. El error estándar resume qué tan dispersas o concentradas se encuentran esas medias.

1

Cada muestra produce una media

Una muestra reúne solo algunos hogares de la población. Cada hogar tiene un ingreso, pero al calcularlos en conjunto obtenemos una sola media:

\[ \bar{x} \]

Si seleccionamos otra muestra del mismo tamaño, pueden cambiar los hogares elegidos y también la media obtenida.

En este proceso, la población, su media \(\mu\) y el tamaño de la muestra permanecen fijos. Lo que cambia es la selección de hogares y, por lo tanto, la media muestral \(\bar{x}\).

Una muestra calculada con más hogares, estudiantes, trabajadores, etc… suele ser menos sensible a la presencia de unos pocos casos particulares.

2

Muchas muestras producen una distribución de medias

Imaginemos que seleccionamos muchas muestras usando siempre la misma población, el mismo tamaño y el mismo método.

Cada muestra produce una media distinta:

\[ \bar{x}_1,\ \bar{x}_2,\ \bar{x}_3,\ \ldots \]

Al reunir todas esas medias, formamos la distribución muestral de la media.

En ella, cada punto representa la media de una muestra completa. Algunas medias quedan sobre \(\mu\) y otras bajo ella, pero generalmente se agrupan alrededor de la media poblacional.

En resumen:

en la población, cada punto representa un hogar; en la distribución muestral, cada punto representa una media muestral.

3

El error estándar resume la variación entre medias

Las medias cambian de una muestra a otra. Algunas quedan por encima de la media poblacional y otras por debajo. El error estándar resume cuánto suelen variar esas medias:

  • un error estándar grande indica mayor dispersión;
  • un error estándar pequeño indica mayor concentración.

En otras palabras, responde: Si repitiéramos muchas veces el muestreo, ¿cuánto cambiarían normalmente las medias?

Al aumentar el tamaño de la muestra, las medias suelen acercarse más a la media poblacional y el error estándar disminuye.

  • Población: muestra los ingresos de todos los hogares.
  • Muestra actual: muestra los ingresos de los hogares seleccionados.
  • Distribución muestral: muestra las medias obtenidas al extraer muchas muestras.
  • Desviación estándar: indica cuánto varían los ingresos individuales.
  • Error estándar: indica cuánto varían las medias entre muestras.

¿Dónde aparece el teorema del límite central?

El teorema del límite central se refiere a la distribución de las medias muestrales.

Bajo condiciones adecuadas, cuando extraemos muchas muestras del mismo tamaño, la distribución de sus medias tiende a aproximarse a una forma normal a medida que aumenta \(n\).

Esto puede ocurrir aunque la población original no tenga forma normal. La aproximación no ocurre a la misma velocidad en todas las poblaciones:

  • si la población es aproximadamente normal, la distribución de las medias puede ser normal incluso con muestras pequeñas;
  • si es moderadamente asimétrica, la aproximación suele mejorar al aumentar \(n\);
  • si presenta asimetría intensa o valores extremos, pueden necesitarse muestras mucho más grandes.
  • la distribución que puede aproximarse a la normal es la formada por las medias muestrales, no por los ingresos individuales .

Cómo se construye el error estándar

Ver en pantalla completa ↗

¿Qué mide el error estándar?

Imaginemos que repetimos muchas veces una encuesta utilizando siempre la misma población; el mismo procedimiento de selección; el mismo tamaño muestral; el mismo estadístico: la media.

Cada muestra produce un resultado diferente. El error estándar de la media resume cuánto varían esos resultados entre una muestra y otra.

En términos más precisos: El error estándar es la desviación estándar de la distribución muestral de la media.

Responde esta pregunta: Si repitiéramos muchas veces el mismo estudio, ¿cuánto variarían normalmente las medias obtenidas?

  • Un error estándar grande indica que las medias están más dispersas.
  • Un error estándar pequeño indica que las medias están más concentradas.

El error estándar no describe cuánto difieren los hogares entre sí. Esa variación se resume mediante la desviación estándar.

Diferencias entre desviación estándar y error estándar
Medida ¿Entre qué valores calcula la variación? ¿Qué describe? Ejemplo
Desviación estándar (\(\sigma\)) Ingresos de hogares individuales La dispersión de los ingresos dentro de la población. Se obtiene calculando la raíz cuadrada de la varianza: \(\sigma=\sqrt{\sigma^2}\) \(\sigma=\$200.000\)
Error estándar (\(SE_{\bar{X}}\)) Medias obtenidas en muestras diferentes Cuánto varía la media de una muestra a otra \(SE_{\bar{X}}=\dfrac{\sigma}{\sqrt{n}}=\$40.000\), con \(n=25\)

¿Por qué disminuye el error estándar?

Cuando cada muestra contiene más hogares, su media depende menos de unos pocos casos particulares. Por eso, las medias obtenidas en distintas muestras tienden a parecerse más y la distribución muestral se concentra. La relación entre el error estándar y el tamaño de la muestra es: \[ SE_{\bar{X}} \propto \frac{1}{\sqrt{n}} \]

Esto significa que la disminución no es lineal: - duplicar \(n\) no reduce el error estándar a la mitad. - para reducirlo aproximadamente a la mitad, debemos multiplicar \(n\) por cuatro.

Ejemplo aplicado · Tamaño muestral y precisión Ver ejemploOcultar ejemplo↓

Supongamos una población de hogares cuyo ingreso mensual tiene:

\[ \mu = \$800.000 \]

\[ \sigma = \$200.000 \]

La desviación estándar de \(\$200.000\) describe cuánto varían los ingresos individuales de los hogares.

Ahora imaginemos que extraemos muchas muestras de esta población. El error estándar indica cuánto variarían las medias obtenidas entre una muestra y otra.

Cuando conocemos la desviación estándar poblacional, se calcula mediante:

\[ SE_{\bar{X}} = \frac{\sigma}{\sqrt{n}} \]

Muestras de 25 hogares

\[ SE_{\bar{X}} = \frac{200.000}{\sqrt{25}} = \frac{200.000}{5} = \$40.000 \]

Las medias de muestras de 25 hogares presentan una variación esperada de aproximadamente \(\$40.000\).

Muestras de 100 hogares

\[ SE_{\bar{X}} = \frac{200.000}{\sqrt{100}} = \frac{200.000}{10} = \$20.000 \]

Al aumentar el tamaño de la muestra de 25 a 100 hogares, el error estándar se reduce a la mitad.

Muestras de 400 hogares

\[ SE_{\bar{X}} = \frac{200.000}{\sqrt{400}} = \frac{200.000}{20} = \$10.000 \]

Las medias calculadas con 400 hogares tienden a quedar más concentradas alrededor de la media poblacional.

Efecto del tamaño muestral sobre el error estándar
Tamaño de la muestra Desviación estándar entre hogares Error estándar entre medias Lectura
\(n=25\) \(\$200.000\) \(\$40.000\) Las medias presentan mayor variación entre muestras.
\(n=100\) \(\$200.000\) \(\$20.000\) Las medias se encuentran más concentradas.
\(n=400\) \(\$200.000\) \(\$10.000\) Las medias presentan menor variación entre muestras.

¿Qué cambia y qué permanece igual?

La desviación estándar poblacional permanece constante:

\[ \sigma = \$200.000 \]

Los hogares no se vuelven más parecidos cuando aumenta \(n\). La dispersión de sus ingresos permanece igual.

Lo que disminuye es el error estándar: las medias calculadas con muestras más grandes tienden a variar menos entre una extracción y otra.

Para reducir el error estándar aproximadamente a la mitad, debemos multiplicar el tamaño muestral por cuatro.

¿Qué significa un error estándar de \(\$10.000\)?

Un error estándar de \(\$10.000\) indica cuánto suelen variar las medias obtenidas en muestras de 400 hogares.

No significa:

  • que la media observada esté equivocada exactamente en \(\$10.000\);
  • que los hogares se encuentren a \(\$10.000\) de la media;
  • que el margen de error sea automáticamente \(\$10.000\);
  • que la muestra esté libre de sesgo.

El error estándar describe la precisión estadística de la media, pero no permite evaluar por sí solo si la muestra representa adecuadamente a la población.

Una muestra grande puede producir una estimación muy precisa, pero incorrecta, si el procedimiento de selección está sesgado.

Fórmulas mínimas y complementarias

Media muestral:

\[ \bar{x}=\frac{\sum_{i=1}^{n}x_i}{n} \]

Error estándar teórico:

\[ SE_{\bar X}=\frac{\sigma}{\sqrt{n}} \]

Error estándar estimado:

\[ \widehat{SE}_{\bar X}=\frac{s}{\sqrt{n}} \]

Aquí (x_i) representa cada caso seleccionado, (n) el tamaño muestral, ({x}) la media de la muestra, () la desviación estándar poblacional, (s) la desviación estándar muestral, (SE) la dispersión esperada de las medias y (c) el factor por el que se multiplica el tamaño muestral.

Código en R y Python
  • R
  • Python
set.seed(123)

media_poblacional <- 800000
desviacion_poblacional <- 200000
tamano_poblacion <- 100000
numero_muestras <- 5000

# Estandariza una población para darle la media y SD elegidas
estandarizar <- function(x, media_objetivo, sd_objetivo) {
  media_objetivo +
    ((x - mean(x)) / sd(x)) * sd_objetivo
}

# Tres poblaciones con igual media y SD, pero distinta forma
tamano_poblacion <- 100000
numero_muestras <- 5000

# Estandariza una población para darle la media y SD elegidas
estandarizar <- function(x, media_objetivo, sd_objetivo) {
  media_objetivo +
    ((x - mean(x)) / sd(x)) * sd_objetivo
}

# Tres poblaciones con igual media y SD, pero distinta forma
poblacion_normal <- estandarizar(
  rnorm(tamano_poblacion),
  media_poblacional,
  desviacion_poblacional
)

poblacion_uniforme <- estandarizar(
  runif(tamano_poblacion),
  media_poblacional,
  desviacion_poblacional
)

poblacion_asimetrica <- estandarizar(
  rlnorm(tamano_poblacion, meanlog = 0, sdlog = 0.9),
  media_poblacional,
  desviacion_poblacional
)

# Extrae muchas muestras y guarda sus medias
simular_medias <- function(poblacion, n, repeticiones) {
  replicate(
    repeticiones,
    mean(sample(poblacion, size = n, replace = TRUE))
  )
}

# Comparación de tamaños muestrales
tamanos <- c(25, 100, 400)

resultados <- data.frame(
  n = tamanos,
  SE_teorico = desviacion_poblacional / sqrt(tamanos),
  SE_empirico = NA_real_
)

medias_por_tamano <- list()

for (i in seq_along(tamanos)) {
  n_actual <- tamanos[i]

  medias <- simular_medias(
    poblacion_asimetrica,
    n = n_actual,
    repeticiones = numero_muestras
  )

  medias_por_tamano[[as.character(n_actual)]] <- medias
  resultados$SE_empirico[i] <- sd(medias)
}

round(resultados, 0)

# Una muestra: SD de casos y SE estimado
muestra <- sample(
  poblacion_asimetrica,
  size = 400,
  replace = TRUE
)

media_muestral <- mean(muestra)
sd_casos <- sd(muestra)
se_estimado <- sd_casos / sqrt(length(muestra))

c(
  media_muestral = media_muestral,
  desviacion_estandar = sd_casos,
  error_estandar_estimado = se_estimado
)

# Población asimétrica
hist(
  poblacion_asimetrica,
  breaks = 50,
  probability = TRUE,
  main = "Distribución de ingresos en la población",
  xlab = "Ingreso"
)

abline(v = media_poblacional, lty = 2)

# Distribución de medias para n = 25
hist(
  medias_por_tamano[["25"]],
  breaks = 35,
  probability = TRUE,
  main = "Distribución muestral de la media: n = 25",
  xlab = "Media muestral"
)

curve(
  dnorm(
    x,
    mean = media_poblacional,
    sd = desviacion_poblacional / sqrt(25)
  ),
  add = TRUE,
  lwd = 2
)

abline(v = media_poblacional, lty = 2)

# Distribución de medias para n = 400
hist(
  medias_por_tamano[["400"]],
  breaks = 35,
  probability = TRUE,
  main = "Distribución muestral de la media: n = 400",
  xlab = "Media muestral"
)

curve(
  dnorm(
    x,
    mean = media_poblacional,
    sd = desviacion_poblacional / sqrt(400)
  ),
  add = TRUE,
  lwd = 2
)

abline(v = media_poblacional, lty = 2)

Python requiere SciPy para la curva normal teórica.

import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import norm

rng = np.random.default_rng(123)

media_poblacional = 800_000
desviacion_poblacional = 200_000
tamano_poblacion = 100_000
numero_muestras = 5_000

def estandarizar(x, media_objetivo, sd_objetivo):
    """Transforma una población para darle la media y SD elegidas."""
    return (
        media_objetivo
        + ((x - np.mean(x)) / np.std(x, ddof=1)) * sd_objetivo
    )

# Tres poblaciones con igual media y SD, pero distinta forma
poblacion_normal = estandarizar(
    rng.normal(size=tamano_poblacion),
    media_poblacional,
    desviacion_poblacional
)

poblacion_uniforme = estandarizar(
    rng.uniform(size=tamano_poblacion),
    media_poblacional,
    desviacion_poblacional
)

poblacion_asimetrica = estandarizar(
    rng.lognormal(
        mean=0,
        sigma=0.9,
        size=tamano_poblacion
    ),
    media_poblacional,
    desviacion_poblacional
)

def simular_medias(poblacion, n, repeticiones):
    """Extrae muestras independientes y devuelve sus medias."""
    return np.array([
        rng.choice(
            poblacion,
            size=n,
            replace=True
        ).mean()
        for _ in range(repeticiones)
    ])

# Comparación de tamaños muestrales
tamanos = [25, 100, 400]
medias_por_tamano = {}

for n in tamanos:
    medias_por_tamano[n] = simular_medias(
        poblacion_asimetrica,
        n=n,
        repeticiones=numero_muestras
    )

    se_teorico = desviacion_poblacional / np.sqrt(n)
    se_empirico = np.std(medias_por_tamano[n], ddof=1)

    print(
        f"n={n}: "
        f"SE teórico=${se_teorico:,.0f}; "
        f"SE simulado=${se_empirico:,.0f}"
    )

# Una muestra: SD de casos y SE estimado
muestra = rng.choice(
    poblacion_asimetrica,
    size=400,
    replace=True
)

media_muestral = np.mean(muestra)
sd_casos = np.std(muestra, ddof=1)
se_estimado = sd_casos / np.sqrt(len(muestra))

print(f"Media muestral: ${media_muestral:,.0f}")
print(f"Desviación estándar: ${sd_casos:,.0f}")
print(f"Error estándar estimado: ${se_estimado:,.0f}")

# Población asimétrica
plt.hist(
    poblacion_asimetrica,
    bins=50,
    density=True
)
plt.axvline(
    media_poblacional,
    linestyle="--"
)
plt.xlabel("Ingreso")
plt.ylabel("Densidad")
plt.title("Distribución de ingresos en la población")
plt.show()

# Distribuciones muestrales para distintos tamaños
for n in [25, 400]:
    medias = medias_por_tamano[n]
    se_teorico = desviacion_poblacional / np.sqrt(n)

    plt.hist(
        medias,
        bins=35,
        density=True
    )

    eje_x = np.linspace(
        media_poblacional - 4 * se_teorico,
        media_poblacional + 4 * se_teorico,
        500
    )

    plt.plot(
        eje_x,
        norm.pdf(
            eje_x,
            loc=media_poblacional,
            scale=se_teorico
        )
    )

    plt.axvline(
        media_poblacional,
        linestyle="--"
    )

    plt.xlabel("Media muestral")
    plt.ylabel("Densidad")
    plt.title(f"Distribución muestral de la media: n = {n}")
    plt.show()
Bibliografía
  • Moore, D. S. (2010). Estadística aplicada básica. Antoni Bosch.
  • Navarro, D. J. Learning Statistics with R.
  • Ritchey, F. J. (2008). Estadística para las ciencias sociales. McGraw-Hill.
← Módulo anterior M03. Curva normal y puntajes Z Siguiente módulo M05. Intervalos de confianza →
Ejecutar el código
---
pagetitle: "M04. Teorema del límite central y error estándar | Estadística Correlacional Interactiva"
page-layout: custom
toc: false
body-class: rs-lesson-page inferencia-module m04-page
format:
  html:
    css:
      - ../assets/css/m04-teorema-limite-central-error-estandar.css
      - ../assets/css/inferencia-modules.css
---

::: {.rs-lesson-page-wrap .m04-module-intro}

::: {.m04-lesson-header}
::: {.inference-module-kicker .m01-module-kicker}
Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 04
:::

# M04. Teorema del límite central y error estándar

::: {.rs-module-lead}
Cuando estudiamos una población mediante una muestra, observamos solo una parte de sus personas, hogares u organizaciones. Si seleccionamos otra muestra, probablemente incluiremos casos diferentes y obtendremos un resultado distinto.

En este módulo observarás qué ocurre cuando repetimos muchas veces el mismo procedimiento de muestreo. Verás cómo se forma una distribución de medias, qué mide el error estándar y por qué, bajo ciertas condiciones, esa distribución puede aproximarse a una forma normal.
:::
:::

::: {.m04-lesson-section #pregunta-social}
## Pregunta social

### ¿Por qué dos muestras de la misma población pueden entregar promedios distintos? {.m04-social-question-title}

```{=html}
<p class="m04-social-question-intro">Dos equipos realizan encuestas para estimar el ingreso mensual promedio de los hogares de una ciudad.

El primer equipo obtiene una media de $790.000.
El segundo equipo obtiene una media de $812.000.

La diferencia entre ambos resultados no significa necesariamente que uno de los equipos se haya equivocado.

Aunque utilicen el mismo procedimiento y seleccionen la misma cantidad de hogares, cada muestra puede contener casos diferentes. Una muestra puede incluir, por azar, más hogares con ingresos altos. Otra puede incluir más hogares con ingresos cercanos o inferiores a la media.

Por eso, dos muestras correctamente obtenidas pueden producir medias distintas, y esta variación entre resultados es esperable cuando estudiamos una población a partir de muestras.</p>
```
:::
> Variación no significa sesgo: Las medias pueden cambiar porque cada muestra incluye hogares distintos. Esto no implica necesariamente un error, pero tampoco garantiza que la muestra sea representativa. Una muestra puede variar por azar y, al mismo tiempo, provenir de un procedimiento sesgado.

::: {.m04-lesson-section #idea-central}
## Idea central

Una muestra produce una sola media. Sin embargo, otra muestra de la misma población puede incluir casos diferentes y entregar un resultado distinto.

Para comprender cuánto puede variar la media, imaginamos que repetimos muchas veces el mismo procedimiento de muestreo. Cada muestra produce una media y, al reunirlas, construimos una distribución muestral. El recorrido es el siguiente:

::: {.rs-callout-warning .rs-callout-warning--m03-cyan-deep}
Población → muestra → media muestral → repetición del muestreo → muchas medias → distribución muestral → error estándar
::: 

La distribución muestral permite observar cómo cambian las medias entre muestras. El error estándar resume qué tan dispersas o concentradas se encuentran esas medias.

::: {.m04-sequence-flow .rs-sequence-flow role="list"}
::: {.m04-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">1</div>
```

### Cada muestra produce una media
Una muestra reúne solo algunos hogares de la población. Cada hogar tiene un ingreso, pero al calcularlos en conjunto obtenemos una sola media:

$$
\bar{x}
$$

Si seleccionamos otra muestra del mismo tamaño, pueden cambiar los hogares elegidos y también la media obtenida.

En este proceso, la población, su media $\mu$ y el tamaño de la muestra permanecen fijos. Lo que cambia es la selección de hogares y, por lo tanto, la media muestral $\bar{x}$.

Una muestra calculada con más hogares, estudiantes, trabajadores, etc... suele ser menos sensible a la presencia de unos pocos casos particulares.
:::

::: {.m04-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">2</div>
```

### Muchas muestras producen una distribución de medias

Imaginemos que seleccionamos muchas muestras usando siempre la misma población, el mismo tamaño y el mismo método.

Cada muestra produce una media distinta:

$$
\bar{x}_1,\ \bar{x}_2,\ \bar{x}_3,\ \ldots
$$

Al reunir todas esas medias, formamos [la distribución muestral de la media.]{.m01-kw}

En ella, cada punto representa la media de una muestra completa. Algunas medias quedan sobre $\mu$ y otras bajo ella, pero generalmente se agrupan alrededor de la media poblacional.

En resumen:

en la población, cada punto representa un hogar;
en la distribución muestral, cada punto representa una media muestral.
:::

::: {.m04-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">3</div>
```

### El error estándar resume la variación entre medias

Las medias cambian de una muestra a otra. Algunas quedan por encima de la media poblacional y otras por debajo. [El error estándar resume cuánto suelen variar esas medias]{.m01-kw}:

- un error estándar grande indica mayor dispersión;
- un error estándar pequeño indica mayor concentración.

En otras palabras, responde: Si repitiéramos muchas veces el muestreo, ¿cuánto cambiarían normalmente las medias?

Al aumentar el tamaño de la muestra, las medias suelen acercarse más a la media poblacional y el error estándar disminuye.
:::

:::

::: {.rs-callout-warning .rs-callout-warning--m03-cyan-deep}
- **Población:** muestra los ingresos de todos los hogares.
- **Muestra actual:** muestra los ingresos de los hogares seleccionados.
- **Distribución muestral:** muestra las medias obtenidas al extraer muchas muestras.
- **Desviación estándar:** indica cuánto varían los ingresos individuales.
- **Error estándar:** indica cuánto varían las medias entre muestras.
::: 

:::

## ¿Dónde aparece el teorema del límite central?

[El teorema del límite central se refiere a la distribución de las medias muestrales.]{.m01-kw}

Bajo condiciones adecuadas, cuando extraemos muchas muestras del mismo tamaño, la distribución de sus medias tiende a aproximarse a una forma normal a medida que aumenta $n$.

Esto puede ocurrir aunque la población original no tenga forma normal. La aproximación no ocurre a la misma velocidad en todas las poblaciones:

- si la población es aproximadamente normal, la distribución de las medias puede ser normal incluso con muestras pequeñas;
- si es moderadamente asimétrica, la aproximación suele mejorar al aumentar $n$;
- si presenta asimetría intensa o valores extremos, pueden necesitarse muestras mucho más grandes.
- la distribución que puede aproximarse a la normal es la formada por las medias muestrales, no por los ingresos individuales .


## Cómo se construye el error estándar

```{=html}
<div id="m04-se-explainer" class="m04-explainer-section"></div>
```

::: {.m04-lesson-section #laboratorio}

```{=html}
<div class="lab-fullscreen-launcher">
  <a class="lab-fullscreen-link" href="../labs/inferencia/m04-teorema-limite-central-laboratorio.html" target="_blank" rel="noopener noreferrer" aria-label="Abrir el Laboratorio del Teorema del Límite Central en una pestaña nueva">
    <span>Ver en pantalla completa</span>
    <span class="lab-fullscreen-link__icon" aria-hidden="true">↗</span>
  </a>
</div>
<div id="m04-lab-root" class="m04-lab-surface m04-lab-breakout" data-lab-id="m04-teorema-limite-central" data-fullscreen-url="../labs/inferencia/m04-teorema-limite-central-laboratorio.html"></div>
```
:::

::: {.m04-lesson-section #explicador-se}

## ¿Qué mide el error estándar?

Imaginemos que repetimos muchas veces una encuesta utilizando siempre la misma población; el mismo procedimiento de selección; el mismo tamaño muestral; el mismo estadístico: la media.

Cada muestra produce un resultado diferente. El error estándar de la media resume cuánto varían esos resultados entre una muestra y otra.

En términos más precisos: El error estándar es la desviación estándar de la distribución muestral de la media.

Responde esta pregunta: Si repitiéramos muchas veces el mismo estudio, ¿cuánto variarían normalmente las medias obtenidas?

- Un error estándar grande indica que las medias están más dispersas.
- Un error estándar pequeño indica que las medias están más concentradas.

El error estándar no describe cuánto difieren los hogares entre sí. Esa variación se resume mediante la desviación estándar.

::: {.m04-table-wrap}
| Medida | ¿Entre qué valores calcula la variación? | ¿Qué describe? | Ejemplo |
| :--- | :--- | :--- | :--- |
| **Desviación estándar ($\sigma$)** | Ingresos de hogares individuales | La dispersión de los ingresos dentro de la población. Se obtiene calculando la raíz cuadrada de la varianza: $\sigma=\sqrt{\sigma^2}$ | $\sigma=\$200.000$ |
| **Error estándar ($SE_{\bar{X}}$)** | Medias obtenidas en muestras diferentes | Cuánto varía la media de una muestra a otra | $SE_{\bar{X}}=\dfrac{\sigma}{\sqrt{n}}=\$40.000$, con $n=25$ |
: Diferencias entre desviación estándar y error estándar {.m04-table}
:::

### ¿Por qué disminuye el error estándar? 
Cuando cada muestra contiene más hogares, su media depende menos de unos pocos casos particulares. Por eso, las medias obtenidas en distintas muestras tienden a parecerse más y la distribución muestral se concentra. La relación entre el error estándar y el tamaño de la muestra es: 
$$ 
SE_{\bar{X}} \propto \frac{1}{\sqrt{n}} 
$$ 

Esto significa que la disminución no es lineal: 
- duplicar $n$ no reduce el error estándar a la mitad.
- para reducirlo aproximadamente a la mitad, debemos multiplicar $n$ por cuatro.


:::




::: {.m04-lesson-section .rs-example-section #ejemplo-aplicado}
<details class="rs-example-disclosure">
<summary class="rs-example-disclosure__summary">
<span class="rs-example-disclosure__heading" role="heading" aria-level="2">Ejemplo aplicado · Tamaño muestral y precisión</span>
<span class="rs-example-disclosure__action"><span class="rs-example-disclosure__show">Ver ejemplo</span><span class="rs-example-disclosure__hide">Ocultar ejemplo</span><span class="rs-example-disclosure__chevron" aria-hidden="true">↓</span></span>
</summary>

::: {.rs-example-disclosure__content}
Supongamos una población de hogares cuyo ingreso mensual tiene:

$$
\mu = \$800.000
$$

$$
\sigma = \$200.000
$$

La desviación estándar de $\$200.000$ describe cuánto varían los ingresos individuales de los hogares.

Ahora imaginemos que extraemos muchas muestras de esta población. El **error estándar** indica cuánto variarían las medias obtenidas entre una muestra y otra.

Cuando conocemos la desviación estándar poblacional, se calcula mediante:

$$
SE_{\bar{X}}
=
\frac{\sigma}{\sqrt{n}}
$$

### Muestras de 25 hogares

$$
SE_{\bar{X}}
=
\frac{200.000}{\sqrt{25}}
=
\frac{200.000}{5}
=
\$40.000
$$

Las medias de muestras de 25 hogares presentan una variación esperada de aproximadamente $\$40.000$.

### Muestras de 100 hogares

$$
SE_{\bar{X}}
=
\frac{200.000}{\sqrt{100}}
=
\frac{200.000}{10}
=
\$20.000
$$

Al aumentar el tamaño de la muestra de 25 a 100 hogares, el error estándar se reduce a la mitad.

### Muestras de 400 hogares

$$
SE_{\bar{X}}
=
\frac{200.000}{\sqrt{400}}
=
\frac{200.000}{20}
=
\$10.000
$$

Las medias calculadas con 400 hogares tienden a quedar más concentradas alrededor de la media poblacional.

::: {.m04-table-wrap}
| Tamaño de la muestra | Desviación estándar entre hogares | Error estándar entre medias | Lectura |
| :--- | :--- | :--- | :--- |
| $n=25$ | $\$200.000$ | $\$40.000$ | Las medias presentan mayor variación entre muestras. |
| $n=100$ | $\$200.000$ | $\$20.000$ | Las medias se encuentran más concentradas. |
| $n=400$ | $\$200.000$ | $\$10.000$ | Las medias presentan menor variación entre muestras. |
: Efecto del tamaño muestral sobre el error estándar {.m04-table}
:::

## ¿Qué cambia y qué permanece igual?

La desviación estándar poblacional permanece constante:

$$
\sigma = \$200.000
$$

Los hogares no se vuelven más parecidos cuando aumenta $n$. La dispersión de sus ingresos permanece igual.

Lo que disminuye es el **error estándar**: las medias calculadas con muestras más grandes tienden a variar menos entre una extracción y otra.

Para reducir el error estándar aproximadamente a la mitad, debemos multiplicar el tamaño muestral por cuatro.

## ¿Qué significa un error estándar de $\$10.000$?

Un error estándar de $\$10.000$ indica cuánto suelen variar las medias obtenidas en muestras de 400 hogares.

No significa:

- que la media observada esté equivocada exactamente en $\$10.000$;
- que los hogares se encuentren a $\$10.000$ de la media;
- que el margen de error sea automáticamente $\$10.000$;
- que la muestra esté libre de sesgo.

::: {.rs-callout-warning .rs-callout-warning--m03-cyan-deep}
El error estándar describe la **precisión estadística** de la media, pero no permite evaluar por sí solo si la muestra representa adecuadamente a la población.

Una muestra grande puede producir una estimación muy precisa, pero incorrecta, si el procedimiento de selección está sesgado.
:::

:::
</details>
:::

::: {.inference-endmatter}
<details class="inference-endmatter__item inference-endmatter__formulas">
<summary><span>Fórmulas mínimas y complementarias</span></summary>

::: {.inference-endmatter__content}

Media muestral:

$$
\bar{x}=\frac{\sum_{i=1}^{n}x_i}{n}
$$

Error estándar teórico:

$$
SE_{\bar X}=\frac{\sigma}{\sqrt{n}}
$$

Error estándar estimado:

$$
\widehat{SE}_{\bar X}=\frac{s}{\sqrt{n}}
$$


Aquí \(x_i\) representa cada caso seleccionado, \(n\) el tamaño muestral, \(\bar{x}\) la media de la muestra, \(\sigma\) la desviación estándar poblacional, \(s\) la desviación estándar muestral, \(SE\) la dispersión esperada de las medias y \(c\) el factor por el que se multiplica el tamaño muestral.

:::
</details>

<details class="inference-endmatter__item inference-endmatter__code">
<summary><span>Código en R y Python</span></summary>

::: {.inference-endmatter__content}

::: {.panel-tabset .rs-code-tabs}

### R {.unnumbered .unlisted}

```r
set.seed(123)

media_poblacional <- 800000
desviacion_poblacional <- 200000
tamano_poblacion <- 100000
numero_muestras <- 5000

# Estandariza una población para darle la media y SD elegidas
estandarizar <- function(x, media_objetivo, sd_objetivo) {
  media_objetivo +
    ((x - mean(x)) / sd(x)) * sd_objetivo
}

# Tres poblaciones con igual media y SD, pero distinta forma
tamano_poblacion <- 100000
numero_muestras <- 5000

# Estandariza una población para darle la media y SD elegidas
estandarizar <- function(x, media_objetivo, sd_objetivo) {
  media_objetivo +
    ((x - mean(x)) / sd(x)) * sd_objetivo
}

# Tres poblaciones con igual media y SD, pero distinta forma
poblacion_normal <- estandarizar(
  rnorm(tamano_poblacion),
  media_poblacional,
  desviacion_poblacional
)

poblacion_uniforme <- estandarizar(
  runif(tamano_poblacion),
  media_poblacional,
  desviacion_poblacional
)

poblacion_asimetrica <- estandarizar(
  rlnorm(tamano_poblacion, meanlog = 0, sdlog = 0.9),
  media_poblacional,
  desviacion_poblacional
)

# Extrae muchas muestras y guarda sus medias
simular_medias <- function(poblacion, n, repeticiones) {
  replicate(
    repeticiones,
    mean(sample(poblacion, size = n, replace = TRUE))
  )
}

# Comparación de tamaños muestrales
tamanos <- c(25, 100, 400)

resultados <- data.frame(
  n = tamanos,
  SE_teorico = desviacion_poblacional / sqrt(tamanos),
  SE_empirico = NA_real_
)

medias_por_tamano <- list()

for (i in seq_along(tamanos)) {
  n_actual <- tamanos[i]

  medias <- simular_medias(
    poblacion_asimetrica,
    n = n_actual,
    repeticiones = numero_muestras
  )

  medias_por_tamano[[as.character(n_actual)]] <- medias
  resultados$SE_empirico[i] <- sd(medias)
}

round(resultados, 0)

# Una muestra: SD de casos y SE estimado
muestra <- sample(
  poblacion_asimetrica,
  size = 400,
  replace = TRUE
)

media_muestral <- mean(muestra)
sd_casos <- sd(muestra)
se_estimado <- sd_casos / sqrt(length(muestra))

c(
  media_muestral = media_muestral,
  desviacion_estandar = sd_casos,
  error_estandar_estimado = se_estimado
)

# Población asimétrica
hist(
  poblacion_asimetrica,
  breaks = 50,
  probability = TRUE,
  main = "Distribución de ingresos en la población",
  xlab = "Ingreso"
)

abline(v = media_poblacional, lty = 2)

# Distribución de medias para n = 25
hist(
  medias_por_tamano[["25"]],
  breaks = 35,
  probability = TRUE,
  main = "Distribución muestral de la media: n = 25",
  xlab = "Media muestral"
)

curve(
  dnorm(
    x,
    mean = media_poblacional,
    sd = desviacion_poblacional / sqrt(25)
  ),
  add = TRUE,
  lwd = 2
)

abline(v = media_poblacional, lty = 2)

# Distribución de medias para n = 400
hist(
  medias_por_tamano[["400"]],
  breaks = 35,
  probability = TRUE,
  main = "Distribución muestral de la media: n = 400",
  xlab = "Media muestral"
)

curve(
  dnorm(
    x,
    mean = media_poblacional,
    sd = desviacion_poblacional / sqrt(400)
  ),
  add = TRUE,
  lwd = 2
)

abline(v = media_poblacional, lty = 2)
```

### Python {.unnumbered .unlisted}

Python requiere SciPy para la curva normal teórica.

```python
import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import norm

rng = np.random.default_rng(123)

media_poblacional = 800_000
desviacion_poblacional = 200_000
tamano_poblacion = 100_000
numero_muestras = 5_000

def estandarizar(x, media_objetivo, sd_objetivo):
    """Transforma una población para darle la media y SD elegidas."""
    return (
        media_objetivo
        + ((x - np.mean(x)) / np.std(x, ddof=1)) * sd_objetivo
    )

# Tres poblaciones con igual media y SD, pero distinta forma
poblacion_normal = estandarizar(
    rng.normal(size=tamano_poblacion),
    media_poblacional,
    desviacion_poblacional
)

poblacion_uniforme = estandarizar(
    rng.uniform(size=tamano_poblacion),
    media_poblacional,
    desviacion_poblacional
)

poblacion_asimetrica = estandarizar(
    rng.lognormal(
        mean=0,
        sigma=0.9,
        size=tamano_poblacion
    ),
    media_poblacional,
    desviacion_poblacional
)

def simular_medias(poblacion, n, repeticiones):
    """Extrae muestras independientes y devuelve sus medias."""
    return np.array([
        rng.choice(
            poblacion,
            size=n,
            replace=True
        ).mean()
        for _ in range(repeticiones)
    ])

# Comparación de tamaños muestrales
tamanos = [25, 100, 400]
medias_por_tamano = {}

for n in tamanos:
    medias_por_tamano[n] = simular_medias(
        poblacion_asimetrica,
        n=n,
        repeticiones=numero_muestras
    )

    se_teorico = desviacion_poblacional / np.sqrt(n)
    se_empirico = np.std(medias_por_tamano[n], ddof=1)

    print(
        f"n={n}: "
        f"SE teórico=${se_teorico:,.0f}; "
        f"SE simulado=${se_empirico:,.0f}"
    )

# Una muestra: SD de casos y SE estimado
muestra = rng.choice(
    poblacion_asimetrica,
    size=400,
    replace=True
)

media_muestral = np.mean(muestra)
sd_casos = np.std(muestra, ddof=1)
se_estimado = sd_casos / np.sqrt(len(muestra))

print(f"Media muestral: ${media_muestral:,.0f}")
print(f"Desviación estándar: ${sd_casos:,.0f}")
print(f"Error estándar estimado: ${se_estimado:,.0f}")

# Población asimétrica
plt.hist(
    poblacion_asimetrica,
    bins=50,
    density=True
)
plt.axvline(
    media_poblacional,
    linestyle="--"
)
plt.xlabel("Ingreso")
plt.ylabel("Densidad")
plt.title("Distribución de ingresos en la población")
plt.show()

# Distribuciones muestrales para distintos tamaños
for n in [25, 400]:
    medias = medias_por_tamano[n]
    se_teorico = desviacion_poblacional / np.sqrt(n)

    plt.hist(
        medias,
        bins=35,
        density=True
    )

    eje_x = np.linspace(
        media_poblacional - 4 * se_teorico,
        media_poblacional + 4 * se_teorico,
        500
    )

    plt.plot(
        eje_x,
        norm.pdf(
            eje_x,
            loc=media_poblacional,
            scale=se_teorico
        )
    )

    plt.axvline(
        media_poblacional,
        linestyle="--"
    )

    plt.xlabel("Media muestral")
    plt.ylabel("Densidad")
    plt.title(f"Distribución muestral de la media: n = {n}")
    plt.show()
```

:::

:::
</details>

<details class="inference-endmatter__item inference-endmatter__references">
<summary><span>Bibliografía</span></summary>

::: {.inference-endmatter__content}

- Moore, D. S. (2010). *Estadística aplicada básica*. Antoni Bosch.
- Navarro, D. J. *Learning Statistics with R*.
- Ritchey, F. J. (2008). *Estadística para las ciencias sociales*. McGraw-Hill.

:::
</details>
:::

```{=html}
<nav class="rs-lesson-footer-nav rs-inference-footer-nav" aria-label="Navegación entre módulos">
  <a href="m03_curva_normal_puntajes_z.qmd" class="rs-nav-link rs-nav-link--previous">
    <span class="rs-nav-link__arrow" aria-hidden="true">←</span>
    <span class="rs-nav-link__copy">
      <span class="rs-nav-link__label">Módulo anterior</span>
      <span class="rs-nav-link__title">M03. Curva normal y puntajes Z</span>
    </span>
  </a>

  <a href="m05_intervalos_confianza.qmd" class="rs-nav-link rs-nav-link--next">
    <span class="rs-nav-link__copy">
      <span class="rs-nav-link__label">Siguiente módulo</span>
      <span class="rs-nav-link__title">M05. Intervalos de confianza</span>
    </span>
    <span class="rs-nav-link__arrow" aria-hidden="true">→</span>
  </a>
</nav>
```
:::

```{=html}
<script src="../assets/js/m04-teorema-limite-central-error-estandar.js"></script>
```

Estadística Correlacional Interactiva
Facultad de Ciencias Sociales
Departamento de Sociología
Universidad de Chile

Volver arriba

Sitio creado por Katherine Aravena .

Código bajo licencia MIT · Ver repositorio en GitHub