Estadística Correlacional Interactiva
  • Inicio
  • Inferencia
    • M01. Datos, medición y variabilidad
    • M02. Probabilidad y distribuciones muestrales
    • M03. Curva normal y puntajes Z
    • M04. Teorema del límite central y error estándar
    • M05. Intervalos de confianza
    • M06. Test de hipótesis y lógica de falsación
    • M07. Hipótesis direccionales y no direccionales
  • Asociación bivariada
    • M08. Asociación, covarianza y correlación de Pearson
    • M09. Inferencia y magnitud de la correlación
    • M10. Correlaciones ordinales: Spearman y Kendall
    • M11. Matrices de correlación y casos perdidos
    • M12. Baterías, consistencia e índices
    • M13. Variables categóricas y tablas de contingencia
    • M14. Chi-cuadrado y magnitud de la asociación
  • Glosario

Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 05

M05. Intervalos de confianza

Como hemos visto, una muestra entrega una estimación de la media poblacional, pero otra muestra podría producir un resultado diferente. Por eso, informar solo la media no muestra cuánta incertidumbre existe.

En este módulo aprenderás a construir un intervalo de confianza alrededor de una estimación, distinguir el error estándar del margen de error e interpretar correctamente qué significa un nivel de confianza del 95%.

Pregunta social

¿Qué información falta cuando comunicamos solamente un promedio?

Una encuesta obtiene un ingreso medio de $800.000. Este valor estima la media de la población, pero podría cambiar si se seleccionara otra muestra. Para mostrar esa incertidumbre, podemos construir un intervalo entr: $795.000 y $805.000. La media muestral entrega una estimación puntual. El intervalo muestra un rango de valores posibles alrededor de ella. La media poblacional es desconocida, mientras que la media muestral y el intervalo pueden cambiar entre muestras.

Idea central

Una muestra entrega una estimación puntual de la media poblacional. Como otra muestra podría producir un resultado diferente, utilizamos un intervalo para representar la incertidumbre de esa estimación. El intervalo busca estimar la media de la población.

El proceso puede resumirse así:

Población → parámetro desconocido → muestra → media muestral → error estándar → nivel de confianza → valor crítico → margen de error → intervalo de confianza

El error estándar indica cuánto suelen variar las medias entre muestras. El nivel de confianza determina el valor crítico, es decir, cuántos errores estándar se utilizarán a cada lado de la media muestral.

Con ambos elementos calculamos el margen de error:

\[ ME = \text{valor crítico}\times SE \]

Luego, sumamos y restamos el margen de error a la media muestral para obtener los límites del intervalo

\[ IC = [\bar{x}-ME;\ \bar{x}+ME] \]

Por lo tanto, el error estándar y el margen de error no son lo mismo:

  • el error estándar describe la variación esperada de la media entre muestras;
  • el margen de error determina cuánto se extiende el intervalo a cada lado de la media muestral.
1

De una media a un intervalo

La media poblacional:

\[ \mu \]

es un parámetro, es decir, una característica numérica de toda la población. Por lo general, no conocemos su valor porque no podemos observar a todas las personas.

Por eso, seleccionamos una muestra y calculamos su media:

\[ \bar{x} \]

La media muestral \(\bar{x}\) es una estimación puntual de la media poblacional \(\mu\). Sin embargo, otra muestra podría producir una media diferente.

Para representar esta incertidumbre, construimos un intervalo alrededor de \(\bar{x}\):

\[ IC = [\text{límite inferior};\ \text{límite superior}] \]

En este módulo, la media muestral se encuentra en el centro del intervalo. La distancia entre la media y cada uno de sus límites se denomina margen de error.

2

De un intervalo a muchos intervalos

Cada muestra puede producir:

  • una media muestral diferente;
  • un error estándar diferente;
  • un margen de error diferente;
  • límites distintos.

Por eso, cada muestra genera su propio intervalo de confianza.

Si repitiéramos muchas veces el mismo procedimiento de muestreo, algunos intervalos contendrían la media poblacional \(\mu\) y otros no.

Un nivel de confianza del 95 % significa que, a largo plazo, aproximadamente el 95 % de los intervalos construidos mediante este procedimiento contendría el parámetro poblacional.

La media poblacional \(\mu\) permanece fija. Los intervalos son los que cambian de una muestra a otra.

Una vez construido un intervalo particular, este contiene o no contiene a \(\mu\). El 95 % se refiere al funcionamiento del procedimiento a largo plazo, no a la probabilidad de que \(\mu\) esté dentro de ese intervalo específico.

3

De la confianza a la precisión

La amplitud de un intervalo depende principalmente de:

  • el nivel de confianza;
  • el tamaño de la muestra;
  • la dispersión de los datos.

Si mantenemos constantes el tamaño de la muestra y la dispersión, un nivel de confianza mayor requiere un valor crítico más grande. Por eso, aumenta el margen de error y el intervalo se vuelve más ancho.

Por ejemplo, con los mismos datos, un intervalo de confianza del 99 % suele ser más amplio que uno del 95 %.

En cambio, si mantenemos fijo el nivel de confianza, una muestra más grande reduce el error estándar y suele producir un intervalo más estrecho.

Por lo tanto:

  • mayor confianza: mayor cobertura esperada, pero un intervalo más amplio;
  • mayor precisión: un intervalo más estrecho.

Un intervalo estrecho indica mayor precisión, pero no garantiza que la muestra represente correctamente a la población. Una muestra grande y sesgada puede producir un intervalo muy estrecho alrededor de una estimación incorrecta.

Recordario: El valor crítico indica cuántos errores estándar se suman y restan a la media muestral para construir un intervalo con el nivel de confianza elegido.

\[ ME=\text{valor crítico}\times SE \]

Para un intervalo del 95 % basado en la distribución normal:

\[ z^*=1{,}96 \]

Por lo tanto:

\[ IC=\bar{x}\pm1{,}96SE \]

A mayor nivel de confianza, mayor valor crítico y más amplio será el intervalo:

90 %: \(1{,}645\) 95 %: \(1{,}96\) 99 %: \(2{,}576\)

Laboratorio de Intervalos de Confianza

Extrae muestras repetidas, construye un intervalo alrededor de cada media y observa cómo el nivel de confianza, el tamaño muestral, la dispersión y el tipo de selección modifican su ancho y su cobertura.

Ver en pantalla completa ↗

Cómo se construye un intervalo

¿Qué significa un 95% de confianza?

Imaginemos que repetimos muchas veces el mismo procedimiento:

extraer una muestra → calcular su media → estimar el error estándar → construir un intervalo

Cada muestra produce una media y un intervalo diferentes.

Interpretación del nivel de confianza
Elemento Significado
Cada repetición Produce un intervalo distinto.
Confianza del 95 % A largo plazo, aproximadamente el 95 % de los intervalos construidos con el mismo procedimiento contendría la media poblacional \(\mu\).
En una simulación La cobertura observada puede ser mayor o menor que 95 %.

El 95 % describe el funcionamiento del procedimiento a largo plazo. Una vez construido un intervalo particular, este contiene o no contiene a \(\mu\).

Cómo interpretarlo

  • ¿Qué comunica un intervalo? → Comunica un rango de valores plausibles para el promedio poblacional y hace visible la incertidumbre asociada al muestreo.

  • ¿Qué significa el 95%? → Si repitiéramos muchas veces el procedimiento, aproximadamente el 95% de los intervalos construidos de la misma manera contendría la media poblacional.

  • ¿Qué hace más preciso un intervalo? → Una muestra más grande o una menor dispersión suele producir intervalos más estrechos.

  • ¿Qué no puede asegurar? → Un intervalo no demuestra que la muestra esté libre de problemas de selección, cobertura o medición. Tampoco muestra dónde se encuentra el 95% de las personas de la población.

Ejemplo aplicado Ver ejemploOcultar ejemplo↓

Supongamos que una muestra tiene:

\[ \bar{x}=\$800.000, \qquad s=\$100.000, \qquad n=1.600 \]

Como no conocemos la desviación estándar poblacional \(\sigma\), utilizamos la distribución \(t\) y la desviación estándar muestral \(s\).

1. Error estándar

\[ SE_{\bar{X}} = \frac{s}{\sqrt{n}} = \frac{100.000}{\sqrt{1.600}} = \$2.500 \]

Esto significa que las medias obtenidas en muestras similares suelen variar aproximadamente \(\$2.500\).

Los grados de libertad son:

\[ gl=n-1=1.599 \]

2. Construcción de los intervalos

El margen de error se calcula mediante:

\[ ME=t^*\times SE_{\bar{X}} \]

Comparación de los intervalos de confianza
Confianza Valor crítico (\(t^*\)) Margen de error Intervalo de confianza
95 % \(1{,}961\) \(\approx \$4.904\) \([\$795.096;\ \$804.904]\)
99 % \(2{,}579\) \(\approx \$6.447\) \([\$793.553;\ \$806.447]\)

Interpretación

El intervalo del 99 % es más ancho porque utiliza un valor crítico mayor.

Con los mismos datos:

mayor confianza: mayor margen de error; mayor margen de error: intervalo más ancho; intervalo más ancho: menor precisión.

Como la muestra es muy grande, el intervalo calculado con la distribución \(t\) es casi igual al obtenido con la distribución normal.

Utilizamos \(t\) porque desconocemos \(\sigma\) y trabajamos con la desviación estándar muestral \(s\).

Fórmulas mínimas y complementarias

Error estándar estimado:

\[ SE_{\bar X}=\frac{s}{\sqrt{n}} \]

Intervalo t para una media:

\[ IC_{1-\alpha}=\bar{x}\pm t_{1-\alpha/2,n-1}\frac{s}{\sqrt{n}} \]

Intervalo z:

\[ IC_{1-\alpha}=\bar{x}\pm z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}} \]

Margen de error:

\[ ME=t^{*}SE_{\bar X} \]

En estas expresiones, ({x}) es la media muestral, (s) la desviación estándar muestral, () la desviación estándar poblacional, (n) el tamaño muestral, () el complemento del nivel de confianza, (t^{}) o (z^{}) el valor crítico, (SE) el error estándar, (ME) el margen de error, (LI) el límite inferior y (LS) el límite superior.

Código en R y Python
  • R
  • Python
set.seed(123)

media_poblacional <- 800000
desviacion_poblacional <- 100000
n <- 1600

# Muestra pedagógica con media y desviación controladas
x <- rnorm(n)
x <- media_poblacional + ((x - mean(x)) / sd(x)) * desviacion_poblacional

media_muestral <- mean(x)
s <- sd(x)
se <- s / sqrt(n)
gl <- n - 1

t_95 <- qt(0.975, df = gl)
t_99 <- qt(0.995, df = gl)
z_95 <- qnorm(0.975)

ic_t_95 <- media_muestral + c(-1, 1) * t_95 * se
ic_t_99 <- media_muestral + c(-1, 1) * t_99 * se
ic_z_95 <- media_muestral +
  c(-1, 1) *
  z_95 *
  desviacion_poblacional /
  sqrt(n)

round(c(media = media_muestral, s = s, se = se, t_95 = t_95), 3)
round(ic_t_95, 0)
round(ic_t_99, 0)
round(ic_z_95, 0)

# Comparación de tamaños
tamanos <- c(25, 100, 400, 1600)
data.frame(
  n = tamanos,
  gl = tamanos - 1,
  t_critico = qt(0.975, df = tamanos - 1),
  SE = desviacion_poblacional / sqrt(tamanos),
  ME = qt(0.975, df = tamanos - 1) * desviacion_poblacional / sqrt(tamanos)
)

# Simulación de cobertura
simular_intervalos <- function(repeticiones = 1000, n = 1600, confianza = 0.95) {
  alpha <- 1 - confianza

  replicate(repeticiones, {
    muestra <- rnorm(n, media_poblacional, desviacion_poblacional)
    xbar <- mean(muestra)
    s <- sd(muestra)
    se <- s / sqrt(n)
    tcrit <- qt(1 - alpha / 2, df = n - 1)
    li <- xbar - tcrit * se
    ls <- xbar + tcrit * se

    c(
      xbar = xbar,
      li = li,
      ls = ls,
      captura = li <= media_poblacional & ls >= media_poblacional
    )
  })
}

intervalos <- t(simular_intervalos())
mean(intervalos[, "captura"])

# Forest plot de 100 intervalos
plot(
  intervalos[1:100, "xbar"],
  seq_len(100),
  xlim = range(intervalos[1:100, c("li", "ls")]),
  pch = 19,
  xlab = "Ingreso promedio estimado",
  ylab = "Muestra"
)

segments(
  intervalos[1:100, "li"],
  seq_len(100),
  intervalos[1:100, "ls"],
  seq_len(100)
)

abline(v = media_poblacional, lty = 2)
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

rng = np.random.default_rng(123)

media_poblacional = 800_000
desviacion_poblacional = 100_000
n = 1600

# Muestra pedagógica con media y desviación controladas
x = rng.normal(size=n)
x = (
    media_poblacional
    + ((x - x.mean()) / x.std(ddof=1))
    * desviacion_poblacional
)

media_muestral = x.mean()
s = x.std(ddof=1)
se = s / np.sqrt(n)
gl = n - 1

t_95 = stats.t.ppf(0.975, df=gl)
t_99 = stats.t.ppf(0.995, df=gl)
z_95 = stats.norm.ppf(0.975)

ic_t_95 = media_muestral + np.array([-1, 1]) * t_95 * se
ic_t_99 = media_muestral + np.array([-1, 1]) * t_99 * se
ic_z_95 = (
    media_muestral
    + np.array([-1, 1])
    * z_95
    * desviacion_poblacional
    / np.sqrt(n)
)

print(media_muestral, s, se, t_95)
print(ic_t_95)
print(ic_t_99)
print(ic_z_95)

# Comparación de tamaños
for n_actual in [25, 100, 400, 1600]:
    gl = n_actual - 1
    se = desviacion_poblacional / np.sqrt(n_actual)
    tcrit = stats.t.ppf(0.975, df=gl)
    print(n_actual, tcrit, se, tcrit * se)

# Simulación de cobertura
def simular_intervalos(repeticiones=1000, n=1600, confianza=0.95):
    alpha = 1 - confianza
    filas = []

    for _ in range(repeticiones):
        muestra = rng.normal(
            media_poblacional,
            desviacion_poblacional,
            size=n
        )

        xbar = muestra.mean()
        s = muestra.std(ddof=1)
        se = s / np.sqrt(n)
        tcrit = stats.t.ppf(1 - alpha / 2, df=n - 1)
        li = xbar - tcrit * se
        ls = xbar + tcrit * se

        filas.append((xbar, li, ls, li <= media_poblacional <= ls))

    return np.array(filas, dtype=object)

intervalos = simular_intervalos()
print(intervalos[:, 3].mean())

# Forest plot de 100 intervalos
fig, ax = plt.subplots()

for i, (xbar, li, ls, captura) in enumerate(
    intervalos[:100],
    start=1
):
    estilo = "-" if captura else "--"
    color = "tab:blue" if captura else "tab:red"

    ax.plot([li, ls], [i, i], linestyle=estilo, color=color)
    ax.plot(xbar, i, "o", color=color)

ax.axvline(
    media_poblacional,
    linestyle="--",
    color="black"
)

ax.set_xlabel("Ingreso promedio estimado")
ax.set_ylabel("Muestra")

plt.show()
Bibliografía
  • Agresti, A., y Finlay, B. Statistical Methods for the Social Sciences. Pearson.
  • Moore, D. S. (2010). Estadística aplicada básica. Antoni Bosch.
  • Navarro, D. J. Learning Statistics with R.
← Módulo anterior M04. Teorema del límite central y error estándar Siguiente módulo M06. Test de hipótesis y lógica de falsación →
Ejecutar el código
---
pagetitle: "M05. Intervalos de confianza | Estadística Correlacional Interactiva"
page-layout: custom
toc: false
body-class: rs-lesson-page inferencia-module m05-page
format:
  html:
    css:
      - ../assets/css/m05-intervalos-confianza.css
      - ../assets/css/inferencia-modules.css
---

::: {.rs-lesson-page-wrap .m05-module-intro}

::: {.m05-lesson-header}
::: {.inference-module-kicker .m05-lesson-kicker}
Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 05
:::

# M05. Intervalos de confianza

::: {.rs-module-lead}
Como hemos visto, una muestra entrega una estimación de la media poblacional, pero otra muestra podría producir un resultado diferente. Por eso, informar solo la media no muestra cuánta incertidumbre existe.

En este módulo aprenderás a construir un intervalo de confianza alrededor de una estimación, distinguir el error estándar del margen de error e interpretar correctamente qué significa un nivel de confianza del 95%.
:::
:::

![](https://nulib.github.io/moderndive_book/images/garfield_comic.png){fig-align="center" width="70%"}


::: {.m05-lesson-section #pregunta-social}
## Pregunta social

### ¿Qué información falta cuando comunicamos solamente un promedio? {.m05-social-question-title}

```{=html}
<p class="m05-social-question-intro">Una encuesta obtiene un ingreso medio de $800.000. Este valor estima la media de la población, pero podría cambiar si se seleccionara otra muestra.

Para mostrar esa incertidumbre, podemos construir un intervalo entr: $795.000 y $805.000.

La media muestral entrega una estimación puntual. El intervalo muestra un rango de valores posibles alrededor de ella.

La media poblacional es desconocida, mientras que la media muestral y el intervalo pueden cambiar entre muestras.</p>
```
:::

::: {.m05-lesson-section #idea-central}
## Idea central
Una muestra entrega una estimación puntual de la media poblacional. Como otra muestra podría producir un resultado diferente, utilizamos un intervalo para representar la incertidumbre de esa estimación. El intervalo busca estimar la media de la población. 

El proceso puede resumirse así:

::: {.rs-callout-warning style="background: rgba(102, 179, 224, 0.1); border-left: 4px solid #6672e0; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}
Población → parámetro desconocido → muestra → media muestral → error estándar → nivel de confianza → valor crítico → margen de error → intervalo de confianza
:::

El **error estándar** indica cuánto suelen variar las medias entre muestras. El [nivel de confianza]{.m01-kw} determina el valor crítico, es decir, cuántos errores estándar se utilizarán a cada lado de la media muestral.

Con ambos elementos calculamos el margen de error:

$$
ME
=
\text{valor crítico}\times SE
$$

Luego, sumamos y restamos el margen de error a la media muestral para obtener los [límites del intervalo]{.m01-kw}

$$
IC
=
[\bar{x}-ME;\ \bar{x}+ME]
$$

Por lo tanto, el error estándar y el margen de error no son lo mismo:

- el **error estándar** describe la variación esperada de la media entre muestras;
- el **margen de error** determina cuánto se extiende el intervalo a cada lado de la media muestral.


::: {.m05-sequence-flow .rs-sequence-flow role="list"}
::: {.m05-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">1</div>
```

### De una media a un intervalo

La media poblacional:

$$
\mu
$$

es un **parámetro**, es decir, una característica numérica de toda la población. Por lo general, no conocemos su valor porque no podemos observar a todas las personas.

Por eso, seleccionamos una muestra y calculamos su media:

$$
\bar{x}
$$

La media muestral $\bar{x}$ es una estimación puntual de la media poblacional $\mu$. Sin embargo, otra muestra podría producir una media diferente.

Para representar esta incertidumbre, construimos un intervalo alrededor de $\bar{x}$:

$$
IC
=
[\text{límite inferior};\ \text{límite superior}]
$$

En este módulo, la media muestral se encuentra en el centro del intervalo. La distancia entre la media y cada uno de sus límites se denomina [margen de error]{.m01-kw}.

:::

::: {.m05-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">2</div>
```

### De un intervalo a muchos intervalos

Cada muestra puede producir:

- una media muestral diferente;
- un error estándar diferente;
- un margen de error diferente;
- límites distintos.

Por eso, cada muestra genera su propio intervalo de confianza.

Si repitiéramos muchas veces el mismo procedimiento de muestreo, algunos intervalos contendrían la media poblacional $\mu$ y otros no.

Un nivel de confianza del 95 % significa que, a largo plazo, aproximadamente [el 95 % de los intervalos construidos]{.m01-kw} mediante este procedimiento contendría **el parámetro poblacional.**

La media poblacional $\mu$ permanece fija. Los intervalos son los que cambian de una muestra a otra.

Una vez construido un intervalo particular, este contiene o no contiene a $\mu$. El 95 % se refiere al funcionamiento del procedimiento a largo plazo, no a la probabilidad de que $\mu$ esté dentro de ese intervalo específico.

:::

::: {.m05-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">3</div>
```

### De la confianza a la precisión

La amplitud de un intervalo depende principalmente de:

- el nivel de confianza;
- el tamaño de la muestra;
- la dispersión de los datos.

Si mantenemos constantes el tamaño de la muestra y la dispersión, un nivel de confianza mayor requiere un valor crítico más grande. Por eso, aumenta el margen de error y el intervalo se vuelve más ancho.

Por ejemplo, con los mismos datos, un intervalo de confianza del 99 % suele ser más amplio que uno del 95 %.

En cambio, si mantenemos fijo el nivel de confianza, una muestra más grande reduce el error estándar y suele producir un intervalo más estrecho.

Por lo tanto:

- **mayor confianza:** mayor cobertura esperada, pero un intervalo más amplio;
- **mayor precisión:** un intervalo más estrecho.

Un intervalo estrecho indica mayor precisión, pero no garantiza que la muestra represente correctamente a la población. Una muestra grande y sesgada puede producir un intervalo muy estrecho alrededor de una estimación incorrecta.


:::
:::
:::

::: {.rs-callout-warning style="background: rgba(102, 179, 224, 0.1); border-left: 4px solid #6672e0; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}

**Recordario:** El valor crítico indica cuántos errores estándar se suman y restan a la media muestral para construir un intervalo con el nivel de confianza elegido.

$$
ME=\text{valor crítico}\times SE
$$

Para un intervalo del 95 % basado en la distribución normal:

$$
z^*=1{,}96
$$

Por lo tanto:

$$
IC=\bar{x}\pm1{,}96SE
$$

A mayor nivel de confianza, mayor valor crítico y más amplio será el intervalo:

90 %: $1{,}645$
95 %: $1{,}96$
99 %: $2{,}576$
::: 

::: {.m05-lesson-section #laboratorio}
## Laboratorio de Intervalos de Confianza

Extrae muestras repetidas, construye un intervalo alrededor de cada media y observa cómo el nivel de confianza, el tamaño muestral, la dispersión y el tipo de selección modifican su ancho y su cobertura.

```{=html}
<div class="lab-fullscreen-launcher">
  <a class="lab-fullscreen-link" href="../labs/inferencia/m05-intervalos-confianza-laboratorio.html" target="_blank" rel="noopener noreferrer" aria-label="Abrir el Laboratorio de Intervalos de Confianza en una pestaña nueva">
    <span>Ver en pantalla completa</span>
    <span class="lab-fullscreen-link__icon" aria-hidden="true">↗</span>
  </a>
</div>
<div id="m05-lab-root" class="m05-lab-surface m05-lab-breakout" data-lab-id="m05-intervalos-confianza" data-fullscreen-url="../labs/inferencia/m05-intervalos-confianza-laboratorio.html"></div>
```
:::

::: {.m05-lesson-section #explicador-ic}
## Cómo se construye un intervalo

```{=html}
<div id="m05-ci-explainer" class="m05-explainer-section"></div>
```
:::

## ¿Qué significa un 95% de confianza?

Imaginemos que repetimos muchas veces el mismo procedimiento:

::: {.rs-callout-warning style="background: rgba(102, 179, 224, 0.1); border-left: 4px solid #6672e0; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}
**extraer una muestra → calcular su media → estimar el error estándar → construir un intervalo**
:::
 
Cada muestra produce una media y un intervalo diferentes.

::: {.m05-table-wrap}
| Elemento | Significado |
| :--- | :--- |
| **Cada repetición** | Produce un intervalo distinto. |
| **Confianza del 95 %** | A largo plazo, aproximadamente el 95 % de los intervalos construidos con el mismo procedimiento contendría la media poblacional $\mu$. |
| **En una simulación** | La cobertura observada puede ser mayor o menor que 95 %. |
: Interpretación del nivel de confianza
::: 

El 95 % describe el funcionamiento del procedimiento a largo plazo. Una vez construido un intervalo particular, este contiene o no contiene a $\mu$.

::: {.m05-lesson-section #como-interpretarlo}
## Cómo interpretarlo

- ¿Qué comunica un intervalo? →  Comunica un rango de valores plausibles para el promedio poblacional y hace visible la incertidumbre asociada al muestreo.

- ¿Qué significa el 95%? →  Si repitiéramos muchas veces el procedimiento, aproximadamente el 95% de los intervalos construidos de la misma manera contendría la media poblacional.

- ¿Qué hace más preciso un intervalo? → Una muestra más grande o una menor dispersión suele producir intervalos más estrechos.

- ¿Qué no puede asegurar? → Un intervalo no demuestra que la muestra esté libre de problemas de selección, cobertura o medición. Tampoco muestra dónde se encuentra el 95% de las personas de la población.
:::

::: {.m05-lesson-section .rs-example-section #ejemplo-aplicado}
<details class="rs-example-disclosure">
<summary class="rs-example-disclosure__summary">
<span class="rs-example-disclosure__heading" role="heading" aria-level="2">Ejemplo aplicado</span>
<span class="rs-example-disclosure__action"><span class="rs-example-disclosure__show">Ver ejemplo</span><span class="rs-example-disclosure__hide">Ocultar ejemplo</span><span class="rs-example-disclosure__chevron" aria-hidden="true">↓</span></span>
</summary>

::: {.rs-example-disclosure__content}

Supongamos que una muestra tiene:

$$
\bar{x}=\$800.000,
\qquad
s=\$100.000,
\qquad
n=1.600
$$

Como no conocemos la desviación estándar poblacional $\sigma$, utilizamos la distribución $t$ y la desviación estándar muestral $s$.

### 1. Error estándar

$$
SE_{\bar{X}}
=
\frac{s}{\sqrt{n}}
=
\frac{100.000}{\sqrt{1.600}}
=
\$2.500
$$

Esto significa que las medias obtenidas en muestras similares suelen variar aproximadamente $\$2.500$.

Los grados de libertad son:

$$
gl=n-1=1.599
$$

### 2. Construcción de los intervalos

El margen de error se calcula mediante:

$$
ME=t^*\times SE_{\bar{X}}
$$

| Confianza | Valor crítico ($t^*$) | Margen de error | Intervalo de confianza |
| :--- | :--- | :--- | :--- |
| **95 %** | $1{,}961$ | $\approx \$4.904$ | $[\$795.096;\ \$804.904]$ |
| **99 %** | $2{,}579$ | $\approx \$6.447$ | $[\$793.553;\ \$806.447]$ |
: Comparación de los intervalos de confianza {.m05-table}

Interpretación

El intervalo del 99 % es más ancho porque utiliza un valor crítico mayor.

Con los mismos datos:

mayor confianza: mayor margen de error;
mayor margen de error: intervalo más ancho;
intervalo más ancho: menor precisión.

Como la muestra es muy grande, el intervalo calculado con la distribución $t$ es casi igual al obtenido con la distribución normal.

Utilizamos $t$ porque desconocemos $\sigma$ y trabajamos con la desviación estándar muestral $s$.

:::
</details>
:::




```{=html}
<script src="../assets/js/m05-intervalos-confianza.js"></script>
```
::: {.inference-endmatter}
<details class="inference-endmatter__item inference-endmatter__formulas">
<summary><span>Fórmulas mínimas y complementarias</span></summary>

::: {.inference-endmatter__content}

Error estándar estimado:

$$
SE_{\bar X}=\frac{s}{\sqrt{n}}
$$

Intervalo t para una media:

$$
IC_{1-\alpha}=\bar{x}\pm t_{1-\alpha/2,n-1}\frac{s}{\sqrt{n}}
$$

Intervalo z:

$$
IC_{1-\alpha}=\bar{x}\pm z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}
$$

Margen de error:

$$
ME=t^{*}SE_{\bar X}
$$

En estas expresiones, \(\bar{x}\) es la media muestral, \(s\) la desviación estándar muestral, \(\sigma\) la desviación estándar poblacional, \(n\) el tamaño muestral, \(\alpha\) el complemento del nivel de confianza, \(t^{*}\) o \(z^{*}\) el valor crítico, \(SE\) el error estándar, \(ME\) el margen de error, \(LI\) el límite inferior y \(LS\) el límite superior.

:::
</details>

<details class="inference-endmatter__item inference-endmatter__code">
<summary><span>Código en R y Python</span></summary>

::: {.inference-endmatter__content}

::: {.panel-tabset .rs-code-tabs}

### R {.unnumbered .unlisted}

```r
set.seed(123)

media_poblacional <- 800000
desviacion_poblacional <- 100000
n <- 1600

# Muestra pedagógica con media y desviación controladas
x <- rnorm(n)
x <- media_poblacional + ((x - mean(x)) / sd(x)) * desviacion_poblacional

media_muestral <- mean(x)
s <- sd(x)
se <- s / sqrt(n)
gl <- n - 1

t_95 <- qt(0.975, df = gl)
t_99 <- qt(0.995, df = gl)
z_95 <- qnorm(0.975)

ic_t_95 <- media_muestral + c(-1, 1) * t_95 * se
ic_t_99 <- media_muestral + c(-1, 1) * t_99 * se
ic_z_95 <- media_muestral +
  c(-1, 1) *
  z_95 *
  desviacion_poblacional /
  sqrt(n)

round(c(media = media_muestral, s = s, se = se, t_95 = t_95), 3)
round(ic_t_95, 0)
round(ic_t_99, 0)
round(ic_z_95, 0)

# Comparación de tamaños
tamanos <- c(25, 100, 400, 1600)
data.frame(
  n = tamanos,
  gl = tamanos - 1,
  t_critico = qt(0.975, df = tamanos - 1),
  SE = desviacion_poblacional / sqrt(tamanos),
  ME = qt(0.975, df = tamanos - 1) * desviacion_poblacional / sqrt(tamanos)
)

# Simulación de cobertura
simular_intervalos <- function(repeticiones = 1000, n = 1600, confianza = 0.95) {
  alpha <- 1 - confianza

  replicate(repeticiones, {
    muestra <- rnorm(n, media_poblacional, desviacion_poblacional)
    xbar <- mean(muestra)
    s <- sd(muestra)
    se <- s / sqrt(n)
    tcrit <- qt(1 - alpha / 2, df = n - 1)
    li <- xbar - tcrit * se
    ls <- xbar + tcrit * se

    c(
      xbar = xbar,
      li = li,
      ls = ls,
      captura = li <= media_poblacional & ls >= media_poblacional
    )
  })
}

intervalos <- t(simular_intervalos())
mean(intervalos[, "captura"])

# Forest plot de 100 intervalos
plot(
  intervalos[1:100, "xbar"],
  seq_len(100),
  xlim = range(intervalos[1:100, c("li", "ls")]),
  pch = 19,
  xlab = "Ingreso promedio estimado",
  ylab = "Muestra"
)

segments(
  intervalos[1:100, "li"],
  seq_len(100),
  intervalos[1:100, "ls"],
  seq_len(100)
)

abline(v = media_poblacional, lty = 2)
```

### Python {.unnumbered .unlisted}

```python
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

rng = np.random.default_rng(123)

media_poblacional = 800_000
desviacion_poblacional = 100_000
n = 1600

# Muestra pedagógica con media y desviación controladas
x = rng.normal(size=n)
x = (
    media_poblacional
    + ((x - x.mean()) / x.std(ddof=1))
    * desviacion_poblacional
)

media_muestral = x.mean()
s = x.std(ddof=1)
se = s / np.sqrt(n)
gl = n - 1

t_95 = stats.t.ppf(0.975, df=gl)
t_99 = stats.t.ppf(0.995, df=gl)
z_95 = stats.norm.ppf(0.975)

ic_t_95 = media_muestral + np.array([-1, 1]) * t_95 * se
ic_t_99 = media_muestral + np.array([-1, 1]) * t_99 * se
ic_z_95 = (
    media_muestral
    + np.array([-1, 1])
    * z_95
    * desviacion_poblacional
    / np.sqrt(n)
)

print(media_muestral, s, se, t_95)
print(ic_t_95)
print(ic_t_99)
print(ic_z_95)

# Comparación de tamaños
for n_actual in [25, 100, 400, 1600]:
    gl = n_actual - 1
    se = desviacion_poblacional / np.sqrt(n_actual)
    tcrit = stats.t.ppf(0.975, df=gl)
    print(n_actual, tcrit, se, tcrit * se)

# Simulación de cobertura
def simular_intervalos(repeticiones=1000, n=1600, confianza=0.95):
    alpha = 1 - confianza
    filas = []

    for _ in range(repeticiones):
        muestra = rng.normal(
            media_poblacional,
            desviacion_poblacional,
            size=n
        )

        xbar = muestra.mean()
        s = muestra.std(ddof=1)
        se = s / np.sqrt(n)
        tcrit = stats.t.ppf(1 - alpha / 2, df=n - 1)
        li = xbar - tcrit * se
        ls = xbar + tcrit * se

        filas.append((xbar, li, ls, li <= media_poblacional <= ls))

    return np.array(filas, dtype=object)

intervalos = simular_intervalos()
print(intervalos[:, 3].mean())

# Forest plot de 100 intervalos
fig, ax = plt.subplots()

for i, (xbar, li, ls, captura) in enumerate(
    intervalos[:100],
    start=1
):
    estilo = "-" if captura else "--"
    color = "tab:blue" if captura else "tab:red"

    ax.plot([li, ls], [i, i], linestyle=estilo, color=color)
    ax.plot(xbar, i, "o", color=color)

ax.axvline(
    media_poblacional,
    linestyle="--",
    color="black"
)

ax.set_xlabel("Ingreso promedio estimado")
ax.set_ylabel("Muestra")

plt.show()
```

:::

:::
</details>

<details class="inference-endmatter__item inference-endmatter__references">
<summary><span>Bibliografía</span></summary>

::: {.inference-endmatter__content}

- Agresti, A., y Finlay, B. *Statistical Methods for the Social Sciences*. Pearson.
- Moore, D. S. (2010). *Estadística aplicada básica*. Antoni Bosch.
- Navarro, D. J. *Learning Statistics with R*.

:::
</details>
:::

```{=html}
<nav class="rs-lesson-footer-nav rs-inference-footer-nav" aria-label="Navegación entre módulos">
  <a href="m04_teorema_limite_central_error_estandar.qmd" class="rs-nav-link rs-nav-link--previous">
    <span class="rs-nav-link__arrow" aria-hidden="true">←</span>
    <span class="rs-nav-link__copy">
      <span class="rs-nav-link__label">Módulo anterior</span>
      <span class="rs-nav-link__title">M04. Teorema del límite central y error estándar</span>
    </span>
  </a>

  <a href="m06_test_hipotesis_falsacion.qmd" class="rs-nav-link rs-nav-link--next">
    <span class="rs-nav-link__copy">
      <span class="rs-nav-link__label">Siguiente módulo</span>
      <span class="rs-nav-link__title">M06. Test de hipótesis y lógica de falsación</span>
    </span>
    <span class="rs-nav-link__arrow" aria-hidden="true">→</span>
  </a>
</nav>
```
:::

Estadística Correlacional Interactiva
Facultad de Ciencias Sociales
Departamento de Sociología
Universidad de Chile

Volver arriba

Sitio creado por Katherine Aravena .

Código bajo licencia MIT · Ver repositorio en GitHub