Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 05
Como hemos visto, una muestra entrega una estimación de la media poblacional, pero otra muestra podría producir un resultado diferente. Por eso, informar solo la media no muestra cuánta incertidumbre existe.
En este módulo aprenderás a construir un intervalo de confianza alrededor de una estimación, distinguir el error estándar del margen de error e interpretar correctamente qué significa un nivel de confianza del 95%.

Una encuesta obtiene un ingreso medio de $800.000. Este valor estima la media de la población, pero podría cambiar si se seleccionara otra muestra. Para mostrar esa incertidumbre, podemos construir un intervalo entr: $795.000 y $805.000. La media muestral entrega una estimación puntual. El intervalo muestra un rango de valores posibles alrededor de ella. La media poblacional es desconocida, mientras que la media muestral y el intervalo pueden cambiar entre muestras.
Una muestra entrega una estimación puntual de la media poblacional. Como otra muestra podría producir un resultado diferente, utilizamos un intervalo para representar la incertidumbre de esa estimación. El intervalo busca estimar la media de la población.
El proceso puede resumirse así:
Población → parámetro desconocido → muestra → media muestral → error estándar → nivel de confianza → valor crítico → margen de error → intervalo de confianza
El error estándar indica cuánto suelen variar las medias entre muestras. El nivel de confianza determina el valor crítico, es decir, cuántos errores estándar se utilizarán a cada lado de la media muestral.
Con ambos elementos calculamos el margen de error:
\[ ME = \text{valor crítico}\times SE \]
Luego, sumamos y restamos el margen de error a la media muestral para obtener los límites del intervalo
\[ IC = [\bar{x}-ME;\ \bar{x}+ME] \]
Por lo tanto, el error estándar y el margen de error no son lo mismo:
La media poblacional:
\[ \mu \]
es un parámetro, es decir, una característica numérica de toda la población. Por lo general, no conocemos su valor porque no podemos observar a todas las personas.
Por eso, seleccionamos una muestra y calculamos su media:
\[ \bar{x} \]
La media muestral \(\bar{x}\) es una estimación puntual de la media poblacional \(\mu\). Sin embargo, otra muestra podría producir una media diferente.
Para representar esta incertidumbre, construimos un intervalo alrededor de \(\bar{x}\):
\[ IC = [\text{límite inferior};\ \text{límite superior}] \]
En este módulo, la media muestral se encuentra en el centro del intervalo. La distancia entre la media y cada uno de sus límites se denomina margen de error.
Cada muestra puede producir:
Por eso, cada muestra genera su propio intervalo de confianza.
Si repitiéramos muchas veces el mismo procedimiento de muestreo, algunos intervalos contendrían la media poblacional \(\mu\) y otros no.
Un nivel de confianza del 95 % significa que, a largo plazo, aproximadamente el 95 % de los intervalos construidos mediante este procedimiento contendría el parámetro poblacional.
La media poblacional \(\mu\) permanece fija. Los intervalos son los que cambian de una muestra a otra.
Una vez construido un intervalo particular, este contiene o no contiene a \(\mu\). El 95 % se refiere al funcionamiento del procedimiento a largo plazo, no a la probabilidad de que \(\mu\) esté dentro de ese intervalo específico.
La amplitud de un intervalo depende principalmente de:
Si mantenemos constantes el tamaño de la muestra y la dispersión, un nivel de confianza mayor requiere un valor crítico más grande. Por eso, aumenta el margen de error y el intervalo se vuelve más ancho.
Por ejemplo, con los mismos datos, un intervalo de confianza del 99 % suele ser más amplio que uno del 95 %.
En cambio, si mantenemos fijo el nivel de confianza, una muestra más grande reduce el error estándar y suele producir un intervalo más estrecho.
Por lo tanto:
Un intervalo estrecho indica mayor precisión, pero no garantiza que la muestra represente correctamente a la población. Una muestra grande y sesgada puede producir un intervalo muy estrecho alrededor de una estimación incorrecta.
Recordario: El valor crítico indica cuántos errores estándar se suman y restan a la media muestral para construir un intervalo con el nivel de confianza elegido.
\[ ME=\text{valor crítico}\times SE \]
Para un intervalo del 95 % basado en la distribución normal:
\[ z^*=1{,}96 \]
Por lo tanto:
\[ IC=\bar{x}\pm1{,}96SE \]
A mayor nivel de confianza, mayor valor crítico y más amplio será el intervalo:
90 %: \(1{,}645\) 95 %: \(1{,}96\) 99 %: \(2{,}576\)
Extrae muestras repetidas, construye un intervalo alrededor de cada media y observa cómo el nivel de confianza, el tamaño muestral, la dispersión y el tipo de selección modifican su ancho y su cobertura.
Imaginemos que repetimos muchas veces el mismo procedimiento:
extraer una muestra → calcular su media → estimar el error estándar → construir un intervalo
Cada muestra produce una media y un intervalo diferentes.
| Elemento | Significado |
|---|---|
| Cada repetición | Produce un intervalo distinto. |
| Confianza del 95 % | A largo plazo, aproximadamente el 95 % de los intervalos construidos con el mismo procedimiento contendría la media poblacional \(\mu\). |
| En una simulación | La cobertura observada puede ser mayor o menor que 95 %. |
El 95 % describe el funcionamiento del procedimiento a largo plazo. Una vez construido un intervalo particular, este contiene o no contiene a \(\mu\).
¿Qué comunica un intervalo? → Comunica un rango de valores plausibles para el promedio poblacional y hace visible la incertidumbre asociada al muestreo.
¿Qué significa el 95%? → Si repitiéramos muchas veces el procedimiento, aproximadamente el 95% de los intervalos construidos de la misma manera contendría la media poblacional.
¿Qué hace más preciso un intervalo? → Una muestra más grande o una menor dispersión suele producir intervalos más estrechos.
¿Qué no puede asegurar? → Un intervalo no demuestra que la muestra esté libre de problemas de selección, cobertura o medición. Tampoco muestra dónde se encuentra el 95% de las personas de la población.
Supongamos que una muestra tiene:
\[ \bar{x}=\$800.000, \qquad s=\$100.000, \qquad n=1.600 \]
Como no conocemos la desviación estándar poblacional \(\sigma\), utilizamos la distribución \(t\) y la desviación estándar muestral \(s\).
\[ SE_{\bar{X}} = \frac{s}{\sqrt{n}} = \frac{100.000}{\sqrt{1.600}} = \$2.500 \]
Esto significa que las medias obtenidas en muestras similares suelen variar aproximadamente \(\$2.500\).
Los grados de libertad son:
\[ gl=n-1=1.599 \]
El margen de error se calcula mediante:
\[ ME=t^*\times SE_{\bar{X}} \]
| Confianza | Valor crítico (\(t^*\)) | Margen de error | Intervalo de confianza |
|---|---|---|---|
| 95 % | \(1{,}961\) | \(\approx \$4.904\) | \([\$795.096;\ \$804.904]\) |
| 99 % | \(2{,}579\) | \(\approx \$6.447\) | \([\$793.553;\ \$806.447]\) |
Interpretación
El intervalo del 99 % es más ancho porque utiliza un valor crítico mayor.
Con los mismos datos:
mayor confianza: mayor margen de error; mayor margen de error: intervalo más ancho; intervalo más ancho: menor precisión.
Como la muestra es muy grande, el intervalo calculado con la distribución \(t\) es casi igual al obtenido con la distribución normal.
Utilizamos \(t\) porque desconocemos \(\sigma\) y trabajamos con la desviación estándar muestral \(s\).
Error estándar estimado:
\[ SE_{\bar X}=\frac{s}{\sqrt{n}} \]
Intervalo t para una media:
\[ IC_{1-\alpha}=\bar{x}\pm t_{1-\alpha/2,n-1}\frac{s}{\sqrt{n}} \]
Intervalo z:
\[ IC_{1-\alpha}=\bar{x}\pm z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}} \]
Margen de error:
\[ ME=t^{*}SE_{\bar X} \]
En estas expresiones, ({x}) es la media muestral, (s) la desviación estándar muestral, () la desviación estándar poblacional, (n) el tamaño muestral, () el complemento del nivel de confianza, (t^{}) o (z^{}) el valor crítico, (SE) el error estándar, (ME) el margen de error, (LI) el límite inferior y (LS) el límite superior.
set.seed(123)
media_poblacional <- 800000
desviacion_poblacional <- 100000
n <- 1600
# Muestra pedagógica con media y desviación controladas
x <- rnorm(n)
x <- media_poblacional + ((x - mean(x)) / sd(x)) * desviacion_poblacional
media_muestral <- mean(x)
s <- sd(x)
se <- s / sqrt(n)
gl <- n - 1
t_95 <- qt(0.975, df = gl)
t_99 <- qt(0.995, df = gl)
z_95 <- qnorm(0.975)
ic_t_95 <- media_muestral + c(-1, 1) * t_95 * se
ic_t_99 <- media_muestral + c(-1, 1) * t_99 * se
ic_z_95 <- media_muestral +
c(-1, 1) *
z_95 *
desviacion_poblacional /
sqrt(n)
round(c(media = media_muestral, s = s, se = se, t_95 = t_95), 3)
round(ic_t_95, 0)
round(ic_t_99, 0)
round(ic_z_95, 0)
# Comparación de tamaños
tamanos <- c(25, 100, 400, 1600)
data.frame(
n = tamanos,
gl = tamanos - 1,
t_critico = qt(0.975, df = tamanos - 1),
SE = desviacion_poblacional / sqrt(tamanos),
ME = qt(0.975, df = tamanos - 1) * desviacion_poblacional / sqrt(tamanos)
)
# Simulación de cobertura
simular_intervalos <- function(repeticiones = 1000, n = 1600, confianza = 0.95) {
alpha <- 1 - confianza
replicate(repeticiones, {
muestra <- rnorm(n, media_poblacional, desviacion_poblacional)
xbar <- mean(muestra)
s <- sd(muestra)
se <- s / sqrt(n)
tcrit <- qt(1 - alpha / 2, df = n - 1)
li <- xbar - tcrit * se
ls <- xbar + tcrit * se
c(
xbar = xbar,
li = li,
ls = ls,
captura = li <= media_poblacional & ls >= media_poblacional
)
})
}
intervalos <- t(simular_intervalos())
mean(intervalos[, "captura"])
# Forest plot de 100 intervalos
plot(
intervalos[1:100, "xbar"],
seq_len(100),
xlim = range(intervalos[1:100, c("li", "ls")]),
pch = 19,
xlab = "Ingreso promedio estimado",
ylab = "Muestra"
)
segments(
intervalos[1:100, "li"],
seq_len(100),
intervalos[1:100, "ls"],
seq_len(100)
)
abline(v = media_poblacional, lty = 2)import numpy as np
from scipy import stats
import matplotlib.pyplot as plt
rng = np.random.default_rng(123)
media_poblacional = 800_000
desviacion_poblacional = 100_000
n = 1600
# Muestra pedagógica con media y desviación controladas
x = rng.normal(size=n)
x = (
media_poblacional
+ ((x - x.mean()) / x.std(ddof=1))
* desviacion_poblacional
)
media_muestral = x.mean()
s = x.std(ddof=1)
se = s / np.sqrt(n)
gl = n - 1
t_95 = stats.t.ppf(0.975, df=gl)
t_99 = stats.t.ppf(0.995, df=gl)
z_95 = stats.norm.ppf(0.975)
ic_t_95 = media_muestral + np.array([-1, 1]) * t_95 * se
ic_t_99 = media_muestral + np.array([-1, 1]) * t_99 * se
ic_z_95 = (
media_muestral
+ np.array([-1, 1])
* z_95
* desviacion_poblacional
/ np.sqrt(n)
)
print(media_muestral, s, se, t_95)
print(ic_t_95)
print(ic_t_99)
print(ic_z_95)
# Comparación de tamaños
for n_actual in [25, 100, 400, 1600]:
gl = n_actual - 1
se = desviacion_poblacional / np.sqrt(n_actual)
tcrit = stats.t.ppf(0.975, df=gl)
print(n_actual, tcrit, se, tcrit * se)
# Simulación de cobertura
def simular_intervalos(repeticiones=1000, n=1600, confianza=0.95):
alpha = 1 - confianza
filas = []
for _ in range(repeticiones):
muestra = rng.normal(
media_poblacional,
desviacion_poblacional,
size=n
)
xbar = muestra.mean()
s = muestra.std(ddof=1)
se = s / np.sqrt(n)
tcrit = stats.t.ppf(1 - alpha / 2, df=n - 1)
li = xbar - tcrit * se
ls = xbar + tcrit * se
filas.append((xbar, li, ls, li <= media_poblacional <= ls))
return np.array(filas, dtype=object)
intervalos = simular_intervalos()
print(intervalos[:, 3].mean())
# Forest plot de 100 intervalos
fig, ax = plt.subplots()
for i, (xbar, li, ls, captura) in enumerate(
intervalos[:100],
start=1
):
estilo = "-" if captura else "--"
color = "tab:blue" if captura else "tab:red"
ax.plot([li, ls], [i, i], linestyle=estilo, color=color)
ax.plot(xbar, i, "o", color=color)
ax.axvline(
media_poblacional,
linestyle="--",
color="black"
)
ax.set_xlabel("Ingreso promedio estimado")
ax.set_ylabel("Muestra")
plt.show()---
pagetitle: "M05. Intervalos de confianza | Estadística Correlacional Interactiva"
page-layout: custom
toc: false
body-class: rs-lesson-page inferencia-module m05-page
format:
html:
css:
- ../assets/css/m05-intervalos-confianza.css
- ../assets/css/inferencia-modules.css
---
::: {.rs-lesson-page-wrap .m05-module-intro}
::: {.m05-lesson-header}
::: {.inference-module-kicker .m05-lesson-kicker}
Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 05
:::
# M05. Intervalos de confianza
::: {.rs-module-lead}
Como hemos visto, una muestra entrega una estimación de la media poblacional, pero otra muestra podría producir un resultado diferente. Por eso, informar solo la media no muestra cuánta incertidumbre existe.
En este módulo aprenderás a construir un intervalo de confianza alrededor de una estimación, distinguir el error estándar del margen de error e interpretar correctamente qué significa un nivel de confianza del 95%.
:::
:::
{fig-align="center" width="70%"}
::: {.m05-lesson-section #pregunta-social}
## Pregunta social
### ¿Qué información falta cuando comunicamos solamente un promedio? {.m05-social-question-title}
```{=html}
<p class="m05-social-question-intro">Una encuesta obtiene un ingreso medio de $800.000. Este valor estima la media de la población, pero podría cambiar si se seleccionara otra muestra.
Para mostrar esa incertidumbre, podemos construir un intervalo entr: $795.000 y $805.000.
La media muestral entrega una estimación puntual. El intervalo muestra un rango de valores posibles alrededor de ella.
La media poblacional es desconocida, mientras que la media muestral y el intervalo pueden cambiar entre muestras.</p>
```
:::
::: {.m05-lesson-section #idea-central}
## Idea central
Una muestra entrega una estimación puntual de la media poblacional. Como otra muestra podría producir un resultado diferente, utilizamos un intervalo para representar la incertidumbre de esa estimación. El intervalo busca estimar la media de la población.
El proceso puede resumirse así:
::: {.rs-callout-warning style="background: rgba(102, 179, 224, 0.1); border-left: 4px solid #6672e0; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}
Población → parámetro desconocido → muestra → media muestral → error estándar → nivel de confianza → valor crítico → margen de error → intervalo de confianza
:::
El **error estándar** indica cuánto suelen variar las medias entre muestras. El [nivel de confianza]{.m01-kw} determina el valor crítico, es decir, cuántos errores estándar se utilizarán a cada lado de la media muestral.
Con ambos elementos calculamos el margen de error:
$$
ME
=
\text{valor crítico}\times SE
$$
Luego, sumamos y restamos el margen de error a la media muestral para obtener los [límites del intervalo]{.m01-kw}
$$
IC
=
[\bar{x}-ME;\ \bar{x}+ME]
$$
Por lo tanto, el error estándar y el margen de error no son lo mismo:
- el **error estándar** describe la variación esperada de la media entre muestras;
- el **margen de error** determina cuánto se extiende el intervalo a cada lado de la media muestral.
::: {.m05-sequence-flow .rs-sequence-flow role="list"}
::: {.m05-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">1</div>
```
### De una media a un intervalo
La media poblacional:
$$
\mu
$$
es un **parámetro**, es decir, una característica numérica de toda la población. Por lo general, no conocemos su valor porque no podemos observar a todas las personas.
Por eso, seleccionamos una muestra y calculamos su media:
$$
\bar{x}
$$
La media muestral $\bar{x}$ es una estimación puntual de la media poblacional $\mu$. Sin embargo, otra muestra podría producir una media diferente.
Para representar esta incertidumbre, construimos un intervalo alrededor de $\bar{x}$:
$$
IC
=
[\text{límite inferior};\ \text{límite superior}]
$$
En este módulo, la media muestral se encuentra en el centro del intervalo. La distancia entre la media y cada uno de sus límites se denomina [margen de error]{.m01-kw}.
:::
::: {.m05-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">2</div>
```
### De un intervalo a muchos intervalos
Cada muestra puede producir:
- una media muestral diferente;
- un error estándar diferente;
- un margen de error diferente;
- límites distintos.
Por eso, cada muestra genera su propio intervalo de confianza.
Si repitiéramos muchas veces el mismo procedimiento de muestreo, algunos intervalos contendrían la media poblacional $\mu$ y otros no.
Un nivel de confianza del 95 % significa que, a largo plazo, aproximadamente [el 95 % de los intervalos construidos]{.m01-kw} mediante este procedimiento contendría **el parámetro poblacional.**
La media poblacional $\mu$ permanece fija. Los intervalos son los que cambian de una muestra a otra.
Una vez construido un intervalo particular, este contiene o no contiene a $\mu$. El 95 % se refiere al funcionamiento del procedimiento a largo plazo, no a la probabilidad de que $\mu$ esté dentro de ese intervalo específico.
:::
::: {.m05-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">3</div>
```
### De la confianza a la precisión
La amplitud de un intervalo depende principalmente de:
- el nivel de confianza;
- el tamaño de la muestra;
- la dispersión de los datos.
Si mantenemos constantes el tamaño de la muestra y la dispersión, un nivel de confianza mayor requiere un valor crítico más grande. Por eso, aumenta el margen de error y el intervalo se vuelve más ancho.
Por ejemplo, con los mismos datos, un intervalo de confianza del 99 % suele ser más amplio que uno del 95 %.
En cambio, si mantenemos fijo el nivel de confianza, una muestra más grande reduce el error estándar y suele producir un intervalo más estrecho.
Por lo tanto:
- **mayor confianza:** mayor cobertura esperada, pero un intervalo más amplio;
- **mayor precisión:** un intervalo más estrecho.
Un intervalo estrecho indica mayor precisión, pero no garantiza que la muestra represente correctamente a la población. Una muestra grande y sesgada puede producir un intervalo muy estrecho alrededor de una estimación incorrecta.
:::
:::
:::
::: {.rs-callout-warning style="background: rgba(102, 179, 224, 0.1); border-left: 4px solid #6672e0; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}
**Recordario:** El valor crítico indica cuántos errores estándar se suman y restan a la media muestral para construir un intervalo con el nivel de confianza elegido.
$$
ME=\text{valor crítico}\times SE
$$
Para un intervalo del 95 % basado en la distribución normal:
$$
z^*=1{,}96
$$
Por lo tanto:
$$
IC=\bar{x}\pm1{,}96SE
$$
A mayor nivel de confianza, mayor valor crítico y más amplio será el intervalo:
90 %: $1{,}645$
95 %: $1{,}96$
99 %: $2{,}576$
:::
::: {.m05-lesson-section #laboratorio}
## Laboratorio de Intervalos de Confianza
Extrae muestras repetidas, construye un intervalo alrededor de cada media y observa cómo el nivel de confianza, el tamaño muestral, la dispersión y el tipo de selección modifican su ancho y su cobertura.
```{=html}
<div class="lab-fullscreen-launcher">
<a class="lab-fullscreen-link" href="../labs/inferencia/m05-intervalos-confianza-laboratorio.html" target="_blank" rel="noopener noreferrer" aria-label="Abrir el Laboratorio de Intervalos de Confianza en una pestaña nueva">
<span>Ver en pantalla completa</span>
<span class="lab-fullscreen-link__icon" aria-hidden="true">↗</span>
</a>
</div>
<div id="m05-lab-root" class="m05-lab-surface m05-lab-breakout" data-lab-id="m05-intervalos-confianza" data-fullscreen-url="../labs/inferencia/m05-intervalos-confianza-laboratorio.html"></div>
```
:::
::: {.m05-lesson-section #explicador-ic}
## Cómo se construye un intervalo
```{=html}
<div id="m05-ci-explainer" class="m05-explainer-section"></div>
```
:::
## ¿Qué significa un 95% de confianza?
Imaginemos que repetimos muchas veces el mismo procedimiento:
::: {.rs-callout-warning style="background: rgba(102, 179, 224, 0.1); border-left: 4px solid #6672e0; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}
**extraer una muestra → calcular su media → estimar el error estándar → construir un intervalo**
:::
Cada muestra produce una media y un intervalo diferentes.
::: {.m05-table-wrap}
| Elemento | Significado |
| :--- | :--- |
| **Cada repetición** | Produce un intervalo distinto. |
| **Confianza del 95 %** | A largo plazo, aproximadamente el 95 % de los intervalos construidos con el mismo procedimiento contendría la media poblacional $\mu$. |
| **En una simulación** | La cobertura observada puede ser mayor o menor que 95 %. |
: Interpretación del nivel de confianza
:::
El 95 % describe el funcionamiento del procedimiento a largo plazo. Una vez construido un intervalo particular, este contiene o no contiene a $\mu$.
::: {.m05-lesson-section #como-interpretarlo}
## Cómo interpretarlo
- ¿Qué comunica un intervalo? → Comunica un rango de valores plausibles para el promedio poblacional y hace visible la incertidumbre asociada al muestreo.
- ¿Qué significa el 95%? → Si repitiéramos muchas veces el procedimiento, aproximadamente el 95% de los intervalos construidos de la misma manera contendría la media poblacional.
- ¿Qué hace más preciso un intervalo? → Una muestra más grande o una menor dispersión suele producir intervalos más estrechos.
- ¿Qué no puede asegurar? → Un intervalo no demuestra que la muestra esté libre de problemas de selección, cobertura o medición. Tampoco muestra dónde se encuentra el 95% de las personas de la población.
:::
::: {.m05-lesson-section .rs-example-section #ejemplo-aplicado}
<details class="rs-example-disclosure">
<summary class="rs-example-disclosure__summary">
<span class="rs-example-disclosure__heading" role="heading" aria-level="2">Ejemplo aplicado</span>
<span class="rs-example-disclosure__action"><span class="rs-example-disclosure__show">Ver ejemplo</span><span class="rs-example-disclosure__hide">Ocultar ejemplo</span><span class="rs-example-disclosure__chevron" aria-hidden="true">↓</span></span>
</summary>
::: {.rs-example-disclosure__content}
Supongamos que una muestra tiene:
$$
\bar{x}=\$800.000,
\qquad
s=\$100.000,
\qquad
n=1.600
$$
Como no conocemos la desviación estándar poblacional $\sigma$, utilizamos la distribución $t$ y la desviación estándar muestral $s$.
### 1. Error estándar
$$
SE_{\bar{X}}
=
\frac{s}{\sqrt{n}}
=
\frac{100.000}{\sqrt{1.600}}
=
\$2.500
$$
Esto significa que las medias obtenidas en muestras similares suelen variar aproximadamente $\$2.500$.
Los grados de libertad son:
$$
gl=n-1=1.599
$$
### 2. Construcción de los intervalos
El margen de error se calcula mediante:
$$
ME=t^*\times SE_{\bar{X}}
$$
| Confianza | Valor crítico ($t^*$) | Margen de error | Intervalo de confianza |
| :--- | :--- | :--- | :--- |
| **95 %** | $1{,}961$ | $\approx \$4.904$ | $[\$795.096;\ \$804.904]$ |
| **99 %** | $2{,}579$ | $\approx \$6.447$ | $[\$793.553;\ \$806.447]$ |
: Comparación de los intervalos de confianza {.m05-table}
Interpretación
El intervalo del 99 % es más ancho porque utiliza un valor crítico mayor.
Con los mismos datos:
mayor confianza: mayor margen de error;
mayor margen de error: intervalo más ancho;
intervalo más ancho: menor precisión.
Como la muestra es muy grande, el intervalo calculado con la distribución $t$ es casi igual al obtenido con la distribución normal.
Utilizamos $t$ porque desconocemos $\sigma$ y trabajamos con la desviación estándar muestral $s$.
:::
</details>
:::
```{=html}
<script src="../assets/js/m05-intervalos-confianza.js"></script>
```
::: {.inference-endmatter}
<details class="inference-endmatter__item inference-endmatter__formulas">
<summary><span>Fórmulas mínimas y complementarias</span></summary>
::: {.inference-endmatter__content}
Error estándar estimado:
$$
SE_{\bar X}=\frac{s}{\sqrt{n}}
$$
Intervalo t para una media:
$$
IC_{1-\alpha}=\bar{x}\pm t_{1-\alpha/2,n-1}\frac{s}{\sqrt{n}}
$$
Intervalo z:
$$
IC_{1-\alpha}=\bar{x}\pm z_{1-\alpha/2}\frac{\sigma}{\sqrt{n}}
$$
Margen de error:
$$
ME=t^{*}SE_{\bar X}
$$
En estas expresiones, \(\bar{x}\) es la media muestral, \(s\) la desviación estándar muestral, \(\sigma\) la desviación estándar poblacional, \(n\) el tamaño muestral, \(\alpha\) el complemento del nivel de confianza, \(t^{*}\) o \(z^{*}\) el valor crítico, \(SE\) el error estándar, \(ME\) el margen de error, \(LI\) el límite inferior y \(LS\) el límite superior.
:::
</details>
<details class="inference-endmatter__item inference-endmatter__code">
<summary><span>Código en R y Python</span></summary>
::: {.inference-endmatter__content}
::: {.panel-tabset .rs-code-tabs}
### R {.unnumbered .unlisted}
```r
set.seed(123)
media_poblacional <- 800000
desviacion_poblacional <- 100000
n <- 1600
# Muestra pedagógica con media y desviación controladas
x <- rnorm(n)
x <- media_poblacional + ((x - mean(x)) / sd(x)) * desviacion_poblacional
media_muestral <- mean(x)
s <- sd(x)
se <- s / sqrt(n)
gl <- n - 1
t_95 <- qt(0.975, df = gl)
t_99 <- qt(0.995, df = gl)
z_95 <- qnorm(0.975)
ic_t_95 <- media_muestral + c(-1, 1) * t_95 * se
ic_t_99 <- media_muestral + c(-1, 1) * t_99 * se
ic_z_95 <- media_muestral +
c(-1, 1) *
z_95 *
desviacion_poblacional /
sqrt(n)
round(c(media = media_muestral, s = s, se = se, t_95 = t_95), 3)
round(ic_t_95, 0)
round(ic_t_99, 0)
round(ic_z_95, 0)
# Comparación de tamaños
tamanos <- c(25, 100, 400, 1600)
data.frame(
n = tamanos,
gl = tamanos - 1,
t_critico = qt(0.975, df = tamanos - 1),
SE = desviacion_poblacional / sqrt(tamanos),
ME = qt(0.975, df = tamanos - 1) * desviacion_poblacional / sqrt(tamanos)
)
# Simulación de cobertura
simular_intervalos <- function(repeticiones = 1000, n = 1600, confianza = 0.95) {
alpha <- 1 - confianza
replicate(repeticiones, {
muestra <- rnorm(n, media_poblacional, desviacion_poblacional)
xbar <- mean(muestra)
s <- sd(muestra)
se <- s / sqrt(n)
tcrit <- qt(1 - alpha / 2, df = n - 1)
li <- xbar - tcrit * se
ls <- xbar + tcrit * se
c(
xbar = xbar,
li = li,
ls = ls,
captura = li <= media_poblacional & ls >= media_poblacional
)
})
}
intervalos <- t(simular_intervalos())
mean(intervalos[, "captura"])
# Forest plot de 100 intervalos
plot(
intervalos[1:100, "xbar"],
seq_len(100),
xlim = range(intervalos[1:100, c("li", "ls")]),
pch = 19,
xlab = "Ingreso promedio estimado",
ylab = "Muestra"
)
segments(
intervalos[1:100, "li"],
seq_len(100),
intervalos[1:100, "ls"],
seq_len(100)
)
abline(v = media_poblacional, lty = 2)
```
### Python {.unnumbered .unlisted}
```python
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt
rng = np.random.default_rng(123)
media_poblacional = 800_000
desviacion_poblacional = 100_000
n = 1600
# Muestra pedagógica con media y desviación controladas
x = rng.normal(size=n)
x = (
media_poblacional
+ ((x - x.mean()) / x.std(ddof=1))
* desviacion_poblacional
)
media_muestral = x.mean()
s = x.std(ddof=1)
se = s / np.sqrt(n)
gl = n - 1
t_95 = stats.t.ppf(0.975, df=gl)
t_99 = stats.t.ppf(0.995, df=gl)
z_95 = stats.norm.ppf(0.975)
ic_t_95 = media_muestral + np.array([-1, 1]) * t_95 * se
ic_t_99 = media_muestral + np.array([-1, 1]) * t_99 * se
ic_z_95 = (
media_muestral
+ np.array([-1, 1])
* z_95
* desviacion_poblacional
/ np.sqrt(n)
)
print(media_muestral, s, se, t_95)
print(ic_t_95)
print(ic_t_99)
print(ic_z_95)
# Comparación de tamaños
for n_actual in [25, 100, 400, 1600]:
gl = n_actual - 1
se = desviacion_poblacional / np.sqrt(n_actual)
tcrit = stats.t.ppf(0.975, df=gl)
print(n_actual, tcrit, se, tcrit * se)
# Simulación de cobertura
def simular_intervalos(repeticiones=1000, n=1600, confianza=0.95):
alpha = 1 - confianza
filas = []
for _ in range(repeticiones):
muestra = rng.normal(
media_poblacional,
desviacion_poblacional,
size=n
)
xbar = muestra.mean()
s = muestra.std(ddof=1)
se = s / np.sqrt(n)
tcrit = stats.t.ppf(1 - alpha / 2, df=n - 1)
li = xbar - tcrit * se
ls = xbar + tcrit * se
filas.append((xbar, li, ls, li <= media_poblacional <= ls))
return np.array(filas, dtype=object)
intervalos = simular_intervalos()
print(intervalos[:, 3].mean())
# Forest plot de 100 intervalos
fig, ax = plt.subplots()
for i, (xbar, li, ls, captura) in enumerate(
intervalos[:100],
start=1
):
estilo = "-" if captura else "--"
color = "tab:blue" if captura else "tab:red"
ax.plot([li, ls], [i, i], linestyle=estilo, color=color)
ax.plot(xbar, i, "o", color=color)
ax.axvline(
media_poblacional,
linestyle="--",
color="black"
)
ax.set_xlabel("Ingreso promedio estimado")
ax.set_ylabel("Muestra")
plt.show()
```
:::
:::
</details>
<details class="inference-endmatter__item inference-endmatter__references">
<summary><span>Bibliografía</span></summary>
::: {.inference-endmatter__content}
- Agresti, A., y Finlay, B. *Statistical Methods for the Social Sciences*. Pearson.
- Moore, D. S. (2010). *Estadística aplicada básica*. Antoni Bosch.
- Navarro, D. J. *Learning Statistics with R*.
:::
</details>
:::
```{=html}
<nav class="rs-lesson-footer-nav rs-inference-footer-nav" aria-label="Navegación entre módulos">
<a href="m04_teorema_limite_central_error_estandar.qmd" class="rs-nav-link rs-nav-link--previous">
<span class="rs-nav-link__arrow" aria-hidden="true">←</span>
<span class="rs-nav-link__copy">
<span class="rs-nav-link__label">Módulo anterior</span>
<span class="rs-nav-link__title">M04. Teorema del límite central y error estándar</span>
</span>
</a>
<a href="m06_test_hipotesis_falsacion.qmd" class="rs-nav-link rs-nav-link--next">
<span class="rs-nav-link__copy">
<span class="rs-nav-link__label">Siguiente módulo</span>
<span class="rs-nav-link__title">M06. Test de hipótesis y lógica de falsación</span>
</span>
<span class="rs-nav-link__arrow" aria-hidden="true">→</span>
</a>
</nav>
```
:::