Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 01
Medir nos permite convertir características de la vida social en datos que podemos organizar y comparar. Sin embargo, ningún número describe por sí solo toda la realidad de un grupo. En este módulo observarás cómo los ingresos de distintos hogares forman una distribución. Aprenderás por qué la media debe interpretarse junto con la mediana, la forma de la distribución y la dispersión de los casos.
Imagina que un informe señala que el ingreso mensual promedio de los hogares de una comuna es de $700.000. ¿Qué te permite saber esa cifra? El promedio entrega información sobre el centro de los ingresos observados. Sin embargo, no indica por sí solo si la mayoría de los hogares recibe un ingreso cercano a esa cantidad, si existen grandes diferencias internas o si unos pocos ingresos muy altos están elevando el resultado.
Para comprender qué representa el promedio, necesitamos observar los hogares que se encuentran detrás de esa cifra. Para ilustrar este problema empírico, imaginemos dos comunas que reportan el mismo ingreso promedio de $700.000 mensuales, pero con realidades de estratificación interna opuestas:
Grupo A · Concentrado
La mayoría de los hogares recibe ingresos cercanos a $700.000. Los valores se ubican aproximadamente entre $620.000 y $780.000. En este grupo, la media se encuentra cerca de gran parte de los casos.
Grupo B · Disperso y desigual
Algunos hogares reciben cerca de $300.000, mientras que otros superan $1.000.000. La media continúa siendo $700.000, pero muchos hogares se encuentran alejados de ella.
Antes de calcular un promedio, necesitamos identificar qué observamos y cómo lo convertimos en datos. Para describir una variable no basta con preguntar dónde está su centro, también necesitamos observar cómo se distribuyen los casos alrededor. En este ejemplo, cada hogar es una unidad de análisis y su ingreso mensual es el valor observado de la variable ingreso. Para pasar desde los casos individuales hasta una descripción del grupo, seguiremos tres pasos.
Cada hogar es una unidad de análisis. La característica que observamos es su ingreso mensual y el valor registrado para cada hogar es un dato. Una variable es una característica que puede tomar valores diferentes entre las unidades. En este caso, la variable es el ingreso mensual del hogar.
Un ingreso aislado nos informa sobre un hogar. Cuando reunimos los ingresos de todos los hogares, obtenemos una distribución observada. La distribución permite observar dónde se concentran los casos, cuánto se separan entre sí, qué forma presentan y si existen valores alejados del resto.
La media y la mediana nos ayudan a identificar el centro de una distribución, pero no indican por sí solas qué tan separados están los casos.
Para describir esa separación utilizamos medidas de dispersión, como la varianzay la desviación estándar. Una dispersión mayor indica que los valores se encuentran, en conjunto, más alejados de la media.
Conexión con tu Grupo Activo:
La siguiente animación interactiva toma los datos exactos del grupo que estás analizando arriba en el laboratorio y desglosa paso a paso cómo la estadística construye el concepto de desviación estándar (\(s\)) a partir de las distancias individuales.
La siguiente tabla resume exactamente los indicadores paramétricos y robustos obtenidos para los escenarios didácticos compactos.
Para facilitar la reproducción manual, el ejemplo siguiente utiliza una muestra reducida de nueve hogares por grupo.
| Escenario empírico | Hogares (N) | Media (\(\bar{X}\)) | Mediana (\(Me\)) | Desviación estándar (\(s\)) |
|---|---|---|---|---|
| Grupo A · Concentrado | 9 | $700.000 | $700.000 | $48.477 |
| Grupo B · Disperso | 9 | $700.000 | $700.000 | $258.602 |
| Grupo B + Valor extremo ($3,0M) | 10 | $930.000 | $700.000 | $767.101 |
¿Qué muestra la comparación? Los grupos A y B tienen la misma media y la misma mediana. Sin embargo, la desviación estándar del Grupo B es mucho mayor, porque sus ingresos se encuentran más separados de la media. Al agregar un hogar con ingreso de $3.000.000: la media aumenta de $700.000 a $930.000;la mediana se mantiene en $700.000; la desviación estándar aumenta de $258.602 a $767.101. El valor extremo afecta especialmente a la media y a la desviación estándar porque ambas medidas utilizan la magnitud de todos los valores. La mediana se mantiene porque la posición central de los casos ordenados no cambia.
La media aritmética (\(\bar{X}\)) se define como la suma de todos los valores observados dividida por el número total de unidades en la muestra (\(n\)):
\[\bar{X} = \frac{\sum_{i=1}^{n} X_i}{n}\]
La varianza muestral (\(s^2\)) cuantifica el promedio de las desviaciones al cuadrado respecto de la media. Para garantizar que sea un estimador insesgado de la varianza poblacional, se divide por los grados de libertad (\(n - 1\)):
\[s^2 = \frac{\sum_{i=1}^{n} (X_i - \bar{X})^2}{n - 1}\]
La desviación estándar (\(s\)) es la raíz cuadrada positiva de la varianza muestral, lo que nos devuelve a las unidades de medición originales del fenómeno sociológico (en nuestro caso, pesos chilenos):
\[s = \sqrt{s^2} = \sqrt{\frac{\sum_{i=1}^{n} (X_i - \bar{X})^2}{n - 1}}\]
A continuación presentamos cómo implementar la simulación de una encuesta salarial (\(N = 200\)), calcular los estimadores muestrales exactos y generar el diagnóstico visual de dispersión utilizando los dos lenguajes estándar en análisis científico y sociológico.
# Fijar semilla metodológica para reproducibilidad de la simulación
set.seed(123)
# Simular 200 observaciones de ingreso mensual con media 700 mil y sd 150 mil
ingresos <- rnorm(n = 200, mean = 700000, sd = 150000)
# Resumen estadístico paramétrico y no paramétrico
cat("Media aritmética (x̄): $", round(mean(ingresos), 0), "\n")
cat("Mediana muestral (Me): $", round(median(ingresos), 0), "\n")
cat("Desviación estándar (s): $", round(sd(ingresos), 0), "\n") # Utiliza n-1 por defecto
cat("Varianza muestral (s²): ", round(var(ingresos), 0), "\n")
# Gráfico de histograma con línea vertical de la media y mediana
hist(ingresos, breaks = 15, col = "#3b82f6", border = "white",
main = "Distribución del Ingreso Simulado (N = 200)",
xlab = "Ingreso Mensual ($)", ylab = "Frecuencia de Hogares")
abline(v = mean(ingresos), col = "#1d4ed8", lwd = 3) # Línea azul: Media
abline(v = median(ingresos), col = "#d97706", lwd = 3, lty = 2) # Línea ámbar: Mediana
legend("topright", legend = c("Media", "Mediana"),
col = c("#1d4ed8", "#d97706"), lwd = 3, lty = c(1, 2), bg = "white", text.col = "black")import numpy as np
import matplotlib.pyplot as plt
# Fijar semilla aleatoria y generar distribución normal simulada
np.random.seed(123)
ingresos = np.random.normal(loc=700000, scale=150000, size=200)
# Cálculo de estadísticos muestrales (ddof=1 para utilizar denominador n - 1)
media = np.mean(ingresos)
mediana = np.median(ingresos)
desviacion = np.std(ingresos, ddof=1)
varianza = np.var(ingresos, ddof=1)
print(f"Media aritmética (x̄): ${media:,.0f}".replace(',', '.'))
print(f"Mediana muestral (Me): ${mediana:,.0f}".replace(',', '.'))
print(f"Desviación estándar (s): ${desviacion:,.0f}".replace(',', '.'))
print(f"Varianza muestral (s²): {varianza:,.0f}".replace(',', '.'))
# Visualización con histograma y líneas de referencia
plt.figure(figsize=(9, 5))
plt.hist(ingresos, bins=15, color='#3b82f6', edgecolor='white', alpha=0.85)
plt.axvline(media, color='#1d4ed8', linewidth=3, label=f'Media: ${media:,.0f}'.replace(',', '.'))
plt.axvline(mediana, color='#d97706', linewidth=3, linestyle='--', label=f'Mediana: ${mediana:,.0f}'.replace(',', '.'))
plt.title("Distribución del Ingreso Simulado (N = 200)")
plt.xlabel("Ingreso Mensual ($)")
plt.ylabel("Frecuencia de Hogares")
plt.legend()
plt.grid(axis='y', alpha=0.2)
plt.show()R.---
pagetitle: "M01. Datos, medición y variabilidad | Estadística Correlacional Interactiva"
page-layout: custom
toc: false
body-class: rs-lesson-page inferencia-module m01-page
format:
html:
css:
- ../assets/css/m01-datos-medicion.css
- ../assets/css/inferencia-modules.css
---
::: {.rs-lesson-page-wrap}
::: {.m01-module-intro}
::: {.inference-module-kicker .m01-module-kicker}
Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 01
:::
# M01. Datos, medición y variabilidad {.m01-title}
::: {.m01-module-lead .rs-module-lead}
Medir nos permite convertir características de la vida social en datos que podemos organizar y comparar. Sin embargo, ningún número describe por sí solo toda la realidad de un grupo. En este módulo observarás cómo los ingresos de distintos hogares forman una distribución. Aprenderás por qué la media debe interpretarse junto con la mediana, la forma de la distribución y la dispersión de los casos.
:::
:::
::: {.rs-lesson-section #pregunta-social}
## Pregunta Social
::: {.m01-editorial-block}
### ¿El ingreso promedio representa bien a todos los hogares de un grupo? {.m01-social-question-title}
::: {.m01-social-question-intro}
Imagina que un informe señala que el ingreso mensual promedio de los hogares de una comuna es de $700.000. ¿Qué te permite saber esa cifra? El promedio entrega información sobre el centro de los ingresos observados. Sin embargo, no indica por sí solo si la mayoría de los hogares recibe un ingreso cercano a esa cantidad, si existen grandes diferencias internas o si unos pocos ingresos muy altos están elevando el resultado.
Para comprender qué representa el promedio, necesitamos observar los hogares que se encuentran detrás de esa cifra. Para ilustrar este problema empírico, imaginemos dos comunas que reportan el mismo ingreso promedio de **$700.000 mensuales**, pero con realidades de estratificación interna opuestas:
:::
::: {.m01-group-comparison-box}
::: {.m01-group-col}
[Grupo A · Concentrado]{.m01-group-badge .m01-badge-a}
#### Homogeneidad interna
La mayoría de los hogares recibe ingresos cercanos a $700.000. Los valores se ubican aproximadamente entre $620.000 y $780.000. En este grupo, la media se encuentra cerca de gran parte de los casos.
:::
::: {.m01-group-col}
[Grupo B · Disperso y desigual]{.m01-group-badge .m01-badge-b}
#### Alta heterogeneidad
Algunos hogares reciben cerca de $300.000, mientras que otros superan $1.000.000. La media continúa siendo $700.000, pero muchos hogares se encuentran alejados de ella.
:::
:::
:::
:::
::: {.rs-lesson-section #idea-central}
## Idea Central
Antes de calcular un promedio, necesitamos identificar qué observamos y cómo lo convertimos en datos. Para describir una variable no basta con preguntar dónde está su centro, también necesitamos observar cómo se distribuyen los casos alrededor. En este ejemplo, cada hogar es una unidad de análisis y su ingreso mensual es el valor observado de la variable ingreso. Para pasar desde los casos individuales hasta una descripción del grupo, seguiremos tres pasos.
::: {.m01-sequence-flow .rs-sequence-flow role="list"}
::: {.m01-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="m01-flow-step-num rs-flow-step-num" aria-hidden="true">1</div>
```
### De la unidad al dato
Cada hogar es una unidad de análisis. La característica que observamos es su ingreso mensual y el valor registrado para cada hogar es un dato. Una variable es una característica que puede tomar valores diferentes entre las unidades. En este caso, la variable es el ingreso mensual del hogar.
:::
::: {.m01-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="m01-flow-step-num rs-flow-step-num" aria-hidden="true">2</div>
```
### De los casos a la distribución
Un ingreso aislado nos informa sobre un hogar. Cuando reunimos los ingresos de todos los hogares, obtenemos una distribución observada. La distribución permite observar dónde se concentran los casos, cuánto se separan entre sí, qué forma presentan y si existen valores alejados del resto.
:::
::: {.m01-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="m01-flow-step-num rs-flow-step-num" aria-hidden="true">3</div>
```
### Del promedio a la dispersión
La media y la mediana nos ayudan a identificar el centro de una distribución, pero no indican por sí solas qué tan separados están los casos.
Para describir esa separación utilizamos medidas de dispersión, como la [varianza]{.m01-kw}y la [desviación estándar]{.m01-kw}. Una dispersión mayor indica que los valores se encuentran, en conjunto, más alejados de la media.
:::
:::
:::
::: {.rs-lesson-section .column-screen-inset #laboratorio-interactivo}
```{=html}
<div class="lab-fullscreen-launcher">
<a class="lab-fullscreen-link" href="../labs/inferencia/m01-datos-medicion-laboratorio.html" target="_blank" rel="noopener noreferrer" aria-label="Abrir el Laboratorio de Medición y Variabilidad en una pestaña nueva">
<span>Ver en pantalla completa</span>
<span class="lab-fullscreen-link__icon" aria-hidden="true">↗</span>
</a>
</div>
<!-- Contenedor raíz del laboratorio interactivo de 3 zonas con expansión amplia (breakout) -->
<div id="m01-lab-root" class="m01-lab-surface m01-lab-breakout" data-lab-id="m01-datos-medicion" data-fullscreen-url="../labs/inferencia/m01-datos-medicion-laboratorio.html">
<!-- El contenido interactivo es generado e inyectado por m01-datos-medicion.js -->
</div>
```
:::
::: {.rs-lesson-section #calculo-dispersion}
## Recorrido: Cómo se calcula la dispersión
::: {.rs-callout-note .rs-callout-note--m01-blue}
**Conexión con tu Grupo Activo:**
La siguiente animación interactiva toma los datos exactos del grupo que estás analizando arriba en el laboratorio y desglosa paso a paso cómo la estadística construye el concepto de **desviación estándar ($s$)** a partir de las distancias individuales.
:::
```{=html}
<!-- Contenedor del explicador animado de dispersión (5 pasos) -->
<div id="m01-dispersion-explainer" class="m01-explainer-section">
<!-- El contenido animado es generado e inyectado por m01-datos-medicion.js -->
</div>
```
:::
::: {.rs-lesson-section .rs-example-section #ejemplo-aplicado}
<details class="rs-example-disclosure">
<summary class="rs-example-disclosure__summary">
<span class="rs-example-disclosure__heading" role="heading" aria-level="2">Ejemplo Aplicado: Contraste de Escenarios</span>
<span class="rs-example-disclosure__action"><span class="rs-example-disclosure__show">Ver ejemplo</span><span class="rs-example-disclosure__hide">Ocultar ejemplo</span><span class="rs-example-disclosure__chevron" aria-hidden="true">↓</span></span>
</summary>
::: {.rs-example-disclosure__content}
La siguiente tabla resume exactamente los indicadores paramétricos y robustos obtenidos para los escenarios didácticos compactos.
::: {.m01-compact-note}
Para facilitar la reproducción manual, el ejemplo siguiente utiliza una muestra reducida de nueve hogares por grupo.
:::
::: {.m01-table-wrap}
| Escenario empírico | Hogares (N) | Media ($\bar{X}$) | Mediana ($Me$) | Desviación estándar ($s$) |
| :--- | :--- | :--- | :--- | :--- |
| **Grupo A · Concentrado** | 9 | $700.000 | $700.000 | $48.477 |
| **Grupo B · Disperso** | 9 | $700.000 | $700.000 | $258.602 |
| **Grupo B + Valor extremo ($3,0M)** | 10 | $930.000 | $700.000 | $767.101 |
: Indicator values across simulated scenarios {.m01-table}
:::
::: {.rs-callout-warning .rs-callout-warning--m01-amber}
**¿Qué muestra la comparación?** Los grupos A y B tienen la misma media y la misma mediana. Sin embargo, la desviación estándar del Grupo B es mucho mayor, porque sus ingresos se encuentran más separados de la media. Al agregar un hogar con ingreso de $3.000.000: la media aumenta de $700.000 a $930.000;la mediana se mantiene en $700.000; la desviación estándar aumenta de $258.602 a $767.101. El valor extremo afecta especialmente a la media y a la desviación estándar porque ambas medidas utilizan la magnitud de todos los valores. La mediana se mantiene porque la posición central de los casos ordenados no cambia.
:::
:::
</details>
:::
::: {.inference-endmatter}
<details class="inference-endmatter__item inference-endmatter__formulas">
<summary><span>Fórmulas mínimas y complementarias</span></summary>
::: {.inference-endmatter__content}
::: {.m01-formula-card}
#### Fórmulas Canónicas del Centro y la Dispersión Muestral
La **media aritmética ($\bar{X}$)** se define como la suma de todos los valores observados dividida por el número total de unidades en la muestra ($n$):
$$\bar{X} = \frac{\sum_{i=1}^{n} X_i}{n}$$
La **varianza muestral ($s^2$)** cuantifica el promedio de las desviaciones al cuadrado respecto de la media. Para garantizar que sea un estimador insesgado de la varianza poblacional, se divide por los grados de libertad ($n - 1$):
$$s^2 = \frac{\sum_{i=1}^{n} (X_i - \bar{X})^2}{n - 1}$$
La **desviación estándar ($s$)** es la raíz cuadrada positiva de la varianza muestral, lo que nos devuelve a las unidades de medición originales del fenómeno sociológico (en nuestro caso, pesos chilenos):
$$s = \sqrt{s^2} = \sqrt{\frac{\sum_{i=1}^{n} (X_i - \bar{X})^2}{n - 1}}$$
```{=html}
<div class="m01-symbol-list">
<div class="m01-symbol-item"><span class="m01-symbol-tag">X_i</span> <span>Valor observado para la unidad o hogar <em>i</em>.</span></div>
<div class="m01-symbol-item"><span class="m01-symbol-tag">n</span> <span>Tamaño total de la muestra analizada (<em>N</em>).</span></div>
<div class="m01-symbol-item"><span class="m01-symbol-tag">X̄</span> <span>Media muestral o punto de equilibrio.</span></div>
<div class="m01-symbol-item"><span class="m01-symbol-tag">X_i - X̄</span> <span>Distancia o desvío respecto al promedio.</span></div>
<div class="m01-symbol-item"><span class="m01-symbol-tag">n - 1</span> <span>Grados de libertad (corrección muestral).</span></div>
<div class="m01-symbol-item"><span class="m01-symbol-tag">s</span> <span>Desviación estándar (dispersión típica).</span></div>
</div>
```
:::
:::
</details>
<details class="inference-endmatter__item inference-endmatter__code">
<summary><span>Código en R y Python</span></summary>
::: {.inference-endmatter__content}
A continuación presentamos cómo implementar la simulación de una encuesta salarial ($N = 200$), calcular los estimadores muestrales exactos y generar el diagnóstico visual de dispersión utilizando los dos lenguajes estándar en análisis científico y sociológico.
::: {.panel-tabset .rs-code-tabs}
### R {.unnumbered .unlisted}
```r
# Fijar semilla metodológica para reproducibilidad de la simulación
set.seed(123)
# Simular 200 observaciones de ingreso mensual con media 700 mil y sd 150 mil
ingresos <- rnorm(n = 200, mean = 700000, sd = 150000)
# Resumen estadístico paramétrico y no paramétrico
cat("Media aritmética (x̄): $", round(mean(ingresos), 0), "\n")
cat("Mediana muestral (Me): $", round(median(ingresos), 0), "\n")
cat("Desviación estándar (s): $", round(sd(ingresos), 0), "\n") # Utiliza n-1 por defecto
cat("Varianza muestral (s²): ", round(var(ingresos), 0), "\n")
# Gráfico de histograma con línea vertical de la media y mediana
hist(ingresos, breaks = 15, col = "#3b82f6", border = "white",
main = "Distribución del Ingreso Simulado (N = 200)",
xlab = "Ingreso Mensual ($)", ylab = "Frecuencia de Hogares")
abline(v = mean(ingresos), col = "#1d4ed8", lwd = 3) # Línea azul: Media
abline(v = median(ingresos), col = "#d97706", lwd = 3, lty = 2) # Línea ámbar: Mediana
legend("topright", legend = c("Media", "Mediana"),
col = c("#1d4ed8", "#d97706"), lwd = 3, lty = c(1, 2), bg = "white", text.col = "black")
```
### Python {.unnumbered .unlisted}
```python
import numpy as np
import matplotlib.pyplot as plt
# Fijar semilla aleatoria y generar distribución normal simulada
np.random.seed(123)
ingresos = np.random.normal(loc=700000, scale=150000, size=200)
# Cálculo de estadísticos muestrales (ddof=1 para utilizar denominador n - 1)
media = np.mean(ingresos)
mediana = np.median(ingresos)
desviacion = np.std(ingresos, ddof=1)
varianza = np.var(ingresos, ddof=1)
print(f"Media aritmética (x̄): ${media:,.0f}".replace(',', '.'))
print(f"Mediana muestral (Me): ${mediana:,.0f}".replace(',', '.'))
print(f"Desviación estándar (s): ${desviacion:,.0f}".replace(',', '.'))
print(f"Varianza muestral (s²): {varianza:,.0f}".replace(',', '.'))
# Visualización con histograma y líneas de referencia
plt.figure(figsize=(9, 5))
plt.hist(ingresos, bins=15, color='#3b82f6', edgecolor='white', alpha=0.85)
plt.axvline(media, color='#1d4ed8', linewidth=3, label=f'Media: ${media:,.0f}'.replace(',', '.'))
plt.axvline(mediana, color='#d97706', linewidth=3, linestyle='--', label=f'Mediana: ${mediana:,.0f}'.replace(',', '.'))
plt.title("Distribución del Ingreso Simulado (N = 200)")
plt.xlabel("Ingreso Mensual ($)")
plt.ylabel("Frecuencia de Hogares")
plt.legend()
plt.grid(axis='y', alpha=0.2)
plt.show()
```
:::
:::
</details>
<details class="inference-endmatter__item inference-endmatter__references">
<summary><span>Bibliografía</span></summary>
::: {.inference-endmatter__content}
- **Ritchey, F. J. (2008).** *Estadística para las ciencias sociales*. McGraw-Hill. (Capítulo 3: La imaginación estadística y la medición de variables sociales; Capítulo 4: Medidas de tendencia central y dispersión).
- **Moore, D. S. (2010).** *Estadística aplicada básica*. Antoni Bosch. (Capítulos 1 y 2: Descripción de distribuciones de datos numéricos y resistencia a valores extremos).
- **Cohen, J., Cohen, P., West, S. G., & Aiken, L. S. (2003).** *Applied multiple regression/correlation analysis for the behavioral sciences*. Routledge. (Capítulo 2: Bivariate distributions and variance foundations).
- **Navarro, D. (2018).** *Learning Statistics with R: A tutorial for psychology students and other beginners*. Enfoque intuitivo en estimadores insesgados ($n - 1$) y visualización exploratoria con `R`.
:::
</details>
:::
```{=html}
<nav class="rs-lesson-footer-nav rs-inference-footer-nav" aria-label="Navegación entre módulos">
<a href="../index.qmd" class="rs-nav-link rs-nav-link--previous">
<span class="rs-nav-link__arrow" aria-hidden="true">←</span>
<span class="rs-nav-link__copy">
<span class="rs-nav-link__label">Volver al inicio</span>
<span class="rs-nav-link__title">Estadística Correlacional Interactiva</span>
</span>
</a>
<a href="m02_probabilidad_distribuciones_muestrales.qmd" class="rs-nav-link rs-nav-link--next">
<span class="rs-nav-link__copy">
<span class="rs-nav-link__label">Siguiente módulo</span>
<span class="rs-nav-link__title">M02. Probabilidad y distribuciones muestrales</span>
</span>
<span class="rs-nav-link__arrow" aria-hidden="true">→</span>
</a>
</nav>
```
:::
```{=html}
<script src="../assets/js/m01-datos-medicion.js"></script>
```