Estadística Correlacional Interactiva
  • Inicio
  • Inferencia
    • M01. Datos, medición y variabilidad
    • M02. Probabilidad y distribuciones muestrales
    • M03. Curva normal y puntajes Z
    • M04. Teorema del límite central y error estándar
    • M05. Intervalos de confianza
    • M06. Test de hipótesis y lógica de falsación
    • M07. Hipótesis direccionales y no direccionales
  • Asociación bivariada
    • M08. Asociación, covarianza y correlación de Pearson
    • M09. Inferencia y magnitud de la correlación
    • M10. Correlaciones ordinales: Spearman y Kendall
    • M11. Matrices de correlación y casos perdidos
    • M12. Baterías, consistencia e índices
    • M13. Variables categóricas y tablas de contingencia
    • M14. Chi-cuadrado y magnitud de la asociación
  • Glosario

Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 03

M03. Curva normal y puntajes Z

Para comparar valores de escalas diferentes, no basta con mirar cuál es mayor. Necesitamos saber dónde se encuentra cada valor respecto de la media de su grupo y cuánta dispersión existe en esa distribución. En este módulo aprenderás a expresar esa posición mediante un puntaje Z, que expresa esa distancia considerando la dispersión de los datos. Cuando la distribución es aproximadamente normal, puede relacionarse con un área bajo la curva y con un percentil aproximado.

Pregunta social

¿Quién ocupa una posición más alta dentro de su grupo?

Mary obtiene 26 puntos en una prueba cuya escala va de 0 a 36. Jason obtiene 900 puntos en otra prueba cuya escala va de 200 a 1600. Aunque 900 es numéricamente mayor que 26, esta comparación directa no nos indica quién ocupa una posición más alta dentro de su grupo. Los puntajes pertenecen a escalas diferentes y fueron obtenidos en distribuciones distintas. Para comparar sus posiciones relativas necesitamos conocer, en cada prueba: la media del grupo de referencia; la desviación estándar; la distancia entre el puntaje observado y la media. El puntaje Z reúne esa información en una escala común.

Idea central

Para saber qué representa un valor, no basta con observar el número. Primero debemos compararlo con el grupo al que pertenece. Necesitamos conocer la media y la desviación estándar de ese grupo. Después calculamos qué tan lejos se encuentra el valor de la media y expresamos esa distancia en desviaciones estándar mediante un puntaje Z.

El recorrido es el siguiente:

Valor observado → grupo de referencia → media y desviación estándar → distancia respecto de la media → puntaje Z → posición relativa

Si la distribución puede representarse adecuadamente mediante una curva normal, también podemos relacionar esa posición con un área bajo la curva y con un percentil aproximado.

Puntaje Z → área bajo la curva normal → percentil aproximado

1

Del puntaje bruto a la posición relativa

Un puntaje bruto es el valor original obtenido por una persona, como el resultado de una prueba, su estatura o su ingreso. Ese valor, por sí solo, no muestra si es alto o bajo dentro de su grupo.

El puntaje Z indica qué tan lejos se encuentra un valor de la media, utilizando la desviación estándar como unidad de comparación. El grupo de referencia importa, porque un mismo valor puede tener distintos puntajes Z según el grupo con el que se compare. Por ejemplo, el resultado puede cambiar si se toma como referencia al país completo, a un establecimiento o a un grupo de edad.

2

¿Qué indica el puntaje (Z)?

El puntaje Z indica cuántas desviaciones estándar se encuentra un valor por encima o por debajo de la media de su grupo.

Como utiliza una unidad común, permite comparar valores provenientes de distribuciones con medias, escalas o dispersiones diferentes.

\[ Z=0 \]

El valor coincide con la media.

\[ Z>0 \]

El valor se encuentra sobre la media.

\[ Z<0 \]

El valor se encuentra bajo la media.

\[ |Z| \]

Indica qué tan lejos se encuentra el valor de la media, sin considerar la dirección.

Por ejemplo:

\(Z=1{,}50\): el valor está 1,50 desviaciones estándar sobre la media. \(Z=-0{,}50\): el valor está 0,50 desviaciones estándar bajo la media.

En resumen, el signo indica la dirección y el valor absoluto indica la distancia respecto de la media. Su significado depende de la variable estudiada y del grupo utilizado como referencia.

3

De la distancia al área

El puntaje Z indica qué tan lejos se encuentra un valor de la media. Para interpretar esta distancia no es necesario que los datos sigan una distribución normal. Sin embargo, cuando la distribución es aproximadamente normal, el puntaje Z también permite estimar qué proporción de casos se encuentra por debajo de ese valor.

El proceso es:

puntaje Z → posición en la curva normal → área acumulada → percentil aproximado

El área ubicada a la izquierda del valor representa la proporción acumulada bajo la curva normal. Por ejemplo, un área de \(0{,}84\) indica que aproximadamente el 84 % de los casos se encuentra en o bajo ese valor.

Un puntaje Z puede calcularse siempre que dispongamos de una media y una desviación estándar.

La distribución no necesita ser normal para interpretar Z como una distancia estandarizada. Sin embargo, para convertir esa posición en un área o percentil mediante la curva, la distribución normal debe representar razonablemente los datos.

Si los datos son muy asimétricos, bimodales o están dominados por valores extremos, el puntaje Z sigue siendo válido como distancia respecto de la media, pero el percentil normal puede no describir correctamente los datos observados.

Recorrido: de la escala original al puntaje Z ¿Cómo se obtiene un puntaje Z?

El siguiente labortorio de la Curva Normal y Puntajes Z es reactivo con el reccorrido de ¿Cómo se obtiene un puntaje Z? Si cambia el escenario -ingreso, estatura…-, valor observado, media, etc en el laboratorio, El calculo del recorrido cambiara.

Laboratorio de Curva Normal y Puntajes Z

Ubica un puntaje respecto de su grupo, observa cómo se transforma en Z y relaciona su posición con un área bajo la curva normal. Modifica la media, la dispersión y la forma de los datos para examinar cuándo el modelo normal resulta adecuado.

Ver en pantalla completa ↗
Ejemplo aplicado · Comparar posiciones en escalas diferentes Ver ejemploOcultar ejemplo↓

Mary y Jason rindieron pruebas con escalas, medias y desviaciones estándar diferentes. Por eso, no podemos comparar directamente sus puntajes brutos. Para conocer quién ocupa una posición relativa más alta, debemos observar qué tan lejos se encuentra cada puntaje de la media de su propio grupo.

Comparación de la posición relativa de Mary y Jason
Paso de la comparación Mary Jason
Puntaje observado (\(x\)) 26 puntos 900 puntos
Media del grupo (\(\mu\)) 22 puntos 1.000 puntos
Desviación estándar (\(\sigma\)) 2 puntos 100 puntos
Distancia respecto de la media (\(x-\mu\)) \(26-22=4\) \(900-1\,000=-100\)
Interpretación de la distancia 4 puntos sobre la media 100 puntos bajo la media
Cálculo del puntaje Z \(Z=\dfrac{26-22}{2}\) \(Z=\dfrac{900-1\,000}{100}\)
Puntaje Z \(Z=2\) \(Z=-1\)
Posición relativa 2 desviaciones estándar sobre la media 1 desviación estándar bajo la media

Mary obtiene:

\[ Z_{\text{Mary}}=2 \]

Jason obtiene:

\[ Z_{\text{Jason}}=-1 \]

Por lo tanto, Mary ocupa una posición relativa más alta dentro de su grupo de referencia. Aunque 900 es numéricamente mayor que 26, ambos puntajes pertenecen a escalas diferentes y no pueden compararse directamente.

El puntaje Z muestra que Mary se encuentra dos desviaciones estándar sobre la media de su grupo, mientras que Jason se encuentra una desviación estándar bajo la media del suyo.

Esta comparación solo informa sobre la posición relativa de cada persona dentro de su grupo. No permite afirmar que una prueba sea más difícil que la otra ni que ambas midan exactamente la misma capacidad.

La interpretación mediante áreas o percentiles requiere, además, que la distribución de referencia sea razonablemente normal.

Para finalizar

El puntaje Z indica cuántas desviaciones estándar separan un valor de la media de su grupo. Por ejemplo, \(Z=-0{,}50\) significa que el valor está 0,50 desviaciones estándar bajo la media. Cuando la distribución es aproximadamente normal, Z también puede relacionarse con un área acumulada y un percentil:

\[ P(Z\leq -0{,}50)\approx 0{,}309 \]

Esto corresponde aproximadamente al percentil 31: cerca del 31 % de la distribución se encuentra en o bajo ese valor. No significa que la persona haya obtenido el 31 % del puntaje total.

El puntaje Z puede calcularse aunque la distribución no sea normal, pero el percentil normal solo debe interpretarse cuando la curva normal representa razonablemente los datos. Toda interpretación debe indicar el grupo de referencia, la dirección y la distancia respecto de la media.

Estandarizar una distribución no la vuelve normal. El puntaje Z compara posiciones relativas, pero no explica sus causas ni indica que una persona sea mejor o peor.

Fórmulas mínimas y complementarias

Puntaje Z poblacional:

\[ z=\frac{x-\mu}{\sigma} \]

Puntaje Z muestral:

\[ z=\frac{x-\bar{x}}{s} \]

Probabilidad acumulada:

\[ P(Z\leq z)=\Phi(z) \]

Área derecha:

\[ P(Z>z)=1-\Phi(z) \]

En estas expresiones, (x) es el valor observado, () la media poblacional, () la desviación estándar poblacional, ({x}) la media muestral, (s) la desviación estándar muestral, (z) la posición estandarizada y ((z)) el área acumulada bajo la curva normal estándar.

Código en R y Python
  • R
  • Python
# Ejemplo principal
puntaje <- 450
media <- 500
desviacion <- 100

z <- (puntaje - media) / desviacion
area_izquierda <- pnorm(z)
area_derecha <- 1 - pnorm(z)

z
area_izquierda
area_derecha

# Área entre Z = -1 y Z = 1
area_central <- pnorm(1) - pnorm(-1)
area_central

# Z asociado al percentil 80
z_percentil_80 <- qnorm(0.80)
z_percentil_80

# Comparación entre escalas
z_mary <- (26 - 22) / 2
z_jason <- (900 - 1000) / 100

c(Mary = z_mary, Jason = z_jason)

# Curva normal estándar y área izquierda de Z = -0.5
valores_z <- seq(-4, 4, length.out = 1000)
densidad <- dnorm(valores_z)

plot(
  valores_z,
  densidad,
  type = "l",
  xlab = "Puntaje Z",
  ylab = "Densidad",
  main = "Área acumulada bajo la curva normal"
)

zona <- valores_z <= z

polygon(
  c(valores_z[zona], z),
  c(densidad[zona], 0)
)

abline(v = z, lty = 2)

# Comparar datos empíricos con el modelo normal
set.seed(123)

puntajes <- rnorm(
  n = 300,
  mean = media,
  sd = desviacion
)

hist(
  puntajes,
  probability = TRUE,
  breaks = 20,
  xlab = "Puntaje",
  main = "Datos observados y curva normal"
)

curve(
  dnorm(x, mean = media, sd = desviacion),
  add = TRUE,
  lwd = 2
)

Python requiere SciPy para norm.cdf() y norm.ppf().

import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import norm

# Ejemplo principal
puntaje = 450
media = 500
desviacion = 100

z = (puntaje - media) / desviacion
area_izquierda = norm.cdf(z)
area_derecha = 1 - norm.cdf(z)

print("Puntaje Z:", z)
print("Área izquierda:", area_izquierda)
print("Área derecha:", area_derecha)

# Área entre Z = -1 y Z = 1
area_central = norm.cdf(1) - norm.cdf(-1)
print("Área entre -1 y 1:", area_central)

# Z asociado al percentil 80
z_percentil_80 = norm.ppf(0.80)
print("Z del percentil 80:", z_percentil_80)

# Comparación entre escalas
z_mary = (26 - 22) / 2
z_jason = (900 - 1000) / 100

print("Z de Mary:", z_mary)
print("Z de Jason:", z_jason)

# Curva normal estándar y área izquierda de Z = -0.5
valores_z = np.linspace(-4, 4, 1000)
densidad = norm.pdf(valores_z)

plt.plot(valores_z, densidad)
plt.fill_between(
    valores_z,
    densidad,
    where=valores_z <= z
)
plt.axvline(z, linestyle="--")
plt.xlabel("Puntaje Z")
plt.ylabel("Densidad")
plt.title("Área acumulada bajo la curva normal")
plt.show()

# Comparar datos empíricos con el modelo normal
rng = np.random.default_rng(123)

puntajes = rng.normal(
    loc=media,
    scale=desviacion,
    size=300
)

plt.hist(
    puntajes,
    bins=20,
    density=True,
    alpha=0.6
)

valores_x = np.linspace(
    media - 4 * desviacion,
    media + 4 * desviacion,
    1000
)

plt.plot(
    valores_x,
    norm.pdf(valores_x, loc=media, scale=desviacion)
)

plt.xlabel("Puntaje")
plt.ylabel("Densidad")
plt.title("Datos observados y curva normal")
plt.show()
Bibliografía
  • Moore, D. S. (2010). Estadística aplicada básica. Antoni Bosch.
  • Navarro, D. J. Learning Statistics with R.
  • Pardo, A., Ruiz, M. A., y San Martín, R. Análisis de datos en ciencias sociales y de la salud I. Síntesis.
← Módulo anterior M02. Probabilidad y distribuciones muestrales Siguiente módulo M04. Teorema del límite central y error estándar →
Ejecutar el código
---
pagetitle: "M03. Curva normal y puntajes Z | Estadística Correlacional Interactiva"
page-layout: custom
toc: false
body-class: rs-lesson-page inferencia-module m03-page
format:
  html:
    css:
      - ../assets/css/m03-curva-normal-puntajes-z.css
      - ../assets/css/inferencia-modules.css
---

::: {.rs-lesson-page-wrap .m03-module-intro}

::: {.m03-lesson-header}
::: {.inference-module-kicker .m01-module-kicker}
Unidad 1 · Inferencia estadística y distribuciones muestrales · Módulo 03
:::

# M03. Curva normal y puntajes Z

::: {.rs-module-lead}
Para comparar valores de escalas diferentes, no basta con mirar cuál es mayor. Necesitamos saber dónde se encuentra cada valor respecto de la media de su grupo y cuánta dispersión existe en esa distribución. En este módulo aprenderás a expresar esa posición mediante un puntaje Z, que expresa esa distancia considerando la dispersión de los datos. Cuando la distribución es aproximadamente normal, puede relacionarse con un área bajo la curva y con un percentil aproximado.
:::
:::

::: {.m03-lesson-section #pregunta-social}
## Pregunta social

### ¿Quién ocupa una posición más alta dentro de su grupo? {.m03-social-question-title}

```{=html}
<p class="m03-social-question-intro">Mary obtiene 26 puntos en una prueba cuya escala va de 0 a 36. Jason obtiene 900 puntos en otra prueba cuya escala va de 200 a 1600.

Aunque 900 es numéricamente mayor que 26, esta comparación directa no nos indica quién ocupa una posición más alta dentro de su grupo. Los puntajes pertenecen a escalas diferentes y fueron obtenidos en distribuciones distintas.

Para comparar sus posiciones relativas necesitamos conocer, en cada prueba:

la media del grupo de referencia;
la desviación estándar;
la distancia entre el puntaje observado y la media.

El puntaje Z reúne esa información en una escala común.
</p>
```
:::

::: {.m03-lesson-section #idea-central}
## Idea central

Para saber qué representa un valor, no basta con observar el número. Primero debemos compararlo con el grupo al que pertenece. Necesitamos conocer la media y la desviación estándar de ese grupo. Después calculamos qué tan lejos se encuentra el valor de la media y expresamos esa distancia en desviaciones estándar mediante un puntaje Z.

El recorrido es el siguiente:

::: {.rs-callout-warning .rs-callout-warning--m03-cyan-deep}
Valor observado → grupo de referencia → media y desviación estándar → distancia respecto de la media → puntaje Z → posición relativa
::: 

Si la distribución puede representarse adecuadamente mediante una curva normal, también podemos relacionar esa posición con un área bajo la curva y con un percentil aproximado.

Puntaje Z → área bajo la curva normal → percentil aproximado

::: {.m03-sequence-flow .rs-sequence-flow role="list"}
::: {.m03-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">1</div>
```

### Del puntaje bruto a la posición relativa

Un puntaje bruto es el valor original obtenido por una persona, como el resultado de una prueba, su estatura o su ingreso. Ese valor, por sí solo, no muestra si es alto o bajo dentro de su grupo.

El puntaje Z indica qué tan lejos se encuentra un valor de la media, utilizando la desviación estándar como unidad de comparación. El grupo de referencia importa, porque un mismo valor puede tener distintos puntajes Z según el grupo con el que se compare. Por ejemplo, el resultado puede cambiar si se toma como referencia al país completo, a un establecimiento o a un grupo de edad. 
:::

::: {.m03-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">2</div>
```

### ¿Qué indica el puntaje (Z)?
El puntaje Z indica cuántas desviaciones estándar se encuentra un valor por encima o por debajo de la media de su grupo.

Como utiliza una unidad común, permite comparar valores provenientes de distribuciones con medias, escalas o dispersiones diferentes.

$$
Z=0
$$

El valor coincide con la media.

$$
Z>0
$$

El valor se encuentra sobre la media.

$$
Z<0
$$

El valor se encuentra bajo la media.

$$
|Z|
$$

Indica qué tan lejos se encuentra el valor de la media, sin considerar la dirección.

Por ejemplo:

$Z=1{,}50$: el valor está 1,50 desviaciones estándar sobre la media.
$Z=-0{,}50$: el valor está 0,50 desviaciones estándar bajo la media.

En resumen, el signo indica la dirección y el valor absoluto indica la distancia respecto de la media. Su significado depende de la variable estudiada y del grupo utilizado como referencia.
:::

::: {.m03-flow-step .rs-flow-step role="listitem"}
```{=html}
<div class="rs-flow-step-num" aria-hidden="true">3</div>
```

### De la distancia al área

El puntaje Z indica qué tan lejos se encuentra un valor de la media. Para interpretar esta distancia no es necesario que los datos sigan una distribución normal. Sin embargo, cuando la distribución es aproximadamente normal, el puntaje Z también permite estimar qué proporción de casos se encuentra por debajo de ese valor.

El proceso es:

puntaje Z → posición en la curva normal → área acumulada → percentil aproximado

El área ubicada a la izquierda del valor representa la proporción acumulada bajo la curva normal. Por ejemplo, un área de $0{,}84$ indica que aproximadamente el 84 % de los casos se encuentra en o bajo ese valor.
:::
:::
:::

 
::: {.rs-callout-warning .rs-callout-warning--m03-cyan}

Un puntaje Z puede calcularse siempre que dispongamos de una media y una desviación estándar.

La distribución no necesita ser normal para interpretar Z como una distancia estandarizada. Sin embargo, para convertir esa posición en un área o percentil mediante la curva, la distribución normal debe representar razonablemente los datos.

Si los datos son muy asimétricos, bimodales o están dominados por valores extremos, el puntaje Z sigue siendo válido como distancia respecto de la media, pero el percentil normal puede no describir correctamente los datos observados.
:::

::: {.m03-lesson-section #secuencia-visual}
## Recorrido: de la escala original al puntaje Z ¿Cómo se obtiene un puntaje Z?

```{=html}
<div id="m03-standardization-explainer" class="m03-explainer-section"></div>
```
:::

::: {.rs-callout-warning style="background: rgb(255, 234, 0); border-left: 4px solid #daf704; padding: 1rem; border-radius: 4px; margin: 1.2rem 0;"}

El siguiente labortorio de la Curva Normal y Puntajes Z es **reactivo** con el reccorrido de ¿Cómo se obtiene un puntaje Z? Si cambia el escenario -ingreso, estatura...-, valor observado, media, etc en el laboratorio, **El calculo del recorrido cambiara**.
:::

::: {.m03-lesson-section #laboratorio}
## Laboratorio de Curva Normal y Puntajes Z

Ubica un puntaje respecto de su grupo, observa cómo se transforma en Z y relaciona su posición con un área bajo la curva normal. Modifica la media, la dispersión y la forma de los datos para examinar cuándo el modelo normal resulta adecuado.

```{=html}
<div class="lab-fullscreen-launcher">
  <a class="lab-fullscreen-link" href="../labs/inferencia/m03-curva-normal-puntajes-z-laboratorio.html" target="_blank" rel="noopener noreferrer" aria-label="Abrir el Laboratorio de Curva Normal y Puntajes Z en una pestaña nueva">
    <span>Ver en pantalla completa</span>
    <span class="lab-fullscreen-link__icon" aria-hidden="true">↗</span>
  </a>
</div>
<div id="m03-lab-root" class="m03-lab-surface m03-lab-breakout" data-lab-id="m03-curva-normal-z" data-fullscreen-url="../labs/inferencia/m03-curva-normal-puntajes-z-laboratorio.html"></div>
```
:::



::: {.m03-lesson-section .rs-example-section #ejemplo-aplicado}
<details class="rs-example-disclosure">
<summary class="rs-example-disclosure__summary">
<span class="rs-example-disclosure__heading" role="heading" aria-level="2">Ejemplo aplicado · Comparar posiciones en escalas diferentes</span>
<span class="rs-example-disclosure__action"><span class="rs-example-disclosure__show">Ver ejemplo</span><span class="rs-example-disclosure__hide">Ocultar ejemplo</span><span class="rs-example-disclosure__chevron" aria-hidden="true">↓</span></span>
</summary>

::: {.rs-example-disclosure__content}

Mary y Jason rindieron pruebas con escalas, medias y desviaciones estándar diferentes. Por eso, no podemos comparar directamente sus puntajes brutos. Para conocer quién ocupa una posición relativa más alta, debemos observar qué tan lejos se encuentra cada puntaje de la media de su propio grupo.

::: {.m01-table-wrap}
| Paso de la comparación | Mary | Jason |
| :--- | :--- | :--- |
| **Puntaje observado ($x$)** | 26 puntos | 900 puntos |
| **Media del grupo ($\mu$)** | 22 puntos | 1.000 puntos |
| **Desviación estándar ($\sigma$)** | 2 puntos | 100 puntos |
| **Distancia respecto de la media ($x-\mu$)** | $26-22=4$ | $900-1\,000=-100$ |
| **Interpretación de la distancia** | 4 puntos sobre la media | 100 puntos bajo la media |
| **Cálculo del puntaje Z** | $Z=\dfrac{26-22}{2}$ | $Z=\dfrac{900-1\,000}{100}$ |
| **Puntaje Z** | $Z=2$ | $Z=-1$ |
| **Posición relativa** | 2 desviaciones estándar sobre la media | 1 desviación estándar bajo la media |
: Comparación de la posición relativa de Mary y Jason {.m03-table}
::: 

Mary obtiene:

$$
Z_{\text{Mary}}=2
$$

Jason obtiene:

$$
Z_{\text{Jason}}=-1
$$

Por lo tanto, Mary ocupa una posición relativa más alta dentro de su grupo de referencia. Aunque 900 es numéricamente mayor que 26, ambos puntajes pertenecen a escalas diferentes y no pueden compararse directamente.

El puntaje Z muestra que Mary se encuentra dos desviaciones estándar sobre la media de su grupo, mientras que Jason se encuentra una desviación estándar bajo la media del suyo.

Esta comparación solo informa sobre la posición relativa de cada persona dentro de su grupo. No permite afirmar que una prueba sea más difícil que la otra ni que ambas midan exactamente la misma capacidad.

La interpretación mediante áreas o percentiles requiere, además, que la distribución de referencia sea razonablemente normal.

:::
</details>
:::


::: {.rs-callout-warning .rs-callout-warning--m03-blue}

**Para finalizar**

El puntaje Z indica cuántas desviaciones estándar separan un valor de la media de su grupo. Por ejemplo, $Z=-0{,}50$ significa que el valor está 0,50 desviaciones estándar bajo la media. Cuando la distribución es aproximadamente normal, Z también puede relacionarse con un área acumulada y un percentil:

$$
P(Z\leq -0{,}50)\approx 0{,}309
$$

Esto corresponde aproximadamente al percentil 31: cerca del 31 % de la distribución se encuentra en o bajo ese valor. No significa que la persona haya obtenido el 31 % del puntaje total.

El puntaje Z puede calcularse aunque la distribución no sea normal, pero el percentil normal solo debe interpretarse cuando la curva normal representa razonablemente los datos. Toda interpretación debe indicar el grupo de referencia, la dirección y la distancia respecto de la media.

> Estandarizar una distribución no la vuelve normal. El puntaje Z compara posiciones relativas, pero no explica sus causas ni indica que una persona sea mejor o peor.
:::


::: {.inference-endmatter}
<details class="inference-endmatter__item inference-endmatter__formulas">
<summary><span>Fórmulas mínimas y complementarias</span></summary>

::: {.inference-endmatter__content}

Puntaje Z poblacional:

$$
z=\frac{x-\mu}{\sigma}
$$

Puntaje Z muestral:

$$
z=\frac{x-\bar{x}}{s}
$$

Probabilidad acumulada:

$$
P(Z\leq z)=\Phi(z)
$$

Área derecha:

$$
P(Z>z)=1-\Phi(z)
$$

En estas expresiones, \(x\) es el valor observado, \(\mu\) la media poblacional, \(\sigma\) la desviación estándar poblacional, \(\bar{x}\) la media muestral, \(s\) la desviación estándar muestral, \(z\) la posición estandarizada y \(\Phi(z)\) el área acumulada bajo la curva normal estándar.

:::


</details>

<details class="inference-endmatter__item inference-endmatter__code">
<summary><span>Código en R y Python</span></summary>

::: {.inference-endmatter__content}

::: {.panel-tabset .rs-code-tabs}

### R {.unnumbered .unlisted}

```r
# Ejemplo principal
puntaje <- 450
media <- 500
desviacion <- 100

z <- (puntaje - media) / desviacion
area_izquierda <- pnorm(z)
area_derecha <- 1 - pnorm(z)

z
area_izquierda
area_derecha

# Área entre Z = -1 y Z = 1
area_central <- pnorm(1) - pnorm(-1)
area_central

# Z asociado al percentil 80
z_percentil_80 <- qnorm(0.80)
z_percentil_80

# Comparación entre escalas
z_mary <- (26 - 22) / 2
z_jason <- (900 - 1000) / 100

c(Mary = z_mary, Jason = z_jason)

# Curva normal estándar y área izquierda de Z = -0.5
valores_z <- seq(-4, 4, length.out = 1000)
densidad <- dnorm(valores_z)

plot(
  valores_z,
  densidad,
  type = "l",
  xlab = "Puntaje Z",
  ylab = "Densidad",
  main = "Área acumulada bajo la curva normal"
)

zona <- valores_z <= z

polygon(
  c(valores_z[zona], z),
  c(densidad[zona], 0)
)

abline(v = z, lty = 2)

# Comparar datos empíricos con el modelo normal
set.seed(123)

puntajes <- rnorm(
  n = 300,
  mean = media,
  sd = desviacion
)

hist(
  puntajes,
  probability = TRUE,
  breaks = 20,
  xlab = "Puntaje",
  main = "Datos observados y curva normal"
)

curve(
  dnorm(x, mean = media, sd = desviacion),
  add = TRUE,
  lwd = 2
)
```

### Python {.unnumbered .unlisted}

Python requiere SciPy para `norm.cdf()` y `norm.ppf()`.

```python
import numpy as np
import matplotlib.pyplot as plt
from scipy.stats import norm

# Ejemplo principal
puntaje = 450
media = 500
desviacion = 100

z = (puntaje - media) / desviacion
area_izquierda = norm.cdf(z)
area_derecha = 1 - norm.cdf(z)

print("Puntaje Z:", z)
print("Área izquierda:", area_izquierda)
print("Área derecha:", area_derecha)

# Área entre Z = -1 y Z = 1
area_central = norm.cdf(1) - norm.cdf(-1)
print("Área entre -1 y 1:", area_central)

# Z asociado al percentil 80
z_percentil_80 = norm.ppf(0.80)
print("Z del percentil 80:", z_percentil_80)

# Comparación entre escalas
z_mary = (26 - 22) / 2
z_jason = (900 - 1000) / 100

print("Z de Mary:", z_mary)
print("Z de Jason:", z_jason)

# Curva normal estándar y área izquierda de Z = -0.5
valores_z = np.linspace(-4, 4, 1000)
densidad = norm.pdf(valores_z)

plt.plot(valores_z, densidad)
plt.fill_between(
    valores_z,
    densidad,
    where=valores_z <= z
)
plt.axvline(z, linestyle="--")
plt.xlabel("Puntaje Z")
plt.ylabel("Densidad")
plt.title("Área acumulada bajo la curva normal")
plt.show()

# Comparar datos empíricos con el modelo normal
rng = np.random.default_rng(123)

puntajes = rng.normal(
    loc=media,
    scale=desviacion,
    size=300
)

plt.hist(
    puntajes,
    bins=20,
    density=True,
    alpha=0.6
)

valores_x = np.linspace(
    media - 4 * desviacion,
    media + 4 * desviacion,
    1000
)

plt.plot(
    valores_x,
    norm.pdf(valores_x, loc=media, scale=desviacion)
)

plt.xlabel("Puntaje")
plt.ylabel("Densidad")
plt.title("Datos observados y curva normal")
plt.show()
```

:::

:::
</details>

<details class="inference-endmatter__item inference-endmatter__references">
<summary><span>Bibliografía</span></summary>

::: {.inference-endmatter__content}

- Moore, D. S. (2010). *Estadística aplicada básica*. Antoni Bosch.
- Navarro, D. J. *Learning Statistics with R*.
- Pardo, A., Ruiz, M. A., y San Martín, R. *Análisis de datos en ciencias sociales y de la salud I*. Síntesis.

:::
</details>
:::

```{=html}
<nav class="rs-lesson-footer-nav rs-inference-footer-nav" aria-label="Navegación entre módulos">
  <a href="m02_probabilidad_distribuciones_muestrales.qmd" class="rs-nav-link rs-nav-link--previous">
    <span class="rs-nav-link__arrow" aria-hidden="true">←</span>
    <span class="rs-nav-link__copy">
      <span class="rs-nav-link__label">Módulo anterior</span>
      <span class="rs-nav-link__title">M02. Probabilidad y distribuciones muestrales</span>
    </span>
  </a>

  <a href="m04_teorema_limite_central_error_estandar.qmd" class="rs-nav-link rs-nav-link--next">
    <span class="rs-nav-link__copy">
      <span class="rs-nav-link__label">Siguiente módulo</span>
      <span class="rs-nav-link__title">M04. Teorema del límite central y error estándar</span>
    </span>
    <span class="rs-nav-link__arrow" aria-hidden="true">→</span>
  </a>
</nav>
```

:::

```{=html}
<script src="../assets/js/m03-curva-normal-puntajes-z.js"></script>
```

Estadística Correlacional Interactiva
Facultad de Ciencias Sociales
Departamento de Sociología
Universidad de Chile

Volver arriba

Sitio creado por Katherine Aravena .

Código bajo licencia MIT · Ver repositorio en GitHub