Estadística Correlacional Interactiva
  • Inicio
  • Inferencia
    • M01. Datos, medición y variabilidad
    • M02. Probabilidad y distribuciones muestrales
    • M03. Curva normal y puntajes Z
    • M04. Teorema del límite central y error estándar
    • M05. Intervalos de confianza
    • M06. Test de hipótesis y lógica de falsación
    • M07. Hipótesis direccionales y no direccionales
  • Asociación bivariada
    • M08. Asociación, covarianza y correlación de Pearson
    • M09. Inferencia y magnitud de la correlación
    • M10. Correlaciones ordinales: Spearman y Kendall
    • M11. Matrices de correlación y casos perdidos
    • M12. Baterías, consistencia e índices
    • M13. Variables categóricas y tablas de contingencia
    • M14. Chi-cuadrado y magnitud de la asociación
  • Glosario

Herramienta Pedagógica de Consulta

Glosario Metodológico y Estadístico

Conceptos centrales para leer, interpretar y comunicar análisis descriptivos, inferenciales y de asociación bivariada en ciencias sociales. Este glosario no reemplaza los módulos: funciona como una herramienta de consulta rápida para volver sobre definiciones, fórmulas, ejemplos y errores frecuentes.

Datos y medición Probabilidad e inferencia Curva normal y puntajes Z Intervalos y error estándar Test de hipótesis Asociación y correlación Ordinales y categóricas Tamaños de efecto Reporte y comunicación

Datos y medición

Conceptos elementales sobre el proceso de conceptualización, operacionalización, medición y variabilidad empírica en sociología cuantitativa.

Módulo 01

Variable dependiente (\(Y\))

Fenómeno, resultado o comportamiento que el investigador intenta explicar o modelar en función de la variación de otras variables.

Ejemplo. Nivel de ingreso laboral de una persona, probabilidad de votar o actitud hacia la democracia.

Error común. Elegir como variable dependiente un indicador que temporalmente se midió antes o que no tiene relación teórica como resultado respecto a los predictores.

Módulo 01

Variable independiente (\(X\))

Variable explicativa, de estratificación o predictor utilizada para analizar y explicar las variaciones observadas en la variable dependiente.

Ejemplo. Años de escolaridad acumulados, edad, clase social ocupacional o región de residencia.

Error común. Asumir mecánicamente que toda variable independiente causa la dependiente en un estudio observacional sin considerar variables de confusión omitidas.

Módulo 01

Unidad de análisis

Entidad básica u objeto social sobre la cual se recolectan los datos y se miden las variables empíricas del estudio (ej. personas, hogares, comunas o países).

Ejemplo. En la CASEN o CASEN-ENCOVI, la unidad de análisis puede ser la persona encuestada o el hogar completo según la pregunta de investigación.

Error común. Caer en la falacia ecológica, infiriendo comportamientos individuales a partir de asociaciones agregadas a nivel comunal o regional.

Módulo 01

Nivel de medición nominal

Escala donde las categorías solo diferencian cualitativamente entre modalidades, sin orden interno ni distancia métrica cuantificable entre ellas.

Ejemplo. Identificación religiosa (católico, evangélico, agnóstico, otro) o situación ocupacional.

Error común. Asignar códigos numéricos (1=Católico, 2=Evangélico, 3=Agnóstico) y calcular medias o desviaciones estándar con ellos como si fueran cuantitativos.

Módulo 01

Nivel de medición ordinal

Escala que clasifica las observaciones en una secuencia jerárquica u ordenada de mayor o menor intensidad, pero donde la distancia exacta entre categorías es desconocida o desigual.

Ejemplo. Nivel educativo alcanzado (Básica, Media, Técnica, Universitaria) o ítems Likert de acuerdo (Totalmente en desacuerdo a Totalmente de acuerdo).

Error común. Tratar escalas ordinales simples de pocos ítems como si tuvieran intervalos numéricos equidistantes y aplicarles correlación de Pearson sin justificación.

Módulo 01

Nivel de medición intervalar / razón

Escala cuantitativa con unidad de medida estandarizada donde las distancias entre valores son idénticas y significativas en todo el continuo numérico. En el nivel de razón existe además un cero absoluto (ausencia total del atributo).

Ejemplo. Ingreso mensual en pesos chilenos (\(Nivel de razón\)), edad en años cumplidos o puntaje en una prueba estandarizada (\(Nivel intervalar\)).

Error común. Categorizar prematuramente variables continuas (ej. convertir ingreso exacto en “bajo/medio/alto”), perdiendo variabilidad y potencia estadística en el análisis.

Módulo 01

Varianza muestral (\(s^2\))

Medida del promedio del cuadrado de las desviaciones de cada observación respecto a la media aritmética muestral: \(s^2 = \frac{\sum (X_i - \bar{X})^2}{n - 1}\).

Ejemplo. Cuantificar cuán heterogéneos son los ingresos en una comuna respecto a su salario promedio.

Error común. Olvidar que la varianza está expresada en las unidades cuadráticas de la variable original, por lo que su interpretación requiere extraer la raíz cuadrada para obtener la desviación estándar (\(s\)).

Probabilidad e inferencia

Conceptos sobre cómo transitamos teórica y metodológicamente desde una muestra observada hacia estimaciones y generalizaciones en la población de estudio.

Módulo 02

Población (\(\mathbf{N}\)) vs. Muestra (\(\mathbf{n}\))

La población es el conjunto total o universo de unidades al cual se desea generalizar (\(N\)). La muestra es el subconjunto finito de unidades efectivamente extraído y observado (\(n\)).

Ejemplo. Población: Todos los hogares urbanos de Chile (\(N \approx 5.5\text{ millones}\)). Muestra: 62,000 hogares encuestados en la CASEN (\(n = 62,000\)).

Error común. Confundir los hallazgos en una muestra no probabilística (ej. encuesta voluntaria por redes sociales) con conclusiones válidas para toda la población general.

Módulo 02

Parámetro poblacional (\(\theta\)) vs. Estadístico muestral (\(\hat{\theta}\))

Un parámetro es un valor numérico fijo, generalmente desconocido, que resume una característica en la población (ej. media poblacional \(\mu\)). Un estadístico es un número calculado a partir de una muestra (ej. media muestral \(\bar{X}\)) que sirve para estimar el parámetro.

Ejemplo. La verdadera proporción poblacional de aprobación de una política de vivienda (\(P\)) es un parámetro desconocido; el porcentaje 45.2% obtenido en una encuesta nacional es el estadístico muestral (\(\hat{P}\)).

Error común. Tratar el estadístico muestral como una verdad absoluta y exacta sin reportar su incertidumbre ni su margen de error.

Módulo 02

Azar muestral y variabilidad muestral

Fluctuación natural del valor de un estadístico cuando se extraen diferentes muestras aleatorias del mismo tamaño desde una misma población.

Ejemplo. Si extraemos 100 encuestas aleatorias distintas de 1,200 personas para medir la escolaridad promedio en Santiago, cada muestra arrojará un promedio ligeramente diferente debido al azar del muestreo.

Error común. Atribuir pequeñas diferencias en porcentajes o promedios entre dos encuestas sucesivas a cambios sociales profundos cuando en realidad caen dentro de la variabilidad muestral esperada.

Módulo 02

Distribución muestral

Distribución teórica de probabilidad de los posibles valores que puede tomar un estadístico (como una media o una correlación) al extraer todas las muestras aleatorias de tamaño \(n\) de una población.

Ejemplo. La distribución muestral de la media (\(\bar{X}\)) nos permite saber qué tan probable es observar un promedio muestral particular si la verdadera media poblacional es \(\mu\).

Error común. Confundir la distribución de los datos empíricos dentro de una muestra singular con la distribución muestral del estadístico a través de infinitas muestras.

Curva normal y puntajes Z

Herramientas paramétricas para modelar distribuciones simétricas, calcular áreas bajo la curva y comparar puntajes en escalas estandarizadas.

Módulo 03

Distribución normal (Campana de Gauss)

Distribución de probabilidad continua, simétrica y asintótica en forma de campana, completamente determinada por su media (\(\mu\)) y su desviación estándar (\(\sigma\)). En ella coinciden exactamente la media, la mediana y la moda.

Ejemplo. La distribución del puntaje de pruebas de selección universitaria estandarizadas para una cohorte nacional.

Error común. Asumir a priori que cualquier variable social cuantitativa (como el ingreso o el patrimonio, fuertemente asimétricos hacia la derecha) sigue una distribución normal sin inspeccionar su histograma.

Módulo 03

Regla empírica (68 - 95 - 99.7)

Propiedad matemática de toda distribución normal: el 68.27% de las observaciones cae dentro de \(\pm 1\sigma\) de la media, el 95.45% dentro de \(\pm 2\sigma\), y el 99.73% dentro de \(\pm 3\sigma\).

Ejemplo. Si una escala de satisfacción comunitaria tiene media 50 y desviación estándar 10 en una población normal, aproximadamente el 95% de la población tendrá puntajes entre 30 y 70.

Error común. Aplicar los porcentajes de la regla empírica a distribuciones marcadamente asimétricas o bimodales.

Módulo 03

Puntaje estandarizado (\(Z\)-score)

Transformación lineal de una variable que expresa cuántas desviaciones estándar (\(\sigma\)) se encuentra una observación (\(X\)) por encima o por debajo de su media muestral o poblacional (\(\mu\)): \(Z = \frac{X - \mu}{\sigma}\).

Ejemplo. Comparar el rendimiento de una estudiante con puntaje \(X=620\) en una prueba con media 500 y desviación 100 (\(Z=1.20\)) frente a su puntaje en otra prueba con media 50 y desviación 5 (\(Z=1.40\)).

Error común. Creer que estandarizar una variable en puntajes \(Z\) altera o corrige su asimetría original; la estandarización solo cambia la media a 0 y la desviación estándar a 1, conservando la forma exacta de la distribución.

Intervalos y error estándar

Conceptos sobre la medición rigurosa del error de muestreo y la acotación estadística del parámetro poblacional mediante intervalos de confianza.

Módulo 04

Teorema del Límite Central (TLC)

Teorema matemático fundamental que establece que, al extraer muestras aleatorias de tamaño suficientemente grande (\(n \ge 30\)), la distribución muestral de las medias tenderá a una distribución normal con media igual a \(\mu\) y varianza \(\sigma^2/n\), independientemente de cuál sea la forma geométrica de la distribución original en la población.

Ejemplo. Aunque el ingreso per cápita en Chile tenga una distribución altamente sesgada con una larga cola hacia los ingresos altos, la distribución de los promedios comunales o de muestras grandes (\(n=1,000\)) será prácticamente normal, permitiendo hacer inferencia paramétrica.

Error común. Afirmar que el Teorema del Límite Central “normaliza los datos de mi muestra si aumento el tamaño muestral”; el TLC normaliza la distribución muestral del estadístico (\(\bar{X}\)), nunca la distribución empírica de las observaciones individuales (\(X_i\)).

Módulo 04

Error estándar (\(SE\) o \(s_{\bar{X}}\))

Desviación estándar de la distribución muestral de un estadístico. Para la media muestral se calcula como el cociente entre la desviación estándar muestral y la raíz cuadrada del tamaño de muestra: \(SE = \frac{s}{\sqrt{n}}\). Mide la precisión o dispersión del estadístico muestral respecto al parámetro poblacional.

Ejemplo. Si una encuesta reporta un promedio de escolaridad de 11.2 años con una desviación estándar de \(s = 3.5\) en una muestra de \(n = 1,225\) personas, el error estándar de esa estimación es \(SE = \frac{3.5}{\sqrt{1225}} = \frac{3.5}{35} = 0.10\) años.

Error común. Confundir la desviación estándar (\(s\)), que cuantifica la dispersión entre las personas dentro de la muestra, con el error estándar (\(SE\)), que cuantifica la dispersión de las medias muestrales a través del azar del muestreo.

Módulo 05

Intervalo de confianza al 95% (\(IC_{95\%}\))

Rango numérico construido alrededor de una estimación puntual muestral, con una probabilidad teórica (\(1-\alpha=0.95\)) de que, si se repitiera el muestreo infinitas veces, el 95% de los intervalos generados contendrían el verdadero valor poblacional del parámetro. Su fórmula para medias grandes es \(IC_{95\%} = \bar{X} \pm 1.96 \cdot SE\).

Ejemplo. Un intervalo de confianza al 95% para el promedio de horas trabajadas en una comuna de \([41.8, 44.2]\) horas indica que tenemos un 95% de confianza en que el verdadero promedio poblacional reside en ese rango.

Error común. Decir que “existe un 95% de probabilidad de que la media poblacional \(\mu\) varíe y caiga dentro de este intervalo fijo ya calculado”. El parámetro poblacional \(\mu\) es constante; lo que es aleatorio en el muestreo repetido es el intervalo construido.

Test de hipótesis

Lógica epistemológica de falsación popperiana y toma de decisiones inferenciales contrastando empíricamente con hipótesis estadísticas.

Módulo 06

Hipótesis nula (\(H_0\)) y alternativa (\(H_1\))

La hipótesis nula (\(H_0\)) es el enunciado conservador de ausencia de efecto, diferencia o asociación en la población (ej. \(\mu_1 - \mu_2 = 0\) o \(r = 0\)). La hipótesis alternativa (\(H_1\)) es el enunciado teórico de investigación que sostiene la existencia de una relación, diferencia o patrón sistemático.

Ejemplo. En un estudio salarial por género: \(H_0: \mu_{\text{hombres}} = \mu_{\text{mujeres}}\) frente a \(H_1: \mu_{\text{hombres}} \ne \mu_{\text{mujeres}}\).

Error común. Plantear \(H_0\) y \(H_1\) en términos del estadístico muestral (\(\bar{X}\) o \(r\)) en lugar del parámetro poblacional (\(\mu\) o \(\rho\)). Las hipótesis siempre afirman estados sobre la población total.

Módulo 06

Nivel de significancia (\(\alpha\))

Probabilidad teórica máxima de cometer un Error Tipo I que el investigador está dispuesto a tolerar antes de realizar la prueba. Convencionalmente en sociología se fija en \(\alpha = 0.05\) (o un 5% de riesgo de falso positivo).

Ejemplo. Trabajar con \(\alpha = 0.05\) significa que si la hipótesis nula fuera rigurosamente verdadera en la población, aceptaríamos una probabilidad de 1 en 20 de rechazarla por pura casualidad muestral.

Error común. Modificar o relajar el nivel de significancia \(\alpha\) a posteriori (ej. subirlo a \(\alpha = 0.10\)) después de ver que el valor \(p\) empírico resultó ser \(0.06\) para lograr “significancia a toda costa”.

Módulo 07

Valor \(p\) (\(p\)-valor)

Probabilidad condicional de obtener en la muestra un valor del estadístico de prueba tan o más extremo que el efectivamente observado, suponiendo que la Hipótesis Nula (\(H_0\)) fuera absolutamente verdadera en la población: \(p = P(\text{Estadístico} \ge \text{obs} \mid H_0 \text{ es verdadera})\).

Ejemplo. Si al evaluar si dos comunas difieren en participación ciudadana obtenemos un valor \(p = 0.003\), significa que la probabilidad de haber obtenido una diferencia tan grande entre comunas exclusivamente por azar muestral bajo \(H_0\) es de apenas 0.3%. Como \(p < 0.05\), rechazamos \(H_0\).

Error común. Interpretar el valor \(p\) como la “probabilidad de que la hipótesis nula sea falsa” o como “la probabilidad de que nuestros resultados sean producto del azar”. El valor \(p\) asume la verdad de \(H_0\) desde el primer segundo del cálculo.

Módulo 07

Prueba \(t\) de Student y grados de libertad (\(df\))

Estadístico paramétrico utilizado para evaluar si la diferencia entre una media muestral y una media poblacional hipotética (o entre dos medias muestrales) es estadísticamente significativa, especialmente cuando el tamaño muestral es pequeño o la varianza poblacional es desconocida: \(t = \frac{\bar{X} - \mu_0}{SE}\). Los grados de libertad (\(df = n - 1\)) determinan la forma exacta y el grosor de las colas de la distribución \(t\).

Ejemplo. Contrastar si el puntaje en una escala de anomia en un grupo de 25 trabajadores precarios difiere del promedio histórico poblacional de 50 puntos.

Error común. Olvidar que a medida que los grados de libertad aumentan (\(df > 30\)), la distribución \(t\) de Student converge exactamente con la distribución normal estándar (\(Z\)).

Módulo 08

Hipótesis direccionales (una cola) vs. No direccionales (dos colas)

Una prueba no direccional (dos colas) evalúa si existe cualquier diferencia (positiva o negativa), dividiendo el riesgo de error en ambos extremos (\(\alpha / 2\)). Una prueba direccional (una cola) evalúa un único extremo teórico especificado a priori (ej. que un grupo tiene estrictamente mayor promedio que el otro), concentrando todo el área de rechazo \(\alpha\) en una cola.

Ejemplo. Dos colas: \(H_1: \mu_1 \ne \mu_2\). Una cola: \(H_1: \mu_{\text{posgrado}} > \mu_{\text{pregrado}}\).

Error común. Usar una prueba de una cola solamente después de haber observado los datos empíricos para reducir el valor crítico y lograr que un resultado marginal (ej. \(p = 0.06\) a dos colas) sea “significativo” (\(p = 0.03\) a una cola).

Asociación y correlación

Conceptos para medir la co-variación conjunta de variables métricas en el plano cartesiano e interpretar matrices relacionales en sociología.

Módulo 09

Covarianza empírica (\(cov_{xy}\) o \(s_{xy}\))

Medida absoluta de variación conjunta que cuantifica en qué medida dos variables cuantitativas tienden a variar en la misma dirección o en direcciones opuestas respecto a sus respectivas medias: \(cov(X,Y) = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{n - 1}\).

Ejemplo. Si la covarianza entre años de experiencia (\(X\)) e ingreso laboral (\(Y\)) en una empresa es de \(+145,000\), indica una relación directa u homodireccional.

Error común. Interpretar la magnitud numérica pura de la covarianza para comparar la fuerza de dos relaciones distintas. La covarianza carece de cota superior e inferior porque depende directamente de las unidades de medición (pesos, años, horas), por lo que requiere estandarizarse en un coeficiente de correlación.

Módulo 10

Correlación de Pearson (\(r\))

Coeficiente paramétrico estandarizado que mide la fuerza, dirección y linealidad de la relación entre dos variables intervalares o de razón: \(r = \frac{cov(X,Y)}{s_x \cdot s_y}\). Está acotado rigurosamente en el intervalo \([-1, +1]\).

Ejemplo. Un coeficiente de \(r = +0.68\) entre años de escolaridad de la madre y años de escolaridad del hijo refleja una asociación lineal positiva y sustancial intergeneracional.

Error común. Interpretar un coeficiente de Pearson cercano a cero (\(r \approx 0.02\)) como ausencia total de relación entre las variables, cuando podría existir una fuerte relación curva no lineal (ej. forma de U o parábola inalcanzable para una recta).

Módulo 13

Borrado Listwise vs. Borrado Pairwise en matrices

Cuando existen valores perdidos (\(NAs\)) en una matriz de correlaciones: el borrado Listwise elimina de toda la matriz cualquier observación que tenga al menos un valor perdido en cualquiera de las variables analizadas. El borrado Pairwise utiliza para cada celda \((i, j)\) particular todos los pares disponibles con datos válidos para esas dos variables específicas.

Ejemplo. En una encuesta de 1,000 personas con 10 variables de opinión, si cada persona dejó de responder 1 ítem distinto, el borrado listwise puede dejar la muestra efectiva en \(n=0\) o \(n=150\), mientras que el pairwise mantendrá \(n \approx 900\) para cada correlación bivariada.

Error común. Usar borrado Pairwise sin advertir en el reporte metodológico que cada coeficiente de la matriz fue estimado con una muestra (\(n\)) y grados de libertad distintos, lo que puede volver la matriz de correlaciones inconsistente no definida positiva.

Variables ordinales y categóricas

Herramientas no paramétricas y de tablas cruzadas para analizar asociación entre escalas de rangos, índices sumatorios y variables cualitativas.

Módulo 12

Correlación de rangos de Spearman (\(\rho\) o \(r_s\))

Alternativa no paramétrica al coeficiente de Pearson, que calcula la correlación sobre los rangos u órdenes ordinales de las observaciones (\(1^\circ, 2^\circ, 3^\circ\dots\)) en lugar de sus valores numéricos exactos. Evalúa relaciones monótonas en escalas ordinales o variables continuas con fuerte asimetría u outliers.

Ejemplo. Correlacionar el ranking socioeconómico comunal (de 1 a 345 en Chile) con el ranking en puntaje promedio SIMCE.

Error común. Usar Spearman creyendo que penaliza menos la falta de datos, cuando en realidad su único rol es capturar relaciones crecientes o decrecientes sin exigir normalidad ni linealidad estricta.

Módulo 12

Tau de Kendall (\(\tau\))

Coeficiente no paramétrico basado en el recuento de pares concordantes (\(C\)) y discordantes (\(D\)) entre dos variables ordinales: \(\tau = \frac{C - D}{\frac{1}{2} n(n-1)}\). Es especialmente robusto y preciso en muestras pequeñas o cuando existen frecuentes empates en las categorías ordinales.

Ejemplo. Evaluar la concordancia entre dos jueces que clasifican el nivel de vulnerabilidad laboral de 20 sindicatos en categorías ordinales de riesgo.

Error común. Comparar directamente la magnitud numérica pura de un \(\tau\) de Kendall con un \(\rho\) de Spearman; en una misma base de datos, Kendall suele ser numéricamente inferior a Spearman para la misma relación subyacente.

Módulo 14

Alpha de Cronbach (\(\alpha\))

Estadístico de consistencia interna y confiabilidad que evalúa hasta qué punto un conjunto de ítems de una batería (ej. 5 preguntas tipo Likert) correlacionan entre sí y miden una dimensión latente y coherente única. Su valor varía de \(0\) a \(1\); en sociología se considera aceptable \(\alpha \ge 0.70\).

Ejemplo. Verificar si 4 afirmaciones sobre confianza en instituciones del Estado tienen un \(\alpha = 0.82\) antes de promediarlas en un “Índice de Confianza Institucional”.

Error común. Asumir que un Alpha de Cronbach muy elevado (\(\alpha > 0.95\)) garantiza mayor validez y calidad de la escala; a menudo refleja redundancia extrema o tautología entre ítems prácticamente idénticos en su redacción.

Módulo 15

Tabla de contingencia y regla de Zeisel

Matriz de frecuencias cruzadas donde las filas representan categorías de una variable y las columnas de otra. La Regla de Zeisel establece el canon sociológico de interpretación: la variable independiente debe ubicarse en las filas, calculando los porcentajes por fila (al 100% en horizontal), y la comparación analítica debe realizarse leyendo las columnas hacia abajo.

Ejemplo. Filas: Nivel educativo (Independiente). Columnas: Participación en manifestaciones civiles (Dependiente: Sí vs. No). Porcentaje por fila: qué porcentaje de universitarios protesta en comparación con qué porcentaje de educación básica protesta.

Error común. Interpretar porcentajes del total general o porcentajes por columna como si explicaran el riesgo o la propensión causal de los grupos sociodemográficos.

Módulo 16

Test Chi-cuadrado de independencia (\(\chi^2\))

Prueba de hipótesis no paramétrica para evaluar si existe asociación estadísticamente significativa entre dos variables categóricas o nominales en una tabla cruzada. Compara las frecuencias observadas en cada celda (\(O_{ij}\)) con las frecuencias esperadas bajo independencia teórica (\(E_{ij}\)): \(\chi^2 = \sum \frac{(O_{ij} - E_{ij})^2}{E_{ij}}\).

Ejemplo. Evaluar si la preferencia por un partido político está asociada significativamente a la categoría socioeconómica autodeclarada en una encuesta de \(n=1,500\) electores.

Error común. Aplicar el test Chi-cuadrado en tablas con muestras excesivamente pequeñas donde más del 20% de las celdas interiores tienen una frecuencia esperada inferior a 5 (\(E_{ij} < 5\)), violando su supuesto distribucional.

Módulo 16

Residuos estandarizados ajustados (\(d_{ij}\))

Estadístico que mide cuántas desviaciones estándar dista la frecuencia observada de una celda particular de su frecuencia esperada bajo independencia: \(d_{ij} = \frac{O_{ij} - E_{ij}}{\sqrt{E_{ij}(1 - P_{row})(1 - P_{col})}}\). Siguen una distribución normal estándar (\(Z\)), donde valores absolutos \(|d_{ij}| \ge 1.96\) indican que esa celda contribuye significativamente a la asociación o al rechazo global de la hipótesis nula.

Ejemplo. En una tabla entre ocupación y voto, si la celda de “Obreros industriales que votan izquierda” tiene un residuo \(d = +4.2\), significa que hay una concentración significativamente mayor de casos en esa celda de lo que el azar o la independencia predecirían.

Error común. Quedarse únicamente con el valor global significativo del \(\chi^2\) en una tabla grande (\(4 \times 5\)) sin examinar los residuos \(d_{ij}\) para descubrir qué celdas exactas originan el rechazo de independencia.

Tamaños de efecto

Indicadores estandarizados que miden la magnitud de la asociación y la relevancia práctica o sustantiva de los hallazgos en sociología con independencia del tamaño muestral.

Módulo 11

Coeficiente de determinación (\(R^2\)) en correlación

El cuadrado del coeficiente de correlación de Pearson (\(R^2 = r^2\)), que expresa exactamente la proporción de varianza compartida o explicada de una variable por la otra en el plano bivariado. Se interpreta en porcentaje (de 0% a 100%).

Ejemplo. Si la correlación entre horas de estudio y puntaje en un examen es de \(r = 0.50\), el tamaño de efecto \(R^2 = 0.25\) indica que el 25% de la varianza en los puntajes se asocia linealmente a la diferencia en las horas de estudio.

Error común. Confundir el coeficiente de correlación \(r = 0.50\) con un 50% de explicación; al elevar al cuadrado, se demuestra que un \(r = 0.50\) solo explica la cuarta parte (25%) de la varianza conjunta.

Módulo 17

Coeficiente Phi (\(\phi\))

Medida del tamaño de efecto y fuerza de asociación para tablas de contingencia de dimensión exactas \(2 \times 2\) (dos variables binarias): \(\phi = \sqrt{\frac{\chi^2}{n}}\). Varía entre \(0\) (independencia absoluta) y \(1\) (asociación perfecta), independizándose del tamaño de la muestra \(n\).

Ejemplo. Evaluar la intensidad real de la relación entre Situación laboral (Ocupado vs. Desocupado) y Participación en sindicato (Sí vs. No) en una muestra de 5,000 trabajadores.

Error común. Aplicar o interpretar el coeficiente Phi (\(\phi\)) en tablas mayores a \(2 \times 2\) (\(3 \times 4\) o \(4 \times 4\)), donde su valor numérico puede superar el límite superior de \(1\), haciendo imposible la comparación.

Módulo 17

V de Cramer (\(V\))

Medida generalizada de tamaño de efecto y fuerza de asociación para tablas de contingencia de cualquier dimensión \(R \times C\): \(V = \sqrt{\frac{\chi^2}{n \cdot \min(R-1, C-1)}}\). Varía rigurosamente entre \(0\) y \(1\) en cualquier tabla, permitiendo comparar de forma estandarizada relaciones entre variables nominales y ordinales.

Ejemplo. Un valor de \(V = 0.28\) entre la región del país (16 categorías) y la preferencia en política medioambiental refleja una asociación de intensidad media en sociología empírica.

Error común. Creer que porque el estadístico \(\chi^2 = 142.5\) arroja un valor \(p < 0.0001\) en una muestra gigantesca (\(n=25,000\)), la relación es extremadamente fuerte; al calcular \(V = 0.05\) descubrimos que el tamaño de efecto es trivial en la realidad social.

Reporte y comunicación

Estandarización formal en estilo APA 7ª edición, visualización gráfica y síntesis comparativa para reportar resultados estadísticos en investigación científica.

Módulo 18

Reporte de correlación en formato APA 7ª edición

Estándar académico para redactar en texto continuo los resultados de un coeficiente de Pearson o Spearman: se informan los grados de libertad entre paréntesis (\(n-2\)), el valor del coeficiente con dos decimales, la dirección, y el valor \(p\) exacto (o \(p < .001\)).

Ejemplo. “Se observó una correlación positiva y estadísticamente significativa entre el nivel de capital social cívico y la participación comunitaria, \(r(148) = .42\), \(p < .001\), \(R^2 = .18\).”

Error común. Omitir el tamaño del efecto (\(R^2\)) y los grados de libertad, o escribir “p = 0.000” tal como aparece a veces en el software estadístico, cuando la norma exige redactar “\(p < .001\)”.

Módulo 18

Reporte de Chi-cuadrado en formato APA 7ª edición

Estándar académico para reportar la prueba de independencia en tablas cruzadas: se especifican los grados de libertad y el tamaño de muestra \(N\) entre paréntesis, el valor del estadístico \(\chi^2\), el valor \(p\) y el tamaño de efecto \(V\) de Cramer o \(\phi\).

Ejemplo. “El test de independencia reveló una asociación estadísticamente significativa entre el nivel educacional de los padres y la asistencia a teatro o museos, \(\chi^2(4, N = 1,250) = 45.82\), \(p < .001\), \(V = .14\).”

Error común. Redactar el resultado del Chi-cuadrado concluyendo con verbos causales (“La educación parental provoca o causa directamente mayor asistencia a museos”), excediendo la naturaleza bivariada y no experimental del análisis.

Módulo 19

Diagrama de dispersión (Scatterplot)

Gráfico de coordenadas cartesianas de dos ejes (\(X, Y\)) donde cada punto representa la medición simultánea de dos variables continuas para una única unidad de análisis en la muestra. Es el primer diagnóstico indispensable antes de calcular un coeficiente de correlación.

Ejemplo. Graficar en el eje horizontal el porcentaje de áreas verdes por comuna y en el eje vertical el puntaje de bienestar de salud mental autodeclarada para evaluar la forma lineal de la nube de puntos.

Error común. Omitir la inspección visual del scatterplot, perdiendo la detección de posibles valores atípicos severos (outliers) que estén inflando o destruyendo el valor de una correlación paramétrica de Pearson.

Módulo 20

Árbol de decisión de asociación bivariada

Esquema metodológico que guía la selección de la prueba estadística idónea para dos variables en función de su nivel de medición y distribución: (1) Dos variables continuas normales \(\rightarrow\) Pearson (\(r\)); (2) Dos ordinales o continuas asimétricas \(\rightarrow\) Spearman (\(\rho\)) o Kendall (\(\tau\)); (3) Dos variables nominales u ordinales en tabla cruzada \(\rightarrow\) Chi-cuadrado (\(\chi^2\)) acompañado de \(V\) de Cramer o \(\phi\).

Ejemplo. Para analizar la relación entre una variable nominal de 5 categorías y una variable ordinal de 4 categorías, el árbol indica construir una tabla de contingencia y calcular \(\chi^2\) con \(V\) de Cramer.

Error común. Aplicar una prueba paramétrica de Pearson al cruzar dos variables nominales codificadas con números, obteniendo coeficientes absurdos sin sentido sociológico ni matemático.

Bibliografía y Referencias Clave

Agresti, A. (2018). An Introduction to Categorical Data Analysis (3rd ed.). Wiley. (Capítulos 2 y 3: Tablas de contingencia, Chi-cuadrado, medidas de asociación y residuos).

Babbie, E. (2020). The Practice of Social Research (15th ed.). Cengage Learning. (Capítulos 5 y 16: Niveles de medición, índices sumatorios, Alpha de Cronbach y elaboración de tablas).

Field, A., Miles, J., & Field, Z. (2012). Discovering Statistics Using R. SAGE Publications. (Capítulos 4, 6 y 18: Exploración de datos, correlación de Pearson, Spearman, Kendall y análisis Chi-cuadrado en R).

Gelman, A., Hill, J., & Vehtari, A. (2020). Regression and Other Stories. Cambridge University Press. (Capítulos 3 a 5: Fundamentos de estimación, intervalos de confianza, incertidumbre y simulación de muestras en ciencias sociales).

Ejecutar el código
---
pagetitle: "Glosario Metodológico | Estadística Correlacional Interactiva"
page-layout: custom
toc: false
body-class: rs-glossary-page
---

::: {.rs-glossary-page-wrap}

::: {.rs-lesson-header .rs-glossary-header}
::: {.rs-lesson-kicker}
Herramienta Pedagógica de Consulta
:::
```{=html}
<h1>Glosario Metodológico y Estadístico</h1>
<p>Conceptos centrales para leer, interpretar y comunicar análisis descriptivos, inferenciales y de asociación bivariada en ciencias sociales. Este glosario no reemplaza los módulos: funciona como una herramienta de consulta rápida para volver sobre definiciones, fórmulas, ejemplos y errores frecuentes.</p>
```
:::

::: {.rs-glossary-search}
```{=html}
<input type="search" id="glossary-search" placeholder="Buscar concepto, fórmula o módulo..." aria-label="Buscar concepto, fórmula o módulo" />
```
:::

::: {.rs-glossary-nav}
[Datos y medición](#datos-medicion)
[Probabilidad e inferencia](#probabilidad-inferencia)
[Curva normal y puntajes Z](#curva-normal-z)
[Intervalos y error estándar](#intervalos-error-estandar)
[Test de hipótesis](#test-hipotesis)
[Asociación y correlación](#asociacion-correlacion)
[Ordinales y categóricas](#ordinales-categoricas)
[Tamaños de efecto](#tamanos-efecto)
[Reporte y comunicación](#reporte-comunicacion)
:::

::: {.rs-glossary-section #datos-medicion}
::: {.rs-glossary-section-header}
## Datos y medición
<p>Conceptos elementales sobre el proceso de conceptualización, operacionalización, medición y variabilidad empírica en sociología cuantitativa.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Variable dependiente ($Y$)
:::

::: {.rs-glossary-definition}
Fenómeno, resultado o comportamiento que el investigador intenta explicar o modelar en función de la variación de otras variables.
:::

::: {.rs-glossary-example}
**Ejemplo.** Nivel de ingreso laboral de una persona, probabilidad de votar o actitud hacia la democracia.
:::

::: {.rs-glossary-warning}
**Error común.** Elegir como variable dependiente un indicador que temporalmente se midió antes o que no tiene relación teórica como resultado respecto a los predictores.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Variable independiente ($X$)
:::

::: {.rs-glossary-definition}
Variable explicativa, de estratificación o predictor utilizada para analizar y explicar las variaciones observadas en la variable dependiente.
:::

::: {.rs-glossary-example}
**Ejemplo.** Años de escolaridad acumulados, edad, clase social ocupacional o región de residencia.
:::

::: {.rs-glossary-warning}
**Error común.** Asumir mecánicamente que toda variable independiente causa la dependiente en un estudio observacional sin considerar variables de confusión omitidas.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Unidad de análisis
:::

::: {.rs-glossary-definition}
Entidad básica u objeto social sobre la cual se recolectan los datos y se miden las variables empíricas del estudio (ej. personas, hogares, comunas o países).
:::

::: {.rs-glossary-example}
**Ejemplo.** En la CASEN o CASEN-ENCOVI, la unidad de análisis puede ser la persona encuestada o el hogar completo según la pregunta de investigación.
:::

::: {.rs-glossary-warning}
**Error común.** Caer en la falacia ecológica, infiriendo comportamientos individuales a partir de asociaciones agregadas a nivel comunal o regional.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Nivel de medición nominal
:::

::: {.rs-glossary-definition}
Escala donde las categorías solo diferencian cualitativamente entre modalidades, sin orden interno ni distancia métrica cuantificable entre ellas.
:::

::: {.rs-glossary-example}
**Ejemplo.** Identificación religiosa (católico, evangélico, agnóstico, otro) o situación ocupacional.
:::

::: {.rs-glossary-warning}
**Error común.** Asignar códigos numéricos (1=Católico, 2=Evangélico, 3=Agnóstico) y calcular medias o desviaciones estándar con ellos como si fueran cuantitativos.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Nivel de medición ordinal
:::

::: {.rs-glossary-definition}
Escala que clasifica las observaciones en una secuencia jerárquica u ordenada de mayor o menor intensidad, pero donde la distancia exacta entre categorías es desconocida o desigual.
:::

::: {.rs-glossary-example}
**Ejemplo.** Nivel educativo alcanzado (Básica, Media, Técnica, Universitaria) o ítems Likert de acuerdo (Totalmente en desacuerdo a Totalmente de acuerdo).
:::

::: {.rs-glossary-warning}
**Error común.** Tratar escalas ordinales simples de pocos ítems como si tuvieran intervalos numéricos equidistantes y aplicarles correlación de Pearson sin justificación.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Nivel de medición intervalar / razón
:::

::: {.rs-glossary-definition}
Escala cuantitativa con unidad de medida estandarizada donde las distancias entre valores son idénticas y significativas en todo el continuo numérico. En el nivel de razón existe además un cero absoluto (ausencia total del atributo).
:::

::: {.rs-glossary-example}
**Ejemplo.** Ingreso mensual en pesos chilenos ($Nivel de razón$), edad en años cumplidos o puntaje en una prueba estandarizada ($Nivel intervalar$).
:::

::: {.rs-glossary-warning}
**Error común.** Categorizar prematuramente variables continuas (ej. convertir ingreso exacto en "bajo/medio/alto"), perdiendo variabilidad y potencia estadística en el análisis.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 01</span>
```
### Varianza muestral ($s^2$)
:::

::: {.rs-glossary-definition}
Medida del promedio del cuadrado de las desviaciones de cada observación respecto a la media aritmética muestral: $s^2 = \frac{\sum (X_i - \bar{X})^2}{n - 1}$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Cuantificar cuán heterogéneos son los ingresos en una comuna respecto a su salario promedio.
:::

::: {.rs-glossary-warning}
**Error común.** Olvidar que la varianza está expresada en las unidades cuadráticas de la variable original, por lo que su interpretación requiere extraer la raíz cuadrada para obtener la desviación estándar ($s$).
:::
::::

:::::
:::

::: {.rs-glossary-section #probabilidad-inferencia}
::: {.rs-glossary-section-header}
## Probabilidad e inferencia
<p>Conceptos sobre cómo transitamos teórica y metodológicamente desde una muestra observada hacia estimaciones y generalizaciones en la población de estudio.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 02</span>
```
### Población ($\mathbf{N}$) vs. Muestra ($\mathbf{n}$)
:::

::: {.rs-glossary-definition}
La población es el conjunto total o universo de unidades al cual se desea generalizar ($N$). La muestra es el subconjunto finito de unidades efectivamente extraído y observado ($n$).
:::

::: {.rs-glossary-example}
**Ejemplo.** Población: Todos los hogares urbanos de Chile ($N \approx 5.5\text{ millones}$). Muestra: 62,000 hogares encuestados en la CASEN ($n = 62,000$).
:::

::: {.rs-glossary-warning}
**Error común.** Confundir los hallazgos en una muestra no probabilística (ej. encuesta voluntaria por redes sociales) con conclusiones válidas para toda la población general.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 02</span>
```
### Parámetro poblacional ($\theta$) vs. Estadístico muestral ($\hat{\theta}$)
:::

::: {.rs-glossary-definition}
Un parámetro es un valor numérico fijo, generalmente desconocido, que resume una característica en la población (ej. media poblacional $\mu$). Un estadístico es un número calculado a partir de una muestra (ej. media muestral $\bar{X}$) que sirve para estimar el parámetro.
:::

::: {.rs-glossary-example}
**Ejemplo.** La verdadera proporción poblacional de aprobación de una política de vivienda ($P$) es un parámetro desconocido; el porcentaje 45.2% obtenido en una encuesta nacional es el estadístico muestral ($\hat{P}$).
:::

::: {.rs-glossary-warning}
**Error común.** Tratar el estadístico muestral como una verdad absoluta y exacta sin reportar su incertidumbre ni su margen de error.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 02</span>
```
### Azar muestral y variabilidad muestral
:::

::: {.rs-glossary-definition}
Fluctuación natural del valor de un estadístico cuando se extraen diferentes muestras aleatorias del mismo tamaño desde una misma población.
:::

::: {.rs-glossary-example}
**Ejemplo.** Si extraemos 100 encuestas aleatorias distintas de 1,200 personas para medir la escolaridad promedio en Santiago, cada muestra arrojará un promedio ligeramente diferente debido al azar del muestreo.
:::

::: {.rs-glossary-warning}
**Error común.** Atribuir pequeñas diferencias en porcentajes o promedios entre dos encuestas sucesivas a cambios sociales profundos cuando en realidad caen dentro de la variabilidad muestral esperada.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 02</span>
```
### Distribución muestral
:::

::: {.rs-glossary-definition}
Distribución teórica de probabilidad de los posibles valores que puede tomar un estadístico (como una media o una correlación) al extraer todas las muestras aleatorias de tamaño $n$ de una población.
:::

::: {.rs-glossary-example}
**Ejemplo.** La distribución muestral de la media ($\bar{X}$) nos permite saber qué tan probable es observar un promedio muestral particular si la verdadera media poblacional es $\mu$.
:::

::: {.rs-glossary-warning}
**Error común.** Confundir la distribución de los datos empíricos dentro de una muestra singular con la distribución muestral del estadístico a través de infinitas muestras.
:::
::::

:::::
:::

::: {.rs-glossary-section #curva-normal-z}
::: {.rs-glossary-section-header}
## Curva normal y puntajes Z
<p>Herramientas paramétricas para modelar distribuciones simétricas, calcular áreas bajo la curva y comparar puntajes en escalas estandarizadas.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 03</span>
```
### Distribución normal (Campana de Gauss)
:::

::: {.rs-glossary-definition}
Distribución de probabilidad continua, simétrica y asintótica en forma de campana, completamente determinada por su media ($\mu$) y su desviación estándar ($\sigma$). En ella coinciden exactamente la media, la mediana y la moda.
:::

::: {.rs-glossary-example}
**Ejemplo.** La distribución del puntaje de pruebas de selección universitaria estandarizadas para una cohorte nacional.
:::

::: {.rs-glossary-warning}
**Error común.** Asumir a priori que cualquier variable social cuantitativa (como el ingreso o el patrimonio, fuertemente asimétricos hacia la derecha) sigue una distribución normal sin inspeccionar su histograma.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 03</span>
```
### Regla empírica (68 - 95 - 99.7)
:::

::: {.rs-glossary-definition}
Propiedad matemática de toda distribución normal: el 68.27% de las observaciones cae dentro de $\pm 1\sigma$ de la media, el 95.45% dentro de $\pm 2\sigma$, y el 99.73% dentro de $\pm 3\sigma$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Si una escala de satisfacción comunitaria tiene media 50 y desviación estándar 10 en una población normal, aproximadamente el 95% de la población tendrá puntajes entre 30 y 70.
:::

::: {.rs-glossary-warning}
**Error común.** Aplicar los porcentajes de la regla empírica a distribuciones marcadamente asimétricas o bimodales.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 03</span>
```
### Puntaje estandarizado ($Z$-score)
:::

::: {.rs-glossary-definition}
Transformación lineal de una variable que expresa cuántas desviaciones estándar ($\sigma$) se encuentra una observación ($X$) por encima o por debajo de su media muestral o poblacional ($\mu$): $Z = \frac{X - \mu}{\sigma}$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Comparar el rendimiento de una estudiante con puntaje $X=620$ en una prueba con media 500 y desviación 100 ($Z=1.20$) frente a su puntaje en otra prueba con media 50 y desviación 5 ($Z=1.40$).
:::

::: {.rs-glossary-warning}
**Error común.** Creer que estandarizar una variable en puntajes $Z$ altera o corrige su asimetría original; la estandarización solo cambia la media a 0 y la desviación estándar a 1, conservando la forma exacta de la distribución.
:::
::::

:::::
:::

::: {.rs-glossary-section #intervalos-error-estandar}
::: {.rs-glossary-section-header}
## Intervalos y error estándar
<p>Conceptos sobre la medición rigurosa del error de muestreo y la acotación estadística del parámetro poblacional mediante intervalos de confianza.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 04</span>
```
### Teorema del Límite Central (TLC)
:::

::: {.rs-glossary-definition}
Teorema matemático fundamental que establece que, al extraer muestras aleatorias de tamaño suficientemente grande ($n \ge 30$), la distribución muestral de las medias tenderá a una distribución normal con media igual a $\mu$ y varianza $\sigma^2/n$, independientemente de cuál sea la forma geométrica de la distribución original en la población.
:::

::: {.rs-glossary-example}
**Ejemplo.** Aunque el ingreso per cápita en Chile tenga una distribución altamente sesgada con una larga cola hacia los ingresos altos, la distribución de los promedios comunales o de muestras grandes ($n=1,000$) será prácticamente normal, permitiendo hacer inferencia paramétrica.
:::

::: {.rs-glossary-warning}
**Error común.** Afirmar que el Teorema del Límite Central "normaliza los datos de mi muestra si aumento el tamaño muestral"; el TLC normaliza la distribución muestral del estadístico ($\bar{X}$), nunca la distribución empírica de las observaciones individuales ($X_i$).
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 04</span>
```
### Error estándar ($SE$ o $s_{\bar{X}}$)
:::

::: {.rs-glossary-definition}
Desviación estándar de la distribución muestral de un estadístico. Para la media muestral se calcula como el cociente entre la desviación estándar muestral y la raíz cuadrada del tamaño de muestra: $SE = \frac{s}{\sqrt{n}}$. Mide la precisión o dispersión del estadístico muestral respecto al parámetro poblacional.
:::

::: {.rs-glossary-example}
**Ejemplo.** Si una encuesta reporta un promedio de escolaridad de 11.2 años con una desviación estándar de $s = 3.5$ en una muestra de $n = 1,225$ personas, el error estándar de esa estimación es $SE = \frac{3.5}{\sqrt{1225}} = \frac{3.5}{35} = 0.10$ años.
:::

::: {.rs-glossary-warning}
**Error común.** Confundir la desviación estándar ($s$), que cuantifica la dispersión entre las personas dentro de la muestra, con el error estándar ($SE$), que cuantifica la dispersión de las medias muestrales a través del azar del muestreo.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 05</span>
```
### Intervalo de confianza al 95% ($IC_{95\%}$)
:::

::: {.rs-glossary-definition}
Rango numérico construido alrededor de una estimación puntual muestral, con una probabilidad teórica ($1-\alpha=0.95$) de que, si se repitiera el muestreo infinitas veces, el 95% de los intervalos generados contendrían el verdadero valor poblacional del parámetro. Su fórmula para medias grandes es $IC_{95\%} = \bar{X} \pm 1.96 \cdot SE$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Un intervalo de confianza al 95% para el promedio de horas trabajadas en una comuna de $[41.8, 44.2]$ horas indica que tenemos un 95% de confianza en que el verdadero promedio poblacional reside en ese rango.
:::

::: {.rs-glossary-warning}
**Error común.** Decir que "existe un 95% de probabilidad de que la media poblacional $\mu$ varíe y caiga dentro de este intervalo fijo ya calculado". El parámetro poblacional $\mu$ es constante; lo que es aleatorio en el muestreo repetido es el intervalo construido.
:::
::::

:::::
:::

::: {.rs-glossary-section #test-hipotesis}
::: {.rs-glossary-section-header}
## Test de hipótesis
<p>Lógica epistemológica de falsación popperiana y toma de decisiones inferenciales contrastando empíricamente con hipótesis estadísticas.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 06</span>
```
### Hipótesis nula ($H_0$) y alternativa ($H_1$)
:::

::: {.rs-glossary-definition}
La hipótesis nula ($H_0$) es el enunciado conservador de ausencia de efecto, diferencia o asociación en la población (ej. $\mu_1 - \mu_2 = 0$ o $r = 0$). La hipótesis alternativa ($H_1$) es el enunciado teórico de investigación que sostiene la existencia de una relación, diferencia o patrón sistemático.
:::

::: {.rs-glossary-example}
**Ejemplo.** En un estudio salarial por género: $H_0: \mu_{\text{hombres}} = \mu_{\text{mujeres}}$ frente a $H_1: \mu_{\text{hombres}} \ne \mu_{\text{mujeres}}$.
:::

::: {.rs-glossary-warning}
**Error común.** Plantear $H_0$ y $H_1$ en términos del estadístico muestral ($\bar{X}$ o $r$) en lugar del parámetro poblacional ($\mu$ o $\rho$). Las hipótesis siempre afirman estados sobre la población total.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 06</span>
```
### Nivel de significancia ($\alpha$)
:::

::: {.rs-glossary-definition}
Probabilidad teórica máxima de cometer un Error Tipo I que el investigador está dispuesto a tolerar antes de realizar la prueba. Convencionalmente en sociología se fija en $\alpha = 0.05$ (o un 5% de riesgo de falso positivo).
:::

::: {.rs-glossary-example}
**Ejemplo.** Trabajar con $\alpha = 0.05$ significa que si la hipótesis nula fuera rigurosamente verdadera en la población, aceptaríamos una probabilidad de 1 en 20 de rechazarla por pura casualidad muestral.
:::

::: {.rs-glossary-warning}
**Error común.** Modificar o relajar el nivel de significancia $\alpha$ a posteriori (ej. subirlo a $\alpha = 0.10$) después de ver que el valor $p$ empírico resultó ser $0.06$ para lograr "significancia a toda costa".
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 07</span>
```
### Valor $p$ ($p$-valor)
:::

::: {.rs-glossary-definition}
Probabilidad condicional de obtener en la muestra un valor del estadístico de prueba tan o más extremo que el efectivamente observado, suponiendo que la Hipótesis Nula ($H_0$) fuera absolutamente verdadera en la población: $p = P(\text{Estadístico} \ge \text{obs} \mid H_0 \text{ es verdadera})$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Si al evaluar si dos comunas difieren en participación ciudadana obtenemos un valor $p = 0.003$, significa que la probabilidad de haber obtenido una diferencia tan grande entre comunas exclusivamente por azar muestral bajo $H_0$ es de apenas 0.3%. Como $p < 0.05$, rechazamos $H_0$.
:::

::: {.rs-glossary-warning}
**Error común.** Interpretar el valor $p$ como la "probabilidad de que la hipótesis nula sea falsa" o como "la probabilidad de que nuestros resultados sean producto del azar". El valor $p$ asume la verdad de $H_0$ desde el primer segundo del cálculo.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 07</span>
```
### Prueba $t$ de Student y grados de libertad ($df$)
:::

::: {.rs-glossary-definition}
Estadístico paramétrico utilizado para evaluar si la diferencia entre una media muestral y una media poblacional hipotética (o entre dos medias muestrales) es estadísticamente significativa, especialmente cuando el tamaño muestral es pequeño o la varianza poblacional es desconocida: $t = \frac{\bar{X} - \mu_0}{SE}$. Los grados de libertad ($df = n - 1$) determinan la forma exacta y el grosor de las colas de la distribución $t$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Contrastar si el puntaje en una escala de anomia en un grupo de 25 trabajadores precarios difiere del promedio histórico poblacional de 50 puntos.
:::

::: {.rs-glossary-warning}
**Error común.** Olvidar que a medida que los grados de libertad aumentan ($df > 30$), la distribución $t$ de Student converge exactamente con la distribución normal estándar ($Z$).
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 08</span>
```
### Hipótesis direccionales (una cola) vs. No direccionales (dos colas)
:::

::: {.rs-glossary-definition}
Una prueba no direccional (dos colas) evalúa si existe cualquier diferencia (positiva o negativa), dividiendo el riesgo de error en ambos extremos ($\alpha / 2$). Una prueba direccional (una cola) evalúa un único extremo teórico especificado a priori (ej. que un grupo tiene estrictamente *mayor* promedio que el otro), concentrando todo el área de rechazo $\alpha$ en una cola.
:::

::: {.rs-glossary-example}
**Ejemplo.** Dos colas: $H_1: \mu_1 \ne \mu_2$. Una cola: $H_1: \mu_{\text{posgrado}} > \mu_{\text{pregrado}}$.
:::

::: {.rs-glossary-warning}
**Error común.** Usar una prueba de una cola solamente después de haber observado los datos empíricos para reducir el valor crítico y lograr que un resultado marginal (ej. $p = 0.06$ a dos colas) sea "significativo" ($p = 0.03$ a una cola).
:::
::::

:::::
:::

::: {.rs-glossary-section #asociacion-correlacion}
::: {.rs-glossary-section-header}
## Asociación y correlación
<p>Conceptos para medir la co-variación conjunta de variables métricas en el plano cartesiano e interpretar matrices relacionales en sociología.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 09</span>
```
### Covarianza empírica ($cov_{xy}$ o $s_{xy}$)
:::

::: {.rs-glossary-definition}
Medida absoluta de variación conjunta que cuantifica en qué medida dos variables cuantitativas tienden a variar en la misma dirección o en direcciones opuestas respecto a sus respectivas medias: $cov(X,Y) = \frac{\sum (X_i - \bar{X})(Y_i - \bar{Y})}{n - 1}$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Si la covarianza entre años de experiencia ($X$) e ingreso laboral ($Y$) en una empresa es de $+145,000$, indica una relación directa u homodireccional.
:::

::: {.rs-glossary-warning}
**Error común.** Interpretar la magnitud numérica pura de la covarianza para comparar la fuerza de dos relaciones distintas. La covarianza carece de cota superior e inferior porque depende directamente de las unidades de medición (pesos, años, horas), por lo que requiere estandarizarse en un coeficiente de correlación.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 10</span>
```
### Correlación de Pearson ($r$)
:::

::: {.rs-glossary-definition}
Coeficiente paramétrico estandarizado que mide la fuerza, dirección y linealidad de la relación entre dos variables intervalares o de razón: $r = \frac{cov(X,Y)}{s_x \cdot s_y}$. Está acotado rigurosamente en el intervalo $[-1, +1]$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Un coeficiente de $r = +0.68$ entre años de escolaridad de la madre y años de escolaridad del hijo refleja una asociación lineal positiva y sustancial intergeneracional.
:::

::: {.rs-glossary-warning}
**Error común.** Interpretar un coeficiente de Pearson cercano a cero ($r \approx 0.02$) como ausencia total de relación entre las variables, cuando podría existir una fuerte relación curva no lineal (ej. forma de U o parábola inalcanzable para una recta).
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 13</span>
```
### Borrado Listwise vs. Borrado Pairwise en matrices
:::

::: {.rs-glossary-definition}
Cuando existen valores perdidos ($NAs$) en una matriz de correlaciones: el borrado Listwise elimina de toda la matriz cualquier observación que tenga al menos un valor perdido en cualquiera de las variables analizadas. El borrado Pairwise utiliza para cada celda $(i, j)$ particular todos los pares disponibles con datos válidos para esas dos variables específicas.
:::

::: {.rs-glossary-example}
**Ejemplo.** En una encuesta de 1,000 personas con 10 variables de opinión, si cada persona dejó de responder 1 ítem distinto, el borrado listwise puede dejar la muestra efectiva en $n=0$ o $n=150$, mientras que el pairwise mantendrá $n \approx 900$ para cada correlación bivariada.
:::

::: {.rs-glossary-warning}
**Error común.** Usar borrado Pairwise sin advertir en el reporte metodológico que cada coeficiente de la matriz fue estimado con una muestra ($n$) y grados de libertad distintos, lo que puede volver la matriz de correlaciones inconsistente no definida positiva.
:::
::::

:::::
:::

::: {.rs-glossary-section #ordinales-categoricas}
::: {.rs-glossary-section-header}
## Variables ordinales y categóricas
<p>Herramientas no paramétricas y de tablas cruzadas para analizar asociación entre escalas de rangos, índices sumatorios y variables cualitativas.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 12</span>
```
### Correlación de rangos de Spearman ($\rho$ o $r_s$)
:::

::: {.rs-glossary-definition}
Alternativa no paramétrica al coeficiente de Pearson, que calcula la correlación sobre los rangos u órdenes ordinales de las observaciones ($1^\circ, 2^\circ, 3^\circ\dots$) en lugar de sus valores numéricos exactos. Evalúa relaciones monótonas en escalas ordinales o variables continuas con fuerte asimetría u outliers.
:::

::: {.rs-glossary-example}
**Ejemplo.** Correlacionar el ranking socioeconómico comunal (de 1 a 345 en Chile) con el ranking en puntaje promedio SIMCE.
:::

::: {.rs-glossary-warning}
**Error común.** Usar Spearman creyendo que penaliza menos la falta de datos, cuando en realidad su único rol es capturar relaciones crecientes o decrecientes sin exigir normalidad ni linealidad estricta.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 12</span>
```
### Tau de Kendall ($\tau$)
:::

::: {.rs-glossary-definition}
Coeficiente no paramétrico basado en el recuento de pares concordantes ($C$) y discordantes ($D$) entre dos variables ordinales: $\tau = \frac{C - D}{\frac{1}{2} n(n-1)}$. Es especialmente robusto y preciso en muestras pequeñas o cuando existen frecuentes empates en las categorías ordinales.
:::

::: {.rs-glossary-example}
**Ejemplo.** Evaluar la concordancia entre dos jueces que clasifican el nivel de vulnerabilidad laboral de 20 sindicatos en categorías ordinales de riesgo.
:::

::: {.rs-glossary-warning}
**Error común.** Comparar directamente la magnitud numérica pura de un $\tau$ de Kendall con un $\rho$ de Spearman; en una misma base de datos, Kendall suele ser numéricamente inferior a Spearman para la misma relación subyacente.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 14</span>
```
### Alpha de Cronbach ($\alpha$)
:::

::: {.rs-glossary-definition}
Estadístico de consistencia interna y confiabilidad que evalúa hasta qué punto un conjunto de ítems de una batería (ej. 5 preguntas tipo Likert) correlacionan entre sí y miden una dimensión latente y coherente única. Su valor varía de $0$ a $1$; en sociología se considera aceptable $\alpha \ge 0.70$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Verificar si 4 afirmaciones sobre confianza en instituciones del Estado tienen un $\alpha = 0.82$ antes de promediarlas en un "Índice de Confianza Institucional".
:::

::: {.rs-glossary-warning}
**Error común.** Asumir que un Alpha de Cronbach muy elevado ($\alpha > 0.95$) garantiza mayor validez y calidad de la escala; a menudo refleja redundancia extrema o tautología entre ítems prácticamente idénticos en su redacción.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 15</span>
```
### Tabla de contingencia y regla de Zeisel
:::

::: {.rs-glossary-definition}
Matriz de frecuencias cruzadas donde las filas representan categorías de una variable y las columnas de otra. La Regla de Zeisel establece el canon sociológico de interpretación: la variable independiente debe ubicarse en las filas, calculando los porcentajes por fila (al 100% en horizontal), y la comparación analítica debe realizarse leyendo las columnas hacia abajo.
:::

::: {.rs-glossary-example}
**Ejemplo.** Filas: Nivel educativo (Independiente). Columnas: Participación en manifestaciones civiles (Dependiente: Sí vs. No). Porcentaje por fila: qué porcentaje de universitarios protesta en comparación con qué porcentaje de educación básica protesta.
:::

::: {.rs-glossary-warning}
**Error común.** Interpretar porcentajes del total general o porcentajes por columna como si explicaran el riesgo o la propensión causal de los grupos sociodemográficos.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 16</span>
```
### Test Chi-cuadrado de independencia ($\chi^2$)
:::

::: {.rs-glossary-definition}
Prueba de hipótesis no paramétrica para evaluar si existe asociación estadísticamente significativa entre dos variables categóricas o nominales en una tabla cruzada. Compara las frecuencias observadas en cada celda ($O_{ij}$) con las frecuencias esperadas bajo independencia teórica ($E_{ij}$): $\chi^2 = \sum \frac{(O_{ij} - E_{ij})^2}{E_{ij}}$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Evaluar si la preferencia por un partido político está asociada significativamente a la categoría socioeconómica autodeclarada en una encuesta de $n=1,500$ electores.
:::

::: {.rs-glossary-warning}
**Error común.** Aplicar el test Chi-cuadrado en tablas con muestras excesivamente pequeñas donde más del 20% de las celdas interiores tienen una frecuencia esperada inferior a 5 ($E_{ij} < 5$), violando su supuesto distribucional.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 16</span>
```
### Residuos estandarizados ajustados ($d_{ij}$)
:::

::: {.rs-glossary-definition}
Estadístico que mide cuántas desviaciones estándar dista la frecuencia observada de una celda particular de su frecuencia esperada bajo independencia: $d_{ij} = \frac{O_{ij} - E_{ij}}{\sqrt{E_{ij}(1 - P_{row})(1 - P_{col})}}$. Siguen una distribución normal estándar ($Z$), donde valores absolutos $|d_{ij}| \ge 1.96$ indican que esa celda contribuye significativamente a la asociación o al rechazo global de la hipótesis nula.
:::

::: {.rs-glossary-example}
**Ejemplo.** En una tabla entre ocupación y voto, si la celda de "Obreros industriales que votan izquierda" tiene un residuo $d = +4.2$, significa que hay una concentración significativamente mayor de casos en esa celda de lo que el azar o la independencia predecirían.
:::

::: {.rs-glossary-warning}
**Error común.** Quedarse únicamente con el valor global significativo del $\chi^2$ en una tabla grande ($4 \times 5$) sin examinar los residuos $d_{ij}$ para descubrir qué celdas exactas originan el rechazo de independencia.
:::
::::

:::::
:::

::: {.rs-glossary-section #tamanos-efecto}
::: {.rs-glossary-section-header}
## Tamaños de efecto
<p>Indicadores estandarizados que miden la magnitud de la asociación y la relevancia práctica o sustantiva de los hallazgos en sociología con independencia del tamaño muestral.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 11</span>
```
### Coeficiente de determinación ($R^2$) en correlación
:::

::: {.rs-glossary-definition}
El cuadrado del coeficiente de correlación de Pearson ($R^2 = r^2$), que expresa exactamente la proporción de varianza compartida o explicada de una variable por la otra en el plano bivariado. Se interpreta en porcentaje (de 0% a 100%).
:::

::: {.rs-glossary-example}
**Ejemplo.** Si la correlación entre horas de estudio y puntaje en un examen es de $r = 0.50$, el tamaño de efecto $R^2 = 0.25$ indica que el 25% de la varianza en los puntajes se asocia linealmente a la diferencia en las horas de estudio.
:::

::: {.rs-glossary-warning}
**Error común.** Confundir el coeficiente de correlación $r = 0.50$ con un 50% de explicación; al elevar al cuadrado, se demuestra que un $r = 0.50$ solo explica la cuarta parte (25%) de la varianza conjunta.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 17</span>
```
### Coeficiente Phi ($\phi$)
:::

::: {.rs-glossary-definition}
Medida del tamaño de efecto y fuerza de asociación para tablas de contingencia de dimensión exactas $2 \times 2$ (dos variables binarias): $\phi = \sqrt{\frac{\chi^2}{n}}$. Varía entre $0$ (independencia absoluta) y $1$ (asociación perfecta), independizándose del tamaño de la muestra $n$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Evaluar la intensidad real de la relación entre Situación laboral (Ocupado vs. Desocupado) y Participación en sindicato (Sí vs. No) en una muestra de 5,000 trabajadores.
:::

::: {.rs-glossary-warning}
**Error común.** Aplicar o interpretar el coeficiente Phi ($\phi$) en tablas mayores a $2 \times 2$ ($3 \times 4$ o $4 \times 4$), donde su valor numérico puede superar el límite superior de $1$, haciendo imposible la comparación.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 17</span>
```
### V de Cramer ($V$)
:::

::: {.rs-glossary-definition}
Medida generalizada de tamaño de efecto y fuerza de asociación para tablas de contingencia de cualquier dimensión $R \times C$: $V = \sqrt{\frac{\chi^2}{n \cdot \min(R-1, C-1)}}$. Varía rigurosamente entre $0$ y $1$ en cualquier tabla, permitiendo comparar de forma estandarizada relaciones entre variables nominales y ordinales.
:::

::: {.rs-glossary-example}
**Ejemplo.** Un valor de $V = 0.28$ entre la región del país (16 categorías) y la preferencia en política medioambiental refleja una asociación de intensidad media en sociología empírica.
:::

::: {.rs-glossary-warning}
**Error común.** Creer que porque el estadístico $\chi^2 = 142.5$ arroja un valor $p < 0.0001$ en una muestra gigantesca ($n=25,000$), la relación es extremadamente fuerte; al calcular $V = 0.05$ descubrimos que el tamaño de efecto es trivial en la realidad social.
:::
::::

:::::
:::

::: {.rs-glossary-section #reporte-comunicacion}
::: {.rs-glossary-section-header}
## Reporte y comunicación
<p>Estandarización formal en estilo APA 7ª edición, visualización gráfica y síntesis comparativa para reportar resultados estadísticos en investigación científica.</p>
:::

::::: {.rs-glossary-grid}

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 18</span>
```
### Reporte de correlación en formato APA 7ª edición
:::

::: {.rs-glossary-definition}
Estándar académico para redactar en texto continuo los resultados de un coeficiente de Pearson o Spearman: se informan los grados de libertad entre paréntesis ($n-2$), el valor del coeficiente con dos decimales, la dirección, y el valor $p$ exacto (o $p < .001$).
:::

::: {.rs-glossary-example}
**Ejemplo.** "Se observó una correlación positiva y estadísticamente significativa entre el nivel de capital social cívico y la participación comunitaria, $r(148) = .42$, $p < .001$, $R^2 = .18$."
:::

::: {.rs-glossary-warning}
**Error común.** Omitir el tamaño del efecto ($R^2$) y los grados de libertad, o escribir "p = 0.000" tal como aparece a veces en el software estadístico, cuando la norma exige redactar "$p < .001$".
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 18</span>
```
### Reporte de Chi-cuadrado en formato APA 7ª edición
:::

::: {.rs-glossary-definition}
Estándar académico para reportar la prueba de independencia en tablas cruzadas: se especifican los grados de libertad y el tamaño de muestra $N$ entre paréntesis, el valor del estadístico $\chi^2$, el valor $p$ y el tamaño de efecto $V$ de Cramer o $\phi$.
:::

::: {.rs-glossary-example}
**Ejemplo.** "El test de independencia reveló una asociación estadísticamente significativa entre el nivel educacional de los padres y la asistencia a teatro o museos, $\chi^2(4, N = 1,250) = 45.82$, $p < .001$, $V = .14$."
:::

::: {.rs-glossary-warning}
**Error común.** Redactar el resultado del Chi-cuadrado concluyendo con verbos causales ("La educación parental *provoca o causa directamente* mayor asistencia a museos"), excediendo la naturaleza bivariada y no experimental del análisis.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 19</span>
```
### Diagrama de dispersión (Scatterplot)
:::

::: {.rs-glossary-definition}
Gráfico de coordenadas cartesianas de dos ejes ($X, Y$) donde cada punto representa la medición simultánea de dos variables continuas para una única unidad de análisis en la muestra. Es el primer diagnóstico indispensable antes de calcular un coeficiente de correlación.
:::

::: {.rs-glossary-example}
**Ejemplo.** Graficar en el eje horizontal el porcentaje de áreas verdes por comuna y en el eje vertical el puntaje de bienestar de salud mental autodeclarada para evaluar la forma lineal de la nube de puntos.
:::

::: {.rs-glossary-warning}
**Error común.** Omitir la inspección visual del scatterplot, perdiendo la detección de posibles valores atípicos severos (outliers) que estén inflando o destruyendo el valor de una correlación paramétrica de Pearson.
:::
::::

:::: {.rs-glossary-card}
::: {.rs-glossary-card-top}
```{=html}
<span class="rs-glossary-tag">Módulo 20</span>
```
### Árbol de decisión de asociación bivariada
:::

::: {.rs-glossary-definition}
Esquema metodológico que guía la selección de la prueba estadística idónea para dos variables en función de su nivel de medición y distribución: (1) Dos variables continuas normales $\rightarrow$ Pearson ($r$); (2) Dos ordinales o continuas asimétricas $\rightarrow$ Spearman ($\rho$) o Kendall ($\tau$); (3) Dos variables nominales u ordinales en tabla cruzada $\rightarrow$ Chi-cuadrado ($\chi^2$) acompañado de $V$ de Cramer o $\phi$.
:::

::: {.rs-glossary-example}
**Ejemplo.** Para analizar la relación entre una variable nominal de 5 categorías y una variable ordinal de 4 categorías, el árbol indica construir una tabla de contingencia y calcular $\chi^2$ con $V$ de Cramer.
:::

::: {.rs-glossary-warning}
**Error común.** Aplicar una prueba paramétrica de Pearson al cruzar dos variables nominales codificadas con números, obteniendo coeficientes absurdos sin sentido sociológico ni matemático.
:::
::::

:::::
:::

::: {.rs-glossary-biblio-section}
## Bibliografía y Referencias Clave

<p><strong>Agresti, A. (2018).</strong> <em>An Introduction to Categorical Data Analysis</em> (3rd ed.). Wiley. (Capítulos 2 y 3: Tablas de contingencia, Chi-cuadrado, medidas de asociación y residuos).</p>

<p><strong>Babbie, E. (2020).</strong> <em>The Practice of Social Research</em> (15th ed.). Cengage Learning. (Capítulos 5 y 16: Niveles de medición, índices sumatorios, Alpha de Cronbach y elaboración de tablas).</p>

<p><strong>Field, A., Miles, J., & Field, Z. (2012).</strong> <em>Discovering Statistics Using R</em>. SAGE Publications. (Capítulos 4, 6 y 18: Exploración de datos, correlación de Pearson, Spearman, Kendall y análisis Chi-cuadrado en R).</p>

<p><strong>Gelman, A., Hill, J., & Vehtari, A. (2020).</strong> <em>Regression and Other Stories</em>. Cambridge University Press. (Capítulos 3 a 5: Fundamentos de estimación, intervalos de confianza, incertidumbre y simulación de muestras en ciencias sociales).</p>
:::

:::

<script src="assets/js/glossary-search.js"></script>

Estadística Correlacional Interactiva
Facultad de Ciencias Sociales
Departamento de Sociología
Universidad de Chile

Volver arriba

Sitio creado por Katherine Aravena .

Código bajo licencia MIT · Ver repositorio en GitHub