Matemática / Estadística inferencial

Una muestra puede acertar. O puede engañarte.

Tomá muestras repetidas de la misma población y observá qué intervalos alcanzan el valor real.

Intervalos obtenidos

Cubren el valor real

Preguntas frecuentes

¿A cuánta gente tengo que encuestar?

Con la fórmula n = z² × p × (1 − p) ÷ e². Para un margen de ±3% al 95% de confianza con proporción desconocida (p = 50%) hacen falta 1.068 respuestas válidas, y ese número casi no depende del tamaño del país: 1.068 alcanza tanto para una ciudad de 500.000 como para un país de 45 millones.

¿Por qué el tamaño de muestra casi no depende de la población?

Porque lo que manda es el margen de error, no el universo. La corrección por población finita sólo se nota cuando la muestra es una fracción grande del total: las 385 respuestas que pide un ±5% al 95% bajan a 279 si tu universo es una empresa de 1.000 personas. Con una población de un millón, la corrección es imperceptible.

¿Qué significa "95% de confianza"?

Que si repitieras el estudio muchas veces con el mismo método, el 95% de los intervalos construidos así contendrían la media verdadera. NO significa que haya 95% de probabilidad de que la media esté en TU intervalo: la media poblacional es un número fijo, el que varía es el intervalo.

¿Cuándo uso z y cuándo t de Student para el intervalo?

Usá z si conocés el desvío poblacional o si tu muestra es grande (n ≥ 30). Usá t si estimaste el desvío de la propia muestra y n es chico. La diferencia no es cosmética: con n = 5 al 95%, t = 2,776 contra z = 1,96, o sea un intervalo un 40% más ancho. Usar z ahí te haría reportar más precisión de la que tenés.

¿Cómo achico el margen de error de mi encuesta?

Aumentando n, pero con rendimientos decrecientes: el margen baja con la raíz cuadrada de la muestra. Para reducirlo a la mitad tenés que cuadruplicar los casos. Pasar de ±4% a ±2% te lleva de unas 600 a unas 2.400 respuestas, y de ahí a ±1% harían falta unas 9.600.

¿Qué mide el coeficiente de correlación de Pearson?

La fuerza y el sentido de la relación lineal entre dos variables, en una escala de −1 a 1. Un r de 0,85 indica una relación positiva fuerte; uno de −0,9, una negativa muy fuerte; uno cercano a 0, que no hay relación lineal. El R² = r² se lee como el porcentaje de la variabilidad de y que queda explicado por x.

¿Correlación implica causalidad?

No, y es el error más común de todos. Dos variables pueden correlacionar porque una causa a la otra, porque una tercera variable causa a las dos, o por pura casualidad si mirás suficientes series. El consumo de helado y los ahogamientos correlacionan fuerte, y el culpable es el verano. Para hablar de causa hacen falta un experimento o un diseño causal, no un r alto.

¿Un r cercano a cero significa que no hay relación?

Significa que no hay relación lineal. Una relación en forma de U —el rendimiento sube con la temperatura y después baja— puede dar r ≈ 0 y ser perfectamente determinista. Por eso la primera regla frente a un r es graficar los puntos: el dibujo muestra en un segundo lo que el coeficiente esconde.

¿Para qué sirve el test de chi-cuadrado?

Para decidir si dos variables categóricas están asociadas o son independientes. Compara lo que observaste con lo que esperarías si no hubiera ninguna relación: χ² = Σ (observado − esperado)² ÷ esperado. Es el test de un A/B test con conversiones, de una encuesta cruzada por género o de un tratamiento contra un control.

¿Cómo se lee el valor p del chi-cuadrado?

Es la probabilidad de ver una diferencia como la tuya (o mayor) si las variables fueran independientes. Si p < 0,05 rechazás la independencia: la asociación difícilmente sea casualidad. Si p ≥ 0,05, no tenés evidencia suficiente, que no es lo mismo que probar que no hay efecto: puede faltarte muestra.

¿Qué pasa si alguna frecuencia esperada es menor a 5?

El chi-cuadrado deja de ser confiable, porque la aproximación a la distribución χ² se rompe con conteos muy chicos. En una tabla 2×2 la salida estándar es el test exacto de Fisher. Esta página te avisa cuando alguna esperada queda por debajo de 5.

¿Un resultado significativo quiere decir que el efecto es importante?

No. La significancia estadística mide qué tan improbable es el resultado bajo la hipótesis de que no pasa nada, y con muestras enormes cualquier diferencia mínima se vuelve significativa. Para saber si importa hay que mirar el tamaño del efecto: la diferencia de proporciones, el r, el ancho del intervalo. Significativo y relevante son dos cosas distintas.

Fuentes

Metodologías de muestreo y estimación de encuestas a hogaresNIST/SEMATECH e-Handbook of Statistical Methods — Confidence intervals and hypothesis testsConfidence intervals and significance testsASA Statement on Statistical Significance and P-ValuesStudent (W. S. Gosset), "The Probable Error of a Mean", Biometrika 1908

Respuesta comprobable

La respuesta, sin vueltas

n = z² × p × (1 − p) ÷ e², con corrección por población finita si el universo es chico.

Toda la estadística inferencial responde a la misma incomodidad: mediste unos pocos casos y querés hablar de todos. Elegí abajo en qué etapa estás —cuántos casos necesitás, qué margen tiene tu promedio, si dos variables se mueven juntas o si una diferencia es real— y te mostramos la cuenta completa.

Qué entra

  • Fórmula base: n = z² × p × (1 − p) ÷ e², donde e es el margen de error en tanto por uno
  • z sale del nivel de confianza: 1,6449 al 90%, 1,96 al 95% y 2,5758 al 99%
  • p es la proporción esperada; si no la conocés, usá 50%, que es el caso más exigente
  • Corrección por población finita: n = n₀ ÷ (1 + (n₀ − 1) ÷ N), útil cuando el universo no es enorme

Qué puede cambiarla

  • Bajar el margen a la mitad CUADRUPLICA la muestra: de ±4% a ±2% pasás de unas 600 a unas 2.400 respuestas
  • Este n es de respuestas VÁLIDAS, no de invitaciones enviadas: con 60% de tasa de respuesta tenés que contactar bastante más
  • La fórmula asume muestreo aleatorio simple. Si la muestra está sesgada (auto-selección, sólo redes sociales), ningún n te salva

Plazo o próximo paso: dato práctico: para una población grande, ±3% al 95% son 1.068 respuestas, sin importar si el país tiene 5 o 50 millones de habitantes.

Fuentes principales: INDEC — Instituto Nacional de Estadística y Censos · NIST / SEMATECH

Transparencia editorial

Quién responde por esta guía

Estado editorial visible en metodología
Autor y editor responsableFundador y editor responsable de Hacé Cuentas.
Cómo se verificaLa autoría y el método están explicados en las páginas editoriales.
Fuentes y métodoLa página explica sus supuestos y límites.Ver metodología →

Elegí tu situación

¿Qué querés resolver?