Guía y calculadora de estadística

¿Puedo confiar en lo que me dice esta muestra?

Toda la estadística inferencial responde a la misma incomodidad: mediste unos pocos casos y querés hablar de todos. Elegí abajo en qué etapa estás —cuántos casos necesitás, qué margen tiene tu promedio, si dos variables se mueven juntas o si una diferencia es real— y te mostramos la cuenta completa.

Actualizado 27-07-2026 5 tests e intervalos adentro Con la fórmula y la conclusión

Tu caso

¿En qué etapa estás?

Las dos primeras ramas son de diseño y estimación (antes y después de medir). Las dos últimas son tests: contestan si lo que ves en los datos aguanta o puede ser casualidad.

Mi caso es otro

Afiná la estimación

Cargá tus datos

Cada rama usa dos, tres o cuatro campos; los demás quedan ahí sin molestar. El nivel de confianza se comparte entre las ramas de muestra e intervalos.

Se usa en las ramas de tamaño de muestra e intervalos de confianza.

Sólo tamaño de muestra. El ±X% con el que querés reportar el resultado.

Sólo tamaño de muestra. Si no la conocés, dejá 50: es el escenario más exigente.

Sólo tamaño de muestra. Con 0 no se aplica la corrección por población finita.

Ramas de intervalo de confianza.

Ramas de intervalo de confianza. Tiene que ser mayor que 0.

Ramas de intervalo de confianza. Mínimo 2.

Sólo correlación. Tiene que tener la misma cantidad de valores que Y.

Sólo correlación. Cada valor se aparea con el de X en la misma posición.

Sólo chi-cuadrado. a y b son la primera fila; c y d la segunda. Cantidades, no porcentajes.

Aceptamos coma decimal en los campos sueltos ("1,5" es uno y medio), pero en las LISTAS la coma es el separador: escribí los decimales con punto. El valor crítico t se calcula por expansión de Cornish-Fisher, con error menor a una milésima para 3 o más grados de libertad.

Cómo se forma el total

La cuenta, paso a paso

Cada fila es un paso: los datos que entraron, el valor crítico usado, los términos intermedios y la conclusión. En los tests, la última fila es siempre la decisión: rechazás o no rechazás.

En las ramas de intervalo, las barras muestran el límite inferior, la media y el límite superior: mirar el ancho entre las puntas es la forma más honesta de leer un promedio muestral. En chi-cuadrado se comparan las frecuencias observadas contra las esperadas bajo independencia: cuanto más se despegan, más grande es el estadístico.

    Respuesta rápida

    Qué te corresponde

    n = z² × p × (1 − p) ÷ e², con corrección por población finita si el universo es chico. Fórmula base: n = z² × p × (1 − p) ÷ e², donde e es el margen de error en tanto por uno

    Plazo:

    Preguntas frecuentes

    ¿A cuánta gente tengo que encuestar?

    Con la fórmula n = z² × p × (1 − p) ÷ e². Para un margen de ±3% al 95% de confianza con proporción desconocida (p = 50%) hacen falta 1.068 respuestas válidas, y ese número casi no depende del tamaño del país: 1.068 alcanza tanto para una ciudad de 500.000 como para un país de 45 millones.

    ¿Por qué el tamaño de muestra casi no depende de la población?

    Porque lo que manda es el margen de error, no el universo. La corrección por población finita sólo se nota cuando la muestra es una fracción grande del total: las 385 respuestas que pide un ±5% al 95% bajan a 279 si tu universo es una empresa de 1.000 personas. Con una población de un millón, la corrección es imperceptible.

    ¿Qué significa "95% de confianza"?

    Que si repitieras el estudio muchas veces con el mismo método, el 95% de los intervalos construidos así contendrían la media verdadera. NO significa que haya 95% de probabilidad de que la media esté en TU intervalo: la media poblacional es un número fijo, el que varía es el intervalo.

    ¿Cuándo uso z y cuándo t de Student para el intervalo?

    Usá z si conocés el desvío poblacional o si tu muestra es grande (n ≥ 30). Usá t si estimaste el desvío de la propia muestra y n es chico. La diferencia no es cosmética: con n = 5 al 95%, t = 2,776 contra z = 1,96, o sea un intervalo un 40% más ancho. Usar z ahí te haría reportar más precisión de la que tenés.

    ¿Cómo achico el margen de error de mi encuesta?

    Aumentando n, pero con rendimientos decrecientes: el margen baja con la raíz cuadrada de la muestra. Para reducirlo a la mitad tenés que cuadruplicar los casos. Pasar de ±4% a ±2% te lleva de unas 600 a unas 2.400 respuestas, y de ahí a ±1% harían falta unas 9.600.

    ¿Qué mide el coeficiente de correlación de Pearson?

    La fuerza y el sentido de la relación lineal entre dos variables, en una escala de −1 a 1. Un r de 0,85 indica una relación positiva fuerte; uno de −0,9, una negativa muy fuerte; uno cercano a 0, que no hay relación lineal. El R² = r² se lee como el porcentaje de la variabilidad de y que queda explicado por x.

    ¿Correlación implica causalidad?

    No, y es el error más común de todos. Dos variables pueden correlacionar porque una causa a la otra, porque una tercera variable causa a las dos, o por pura casualidad si mirás suficientes series. El consumo de helado y los ahogamientos correlacionan fuerte, y el culpable es el verano. Para hablar de causa hacen falta un experimento o un diseño causal, no un r alto.

    ¿Un r cercano a cero significa que no hay relación?

    Significa que no hay relación lineal. Una relación en forma de U —el rendimiento sube con la temperatura y después baja— puede dar r ≈ 0 y ser perfectamente determinista. Por eso la primera regla frente a un r es graficar los puntos: el dibujo muestra en un segundo lo que el coeficiente esconde.

    ¿Para qué sirve el test de chi-cuadrado?

    Para decidir si dos variables categóricas están asociadas o son independientes. Compara lo que observaste con lo que esperarías si no hubiera ninguna relación: χ² = Σ (observado − esperado)² ÷ esperado. Es el test de un A/B test con conversiones, de una encuesta cruzada por género o de un tratamiento contra un control.

    ¿Cómo se lee el valor p del chi-cuadrado?

    Es la probabilidad de ver una diferencia como la tuya (o mayor) si las variables fueran independientes. Si p < 0,05 rechazás la independencia: la asociación difícilmente sea casualidad. Si p ≥ 0,05, no tenés evidencia suficiente, que no es lo mismo que probar que no hay efecto: puede faltarte muestra.

    ¿Qué pasa si alguna frecuencia esperada es menor a 5?

    El chi-cuadrado deja de ser confiable, porque la aproximación a la distribución χ² se rompe con conteos muy chicos. En una tabla 2×2 la salida estándar es el test exacto de Fisher. Esta página te avisa cuando alguna esperada queda por debajo de 5.

    ¿Un resultado significativo quiere decir que el efecto es importante?

    No. La significancia estadística mide qué tan improbable es el resultado bajo la hipótesis de que no pasa nada, y con muestras enormes cualquier diferencia mínima se vuelve significativa. Para saber si importa hay que mirar el tamaño del efecto: la diferencia de proporciones, el r, el ancho del intervalo. Significativo y relevante son dos cosas distintas.