Costos de infraestructura de IA

¿Cuánto te va a costar la IA este mes?

Partimos del caso más común: pagás una API por tokens. Si en cambio alquilás GPU, levantás un servidor o querés saber cuánto te sale el millón de tokens propio, cambialo abajo.

Precios de lista al 27-07-2026 Todo en dólares 8 calculadoras adentro

Tu caso

¿Cómo pagás la IA?

Partimos del caso más frecuente. Si el tuyo es distinto, cambialo.

Mi caso es otro

Afiná la estimación

Cargá tus números

Cada caso usa los campos que le sirven; el resto los podés ignorar.

Precios de lista de la API de Anthropic al 27-07-2026. Para cualquier otro proveedor elegí "Otro modelo" y cargá los dos precios de abajo.

Dejalo en 0 para usar el precio del modelo elegido. Cualquier valor mayor a 0 lo pisa.

Dejalo en 0 para usar el precio del modelo elegido.

System prompt, instrucciones y documentos que van iguales en todas las llamadas. Es la porción que se puede cachear.

Qué porcentaje de las llamadas encuentra la caché caliente. Con 0 no hay ahorro.

Sólo se usa para mostrarte el costo por llamada.

GPU encendida y sin carga. Es la fuga más común de un presupuesto de inferencia.

Sólo para autohospedaje. Es la velocidad de generación de una sola conversación.

Todos los importes están en dólares. Los precios de modelo cargados son los de lista de la API de Anthropic al 27-07-2026 y caducan rápido: para cualquier otro proveedor, o si el tuyo cambió, cargá los precios a mano en los dos campos de precio. Esto es una estimación de costos, no una cotización.

Cómo se forma el total

El desglose de tu factura

Todas las filas están en dólares. Las barras comparan cada rubro con el más grande.

La composición muestra qué rubro manda en tu factura. En la rama de API casi siempre es la salida, que se cobra varias veces la entrada; en la de GPU, mirá cuánto pesa el tiempo ocioso.

    Respuesta rápida

    Qué te corresponde

    El gasto son los millones de tokens de entrada y de salida, cada uno a su precio. Tokens de entrada por su precio, y tokens de salida por el suyo, que es varias veces mayor

    Plazo:

    Preguntas frecuentes

    ¿Cómo se calcula el costo de una API de IA por tokens?

    Se cuentan por separado los tokens que entran y los que salen, y cada grupo se multiplica por su propio precio por millón. La fórmula es: millones de entrada × precio de entrada, más millones de salida × precio de salida. No es un precio único por llamada, y por eso dos aplicaciones con el mismo número de llamadas pueden tener facturas muy distintas.

    ¿Por qué la salida cuesta más que la entrada?

    Porque generar es más caro que leer. La entrada se procesa de una sola vez en paralelo, mientras que la salida se produce token por token, y cada uno exige una pasada completa por el modelo. En la práctica la salida se cobra alrededor de cinco veces la entrada, así que recortar respuestas largas baja la factura mucho más rápido que recortar el prompt.

    ¿Cuánto es un token?

    Como referencia gruesa, un token equivale a unos cuatro caracteres en inglés y a algo menos en español, donde una palabra suele costar más de un token. Cada modelo usa su propio tokenizador, así que el número exacto varía y no conviene apoyar un presupuesto ajustado en una estimación por caracteres: la mayoría de los proveedores ofrece un endpoint para contar tokens de verdad.

    ¿Cuándo conviene usar prompt caching?

    A partir de la segunda llamada que comparta el mismo prefijo. Escribir la caché cuesta 1,25 veces el precio normal de entrada y leerla cuesta 0,10, así que la primera llamada sale más cara y la segunda ya empieza a devolver. Con un prompt fijo grande y muchas llamadas repetidas, el ahorro sobre esa porción se acerca al 90%.

    ¿Qué parte del prompt puedo cachear?

    La que no cambia entre llamadas y está al principio: instrucciones del sistema, definiciones de herramientas y documentos de referencia. La caché es una coincidencia de prefijo, así que cualquier byte que cambie temprano invalida todo lo que viene después. Una fecha o un identificador metido en el encabezado del prompt basta para tirar abajo el ahorro completo.

    ¿Me conviene alquilar GPU en vez de pagar la API?

    Sólo si sostenés volumen alto y constante. La cuenta es dividir el costo de la GPU por hora entre los tokens que realmente servís en esa hora, y eso depende del batch: cuántos pedidos podés atender en paralelo. Con un batch chico, el costo por millón de tokens propio suele quedar por encima del precio de la API, y a eso todavía hay que sumarle ingeniería, monitoreo y guardias.

    ¿Cuánto pierdo por tener GPU encendidas sin usar?

    Exactamente lo mismo que si estuvieran a full: se cobra por hora encendida, no por trabajo hecho. Es la fuga más común de un presupuesto de inferencia, y en cargas con picos irregulares el tiempo ocioso puede pasar la mitad del gasto. Apagar o liberar la instancia en los huecos suele ahorrar más que cualquier optimización del modelo.

    ¿Qué es el descuento spot y cuánto ahorra?

    Es capacidad sobrante que el proveedor vende más barata a cambio de poder cortártela sin aviso. Los descuentos suelen ir del 50% al 80% sobre el precio on-demand. Sirve para entrenamiento y trabajos por lotes que toleran reiniciarse desde un checkpoint; para inferencia de cara al usuario, la interrupción cuesta más que el ahorro.

    ¿Cómo estimo lo que sale un servidor cloud?

    Se suman cuatro rubros: vCPU y RAM, que son el cómputo y se llevan el grueso; almacenamiento SSD por GB, que suele ser marginal; y tráfico de salida, que es el que más sorprende. Los precios de referencia de este hub son promedios on-demand: reservar la instancia por uno a tres años recorta habitualmente entre un 30% y un 60%.

    ¿Por qué el precio del modelo es un campo editable?

    Porque los precios de los modelos de IA cambian y los modelos se discontinúan más rápido que cualquier página. La lista precargada son los precios de la API de Anthropic con su fecha de verificación; para cualquier otro proveedor, o si el tuyo cambió, elegí "Otro modelo" y cargá los dos números a mano. El hub prefiere pedirte el dato antes que inventarlo.

    ¿Un modelo más barato siempre sale más barato?

    No necesariamente. Un modelo chico suele necesitar prompts más largos, más reintentos y más pasos para llegar al mismo resultado, y cada uno de esos pasos vuelve a pagar entrada y salida. Antes de bajar de gama, medí el costo de la tarea completa y no el precio por millón de tokens.

    ¿Los precios de este hub incluyen impuestos?

    No. Son precios de lista en dólares, sin impuestos ni percepciones. Si pagás desde Argentina con tarjeta, sumale los recargos que correspondan a tu situación fiscal; si la empresa factura al exterior, el tratamiento es otro. Consultá con tu contador antes de armar el presupuesto final.