Tecnología / Inteligencia artificial

El costo está en el flujo, no en una sola llamada.

Sumá usuarios, frecuencia, tokens de entrada y salida para presupuestar cada etapa del producto.

Flujo por solicitud

Preguntas frecuentes

¿Cómo se calcula el costo de una API de IA por tokens?

Se cuentan por separado los tokens que entran y los que salen, y cada grupo se multiplica por su propio precio por millón. La fórmula es: millones de entrada × precio de entrada, más millones de salida × precio de salida. No es un precio único por llamada, y por eso dos aplicaciones con el mismo número de llamadas pueden tener facturas muy distintas.

¿Por qué la salida cuesta más que la entrada?

Porque generar es más caro que leer. La entrada se procesa de una sola vez en paralelo, mientras que la salida se produce token por token, y cada uno exige una pasada completa por el modelo. En la práctica la salida se cobra alrededor de cinco veces la entrada, así que recortar respuestas largas baja la factura mucho más rápido que recortar el prompt.

¿Cuánto es un token?

Como referencia gruesa, un token equivale a unos cuatro caracteres en inglés y a algo menos en español, donde una palabra suele costar más de un token. Cada modelo usa su propio tokenizador, así que el número exacto varía y no conviene apoyar un presupuesto ajustado en una estimación por caracteres: la mayoría de los proveedores ofrece un endpoint para contar tokens de verdad.

¿Cuándo conviene usar prompt caching?

A partir de la segunda llamada que comparta el mismo prefijo. Escribir la caché cuesta 1,25 veces el precio normal de entrada y leerla cuesta 0,10, así que la primera llamada sale más cara y la segunda ya empieza a devolver. Con un prompt fijo grande y muchas llamadas repetidas, el ahorro sobre esa porción se acerca al 90%.

¿Qué parte del prompt puedo cachear?

La que no cambia entre llamadas y está al principio: instrucciones del sistema, definiciones de herramientas y documentos de referencia. La caché es una coincidencia de prefijo, así que cualquier byte que cambie temprano invalida todo lo que viene después. Una fecha o un identificador metido en el encabezado del prompt basta para tirar abajo el ahorro completo.

¿Me conviene alquilar GPU en vez de pagar la API?

Sólo si sostenés volumen alto y constante. La cuenta es dividir el costo de la GPU por hora entre los tokens que realmente servís en esa hora, y eso depende del batch: cuántos pedidos podés atender en paralelo. Con un batch chico, el costo por millón de tokens propio suele quedar por encima del precio de la API, y a eso todavía hay que sumarle ingeniería, monitoreo y guardias.

¿Cuánto pierdo por tener GPU encendidas sin usar?

Exactamente lo mismo que si estuvieran a full: se cobra por hora encendida, no por trabajo hecho. Es la fuga más común de un presupuesto de inferencia, y en cargas con picos irregulares el tiempo ocioso puede pasar la mitad del gasto. Apagar o liberar la instancia en los huecos suele ahorrar más que cualquier optimización del modelo.

¿Qué es el descuento spot y cuánto ahorra?

Es capacidad sobrante que el proveedor vende más barata a cambio de poder cortártela sin aviso. Los descuentos suelen ir del 50% al 80% sobre el precio on-demand. Sirve para entrenamiento y trabajos por lotes que toleran reiniciarse desde un checkpoint; para inferencia de cara al usuario, la interrupción cuesta más que el ahorro.

¿Cómo estimo lo que sale un servidor cloud?

Se suman cuatro rubros: vCPU y RAM, que son el cómputo y se llevan el grueso; almacenamiento SSD por GB, que suele ser marginal; y tráfico de salida, que es el que más sorprende. Los precios de referencia de este hub son promedios on-demand: reservar la instancia por uno a tres años recorta habitualmente entre un 30% y un 60%.

¿Por qué el precio del modelo es un campo editable?

Porque los precios de los modelos de IA cambian y los modelos se discontinúan más rápido que cualquier página. La lista precargada son los precios de la API de Anthropic con su fecha de verificación; para cualquier otro proveedor, o si el tuyo cambió, elegí "Otro modelo" y cargá los dos números a mano. El hub prefiere pedirte el dato antes que inventarlo.

¿Un modelo más barato siempre sale más barato?

No necesariamente. Un modelo chico suele necesitar prompts más largos, más reintentos y más pasos para llegar al mismo resultado, y cada uno de esos pasos vuelve a pagar entrada y salida. Antes de bajar de gama, medí el costo de la tarea completa y no el precio por millón de tokens.

¿Los precios de este hub incluyen impuestos?

No. Son precios de lista en dólares, sin impuestos ni percepciones. Si pagás desde Argentina con tarjeta, sumale los recargos que correspondan a tu situación fiscal; si la empresa factura al exterior, el tratamiento es otro. Consultá con tu contador antes de armar el presupuesto final.

Fuentes

Precios de la API de Claude — USD por millón de tokens de entrada y salidaPrompt caching — multiplicadores de escritura (1,25×) y lectura (0,10×)Amazon EC2 — precios on-demand de cómputo, almacenamiento y transferencia de datosGoogle Cloud — precios de GPU y de instancias spot

Respuesta comprobable

La respuesta, sin vueltas

El gasto son los millones de tokens de entrada y de salida, cada uno a su precio.

Partimos del caso más común: pagás una API por tokens. Si en cambio alquilás GPU, levantás un servidor o querés saber cuánto te sale el millón de tokens propio, cambialo abajo.

Qué entra

  • Tokens de entrada por su precio, y tokens de salida por el suyo, que es varias veces mayor
  • El descuento del prompt caching sobre la parte fija del prompt que se repite en cada llamada
  • El costo por llamada y el equivalente anual

Qué puede cambiarla

  • La salida se cobra cinco veces la entrada en la mayoría de los modelos: acortar respuestas largas baja la factura mucho más rápido que acortar el prompt
  • Los precios de los modelos cambian seguido. Verificá siempre la página oficial de precios del proveedor antes de comprometer un presupuesto

Plazo o próximo paso: la caché se cobra 1,25× al escribirla y 0,10× al leerla, así que recién conviene a partir de la segunda llamada.

Fuentes principales: Anthropic · Anthropic

Transparencia editorial

Quién responde por esta guía

Estado editorial visible en metodología
Autor y editor responsableFundador y editor responsable de Hacé Cuentas.
Cómo se verificaLa autoría y el método están explicados en las páginas editoriales.
Fuentes y métodoLa página explica sus supuestos y límites.Ver metodología →

Elegí tu situación

Consulta principal:Cuánto me cuesta la API de IA

¿Qué querés resolver?

Herramientas relacionadas en otros países e idiomas

Revisá el idioma, las unidades y los supuestos de cada herramienta.