Su prueba de concepto de Bedrock (proof of concept) funcionó. El modelo era bueno, la API era limpia, lanzó una funcionalidad y a los usuarios les gusta.
Entonces llegó la factura.
Era más alta que la cifra aproximada que utilizó para dar luz verde al proyecto, y las líneas que puede ver en la factura no explican del todo por qué. No está solo, y la respuesta no es «Bedrock es caro».
La respuesta es que los precios de Bedrock tienen cinco o seis piezas móviles que no son evidentes hasta que se han pasado uno o dos ciclos de facturación.
Esta guía es la que un ingeniero sénior de AWS escribiría para otro ingeniero sénior de AWS. Analizamos cómo le cobra Bedrock realmente a mediados de 2026, dónde se esconden las sorpresas, las pocas palancas que más mueven la factura y los momentos en los que la respuesta es no usar Bedrock en absoluto.
Resumen: Precios de AWS Bedrock
|
Cómo funcionan realmente los precios de AWS Bedrock (también conocidos como precios de Amazon Bedrock)
Bedrock se basa en el uso. No hay un mínimo, ni suscripción, ni un nivel gratuito de AWS Bedrock en el que pueda confiar para producción (más información sobre el nivel gratuito más adelante). Usted paga por lo que usa, pero «lo que usa» tiene cinco categorías que vale la pena entender antes de pronosticar una factura.
Los precios de Amazon Bedrock (AWS y Amazon se refieren al mismo servicio indistintamente) se desglosan en cuatro modos principales, en términos sencillos:
- Bajo demanda: Pague por cada 1.000 tokens de entrada, por cada 1.000 tokens de salida, por imagen o por segundo de vídeo generado. Sin compromiso, sin mínimo, los precios varían según el modelo y la región de AWS. Aquí es donde empiezan la mayoría de los equipos.
- Rendimiento provisionado: Reserve capacidad dedicada para un modelo específico en unidades de modelo, facturada por hora, utilice o no la capacidad. A esto se cambia cuando el uso se vuelve predecible y de gran volumen.
- Inferencia por lotes: Ejecute trabajos asíncronos con un 50 % de descuento sobre la tarifa Bajo demanda. Específicamente para Amazon Nova, AWS también ofrece un nivel Flex con el mismo 50 % de descuento, además de un nivel Priority a aproximadamente 1,75 veces el Standard para cargas de trabajo críticas que necesitan una asignación de cómputo preferente. Adecuado para trabajos donde la latencia no importa (resúmenes nocturnos, clasificación de documentos, enriquecimiento periódico).
- Almacenamiento en caché de prompts: Almacene en caché el contexto de entrada repetido (prompts del sistema, fragmentos de conocimiento extensos, ejemplos de pocos disparos) y pague una fracción de la tarifa de tokens de entrada por la parte almacenada en caché. Ahorros de hasta el 90 % en la parte de entrada para aplicaciones con mucho contexto.
Los cuatro modos no son excluyentes. Un sistema de producción a menudo utiliza tres de ellos a la vez: –
- Bajo demanda para el tráfico en vivo
- Por lotes para el trabajo nocturno
- Almacenamiento en caché de prompts en las partes estáticas de cada solicitud y, a veces,
- Rendimiento provisionado en el modelo que maneja la mayor parte de la carga.
Luego están los componentes que se asientan sobre el modelo y tienen sus propios precios: Bedrock Knowledge Bases para RAG, Bedrock Agents para flujos de trabajo de varios pasos, Bedrock Flows para orquestación visual y Bedrock Guardrails para moderación de contenido.
Cada uno tiene una línea separada en la factura.
Referencia rápida: los cuatro modos de precios de AWS Bedrock de un vistazo.
| Modo de precios | Cómo se paga | Ideal para | Descuento típico vs. Bajo demanda |
|---|---|---|---|
|
Bajo demanda |
Por cada 1.000 tokens de entrada, por cada 1.000 tokens de salida, por imagen, por segundo de vídeo | Uso modesto, puntual o impredecible; prototipos y producción temprana |
Base (sin descuento) |
|
Rendimiento provisionado |
Por hora por unidad de modelo (niveles sin compromiso, de 1 mes o de 6 meses) | Cargas de trabajo constantes, de gran volumen y predecibles; necesario para modelos personalizados o ajustados |
Variable; depende de la utilización y el compromiso |
|
Inferencia por lotes (o nivel Flex) |
Misma estructura por token, asíncrona | Resúmenes nocturnos, enriquecimiento periódico, clasificación, generación de embeddings |
50 % de descuento |
|
Almacenamiento en caché de prompts |
Tokens de entrada en caché facturados a una fracción de la tarifa estándar | Aplicaciones con prefijos estáticos grandes (prompts del sistema, ejemplos de pocos disparos, contexto de conocimiento fijo) |
Hasta un 90 % de descuento en la parte almacenada en caché |
Precios Bajo demanda: el punto de partida predeterminado
Cuando llama por primera vez a un modelo de Bedrock a través de la API, está en el modo Bajo demanda. El modelo se comparte de forma multiinquilino, usted paga por token y no hay compromiso.
La estructura es la misma en todos los modelos de texto: paga por separado por los tokens de entrada (su prompt, incluyendo cualquier contexto recuperado y el mensaje del sistema) y los tokens de salida (la respuesta del modelo). Los tokens de salida generalmente cuestan de 3 a 5 veces más que los de entrada. Esta relación es el dato más importante para la previsión de costes, porque la mayoría de los equipos subestiman el coste de salida cuando calculan el gasto.
Un ejemplo rápido con Amazon Nova Pro. A partir de junio de 2026 en la página oficial de precios de AWS Nova, Nova Pro Bajo demanda cuesta 0,80 $ por cada millón de tokens de entrada y 3,20 $ por cada millón de tokens de salida, lo que equivale a 0,0008 $ por cada 1.000 tokens de entrada y 0,0032 $ por cada 1.000 tokens de salida.
Así, un intercambio de chat típico de 1.000 tokens de entrada y 500 tokens de salida cuesta 0,0008 $ + 0,0016 $ = 0,0024 $ por llamada. Con 100.000 llamadas al día, eso supone unos 240 $ al día, o aproximadamente 7.200 $ al mes.
Precios verificados de Amazon Nova Bajo demanda (EE. UU. Este, nivel Standard, 2026).
|
Modelo Nova |
Por 1M de tokens de entrada | Por 1M de tokens de salida |
Ideal para |
|---|---|---|---|
|
Nova Micro |
0,035 $ | 0,14 $ |
Clasificación simple, decisiones de enrutamiento, extracción ligera |
|
Nova Lite |
0,06 $ | 0,24 $ |
La mayoría de chats, resúmenes, tareas de complejidad media |
|
Nova Pro |
0,80 $ | 3,20 $ |
Consultas con mucho razonamiento, flujos de trabajo de agentes, tareas multimodales |
|
Nova Pro (latencia optimizada) |
1,00 $ | 4,00 $ |
UX en tiempo real donde cada 100 ms cuenta |
|
Nova Premier |
2,50 $ | 12,50 $ |
Nova de máxima calidad para razonamientos complejos de varios pasos |
Nota: Los tokens de entrada de lectura de caché se facturan con un 75 % menos que el precio del token de entrada bajo demanda. Los precios de los niveles Flex y Batch tienen un descuento aproximado del 50 % sobre las tarifas del nivel Standard mostradas. La generación Nova 2 (Nova 2 Lite, Nova 2 Pro, Nova 2 Omni) está disponible en Preview con tarifas diferentes. Verifique las últimas tarifas aquí.
Precios verificados de Anthropic Claude en Amazon Bedrock (Inferencia global entre regiones, EE. UU. Este Ohio, 2026).
|
Modelo Claude |
Por 1M entrada | Por 1M salida | Entrada por lotes (50 % dto.) | Salida por lotes (50 % dto.) |
Lectura de caché (~90 % dto. entrada) |
|---|---|---|---|---|---|
|
Claude Opus 4.8 |
5,00 $ | 25,00 $ | N/A | N/A |
0,50 $ |
|
Claude Opus 4.7 |
5,00 $ | 25,00 $ | N/A | N/A |
0,50 $ |
|
Claude Opus 4.6 |
5,00 $ | 25,00 $ | 2,50 $ | 12,50 $ |
0,50 $ |
|
Claude Opus 4.5 |
5,00 $ | 25,00 $ | 2,50 $ | 12,50 $ |
0,50 $ |
|
Claude Sonnet 4.6 |
3,00 $ | 15,00 $ | 1,50 $ | 7,50 $ |
0,30 $ |
|
Claude Sonnet 4.5 |
3,00 $ | 15,00 $ | 1,50 $ | 7,50 $ |
0,30 $ |
|
Claude Sonnet 4 |
3,00 $ | 15,00 $ | 1,50 $ | 7,50 $ |
0,30 $ |
|
Claude Haiku 4.5 |
1,00 $ | 5,00 $ | 0,50 $ | 2,50 $ |
0,10 $ |
|
Claude 3.5 Haiku |
0,80 $ | 4,00 $ | N/A | N/A |
0,08 $ |
|
Claude Mythos Preview |
no disponible | no disponible | no disponible | no disponible |
no disponible |
Las tarifas de inferencia geográfica y entre regiones dentro de la misma región son ligeramente superiores (p. ej., Sonnet 4.6 a 3,30 $ entrada / 16,50 $ salida por 1M). Los precios del nivel Reserved también están disponibles con compromisos de 1 y 3 meses para cargas de trabajo estables. Verifique las últimas tarifas aquí.
Comparación de costes que vale la pena conocer: Claude Sonnet 4.6 a 3,00 $ por 1M de tokens de entrada es aproximadamente 4 veces más caro que Nova Pro a 0,80 $, y 50 veces más caro que Nova Lite a 0,06 $. Esa diferencia es la razón por la que el enrutamiento de modelos es tan importante. Enviar una consulta a Sonnet 4.6 cuando Nova Lite habría respondido correctamente le cuesta 50 veces más de lo que debería.
La familia Claude de Anthropic en Bedrock sigue el mismo patrón con un coste absoluto más elevado.
- Los precios de Anthropic en AWS Bedrock siguen de cerca las tarifas de la API publicadas por Anthropic, con variaciones regionales.
- Claude Opus 4.8 se sitúa en la parte superior del catálogo (5,00 $ por 1M de tokens de entrada, 25,00 $ por 1M de salida).
- Claude Sonnet 4.6 es la opción principal de alta calidad (3,00 $ por 1M de entrada, 15,00 $ por 1M de salida, con una ventana de contexto de 1M de tokens en preview).
- Claude Haiku 4.5 es la opción más rápida y económica (1,00 $ por 1M de entrada, 5,00 $ por 1M de salida).
- Anthropic también tiene Mythos Preview disponible en una vista previa de investigación restringida (no disponible para el público general, sin precios publicados aún).
- Los modelos Meta Llama y Mistral ofrecen puntos alternativos de precio-rendimiento. Verifique siempre la tarifa actual en la página oficial de precios de AWS Bedrock antes de comprometerse con un presupuesto, porque las tarifas cambian y la región importa.
Para los embeddings (modelos vectoriales como Amazon Titan Text Embeddings o Cohere Embed), solo paga por los tokens de entrada porque la salida es un vector, no texto generado. Los costes de los embeddings suelen ser pequeños por llamada, pero las aplicaciones RAG generan muchos, por lo que se acumulan.
Para la generación de imágenes y vídeos, la unidad cambia. Amazon Nova Canvas cobra por imagen generada, con una tarifa más alta para una mayor resolución o calidad premium. Amazon Nova Reel cobra por segundo de vídeo generado. Los modelos de Stability AI en Bedrock siguen patrones similares por imagen.
El patrón en todos estos casos: usted paga por la salida. La forma de reducir el coste Bajo demanda es casi siempre producir menos salida, o producir la misma salida con un modelo más barato.
Rendimiento provisionado: cuándo vale la pena
El Rendimiento provisionado es la respuesta para cargas de trabajo constantes y de gran volumen. Usted reserva unidades de modelo (cada una garantiza un rendimiento de tokens por minuto conocido) y paga una tarifa por hora, tanto si la capacidad está en uso como si está inactiva.
La compensación es sencilla. Bajo demanda es más barato por token, pero tiene una latencia variable bajo carga y no garantiza la capacidad.
El Rendimiento provisionado es más caro por hora, pero ofrece un rendimiento y un coste predecibles. Hay tres niveles de compromiso: sin compromiso (pago por hora, cancelación en cualquier momento), compromiso de 1 mes (tarifa por hora más baja) y compromiso de 6 meses (tarifa por hora mínima).
El cálculo honesto sobre si cambiar:
- Si su volumen diario de tokens es modesto y puntual, quédese en Bajo demanda.
- Si está ejecutando un modelo con una utilización alta y sostenida (piense en un chat de atención al cliente con tráfico constante o en un procesamiento por lotes que se ejecuta casi todo el día), compare la tarifa de Rendimiento provisionado con su factura de Bajo demanda. El punto de equilibrio depende de la carga de trabajo, pero como regla orientativa, las cargas de trabajo sostenidas por encima del equivalente a unos pocos cientos de miles de tokens por minuto empiezan a ser más baratas con el Rendimiento provisionado.
- Si utiliza un modelo personalizado importado o ajustado, no tiene elección. Los modelos personalizados en Bedrock requieren Rendimiento provisionado por diseño, ya que no se pueden compartir en el grupo multiinquilino de Bajo demanda.
El error que debe evitar es el exceso de reserva. Comprar capacidad con un compromiso de 6 meses para un tráfico que aún no es estable es la forma más rápida de gastar de más en Bedrock. La mayoría de los equipos deberían operar en Bajo demanda el tiempo suficiente para ver la forma real del tráfico antes de comprometerse.
Inferencia por lotes y almacenamiento en caché de prompts: las dos palancas silenciosas
Dos modos de precios son fáciles de pasar por alto y a menudo mueven la factura más que la decisión de elección del modelo.
La inferencia por lotes ejecuta sus prompts de forma asíncrona a la mitad de la tarifa Bajo demanda (AWS también tiene un nivel Flex con el mismo 50 % de descuento para los modelos compatibles, con compensaciones similares).
Los casos de uso no son interactivos:
- Resumen de documentos nocturno
- Enriquecimiento periódico de datos
- Generación de embeddings a gran escala
- Generación de informes al final del día
- Cualquier cosa en la que la solicitud y la respuesta no necesiten ocurrir en tiempo real. Si puede retener una solicitud durante horas, puede pagar la mitad
El patrón que funciona: tome las partes de su carga de trabajo de gran volumen y tolerantes a la latencia y páselas a Batch. El primer lugar donde mirar es cualquier cosa que se ejecute con una programación cron. El segundo es cualquier cosa en la que un usuario inicie un trabajo y esté contento de recibir un correo electrónico cuando termine.
El almacenamiento en caché de prompts es la palanca más importante para las aplicaciones con mucho contexto. Si sus prompts incluyen un prefijo estático grande (un prompt del sistema, un conjunto grande de ejemplos de pocos disparos, un documento de política largo, un contexto de base de conocimientos) y el prefijo se repite en las solicitudes, Bedrock puede almacenar en caché el prefijo y facturar los tokens almacenados en caché a una fracción de la tarifa estándar de tokens de entrada.
Ahorros de hasta el 90 % en la parte almacenada en caché de la entrada son típicos para aplicaciones con mucho contexto.
Esta es la optimización menos utilizada en los despliegues de Bedrock en producción.
Si su aplicación envía el mismo prompt del sistema de 5.000 tokens con cada solicitud, probablemente esté pagando por 5.000 tokens de entrada en cada llamada cuando podría estar pagando una fracción mínima de eso.
Vale la pena realizar una auditoría si observa una factura de tokens de entrada superior a lo esperado.
Los costes ocultos: Knowledge Bases, Agents, Flows, Guardrails
La mayoría de los equipos presupuestan para el modelo y olvidan los componentes que lo envuelven. Cada uno tiene su propia línea en la factura.
Bedrock Knowledge Bases es la capacidad RAG gestionada. La invocación del modelo durante la recuperación se cobra a las tarifas de inferencia estándar.
El coste oculto es el almacén de vectores: si utiliza Amazon OpenSearch Serverless como índice de respaldo (la opción gestionada predeterminada), espere una base de unos pocos cientos de dólares al mes como mínimo para la capacidad de OCU, incluso con un volumen de consultas bajo.
Para cargas de trabajo más pequeñas, alternativas como Amazon Aurora PostgreSQL con pgvector u OpenSearch autogestionado pueden ser más baratas, pero requieren más configuración. También está el coste del modelo de embeddings durante la ingesta, que se paga una vez por documento pero se repite cada vez que se vuelve a indexar.
Bedrock Agents orquestan flujos de trabajo de varios pasos donde el modelo llama a herramientas, recupera contexto y produce una respuesta final.
La invocación del agente en sí no tiene una tarifa fija por llamada; lo que paga es la suma de cada llamada al modelo que el agente realiza a lo largo del camino.
Los agentes que realizan muchas llamadas a herramientas y muchas invocaciones al modelo por solicitud de usuario pueden ser engañosamente caros si solo cuenta las interacciones visibles del usuario.
Bedrock Flows es el producto de orquestación visual para encadenar prompts, condiciones y herramientas. El coste específico de Flows es de aproximadamente 0,035 $ por cada 1.000 transiciones de nodos visuales, además de los costes de invocación del modelo subyacente.
Para un uso de bajo volumen es trivial; para cargas de trabajo de producción de alto volumen vale la pena medirlo.
Bedrock Guardrails cobra 0,15 $ por cada 1.000 unidades de texto para las evaluaciones de filtros de contenido en contenido de texto, más 0,00075 $ por imagen para contenido de imagen. Esto es por evaluación, no por llamada: si ejecuta Guardrails tanto en la entrada como en la salida, paga por ambas. La tarifa del filtro de texto es modesta por llamada, pero se acumula con un alto volumen de solicitudes y ventanas de contenido grandes.
Ninguno de estos es irrazonable por sí solo. Se convierten en un problema cuando los equipos los apilan todos juntos sin medir la contribución de cada uno a la cifra final.
Costes ocultos de un vistazo.
| Componente | Qué se paga | Cuándo se aplica |
|---|---|---|
|
Bedrock Knowledge Bases |
Tarifas de inferencia estándar durante la recuperación, más el coste del almacén de vectores (OpenSearch Serverless normalmente unos cientos de dólares al mes como mínimo) |
Cualquier aplicación RAG que utilice las Knowledge Bases gestionadas de Bedrock |
|
Bedrock Agents |
Suma de cada llamada al modelo que el agente realiza por solicitud de usuario |
Agentes de varios pasos que encadenan llamadas a herramientas e invocaciones al modelo |
|
Bedrock Flows |
0,035 $ por cada 1.000 transiciones de nodos visuales, además de los costes del modelo subyacente |
Orquestación basada en Flows de alto volumen |
|
Bedrock Guardrails (texto) |
0,15 $ por cada 1.000 unidades de texto, cobrados por evaluación (la entrada y la salida cuentan por separado) |
Cualquier aplicación de producción con moderación de contenido, facturada en cada llamada evaluada |
|
Bedrock Guardrails (imagen) |
0,00075 $ por imagen procesada |
Moderación de contenido de imagen |
|
Transferencia de datos entre regiones |
Tarifas estándar de salida de AWS |
Despliegues multirregión o fuentes de datos en una región diferente a la del modelo |
Enrutamiento de modelos: la mayor palanca de optimización
Si lee una sección de esta guía, que sea esta.
La optimización de costes más eficaz en Bedrock no es cambiar de Bajo demanda a Rendimiento provisionado. No es Batch. No es el almacenamiento en caché de prompts. Esas son reales y vale la pena hacerlas. Pero ninguna de ellas mueve tanto la factura como utilizar el modelo del tamaño adecuado para cada solicitud.
El patrón: envíe solicitudes simples a un modelo barato y rápido. Envíe solicitudes complejas a un modelo grande y caro. Decida cuál es cuál mediante programación.
Un ejemplo práctico con cifras verificadas: suponga que su aplicación maneja dos tipos de consultas: búsquedas de datos breves (aproximadamente el 70 % del tráfico) y razonamientos complejos de varios pasos (aproximadamente el 30 % del tráfico).
Si enruta todo a Claude Sonnet 4.6 (3,00 $/M entrada) o Nova Premier (2,50 $/M entrada), paga tarifas de nivel superior en cada llamada.
Si enruta el 70 % a Claude Haiku 4.5 (1,00 $/M entrada), Nova Lite (0,06 $/M entrada) o incluso Nova Micro (0,035 $/M entrada) para las tareas más sencillas, y reserva Sonnet 4.6 o Nova Premier solo para el 30 % que lo necesita, puede reducir el gasto total en modelos entre un 60 y un 80 % en la parte enrutada sin cambiar la calidad de cara al usuario en las consultas que importan.
La implementación es un clasificador o una función de enrutador que se ejecuta antes de la llamada al modelo costoso. AWS también ofrece una función nativa llamada Intelligent Prompt Routing que hace esto por usted entre modelos de la misma familia (Claude Sonnet 4.6 y Haiku 4.5, Llama 3.3 70B y 3.1 8B, o Nova Pro y Nova Lite).
AWS publica que puede reducir los costes hasta en un 30 % sin comprometer la precisión. Si desea el patrón de enrutamiento pero no quiere construir el clasificador usted mismo, esta es la opción sin desarrollo.
La compensación es real. El enrutamiento añade una pequeña cantidad de latencia, un coste inicial mínimo para el clasificador y complejidad arquitectónica. Para aplicaciones de bajo volumen es excesivo. Para cualquier cosa con un tráfico significativo, es la mayor palanca que tiene.
Este es el patrón que Avahi ha utilizado con Groopview, nuestro caso de estudio principal a continuación.
Palancas de optimización, clasificadas por impacto.
| Palanca | Impacto típico | Esfuerzo de implementación | Riesgo |
|---|---|---|---|
|
Ajustar el tamaño del modelo (enrutamiento) |
Alto (a menudo un 30-50 % menos de gasto en modelos) | Medio (lógica de clasificador + enrutamiento, o uso de AWS Intelligent Prompt Routing) |
Bajo si prueba primero el modelo más barato con tráfico representativo |
|
Caché de prompts para contexto estático |
Alto para apps con mucho contexto (hasta 90 % dto. en entrada en caché) | Bajo (configuración, no arquitectura) |
Muy bajo |
|
Inferencia por lotes para trabajos offline |
Medio (50 % dto. sobre Bajo demanda en la parte por lotes) | Medio (arquitectura basada en colas) |
Muy bajo |
|
Cambiar tráfico sostenido a Rendimiento provisionado |
Medio para cargas de trabajo constantes | Medio (planificación de capacidad + compromiso) |
Medio (el exceso de reserva desperdicia dinero) |
|
Reducir la longitud de los tokens de salida (prompts, formato de respuesta) |
Medio (la salida es 3-5 veces más barata de recortar que la entrada) | Bajo (ingeniería de prompts) |
Bajo |
|
Caché de salidas aptas para Guardrails |
Bajo a medio | Bajo |
Muy bajo |
Calculadora de precios de AWS Bedrock: previsión de su factura
La oficial Calculadora de precios de AWS es compatible con Amazon Bedrock y es la herramienta adecuada para una primera previsión. Los campos que más importan:
- Modelo y región (las tarifas difieren entre regiones)
- Tokens de entrada diarios y tokens de salida diarios (su modelo y modo de precios más utilizados)
- Tamaño del almacén de vectores de Knowledge Bases y tasa de consultas
- Evaluaciones de Guardrails por día
- Volumen de generación de imágenes o vídeos, si corresponde
La advertencia honesta: la calculadora solo le muestra lo que AWS cobrará por los componentes que usted introduzca. No detecta los patrones que impulsan el gasto excesivo (modelos sobredimensionados, prompts sin caché, rendimiento sobreprovisionado, Guardrails ejecutándose en cada entrada y cada salida).
Para una previsión real sobre una carga de trabajo real, instrumente primero la aplicación, mida durante una o dos semanas en Bajo demanda y realice la previsión a partir del uso observado. La calculadora es un punto de partida, no la respuesta definitiva.
Cuándo NO usar Bedrock
Vale la pena decirlo directamente porque nadie más lo escribe.
Bedrock ES la respuesta correcta cuando:
- Desea acceso gestionado a múltiples modelos de vanguardia bajo una sola interfaz (Anthropic, Amazon Nova, Meta, Mistral, Cohere y otros sin gestionar relaciones con proveedores por separado).
- Necesita una integración nativa de AWS con el resto de su stack (S3, Lambda, ECS, IAM, VPC, CloudWatch).
- Le importan los controles de IAM, el aislamiento de VPC y el registro de auditoría de nivel AWS para el cumplimiento normativo.
- La economía unitaria tiene sentido a su escala una vez que aplica el enrutamiento, el almacenamiento en caché y el modo de precios adecuado.
Bedrock NO es la respuesta correcta cuando:
- Toda su carga de trabajo es un modelo específico con un volumen sostenido muy alto y puede ejecutarlo de forma más económica en otro lugar.
- Ejecuta modelos de la familia Llama con una carga sostenida pesada (el alojamiento directo en Amazon EC2 con Inferentia o una plataforma de inferencia dedicada a menudo supera la economía de Bedrock).
- Su caso de uso se ajusta a un modelo pequeño de código abierto y el autohospedaje en su propia infraestructura es significativamente más barato.
- Su aplicación solo utiliza los modelos de un proveedor y acudir directamente a la API de ese proveedor resulta más económico (a cambio de renunciar a la seguridad e integración nativas de AWS).
Bedrock optimiza la amplitud (muchos modelos, una interfaz), la gobernanza (controles de nivel AWS) y la facilidad de integración. Si eso le importa, Bedrock es la opción más sólida del mercado. Si no los necesita, haga los cálculos con las alternativas antes de comprometerse.
Resultado real: Cómo Groopview redujo el tiempo de respuesta del avatar de IA en un 80 % con el enrutamiento de modelo Dual-Nova
Groopview crea un avatar coanfitrión de IA que procesa texto e imágenes durante transmisiones en vivo en tiempo real. El producto es sensible a la latencia de una manera que la mayoría de la IA empresarial no lo es: una respuesta lenta rompe la experiencia de redes sociales que el avatar debe habilitar.

La arquitectura anterior enrutaba cada interacción a través de un único modelo capaz. El tiempo de respuesta era de unos 12 segundos. Para un producto de transmisión en vivo, eso era demasiado lento para sentirse en tiempo real, y el coste del modelo por interacción era más alto de lo que la economía unitaria podía soportar a escala.
En Avahi reconstruimos la arquitectura en Amazon Bedrock utilizando un marco de orquestación Dual-Nova, enrutando cada solicitud a través de un clasificador que decide si la consulta es simple o compleja:
- Las consultas simples (la mayor parte del tráfico) se enrutan a Amazon Nova Lite, el modelo más pequeño y económico.
- Las consultas complejas se enrutan a Amazon Nova Pro, el modelo más grande y de mayor calidad.
El stack: Amazon Bedrock (Nova Pro y Nova Lite), Amazon API Gateway, AWS Lambda, instancias de GPU Amazon EC2 g6e para el renderizado del avatar, Amazon S3, Amazon RDS y Amazon CloudWatch para la observabilidad.
El resultado:
- El tiempo de respuesta del avatar de IA bajó de 12 segundos a unos 2,5 segundos para consultas simples (una reducción de la latencia del 80 %).
- Las consultas complejas responden en unos 7 segundos.
- Mayor fidelización en las sesiones y nuevas fuentes de ingresos gracias a la mejora de la experiencia en tiempo real.
- El coste por interacción disminuyó porque la mayoría del tráfico ahora llega al modelo más barato.
Este es el patrón de enrutamiento de modelos hecho realidad. Mismo producto, mismos modelos disponibles, diferente elección arquitectónica sobre qué solicitud llega a qué modelo.
Leer el caso de estudio completo →
Dónde encaja la financiación de AWS
La parte que la mayoría de las guías de precios no pueden ofrecer.
Avahi es un socio de servicios de nivel AWS Premier Tier y, a través de nuestra asociación con AWS, la prueba de concepto que demuestre su caso de costes de Bedrock puede ser financiada. Las empresas elegibles pueden recibir una PoC financiada dependiendo del proyecto, para que pueda modelar el coste real en su carga de trabajo real antes de comprometerse con una construcción completa.
La estructura que funciona: elija la carga de trabajo que está evaluando, defina el objetivo de coste, construya una PoC acotada frente a su forma de tráfico real en Bedrock con la arquitectura de enrutamiento y almacenamiento en caché adecuada, mida la factura frente a la previsión y decida.
Comience con una PoC financiada →
Tome la decisión con Avahi
Bedrock es la plataforma de modelos gestionados más sólida del mercado para equipos que desean la amplitud de los modelos de vanguardia con controles nativos de AWS. La factura se convierte en un problema solo cuando los equipos usan por defecto el modelo más grande, dejan los prompts estáticos sin caché, sobreprovisionan el rendimiento y omiten la capa de enrutamiento que realiza el trabajo real de optimización de costes.
La forma de obtener una previsión de costes defendible no es una calculadora. Es una PoC acotada frente a su carga de trabajo real que demuestre que la estrategia de enrutamiento, almacenamiento en caché y provisionamiento funciona a su escala.
Comience con una PoC financiada en su carga de trabajo de mayor volumen. Las empresas elegibles pueden recibir una PoC financiada según su proyecto.
Preguntas frecuentes: Precios de AWS Bedrock
¿Cuánto cuesta empezar con Bedrock?
No hay un coste fijo para empezar con AWS Bedrock (o Amazon Bedrock; el servicio se nombra de ambas formas). Habilita el servicio en su cuenta de AWS, solicita acceso a los modelos fundacionales que desea utilizar y paga solo por lo que procesa: por cada 1.000 tokens de entrada y salida para modelos de texto, por imagen para generación de imágenes, por segundo para vídeo, más tarifas por hora para cualquier Rendimiento provisionado reservado. Un prototipo pequeño que utilice un modelo como Amazon Nova Lite o Claude 3.5 Haiku puede ejecutarse por unos pocos dólares al día. Una aplicación en producción puede oscilar entre cientos y muchos miles de dólares al mes según el volumen y la elección del modelo.
¿AWS Bedrock es gratuito?
Bedrock no es gratuito de la forma en que Amazon S3 o AWS Lambda tienen niveles gratuitos en los que puede confiar para cargas de trabajo en producción. AWS ofrece periódicamente créditos y asignaciones de prueba para modelos específicos, y los proveedores de modelos individuales ocasionalmente promueven períodos de evaluación. Para implementaciones en producción, asuma que Bedrock es de uso pago desde la primera llamada. La forma correcta de evaluar antes de comprometerse es una prueba de concepto delimitada, que puede ser parcial o totalmente financiada por AWS para empresas elegibles.
¿Bedrock es costoso?
Bedrock no es categóricamente caro. Se vuelve costoso de tres formas predecibles: usar por defecto el modelo más grande para cada solicitud cuando la mayoría no lo necesita, dejar prompts estáticos grandes sin almacenar en caché y reservar en exceso Rendimiento provisionado antes de que el tráfico sea estable. Los equipos que enrutan solicitudes simples a modelos pequeños, almacenan en caché contexto repetido y permanecen en Bajo demanda hasta que el tráfico sea predecible encuentran que los costes de Bedrock son razonables para lo que entregan. (Los hilos sobre precios de AWS Bedrock en Reddit consistentemente revelan los mismos tres modos de falla: modelos sobredimensionados, prompts sin almacenar en caché y rendimiento sobrerreservado). Las decisiones de arquitectura importan más que la tarifa publicada.
¿Para qué se utiliza AWS Bedrock?
AWS Bedrock es un servicio completamente administrado que le da acceso a modelos fundacionales de múltiples proveedores (Anthropic Claude, Amazon Nova, Meta Llama, Mistral, Stability AI, Cohere y otros) detrás de una API. Se utiliza para construir aplicaciones de IA generativa que incluyen chatbots, sistemas RAG, procesamiento de documentos, generación de imágenes y vídeo, agentes y moderación de contenido, sin el trabajo de administrar la infraestructura del modelo subyacente. Bedrock es la respuesta nativa de AWS a la pregunta de cómo usar modelos de frontera dentro de un entorno que cumple con los requisitos empresariales de IAM, VPC y auditoría.
¿Cuánto cuesta Claude en Bedrock?
Los precios de AWS Bedrock para Claude siguen el patrón estándar de Bedrock: se cobra por cada 1.000 tokens de entrada y salida, y la salida normalmente cuesta de 3 a 5 veces más que la entrada. Claude Sonnet 4.6 es la opción de mayor calidad y mayor coste en la alineación actual. Claude 3.5 Haiku es la opción más rápida y económica para la mayoría de las tareas. Las tarifas exactas varían según la región y cambian a medida que Anthropic lanza nuevas versiones, así que siempre verifique la tarifa actual en la página oficial de precios de AWS Bedrock antes de hacer pronósticos.
¿Qué son los precios de Rendimiento provisionado de AWS Bedrock?
El Rendimiento provisionado en Bedrock reserva capacidad dedicada en unidades de modelo, facturadas por hora por unidad independientemente de la utilización. Hay tres niveles de compromiso: sin compromiso (tarifa por hora más alta, se detiene en cualquier momento), compromiso de 1 mes (tarifa más baja) y compromiso de 6 meses (tarifa más baja). Cada modelo tiene su propia tarifa de unidad de modelo y sus propios ahorros por nivel de compromiso. El punto de equilibrio frente a Bajo demanda depende de la utilización sostenida; para cargas de trabajo de alto volumen predecibles generalmente gana, para tráfico intermitente o impredecible generalmente no.
Precios de AWS Bedrock Guardrails: ¿Cuánto cuesta?
Bedrock Guardrails se factura a 0,15 $ por cada 1.000 unidades de texto para evaluaciones de filtro de contenido en contenido de texto (más 0,00075 $ por imagen para contenido de imagen), según lo publicado en la página de precios de AWS Bedrock a junio de 2026. El precio es por evaluación, por lo que si ejecuta Guardrails tanto en la entrada como en la salida de cada llamada al modelo, paga por ambas evaluaciones. Para aplicaciones de bajo volumen esto es trivial. Para implementaciones en producción de alto volumen con ventanas de contenido grandes, Guardrails puede convertirse en una parte significativa de la factura total de Bedrock y vale la pena medirlo por separado.
¿Cómo funcionan los precios de LLM de AWS Bedrock?
Los precios de LLM de Bedrock tienen cuatro modos: Bajo demanda (por cada 1.000 tokens de entrada y salida, sin compromiso), Rendimiento provisionado (capacidad reservada por hora), Inferencia por lotes (procesamiento asíncrono a aproximadamente la mitad de la tarifa Bajo demanda) y Almacenamiento en caché de prompts (contexto de entrada almacenado en caché facturado a una fracción de las tarifas estándar, hasta un 90 % de descuento). La mayoría de las implementaciones en producción combinan tres de estos: Bajo demanda para tráfico en vivo, Por lotes para trabajo nocturno y Almacenamiento en caché de prompts en prefijos de prompts estáticos. El Rendimiento provisionado entra cuando el uso es grande, constante y predecible.
¿Puede Avahi ayudar a optimizar mi factura de AWS Bedrock?
Sí. Avahi es un AWS Premier Tier Services Partner que construye y optimiza arquitecturas de IA generativa en AWS, incluido enrutamiento de modelos, almacenamiento en caché de prompts, migración por lotes y Rendimiento provisionado dimensionado correctamente. A través de nuestra asociación con AWS, la prueba de concepto que demuestra el caso de coste puede ser financiada. Las empresas elegibles pueden recibir una PoC financiada según el proyecto, para que pueda modelar los ahorros reales en su carga de trabajo real antes de comprometerse con una reconstrucción.
