//AI Inference

Inferencia de AI global sobre infraestructura administrada

Construye y despliega aplicaciones inteligentes que ejecutan modelos de AI cerca de tus usuarios, a cualquier escala.

Documentación

Confiabilidad integrada

La arquitectura distribuida con failover automático mantiene tu AI funcionando.

API compatible con OpenAI

Conserva tu código y tus SDKs actuales: solo cambia el endpoint.

Paga por uso

Pagas solo cuando tus modelos están ejecutando inferencia.

Despliega desde tu entorno local

Compila, depura y despliega workloads de AI de la forma en que ya programas, pero con la escala de una infraestructura distribuida.

Baja latencia Despliegue instantáneo Configuración cero Pago por solicitud

Más información

Interfaz de fine-tuning con LoRA para personalizar modelos de AI según el dominio.

Ajusta modelos con LoRA

Adapta las salidas del modelo a tu dominio usando Low-Rank Adaptation (LoRA), mejorando la precisión en tareas especializadas mientras reduces los costos de cómputo, sin necesidad de reentrenar el modelo completo.
Más información

Interfaz de fine-tuning con LoRA para personalizar modelos de AI según el dominio.

Explora nuestros modelos destacados

Del hello world a workloads de AI en producción

Construye aplicaciones de AI con el mismo flujo de trabajo que usas para las apps web modernas. AI Inference se conecta con SQL Database, Object Storage y Functions para que los equipos puedan ejecutar modelos, recuperar contexto, almacenar assets y ejecutar lógica distribuida en una sola plataforma.
Documentación

Qué puedes construir con AI Inference

Automatización

AI agents para workflows automatizados

Crea agentes que planifican, llaman herramientas y completan tareas con respuestas conscientes del contexto.

Apps de AI

Aplicaciones con AI (RAG + búsqueda)

Crea RAG, búsqueda semántica y experiencias personalizadas usando búsqueda vectorial de SQL Database.

Media

Generación de imágenes y AI visual

Genera, analiza y transforma imágenes con modelos de AI multimodal.

Audio

Transcripción de voz a texto y procesamiento de audio

Transcribe, resume y procesa audio con inferencia de AI de baja latencia.

Soporte

Copilot de soporte al cliente

Responde preguntas de clientes usando tu base de conocimiento y AI Inference escalable.

Seguridad

Detección y eliminación automatizada de amenazas

Clasifica amenazas, detecta abuso y automatiza acciones de seguridad con modelos de AI.

DNZ
Axur
Radware
Arezzo
Contabilizei
Magazine Luiza
Fourbank
América Móvil
Crefisa
Netshoes
Dafiti
Global Fashion Group
AXUR

"Con Azion, escalamos nuestros modelos de AI propietarios sin preocuparnos por la infraestructura. Inspeccionamos millones de sitios web por día y realizamos el takedown más rápido del mercado."

Fabio Ramos

CEO at Axur

//Completo, no complejo

Primitivas que escalan contigo

Preguntas frecuentes

¿Qué es Azion AI Inference?

Azion AI Inference es una plataforma serverless para desplegar y ejecutar modelos de AI en una arquitectura distribuida. Ofrece una API compatible con OpenAI para una migración sencilla, soporta LLMs, VLMs, embeddings y modelos de reranking, y ofrece fine-tuning con LoRA para personalización de dominio. Escala automáticamente sin gestión de GPU, manteniendo respuestas de baja latencia a nivel global.

¿Qué modelos puedo ejecutar?

Elige entre un catálogo de modelos de código abierto para generación de texto y código, tareas de vision-language, embeddings y reranking. El catálogo evoluciona a medida que hay nuevos modelos disponibles, y puedes hacer fine-tuning de los modelos compatibles con LoRA para tu dominio específico.

¿Es compatible con la API de OpenAI?

Sí. AI Inference usa un formato de API compatible con OpenAI, por lo que puedes migrar aplicaciones existentes actualizando la URL base y las credenciales. Mantén tus SDKs y patrones de integración actuales: no se requiere reescribir código.

¿Puedo hacer fine-tuning de modelos?

Sí. AI Inference soporta fine-tuning con LoRA (Low-Rank Adaptation), lo que te permite especializar modelos para tu dominio sin necesidad de un reentrenamiento completo. Esto reduce los costos de cómputo mientras mejora la precisión en tareas específicas como soporte al cliente, generación de código o preguntas y respuestas de dominio específico.

¿Cómo construyo RAG y búsqueda semántica?

Usa AI Inference junto con SQL Database Vector Search para almacenar embeddings y recuperar el contexto relevante en aplicaciones de RAG. Esta búsqueda vectorial integrada significa que no necesitas gestionar una base de datos vectorial aparte: SQL y vectores en un solo servicio.

¿Puedo construir AI agents y workflows con tool-calling?

Sí. AI Inference impulsa patrones de agentes como ReAct y workflows con tool-calling cuando se combina con Applications, Functions y APIs externas. Azion ofrece plantillas y guías para arquitecturas de agentes basadas en LangChain y LangGraph.

¿Cómo migro desde Cloudflare Workers AI?

La migración es sencilla gracias a las APIs compatibles con OpenAI en ambas plataformas. Actualiza tu URL base para apuntar a los endpoints de Azion AI Inference, migra los adaptadores LoRA que tengas y realiza la integración con Azion Functions. Si usas Cloudflare Vectorize, migra a Azion SQL Database Vector Search para almacenamiento vectorial integrado.

¿Cómo se compara el precio con otras plataformas?

AI Inference usa un precio simple por solicitud, sin unidades abstractas como "neuronas". Pagas por las solicitudes de inferencia según el modelo y el uso de tokens, sin costos por inactividad ni compromisos de capacidad. Esta transparencia hace que la previsión de costos sea predecible en comparación con modelos de facturación basados en neuronas.

¿Cómo despliego AI Inference en mi aplicación?

Crea un endpoint de AI Inference y luego intégralo en tu flujo de solicitudes usando Applications y Functions. Esto añade capacidades de AI a APIs existentes y experiencias de usuario con ejecución distribuida, escalado gestionado y failover automático.

//Build

Crea una vez.
Ejecuta en todas partes.

Consigue una ruta más rápida al lanzamiento, menor latencia y menos sobrecarga de infraestructura.