Glossário
Consulte o significado de cada termo usado na documentação de AI Inference, de Azion.AI.run e Azion Cells a Compute Time e Workload Domain.
Os termos abaixo são o vocabulário da documentação de AI Inference, e cada definição traz o link da página que apresenta o termo.
| Termo | Definição |
|---|---|
| AI Inference | O produto que executa modelos de inteligência artificial na infraestrutura distribuída global da Azion em resposta a uma requisição. AI Inference chama cada modelo por meio de Azion.AI.run, de dentro de uma função, portanto você não provisiona infraestrutura para executar um modelo. |
| AI Inference Starter Kit | O template que implanta uma aplicação com uma API compatível com OpenAI na frente de AI Inference. AI Inference Starter Kit cria a aplicação, a função que chama o modelo e o Workload Domain que a serve. |
| Azion Cells | A funcionalidade de Orchestrator pela qual AI Inference executa um modelo. Uma chamada a Azion.AI.run alcança o modelo por meio da Azion Cells API. |
| Azion Runtime | O ambiente de execução do JavaScript de uma função, construído sobre padrões Web. Os modelos de AI Inference são executados em Azion Runtime, assim como a função que os chama. |
Azion.AI.run | O binding de runtime que uma função chama para executar um modelo. Ele recebe o id do modelo e um corpo no formato de requisição da OpenAI e retorna uma resposta lida em choices[0].message.content. Invocação de modelos documenta cada campo do corpo. |
| Compute Time | O medidor de uso da execução de um modelo, expresso em GB-hora. Para AI Inference e LoRA Fine-Tune, é o tempo de execução ativa em horas multiplicado pela memória alocada em gigabytes. A página de preços informa a tarifa. |
| id do modelo | A string que identifica um modelo para Azion.AI.run, passada como o primeiro argumento dele. Duas convenções estão em uso: o caminho do repositório no HuggingFace, como Qwen/Qwen3-Embedding-4B, e uma forma em minúsculas sem barra, como gpt-oss-20b. Cada página de modelo indica o id a usar para aquele modelo. |
| LoRA Fine-Tune | O add-on que estende AI Inference com o fine-tuning de modelos suportados por meio de Low-Rank Adaptation. LoRA Fine-Tune é executado na infraestrutura da Azion, e as páginas dos modelos indicam quais modelos o suportam. |
| OpenAI-compatible API | O formato de requisição e de resposta que AI Inference aceita, equivalente ao formato de chat completions da OpenAI. O endpoint que serve esse formato pertence à aplicação que você mesmo implanta, no Workload Domain dela, e AI Inference não publica um endpoint próprio. Invocação de modelos traz o corpo da requisição e a resposta. |
| Workload Domain | O domínio que a Azion gera para uma aplicação, no formato xxxxxxxxxx.map.azionedge.net. Uma aplicação implantada a partir de AI Inference Starter Kit serve o próprio endpoint compatível com OpenAI nesse domínio. Você pode adicionar um domínio personalizado no lugar. |