Modelos de AI
Compare os modelos que AI Inference executa por categoria, comprimento do contexto e tipo de entrada, e copie o id que cada um recebe na invocação.
AI Inference executa os modelos desta página. Você seleciona um modelo pelo id, uma string à qual o modelo responde, e não pelo nome sob o qual ele aparece listado. Cada linha do catálogo carrega esse id ao lado das capacidades que a página do modelo declara para si. Para conhecer o corpo da requisição em que o id viaja, consulte Invocação de modelos.
Catálogo de modelos
Cada linha é um modelo, e o nome do modelo leva à página do modelo, que traz um exemplo de requisição. A coluna Categoria indica LLM para um large language model, VLM para um vision language model, Embedding ou Reranker. Um traço significa que a página do modelo não declara valor para aquela capacidade.
| Modelo | Categoria | Entrada | Comprimento de contexto | Tamanho | Chamada de ferramentas | LoRA | Id do modelo |
|---|---|---|---|---|---|---|---|
| Mistral 3 Small (24B AWQ) | LLM | Texto | 32k tokens | 24B parâmetros | Sim | Não | casperhansen-mistral-small-24b-instruct-2501-awq |
| BAAI/bge-reranker-v2-m3 | Reranker | Texto | 8k tokens | 568M parâmetros | — | Não | baai-bge-reranker-v2-m3 |
| InternVL3 | VLM | Texto e imagem | 16k tokens | 1B parâmetros | Não | Não | opengvlab-internvl3-1b-instruct |
| Qwen2.5 VL AWQ 3B | VLM | Texto e imagem | 32k tokens | 3B parâmetros | Sim | Sim | qwen-qwen25-vl-3b-instruct-awq |
| Qwen2.5 VL AWQ 7B | VLM | Texto e imagem | 32k tokens | 7B parâmetros | Sim | Sim | qwen-qwen25-vl-7b-instruct-awq |
| Qwen3 30B A3B Instruct 2507 FP8 | LLM | Texto | 64k tokens | 30B parâmetros | Sim | Sim | Qwen/Qwen3-30B-A3B-Instruct-2507-FP8 |
| Qwen3 Embedding 4B | Embedding | Texto | 32k tokens | 4B parâmetros | — | — | Qwen/Qwen3-Embedding-4B |
| Nanonets-OCR-s | — | Texto e imagem | 32k tokens | — | — | — | nanonets/Nanonets-OCR-s |
| GPT-OSS 20B | LLM | Texto | 131k tokens | 20B parâmetros | Sim | Não | gpt-oss-20b |
Ids de modelo
Um id de modelo é a string que seleciona o modelo: o primeiro argumento de Azion.AI.run dentro de uma função e o campo model do corpo de uma requisição HTTP. Os ids não compartilham uma forma única. Alguns são minúsculos e separados por hífen, sem barra, e outros carregam um prefixo de publicador e capitalização mista. Copie um id da tabela caractere por caractere, em vez de derivá-lo do nome do modelo.