Qwen2.5 VL AWQ 3B
Invoque Qwen2.5 VL AWQ 3B, um vision-language model de 3B parâmetros com 32k tokens de contexto, e envie texto e imagens na mesma requisição.
Qwen2.5 VL AWQ 3B é um vision-language model com 3 bilhões de parâmetros. Ele lê texto e imagens, retorna texto e realiza análise visual, raciocínio de agente, compreensão de vídeo longo, localização visual e geração de saída estruturada. AI Inference executa o modelo sob o id qwen-qwen25-vl-3b-instruct-awq.
Detalhes do modelo
O id é o que uma requisição envia para alcançar este modelo, e Azion.AI.run o recebe como primeiro argumento. O repositório no HuggingFace contém o model card.
| Detalhe | Valor |
|---|---|
| Nome do modelo | Qwen2.5 VL |
| Versão | AWQ 3B |
| Categoria do modelo | Vision-Language Model (VLM) |
| Id do modelo | qwen-qwen25-vl-3b-instruct-awq |
| Tamanho | 3B parâmetros |
| Modelo no HuggingFace | Qwen/Qwen2.5-VL-3B-Instruct-AWQ |
| Endpoint compatível com OpenAI | OpenAI Chat API |
| Licença | Apache 2.0 |
Capacidades
Estas capacidades são propriedades do modelo, e o corpo da requisição não as define. Para os campos que uma requisição de chat aceita, com seus tipos, padrões e limites, consulte Invocação de modelos.
| Capacidade | Valor |
|---|---|
| Dados de entrada | Texto e imagem |
| Comprimento de contexto | 32k tokens |
| Chamada de ferramentas | Sim |
| Suporta LoRA | Sim |
Uso
Você chama este modelo a partir de uma função, por meio do binding Azion.AI.run. O primeiro argumento é o id do modelo, e o segundo é um corpo de requisição compatível com OpenAI. Cada exemplo desta página usa esse binding. Para a forma HTTP da mesma requisição, consulte Invocação de modelos.
Chat completion
Esta requisição carrega uma mensagem de sistema que define o comportamento do modelo e uma mensagem de usuário que contém o prompt:
Uma entrada chega em choices, e o texto que o modelo gerou fica em choices[0].message.content:
Chamada de ferramentas
Um array tools declara as funções que o modelo pode chamar. Cada entrada define type como function e carrega um objeto function com três campos: o name que o modelo retorna, uma description do que a função faz e os parameters que ela aceita, escritos como um objeto JSON Schema:
Uma resposta que seleciona uma ferramenta carrega null em content, uma entrada em tool_calls com o nome da função e os argumentos que o modelo escolheu, e tool_calls em finish_reason:
Entrada multimodal
Uma mensagem de usuário que carrega uma imagem define content como um array de partes em vez de uma string. Cada parte indica o seu type: uma parte text contém o prompt, e uma parte image_url contém a URL de onde o modelo lê a imagem. Para as partes de conteúdo que uma mensagem aceita, consulte Objetos de mensagem.
Esta requisição envia uma parte de texto e uma parte de imagem dentro da mesma mensagem de usuário:
O modelo retorna o mesmo objeto de resposta de um chat completion, e o que ele leu na imagem fica em choices[0].message.content.