Qwen2.5 VL AWQ 7B
Invoque Qwen2.5 VL AWQ 7B, um modelo de visão e linguagem com 7 bilhões de parâmetros, e envie texto e imagem na mesma requisição.
Qwen2.5 VL AWQ 7B é um modelo de visão e linguagem com 7 bilhões de parâmetros, construído para análise visual, raciocínio agêntico, compreensão de vídeos longos, localização visual e geração de saída estruturada. O modelo aceita texto e imagens na mesma requisição, retorna texto e recebe definições de ferramentas. AI Inference executa o modelo sob o id qwen-qwen25-vl-7b-instruct-awq.
Detalhes do modelo
Estes valores identificam o modelo. Uma requisição nomeia o id do modelo para alcançá-lo, e o repositório no HuggingFace contém o model card.
| Detalhe | Valor |
|---|---|
| Nome do modelo | Qwen2.5 VL |
| Versão | AWQ 7B |
| Categoria do modelo | Vision-Language Model (VLM) |
| Id do modelo | qwen-qwen25-vl-7b-instruct-awq |
| Tamanho | 7B parâmetros |
| Modelo no HuggingFace | Qwen/Qwen2.5-VL-7B-Instruct-AWQ |
| Endpoint compatível com OpenAI | OpenAI Chat API |
| Licença | Apache 2.0 |
Capacidades
Qwen2.5 VL AWQ 7B declara estas capacidades para si, e nenhuma delas é um campo da requisição. Para ler os campos que uma requisição de chat carrega, com seus tipos, padrões e limites, consulte Invocação de modelos.
| Capacidade | Valor |
|---|---|
| Dados de entrada | Texto e imagem |
| Comprimento de contexto | 32k tokens |
| Chamada de ferramentas | Sim |
| Suporta LoRA | Sim |
Uso
Todos os exemplos desta página chamam Azion.AI.run de dentro de uma função. O binding recebe o id do modelo como primeiro argumento e um corpo de requisição compatível com OpenAI como segundo, então o corpo nunca repete o id. Para enviar o mesmo corpo ao endpoint HTTP compatível com OpenAI, consulte Invocação de modelos.
Chat completion
Uma requisição de chat carrega a conversa como um array messages, com uma mensagem de sistema que define o comportamento e uma mensagem de usuário que faz a pergunta:
Com stream definido como false, a chamada resolve para uma resposta completa, e modelResponse?.choices?.[0]?.message?.content contém o texto gerado.
Chamada de ferramentas
Uma requisição com chamada de ferramentas mantém as mesmas mensagens e adiciona um array tools. Cada entrada declara type como function, nomeia a função, descreve o que ela faz e define seus parameters como um objeto JSON Schema:
Uma função lê a resposta do modelo na primeira entrada de choices e age sobre ela, o que nesta requisição significa chamar get_weather.
Entrada multimodal
Uma requisição multimodal coloca texto e imagem em uma única mensagem de usuário: o campo content recebe um array de partes em vez de uma string, e cada parte declara seu type. Para os campos que cada parte carrega, consulte Invocação de modelos. Esta requisição envia uma pergunta e a URL de uma imagem juntas:
O modelo lê a imagem a partir da URL que a requisição fornece e responde em texto em modelResponse?.choices?.[0]?.message?.content.