InternVL3
Invoque InternVL3, um vision language model de 1B parâmetros com 16k tokens de contexto, e envie texto e imagens na mesma requisição.
InternVL3 é um vision language model com 1 bilhão de parâmetros, construído para tarefas que incluem agentes GUI, análise de imagem industrial e percepção de visão 3D. Ele lê texto e imagens e retorna texto. AI Inference executa o modelo sob o id opengvlab-internvl3-1b-instruct.
Detalhes do modelo
O id do modelo é a string que seleciona este modelo, e é o primeiro argumento que Azion.AI.run recebe. O repositório no HuggingFace contém o model card.
| Detalhe | Valor |
|---|---|
| Nome do modelo | InternVL3 |
| Versão | Instruct 1B |
| Categoria do modelo | Vision-Language Model (VLM) |
| Id do modelo | opengvlab-internvl3-1b-instruct |
| Tamanho | 1B parâmetros |
| Modelo no HuggingFace | OpenGVLab/InternVL3-1B-Instruct |
| Endpoint compatível com OpenAI | OpenAI Chat API |
| Licença | Apache 2.0 |
Capacidades
Estes valores pertencem ao modelo e não fazem parte do corpo da requisição. Para os campos que toda requisição de chat aceita, com seus tipos, padrões e limites, consulte Invocação de modelos.
| Capacidade | Valor |
|---|---|
| Dados de entrada | Texto e imagem |
| Comprimento de contexto | 16k tokens |
| Chamada de ferramentas | Não |
| Suporta LoRA | Não |
Uso
Uma função invoca o modelo com Azion.AI.run, passando o id como primeiro argumento e um corpo de requisição compatível com OpenAI como segundo. Os exemplos abaixo usam esse binding. Para enviar o mesmo corpo ao endpoint HTTP compatível com OpenAI, consulte Invocação de modelos.
Chat completion
Uma requisição de texto carrega uma mensagem de sistema e uma mensagem de usuário, cada uma com o seu conteúdo em uma string:
O modelo responde com uma entrada em choices, e o texto gerado fica em choices[0].message.content.
Entrada multimodal
Uma imagem vai no mesmo array messages que o texto. A mensagem do usuário recebe o seu content como um array de partes em vez de uma string, e cada parte indica o seu type e carrega o campo que esse tipo usa:
O modelo lê a imagem naquela URL e responde sobre ela em choices[0].message.content. Para uma descrição campo a campo das partes que um array content aceita, consulte Invocação de modelos.