Qwen3 30B A3B Instruct 2507 FP8
Invoque Qwen3 30B A3B Instruct 2507 FP8, um modelo de linguagem de 30B parâmetros com contexto de 64k tokens, chamada de ferramentas e suporte a LoRA.
Qwen3 30B A3B Instruct 2507 FP8 é um modelo de linguagem grande ajustado por instruções com 30 bilhões de parâmetros, em precisão FP8. Ele lê texto e retorna texto, para chat e resposta a perguntas, sumarização, tarefas multilíngues, problemas de matemática e ciências, codificação e fluxos de trabalho que chamam ferramentas. AI Inference executa o modelo sob o id Qwen/Qwen3-30B-A3B-Instruct-2507-FP8.
Detalhes do modelo
O id é a string que uma requisição envia para selecionar este modelo, e Azion.AI.run o recebe como primeiro argumento. O repositório no HuggingFace publica o model card.
| Detalhe | Valor |
|---|---|
| Nome do modelo | Qwen3 30B A3B Instruct 2507 FP8 |
| Versão | 30B - FP8 |
| Categoria do modelo | Large Language Model (LLM) |
| Id do modelo | Qwen/Qwen3-30B-A3B-Instruct-2507-FP8 |
| Tamanho | 30B parâmetros |
| Modelo no HuggingFace | Qwen/Qwen3-30B-A3B-Instruct-2507-FP8 |
| Endpoint compatível com OpenAI | OpenAI Chat API |
| Licença | Apache 2.0 |
Capacidades
Os valores abaixo são propriedades do modelo, e o corpo de uma requisição não os define. Para os campos que o corpo de uma requisição carrega, com seus tipos, padrões e limites, consulte Invocação de modelos.
| Capacidade | Valor |
|---|---|
| Dados de entrada | Texto |
| Comprimento de contexto | 64k tokens |
| Chamada de ferramentas | Sim |
| Suporta LoRA | Sim |
A janela de contexto nativa do modelo no projeto de origem é maior, e 64k tokens é o comprimento de contexto que AI Inference serve.
Uso
Os exemplos abaixo invocam o modelo a partir de uma função com Azion.AI.run. O binding recebe o id do modelo como primeiro argumento e o corpo da requisição como segundo, então o corpo nunca repete o id. Para enviar o mesmo corpo ao endpoint HTTP compatível com OpenAI, consulte Invocação de modelos.
Chat completion
Esta requisição carrega uma mensagem de sistema, que define o papel em que o modelo responde, e uma mensagem de usuário, que contém o prompt:
A chamada resolve para um único objeto de resposta, e o texto gerado fica em modelResponse?.choices?.[0]?.message?.content, o conteúdo da primeira entrada em choices.
Chamada de ferramentas
A mesma chamada se torna uma requisição com chamada de ferramentas quando o corpo carrega um array tools. Cada entrada define type como function e contém um objeto function que nomeia uma função que o modelo pode chamar, o que ela faz e os parameters que ela recebe em formato JSON Schema:
Quando o modelo seleciona uma ferramenta, a mensagem do assistente carrega um array tool_calls em vez de texto, e cada entrada nomeia a função e os argumentos que o modelo gerou para ela.