Nanonets-OCR-s
Invoque Nanonets-OCR-s, um modelo de OCR que lê a imagem de um documento e retorna o texto como Markdown estruturado, com 32k tokens de contexto.
Nanonets-OCR-s é um modelo de reconhecimento óptico de caracteres (OCR) que converte a imagem de um documento em Markdown estruturado. A saída preserva o layout da origem, incluindo títulos, listas, tabelas e tags básicas, para que outro modelo consiga interpretá-la. AI Inference executa o modelo sob o id nanonets/Nanonets-OCR-s.
Detalhes do modelo
O id do modelo seleciona este modelo em uma requisição, e Azion.AI.run o recebe como primeiro argumento.
| Detalhe | Valor |
|---|---|
| Nome do modelo | Nanonets-OCR-s |
| Id do modelo | nanonets/Nanonets-OCR-s |
Capacidades
Os valores abaixo descrevem o modelo em si, e nenhum deles é um campo do corpo da requisição. Para saber quais campos um corpo de requisição aceita, com seus tipos, padrões e limites, consulte Invocação de modelos.
| Capacidade | Valor |
|---|---|
| Dados de entrada | Texto e imagem |
| Comprimento de contexto | 32k tokens |
Uso
Azion.AI.run executa o modelo de dentro de uma função: o id vai no primeiro argumento e um corpo de requisição compatível com OpenAI vai no segundo. O exemplo desta página chama o binding dessa forma. Para enviar o mesmo corpo por HTTP, consulte Invocação de modelos.
OCR
Uma requisição de OCR carrega a imagem do documento e a instrução que diz ao modelo como transcrevê-la. As duas viajam em uma única mensagem de usuário, como um array content cujas partes indicam cada uma o seu type. Para os campos que cada parte carrega, consulte Objetos de mensagem. Esta requisição lê um PNG codificado em base64 e limita a resposta a 500 tokens:
O modelo retorna uma entrada em choices, e o texto transcrito fica em choices[0].message.content: