Lista de processadores

Esta página contém informações detalhadas sobre todos os processadores oferecidos pela Document AI. Confira uma lista de todos os processadores por tipo de solução.

Todos os processadores da Document AI obedecem aos Termos de Segurança e Tratamento de Dados.

Consulte a documentação Como gerenciar versões do processador para mais detalhes. Além disso, limites específicos de processador se aplicam às cotas e limites gerais do produto.

Digitalizar texto

Enterprise Document OCR (reconhecimento óptico de caracteres)

Descrição

Identificar e extrair texto em diferentes tipos de documentos.

Esse processador permite identificar e extrair texto, incluindo texto manuscrito, de documentos em mais de 200 idiomas. O processador também usa o aprendizado de máquina para fazer uma avaliação da qualidade de um documento com base na legibilidade do conteúdo.

Categoria Digitalizar
Funções OCR, análise de qualidade
Etapa de lançamento Disponibilidade geral
Status do acesso Pública
Digitar na API OCR_PROCESSOR
Idiomas aceitos
Lista completa de idiomas
Nome do idioma Tag BCP 47 Script Suporte para escrita à mão
Africâner af Latn
Albanês sq Latn
Árabe ar Arab
Armênio hy Armn
Bielorrusso be Cyrl
Bengali bn Beng
Bengalês bn Beng
Búlgaro bg Cyrl
Catalão ca Latn
Chinês zh Hani
Croata hr Latn
Tcheco cs Latn
Dinamarquês da Latn
Holandês nl Latn
Inglês en Latn
Estoniano et Latn
Filipino fil Latn
Finlandês fi Latn
Francês fr Latn
Alemão de Latn
Grego el Grek
Gujarati gu Gujr
Hebraico iw Hebr
Hindi hi Deva
Húngaro hu Latn
Islandês is Latn
Indonésio id Latn
Italiano it Latn
Japonês ja Jpan
Canarês kn Knda
Khmer km Khmr
Coreano ko Kore
Laosiano lo Laoo
Letão lv Latn
Lituano lt Latn
Macedônio mk Cyrl
Malaio ms Latn
Malaiala ml Mlym
Marati mr Deva
Nepalês ne Deva
Norueguês no Latn
Persa fa Arab
Polonês pl Latn
Português (Portugal e Brasil) pt Latn
Punjabi pa Guru
Romeno ro Latn
Russo ru Cyrl
Sérvio sr Cyrl
Eslovaco sk Latn
Esloveno sl Latn
Espanhol es Latn
Sueco sv Latn
Tagalo tl Latn
Tâmil ta Taml
Télugo te Telu
Tailandês th Thai
Turco tr Latn
Ucraniano uk Cyrl
Vietnamita vi Latn
Ídiche yi Hebr
Versões do processador
ID da versão Canal de lançamento Maturidade da versão Descrição
pretrained-ocr-v1.2-2022-11-10 Estável GA Versão congelada do modelo v1.0: arquivos, configurações e binários de um snapshot de versão congelados em uma imagem de contêiner por até 18 meses.
pretrained-ocr-v2.0-2023-06-02 Estável GA Modelo pronto para Production especializado em casos de uso de documentos. Inclui acesso a todos os complementos OCR.
pretrained-ocr-v2.1-2024-08-07 Estável GA As principais áreas de melhoria da v2.1 são: melhor reconhecimento de texto impresso, detecção mais precisa de caixas de seleção e ordem de leitura mais precisa.
pretrained-ocr-v2.1.1-2025-01-31 Versão candidata a lançamento Prévia pública A v2.1.1 é semelhante à v2.1 e está disponível em todas as regiões, exceto: US, EU e asia-southeast1.

Para mais informações, consulte Como gerenciar versões de processadores.

Cotas e limites
Máximo de páginas (solicitações on-line/síncronas): 15
Máximo de páginas (solicitações em lote/off-line/assíncronas): 500
Máximo de páginas (modo sem imagens on-line/solicitações síncronas): 30
Uptraining (em inglês)
Exemplo de arquivo de entrada Abrir em uma nova janela.
Exemplo de saída Abrir em uma nova janela.
Regiões com suporte
  • asia-south1
  • asia-southeast1
  • australia-southeast1
  • eu
  • europe-west2
  • europe-west3
  • northamerica-northeast1
  • us
Mais informações OCR de documentos corporativos

Extrair entidades dos documentos

Consulte Conjuntos de dados de amostra para ver exemplos rotulados e não rotulados que podem ser usados no treinamento.

Extrator personalizado

Descrição

Extraia campos de documentos usando IA generativa ou modelos personalizados e ajuste os modelos para extrair dados com precisão dos seus documentos.

Categoria Extrair
Funções OCR, extração de entidades
Etapa de lançamento Disponibilidade geral
Status do acesso Pública
Digitar na API CUSTOM_EXTRACTION_PROCESSOR
Observações
  • Se você usar a IA generativa para extração:

    • No momento, apenas o idioma inglês é aceito.
    • A disponibilidade por região está em US, EU, northamerica-northeast1 e asia-southeast1.

Idiomas aceitos
Lista completa de idiomas
Nome do idioma Tag BCP 47 Script Suporte para escrita à mão
Africâner af Latn
Árabe ar Arab
Azerbaijano az Latn
Azerbaijano (cirílico) az-Cyrl Cyrl
Bielorrusso be Cyrl
Búlgaro bg Cyrl
Bósnio bs Latn
Catalão ca Latn
Cebuano ceb Latn
Tcheco cs Latn
Galês cy Latn
Dinamarquês da Latn
Alemão de Latn
Grego el Grek
Inglês en Latn
Esperanto eo Latn
Espanhol es Latn
Estoniano et Latn
Basco eu Latn
Persa fa Arab
Finlandês fi Latn
Filipino fil Latn
Francês fr Latn
Irlandês ga Latn
Galego gl Latn
Hindi hi Deva
Croata hr Latn
Crioulo haitiano ht Latn
Húngaro hu Latn
Indonésio id Latn
Islandês is Latn
Italiano it Latn
Hebraico iw Hebr
Japonês ja Jpan
Javanês jv Latn
Cazaque kk Cyrl
Coreano ko Kore
Quirguiz ky Cyrl
Latim la Latn
Lituano lt Latn
Letão lv Latn
Macedônio mk Cyrl
Mongol mn