Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Importante
Traduções não ingleses são fornecidas apenas por conveniência. Por favor, consulte a EN-US versão deste documento para a versão definitiva.
Este artigo fornece informações sobre casos de uso para o reconhecimento ótico de caracteres (OCR).
O que é uma nota de transparência?
Um sistema de IA inclui não só a tecnologia, mas também as pessoas que a irão utilizar, as pessoas que serão afetadas por ela e o ambiente onde é implementada. Criar um sistema adequado ao seu propósito requer compreender como a tecnologia funciona, as suas capacidades e limitações, e como alcançar o melhor desempenho.
Microsoft fornece notas de transparência para o ajudar a compreender como funciona a nossa tecnologia de IA. Isto inclui as escolhas que os proprietários do sistema podem fazer que influenciam o desempenho e o comportamento do sistema, e a importância de pensar no sistema como um todo, incluindo a tecnologia, as pessoas e o ambiente. Pode usar notas de transparência ao desenvolver ou implementar o seu próprio sistema, ou partilhá-las com as pessoas que irão usar ou ser afetadas pelo seu sistema.
As notas de transparência fazem parte de um esforço mais amplo da Microsoft para pôr em prática os nossos princípios de IA. Para saber mais, consulte os princípios de IA Microsoft.
Introdução ao reconhecimento ótico de caracteres (OCR)
Hoje em dia, as empresas precisam frequentemente de converter texto a partir de imagens, documentos em papel digitalizados e ficheiros digitais em insights acionáveis. Estes insights impulsionam a mineração de conhecimento, a automação de processos de negócio e a acessibilidade de conteúdos para todos. O reconhecimento ótico de caracteres (OCR) é um serviço de IA utilizado para extrair texto de conteúdos visuais, como imagens e documentos. Atualmente, o OCR suporta várias linguagens para extração de texto impresso (ver linguagens suportadas por OCR). Atualmente, o OCR manuscrito é suportado exclusivamente para inglês.
Os fundamentos do OCR
A tecnologia OCR da Microsoft é oferecida através da Azure Vision na Foundry Tools Read API. Os clientes ligam à Read API com o seu conteúdo para obter o texto extraído, a sua localização e outras informações sobre a saída de texto legível por máquina. Processam a saída nas suas aplicações empresariais para implementar inteligência de conteúdos, automação de processos empresariais e outros cenários para os seus utilizadores.
| Termo | Definição |
|---|---|
| Assíncrono | Assíncrono significa que o serviço não devolve imediatamente o texto extraído. Em vez disso, o processo começa em segundo plano. A aplicação do cliente terá de voltar a verificar mais tarde para obter o texto extraído. |
| Leia | A operação de Leitura é uma chamada assíncrona que aceita imagens e documentos para iniciar a análise e extração de texto, que é devolvida através de outra chamada. |
| Obter Resultados de Leitura | Enquanto o processo de análise e extração está ativo, a operação Get Read Results apresenta o estado do progresso. Quando o processo está concluído, a operação Obter Resultados de Leitura gera o texto extraído (sob a forma de linhas e palavras de texto) e valores de confiança. |
| Valor de confiança | A operação Get Read Results devolve valores de confiança no intervalo entre 0 e 1 para todas as palavras extraídas. Este valor representa a estimativa do serviço de quantas vezes extrai corretamente a palavra de um total de 100. Por exemplo, uma palavra que se estima ser corretamente extraída 82% das vezes resultará num valor de confiança de 0,82. |
Exemplos de casos de uso
Os seguintes casos de uso são exemplos populares para a tecnologia OCR.
- Pesquisa e arquivo de imagens e documentos: Documentos não estruturados, como contratos legais, documentos técnicos e conteúdos noticiosos, contêm informação e metadados ricos que não estão disponíveis para processos como etiquetagem, categorização e pesquisa automatizadas. O OCR permite que o texto destes documentos seja legível por máquina para análise, pesquisa e recuperação.
- Moderação e localização de conteúdos de imagens: empresas de comércio eletrónico, editoras de conteúdos gerados por utilizadores e comunidades de jogos online e redes sociais precisam de moderar imagens para cumprir as normas de segurança online. Em certos casos, também precisam de localizar conteúdos para audiências internacionais. O OCR permite extrair texto de imagens para aplicar processamento a jusante.
- Automação de processos de negócio: A automação de processos empresariais requer a integração de dados e preferências introduzidos pelo utilizador em documentos e ecrãs de aplicações com processos empresariais complexos. O OCR desbloqueia o texto incorporado em documentos e imagens e torna-o disponível para utilização nas etapas dos fluxos de trabalho empresariais.
- Processamento de documentos financeiros e de saúde: Quando utilizado no processamento administrativo de formulários de candidatura financeira e de seguros, o OCR ajuda a poupar tempo e esforço no processamento de documentos. De forma semelhante, a aplicação do OCR nos reembolsos de pedidos médicos e nos formulários de informação médica acelera o processo de reembolso e a qualificação para serviços e benefícios.
Considerações na escolha de outros casos de uso
Considere os seguintes fatores ao escolher um caso de uso.
Considere cuidadosamente ao utilizar para atribuição ou negação de benefícios: Utilizar diretamente a saída do OCR para atribuir ou negar benefícios pode resultar em erros se baseados em informação incorreta ou incompleta. Por exemplo, ao preencher formulários médicos, os utilizadores podem cometer erros ou não incluir informações importantes. Além disso, o OCR pode potencialmente interpretar mal ou não detetar partes do formulário. Para garantir decisões justas e de alta qualidade para os consumidores, combine automação baseada em OCR com supervisão humana.
Evite o uso para identificação de assinaturas: Ao extrair texto manuscrito, evite usar os resultados do OCR nas assinaturas para identificar indivíduos. As assinaturas são difíceis de ler tanto para humanos como para máquinas. Uma forma melhor de usar o OCR é usá-lo para detetar a presença de uma assinatura para análises adicionais.
Não use OCR para decisões que possam ter impactos adversos graves: Exemplos desses casos incluem o processamento de prescrições médicas e a dispensa de medicação. Os modelos de aprendizagem automática que extraem texto de prescrições podem resultar em saída de texto indetetada ou incorreta. Decisões baseadas em resultados incorretos podem ter impactos adversos graves. Além disso, é aconselhável incluir a revisão humana das decisões que possam ter impactos graves nos indivíduos.
-
Considerações legais e regulatórias: As organizações precisam de avaliar potenciais obrigações legais e regulatórias específicas ao utilizar quaisquer Ferramentas e Soluções da Foundry, que podem não ser adequadas para uso em todos os setores ou cenários. Além disso, as ferramentas ou soluções da Foundry não foram concebidas para e não podem ser usadas de formas proibidas nos termos de serviço aplicáveis e nos códigos de conduta relevantes.