Falando sobre o software de reconhecimento de texto OCR
Somos uma grande empresa de impressão em Shenzhen, China. Oferecemos todas as publicações de livros, impressão de livros em capa dura, impressão de livros em papercover, capa dura, impressão de livros sprial, impressão de livros, impressão de folhetos, caixa de embalagem, calendários, todos os tipos de PVC, brochuras de produtos, notas, livros infantis, tipos de produtos especiais de impressão em cores de papel, cartão de jogo e assim por diante.
Para mais informações por favor visite
http://www.joyful-printing.com. Apenas ENG
http://www.joyful-printing.net
http://www.joyful-printing.org
email: info@joyful-printing.net
A tarefa do software de reconhecimento de caracteres chinês é estudar como tornar um computador "alfabetizado". O sistema geralmente usa um dispositivo de conversão fotoelétrico para converter um caractere chinês ou uma caixa de palavra em um sinal elétrico e o envia para um computador, que é automaticamente reconhecido e lido por um computador, por isso é chamado de ótico. Reconhecimento óptico de caracteres (OCR).
Perfil de desenvolvimento de OCR
O conceito de OCR foi proposto pela primeira vez pelo cientista alemão Tausheck em 1929. Mais tarde, o cientista americano Handel também propôs a ideia de usar a tecnologia para identificar palavras. A primeira pesquisa sobre o reconhecimento de caracteres chineses impressos foi Casey e Nagy, da IBM. Em 1966, eles publicaram o primeiro artigo sobre reconhecimento de caracteres chineses, que usava a correspondência de modelos para identificar 1000 caracteres chineses impressos. No início dos anos 1970, estudiosos japoneses começaram a estudar o reconhecimento de caracteres chineses e fizeram muito trabalho. A pesquisa sobre o reconhecimento de caracteres chineses na China começou relativamente tarde, e o trabalho de pesquisa de OCR começou no final dos anos 70. O software OCR inicial falhou em atender aos requisitos reais devido a vários fatores, como taxa de reconhecimento e produção. Ao mesmo tempo, devido ao alto custo do equipamento de hardware e velocidade de operação lenta, não atingiu um nível prático. Apenas alguns departamentos, como departamentos de informações, unidades de impressão e publicação, usam o software OCR. Depois de 1986, a pesquisa de OCR da China fez grandes progressos, e inovou na modelagem de caracteres chineses e nos métodos de reconhecimento. Alcançou resultados frutuosos em aplicações de desenvolvimento e desenvolvimento de sistemas. Muitas unidades lançaram sucessivamente produtos chineses de OCR. Após a década de 1990, com a ampla aplicação dos scanners de plataforma e a popularização da automação de informações e automação de escritórios na China, o desenvolvimento da tecnologia OCR foi amplamente promovido, e a taxa de reconhecimento de OCR foi reconhecida e a velocidade de reconhecimento foi satisfeita os usuários. Afirmação.
Atualmente, existem muitos softwares OCR populares. O OCR em inglês inclui principalmente OmniPage, OCR chinês, principalmente Tsinghua Unisplendour OCR, OCT Tsinghua Wentong, OCR Hanwang, OCR Zhongjing Shangshu, OCR Danqing e OCR Mengyu. Apesar da grande quantidade de caracteres chineses e fontes complexas, a tecnologia OCR amadureceu. Muitos softwares de OCR podem não apenas reconhecer caracteres chineses impressos em preto e branco, mas também reconhecer caracteres chineses em escala de cinza e em cores. A velocidade de reconhecimento é rápida e a taxa de precisão de reconhecimento é superior a 99%. Ele pode reconhecer várias fontes, como Song, Bold e Scorpion. Tradicional; pode reconhecer uma variedade de fontes, mistura de tamanho de fonte diferente; alguns softwares de OCR também podem identificar imagens, tabelas. Ao mesmo tempo, grandes progressos foram feitos no estudo do reconhecimento de caracteres chineses manuscritos, e a taxa de reconhecimento correta alcançou mais de 70%.
Aplicação de software OCR
No mercado de scanners, muitos tipos de scanners de escritório e domésticos são equipados com software OCR. Por exemplo, o scanner violeta é equipado com OCR violeta, o scanner de cristal é equipado com OCR Shangshu e o scanner Mustek é equipado com o OCR Danqing. O scanner e o software OCR compartilham todo o processo, desde a entrada do documento até o reconhecimento de texto.
A digitalização de documentos é frequentemente usada no campo do escritório. Documentos relacionados a publicações em jornais, revistas, etc. são digitalizados por um scanner e, em seguida, a identificação OCR é realizada ou armazenada como um arquivo de imagem, para posterior reconhecimento OCR, e os arquivos de imagem são convertidos em texto. Arquivo ou arquivo do Word para armazenamento.
Além disso, o armazenamento e a transmissão de informações digitais não são apenas de baixo custo, com alta eficiência, mas também adaptáveis às necessidades pouco desenvolvidas de diagramação e transmissão em rede. Atualmente, existem muitos tesouros de papel, como livros, jornais, revistas, etc., na China, e é urgente convertê-los em informações eletrônicas. Por exemplo, o estabelecimento de uma biblioteca eletrônica requer que os livros sejam digitalizados página por página, e a identificação do software OCR substitui a digitação manual das palavras, o que reduz bastante o tempo de entrada, reduz a intensidade do trabalho, economiza mão de obra e reduz custos. Melhore a precisão de entrada, eficiência de trabalho e automação de escritório moderna.
Atualmente, a combinação de software OCR e scanners foi aplicada a muitos campos da era da informação, como bibliotecas digitais, identificação de vários relatórios e identificação de padrões de sistemas bancários e tributários. Com o desenvolvimento e a popularização de redes e informações, seu escopo de aplicação se tornará cada vez mais extenso.
Composição do sistema de OCR
A função do software de reconhecimento de caracteres chinês OCR é reconhecer vários gráficos ou imagens de cada caractere chinês gravado em caracteres chineses, impressões ou manuscritos por computador e para marcar os códigos de categoria de caracteres chineses. Portanto, o reconhecimento de caracteres chineses é basicamente um problema de reconhecimento de imagem. Devido à grande quantidade de caracteres chineses, diferentes fontes, fontes e estruturas complexas, o processo de reconhecimento de caracteres chineses é extremamente complicado. Diagrama esquemático do fluxo de trabalho do software OCR, conforme mostrado na tabela a seguir:
Dados do documento → entrada de digitalização → processamento de imagem → divisão de layout → reconhecimento de texto → edição de texto → armazenamento de documentos
Devido à popularidade e ampla aplicação dos scanners, o software OCR precisa apenas fornecer uma interface com o scanner e usar o software do driver do scanner. Portanto, o software OCR é composto principalmente por um módulo de processamento de imagem, um módulo de divisão de layout, um módulo de reconhecimento de texto e um módulo de edição de texto.
1. Módulo de processamento de imagem
O módulo de processamento de imagens tem principalmente funções como digitalização de documentos, dimensionamento de imagens e rotação de imagens. Após a entrada do scanner, o documento forma um arquivo de imagem e o módulo de processamento de imagem pode ampliar a imagem para remover manchas e arranhões. Se a imagem não for girada corretamente, a imagem poderá ser girada manualmente ou automaticamente, para criar melhores condições para o reconhecimento de texto. A taxa de reconhecimento é maior.
2. Módulo de divisão de layout
O módulo de divisão de layout inclui principalmente divisão de layout e divisão de alteração, ou seja, entendimento do layout, segmentação de palavras, normalização, etc., e layout automático ou manual pode ser selecionado. O objetivo é informar ao software de OCR para separar os artigos, tabelas, etc. no mesmo layout, para que possam ser processados separadamente e em que ordem.
3. módulo de reconhecimento de texto
O módulo de reconhecimento de texto é a parte principal do software OCR, um diagrama de processo de reconhecimento de texto simples, conforme mostrado abaixo. O módulo de reconhecimento de texto executa principalmente "leitura" nos caracteres chineses de entrada, mas não pode ser multi-linha e deve ser cortado linha a linha. Para caracteres chineses, geralmente é reconhecida por uma palavra e uma palavra, ou seja, reconhecimento de uma única palavra e, em seguida, normalizada. O módulo de reconhecimento de texto extrai os recursos de diferentes caracteres chineses de amostra, conclui o reconhecimento, localiza automaticamente palavras suspeitas e tem funções como antes e depois da associação.
Digitalizar entrada original → corte de linha → corte de palavras → naturalização → extração de recurso de reconhecimento → reconhecimento de palavras ┐ ┐
→- → Extração de recurso de pré-classificação → Biblioteca de recursos (dicionário) → Manuscrito de saída
4. Módulo de edição de texto
O módulo de edição de texto modifica e edita principalmente o texto reconhecido por OCR. Se o sistema reconhecer que está errado, o texto será exibido em vermelho ou azul em negrito e fornecerá texto semelhante para seleção, além de selecionar o editor para saída.
Como usar o software OCR
Embora existam muitos tipos de software OCR, seu uso é semelhante. O primeiro passo é digitalizar o documento e, em seguida, realizar o reconhecimento de OCR. O uso do software OCR é o seguinte:
1. Digitalização de documentos
Para usar o software OCR para reconhecimento de texto, os documentos podem ser digitalizados diretamente no software OCR. Depois de executar o software OCR, a interface do software OCR será exibida.
Coloque o documento a ser digitalizado no lado do vidro do scanner para que o lado a ser digitalizado fique voltado para o lado de vidro do scanner com a extremidade superior do documento voltada para baixo, alinhada com a borda da régua e depois o scanner coberto para se preparar para a digitalização. Clique no botão "Digitalizar" na janela para entrar no software do driver de digitalização para digitalização. O método de verificação não será descrito aqui. No entanto, deve notar-se que a resolução pode ser definida em 200 ~ 400dpi. Para documentos de texto, é essencial ajustar o brilho.
2. Reconhecimento OCR
Para facilitar a operação, selecione as opções do menu e vários ícones aparecem à esquerda da janela.
Para melhor uso, primeiro introduza o ícone à esquerda da tela, de cima para baixo:
Ferramenta "Zoom in": para ampliar a imagem; "zoom out" tool: para reduzir a imagem; ferramenta "definir a área de reconhecimento": para definir a área de reconhecimento; ferramenta "definir a ordem de reconhecimento": para definir a ordem de reconhecimento; Ferramenta Excluir Área de Reconhecimento: para excluir a área de reconhecimento; Ferramenta "Erase Image Noise": para apagar uma área na imagem; Ferramenta "Girar Imagem": para girar a imagem em 90 °, 180 ° ou 270 °; Ferramenta de correção de inclinação: para correção manual da inclinação da imagem.
Etapas gerais para identificação de OCR:
(1) Após o documento ser digitalizado, o texto a ser reconhecido que aparece na janela é muito pequeno. Primeiro, selecione a ferramenta “Zoom in” para ampliar corretamente a imagem para tornar a imagem mais nítida. Se necessário, você também pode selecionar a ferramenta "zoom out" para reduzir o tamanho da tela adequadamente.
(2) Se a tela precisar ser girada em 90 °, 180 ° ou 270 °, use a ferramenta Girar imagem para girar a imagem. Se a tela de texto estiver inclinada, selecione a ferramenta Correção de inclinação para ajustar a tela.
(3) Selecione a ferramenta "Set Recognition Area" durante o reconhecimento e enquadre a área a ser reconhecida na tela de caracteres. Nesse caso, várias áreas podem ser enquadradas de acordo com a condição da tela. Se a área enquadrada estiver incorreta, você pode usar a ferramenta Excluir Área de Identificação para excluir a área reconhecida selecionada.
(4) Para melhorar a taxa de reconhecimento, se a área de reconhecimento selecionada tiver ruído ou uma imagem irreconhecível, a ferramenta "Erase Image Noise" pode ser selecionada para apagar o ruído pouco a pouco. Se você precisar apagar em pedaços, você pode selecionar a ferramenta Wipe Image Block.
(5) Clique no ícone "Reconhecer", o visor OCR está realizando a segmentação de texto e, em seguida, transferido para a tela "Reconhecendo", e o texto reconhecido será exibido passo a passo e transferido para a janela "Revisão de Documento". mostrando.
Muitos softwares de OCR possuem uma função de modificação de texto que reconhece textos que podem estar errados, é exibida em uma cor clara e pode ser modificada.
(6) Armazene o arquivo reconhecido como um arquivo de texto (TXT) ou um arquivo RTF do Word.

