Preparar uma pesquisa no documento inteiro
Tire o texto de um manual de centenas de páginas, salve em TXT e pesquise palavras-chave no editor.
Guide
O Extrair texto retira a camada de texto incorporada ao PDF como ela está, produzindo um texto puro que dá para copiar e pesquisar. Ele lê os objetos de texto realmente existentes no arquivo, sem fazer reconhecimento: PDF com texto (exportado do Word, impresso de uma página web) sai completo; digitalizações têm só imagem, sem camada de texto, e recebem o aviso "nenhum texto extraído".
Atualizado em 2026-09-093 min read
O Extrair texto retira a camada de texto incorporada ao PDF como ela está, produzindo um texto puro que dá para copiar e pesquisar. Ele lê os objetos de texto realmente existentes no arquivo, sem fazer reconhecimento: PDF com texto (exportado do Word, impresso de uma página web) sai completo; digitalizações têm só imagem, sem camada de texto, e recebem o aviso "nenhum texto extraído".
A saída não reproduz a diagramação: é o texto montado na ordem de escrita interna do PDF. Serve para pesquisar, contar e colar em outro lugar; não serve como um documento editável do Word.
<original-name>_texto.txt.| Entrada | Saída | Observação |
|---|---|---|
manual de 3 páginas exportado do Word, divisória ligada |
cada página vem precedida de uma linha "━━━ Página 1 ━━━", "━━━ Página 2 ━━━"… com uma linha em branco entre elas |
o número é a posição no arranjo atual |
PDF gerado por foto de celular |
aviso "nenhum texto extraído: este PDF pode ser uma digitalização (imagem); tente uma ferramenta de OCR" |
use "OCR de PDF" |
só a página 4 selecionada, divisória desligada |
apenas o texto puro da página 4, sem linha de título |
bom para colar direto |
Tire o texto de um manual de centenas de páginas, salve em TXT e pesquise palavras-chave no editor.
Em vez de arrastar o mouse linha por linha no leitor, extraia a página inteira de uma vez e copie.
Se a extração vier vazia, não há camada de texto e o caminho é o OCR.
Cole o resultado em uma ferramenta de contagem de palavras.
O PDF registra a posição absoluta de cada bloco de texto e não a ordem de leitura; em layouts de duas colunas ou com tabelas, a ordem interna de escrita costuma não bater com a ordem visual. Nesses arquivos, extraia página a página e ajuste à mão.
Sim: informe a senha de visualização e a extração funciona — esta etapa só lê a camada de texto, sem precisar remover a senha antes, como acontece em girar e excluir páginas.
Isso indica que a fonte não tem mapeamento Unicode correto, ou seja, a camada de texto em si não é legível. Converta a página em imagem e reconheça de novo com "OCR de PDF".
A camada de texto é interpretada pelo mecanismo de PDF dentro do navegador; nem o arquivo nem o resultado são enviados.
Atualizado em 2026-09-09
Extraia o texto de cada página para copiar ou baixar como TXT
Todo o processamento é feito localmente no navegador; os arquivos não são enviados a nenhum servidor