Preparar una búsqueda de texto completa
Extrae el texto de un manual de cientos de páginas, guárdalo como TXT y busca términos en tu editor.
Guide
«Extraer texto» lee la capa de texto que realmente existe en un PDF y devuelve texto plano que se puede copiar y buscar. Trabaja sobre los objetos de texto reales del documento, sin reconocer nada: un PDF de texto (exportado desde Word, impreso desde una web) se extrae completo; un escaneo, que solo tiene imágenes y ninguna capa de texto, avisa «No se ha extraído texto».
Actualizado el 2026-09-093 min read
«Extraer texto» lee la capa de texto que realmente existe en un PDF y devuelve texto plano que se puede copiar y buscar. Trabaja sobre los objetos de texto reales del documento, sin reconocer nada: un PDF de texto (exportado desde Word, impreso desde una web) se extrae completo; un escaneo, que solo tiene imágenes y ninguna capa de texto, avisa «No se ha extraído texto».
Lo que sale no es una maqueta reconstruida, sino el texto en el orden de escritura interno del PDF: sirve para buscar, contar y pegar en otro sitio, pero no como un borrador de Word editable.
━━━ Página N ━━━ delante de cada página.<original-name>_texto.txt.| Entrada | Salida | Notas |
|---|---|---|
manual de 3 páginas exportado de Word, con separadores activados |
cada página empieza con una línea «━━━ Página 1 ━━━», «━━━ Página 2 ━━━»… y entre páginas hay una línea en blanco |
el número es la posición dentro de la disposición actual |
PDF creado con fotos del móvil |
aviso «No se ha extraído texto: puede que este PDF sea un escaneo (imágenes); prueba una herramienta de OCR» |
usa en su lugar «OCR de PDF» |
solo la página 4 seleccionada, sin separadores |
únicamente el texto de la página 4, sin línea de título |
cómodo para pegar directamente |
Extrae el texto de un manual de cientos de páginas, guárdalo como TXT y busca términos en tu editor.
Cuando no quieres arrastrar el ratón línea a línea en el lector, extrae la página entera y copia desde ahí.
Si la extracción sale vacía, no hay capa de texto y hará falta pasar por OCR.
Pega el resultado en un contador de palabras.
El PDF guarda la posición absoluta de cada bloque de texto, no el orden de lectura; con dos columnas o tablas, el orden interno de escritura no suele coincidir con el visual. En esos archivos conviene extraer página a página y ordenar a mano.
Sí: escribe la contraseña de apertura y extrae; este paso solo lee la capa de texto y no necesita quitar la contraseña antes, a diferencia de girar o borrar páginas.
Significa que la fuente no tiene una asignación Unicode correcta y la capa de texto ya era ilegible. Puedes convertir esa página en imagen y volver a reconocerla con «OCR de PDF».
La capa de texto la analiza el motor de renderizado de PDF dentro del navegador; ni el archivo ni el resultado se suben a ningún sitio.
Actualizado el 2026-09-09
Extrae el texto de cada página para copiarlo o descargarlo como TXT
Todo el procesamiento se realiza en local en el navegador; los archivos no se suben a ningún servidor