Extraer texto de un PDF
Extrae todo el texto seleccionable de un PDF a texto plano que puedes copiar o descargar, localmente en tu navegador.
Cargando Extraer texto de un PDF… Si no ocurre nada, activa JavaScript.
Extraer texto de un PDF significa leer los caracteres almacenados en el documento y devolverlos como texto plano y editable. Es una de las operaciones más habituales en cualquier flujo de trabajo con documentos. Quizá quieras citar un pasaje de un informe, alimentar el contenido de un artículo a un índice de búsqueda, reutilizar el texto de un folleto antiguo, contar palabras o, simplemente, obtener texto limpio de un archivo que no permite una selección fácil en tu visor habitual. En lugar de volver a teclear nada, dejas que la herramienta recorra el documento y te entregue todo lo que puede leer.
Preguntas frecuentes
¿Se suben mis archivos a un servidor?
¿Por qué un PDF escaneado devuelve poco texto o ninguno?
¿Cómo se organiza el texto extraído?
¿Puedo copiar el texto o guardarlo en un archivo?
¿Conserva el formato como la negrita, las tablas o las columnas?
¿Cuál es el tamaño de archivo o el número de páginas máximo?
¿Funciona con PDF protegidos con contraseña?
¿Funciona con texto que no está en inglés y con caracteres especiales?
¿Puedo extraer texto de muchos PDF a la vez?
Acerca de Extraer texto de un PDF
Esta herramienta usa pdf.js, el mismo motor que impulsa la visualización de PDF en los navegadores modernos, ejecutándose por completo en tu dispositivo. Para cada página solicita el contenido de texto y une los fragmentos individuales con espacios, y luego separa las páginas con líneas en blanco para que la salida se mantenga legible y refleje a grandes rasgos la disposición del original. El resultado aparece en un cuadro de texto de solo lectura junto con el número de páginas, y puedes copiarlo todo al portapapeles con un clic o descargarlo como un archivo .txt listo para abrir en cualquier editor.
Todo ocurre en tu navegador, sin que nada se suba. El PDF se lee desde tu disco local y se procesa en memoria, lo que mantiene contratos privados, investigaciones y documentos internos fuera de cualquier servidor de terceros. Una limitación importante que conviene entender es que esta herramienta lee el texto que está realmente almacenado como texto en el archivo. Un documento escaneado o una foto guardada como PDF contiene solo imágenes de palabras, sin datos de caracteres subyacentes, así que devolverá poco texto o ninguno. Para esos archivos necesitarías reconocimiento óptico de caracteres, que reconoce las letras a partir de los píxeles, un proceso distinto de la extracción directa que se realiza aquí.
Por qué sacar el texto de un PDF es más difícil de lo que parece
Un PDF no almacena el texto como lo hace un documento de procesador de textos. En lugar de frases y párrafos, almacena instrucciones de dibujo que dicen, en esencia, coloca este glifo en esta coordenada exacta de la página. A menudo no hay un carácter de espacio explícito entre las palabras ni noción de dónde termina una línea, columna o párrafo y empieza el siguiente. El software de extracción tiene que reconstruir un texto legible observando las posiciones de los glifos, infiriendo los espacios a partir de los huecos entre ellos y deduciendo el orden de lectura de sus coordenadas. Por eso el texto extraído de una disposición compleja a veces puede llegar con las palabras en un orden inesperado o con un espaciado que no coincide con lo que viste en pantalla.
La situación se complica aún más por las fuentes. Cada fuente de un PDF asigna los códigos del flujo de contenido a formas de glifos, pero el enlace de vuelta desde un glifo a su carácter Unicode real es opcional y se transporta en una estructura llamada mapa ToUnicode. Cuando ese mapa está presente, la extracción es limpia. Cuando un PDF usa una fuente de subconjunto o personalizada y omite o estropea el mapa, la salida extraída puede ser ininteligible aunque la página se vea perfecta, porque el visor sabe cómo dibujar las formas pero el archivo nunca registró qué caracteres representan.
Luego está la gran división entre el texto real y las imágenes de texto. En todo el mundo, una enorme proporción de los PDF son escaneos: fotografías o imágenes de escáner plano de papel, envueltas en un contenedor PDF. Para un humano se ven idénticos a un documento nativo digital, pero no contienen ningún dato de caracteres, solo píxeles. Leerlos requiere reconocimiento óptico de caracteres, un campo con raíces que se remontan a las décadas de 1920 y 1930 y a dispositivos construidos para ayudar a los lectores ciegos y para clasificar el correo. El OCR moderno usa aprendizaje automático para lograr una alta precisión en muchos idiomas, pero sigue siendo una tarea fundamentalmente distinta y más propensa a errores que simplemente leer el texto que un PDF digital ya contiene, que es exactamente lo que hace esta herramienta.