Acerca de esta herramienta
El OCR — Optical Character Recognition — añade una capa de texto invisible a un PDF escaneado para que el documento se pueda buscar y copiar y pegar. Las imágenes de la página se dejan intactas, por lo que el archivo se ve idéntico al original; solo cambian los datos de texto subyacentes. Soportamos reconocimiento en inglés, francés, alemán y español, elegidos en el momento de la carga para que el motor pueda usar el diccionario del idioma correcto.
El OCR es más útil en documentos escaneados: escaneos de cámara de contratos, escaneos de fotocopiadora de papeleo, fotografías de páginas de texto. Funciona en PDF regulares también, pero añade poco: un PDF exportado desde Word o un navegador ya contiene texto real que el sistema operativo puede indexar, por lo que el OCR no encuentra nada nuevo que hacer. El Free tier procesa hasta 10 páginas por subida; Pro sube eso a 50. Los límites de página existen porque el OCR requiere mucho más de la CPU que otras operaciones en este sitio.
Cómo funciona
Suelta tu PDF escaneado
Arrastra un PDF escaneado al área de carga o haz clic para elegir uno. Se sube por HTTPS para procesarlo y no se conserva intencionadamente después de la solicitud.
Elige el idioma
Elige el idioma que coincida con el documento — inglés, francés, alemán o español. Elegir el incorrecto reduce drásticamente la precisión.
Haz clic en Extraer texto
Ejecutamos el pase de reconocimiento sobre cada página y añadimos el texto reconocido como una capa invisible debajo de cada imagen.
Descarga el PDF buscable
Guarda el resultado localmente. El archivo se ve igual que antes, pero ahora puedes buscar, seleccionar y copiar texto de él.
Cuándo usarla
- Hacer buscable una pila de contratos escaneados para que puedas encontrar cláusulas por palabra clave en lugar de leer cada página.
- Indexar recibos y facturas escaneados para que las herramientas de contabilidad y las barras de búsqueda puedan extraer texto de ellos.
- Convertir documentos fotografiados en un archivo buscable — cartas antiguas, notas manuscritas (cuando son claras), papeleo heredado.
- Preparar PDF escaneados para la búsqueda por palabras clave dentro de sistemas de gestión documental que no hacen OCR por sí mismos.
- Reutilizar pasajes de texto de informes escaneados sin tener que volver a teclearlos a mano — cópialos desde el PDF buscable en su lugar.
- Mejorar la accesibilidad: los lectores de pantalla pueden leer en voz alta texto de un PDF con OCR; los escaneos en bruto no les dan nada para leer.
Preguntas frecuentes
- ¿Qué significa OCR?
- OCR significa Optical Character Recognition (Reconocimiento Óptico de Caracteres). Es el proceso de mirar una imagen de texto — como una página escaneada o una foto de un documento — y convertirla en caracteres de texto reales que una computadora pueda leer. Una vez que un PDF ha pasado por OCR, puedes buscar en él, copiar su texto, y los lectores de pantalla pueden leerlo en voz alta.
- ¿Se verá diferente el PDF después del OCR?
- No. La representación visual se conserva exactamente: las imágenes de las páginas quedan intactas. Añadimos una capa de texto invisible debajo de la imagen para que el documento sea buscable y seleccionable, pero cada píxel que ves se mantiene igual que en el escaneo original.
- ¿Qué idiomas están soportados?
- Inglés, francés, alemán y español. Elige el idioma que coincida con el texto dominante en la página cuando lo subas — la precisión cae drásticamente si el idioma es incorrecto, ya que el motor usa diccionarios específicos del idioma para decidir entre caracteres de aspecto similar.
- ¿Por qué el límite de páginas es 10 gratis / 50 Pro?
- El OCR requiere un uso intensivo de la CPU — reconocer cada glifo en cada página toma significativamente más capacidad de cómputo que una simple reescritura de PDF. Los límites de página impiden que una sola subida monopolice el servidor y ralentice las cosas para todos los demás. Si tienes un documento más largo, divídelo primero y aplica OCR a la sección relevante.
- ¿Funcionará el OCR en una captura de pantalla del teléfono de una página de texto?
- Por lo general sí, si la foto es clara, está enfocada y bien iluminada. Las fotos borrosas, las sombras fuertes o los ángulos extremos producen resultados notablemente peores: las letras se leen mal, las palabras se unen o separan y la precisión puede caer por debajo de lo útil. Para obtener mejores resultados, escanea o fotografía de frente con iluminación uniforme.
- ¿Por qué parece que el OCR no hace mucho en mi PDF normal?
- Porque un PDF normal — uno exportado desde Word, un navegador o una herramienta de diseño — ya contiene el texto como texto. Ya puedes buscar y copiar de él. El OCR es para documentos cuyo texto existe solo como imágenes, como el escaneo de un contrato en papel o la foto de un recibo. En un PDF normal, la operación es esencialmente nula.