ArchiveLM convierte colecciones de prensa histórica digitalizada en texto buscable, citable y analizable — con OCR verificado contra la imagen original y búsqueda semántica multilingüe.
Probá la plataforma gratisUna colección puede estar perfectamente escaneada y seguir siendo, en la práctica, inutilizable: una carpeta con miles de imágenes no se puede consultar por tema. Y hay un modo de falla silencioso en el OCR con IA: en páginas densas o deterioradas, muchos modelos generan texto verosímil que no está en la página. Para una investigación, eso es veneno — alguien cita un pasaje que nunca existió.
Verificación auto-correctiva: los pasajes recuperados se comparan con la imagen original y las discrepancias se corrigen o se marcan para revisión humana.
Búsqueda semántica multilingüe: una consulta en español (o inglés) recupera los pasajes relevantes aunque la fuente esté en otro idioma.
Research Lab: mapa de entidades, líneas de tiempo y resúmenes para rastrear actores, instituciones y cambios a lo largo del tiempo.
Chat con citas: preguntás en lenguaje natural y obtenés respuestas ancladas a la página de origen.
Costo sustancialmente inferior al de los proveedores tradicionales de digitalización. Podés evaluar la calidad sobre tu propio material antes de contratar: el plan gratuito incluye 25 créditos por mes y los PDF que ya contienen texto no consumen créditos.
Convertir una hemeroteca digitalizada en un corpus consultable por tema, no solo por palabra exacta.
Rastrear la aparición de un actor o un debate político a lo largo de décadas de prensa.
Encontrar pasajes en español dentro de un registro mayormente en inglés (o al revés).
Procesar material propio (periódicos provinciales, documentación oficial) para una investigación o tesis.
Una hemeroteca permite buscar palabras exactas en el OCR existente. ArchiveLM añade búsqueda semántica (encontrás por significado, no solo por coincidencia literal), búsqueda multilingüe (una consulta en inglés recupera fuentes en español, y viceversa) y respuestas con cita a la página exacta — sobre OCR verificado contra la imagen original.
Ese es justamente el problema que resolvemos. En páginas densas o dañadas, muchos modelos generan texto verosímil que no está en la página, lo que produce citas falsas. La verificación auto-correctiva compara los pasajes recuperados con la imagen de origen y marca o corrige las discrepancias. No eliminamos el riesgo por completo: publicamos las evaluaciones donde nuestro sistema falla, incluidos los casos en que inventó texto.
Sí. La plataforma fue desarrollada y evaluada sobre prensa en español del siglo XIX, y está pensada para broadsheets densos, tipografías de época y material multilingüe.
Sí. Podés subir tus fuentes (periódicos, registros oficiales, libros) desde el panel o importarlas por URL desde repositorios como archive.org. Exportás los resultados en texto, JSON, CSV y ALTO/XML.
Probamos la calidad sobre tu propio material antes de hablar de costos. El plan gratuito incluye 25 créditos por mes y los PDF que ya contienen texto no consumen créditos.
ArchiveLM está en beta privada. Revisamos cada solicitud y respondemos en 1–3 días hábiles.
Solicitar acceso a la betaEnglish version: Spanish-language archives