Esta serie cruza dos mundos: el de la catalogación —bibliotecas, archivos, museos— y el de la inteligencia artificial. Cada uno trae su vocabulario, y no todos lo conocen. Esta es una referencia breve de los términos que más aparecen. Si vienes de un acervo, la sección de IA te será útil; si vienes de la IA, la de catalogación.
Inteligencia artificial
Modelo de lenguaje (LLM)
El tipo de inteligencia artificial detrás de herramientas como ChatGPT: un programa entrenado con enormes cantidades de texto que, a partir de lo que lee, identifica, resume y completa información. “LLM” son sus siglas en inglés (large language model). En este blog es lo que lee el documento y propone el registro.
Modelo de frontera
Los modelos de lenguaje más capaces y recientes, operados por grandes proveedores y accesibles por internet (en la nube). Rinden mejor en los casos difíciles, pero procesar con ellos implica enviarles el material. Se contraponen a un modelo local, que corre en la infraestructura de la institución.
Anonimización y tokens
Reemplazar los datos personales de un texto por marcadores neutros —los tokens— antes de enviarlo a un servicio externo, y restaurarlos al volver. Reduce la exposición de datos personales, aunque no garantiza que no quede ninguno.
OCR — reconocimiento óptico de caracteres
Convertir la imagen de un documento escaneado en texto que una máquina puede leer. Es el paso previo cuando el material es un escaneo sin texto seleccionable.
ASR — transcripción automática
Convertir voz en texto. En audio y video es lo que produce la transcripción de la que se extrae el registro. “ASR” son sus siglas en inglés (automatic speech recognition).
Infraestructura y soberanía
On-premise
Que el procesamiento corre en los servidores de la institución, no en un servicio de terceros. El material no sale.
Air-gapped
Una red aislada, sin conexión a internet. El grado máximo de soberanía: el sistema funciona sin comunicarse con el exterior.
Soberanía de datos y residencia de datos
El principio de que cierta información no puede salir de la institución —o del país— que la custodia, por ley, por política o por el tipo de contenido. Se desarrolla en Catalogar con IA sin que el material salga de la institución.
Estándares de catalogación
MARC21 / UNIMARC
El formato estándar para registros bibliográficos en bibliotecas. Estructura la descripción en campos y subcampos codificados.
Dublin Core
Un conjunto simple de campos para describir cualquier recurso de forma interoperable. Menos detallado que MARC, más fácil de intercambiar.
ISAD-G
La norma internacional de descripción archivística. Describe el material en una jerarquía —fondo, sección, serie, unidad— donde importan la procedencia y el contexto, no solo la pieza aislada.
CDWA
El estándar para describir obras de arte y objetos culturales, con el vocabulario del Getty. Distingue la obra de su reproducción.
Control de autoridades
El mecanismo que asegura que una misma persona, entidad o materia se registre siempre de la misma forma, contrastándola contra listas de referencia —VIAF, ISNI, los vocabularios del Getty, o el catálogo de la propia institución—. Evita que un mismo autor entre al índice con tres grafías distintas.
¿Falta un término que te gustaría ver aquí? Escríbenos a info@janium.com.