← Blog

Glosario: los términos de IA y catalogación de este blog

  • janiumcollect
  • ia
  • referencia

Esta serie cruza dos mundos: el de la catalogación —bibliotecas, archivos, museos— y el de la inteligencia artificial. Cada uno trae su vocabulario, y no todos lo conocen. Esta es una referencia breve de los términos que más aparecen. Si vienes de un acervo, la sección de IA te será útil; si vienes de la IA, la de catalogación.

Inteligencia artificial

Modelo de lenguaje (LLM)

El tipo de inteligencia artificial detrás de herramientas como ChatGPT: un programa entrenado con enormes cantidades de texto que, a partir de lo que lee, identifica, resume y completa información. “LLM” son sus siglas en inglés (large language model). En este blog es lo que lee el documento y propone el registro.

Modelo de frontera

Los modelos de lenguaje más capaces y recientes, operados por grandes proveedores y accesibles por internet (en la nube). Rinden mejor en los casos difíciles, pero procesar con ellos implica enviarles el material. Se contraponen a un modelo local, que corre en la infraestructura de la institución.

Anonimización y tokens

Reemplazar los datos personales de un texto por marcadores neutros —los tokens— antes de enviarlo a un servicio externo, y restaurarlos al volver. Reduce la exposición de datos personales, aunque no garantiza que no quede ninguno.

OCR — reconocimiento óptico de caracteres

Convertir la imagen de un documento escaneado en texto que una máquina puede leer. Es el paso previo cuando el material es un escaneo sin texto seleccionable.

ASR — transcripción automática

Convertir voz en texto. En audio y video es lo que produce la transcripción de la que se extrae el registro. “ASR” son sus siglas en inglés (automatic speech recognition).

Infraestructura y soberanía

On-premise

Que el procesamiento corre en los servidores de la institución, no en un servicio de terceros. El material no sale.

Air-gapped

Una red aislada, sin conexión a internet. El grado máximo de soberanía: el sistema funciona sin comunicarse con el exterior.

Soberanía de datos y residencia de datos

El principio de que cierta información no puede salir de la institución —o del país— que la custodia, por ley, por política o por el tipo de contenido. Se desarrolla en Catalogar con IA sin que el material salga de la institución.

Estándares de catalogación

MARC21 / UNIMARC

El formato estándar para registros bibliográficos en bibliotecas. Estructura la descripción en campos y subcampos codificados.

Dublin Core

Un conjunto simple de campos para describir cualquier recurso de forma interoperable. Menos detallado que MARC, más fácil de intercambiar.

ISAD-G

La norma internacional de descripción archivística. Describe el material en una jerarquía —fondo, sección, serie, unidad— donde importan la procedencia y el contexto, no solo la pieza aislada.

CDWA

El estándar para describir obras de arte y objetos culturales, con el vocabulario del Getty. Distingue la obra de su reproducción.

Control de autoridades

El mecanismo que asegura que una misma persona, entidad o materia se registre siempre de la misma forma, contrastándola contra listas de referencia —VIAF, ISNI, los vocabularios del Getty, o el catálogo de la propia institución—. Evita que un mismo autor entre al índice con tres grafías distintas.


¿Falta un término que te gustaría ver aquí? Escríbenos a info@janium.com.