Um acervo audiovisual é difícil de descrever por uma razão simples: é preciso vê-lo ou ouvi-lo para saber o que contém. Uma folha de um processo lê-se num relance; um noticiário de meia hora ou uma gravação de uma sessão não dizem o seu conteúdo até que alguém os reproduza por inteiro. Um arquivo de noticiários, uma fonoteca de entrevistas, uma coleção de videogravações de eventos: cada um guarda dentro nomes, datas e temas espalhados ao longo de minutos de imagem e som, não numa capa.
Por isso esses fundos são catalogados devagar, e muitas vezes ficam sem catalogar. Reproduzir cada ficheiro completo para descrevê-lo não cabe no tempo da equipa, e, entretanto, o material acumula-se, muitas vezes já digitalizado mas sem um registo que permita encontrá-lo. Esse é o caso que o Janium Collect atende quando o acervo é audiovisual.
De que parte a descrição
O Collect não “vê” o vídeo nem “ouve” o áudio como faria uma pessoa. Trabalha com dois derivados do ficheiro que um modelo de linguagem consegue ler.
O primeiro é a transcrição: a voz do áudio (seja uma gravação sonora ou a banda sonora de um vídeo) é convertida em texto com reconhecimento automático de fala, e esse texto torna-se o conteúdo a partir do qual se extraem os metadados. O segundo, no caso do vídeo, são os fotogramas por cena: em vez de um quadro a cada tantos segundos, o sistema deteta quando a imagem muda de forma significativa e toma um fotograma representativo de cada trecho. Assim o modelo vê uma sequência de imagens que resume o que acontece no ecrã, apoiada no que se diz.
O mecanismo de cada modalidade já está descrito em detalhe em dois posts anteriores: como funciona a transcrição e a escolha entre transcrever localmente ou na nuvem em «De uma gravação sonora a um registo de catálogo», e como se amostram os fotogramas e se combinam as duas vias em «De um vídeo a registos ligados». Aqui interessa o caso de uso: o que um arquivo audiovisual ganha ao aplicar ambos.
Um registo do conjunto, e um por cada parte
O ponto que distingue um acervo audiovisual dos outros é que o conteúdo quase nunca é uma coisa só. Um noticiário tem várias peças. Uma sessão gravada tem vários pontos da ordem do dia. Uma entrevista tem turnos. Descrever tudo isso num único registo entrega um registo real mas pobre: quem procura uma peça específica, uma intervenção ou um tema daquela meia hora não a encontra, porque ficou subsumida num resumo geral.
O Collect aborda isso com dois níveis de registo. Por predefinição, cada ficheiro produz
um registo: o resumo global do conteúdo, que para muito material basta. Quando
o fundo justifica, ativa-se por instituição a segmentação: além do registo
global, o sistema divide o material (em intervenções para o áudio, em cenas para o
vídeo) e cataloga cada segmento como um registo filho ligado ao pai. O
vínculo é explícito e bidirecional: cada filho referencia o pai com o campo que
corresponde ao formato (dcterms:isPartOf em Dublin Core, o 773 em MARC), e o pai
referencia os seus filhos sem os embutir. Cada segmento fica como um registo
consultável por si mesmo e, ao mesmo tempo, sabe-se de qual gravação faz parte.
Aqui entra em jogo uma regra que o Collect aplica em todo o processo: não preencher um campo com o que não pode sustentar. Um fragmento no meio de uma gravação raramente traz o seu próprio título, então o modelo deixa esses campos vazios. Na via de áudio, onde a segmentação já deduziu um tema e um resumo de cada intervenção, esses vazios preenchem-se de forma determinista, e o registo do conjunto pode ser descrito agregando o das suas partes: o seu assunto é a união dos temas, a sua descrição a soma dos resumos. Na via de vídeo, o filho de cada cena é catalogado a partir dos seus fotogramas, sem essa passagem de preenchimento. Em ambos os casos é descrição derivada do que já se extraiu, não uma segunda ronda de suposição.
No formato que a instituição já usa
Nada disso muda a norma de descrição do acervo. A saída sai no formato que a instituição usa: Dublin Core para uma descrição simples, ISAD-G para um arquivo onde importam a proveniência e a hierarquia, MARC21 para um catálogo de biblioteca. O registo filho sai no mesmo formato que o pai, não num à parte.
Parte do registo, além disso, não depende do conteúdo em absoluto. Os dados técnicos do ficheiro (duração, codec, resolução) são lidos diretamente do contentor, sem passar pelo modelo, porque são factos mensuráveis; em MARC alimentam os campos fixos de material audiovisual de forma determinista. O tipo de recurso (que se trata de um registo sonoro ou de uma imagem em movimento) também se fixa assim, não é o modelo que decide. Isso deixa ao modelo apenas a parte que exige ler o conteúdo, que é onde ele contribui.
Limites
A transcrição automática tem erro, e esse erro cresce quando o áudio é mau: ruído de fundo, vozes sobrepostas, um microfone distante produzem texto com falhas que se arrastam para a extração. A descrição do visual é feita a partir de alguns fotogramas, não do vídeo completo: capturam o assunto de cada cena, não as suas nuances, e um plano breve ou um gesto podem não ficar refletidos. A segmentação por cena é heurística (baseia-se em quando a imagem muda, o que se aproxima dos cortes temáticos mas nem sempre coincide com eles), então serve como ponto de partida para navegar o material, não como uma segmentação editorial definitiva.
Quando um áudio quase não tem fala (música, ambiente), o sistema não força uma descrição a partir de uma transcrição pobre: apoia-se nos metadados do ficheiro e assinala o caso, para não fabricar conteúdo que não está lá. E como no resto do Collect, o que sai são registos propostos que alguém revê. A transcrição e a descrição por fotogramas assistem o trabalho; não substituem a visualização especializada de material patrimonial. Um fundo audiovisual histórico pede o critério de quem sabe o que está a ver e a ouvir (uma atribuição, uma data da gravação, a identificação de uma pessoa ou de um lugar em quadro) e essa última palavra continua a ser humana. O que muda é o ponto de partida: a revisão começa a partir de um rascunho estruturado e ligado, não do zero, e sobretudo a partir de um material que já está descrito o bastante para encontrá-lo.
Para continuar a conversa
Se a sua instituição tem um arquivo de noticiários, uma fonoteca ou um acervo de vídeo de eventos à espera de descrição, e o ponto de bloqueio é ter de ver ou ouvir cada peça para catalogá-la, é isso que este fluxo procura aliviar, sem tirar de quem cataloga a decisão final. Escreva-nos para info@janium.com; queremos saber como é o seu material audiovisual, em que formato o descreve e quão limpo é o áudio, porque isso muda o que se pode esperar.