Um acervo com áudio apresenta um problema que o papel não tem: o conteúdo não se pode ler de relance. Uma gravação de uma hora esconde o seu tema, os seus nomes e as suas datas dentro de sessenta minutos de fala que alguém precisa escutar para descrever. Uma coleção de entrevistas, atas orais ou registos sonoros se cataloga devagar por essa razão, e muitas vezes fica sem catalogar porque escutar cada ficheiro inteiro não cabe no tempo da equipa.
O Janium Collect trata o áudio com o mesmo destino que um documento: lê-lo e propor um registo de catálogo. A diferença está no primeiro passo. Antes de que um modelo de linguagem possa extrair metadados, a voz tem que se converter em texto. Esse passo é a transcrição automática (ASR), e daí em diante o áudio percorre o mesmo caminho que um PDF.
Da voz ao texto, e do texto ao registo
O Collect transcreve a gravação e usa essa transcrição como o “conteúdo” do ficheiro. Sobre esse texto, o modelo extrai os campos do registo: tema, descrição, pessoas mencionadas, cobertura. A saída sai no formato que o acervo usa —Dublin Core para uma descrição simples, MARC21 para um catálogo de biblioteca, ISAD-G para um arquivo onde importa a procedência—. Não há um fluxo à parte para áudio; é o processo de sempre com uma etapa inicial distinta.
Nem todo o registo sai da fala. Alguns dados vêm dos metadados técnicos do ficheiro, não do conteúdo: a duração, o códec, a resolução de amostragem. Isso calcula-se de forma determinista, sem passar pelo modelo, porque são factos mensuráveis e não convém pedi-los a um sistema que poderia estimá-los mal. O tipo de recurso —que se trata de um registo sonoro— também se fixa assim, não o decide o modelo.
Transcrever local ou na nuvem
A transcrição pode ser feita de duas maneiras, e a escolha tem consequências de custo e de operação distintas.
- Local. O áudio é transcrito na própria máquina, sem sair da instituição. Processa gravações longas, de horas, mas é lento em CPU: a transcrição demora. É a opção quando o material não deve sair do ambiente ou quando não se quer depender de um serviço externo.
- Na nuvem. A transcrição é delegada a um serviço, mais rápido e sem carga para o hardware local. Aqui aparece uma alavanca de custo útil: a transcrição não precisa do mesmo modelo caro que faz a extração de metadados. Pode-se usar um modelo económico apenas para transcrever, e reservar o modelo bom para o passo de catalogação. Em testes internos, separar essa alavanca e limitar o raciocínio do modelo reduziu o custo de forma apreciável sem que a qualidade dos registos caísse na amostra.
Nenhuma das duas é “a correta” em abstrato. O local protege o dado e evita dependências externas em troca de tempo; a nuvem dá velocidade e menor custo por registo em troca de que o áudio saia da instituição. A decisão depende do acervo e das suas restrições, não de uma preferência técnica.
Quando a gravação não é uma coisa só
Uma entrevista tem turnos. Uma ata oral tem pontos da ordem do dia. Uma sessão tem intervenções de pessoas distintas. Descrever tudo isso num único registo perde a estrutura que torna consultável o material.
O Collect pode segmentar a gravação, como opção que se ativa por
instituição. Com a segmentação ligada, além do registo global da
gravação completa, o sistema divide a transcrição em intervenções ou temas e
cataloga cada um como um registo filho vinculado ao pai. Cada filho leva o
seu próprio registo e uma referência explícita à gravação da qual faz parte
—dcterms:isPartOf em Dublin Core, o campo 773 em MARC—, de modo que o catálogo
conserva a relação entre o todo e as suas partes.
O vínculo funciona nas duas direções. Um fragmento no meio da gravação muitas vezes não anuncia o seu próprio tema, então o sistema completa os campos vazios do filho com o que a segmentação já deduziu, e herda do pai a identidade comum —autor, data—. Ao contrário, o registo da gravação completa pode descrever-se a partir dos seus filhos: o seu tema é a união dos temas dos segmentos, a sua descrição a soma dos seus resumos. É descrição derivada de maneira determinista, não inventada.
Onde estão os limites
A transcrição automática tem erro, e o erro cresce com a qualidade do áudio. Uma gravação limpa transcreve-se bem; uma com ruído de fundo, vozes sobrepostas ou microfone distante produz texto com falhas, e essas falhas se arrastam à extração de metadados. Quando o sistema deteta que um ficheiro quase não tem fala —música ou ambiente em vez de voz—, não força uma descrição a partir de uma transcrição pobre: prefere apoiar-se nos metadados do ficheiro e marcar o caso, para não fabricar conteúdo que não está.
Como no restante do Collect, o que sai são registos propostos que alguém revê, não um catálogo terminado. A transcrição é um rascunho do conteúdo, não uma ata literal, e certos dados —uma cota, uma data da sessão, o nome exato de uma entidade— vêm dos metadados ou do critério do catalogador, não do áudio. O sistema encurta a escuta e a digitação; não substitui quem conhece o acervo.
Para continuar a conversa
Se a sua instituição tem gravações sonoras esperando descrição —entrevistas, atas orais, fundos audiovisuais— e o gargalo é que é preciso escutar cada uma para catalogá-la, isso é o que o Collect tenta aliviar. Escreva-nos para info@janium.com; interessa-nos saber como é o seu material sonoro, em que formato o descreve e quão limpo é o áudio, porque isso muda o que se pode esperar.