Ondertitels verbeteren de toegankelijkheid voor doven, slechthorenden en mensen die een andere taal spreken en maken de inhoud toegankelijker voor iedereen. Ze helpen zoekmachines ook om de inhoud gemakkelijker te vinden, waardoor het bereik toeneemt.
De tekstualisatie van gesproken woorden is ook de basis voor vele andere toekomstige applicaties die hierop voortbouwen en waarvoor wij de basis aan het leggen zijn. Deze omvatten het verbeteren van de zoekfunctie, aanbevelingen voor inhoud, het vergemakkelijken of gedeeltelijk automatiseren van keywording, geautomatiseerde vertalingen en nog veel meer.
Automatisch aanmaken vereenvoudigt het proces en bespaart tijd. Het handmatige proces van het transcriberen of aanmaken van ondertitels is tijdrovend en vereist veel middelen, aangezien er voor elke taal en elke episode mensen nodig zijn om de gesproken inhoud in tekst om te zetten.
Ondertitels worden gegenereerd met behulp van Whisper AI, een spraak-naar-tekst algoritme ontwikkeld door Google. Het is in staat om gesproken woord om te zetten in tekst in meer dan 50 talen en is open source, d.w.z. het is open source en kan vrij gebruikt worden. Aangezien het trainen van een dergelijk algoritme erg duur is, moeten wij, net als vele anderen, vertrouwen op bestaande technologieën zoals Whisper AI.
Het algoritme zet zogenaamde fonemen (taalklanken) om in letters, lettergrepen en uiteindelijk woorden. Er worden een aantal verschillende methoden gebruikt om de herkenning te verbeteren of de begrijpelijkheid voor de lezer te vergroten. Het filtert bijvoorbeeld grammaticale stoornissen in het spraakverloop, zoals "Er" en "Ah", of zet bepaalde dialectuitdrukkingen om in meer algemeen begrijpelijke uitdrukkingen.
Daarnaast worden zogenaamde "woordenlijsten" gebruikt om bepaalde termen te herkennen en te reproduceren die alleen in een specifieke taal of een specifiek dialectgebied worden gebruikt. Aangezien deze woordenlijsten ook meer getraind zijn met Duitse termen die in Duitsland gesproken worden, zijn ze minder goed in staat om Oostenrijk-specifieke termen zoals "Nationalrat", "Bezirkshauptmannschaft" of eigennamen zoals "Freistadt" te herkennen. In dergelijke situaties kunnen termen dus onjuist worden getranscribeerd, ook al zijn ze duidelijk uitgesproken als de term niet in de woordenlijst is opgenomen. De stad "Freistadt" wordt bijvoorbeeld soms "Freistaat".
Het algoritme wordt voortdurend verbeterd en er kan worden aangenomen dat de kwaliteit voor Oostenrijks Duits ook zal blijven verbeteren.
Het maken van ondertitels brengt meestal een zesde tot een derde van de totale duur van de audio in beslag. De duur hangt af van de hoeveelheid spraak of muziek, de taal of talen die gesproken worden en de manier waarop de personages spreken. Gemiddeld tilt u voor een bestand van een uur ongeveer 10 - 20 minuten voor autotranscriptie.
Het aanmaken gebeurt op de achtergrond en vereist veel rekenkracht, wat tijdrovend en duur is. We transcriberen eerst de hele database, voornamelijk om de zoekfunctie te verbeteren. Nieuwe bestanden worden alleen getranscribeerd als ze al gepubliceerd zijn, om middelen en tijd te besparen. Zodra de hele database getranscribeerd is - wat meer dan een jaar in beslag neemt - zullen wij overwegen om u meer controle over het transcriptieproces te geven.
Veel van de posts in cba hebben weinig beschrijvende tekst of trefwoorden. Ze kunnen echter alleen gevonden worden als er voldoende tekstinformatie beschikbaar is. Daarom verrijken we onze zoekindex met de transcripties en in een volgende stap kunnen we er ook betekenisvolle trefwoorden uitfilteren en bieden we deze dus aan voor keywording. Dit proces leidt niet alleen tot nauwkeurigere zoekresultaten, maar ook tot een betere balans: er kan nu ook inhoud uit het archief openbaar worden gemaakt waarvoor eerder geen of zeer weinig tekstinformatie beschikbaar was.
Correcte transcriptie is afhankelijk van een aantal factoren
Whisper AI gebruikt een sg. taalmodel om geluiden om te zetten in tekst. Om een specifieke manier van spreken te begrijpen, zoals een dialect, heeft dergelijke technologie veel informatie nodig over hoe mensen in dat dialect spreken. De trainingsgegevens zijn vaak in verschillende mate beschikbaar, afhankelijk van de taal en het dialectgebied. Als gevolg daarvan worden deze algoritmen vaak getraind met bijvoorbeeld Duitse taalvariaties, wat betekent dat Hoogduits veel beter herkend wordt dan bijvoorbeeld bepaalde dialecten.
Naast de manier van spreken hangt de kwaliteit van de transcriptie vooral af van de geluidskwaliteit. "Washy" of gedempt geluid, clipping/vervorming, galm en zelfs de bitsnelheid (de compressiesnelheid van een MP3, bijvoorbeeld) kunnen de kwaliteit ernstig aantasten en dus leiden tot fouten in de ondertiteling.
U kunt deze fouten echter handmatig corrigeren met de ondertitelingseditor.
Ja, de automatisch gemaakte ondertitels kunnen bewerkt worden in de ondertitelingseditor om er zeker van te zijn dat ze correct zijn. U kunt here te weten komen hoe u deze kunt gebruiken.
Ja, met de ondertitelingseditor kunt u zowel de ondertiteling als een WebVTT-bestand exporteren en downloaden als het volledige transcript als tekst.