AI & computing › Neuromorfe & fotonische chips
Nvidia deelt gratis AI-model dat acht sprekers tegelijk herkent
Nvidia heeft een gratis AI-model uitgebracht dat kan bepalen wie er op welk moment praat in een gesprek. Nemotron 3 Diarization onderscheidt tot acht sprekers, ook als ze door elkaar praten, en doet dat in real time. Op de belangrijkste benchmark voor deze technologie is het nu het beste model ter wereld.
Wie een vergadering opneemt of een callcenter-gesprek automatisch wil transcriberen, wil vaak niet alleen weten wat er gezegd is, maar ook wie het zei. Dat proces heet sprekersdiarisatie: software die een gesprek opdeelt in stukjes en elk stukje toewijst aan een specifieke spreker. Nvidia heeft daarvoor nu een nieuw model vrijgegeven: Nemotron 3 Diarization. Het model is met ongeveer 100 miljoen parameters relatief compact en de gewichten zijn gratis te downloaden als open-weightmodel, wat betekent dat iedereen het vrij kan gebruiken en aanpassen.
Acht sprekers, ook door elkaar heen
Het model kan tot acht verschillende sprekers in een gesprek uit elkaar houden en herkent ook wanneer meerdere mensen gelijktijdig praten. Dat laatste is technisch lastig: bij overlappende spraak moeten twee stemsporen tegelijk correct worden herkend. Hoe meer deelnemers, hoe meer achtergrondgeluid en hoe meer galm in de ruimte, hoe moeilijker dat wordt en hoe hoger het foutenpercentage oploopt. Nemotron 3 werkt zowel op bestaande opnames als op live audio, wat het geschikt maakt voor toepassingen als notulen-software of ondertiteling tijdens een videobelletje.
Op zichzelf vertelt het model niet wát er gezegd wordt, alleen wie er spreekt. Gecombineerd met een spraakherkenningssysteem zoals Nvidia's eigen Parakeet ontstaat een compleet transcript met sprekerslabels. Die labels zijn overigens anoniem: het systeem herkent bijvoorbeeld 'spreker_2', maar weet niet wie dat daadwerkelijk is.
Koploper op de ranglijst
Voor dit soort modellen bestaat een onafhankelijke benchmark: de VoiceArena Diarization Benchmark. Daar scoort Nemotron 3 een foutenpercentage van 14,7 procent, tegenover 19,3 procent voor de eerstvolgende concurrent. Vergeleken met zijn eigen voorganger, Streaming Sortformer, is de foutmarge gemiddeld 41 procent lager, gemeten over acht verschillende testscenario's.
Die benchmark is streng: ook overlappende spraak en kleine afwijkingen bij het wisselen van spreker worden als fout geteld. Dat maakt de score extra veelzeggend over hoe goed het model in de praktijk presteert, niet alleen onder ideale omstandigheden.
Sneller ten koste van precisie
Gebruikers kunnen de audiobuffer van het model instellen op vier niveaus, variërend van 30,4 seconden tot slechts 0,32 seconden. Een langere buffer geeft het model meer context om sprekers correct te herkennen, maar reageert trager. Een kortere buffer werkt bijna direct, wat onmisbaar is voor livegebruik, maar gaat doorgaans gepaard met meer fouten. Die afweging tussen snelheid en nauwkeurigheid is typisch voor realtime AI-toepassingen en geeft ontwikkelaars de vrijheid om te kiezen wat het beste past bij hun toepassing, van een naslagtranscript tot live ondertiteling.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Doordat Nvidia dit model gratis en open beschikbaar stelt, kunnen ontwikkelaars het zonder hoge kosten inbouwen in vergadersoftware, callcenters en ondertitelingstools. Dat versnelt de opmars van automatische transcriptie met sprekersherkenning in alledaagse toepassingen, en verlaagt de drempel voor kleinere bedrijven om deze technologie te gebruiken.
- Sprekersdiarisatie
- Het automatisch bepalen wie op welk moment spreekt in een audio-opname of gesprek, zonder de inhoud van de spraak zelf te herkennen.
- Open-weightmodel
- Een AI-model waarvan de onderliggende parameters (gewichten) vrij te downloaden en te gebruiken zijn, in tegenstelling tot modellen die alleen via een betaalde dienst toegankelijk zijn.
- Foutenpercentage (DER)
- Een maatstaf die aangeeft welk deel van een gesprek verkeerd is toegewezen aan een spreker; hoe lager het percentage, hoe nauwkeuriger het model.
- Overlappende spraak
- De situatie waarin twee of meer sprekers gelijktijdig praten, wat voor spraaksoftware lastiger te verwerken is dan spraak na elkaar.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling vergeleken worden.
- Audiobuffer
- Een instelbaar stukje geluid dat het model tegelijk verwerkt; een langere buffer geeft meer nauwkeurigheid, een kortere buffer meer snelheid.
- Spraakherkenning
- Technologie die gesproken taal omzet in geschreven tekst, los van de vraag wie er spreekt.
- Realtime verwerking
- Het vermogen van software om audio te analyseren op het moment dat die binnenkomt, zonder noemenswaardige vertraging.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.