AI & computing › Agentic AI & autonome agents
Startup Speko laat AI automatisch het beste spraakmodel kiezen
Voice-AI-systemen draaien vaak op verouderde spraakmodellen omdat wisselen van leverancier te veel gedoe is. Het Y Combinator-startup Speko wil dat oplossen met een dienst die voortdurend de beste combinatie van spraakherkenning, taalmodel en spraaksynthese kiest en updatet.
Bedrijven die spraak-AI gebruiken voor klantenservice of andere voice agents, draaien vaak op verouderde technologie. Nieuwe modellen voor spraakherkenning en spraaksynthese verschijnen elke maand, maar het wisselen van leverancier is zo omslachtig dat bedrijven jarenlang op dezelfde combinatie blijven hangen. Het Amerikaanse startup Speko, deelnemer aan het techprogramma Y Combinator, wil dat probleem oplossen met een systeem dat automatisch de beste combinatie van spraakmodellen kiest en die keuze voortdurend actualiseert.
Drie lagen, één zwakke schakel
Een voice agent - een AI-agent die telefonisch met klanten praat - bestaat meestal uit drie onderdelen: een model dat spraak omzet in tekst (spraak-naar-tekst), een taalmodel dat een antwoord bedenkt, en een model dat dat antwoord weer omzet in gesproken taal (tekst-naar-spraak). Voor elk van die drie lagen zijn tientallen aanbieders beschikbaar, van grote techbedrijven tot gespecialiseerde AI-startups. Volgens Speko-oprichter Bek Uzakov testen bedrijven die combinatie meestal één keer grondig, bij de bouw van hun systeem, en raken ze daarna nooit meer bijgewerkt. Nieuwe, snellere of goedkopere modellen blijven vervolgens ongebruikt liggen omdat niemand de moeite neemt om opnieuw te testen.
Uzakov bouwde voor de oprichting van Speko vier jaar lang voice agents voor bedrijven in Azië, in meer dan tien talen. Telkens als er een nieuw spraakmodel verscheen, moest zijn team het handmatig laten beoordelen door moedertaalsprekers en vergelijken met het bestaande systeem. Dat proces heeft hij nu omgezet in een geautomatiseerde dienst.
Automatisch de beste combinatie kiezen
Klanten van Speko geven aan welke taal, regio en prioriteit ze hebben - bijvoorbeeld lage kosten, hoge nauwkeurigheid of lage latentie, de vertraging tussen spreken en antwoord. Het platform vergelijkt vervolgens de modellen die aan die eisen voldoen op basis van eigen benchmarks en kiest de best scorende combinatie. Om te voorkomen dat een oproep vertraging oploopt doordat het systeem eerst overlegt met een centrale server, haalt de dienst van tevoren alvast verbindingsgegevens op. Alleen als een gekozen aanbieder de verbinding weigert, activeert het systeem een failover naar de eerstvolgende beste optie.
Volgens Speko blijkt in de praktijk vaak dat bedrijven niet weten hoe slecht hun bestaande spraakherkenning presteert, bijvoorbeeld bij medisch vakjargon of bij langere, spontane gesprekken. Om onafhankelijk te blijven, verkoopt of traint Speko zelf geen spraakmodellen en publiceert het bedrijf ook de testresultaten waarin het zelf niet als beste uit de bus komt.
Discussie over de toekomst van voice AI
Niet iedereen is overtuigd van de aanpak. Op discussieplatform Hacker News, waar Speko zijn lancering aankondigde, wezen reageerders erop dat de sector juist afstapt van de opdeling in drie aparte modellen. Steeds meer bedrijven ontwikkelen één model dat spraak direct verwerkt tot spraak, zonder tussenstap via tekst. Dat zou sneller zijn en tot natuurlijkere resultaten leiden. Of losse routeringsdiensten zoals die van Speko op termijn nog nodig zijn, hangt dus af van hoe snel die nieuwe, geïntegreerde modellen de huidige driedelige aanpak verdringen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Voice-AI-diensten die klantcontact via de telefoon afhandelen, worden een steeds gewonere zaak. Doordat spraakmodellen razendsnel verbeteren, ontstaat er behoefte aan systemen die automatisch de beste en goedkoopste combinatie kiezen, zodat bedrijven niet vastzitten aan verouderde techniek. Tegelijk zet de opkomst van geïntegreerde spraakmodellen die alles in één stap doen, vraagtekens bij hoe lang de huidige aanpak met losse bouwstenen nog stand houdt.
- Spraak-naar-tekst (STT)
- Technologie die gesproken taal automatisch omzet in geschreven tekst.
- Tekst-naar-spraak (TTS)
- Technologie die geschreven tekst omzet in gesproken, natuurlijk klinkende taal.
- Large language model (LLM)
- Een groot taalmodel dat tekst begrijpt en zelf antwoorden genereert.
- Latentie
- De vertraging tussen een actie, zoals spreken, en de reactie van het systeem daarop.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende modellen met elkaar worden vergeleken.
- Failover
- Het automatisch overschakelen naar een alternatief systeem wanneer de eerste keuze uitvalt of weigert.
- Voice agent
- Een AI-systeem dat telefoongesprekken zelfstandig kan voeren, bijvoorbeeld voor klantenservice.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.