Sequence-to-sequence model: hoe computers de ene reeks in een andere vertalen
Stel je een simultaantolk voor die een Engelse zin hoort en die meteen in het Nederlands naspreekt. De tolk luistert eerst de hele gedachte af, vormt in zijn hoofd een soort samenvatting van de betekenis, en zet die betekenis vervolgens om in nieuwe woorden in een andere taal. Een sequence-to-sequence model, vaak afgekort tot seq2seq, doet in software precies dit: het neemt een reeks (bijvoorbeeld een zin, een stuk audio of een programmeercode) en produceert daaruit een andere reeks, zonder dat de twee even lang hoeven te zijn.
Deze aanpak ligt aan de basis van machinevertaling zoals Google Translate, van automatische samenvattingen, van spraakherkenning en, in een moderne, uitgebreide vorm, ook van chatbots zoals ChatGPT. Het bijzondere is dat een seq2seq-model niet woord voor woord een vaste vertaalregel volgt, zoals oudere vertaalsoftware deed, maar zelf leert welke patronen in taal, klank of code bij elkaar horen door te oefenen op miljoenen voorbeelden.
Wat is het precies?
Een sequence-to-sequence model bestaat in de klassieke opzet uit twee delen: een encoder en een decoder. De encoder leest de invoerreeks, bijvoorbeeld een Engelse zin, woord voor woord in en bouwt daarvan een wiskundige samenvatting op, een lange lijst getallen die de betekenis en context van de zin vastlegt. Deze samenvatting heet een vector of, bij de eerste modellen, de "hidden state".
De decoder krijgt vervolgens die samenvatting en genereert daaruit stap voor stap de uitvoerreeks, bijvoorbeeld de Nederlandse vertaling. Bij elke stap voorspelt het model het meest waarschijnlijke volgende woord, gebaseerd op wat het al heeft gegenereerd en op de samenvatting van de encoder.
De eerste versies van dit idee, gepubliceerd in 2014 door onderzoekers van Google (Ilya Sutskever, Oriol Vinyals en Quoc Le) en onafhankelijk door een team rond Kyunghyun Cho, gebruikten hiervoor recurrente neurale netwerken (RNN's), en specifiek een variant genaamd LSTM (long short-term memory). Dit zijn netwerken die informatie stap voor stap verwerken en een soort geheugen bijhouden, wat geschikt is voor reeksen zoals taal.
Een belangrijk probleem van de vroege modellen was dat de hele invoerzin in één vaste samenvatting moest passen, wat bij lange zinnen tot informatieverlies leidde. De oplossing, geïntroduceerd door Dzmitry Bahdanau en collega's in 2014-2015, heet attention (aandacht). Hiermee kan de decoder bij elke stap terugkijken naar alle delen van de oorspronkelijke zin en zelf bepalen welke woorden op dat moment het belangrijkst zijn, in plaats van te vertrouwen op één samengeperste samenvatting.
In 2017 verscheen met het artikel "Attention Is All You Need" van onderzoekers bij Google een nieuwe architectuur: de Transformer. Deze laat de recurrente netwerken helemaal vallen en bouwt uitsluitend op attention-mechanismen, waardoor training veel sneller parallel kan verlopen. Vrijwel alle moderne taalmodellen, inclusief de grote taalmodellen achter huidige chatbots, zijn varianten op dit Transformer-principe en blijven in de kern een vorm van sequence-to-sequence verwerking, ook al wordt de encoder soms weggelaten (zoals bij puur generatieve modellen die alleen een decoder gebruiken).
Wat wil men ermee bereiken?
Het uiteindelijke doel van sequence-to-sequence onderzoek is om computers flexibel om te laten gaan met taken waarbij invoer en uitvoer allebei reeksen zijn met een variabele, onvoorspelbare lengte. Voor 2014 moesten ontwikkelaars voor elke taak (vertalen, samenvatten, spraak omzetten naar tekst) aparte, sterk op regels gebaseerde systemen bouwen met veel handmatig werk van taalkundigen.
Seq2seq-modellen beloven een generieke aanpak: hetzelfde soort netwerk kan, mits getraind op de juiste voorbeelden, worden ingezet voor vertaling, samenvatting, dialoog of zelfs het omzetten van wiskundige formules of programmeercode. Dat maakt onderzoek en ontwikkeling efficiënter, omdat verbeteringen aan de basisarchitectuur direct meerdere toepassingen ten goede komen.
Een tweede doelstelling is kwaliteit: taal is context-afhankelijk en dubbelzinnig, en de hoop is dat een lerend systeem, in tegenstelling tot vaste regels, subtiliteiten als woordvolgorde, idioom en zinsopbouw beter kan vangen door simpelweg genoeg voorbeelden te zien.
Voorbeelden uit de praktijk
Google Neural Machine Translation (GNMT), geïntroduceerd in 2016, was een van de eerste grootschalige, publiek gebruikte toepassingen van seq2seq met attention. Het verving de oudere, op statistiek gebaseerde vertaalsystemen van Google Translate en leverde volgens Google's eigen onderzoek merkbaar vloeiendere vertalingen op.
Listen, Attend and Spell, gepubliceerd in 2015 door onderzoekers van Carnegie Mellon University en Google, paste hetzelfde encoder-decoderprincipe met attention toe op spraakherkenning: audio als invoerreeks, tekst als uitvoerreeks.
Fairseq, een open-source toolkit van Meta AI (destijds Facebook AI Research), gebouwd rond seq2seq- en Transformer-architecturen, wordt sinds 2017 breed gebruikt in onderzoek naar vertaling en taalgeneratie en lag mede aan de basis van meerdere prijswinnende vertaalsystemen bij internationale vertaalcompetities (WMT).
Automatische tekstsamenvatting, zoals toegepast in nieuwsaggregators en onderzoeksdatasets als CNN/DailyMail, gebruikt seq2seq-modellen om lange artikelen om te zetten in korte samenvattingen, waarbij het model leert welke zinnen en woorden de kern van een tekst vormen.
Moderne code-assistenten, zoals modellen die programmeercode genereren uit een beschrijving in gewone taal, bouwen voort op dezelfde encoder-decoder- en Transformer-principes, waarbij de "invoerreeks" een instructie in natuurlijke taal is en de "uitvoerreeks" broncode.
Hoe ver is de techniek?
De kernprincipes van sequence-to-sequence modellen zijn inmiddels breed gerijpt en volledig geïntegreerd in commerciële producten: machinevertaling, ondertiteling, spraakassistenten en samenvattingstools werken dagelijks voor miljoenen gebruikers op basis van deze aanpak.
De ontwikkeling ging in twee grote sprongen: eerst de introductie van RNN-gebaseerde encoder-decodermodellen in 2014, daarna de doorbraak van attention (2014-2015) die de kwaliteit bij lange zinnen sterk verbeterde, en tot slot de Transformer in 2017 die trainingssnelheid en schaalbaarheid enorm vergrootte. Sindsdien is de vooruitgang vooral gedreven door schaal: grotere modellen, meer trainingsdata en meer rekenkracht, eerder dan fundamenteel nieuwe architecturen.
Belangrijke obstakels blijven bestaan. Modellen kunnen "hallucineren", dat wil zeggen plausibel klinkende maar feitelijk onjuiste uitvoer genereren, vooral bij samenvatting en open dialoog. Vertalingen van talen met weinig beschikbare trainingsdata (zogeheten low-resource languages) blijven aanzienlijk minder betrouwbaar dan bijvoorbeeld Engels-Nederlands. Daarnaast vergt training van de grootste modellen enorme hoeveelheden rekenkracht en energie, wat kosten en milieu-impact met zich meebrengt.
Ook is er discussie over hoe goed deze modellen taal daadwerkelijk "begrijpen" versus statistische patronen herkennen; dit is een open onderzoeksvraag zonder consensus.
Wie werken eraan?
Google (via Google Research en Google DeepMind, ontstaan na de fusie van Google Brain en DeepMind) speelde een grondleggende rol, met de originele seq2seq-publicatie in 2014 en de Transformer-architectuur in 2017.
Het Montreal Institute for Learning Algorithms (MILA), verbonden aan de Université de Montréal en onder leiding van onder meer Yoshua Bengio, droeg met Kyunghyun Cho en Dzmitry Bahdanau bij aan zowel de encoder-decoderaanpak als het attention-mechanisme.
Meta AI (voorheen Facebook AI Research) ontwikkelt en onderhoudt fairseq en doet doorlopend onderzoek naar vertaal- en taalmodellen op seq2seq-basis. OpenAI, Microsoft Research en Carnegie Mellon University zijn eveneens actief in vervolgonderzoek, met name naar spraak- en taalgeneratie.
Op landelijk niveau investeren vooral de Verenigde Staten, Canada (via MILA en Vector Institute) en China (met bedrijven als Baidu en Alibaba, actief in vertaal- en spraaktechnologie) fors in dit onderzoeksveld. Ook Europese instituten en universiteiten dragen bij, onder meer via het jaarlijkse WMT-vertaalcongres waar internationale onderzoeksgroepen hun systemen vergelijken.
Verder lezen
- arXiv.org — preprintarchief met de originele wetenschappelijke publicaties over seq2seq, attention en de Transformer
- Google AI — onderzoekspublicaties en blogposts van Google over machinevertaling en taalmodellen
- Meta AI — informatie over fairseq en onderzoek naar taal- en vertaalmodellen
- Association for Computational Linguistics (ACL) — vakvereniging en conferenties voor computerlinguïstiek en taaltechnologie
- TensorFlow — officiële documentatie en tutorials over het bouwen van sequence-to-sequence modellen