AI & computing › Generatieve AI & synthetische media

Nieuw lettertype maakt zichtbaar hoe AI tekst in tokens hakt

· Bijgewerkt 28 september 2026, 02:22 · 2 min leestijd

Generatieve AI & synthetische media
Foto: Cdr. Trevor D. Biscope, CA Emerit (CC BY-SA, via Openverse)

Een ontwikkelaar heeft een gratis tool gebouwd die van een lettertype een speciale versie maakt: eentje waarin elk stukje tekst dat een AI-taalmodel als los token ziet, precies even breed is of een eigen kleur krijgt. Het resultaat maakt in één oogopslag zichtbaar hoe chatbots als ChatGPT, Claude en DeepSeek een zin achter de schermen in stukjes hakken voordat ze hem verwerken.

Waarom taalmodellen in stukjes lezen

Grote taalmodellen lezen geen hele woorden of losse letters, maar tokens: brokjes tekst die kunnen bestaan uit een enkel teken, een lettergreep of een compleet woord. Voordat een taalmodel een vraag kan beantwoorden, knipt een zogeheten tokenizer de invoer eerst op in zulke stukjes. Elk AI-bedrijf gebruikt daarvoor een eigen systeem: OpenAI, Google, Meta en het Chinese DeepSeek hakken exact dezelfde zin allemaal iets anders op. Die opdeling is normaal onzichtbaar voor gebruikers, want in een chatvenster zie je gewoon doorlopende tekst.

Toch heeft die verdeling in tokens grote praktische gevolgen. Een taalmodel genereert antwoorden namelijk token voor token: het voorspelt telkens welk volgend brokje tekst het meest waarschijnlijk is, plakt dat erbij en herhaalt het proces. Hoe die tokenvoorspelling verloopt en welke stukjes tekst als één token tellen, bepaalt mede hoe snel en hoe goedkoop een AI-dienst werkt: minder tokens voor dezelfde boodschap betekent minder rekenwerk en dus lagere tokenefficiëntie-kosten.

Een lettertype als microscoop voor tokens

De nieuwe tool combineert een bestaand lettertype - bijvoorbeeld Inter, Roboto of het Discord-lettertype gg sans - met het tokenizer-bestand van een specifiek AI-model. De compiler bouwt daaruit een compleet nieuw lettertype, met extra opmaakregels op basis van de tokengrenzen. Gebruikers typen een stuk tekst in een testvenster en zien direct hoe die wordt opgeknipt: in de kleurmodus krijgt elk token een eigen tint, in de spatiëringsmodus krijgt elk token precies dezelfde breedte, ongeacht hoeveel letters erin zitten.

Het systeem ondersteunt tokenizers van onder meer OpenAI, Meta's Llama, Alibaba's Qwen, Google's Gemma en Gemini, en DeepSeek. Voor sommige tokenizers, zoals vermoedelijk die van Anthropics Claude-model, kon de maker de exacte tokengrenzen niet bevestigen en werkt de tool met een benadering. Het eindresultaat is telkens één lettertypebestand waarin de tokenregels zijn ingebakken, zodat er geen apart script nodig is om de opmaak te tonen.

Losse bugs en gebruik in Discord en Slack

Bij het testen kwamen ook eigenaardigheden aan het licht. Zo blijkt de tokenizer van DeepSeek bepaalde onzichtbare besturingstekens per ongeluk als spatie te behandelen, waardoor twee spaties gevolgd door zo'n teken worden samengevoegd tot één token. Bij de tokenizers van Meta's Llama 3 en het Chinese GLM-model lopen sommige tekstfragmenten tegen een ingebouwde limiet aan, waarna de tool dat stuk als 'buiten bereik' markeert in plaats van als correct token.

Naast de webtool bouwde de maker ook een thema voor de Discord-client Vesktop en een userscript voor Slack in de browser, zodat berichten van een gekozen gebruiker automatisch in het gecompileerde tokenlettertype verschijnen. Daarmee verschuift het project van een technisch hulpmiddel naar een speels experiment: berichten van AI-collega's of chatbots letterlijk laten zien volgens de bril van het taalmodel zelf.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Tools die tokenisatie zichtbaar maken, helpen ontwikkelaars en gebruikers beter te begrijpen waarom AI-modellen soms rekenfouten maken, dure prompts genereren of merkwaardig omgaan met spaties en leestekens. Naarmate taalmodellen een grotere rol krijgen in software en communicatie, wordt inzicht in dit soort onderliggende mechanismen steeds belangrijker voor het debuggen en optimaliseren van AI-toepassingen.

Token
Het kleinste stukje tekst dat een AI-taalmodel als aparte eenheid verwerkt, variërend van een letter tot een heel woord.
Tokenizer
Het onderdeel van een AI-systeem dat tekst opdeelt in tokens voordat het taalmodel ermee kan rekenen.
Byte Pair Encoding (BPE)
Een veelgebruikt algoritme dat veelvoorkomende letterreeksen samenvoegt tot losse tokens, waardoor tokenizers efficiënter met tekst omgaan.
Glyph
De visuele vorm van een letter of teken zoals die in een lettertype is vastgelegd.
Kerning
De typografische techniek waarbij de ruimte tussen twee specifieke letters wordt aangepast voor een natuurlijker lettertype.
Monospace-lettertype
Een lettertype waarin elk teken exact dezelfde breedte heeft, vaak gebruikt voor programmeercode.
Unicode
De internationale standaard die aan elk teken, symbool en emoji een uniek nummer toekent, zodat computers wereldwijd dezelfde tekens herkennen.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media