AI & computing › Generatieve AI & synthetische media
OpenArch: open-source project ontleedt bouwstenen van moderne taalmodellen
Een nieuw open-source project op GitHub herbouwt de architectuur van bekende AI-taalmodellen als Llama, Qwen en DeepSeek helemaal opnieuw, in leesbare code. OpenArch is bedoeld om te leren hoe deze modellen precies in elkaar zitten, niet om ze in productie te gebruiken.
Wie wil begrijpen hoe een taalmodel als Llama of DeepSeek onder de motorkap werkt, loopt al snel vast in productiecode die vooral is geoptimaliseerd voor snelheid en schaal. Ontwikkelaar anuj0456 probeert dat probleem op te lossen met OpenArch, een verzameling losse Python-bestanden die elk één transformer-architectuur helder en compact naspelen in het framework PyTorch. Het project telt inmiddels tien implementaties, van het relatief eenvoudige GPT-2 tot het gigantische Kimi K2 met naar schatting duizend miljard parameters.
Waarom nog een kopie van bestaande modellen?
OpenArch concurreert niet met bibliotheken als Hugging Face's Transformers, die worden gebruikt om modellen daadwerkelijk te draaien. Het doel is puur educatief: één overzichtelijk bestand per model, waarin keuzes als het type attention-mechanisme, de normalisatiemethode en de manier van positiecodering expliciet zichtbaar zijn. Dat maakt het makkelijker om architecturen naast elkaar te leggen en de verschillen te begrijpen. Het project bouwt voort op de LLM Architecture Gallery van AI-onderzoeker Sebastian Raschka, die tientallen moderne large language models catalogiseert en vergelijkt.
Van simpele attention tot complexe expertsystemen
De code laat zien hoe modelontwerpers in de afgelopen jaren steeds efficiëntere varianten hebben bedacht om tekst te verwerken. Vroege modellen gebruikten gewone multihead attention, waarbij elk stukje tekst apart wordt vergeleken met alle andere stukjes. Nieuwere modellen zoals Llama 3 en Gemma 3 gebruiken "grouped query attention", waarbij rekenwerk wordt gedeeld om geheugen te besparen. DeepSeek en Kimi gaan nog verder met "multihead latent attention", die de kern van de berekening comprimeert. Ook Mixture of Experts-architecturen komen aan bod: technieken waarbij een model tijdens het verwerken van tekst alleen een deel van zijn gespecialiseerde onderdelen inschakelt, in plaats van het hele netwerk. Dat maakt reusachtige modellen als GLM 4.5 en Llama 4 Maverick behapbaar om te trainen en te draaien.
Klein project, grote ambitie
Met tien sterren en één fork op GitHub is OpenArch vooralsnog een bescheiden initiatief. De maker zoekt actief naar bijdragers die nieuwe modellen willen toevoegen, documentatie willen schrijven of tests willen bouwen die de eigen code vergelijken met de officiële implementaties. Het uiteindelijke doel is om alle tweeënzeventig architecturen uit Raschka's overzicht na te bouwen, inclusief tekst-, beeld- en multimodale modellen. Het project is uitgebracht onder de Apache 2.0-licentie en bevat nadrukkelijk geen garanties: voor productiegebruik verwijst de maker naar de officiële, door de oorspronkelijke onderzoeksteams onderhouden code. Voor studenten, onderzoekers en nieuwsgierige programmeurs biedt het echter een zeldzaam compacte ingang in de vaak ondoorzichtige wereld van moderne open-weightmodellen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Projecten als OpenArch verlagen de drempel om te begrijpen hoe geavanceerde AI-taalmodellen technisch in elkaar zitten, wat de kennis over kunstmatige intelligentie minder afhankelijk maakt van een handvol grote techbedrijven. Naarmate meer mensen de bouwstenen van deze modellen doorgronden, kunnen ook kritischer vragen worden gesteld over hun werking, beperkingen en risico's. Educatieve, open code kan zo bijdragen aan een breder en kritischer publiek debat over AI.
- PyTorch
- Een populair softwareframework waarmee onderzoekers en ontwikkelaars neurale netwerken bouwen en trainen.
- Attention-mechanisme
- Het onderdeel van een taalmodel dat bepaalt welke woorden in een tekst het meest relevant zijn voor elkaar.
- Grouped Query Attention (GQA)
- Een efficiëntere variant van attention waarbij meerdere rekenkoppen gedeelde informatie gebruiken, wat geheugen en rekenkracht bespaart.
- Multihead Latent Attention (MLA)
- Een attention-techniek die de interne representaties comprimeert, waardoor grote modellen minder geheugen nodig hebben.
- RMSNorm
- Een normalisatietechniek die de waarden in een neuraal netwerk stabiel houdt tijdens het trainen, met minder rekenwerk dan oudere methodes.
- RoPE (Rotary Position Embedding)
- Een methode om een taalmodel te vertellen op welke positie in een zin elk woord staat, cruciaal om zinsverband te begrijpen.
- Open-weightmodel
- Een AI-model waarvan de getrainde parameters (gewichten) vrij beschikbaar zijn, zodat anderen het kunnen gebruiken, aanpassen of bestuderen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.