AI & computing › Generatieve AI & synthetische media
Thomson Reuters bouwt eigen AI-model in plaats van OpenAI te huren
Thomson Reuters heeft voor 40 miljoen dollar een eigen taalmodel gebouwd voor juridisch werk, in plaats van bestaande AI van OpenAI of Anthropic te huren. Het model, intern 'Thomson' genoemd, draait op het open Chinese model Qwen van Alibaba en is getraind op decennia aan eigen content. Alleen met toegang tot die exclusieve bedrijfsdata verslaat Thomson concurrenten als GPT-5.4; zonder die data blijft het duidelijk achter.
Het informatiebedrijf achter onder meer Reuters, Westlaw en Practical Law lanceert met Thomson zijn eerste eigen taalmodel. Volgens het bedrijf ging er ruim twee jaar aan personeel en rekenkracht in zitten, goed voor zo'n 40 miljoen dollar. Het vaker genoemde bedrag van 450.000 dollar slaat alleen op de laatste trainingsronde van de huidige versie. Zelfs het volledige bedrag telt de echte investering niet volledig mee: decennia aan content uit Westlaw, Practical Law, Checkpoint en Reuters, plus de werkuren van honderden juridische experts.
Eigen data als wapen
De basis is Qwen3.5-397B, het meest recente open model van techbedrijf Alibaba. Samen met het Imperial College in Londen trainde Thomson Reuters dit Chinese model eerst opnieuw op veiligheid, ethiek en politieke neutraliteit. Deze tussenversie kreeg de naam 'Snowdon', naar de berg in Wales. Daarna volgde training op de eigen content van het bedrijf, aangevuld met inbreng van vakexperts en reinforcement learning binnen de eigen software-omgevingen. Opvallend: minder dan 10 procent van alle beschikbare content is tot nu toe gebruikt. Technologiedirecteur Joel Hron zegt dat het bedrijf het onderliggende open source-model al zo'n zes keer heeft ververst. Volgens onderzoeksdirecteur Jonathan Schwartz zit de echte winst niet in dit ene model, maar in de 'modelfabriek' die het bedrijf heeft opgebouwd.
De eigen testresultaten zijn wisselend. Op de juridische maatstaf Stanford LegalBench scoort Thomson 0,823, lager dan Gemini 3.1 Pro en GPT-5.5. Op de Harvey Legal Agent Benchmark eindigt het net achter Opus 4.8. Thomson doet het wel goed op het volgen van instructies en op de test PrBench Legal, maar valt duidelijk terug bij redeneren en programmeren. Veelzeggend is het interne Deep Research-experiment: met alleen internettoegang haalt Thomson een feitelijke nauwkeurigheid van 0,53, tegen 0,65 voor GPT-5.4. Krijgt het model toegang tot de eigen bedrijfscontent, dan wint Thomson nipt met 0,83 tegen 0,82. GPT-5.4 verbetert echter bijna even sterk met diezelfde data, wat laat zien dat toegang tot goede bronnen minstens zo belangrijk is als de training zelf.
Waarom geen kant-en-klaar model?
Thomson Reuters noemt drie redenen om niet simpelweg een bestaand model van OpenAI of Anthropic te fine-tunen. Ten eerste de kosten: standaardtechnieken voor fine-tuning tasten volgens onderzoeksdirecteur Schwartz al snel de algemene vaardigheden van een model aan, en een bedrijf blijft dan afhankelijk van de rekenkosten en planning van de leverancier. Ten tweede de data: de grootste prestatiewinst komt juist uit training binnen eigen tools zoals Westlaw, en die toegang deelt het bedrijf niet met buitenstaanders. Ten derde het zogeheten 'cumulatie-effect': elke beoordeling door een vakexpert wordt weer trainingsmateriaal. Bij een extern model verdwijnt die waarde bij de leverancier; bij een eigen model blijft ze binnenboord.
Thomson wordt eerst ingezet in de functie Tabular Analysis van het product CoCounsel Legal, waar een kleiner en goedkoper model economisch zin heeft. Klantgegevens gaan volgens het bedrijf niet in de training. Een kleinere versie verschijnt bovendien als open-weightmodel op Hugging Face, onder een niet-commerciële licentie.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Het voorbeeld van Thomson Reuters laat zien dat bedrijven met unieke data en veel vakexperts een eigen AI-model kunnen bouwen dat op specifieke taken net zo goed of beter presteert dan de grote algemene taalmodellen. Voor de meeste organisaties, die geen exclusieve datasets of manier hebben om resultaten objectief te meten, blijft het inhuren van bestaande AI-modellen waarschijnlijk goedkoper en praktischer.
- Taalmodel (large language model)
- Een AI-systeem dat getraind is om tekst te begrijpen en te genereren, de basis onder chatbots zoals ChatGPT.
- Fine-tuning
- Het bijschaven van een bestaand AI-model met extra, specifieke data zodat het beter wordt in een bepaalde taak.
- Open-weightmodel
- Een AI-model waarvan de onderliggende parameters openbaar zijn, zodat anderen het gratis of onder voorwaarden kunnen gebruiken en aanpassen.
- Test-tijdschaling
- Een techniek waarbij een AI-model tijdens het genereren van een antwoord extra rekentijd krijgt om beter te redeneren, in plaats van alleen tijdens de training slimmer te worden.
- Instructievolging
- De mate waarin een AI-model precies doet wat er in een opdracht wordt gevraagd, een belangrijke maatstaf bij het beoordelen van taalmodellen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.