AI & computing › Generatieve AI & synthetische media
Claude Opus 4.8 geeft eerlijker toe wanneer het een fout maakt
AI-bedrijf Anthropic lanceert donderdag Claude Opus 4.8, een nieuwe versie van zijn taalmodel die volgens de makers eerlijker is over eigen onzekerheden en fouten. Het model doet minder vaak onderbouwde claims die het niet kan waarmaken en laat viervoudig minder programmeerfouten ongemerkt passeren dan zijn voorganger.
Grote taalmodellen zoals large language models hebben een bekend probleem: ze presenteren hun antwoorden vaak zelfverzekerd, ook als de onderbouwing dun is. Anthropic zegt dat probleem bij Opus 4.8 te hebben aangepakt. Volgens het bedrijf markeert het model vaker expliciet waar het onzeker over is, in plaats van te doen alsof een taak succesvol is afgerond terwijl dat niet zo is.
Anthropic traint zijn modellen naar eigen zeggen al langer op eerlijkheid, onder meer door ze te leren geen claims te maken die ze niet kunnen onderbouwen. Bij Opus 4.8 zou die aanpak verder zijn verbeterd. Testers die vroegtijdig toegang kregen tot het model melden dat het minder snel conclusies trekt op basis van te weinig bewijs. In eigen tests van Anthropic laat Opus 4.8 ongeveer vier keer minder vaak fouten in zelfgeschreven code ongemerkt passeren dan het vorige model.
Zelf bepalen hoeveel moeite het model doet
Naast de eerlijkheidsverbeteringen introduceert Anthropic een nieuwe instelling waarmee gebruikers kunnen bepalen hoeveel "moeite" Claude in een taak steekt. Bij een hogere inspanning gebruikt het model meer rekenkracht en dus meer tokens, de rekeneenheden waarin AI-taalmodellen tekst verwerken. Kiezen gebruikers voor een lagere inspanning, dan krijgen ze sneller een antwoord terug en verbruiken ze minder van hun beschikbare gebruikslimiet. Daarmee krijgen gebruikers meer grip op de balans tussen snelheid, kosten en grondigheid.
Honderden subagents tegelijk aan het werk
Een tweede nieuwe functie heet dynamic workflows en is voorlopig alleen beschikbaar als preview. Hiermee kan Claude grotere, complexere taken aanpakken door het werk zelf op te delen. Het model plant de aanpak en zet vervolgens honderden parallelle subagents in binnen één sessie: kleinere, gespecialiseerde instanties van het model die gelijktijdig aan deelopdrachten werken. Dit type agentic AI, waarbij een systeem zelfstandig stappen plant en uitvoert, wint dit jaar snel terrein bij grote AI-aanbieders. Met Opus 4.8 kunnen deze subagents bovendien langer doorwerken dan voorheen. Nadat alle deelresultaten binnen zijn, controleert Claude de uitkomsten voordat het geheel aan de gebruiker wordt teruggekoppeld.
Anthropic hoort bij de partijen die vooroplopen in de ontwikkeling van zogeheten frontier AI, de meest geavanceerde AI-modellen die op de markt beschikbaar zijn. Concurrenten als OpenAI en Google werken aan vergelijkbare verbeteringen op het gebied van betrouwbaarheid en zelfstandig takenbeheer. Dat onderstreept hoe belangrijk AI-bedrijven het vinden dat gebruikers hun modellen kunnen vertrouwen, zeker nu AI steeds vaker wordt ingezet voor taken waarbij fouten grote gevolgen kunnen hebben, zoals softwareontwikkeling en onderzoek.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-modellen zelfstandiger taken uitvoeren, wordt het steeds belangrijker dat ze eerlijk zijn over hun eigen onzekerheden en fouten. Verbeteringen zoals bij Opus 4.8 kunnen het vertrouwen in AI-systemen vergroten, vooral bij toepassingen zoals programmeren en onderzoek waar onopgemerkte fouten grote gevolgen hebben. Tegelijk laat de introductie van instelbare inspanning en massaal parallelle subagents zien dat AI-bedrijven toewerken naar systemen die grotere, complexere taken zelfstandig kunnen afhandelen.
- Large language model
- Een AI-systeem dat getraind is op grote hoeveelheden tekst en op basis daarvan mensachtige taal kan genereren en begrijpen.
- Tokens
- De kleine tekstfragmenten waarin AI-taalmodellen tekst opsplitsen om te kunnen verwerken; hoe meer tokens gebruikt worden, hoe meer rekenkracht een taak kost.
- Agentic AI
- AI-systemen die niet alleen antwoorden geven, maar zelfstandig stappen plannen en taken uitvoeren om een doel te bereiken.
- Subagent
- Een kleinere, gespecialiseerde instantie van een AI-model die als onderdeel van een grotere taak zelfstandig een deelopdracht uitvoert.
- Frontier AI
- De meest geavanceerde generatie AI-modellen die op enig moment beschikbaar is, doorgaans ontwikkeld door de grootste AI-bedrijven.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.