AI & computing › Generatieve AI & synthetische media
Claude Code doet nu dagelijks onderhoud aan software van Anthropic zelf
AI-bedrijf Anthropic laat zijn eigen programmeertool Claude Code al enkele weken dagelijks onderhoud uitvoeren op interne apps. Van de 388 automatisch aangemaakte codewijzigingen werd 46 procent na controle goedgekeurd en doorgevoerd.
Anthropic test of zijn AI-assistent Claude Code zelfstandig het dagelijkse onderhoud van bedrijfssoftware kan overnemen. Volgens Boris Cherny, de Anthropic-ingenieur die Claude Code ontwikkelde, draait het systeem al enkele weken routines op alle platformen van het bedrijf: iOS, Android, desktop, web, de command line en de Agent SDK. In plaats van dat ontwikkelaars tijd kwijt zijn aan repetitief onderhoudswerk, doet de AI-programmeertool dat nu zelf. Cherny noemt de eerste resultaten 'verrassend positief'.
Twaalf vaste onderhoudsroutines
Het systeem werkt via een speciaal Slack-kanaal genaamd 'proj-claude-maintains-apps', waar Cherny in gewone taal opdrachten geeft. Er komt geen ingewikkelde technische instructie aan te pas: hij vraagt Claude simpelweg om dagelijks te controleren op crashes in de iOS-, Android- en desktopapp, om daarbij de echte applicatie te gebruiken in plaats van een nagebouwde testversie, en om bij problemen automatisch een oplossing voor te stellen.
In totaal draait Claude twaalf gespecialiseerde routines. Een 'Crash Fuzzer' opent apps in een simulator en tikt willekeurig rond om crashes uit te lokken, zoekt vervolgens de oorzaak en schrijft een reparatie. Een 'Dup Unifier' speurt de programmeercode door op bijna identieke stukjes code die zijn samen te voegen. De 'Dead Code Remover' verwijdert code die nooit meer wordt gebruikt; bij twijfel voegt het systeem eerst een meting toe om een dag later te controleren of het vermoeden klopt. Andere routines sporen instabiele tests op, halen overbodige functievlaggen weg van features die allang volledig zijn uitgerold, en vereenvoudigen ingewikkelde bedrijfslogica of overdreven complexe softwarestructuren.
Bijna de helft van de wijzigingen goedgekeurd
In de eerste paar weken produceerde Claude Code 388 pull requests verspreid over de repositories van Anthropic. Na een combinatie van automatische controle door Claude zelf en menselijke code review werden daarvan 180 goedgekeurd en doorgevoerd, een slagingspercentage van ongeveer 46 procent. Volgens Cherny doet de autonome AI-agent het meestal in één keer goed. Gaat het mis, dan stelt het team de betreffende routine bij, zodat de AI het de volgende dag beter doet. Dat bijstellen kost soms een paar dagen.
Meer dan de helft van de automatisch gegenereerde wijzigingen haalde de eindstreep dus niet. Dat laat zien dat de aanpak nog grenzen kent, maar ook potentie heeft. Anthropic onderzoekt inmiddels hoe het goedkeuringsproces voor dit soort mechanische aanpassingen sneller kan. Cherny omschrijft het experiment voorzichtig als 'vroege tekenen van leven' dat autonoom AI-onderhoud van software daadwerkelijk kan werken.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-tools als Claude Code betrouwbaar dagelijks onderhoud kunnen doen, verschuift het werk van softwareontwikkelaars van repetitieve klussen naar controle en bijsturing. Dat kan de ontwikkeling van software versnellen, maar vraagt ook om nieuwe processen om AI-gegenereerde code veilig te beoordelen voordat die live gaat.
- AI-programmeertool
- Software die met kunstmatige intelligentie meeschrijft, controleert of repareert aan programmeercode.
- Pull request
- Een voorstel om een wijziging in de broncode van een project door te voeren, dat eerst beoordeeld wordt voordat het wordt samengevoegd.
- Code review
- Het proces waarbij programmeurs elkaars (of AI-gegenereerde) code controleren op fouten en kwaliteit voordat die wordt geaccepteerd.
- Autonome AI-agent
- Een AI-systeem dat zelfstandig taken uitvoert, zoals het opsporen van fouten en het schrijven van oplossingen, zonder dat een mens elke stap aanstuurt.
- Fuzzing
- Een testtechniek waarbij software met willekeurige of onverwachte invoer wordt bestookt om crashes en fouten op te sporen.
- Dode code
- Programmeercode die nooit meer wordt uitgevoerd of aangeroepen, maar nog wel in de codebase aanwezig is.
- Technische schuld
- De opeenstapeling van snelle of onvolledige oplossingen in software, die later meer tijd kost om recht te zetten.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.