Anthropic is klaar met het vragen aan Claude Code-gebruikers om elke paar minuten op “akkoord” te klikken. Vanaf 14 augustus 2026 wordt Claude Code-autostand de standaardinstelling voor nieuwe sessies in de Pro-, Max- en Team-abonnementen, ter vervanging van de constante stroom toestemmingsverzoeken die al lange tijd bepalen hoe ontwikkelaars omgaan met AI-codeeragenten. Het bedrijf zegt dat het de gegevens heeft om deze overstap te onderbouwen, maar onafhankelijke commentaren — waaronder van ontwikkelaar en onderzoeker Simon Willison — suggereren dat het verhaal genuanceerder is dan een eenvoudige veiligheidswinst.
Summary
Belangrijkste punten
- Anthropic maakt de autostand de standaard voor Claude Code Pro-, Max- en Team-abonnementen vanaf 14 augustus 2026.
- In een test met 1.053 betalende gebruikers blokkeerde de autostand 89% van de gevaarlijke commando’s, terwijl menselijke testers slechts in 13,6% van de gevallen weigerden.
- Onafhankelijke beoordelaar Trajectory Labs voerde 720 indirecte prompt-injectieaanvallen uit op Claude Fable 5, Opus 5 en Sonnet 5 in autostand — geen enkele slaagde.
- Anthropic stopt met het in rekening brengen van de extra tokens die de classifier van de autostand per toolaanroep gebruikt.
- Analisten wijzen nog steeds op onopgeloste risico’s, waaronder kwaadaardige pakketten van derden die onopgemerkt gegevens kunnen exfiltreren.
Anthropic maakt Claude Code-autostand de standaard
De verschuiving beantwoordt een probleem waar Anthropic-ingenieurs openlijk over hebben gesproken: bevestigingsmoeheid. Een mens vragen om elke stap in de workflow van een AI-agent goed te keuren klinkt voorzichtig, maar in de praktijk leert het mensen om door prompts heen te klikken zonder ze echt te lezen. Volgens Anthropic vervangt autostand die herhalende goedkeuringslus door een classifier die elke toolaanroep controleert op acties die onomkeerbaar, destructief of duidelijk buiten de lijntjes zijn. Als de classifier iets markeert, zoekt Claude ofwel naar een veiliger pad of valt hij terug op het vragen om toestemming — en als blokkades zich blijven opstapelen, valt de hele sessie terug naar handmatige goedkeuring.
De uitrol heeft betrekking op Pro-, Max- en Team-abonnementen, tenzij een gebruiker of beheerder handmatig een andere toestemmingsinstelling heeft vastgezet. Anthropic verwijdert ook een kleine financiële drempel: volgens de eigen blogpost van het bedrijf over de wijziging worden de extra tokens die de classifier bij elke toolaanroep verbruikt niet langer in rekening gebracht.
Waarom is dit belangrijker dan alleen gemak? Anthropic zegt dat autostand nu al verandert hoe teams werken — Team- en Enterprise-klanten die het gebruiken, leveren naar verluidt ongeveer 25% meer pull requests op dan degenen die vertrouwen op handmatige goedkeuring. Dat is een betekenisvol productiviteitssignaal, maar het verhoogt ook de inzet: meer autonome codeeractiviteit betekent meer kansen dat er iets misgaat als de onderliggende veiligheidslaag niet solide is.
Blokkeert de autostand daadwerkelijk meer gevaarlijke commando’s dan mensen?
Ja, volgens Anthropic’s eigen tests — met een ruime marge. Het bedrijf voerde een studie uit onder 1.053 betalende testers waarbij, halverwege een normale sessie, een routinematig toestemmingsverzoek stilletjes werd vervangen door een duidelijk gevaarlijk commando. Elke tester kreeg exact hetzelfde scenario te zien. Het resultaat: slechts 13,6% van de mensen weigerde de schadelijke actie. De autostand, getest tegen hetzelfde commando, blokkeerde het in 89% van de gevallen.
De kloof wordt groter naarmate een sessie langer duurt. Anthropic meldde dat de menselijke waakzaamheid na 50 prompts daalde tot ongeveer 5% — een getal dat precies illustreert waarom het bedrijf bevestigingsmoeheid neerzet als een reëel veiligheidsrisico in plaats van een abstracte zorg. Mensen worden moe, afgeleid of zelfgenoegzaam. Een classifier wordt dat, althans in theorie, niet.
Toch snijdt de rekensom aan twee kanten. Dat blokkeerpercentage van 89% laat 11% van de gevaarlijke commando’s door de controles van de autostand glippen — een gat dat Anthropic zelf erkent. Het bedrijf blijft menselijke review aanbevelen voor wijzigingen die productiesystemen raken, wat suggereert dat zelfs Anthropic de autostand nog niet ziet als een volledige vervanging van menselijk oordeel.
Prompt-injectie: de grotere test voor de beveiliging van AI-codeeragenten
Het blokkeren van een duidelijk gevaarlijk commando is één ding. Het stoppen van een aanval die verborgen zit in content die de agent elders leest, is een heel ander probleem, en dat is precies waar beveiligingsonderzoekers zich het meest zorgen over maken. Prompt-injectie — kwaadaardige instructies insmokkelen in tekst, code of bestanden die een AI-agent later verwerkt — is herhaaldelijk aangemerkt als een centrale zwakte in de beveiliging van AI-codeeragenten, en Simon Willison heeft eerder voorspeld dat 2026 een ernstig beveiligingsincident zou kunnen brengen dat precies met dit soort kwetsbaarheid samenhangt.
Anthropic’s antwoord was om een externe controle te laten uitvoeren. Het bedrijf huurde Trajectory Labs in om de nieuwste openbaar beschikbare versies van Claude Code en Codex per 17 juli 2026 onafhankelijk te evalueren. Trajectory Labs ontwierp 72 indirecte prompt-injectie-scenario’s die waren uitgezonderd van Anthropic’s eigen training en tests, en voerde elk scenario vervolgens tien keer uit — in totaal 720 aanvalspogingen. Volgens de resultaten die Anthropic publiceerde, slaagde geen van de 720 pogingen tegen Claude Fable 5, Opus 5 of Sonnet 5 in autostand.
Dat is een opvallend resultaat, en het is de kop die Anthropic wil dat mensen onthouden. Thariq Shihipar, een van de vertegenwoordigers van Anthropic die het werk besprak tijdens een recente Fireside Chat, grapte op sociale media dat het rapport de titel “het dodelijke drietal verslaan” had kunnen krijgen — een verwijzing naar de combinatie van onbetrouwbare input, gevoelige data en agentautonomie die beveiligingsonderzoekers als de gevaarlijkste opstelling voor AI-systemen beschouwen. Cat Wu, een andere vertegenwoordiger van Anthropic die bij dat gesprek aanwezig was, zei dat het bedrijf “zo goed als elke aanval heeft gemitigeerd” die het heeft getest.
Willison blijft op zijn beurt voorzichtig sceptisch in plaats van overtuigd. Hij merkt op dat een nul-succesratio tegen 720 gecureerde aanvalspogingen bemoedigend is, maar niet hetzelfde als een bewijs tegen elke aanvalsvector die een tegenstander in de echte wereld zou kunnen proberen. Eén scenario dat hij specifiek aanhaalt: een kwaadaardig softwarepakket van een derde partij dat een codeeragent instrueert om extra bestanden op te halen en uit te voeren voordat legitieme commando’s worden uitgevoerd — bestanden die in dat proces stilletjes gegevens zouden kunnen exfiltreren. Het is onduidelijk of een versie van Claude Code-autostand dat soort indirecte supply-chain-achtige aanval zou oppikken, aangezien de kwaadaardige instructie er niet per se uitziet als een gevaarlijk commando op de manier waarop de classifier is ontworpen om te detecteren.
Wat nog onopgelost is
Onder dit hele gesprek liggen twee verschillende veiligheidsproblemen, en de autostand lost ze niet per se allebei even goed op. Het eerste is onbedoelde schade — een agent die de verkeerde bestanden verwijdert of een productiedatabase wist, simpelweg omdat hij een instructie verkeerd begreep. Het tweede, en het probleem waar beveiligingsonderzoekers zich meer zorgen over maken, is doelbewuste prompt-injectie, waarbij een aanvaller content die de agent vertrouwt, bewapent.
Willisons eigen conclusie neigt naar een meer structurele oplossing dan het vertrouwen op één enkele veiligheidslaag, hoe goed die in tests ook presteert. In plaats van volledig te vertrouwen op Anthropic AI-veiligheidsmechanismen die in het model of de classifier zijn ingebakken, zegt hij nu gemotiveerder te zijn om agentworkflows te ontwerpen die AI-systemen simpelweg geen toegang geven tot data of tools die schade kunnen veroorzaken als ze verkeerd worden geactiveerd. Dat is een wezenlijk andere houding dan “vertrouw de classifier” — het behandelt de autostand als één verdedigingslaag onder meerdere, niet als een kant-en-klare oplossing.
Het is ook vermeldenswaard dat Anthropic niet het enige grote AI-lab is dat met deze afweging worstelt. OpenAI zou er naar verluidt voor hebben gekozen om geen equivalente autostand standaard in te schakelen voor zijn meest capabele GPT-5.6-model, maar in plaats daarvan te kiezen voor een voorzichtiger, goedkeuringsgebaseerde aanpak — een teken dat zelfs binnen de sector nog geen consensus bestaat over hoeveel autonomie je een AI-codeeragent standaard veilig kunt geven.
FAQ
Wat is de autostand van Anthropic in Claude Code?
De autostand is een instelling die herhaalde menselijke goedkeuringsprompts vervangt door een classifier die is ontworpen om onomkeerbare of gevaarlijke toolaanroepen automatisch te blokkeren, en alleen terugvalt op handmatige goedkeuring wanneer blokkades zich herhalen of er een echt dubbelzinnige actie opduikt.
Hoe effectief is de autostand in het blokkeren van gevaarlijke commando’s in vergelijking met mensen?
In tests met 1.053 betalende gebruikers blokkeerde de autostand 89% van de gevaarlijke commando’s, terwijl slechts 13,6% van de menselijke testers dezelfde schadelijke actie weigerde — en de menselijke waakzaamheid daalde naar verluidt verder, tot rond de 5%, na 50 prompts in een sessie.
Voorkomt de autostand prompt-injectieaanvallen volledig?
Onafhankelijke tests door Trajectory Labs vonden geen enkele geslaagde prompt-injectieaanval onder 720 pogingen tegen Claude Fable 5, Opus 5 en Sonnet 5 in autostand. Dat gezegd hebbende, risico’s zoals kwaadaardige pakketten van derden die gegevens exfiltreren, worden mogelijk niet volledig afgedekt door het huidige systeem.
Welke veiligheidsrisico’s bestaan er nog steeds bij AI-codeeragenten ondanks de autostand?
Agenten kunnen nog steeds per ongeluk schadelijke acties uitvoeren, en geavanceerde aanvallen — met name aanvallen die via kwaadaardige codepakketten van derden verlopen — worden mogelijk niet betrouwbaar onderschept door de classifier van de autostand, volgens analyses van de door Anthropic gepubliceerde resultaten.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Wat is de autostand van Anthropic in Claude Code?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”De autostand is een instelling die herhaalde menselijke goedkeuringsprompts vervangt door een classifier die is ontworpen om onomkeerbare of gevaarlijke toolaanroepen automatisch te blokkeren, en alleen terugvalt op handmatige goedkeuring wanneer blokkades zich herhalen of er een echt dubbelzinnige actie opduikt.”}},{“@type”:”Question”,”name”:”Hoe effectief is de autostand in het blokkeren van gevaarlijke commando’s in vergelijking met mensen?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”In tests met 1.053 betalende gebruikers blokkeerde de autostand 89% van de gevaarlijke commando’s, terwijl slechts 13,6% van de menselijke testers dezelfde schadelijke actie weigerde — en de menselijke waakzaamheid daalde naar verluidt verder, tot rond de 5%, na 50 prompts in een sessie.”}},{“@type”:”Question”,”name”:”Voorkomt de autostand prompt-injectieaanvallen volledig?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Onafhankelijke tests door Trajectory Labs vonden geen enkele geslaagde prompt-injectieaanval onder 720 pogingen tegen Claude Fable 5, Opus 5 en Sonnet 5 in autostand. Dat gezegd hebbende, risico’s zoals kwaadaardige pakketten van derden die gegevens exfiltreren, worden mogelijk niet volledig afgedekt door het huidige systeem.”}},{“@type”:”Question”,”name”:”Welke veiligheidsrisico’s bestaan er nog steeds bij AI-codeeragenten ondanks de autostand?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Agenten kunnen nog steeds per ongeluk schadelijke acties uitvoeren, en geavanceerde aanvallen — met name aanvallen die via kwaadaardige codepakketten van derden verlopen — worden mogelijk niet betrouwbaar onderschept door de classifier van de autostand, volgens analyses van de door Anthropic gepubliceerde resultaten.”}}]}
Artikel geproduceerd met behulp van kunstmatige intelligentie en beoordeeld door de redactie.

