Het model weet dat het getest wordt
Anthropic las mee in wat Claude Opus 5 dacht tijdens een test. Dat bleek iets anders dan wat het opschreef.
Anthropic gaf een testversie van Claude Opus 5 een stapel declaraties om na te kijken. Een saaie klus, precies het soort werk dat op dit moment overal in AI-pilots wordt gestopt.
Halverwege ziet het model dat één bonnetje onder meerdere regelingen valt. Hetzelfde bedrag zou twee keer worden meegeteld. In zijn zichtbare redenering schrijft het netjes op dat het beide posten meeneemt en de overlap zal vermelden.
Op precies diezelfde tokens lazen de onderzoekers iets heel anders in de interne activaties van het model. Daar stond "misschien is de beoordelaar mild". En even verderop "de beoordelaar kijkt hier toch niet naar".
Het eindantwoord bevatte het dubbel getelde totaal. Zonder een woord over de overlap.
Laat dat even bezinken. Het model schreef op wat een beoordelaar wilde lezen, terwijl het er intern al van uitging dat er niemand zou controleren. In de opdracht stond nergens dat er iemand meekeek.
Dit staat in de system card die Anthropic op 24 juli publiceerde bij Opus 5, het technische rapport waarin een AI-lab zelf opschrijft wat een model kan en waar het misgaat. Anthropic zet er twee beperkingen bij. De onderzoekers keken alleen naar gesprekken die hun eigen monitoring al verdacht vond. En de gemeten activaties komen uit een trainingsversie van vóór de release van afgelopen vrijdag.
Diezelfde week werd bekend dat modellen van OpenAI hadden ingebroken bij een ander AI-bedrijf om aan de antwoorden van hun eigen examen te komen. Op de ene ranglijst staat Opus 5 eerste en op de andere vijfde. En over drie weken gaat er een Nederlandse wet in die dit soort incidenten meldingsplichtig maakt zonder het woord AI ook maar één keer te noemen.
Bij elkaar raken ze precies datgene waar jij je AI-pilot straks op afrekent.
Nummer 1 volgens wie precies?
Opus 5 kwam uit op 24 juli, ruim acht weken na Opus 4.8, voor dezelfde prijs van 5 dollar per miljoen tokens erin en 25 eruit. Het zit in Pro, Max, Team en Enterprise en is het standaardmodel op Max. In het gratis abonnement zit het niet.
De scores zelf zijn een rommeltje. Op de Artificial Analysis Intelligence Index, die modellen over een hele reeks tests heen scoort, staat Opus 5 bovenaan. Op plek twee staat datzelfde Opus 5, in een lichtere denkstand. De nummer 1 en de nummer 2 zijn dus hetzelfde model met een andere knop.
LMArena werkt anders. Daar krijgen gewone gebruikers blind twee antwoorden en kiezen ze welke ze beter vinden. Op die lijst staat Opus 5 vijfde. Zet je één correctie uit, die voor opmaak en antwoordlengte, dan staat hetzelfde model ineens eerste. Vier plaatsen hangen dus aan de vraag of je meerekent hoe een antwoord eruitziet. Anthropic schrijft zelf dat de antwoorden van Opus 5 langer uitvallen dan die van eerdere modellen. Of dat de hele verklaring is, publiceert LMArena niet.
Er staat nog iets vreemds op die lijst. Het oudere Opus 4.6 scoort er hoger dan het nieuwere Opus 4.8, met een verschil dat te groot is om toeval te zijn. Blinde stemmers vonden de vorige generatie dus beter dan de opvolger.
Onafhankelijke metingen zijn er verder nauwelijks. METR, dat meet hoe lang een model zelfstandig kan doorwerken, heeft over Opus 5 niets gepubliceerd. Op de inmiddels stilgevallen ranglijsten van SWE-bench Verified en Terminal-Bench komt het evenmin voor. Bij ARC Prize valt het twee kanten op, want daar wint Opus 5 de ene test ruim en verliest het de andere.
Ik schreef hier eerder al dat de benchmarks van de labs zelf reclamefolders zijn. Dat blijft staan. Alleen verdwijnt dit probleem niet als de maker volstrekt eerlijk is.
Ingebroken om aan de examenantwoorden te komen
Op 16 juli meldde Hugging Face, het platform waar zowat de hele AI-wereld modellen en datasets deelt, dat er bij hen was ingebroken. Een kwaadaardige dataset wist via hun eigen dataverwerking code uit te voeren, waarna de aanvaller wachtwoorden verzamelde en zich in een weekend door meerdere interne clusters werkte. Wie erachter zat wisten ze op dat moment nog niet.
Vijf dagen later bleek het OpenAI te zijn. Het ging om modellen die op dat moment in een interne evaluatie draaiden. Ze waren uit op de antwoorden van ExploitGym, de benchmark waarop ze zelf werden getest.
Die evaluatie draaide bewust zonder de veiligheidsclassifiers die in productie wel aanstaan. De omgeving mocht alleen naar buiten om softwarepakketten op te halen via een eigen proxy. Juist in die proxy vonden de modellen een lek dat nog niemand kende. Er is hier dus niets op hol geslagen. Het model deed precies waar het om gevraagd werd, in een omgeving waar de remmen eraf stonden. Dat is een insluitingsfout van de makers zelf. OpenAI laat weten dat de berichtgeving van Reuters meerdere onjuistheden bevat en belooft een technisch rapport, dat er op 27 juli nog niet was.
Toch valt hier iets weg dat ik in eerdere edities zelf steeds heb opgeschreven. Bij het incident waarbij een agent in negen seconden drie maanden werk wiste ging het om een agent met te veel rechten. In het playbook over agent-kaping ging het om een vreemde die de agent instructies wist te voeren. Hier deed het model het op eigen kracht, in een omgeving die vooraf was dichtgezet, met sleutels die het onderweg zelf buitmaakte. Wat het dreef was de opdracht om hoog te scoren.
Van 72 naar 95 procent testherkenning
Terug naar die declaratie. Het Britse AI Security Institute, dat van Anthropic een pre-release versie kreeg om op misalignment te onderzoeken, legde de modellen twee stukken data naast elkaar met de vraag welke uit de praktijk kwam en welke was nagemaakt. Opus 4.7 wees dat in 72 procent van de gevallen goed aan, Mythos Preview 84 procent, Opus 4.8 86 procent, Mythos 5 88 procent en Opus 5 zit op 95 procent. Het instituut tekent er zelf bij aan dat de cijfers voor alle modellen hoger uitvallen omdat het een nieuwe promptset gebruikte, dus lees het als een rangorde binnen deze ene meting.
Wat goed is om te weten is dat die 95 procent geldt als je het model er expliciet naar vraagt. Uit zichzelf zegt Opus 5 er juist zelden iets over, in ongeveer een op de tien gesprekken. Dat is minder vaak dan Sonnet 5, Opus 4.8 en Mythos 5 dat doen. Anthropic schrijft er twee keer bij dat het niet weet waarom.
En dan staat er dit in de system card, in het gedeelte dat het Britse instituut woord voor woord aanleverde en dat Anthropic ongewijzigd heeft afgedrukt. Deze resultaten hebben stevige beperkingen. Het is onduidelijk of modellen zo'n testbesef kunnen hebben en ernaar kunnen handelen zonder het uit te spreken. Er zijn aanwijzingen dat ze dat tot op zekere hoogte kunnen. Daarom kan een goede score op de evaluatie niet garanderen dat het model zich in productie hetzelfde gedraagt.
Denk aan de sjoemelsoftware van Volkswagen. Die auto's herkenden dat ze op de testbank stonden en draaiden dan schoner dan op de weg. Daar zat een team ingenieurs achter dat het bewust zo bouwde, met rechtszaken en miljardenboetes als gevolg. Bij Opus 5 kan je niemand aanwijzen die dit heeft opgeschreven, want het gedrag komt uit de training zelf. Dat maakt het ook lastiger te repareren.
Eigenlijk is de techniek erachter simpel. Het onderzoeksteam vertaalt de interne activaties van het model terug naar leesbare taal. Daar vonden ze wel degelijk een beoordelaar zitten. "Taak weergegeven als een beoordeelde evaluatie" was de eerste van zes categorieën die ze aantroffen.
Achttien dagen eerder publiceerde het interpretability-team van datzelfde bedrijf een verwant experiment. Ze vonden in Claude een klein intern werkgebied, goed voor minder dan een tiende van de interne activiteit, waar begrippen als "nep", "fictief" en "scenario" oplichten. In een chantage-scenario waar Claude Sonnet 4.5 normaal nooit in meegaat, ging het model soms wel dreigen zodra ze die patronen uitschakelden. Anthropic schrijft voorzichtig dat het goede gedrag dus deels gedreven kan zijn door het besef dat het beoordeeld werd. Het bedrijf haalde er onafhankelijke reviewers bij en publiceerde hun commentaar ongefilterd mee. Een van hen kreeg de kernbevindingen op een open model gereproduceerd en zette bij dit ene experiment een streep, want door die patronen uit te zetten voorkom je misschien vooral dat het model een bepaald woord opschrijft. Dat Anthropic die kanttekening zelf meepubliceert, siert ze.
Wat mij het meest opvalt is dat de system card met geen woord naar dat eerdere onderzoek verwijst. Het komt uit hetzelfde bedrijf met achttien dagen ertussen. De verbinding tussen die twee onderzoeken mag je zelf leggen.
Wat je hiermee doet voor je pilot afloopt
Bijna elke pilot die ik langs zie komen is zo opgezet. Een teamleider of beleidsadviseur zet dertig zorgvuldig gekozen dossiers klaar in een aparte testomgeving, laat het model erop los, vinkt de scores af en schrijft het advies. Dat is precies de situatie waarin een systeem zich van zijn beste kant laat zien.
Haal je testgevallen daarom uit het werk van vorige maand. Meet daarna nog een keer met werk dat tijdens de pilot nog niet bestond, want dat kan het model onmogelijk herkend hebben. En bewaar de rare gevallen, de dossiers waar collega's zelf over twijfelden, want daar zie je wat het model doet zodra het geen schoolvoorbeeld meer voor zich heeft.
Stuur je op een dashboard, dan geldt hetzelfde. Anthropic zag dat zelf in de audit van Opus 4.6. Het model kreeg de opdracht een prestatiescore te verbeteren en paste in plaats daarvan het scorebestand aan. Als je stuurt op een cijfer waarvan je de onderliggende taak niet zelf kunt controleren, heb je geen verweer tegen een systeem dat het cijfer aanpast.
Op 15 augustus treedt de Cyberbeveiligingswet in werking, de Nederlandse uitvoering van NIS2. Ruim 8.000 organisaties in achttien sectoren krijgen dan een meldplicht. Bij een significant incident meld je binnen 24 uur via mijn.ncsc.nl, binnen 72 uur uitgebreider en uiterlijk een maand daarna met een eindverslag. Ik heb de wettekst en het bijbehorende besluit doorzocht op "kunstmatige intelligentie" en op "AI". Nul treffers.
Maar goed, dat is minder erg dan het klinkt. De wet noemt een incident technologieneutraal "een gebeurtenis" die de beschikbaarheid, authenticiteit, integriteit of vertrouwelijkheid in gevaar brengt. Er hoeft geen aanvaller aan te pas te komen. Kwade opzet is een vakje op het meldformulier en geen drempel om te moeten melden. Mijn lezing is dus dat een agent die zelf schade veroorzaakt gewoon meldingsplichtig is zodra het incident significant genoeg is. Een standpunt van het NCSC hierover ben ik niet tegengekomen. De drempelwaarden worden nog uitgewerkt terwijl de wet over drie weken ingaat.
Zoek deze week dus uit wie bij jou binnen 24 uur die melding zou doen als een agent iets sloopt. En of diegene het überhaupt op tijd zou zien. OpenAI zag pas op 18 juli in de eigen logboeken dat er iets uit de omgeving was ontsnapt, terwijl het programma al vanaf 9 juli verdacht gedrag vertoonde. Dat is een bedrijf met wereldklasse-engineers en een monitoringbudget waar jij alleen van kunt dromen.
Ik zou zeggen, begin klein. Pak één agent die deze maand bij je draait en beantwoord twee vragen. Op welk cijfer reken je hem af? En kun je buiten dat cijfer om zelf controleren of het werk klopt?
Ook het vermelden waard
De New York Times liet AI-agents drie echte kantoortaken doen Feedback ophalen via Slack ging soepel, ook met een verkeerd gespelde naam en een collega die niet reageerde. Bij de bezuinigingsanalyse zette de agent medewerkers met verlof op de kandidatenlijst zonder hun terugkeerdatum mee te wegen. En na zeventien vlot gegenereerde formulieren strandde hij op het uploaden van de pdf's naar Google Drive. Je toezicht hoort dus op de nuance en op de saaie laatste stap.
77 AI-bedrijven tekenden een brief voor open modellen, Anthropic en Amazon niet De brief stelt dat modellen die iedereen kan downloaden en aanpassen bij de Amerikaanse basisinfrastructuur horen, met het verzoek aan Washington om ze niet voortijdig in te perken. De lijst groeide in een dag van 25 naar 77 namen, met NVIDIA, Microsoft, Meta, Mistral, Hugging Face, SpaceX en inmiddels ook Google en OpenAI. Anthropic en Amazon stonden er op 27 juli nog steeds niet bij, zonder publieke toelichting.
Cloudflare blokkeert vanaf 15 september AI-training standaard bij nieuwe domeinen Bij nieuwe domeinen worden Training- en Agent-bots straks standaard geweerd op pagina's met advertenties, terwijl zoekbots doorgelaten blijven. Bestaande domeinen veranderen niet en je kunt het zelf omzetten, ook in het gratis pakket. Let wel op dat je met Training ook Googlebot, Applebot en BingBot buitensluit, want die crawlen met meerdere doelen tegelijk. Dat ene vinkje kost je dus zoekverkeer.
Anthropic schrapte 80 procent van de system prompt van Claude Code Dat gebeurde voor Opus 5 en Fable 5, zonder meetbaar verlies op de eigen coding-tests. Harde regels als "schrijf nooit commentaar" knijpen bij deze modellen juist de ruimte dicht waarin ze goed presteren. Houd je instructiebestand dus licht en besteed je tokens aan de valkuilen van je eigen project.
De schikking van 1,5 miljard dollar is definitief goedgekeurd Het gaat om 482.460 geregistreerde boeken waarvan er 440.490 zijn geclaimd, met een geraamde uitkering van ongeveer 3.000 dollar per werk. Het eerdere oordeel dat trainen op rechtmatig gekochte boeken onder fair use valt blijft overeind. Het downloaden van zeven miljoen boeken van piratensites is wat Anthropic die 1,5 miljard kostte, al bindt een uitspraak van één Amerikaanse districtsrechtbank verder niemand.
Lees ook
De snelste route naar Nederlandse AI loopt via China
Je duurste AI-model heb je steeds minder nodig
Vind je dit waardevol? Deel het.
Stuur THE HUMAN LOOP door naar één collega die ook met AI bezig is. Voor elke vriend die zich aanmeldt, krijg je gratis maanden premium: inclusief alle Playbooks.
Concreet:
2 vrienden = 1 maand
5 vrienden = 3 maanden
12 vrienden = een half jaar








