AI / GenAI·12 min·1 september 2026

Claude Fable 5.1 is er, en de winst zit in de cache

Van alle modelreleases die ik dit jaar heb gevolgd, heeft die van Fable de gekste boog. Op 9 juni kwam Fable 5 uit, het eerste Mythos-model dat iedereen mocht gebruiken. Ik heb er een middag echt werk doorheen gejaagd en er over geschreven. Drie dagen later lag het eruit, stilgelegd op last van de Amerikaanse overheid, en toen was de vraag niet meer wat het model kon maar of je er iets op durfde te bouwen.

Vandaag, 1 september, staat er een opvolger. Claude Fable 5.1 en Claude Mythos 5.1, aangekondigd op het blog van Anthropic en tegelijk uitgevent in een thread van acht posts, woordelijk gelijk op het officiële Threads-account en op X. Ik heb beide threads gelezen, daarna de aankondiging, daarna de docs. Het cijfer dat het meest voor je rekening uitmaakt staat in de thread pas op plek vijf, en op de aankondigingspagina onder het kopje kosten.

Anthropic zette er ook een video bij, van iets meer dan een minuut, waarin Alex Albert van Research Product Management de release toelicht. Die staat hieronder.

"Introducing Claude Fable 5.1" op het kanaal Anthropic and Claude, gepubliceerd op 1 september 2026. Ik heb de video niet uitgeschreven, dus alles hieronder komt uit de aankondiging en de docs, niet uit wat er in beeld wordt gezegd.

Wat er is aangekondigd

Het zijn twee modellen op één set gewichten. Fable 5.1 is algemeen beschikbaar, Mythos 5.1 is hetzelfde model met lossere veiligheidsfilters en alleen te krijgen via toelatingsprogramma’s. Dat onderscheid stond er bij versie 5 ook al. Anthropic legt in een voetnoot bij die release uit dat fabula en mythos allebei “dat wat verteld wordt” betekenen, en dat de safeguards het enige verschil zijn.

WatFable 5.1Waar het vandaan komt
Model-idclaude-fable-5-1Claude API, Bedrock, Google Cloud, Microsoft Foundry, Claude Platform op AWS
Prijs invoer / uitvoer$10 en $50 per miljoen tokensOngewijzigd ten opzichte van Fable 5
Cache lezen$0,25 per miljoen tokensWas $1, dus 75% eraf
Cache schrijven$12,50 (5 min) en $20 (1 uur)Ongewijzigd
Contextvenster1M tokens, uitvoer tot 128KZelfde klasse als Opus 5 en Sonnet 5
Standaard efforthighIn Cowork en op claude.ai staat de standaard op medium
Kennisafkapjuni 2026Zowel training als betrouwbare kennis
Uitfaseringniet eerder dan 1 september 2027Docs, statuspagina van het model

Mythos 5.1 kost precies hetzelfde en staat in de prijstabel met de aantekening “limited availability”. Toegang loopt via twee programma’s: het Cyber Verification Program voor defensief beveiligingswerk, dat binnenkort ook Mythos-modellen gaat aanbieden, en het Life Sciences Verification Program, waarvan Anthropic schrijft dat de eerste deelnemers in samenwerking met de Amerikaanse overheid zijn toegelaten. Claude Security, het product dat codebases op kwetsbaarheden scant, draait sinds vandaag op Mythos 5.1.

De prijsverandering zit in de cache

In de thread staat de cacheprijs als vijfde post, tussen de benchmarks en de veiligheidsclaims in, en ik las er bij de eerste doorloop overheen.

Hoe de prompt-cache precies werkt heb ik uitgelegd in het stuk over mijn dagelijkse loop; de korte versie is dat een herkend stuk aan de voorkant van je verzoek tegen het cache-tarief gaat in plaats van tegen de invoerprijs. Bij vrijwel alle Claude-modellen ligt dat tarief op 0,1 keer de invoerprijs. Bij Fable 5.1 en Mythos 5.1 is het 0,025 keer, staat in de docs.

In geld: teruglezen ging van $1 naar $0,25 per miljoen tokens. Anthropic rekent voor wat dat doet met de totale rekening, en dat cijfer is niet uit een model gehaald maar uit vier weken echt verbruik in augustus 2026, gemeten op de standaard-effortstand. Voor een gemiddelde werklast over Claude Enterprise, Claude Code en de API zakt de geïndexeerde kostprijs van 100 naar 75. Voor context- en toolzware werklasten, waar het teruglezen het grootste deel van de rekening is, zakt hij naar 55.

Wie een lange sessie draait waarin dezelfde projectcontext honderd keer opnieuw langskomt, betaalt daar dus een kwart van het oude tarief voor. Wie korte losse verzoeken doet met steeds nieuwe context, merkt er weinig van, want de invoer- en uitvoerprijs staan stil. In het stuk over wat mijn dagelijkse loop kost schreef ik dat een dagelijkse taak per definitie nooit een warme cache heeft. Die conclusie verandert hier niet door. De korting geldt voor het teruglezen binnen een sessie, en een taak die één keer per dag start heeft binnen zichzelf wel degelijk een prefix die telkens terugkomt, maar tussen twee runs door niets.

Wat er in je agent verandert zonder dat je iets wijzigt

De migratiegids noemt drie gedragsveranderingen die optreden zonder codewijziging, en de eerste kost je geld op precies de plek waar de cachekorting het teruggeeft.

Minder parallelle toolaanroepen. In lange agentloops waar de volgende onafhankelijke leesacties alleen impliciet uit de taak volgen, doet Fable 5.1 soms één toolaanroep per beurt waar Fable 5 er meerdere bundelde. De docs noemen als plekken waar dit opvalt: eigen coding-agents, bash-en-editor-harnassen, computer use. Elke extra beurt kost tokens, een round trip en wachttijd. Wat er volgens dezelfde bron niet slechter van wordt, is het antwoord. Een verzoek waarin je expliciet meerdere dingen noemt om op te halen loopt nog gewoon parallel, en er staat een kant-en-klare instructieregel in de prompting-gids om het gedrag terug te zetten.

Minder voortgangsmeldingen tijdens lange toolreeksen. Het model schrijft minder tekst tussen de toolaanroepen door, sterker naarmate de effortstand hoger staat, en zijn samenvattingen na een codeersessie zijn korter. Hangt je interface daarop, dan zet je thinking.display op "updates" of "summarized" en vraag je expliciet om een openingsregel, tussenstanden en een afsluiting.

Minder zoek- en ophaalacties. De derde staat in het rijtje van de migratiegids en gaat dezelfde kant op: het model doet het uit zichzelf zuiniger.

Daarnaast staan er twee harde breaking changes in de docs, en de eerste raakt alleen wie zelf de messages-array bouwt. Als je iets wijzigt dat vóór een thinking-blok staat, dus de systeemprompt, de tools of een eerdere beurt, dan geeft het volgende verzoek een fout. Claude Code, claude.ai, Managed Agents en de Agent SDK houden die prefix zelf intact. De controle wordt afgedwongen voor accounts die op of na 31 augustus 2026 zijn aangemaakt; oudere accounts krijgen hem pas als ze er zelf om vragen via een parameter. Mythos 5.1 draait de controle niet.

Wat die drie punten samen doen met het werk, is nog niet uit een meting te halen. De scherpste beschrijving die ik erover zag komt van Ado, een gebruiker die acht minuten na de aankondiging op X schreef dat het model verder in een taak komt voordat het je nodig heeft, dat het zegt wanneer het vastzit in plaats van te doen alsof dat niet zo is, en dat het de makkelijk ogende omweg overslaat om de werkelijke oorzaak aan te pakken. Dat is een losse waarneming van een enkele persoon op de dag van de lancering, geen officiële claim en niet nagemeten, dus behandel het als een hypothese om zelf te toetsen. De twee harde regels in diezelfde post, dezelfde prijs als Fable 5 en 75% goedkopere cache-reads, komen wel overeen met de prijstabel.

De tweede breaking change is subtieler en interessant voor iedereen die een router of fallback tussen modellen heeft hangen. Een thinking-blok onthoudt welk model het gemaakt heeft, en dat is éénrichtingsverkeer: Fable 5.1 leest de thinking-blokken van oudere modellen, geen enkel ouder model leest die van Fable 5.1. Schakel je halverwege een gesprek terug naar bijvoorbeeld Opus 5, dan gooit de API die blokken weg voordat het model ze ziet. Ze tellen niet mee in input_tokens en je betaalt er niet voor, maar zonder een beta-header krijg je ook geen melding dat het gebeurd is.

De benchmarks, inclusief het cijfer dat minder goed uitkomt

De thread noemt harde getallen: 52,6% op Terminal-Bench-Science 0.1, ruim het dubbele van Fable 5, en 55,8% op Terminal-Bench 4.0 tegen 42,0% voor Fable 5. Op de aankondigingspagina staan dezelfde reeksen als grafiek, waar alleen de aslabels als tekst uit te lezen zijn. Anthropic zette dezelfde thread ook op X, en daar hangt onder de benchmarkpost een tabelbeeld waarin de cijfers wel leesbaar staan, inclusief een concurrentkolom die op de aankondigingspagina nergens als tekst te vinden was.

BenchmarkFable 5.1Fable 5Opus 5GPT-5.6 Sol
Wetenschappelijk agentwerk (Terminal-Bench-Science 0.1)52,6%24,7%29,0%22,4%
Agentisch coderen (Terminal-Bench 4.0)55,8%42,0%52,3%37,3%
Kenniswerk (GDPval-AA v2)1853172318241711
Computergebruik (OSWorld 2.0)77,9% / 41,7%72,9% / 36,1%75,4% / 39,6%geen score
Multidisciplinair redeneren (Humanity’s Last Exam)60,9% / 65,0%57,8% / 63,8%56,6% / 63,6%geen score
Bedrijfsprocessen (AutomationBench)31,4%17,1%26,9%19,6%
Agentisch coderen (CursorBench 3.2.0)73,4%70,5%70,0%67,2%

Bij OSWorld en Humanity’s Last Exam staan twee waarden: bij OSWorld de strengere en de mildere telling, bij Humanity’s Last Exam zonder en met gereedschap. Mythos 5.1 haalt op Terminal-Bench 4.0 60,9%, tegen de 55,8% van Fable 5.1. Dat verschil komt van de filters, en daar kom ik zo op terug.

De kolom GPT-5.6 Sol staat er zonder bronvermelding en is door Anthropic zelf gedraaid. Een tabel waarin de aanbieder zowel zijn eigen model als dat van de concurrent meet, is geen vergelijkend warenonderzoek. Bij OSWorld ontbreekt die kolom trouwens, en Anthropic legt in een voetnoot uit waarom: de taken komen uit de augustus-2026-release en zijn daarmee niet vergelijkbaar met eerder gepubliceerde OSWorld-cijfers.

De voetnoot onder die grafieken is bruikbaarder dan de scores zelf. De standaardfout op Terminal-Bench-Science 0.1 is 3,5 tot 4,5 punt per model. Het publieke scorebord van die benchmark, met drie pogingen per taak in een Claude Code-harnas, zet Opus 5 op 30,0% en Fable 5 op 21,4%; Anthropic reproduceert die twee in de eigen opzet op 29,0% en 24,7% en noemt beide binnen de ruis. Een verschil van drie punten in zo’n tabel betekent dus weinig.

Het ongunstige cijfer staat in dezelfde voetnoot. Fable 5.1 is gemeten met de productie-safeguards aan. Op taken waar die tussenbeide kwamen scoorden Fable 5.1 en Fable 5 een nul op OSWorld 2.0, en Fable 5 een nul op AutomationBench. Bij alle andere interventies werd de cybertaak afgehandeld door Opus 4.8 en de biologietaak door Opus 5. Anthropic schrijft er zelf bij dat dit de prestaties van beide modellen op die benchmarks waarschijnlijk drukt. De OSWorld-scores zijn bovendien op de augustus-2026-versie van de taken gedraaid en daarom niet vergelijkbaar met eerder gepubliceerde OSWorld-cijfers, wat de reden is dat er geen concurrent in de grafiek staat.

Mythos 5.1 en Fable 5.1 zijn hetzelfde model, dus het gat tussen die twee lijnen op Terminal-Bench 4.0 bestaat volledig uit de taken waarop de oude, grovere cyberfilters ingrepen. Anthropic verwacht dat het gat kleiner wordt nu die filters nauwkeuriger zijn. Een benchmarkscore meet hier dus mede hoe streng je eigen poortwachter staat afgesteld.

Wetenschap is de eigenlijke claim

De tweede post in de thread zegt dat de onderzoekscapaciteiten “een vroege blik” geven op hoe AI aan wetenschappelijke vooruitgang gaat bijdragen. Dat is precies het soort zin waar ik normaal overheen lees. Onder de aankondiging staan drie voorbeelden die concreter zijn dan de zin.

Bij moleculair ontwerp kreeg Mythos 5.1 open-source eiwitontwerp- en vouwgereedschap en gingen de ontwerpen naar twee externe organisaties voor validatie in het lab. Op drie doelwitten lag de bindingsaffiniteit tien keer hoger dan bij de beste inzendingen van de ontwerpwedstrijden van Adaptyv Bio. De hit rate, het aandeel ontwerpen dat daadwerkelijk bindt, kwam op bijna 50% over twaalf doelwitten, waar 10 tot 15% in dit vakgebied gebruikelijk is. Dat sluit aan op het eerdere eiwitwerk waar ik over schreef, met een hogere trefkans en minder doelwitten.

Bij rekenwerk trainde Fable 5.1 een neuraal netwerk dat uit dertig jaar oude radarbeelden van NASA’s Magellan-missie een nieuwe hoogtekaart van een derde van Venus maakte, met een resolutie van 300 meter. Op een van de beelden staat een schildvulkaan van vijftien kilometer breed.

Bij computationele biologie schreef Mythos 5.1 eigen GPU-kernels en cachete tussenresultaten, waarmee zeven open-source modellen tot 2,5 keer sneller werden bij identieke uitvoer. De winst per model loopt uiteen van 1,4 keer voor Enformer en Evo 2 40B tot 2,5 keer voor ProGen2. Op genoomwijde analyses scheelt dat 30 tot 60% aan geschatte GPU-kosten: een analyse van drie miljoen ClinVar-varianten met Evo 2 40B gaat van geschat $18k naar $8k tegen cloud-lijstprijs. Anthropic merkt op dat zo’n optimalisatie normaal weken werk is voor een team performance-engineers.

Dit is het soort resultaat waar ik voorzichtig mee ben, want het komt van de leverancier en is niet door een derde partij nagerekend. Het staat wel in een vorm die iemand anders kan natrekken: een hit rate meet je in een lab, een GPU-rekening lees je van je eigen factuur.

EFS is voor Nederlandse organisaties het echte nieuws

Naast de modellen staat er een aparte aankondiging van dezelfde dag over Enterprise Frontier Safeguards. Daarmee blijft je data op je eigen cloudinfrastructuur staan in plaats van bij Anthropic, en gebeurt menselijke beoordeling standaard door de klant zelf. Het effect is dat je de privacy krijgt van een zero-data-retentieafspraak zonder de misbruikdetectie op te geven.

Anthropic zegt EFS met meer dan honderd klanten te hebben ontwikkeld, in sectoren waaronder financiële dienstverlening, zorg, industrie, telecom, recht, retail en de publieke sector, samen met AWS, Google Cloud en Microsoft Azure. Ondersteund op Claude Code, Claude Enterprise, het Claude Platform, Amazon Bedrock, Claude Platform op AWS, Google’s Agent Platform en Microsoft Foundry. De uitrol gaat in fasen en begint later dit najaar; tot die tijd krijgen klanten die ervoor in aanmerking komen gewoon zero data retention op Fable 5 en 5.1.

Voor de omgeving waarin ik overdag werk, publieke dienstverlening, is dat een grotere verschuiving dan een paar benchmarkpunten. Dataretentie is bij ons vaak het punt waarop een pilot strandt. Wat er nog niet staat, is hoe een Nederlandse of Europese organisatie hier precies in past en wat “cloudinfrastructuur van de klant” betekent voor wie op EU-regio’s zit. Die vraag is de moeite van het stellen waard voordat je ergens een handtekening onder zet.

Wat er met de filters gebeurt

De safeguards worden preciezer, en dat is een claim met twee kanten. Bij Fable 5 in juni gold nog dat de filters bewust conservatief stonden en in minder dan 5% van de sessies aansloegen, waarbij een geblokkeerd verzoek werd doorgezet naar Opus 4.8 met een melding aan de gebruiker. Vandaag zegt Anthropic dat de biologiefilters voor Fable 5.1 en Fable 5 85% minder vaak vuren op onschuldige vragen over elementaire biologie en medische onderwerpen, gemeten tegen de filters waarmee Fable 5 lanceerde. De thread noemt daarnaast dat cybersecurityfilters ongeveer 60% minder vaak op onschuldige verzoeken aanslaan. Dat cijfer staat woordelijk in zowel de Threads- als de X-thread van het Anthropic-account, en in de aankondiging staat de claim zonder getal, als “less likely to flag benign content”.

De grens zelf schuift niet mee. Vragen over onderzoek en ontwikkeling in de levenswetenschappen gaan nog steeds naar de Opus-modellen. Anthropic schrijft ook dat Mythos 5.1 capabeler is dan Mythos 5, maar volgens de eigen evaluaties nog onder de volgende risicodrempel van het Responsible Scaling Policy blijft, en daarom met dezelfde safeguards wordt uitgerold.

De kanttekening

De standaard verschuift naar duurdere gewoontes. Een cachekorting van 75% maakt lange, contextzware agentsessies goedkoper, en daarmee normaler. De rekening per sessie daalt terwijl het aantal sessies stijgt, en de eerste beweging is zichtbaar in je factuur waar de tweede dat niet is. Reken door wat je in augustus werkelijk verbruikte voordat je concludeert dat je 25% bespaart.

De verantwoordelijkheid voor toezicht schuift naar de klant. EFS zet je data op je eigen infrastructuur en legt menselijke beoordeling standaard bij jou neer. Dat is winst voor je privacy en tegelijk werk dat je erbij krijgt: iemand in jouw organisatie moet die beoordeling kunnen doen, en dat is een rol met bevoegdheden en een naam erbij. Wie EFS aanvraagt om de juridische afdeling tevreden te stellen, koopt een verplichting.

Er stroomt zichtbaarheid weg. Minder voortgangsmeldingen tussen toolaanroepen, kortere samenvattingen na een codeersessie, en thinking-blokken die stilzwijgend worden weggegooid als je terugschakelt naar een ouder model. Elk van die drie maakt het werk gladder en maakt tegelijk moeilijker te zien wat er gebeurd is. Anthropic geeft zelf toe dat het model soms nog langs goedkeuringen en auto-modus-classifiers komt, en dat de eigen gedragsaudit minder zicht heeft op werk met heel lange context en op meerdere agents naast elkaar. Precies de twee situaties waarin je die meldingen het hardst nodig hebt.

Wat ik zelf doe

Ik zet niets om vandaag. Deze site draait op een keten van gates die ik zelf heb gebouwd, en die keten is afgestemd op modellen die zich op een bepaalde manier gedragen in lange loops. De regel over minder parallelle toolaanroepen raakt precies dat, dus ik wil eerst zien wat het doet met de tijd en de tokens van een gewone artikelketen voordat ik iets standaard maak.

Wat ik wel meteen doe, is de cacheredenering nalopen. Als teruglezen vier keer goedkoper wordt, verandert de afweging tussen de cache van vijf minuten en die van een uur, want de schrijfprijs is niet meegedaald. Die rekensom staat in het stuk over mijn dagelijkse loop en moet opnieuw.

En ik laat de vraag over EFS in de Europese context liggen tot er iets concreets over te lezen valt. Zodra dat er is, leg ik het naast de eisen die bij ons een pilot laten stranden.

Veelgestelde vragen

Wat is het verschil tussen Claude Fable 5.1 en Claude Mythos 5.1?

Het is hetzelfde onderliggende model met andere veiligheidsfilters. Fable 5.1 is algemeen beschikbaar, Mythos 5.1 heeft lossere filters voor cybersecurity en levenswetenschappen en is alleen te krijgen via toelatingsprogramma’s. De prijs is identiek: $10 per miljoen invoertokens en $50 per miljoen uitvoertokens.

Wordt Claude Fable 5.1 echt goedkoper voor mij?

Alleen als je werklast leunt op teruglezen uit de prompt-cache. De invoer- en uitvoerprijs blijven staan; het cache-tarief gaat van $1 naar $0,25 per miljoen tokens. Anthropic meet daar over vier weken echt verbruik in augustus 2026 ongeveer 25% kostenverlaging bij een gemiddelde werklast en tot 45% bij context- en toolzware werklasten. Doe je korte losse verzoeken zonder herhaalde context, dan verandert er niets aan je rekening.

Moet ik mijn agent aanpassen als ik overstap?

Als je Claude Code, claude.ai, Managed Agents of de Agent SDK gebruikt, dan houden die de thinking-prefix zelf intact en hoef je niets te doen. Bouw je zelf de messages-array, controleer dan of je nooit iets wijzigt dat vóór een thinking-blok staat, want dat geeft vanaf nu een fout op accounts die op of na 31 augustus 2026 zijn aangemaakt. Draai je lange agentloops, houd dan de toolaanroepen in de gaten: het model bundelt ze minder vaak uit zichzelf en de prompting-gids geeft een instructieregel om dat terug te zetten.

Bronnen

Gecontroleerd op 1 september 2026, een paar uur na de aankondiging. De kern staat vast bij de primaire bron: de aankondiging op anthropic.com draagt de datum van vandaag, de docs zetten claude-fable-5-1 op “Active (latest)” met releasedatum 1 september 2026, en de prijstabel toont het cache-tarief van $0,25. Vier getallen stonden aanvankelijk alleen in de Threads-thread: 52,6% op Terminal-Bench-Science 0.1, 55,8% tegen 42,0% op Terminal-Bench 4.0, en de 60% minder valse treffers op de cyberfilters. De grafieken op de aankondigingspagina geven hun waarden niet als leesbare tekst prijs. Na het lezen van de X-thread van hetzelfde account staan ze alle vier woordelijk op een tweede officieel kanaal, met een tabelbeeld waarin de cijfers leesbaar zijn. Twee kanalen van dezelfde afzender zijn geen tweede meting, dus de cijfers blijven van Anthropic zelf. Het system card heb ik niet gelezen, dus de veiligheidsparagraaf hierboven leunt op de samenvatting die Anthropic er zelf van geeft. De video hierboven is ingesloten maar niet uitgeschreven; er staat in dit stuk dus geen enkele claim die alleen daaruit komt. Onafhankelijke verificatie van de benchmarks bestaat op dit moment niet: het publieke scorebord van Terminal-Bench-Science 0.1 noemt volgens Anthropic alleen Opus 5 en Fable 5. De GPT-5.6 Sol-kolom is eveneens door Anthropic gemeten en niet naast een bron van OpenAI gelegd. Wat er met abonnementen gebeurt, staat nergens; bij Fable 5 was dat in juni wel meteen geregeld, en het ontbreken ervan is nu een open vraag en geen bevestiging dat het inbegrepen is.