Eén model, twee namen: waarom Anthropic Mythos 5 achter slot houdt
Hetzelfde brein, twee verschillende sloten
De afgelopen dagen schreef ik over wat Claude Fable 5 kan. Vandaag de andere kant van het verhaal, de kant die ik eerlijk gezegd interessanter vind: waarom Anthropic exact hetzelfde model in twee versies uitbrengt, met twee namen, en de krachtigste versie bewust achter slot houdt.
Fable 5 en Mythos 5 draaien op precies hetzelfde onderliggende model. Het enige verschil is de beveiliging. Fable 5 is de versie voor iedereen, met beveiliging aan. Mythos 5 is dezelfde machine met die beveiliging deels eraf, en die gaat alleen naar een handjevol vertrouwde partijen. De namen zeggen het al: fabula is Latijn voor "dat wat verteld wordt", verwant aan het Griekse mythos. Zelfde idee, ander masker.
Het probleem heet "uplift"
Waarom zoveel moeite? Het draait om een begrip dat Anthropic uplift noemt. Een model uit de Mythos-klasse is zo goed in cybersecurity en biologisch onderzoek dat het een kwaadwillende kan helpen om schade aan te richten die hij anders niet voor elkaar had gekregen. Niet het soort dingen dat je met een Google-zoekopdracht vindt, maar echte, bruikbare hulp bij iets gevaarlijks.
Het lastige is dat veel van dit werk dual use is. Precies dezelfde vraag die nuttig is in handen van een cybersecurity-professional of een bioloog, kan gevaarlijk zijn in handen van iemand met verkeerde bedoelingen. Je kunt de ene gebruiker niet zomaar van de andere onderscheiden op basis van de vraag alleen. Daar komt de beveiliging om de hoek kijken.
Drie soorten classifiers
Fable 5 komt met een nieuwe set classifiers. Dat zijn aparte AI-systemen die naast het hoofdmodel meedraaien, mogelijk misbruik herkennen, en het hoofdmodel dan tegenhouden om te antwoorden. Anthropic draait al langer classifiers, maar deze hebben bredere dekking. Wordt een verzoek geblokkeerd, dan krijg je in plaats daarvan antwoord van Claude Opus 4.8, het op een na krachtigste model. Ze zijn bewust streng afgesteld, dus af en toe wordt een onschuldige vraag ook geraakt, maar gemiddeld gebeurt dat in minder dan 5% van de sessies.
De classifiers dekken grofweg drie gebieden:
- Cybersecurity. In een interne test liet Anthropic een geautomatiseerde red-teamer 400 beurten lang proberen het model offensieve cybertaken te laten uitvoeren, steeds opnieuw en terugspoelend als het werd geblokkeerd. Fable 5 ging niet overstag bij één enkel schadelijk verzoek rond het plannen van een cyberaanval, exploit-ontwikkeling of het omzeilen van verdediging, ook niet als er een van 30 bekende publieke jailbreak-technieken werd gebruikt.
- Biologie en chemie. Anthropic blokkeerde altijd al een smalle selectie bioweapons-vragen, maar vindt dat nu niet meer genoeg. Reden: goed bekostigde kwaadwillenden zouden uplift kunnen halen voor riskant biologisch onderzoek, en de modellen kunnen inmiddels echte wetenschappelijke taken uitvoeren in plaats van alleen erover praten.
- Distillatie. Anthropic zag eerder grootschalige pogingen om Claude's capaciteiten te "distilleren", oftewel eruit te trekken om er concurrerende modellen mee te trainen, soms in autoritaire landen. Zulke verzoeken worden herkend en teruggestuurd naar Opus 4.8.
Waarom Mythos 5 wél bestaat
Als de beveiliging zo belangrijk is, waarom dan überhaupt een versie zonder? Omdat dezelfde capaciteiten die gevaarlijk zijn in verkeerde handen, juist enorm waardevol zijn in de goede. Mythos 5 gaat naar cyberdefenders en infrastructuuraanbieders via Project Glasswing, een samenwerking met de Amerikaanse overheid. Het is dezelfde machine als Fable 5, maar met de cyber-beveiliging eraf, zodat verdedigers volledig gebruik kunnen maken van wat volgens Anthropic de sterkste cybersecurity-capaciteiten van welk model ook ter wereld zijn.
Wie nu al toegang had tot Claude Mythos Preview, bijvoorbeeld de Glasswing-partners, kan vanaf de lancering upgraden naar Mythos 5. In overleg met de overheid wil Anthropic die toegang stapsgewijs uitbreiden, en er komt een aanvraagprogramma voor cybersecurity-organisaties. Daarnaast komt er een vergelijkbaar programma voor biologie: toegang tot Fable 5 met de biologie- en chemie-beveiliging eraf, maar de cyber-beveiliging blijft dan aan, bedoeld om biomedisch onderzoek en het vinden van nieuwe therapieën te versnellen.
Wat ik ervan vind
Dit is het soort beslissing dat ik als buitenstaander fascinerend vind. Een bedrijf bouwt het krachtigste model dat het ooit publiek heeft gemaakt, en besluit vervolgens om de allerkrachtigste vorm ervan niet aan jou en mij te geven. Niet omdat ze het niet kunnen, maar omdat ze de rommel die ervan kan komen serieus nemen.
Je kunt cynisch zijn en zeggen dat het ook gewoon goede PR is. Maar de afweging zelf is reëel: hoe geef je verdedigers het beste gereedschap zonder hetzelfde gereedschap in de handen van aanvallers te leggen, terwijl de vraag van beide kanten letterlijk hetzelfde is? Eén model, twee namen, en een hele hoop nadenken over wie je wel en niet vertrouwt. Ik vind het een eerlijkere manier van uitrollen dan net doen alsof het risico niet bestaat.