Claude Opus 5 is uit en presteert zoals Fable 5 voor half de tokenkosten
Anthropic heeft Claude Opus 5 uitgebracht. Het model is volgens de maker op veel vlakken vergelijkbaar met Fable 5, maar de tokens zijn slechts de helft van wat die voor Fable kosten.
Claude Opus 5 is per direct beschikbaar, zegt Anthropic. Het model scoort in benchmarks veel hoger dan het voorgaande model, Opus 4.8. In de meeste benchmarks is Opus 5 vergelijkbaar met Fable 5, zegt Anthropic.
Wel geeft het bedrijf tegen VentureBeat een belangrijke nuancering. Opus 5 doet het vooral heel goed bij taken met een specifieke uitkomst. Benchmarks bevatten vooral zulke vragen, waardoor het model daarop goed scoort. In de praktijk kan Fable 5 waarschijnlijk veel taken beter uitvoeren.
Daar staat tegenover dat Opus 5 veel minder kost dan Fable 5. De tokenkosten zijn vergelijkbaar met die van Opus 4.8, zegt Anthropic. Opus 5 kost vijf dollar per miljoen inputtokens en 25 dollar per miljoen outputtokens. Dat betekent dat Opus 5 per token precies half zoveel kost als Fable.
Er komt ook een Fast Mode beschikbaar voor Opus 5. Daarmee is de tool 2,5 keer zo snel. Dat kost twee keer zoveel tokens.
Update, 26-07 – In het intro en de titel stond aanvankelijk dat het model minder kostte aan tokens, maar dat klopt niet. De tokens kosten de helft van wat ze bij Fable kosten.
De tokeneconomie wordt steeds belangrijker
AI-bedrijven maken steeds vaker bekend hoeveel hun nieuwe AI-modellen kosten. Een jaar geleden lag de nadruk nog veel meer op prestaties en benchmarkcijfers. AI-bedrijven waren toen vaak vaag over de exacte kosten van de modellen. Maar de economische kant van AI-modellen wordt steeds belangrijker. Steeds meer bedrijven gebruiken AI-modellen in de praktijk, maar de kosten daarvan kunnen snel oplopen. Door verschillende modellen te gebruiken voor specifieke taken kunnen ontwikkelaars en de bedrijven waarvoor ze werken zuiniger omgaan met tokens. Daarom wordt het steeds belangrijker dat gebruikers weten wat de tools hen kosten.
/i/2008271542.png?f=imagenormal)
Lees meer
Reacties (121)
Je hebt input tokens (prompt, vraag, agentic prompts, afbeeldingen etc) en output tokens, antwoord. Input tokens zijn doorgaans goedkoper dan output tokens. Deze zijn aangegeven met verschillende prijzen met miljoen tokens. Bijvoorbeeld $5/1m input en $25/1m output in het geval van claude opus.
Er zijn 2 verbruiksmodellen: abonnement en credit.
Als je een abonnement hebt betaal je voor een bepaald aantal tokens (meestal niet nader gespecificeerd, kan per provider en over tijd verschillen in hoeverre dit gesubsidieerd wordt, naar gelang de datacenter capaciteit en andere factoren).
Hoe complexer het model hoe sneller je je toelage per tijdslimiet ziet krimpen. In het geval van Claude is er elke 5 uur een limiet en een week limiet. Als je een van de limieten op hebt verbruikt moet je wachten totdat de tijd voorbij is en je verbruikslimited weer gereset wordt (welke maar eerst op is geraakt).
Met een abonnement betaal je dus niet extra voor tokens, tenzij je er zelf voor kiest. Als je abonnement limiet is bereikt kun je dmv pre-paid tokens kopen die niet gesubsidieerd zijn en dus veel duurder (de $5/1m input en $25/1m output).
Context is alle tokens die momenteel in een sessie actief zijn, input en output tokens, zeg maar de hele conversatie. Dit kan met programmeren of grote stukken tekst snel oplopen.
Je moet daarom letten op je context verbruik: 1m tokens context max, maar bij 150K context verbruik geldt een hoger tarief of gaat je abbo sneller op. Context vergt duur geheugen, en zoals je weet is geheugen veel duurder momenteel. Zit je context vol dan start je een nieuwe sessie en is de LLM alles vergeten, tenzij je het opslaat in een bestand, meestal een samenvatting of een nieuwe selectie van tekst uit meerdere bestanden voor vervolg vragen/verwerking/programmeer opdracht.
De mate van subsidie wordt momenteel geschat dat je voor 't $200 max plan ongeveer $5000 aan tokens krijgt. Daar draaien ze verlies op. Ze maken wel winst op pre-paid credits, meestal bij commercieel gebruik.
De webversies van chatgpt en claude laten het inderdaad niet zien
Trouwens ik heb nu even Opus 5 geprobeerd en raad het af als je het gebruikt om met documenten te werken want het hallicineert heel erg snel, iets wat met Opus 4.8 niet zo erg was. Het is wel goed in dingen maken, maar heeft het dus heel moeilijk met input data dat ommgezet moet worden in output data.
Dit is een vector met een zeer groot aantal dimensies die als het ware de 'betekenis' van het token op een wiskundige manier vertegenwoordigen.
- Input text wordt opgekapt in tokens door de tokenizer
- Token = (sub)woord (string). Wordt omgezet in token ID
- Token ID = index (positie) van dit token (integer) in het gekende vocabularium van de LLM. Bv. token "het" = 27649, "_gte" = 125. Wordt gebruikt om een token embedding op te zoeken in de token embedding table, eerste stap van een LLM (elke token index heeft een rij in deze tabel, die rij is de token embedding vector)
- Token embedding = initiële, ruwe "betekenis" van een token (float vector).
- Token embeddings worden door de rest van de LLM geduwd. Op het einde komt een voorspelling van het volgende token (token index).
- Dat proces wordt herhaald tot bv. een stop token gegenereerd wordt. Daarna worden de token indices omgezet naar tokens en aaneen gelijmd door de tokenizer.
Stel je voor dat onderzoekers ereen paper zouden schrijven met "er wordt een schatting gemaakt dat x" zonder enige bronvermelding. Je zou onmiddellijk een afwijzing van een reviewer krijgen. "schatting gemaakt door wie? Wat is de bron?". Dat zal de lezer toch niet zelf moeten gaan opzoeken...
Bron of niet, heel er zal hij er niet van af zitten. 1 complexe taak met opus heeft mij ooit bijna 40 euro gekost, terwijl het ongeveer anderhalf keer mijn 5 uurse limiet was bij een x5 abonnement. Losse tokens kopen is echt ontiegelijk duur. Er is ook een reden waarom je de API niet mag gebruiken als je een abonnement hebt. De API is enkel als je met credits werkt en deze kosten lopen heel erg snel hard op.Heb je voor dat laatste een bron? Ben benieuwd.
De prijszetting voor de tokens is dan ook vooral gericht op de zakelijke markt.
Sowieso is coding via AI een heel stuk goedkoper dan 1-2 manuren. Een Developer kost tegenwoordig minstens 180 euro per uur, daarvoor heb je de max X20 abonnement van Claude.Voor privé gebruik is dit inderdaad zeer duur. Maar als je het professioneel gebruikt en er code mee laat schrijven, dan valt zo'n bedrag beter mee, zeker als je er sterke productiviteitswinst mee boekt.
De prijszetting voor de tokens is dan ook vooral gericht op de zakelijke markt.
https://businessengineer.ai/p/the-subsidized-agi-economy
Mijn vermelde inschatting ligt nog hoger dan ik aangaf, maar zit wel in de range van $4500-$8000.
Leuk dat ze zeggen hoeveel x tokens kosten, maar nergens zie ik inderdaad hoeveel tokens ik heb of hoeveel tokens iets heeft gekost. Als je de CLI gebruikt is dat wel meer inzichtelijk maar voor normale web of desktop app gebruikers niet
Paar kleine aanvullingen:
- de 150K drempel met hoger tarief bestaat niet meer en is door Anthropic in maart verwijderd. Standaard API-prijzen dus voor het volledige context venster
- $5/1M input en $25/1M output"als voorbeeldprijs voor je credits is te weinig; dat geldt eigenlijk alleen voor Opus. Meer realistisch is $1/$5 (Haiku) t/m $10/$50 (Fable 5).
Die cache scheelt enorm in het verbranden van tokens. Feitelijk zit mij hele project in die cache.
En als ik de kosten van zoveel tokens vergelijk tussen de API en met het Plus abbo dan zitten daar per maand duizenden euro’s tussen.
Claude heeft hier nog een web tool voor als je een abonnement hebt: projects, deze kun je koppelen met een git repo en bestanden selecteren die gecachet moeten worden of je kunt losse bestanden uploaden die dan standaard in de cache worden geplaatst. Deze kosten dan geen input tokens meer. Hierop zit wel een bepaald aantal MB maximum op (ik weet zo niet uit mijn hoofd). Dit werkt ook als je met claude code werkt in dezelfde repo. Hiermee kun je bijvoorbeeld je skills en design specs, architecture docs en bron code bestanden die onderhevig zijn aan veel veranderingen etc. in plaatsen voor context.
https://platform.openai.com/tokenizer
Kleine nuance: mogelijks werkt de tokenizer achter Claude iets anders, het taalmodel is hier namelijk nauw mee verbonden en wordt dus vaak niet op zichzelf getraind. Het concept is daarentegen wel vergelijkbaar.
Het is ook lastig om voor je taak de juiste model te kiezen. En daarmee de kosten te beperken.
[Reactie gewijzigd door iAR op 25 juli 2026 08:00]
Ik weet niet of mijn lokale model op mijn NAS of misschien iMac dat goed kan draaien...
De kosten per token zijn dus als het ware hoeveel moeite het kost om een bepaalde input (de prompt die je stuurt plus alle context die de software mee stuurt, zoals bestaande projectcode en web search etc etc) te verwerken, en vervolgens een kostenplaatje voor de output (daadwerkelijke uitkomst van de opdracht) per token ("woord")
Je kan ook een API toegang nemen .. en daarmee betaal je gewoon voor elke gebruikte input en output tokens.
En een "token" is een woord, of een lettergreep of "iets" wat door een LLM model vertaald kan worden naar een "getal" .. wat dan weer gebruikt kan worden om te bepalen welke getallen logischerwijs bij elkaar horen op basis van de de voorgaande getallen. (Okee... Wel heel simpel gezegd, maar je betaalt dus per woord/lettergreep )
De gegeven antwoorden zijn misschien onnodig complex.Wat zijn die tokens eigenlijk?
Een vraag deel je op in brokjes, die gaan in een zwarte doos, en dan komen er weer brokjes (antwoord) uit. Dat zijn input-tokens en output-tokens. Grofweg zou je kunnen spreken van lettergrepen, maar bijvoorbeeld ook leestekens of emoji.
De vraagbrokjes (of input-tokens) worden in parallel verwerkt en daarom zijn ze goedkoop. Maar de antwoordbrokjes (of output-tokens) komen er in serie uit, dus daarom zijn ze duur.
Je kunt economisch gezien dus beter een gedetailleerde vraag stellen en vragen om een kort antwoord. Je hebt er alleen mee te maken als je AI via een API wilt integreren met je software, anders is een abonnement waarschijnlijk de beste value for money.
En, tsja, bij het bedrijf waar ik werk hebben we recent een hulpbotje gebouwd, die 2 a 3 euro per dag kost, maar je ook soms wel een uur of 2 a 3 aan uitpluiswerk scheelt (het helpt hoofdzakelijk met log-analyse)...
De maandkosten van dat ding liggen daarmee onder het uurtarief van een beetje competente IT'er, en het scheelt ons team in totaal richting een kwart FTE aan (uitzoek)werk. (Ook al niet het leukste klusje)
Dat is een blijvertje!
(huidige) AI gaat dus niemand van mijn team vervangen, maar is wel druk op weg om een onmisbaar hulpmiddel te zijn, met name bij troubleshooting.
Oftewel, die bubbel is niet alleen maar lucht!
[Reactie gewijzigd door Keypunchie op 24 juli 2026 23:00]
Dat is dan ook heel wat anders dan een zekere CEO die riep dat je minimaal de helft van je salaris aan tokens moet verbranden.
Nee hoor, dat is niet nodig, Dat zijn ze zelf prima aan het doen.Iets wat mensen per direct mee moeten stoppen met het kopen ervan als ze die bubbel eindelijk willen laten barsten
En nee, de bubbel zal niet barsten, maar hij zal wel behoorlijk leeglopen in de eerste helft van volgend jaar.Claude Opus 5 is uit en presteert zoals Fable 5 tegen de helft van de prijs
Ik dacht eerst dat hallucinaties de doodsteek van AI zouden zijn, maar ik zie dat AI-gebruikers de tool anders aan het gebruiken zijn, meer als een meestal nuttige maar op zijn tijd liegende, overdrijvende en dus niet altijd betrouwbare partner, die het saaie onderzoeks-/speurwerk voor ze wegneemt.
Wat de bubbel wel behoorlijk zal laten leeglopen, is dat mensen en bedrijven minder bereid zijn om veel voor hun tokkens te betalen, en nu de buzz en glimmer van AI aan het verdwijnen is, dat er nu al een race naar de bodem aan het plaatsvinden is.
En over tijd, gaat AI gewoon een tool worden die zijn nut heeft, maar niemand er de hoofdprijs voor wil betalen.
Hier wordt er specifiek ingegaan op wat tokens nu eigenlijk zijn.
YouTube: #2 - Staat Europa in 2031 volledig buitenspel in de AI-race?
Het makkelijkste voorbeeld is het zoeken. Je stuurt een prompt. Een LLM gebruikt jouw prompt om output te genereren in de vorm van zoek opdrachten. De resultaten worden weer in een LLM gestopt om te bepalen of de zoekopdracht voldoende info heeft opgeleverd. Zo ja, dan genereert de LLM een antwoord. Zo niet dan genereert het LLM weer een zoekopdracht. Zo kan het loopje blijven gaan. Jij stelt een korte vraag maar de hoeveelheid tekst dat het model moet verwerken groeit met elke zoekopdracht enorm.
Voor code is het simpeler. Voor code heeft het model vaak geen additionele informatie nodig en is het puur het verwerken van je prompt. Daar is het visueel heel zichtbaar want het is beperkt tot jou input en de output van het model zonder al teveel magie op de achtergrond
Als je een model lokaal draait is dat heel zichtbaar. Stel een relatief oud model bijvoorbeeld de vraag wie de burgermeester is van Rotterdam. Je krijgt vaak Aboutaleb als antwoord. Geef je model daarna bijv DuckDuckGo als tool. of een webscraper voor Wikipedia. En je krijgt ineens altijd het juiste antwoord. Dat is niet omdat je model ineens veel slimmer is geworden. Nee, de resultaten van DuckDuckGo worden gewoon toegevoegd aan je input prompt waardoor het model het juiste antwoord al in de input krijgt meegestuurd. Niks schimmige aan...
[Reactie gewijzigd door Mellow Jack op 24 juli 2026 23:54]
Niet anders dan bij een mens overigens. Daar krijg je ook alleen de output aan het einde van een denkproces.
Het enige wat uitmaakt is of het resultaat in de genomen tijd de prijs waard is.
Als ik ergens een week over doe een ik krijg 10000 euro. En nu krijg ik na een week nog steeds 10000 maar met 1000 euro aan ai credits ben ik na twee dagen klaar en kan ik 5 dagen vrije tijd hebben. Geef de klant wellicht nog 1000 korting.... Wat kan het mij schelen als dat ding, de ai maar voor 500 werkelijk werk heeft gedaan. De prijs is gewoon te goed om te laten liggen. Ik ga er op vooruit.
Bij cryptocurrencies wordt ook het woord "token" gebruikt, wellicht dat je daarom denkt dat het iets te maken heeft met een virtuele munt. Maar daar heeft het niets mee te maken. De betekenis van "token" als het gaat over cryptocurrencies is iets heel anders.
Dit is geen goede interpretatie. Opus 5 is 2x zo goedkoop, voor 1 miljoen tokens. Maar nu lijkt het volgens het artikel dat het model 2x zo efficient is, wat helemaal niet aan de orde is. Ze rekenen simpelweg de helft minder voor het tokengebruik, that's it.
Het kan ook zijn dat fable naar je werk keek en het zo simpel vond dat hij je automatisch naar een simpeler goedkoper model heeft doorgezet.
Ik vroeg om een oude patch the importeren en dat werd geblocked omdat er api calls in zitten die met hacking geassocieerd werden.
Automatisch gedowngrade van fable naar opus 5, en van opus 5 naar 4.8
Ik heb opus 5 nog niet geprobeerd. Maar mijn ervaring met Opus 4.8 VS Fable was dat je met opus op max het zelfde resultaat bereikte als met Fable op low met ongeveer het zelfde token gebruik, alleen was Fable wel beter in het oplossen van complexe fouten in de code.Iemand Opus 5 al geprobeerd, en is het echt zo dat het minder kost? Op de een of andere manier was Fable 5 bij mij best oke en niet heel slurpend gek genoeg..
En als ik het artikel zo lees snap ik niet echt wat Antropics nou wilt bereiken met 2 taal modellen die beide net zo goed zouden moeten zijn? Ik vind hun doel maar heel erg wazig.
[Reactie gewijzigd door oCe op 25 juli 2026 08:43]
Ontlopen die modellen elkaar inmiddels nog echt wel? De één iets beter in beredeneren, de ander in code, een ander in plaatjes. Het wordt belangrijker om snel te kunnen schakelen tussen modellen dan om "de beste" te vinden. Daar gaat het te snel voor.
En daarnaast heeft OpenAI die irritante 5-uurslimiet verwijderd en voeren ze regelmatig resets uit (bij elke miljoen nieuwe gebruikers sinds de release van 5.6 tot nu toe) en soms ook banked resets, waarbij je zelf kunt bepalen wanneer je reset. Dus als je dan moet kiezen tussen Codex of Claude code, dan is de keuze snel gemaakt voor de meeste mensen.
[Reactie gewijzigd door Dynamix86 op 24 juli 2026 21:58]
Ik gebruik dus gewoon mijn Claude tot de 5 uur limiet op is (die 5 uur kan je trouwens zelf starten. Stuur een goedemorgen om 7u voor je naar het werk vertrekt en tegen de middag zit je aan de reset, kan je na de lunch aan de volgende batch beginnen). En pas als ik bij Claude aan de limiet zit ga ik verder met Codex.
Ben dus heel benieuwd om volgende week Opus 5 te proberen.
Ik ben benieuwd of dezelfde guardrails zijn ingesteld op Opus als dat ze bij Fable hebben gedaan voor biological en hacking topics waar een fallback werd uitgevoerd.
Daarnaast ervaar ik Gemini als erg belerend, waar Claude, misschien door een stijl instructie, zich als een volwassen collega gedraagt. Ik gebruik het eerder voor support dan coderen.
[Reactie gewijzigd door satya op 25 juli 2026 11:07]
Ongeacht welk model, ik vind het vooral lastig om de gegenereerde code te begrijpen. Dit kost voor mij veruit de meeste inspanning. Ik vind van mijzelf dat ik een aardig goede developer ben, toch ben ik elke keer weer verbaasd over de gebruikte annotaties en oplossingen.
Ook is een handig ding van LLMs dat je het direct aan ze kunt vragen waarom ze iets op een bepaalde manier hebben gedaan en hoe je ze het anders kunnen laten doen.
edit: typo
[Reactie gewijzigd door Grimgor_6x3 op 25 juli 2026 09:48]
Lijkt me ook iets dat heel goed kan zijn voor junior profielen: het door AI laten doen zal je minder diep door het leerproces sturen, maar door constante uitleg te vragen kan je toch nog op vrij snel tempo evolueren.
Bovenstaande gaat over euros die je nodig hebt om prestatie X te realiseren.Claude Opus 5 is uit en presteert zoals Fable 5 voor half de tokenkosten
Onderstaande gaat over het aantal tokens dat nodig is om prestatie X te realiseren.
Deze twee zijn niet met elkaar te vergelijken tot de prijsverschillen tussen input en output tokens erbij vermeld worden.Anthropic heeft Claude Opus 5 uitgebracht. Het model is volgens de maker op veel vlakken vergelijkbaar met Fable 5, maar het kost half zoveel aan tokens.
Onder de tabel wordt nog wat extra informtie over de kosten gegeven, maar het laat zich lezen als een VWO Wiskune-A examenopgave:
Daar staat tegenover dat Opus 5 veel minder kost dan Fable 5. De tokenkosten zijn vergelijkbaar met die van Opus 4.8, zegt Anthropic. Opus 5 kost vijf dollar per miljoen inputtokens en 25 dollar per miljoen outputtokens. Dat betekent dat Opus 5 per token precies half zoveel kost als Fable.
Er komt ook een Fast Mode beschikbaar voor Opus 5. Daarmee is de tool 2,5 keer zo snel. Dat kost twee keer zoveel tokens.
[Reactie gewijzigd door Recursio op 24 juli 2026 22:08]
Anthropic nu: hier heb je standaard iets dat net zo goed is - nice?
[Reactie gewijzigd door JorisM op 25 juli 2026 07:35]
[Reactie gewijzigd door JorisM op 25 juli 2026 11:37]
(Indien de titel wordt aangepast, hij was 'Claude Opus 5 is uit en presteert zoals Fable 5 voor half de tokenkosten'.)
[Reactie gewijzigd door erikieperikie op 24 juli 2026 22:55]
Om te kunnen reageren moet je ingelogd zijn
/i/2008271544.png?f=imagenormal)
:strip_icc():strip_exif()/u/516084/crop577bf4bb31ccb_cropped.jpeg?f=community)
/u/20302/pc.png?f=community)
:strip_icc():strip_exif()/u/285081/crop5f44df177fce3_cropped.jpeg?f=community)
/u/325014/Inter3-play.png?f=community)
:strip_icc():strip_exif()/u/572004/fox.jpg?f=community)
/u/1505472/crop67b98a9a4ffd2_cropped.png?f=community)
:strip_icc():strip_exif()/u/432714/crop6287e94322cf6_cropped.jpg?f=community)
/u/54726/crop61d595cc88687.png?f=community)
:strip_icc():strip_exif()/u/200296/arch-dsotm_small.jpg?f=community)
:strip_icc():strip_exif()/u/94045/crop66c1b4250e8a2_cropped.jpg?f=community)
:strip_icc():strip_exif()/u/270673/8ball-blue-60x60px.jpg?f=community)
/u/204872/crop65a1d5f52b87f.png?f=community)
:strip_icc():strip_exif()/u/71115/plus222.jpg?f=community)
/u/27299/hoofd.png?f=community)
/u/472627/crop5c83fe498b36e_cropped.png?f=community)
:strip_exif()/u/54579/Static.gif?f=community)
:strip_icc():strip_exif()/u/98161/Untitled-1.jpg?f=community)
:strip_icc():strip_exif()/u/134130/crop656d9955ccc54.jpg?f=community)
:strip_exif()/u/30814/newgot.gif?f=community)
:strip_exif()/u/1051913/crop6a50e289d78a8_cropped.webp?f=community)
:strip_icc():strip_exif()/u/170929/crop5fb818d8235b7_cropped.jpeg?f=community)
/u/38782/crop6146c7a29805d_cropped.png?f=community)
:strip_icc():strip_exif()/u/135355/20071128geek.jpg?f=community)
:strip_icc():strip_exif()/u/2081084/crop69594ea6c0094_cropped.jpg?f=community)
/u/1219196/crop6324b2e35d04c_cropped.png?f=community)
:strip_icc():strip_exif()/u/221910/crop568251d74f211_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/97374/crop5de67e3f09be9_cropped.jpeg?f=community)
:strip_exif()/u/174875/crop5a47567761dca_cropped.gif?f=community)
:strip_icc():strip_exif()/u/177567/crop5f8591cadf088_cropped.jpeg?f=community)
:strip_icc():strip_exif()/u/133312/poppetje.jpg?f=community)
:strip_icc():strip_exif()/u/312601/crop62ac6b614e17e_cropped.jpg?f=community)
/u/152864/crop59af8ee117886_cropped.png?f=community)
:strip_icc():strip_exif()/u/201581/TRAFFICEJAM.jpg?f=community)