Blog / AI-kosten berekenen
Beschrijf één run van je agent en hoe vaak die draait, en je krijgt antwoord op de vraag ‘wat kost AI?’ voor jouw workload. De calculator prijst die run op negen Claude-, GPT- en Gemini-modellen tegen hun officiële lijstprijzen, gecontroleerd op 3 oktober 2026.
Je agent
Modelkosten per maand
Zelfde workload op elk model, per maand
Het volledige rapport voegt de kosten bij 2× en 10× volume toe, waar caching en modelkeuze het meest besparen, en de kosten voor hosting en monitoring die je naast de modelrekening begroot.
Gebruikte prijzen
| Provider | Model | Input | Gecachete input | Output | Opmerking |
|---|---|---|---|---|---|
| Anthropic | Claude Opus 5.5 | $4,00 | $0,200 | $20,00 | |
| Anthropic | Claude Sonnet 5.5 | $2,00 | $0,200 | $10,00 | |
| Anthropic | Claude Haiku 4.5 | $1,00 | $0,100 | $5,00 | |
| Anthropic | Claude Fable 5.1 | $10,00 | $0,250 | $50,00 | |
| OpenAI | gpt-6-astra | $10,00 | $1,000 | $50,00 | |
| OpenAI | gpt-6.1-sol | $2,00 | $0,100 | $10,00 | |
| OpenAI | gpt-6-luna | $0,10 | $0,010 | $0,50 | |
| Gemini 3.1 Pro Preview | $2,00 | $0,200 | $12,00 | Prompts tot 200k tokens | |
| Gemini 3.8 Flash | $0,75 | $0,075 | $3,75 | Tarief tot 31 dec. 2026; $1,50 / $7,50 vanaf 1 jan. 2027 |
Amerikaanse dollars, standaard tier, gecontroleerd op 3 oktober 2026 op de prijspagina's van Anthropic, OpenAI en Google. Gecachete input is het cache-read-tarief; cache writes, batchkortingen en regionale toeslagen zitten er niet in.
inputtokens × (1 − cachedeel) × inputprijs + inputtokens × cachedeel × cacheprijsoutputtokens × outputprijs(input + output per call) × calls per runper run × runs per maandFAQ
Van de officiële API-prijspagina van elke provider, gecontroleerd op 3 oktober 2026: Anthropic, OpenAI en Google. Het zijn standaard lijstprijzen in Amerikaanse dollars, vóór volumekorting, batchkorting of regionale toeslag.
Een modelcall is één verzoek aan het model en één antwoord terug. Een agent die iets opzoekt, een beslissing neemt en dan een antwoord schrijft, doet voor elke stap een call, en elke call stuurt het gesprek tot dan toe opnieuw mee als input. Daarom zijn er meestal meer inputtokens dan outputtokens.
De meeste providers rekenen minder voor input die ze kort geleden al hebben gezien, zoals een lange systeemprompt die in elke run terugkomt. Het cachedeel is het deel van de input van elke call dat tegen dat lagere cachetarief wordt gefactureerd.
Nee. Providers tellen tokens met verschillende tokenizers, dus dezelfde tekst is op elk model een ander aantal tokens, en echte runs verschillen in lengte. Gebruik de schatting om modellen te vergelijken en een budget te bepalen, en meet daarna het echte gebruik in een pilot.
We bouwen een pilot op je data, meten hoeveel tokens elke run echt gebruikt en geven je de maandkosten voordat je opschaalt.