Blog / AI-kosten berekenen

Wat kost AI? De kosten per run, per model

Beschrijf één run van je agent en hoe vaak die draait, en je krijgt antwoord op de vraag ‘wat kost AI?’ voor jouw workload. De calculator prijst die run op negen Claude-, GPT- en Gemini-modellen tegen hun officiële lijstprijzen, gecontroleerd op 3 oktober 2026.

Je agent

Eén run is één taak van begin tot eind, zoals één beantwoord ticket of één verwerkte factuur.
Elke stap die het model iets vraagt, is één call.
Instructies, context en het gesprek tot nu toe. Ongeveer 750 woorden Engelse tekst is 1.000 tokens.
Herhaalde instructies en documenten die de provider in de cache heeft.

Modelkosten per maand

per run
per jaar
tokens per maand
van de kosten is output

Zelfde workload op elk model, per maand

Het volledige rapport voegt de kosten bij 2× en 10× volume toe, waar caching en modelkeuze het meest besparen, en de kosten voor hosting en monitoring die je naast de modelrekening begroot.

Dank je. Je rapport staat binnen één werkdag in je inbox, op basis van de cijfers hierboven.

Gebruikte prijzen

Wat kost AI? Lijstprijzen per miljoen tokens

ProviderModelInputGecachete inputOutputOpmerking
AnthropicClaude Opus 5.5$4,00$0,200$20,00
AnthropicClaude Sonnet 5.5$2,00$0,200$10,00
AnthropicClaude Haiku 4.5$1,00$0,100$5,00
AnthropicClaude Fable 5.1$10,00$0,250$50,00
OpenAIgpt-6-astra$10,00$1,000$50,00
OpenAIgpt-6.1-sol$2,00$0,100$10,00
OpenAIgpt-6-luna$0,10$0,010$0,50
GoogleGemini 3.1 Pro Preview$2,00$0,200$12,00Prompts tot 200k tokens
GoogleGemini 3.8 Flash$0,75$0,075$3,75Tarief tot 31 dec. 2026; $1,50 / $7,50 vanaf 1 jan. 2027

Amerikaanse dollars, standaard tier, gecontroleerd op 3 oktober 2026 op de prijspagina's van Anthropic, OpenAI en Google. Gecachete input is het cache-read-tarief; cache writes, batchkortingen en regionale toeslagen zitten er niet in.

De formule

  • Input per call: inputtokens × (1 − cachedeel) × inputprijs + inputtokens × cachedeel × cacheprijs
  • Output per call: outputtokens × outputprijs
  • Per run: (input + output per call) × calls per run
  • Per maand: per run × runs per maand

Wat er niet in zit

  • Hosting, monitoring en het workflowplatform waarop de agent draait.
  • Betaalde tools die de agent aanroept, zoals zoeken op het web.
  • Verschillen tussen tokenizers: dezelfde tekst telt bij elke provider een ander aantal tokens.
  • Retries en mislukte runs.

FAQ

Vragen over deze tool

Waar komen de modelprijzen vandaan?

Van de officiële API-prijspagina van elke provider, gecontroleerd op 3 oktober 2026: Anthropic, OpenAI en Google. Het zijn standaard lijstprijzen in Amerikaanse dollars, vóór volumekorting, batchkorting of regionale toeslag.

Wat is een modelcall, en waarom doet een agent er meerdere?

Een modelcall is één verzoek aan het model en één antwoord terug. Een agent die iets opzoekt, een beslissing neemt en dan een antwoord schrijft, doet voor elke stap een call, en elke call stuurt het gesprek tot dan toe opnieuw mee als input. Daarom zijn er meestal meer inputtokens dan outputtokens.

Wat doet het cachedeel?

De meeste providers rekenen minder voor input die ze kort geleden al hebben gezien, zoals een lange systeemprompt die in elke run terugkomt. Het cachedeel is het deel van de input van elke call dat tegen dat lagere cachetarief wordt gefactureerd.

Is de schatting exact?

Nee. Providers tellen tokens met verschillende tokenizers, dus dezelfde tekst is op elk model een ander aantal tokens, en echte runs verschillen in lengte. Gebruik de schatting om modellen te vergelijken en een budget te bepalen, en meet daarna het echte gebruik in een pilot.

Wat kost AI echt voor jouw agent?

We bouwen een pilot op je data, meten hoeveel tokens elke run echt gebruikt en geven je de maandkosten voordat je opschaalt.

Plan een kennismaking
Bedankt, je aanvraag is ontvangen.
Er ging iets mis bij het verzenden van het formulier.