Viele KI-Nutzer können kaum abschätzen, was ein bestimmter KI-Anwendungsfall am Ende tatsächlich kostet. Genau das führt in der Praxis zu zwei entgegengesetzten Fehlern: Entweder wird KI für Aufgaben eingesetzt, für die sie deutlich zu teuer und überqualifiziert ist – klassisches Skripting wäre günstiger und zuverlässiger – oder KI wird aus Übervorsicht gar nicht erst ausprobiert, obwohl die tatsächlichen Kosten pro Anfrage im Centbereich liegen.
Dieser Artikel stellt den Zusammenhang zwischen Copilot Credits, dem Token-Verbrauch gängiger Sprachmodelle und den tatsächlichen Kosten in Euro her und liefert ein Werkzeug, mit dem sich diese Kosten vorher abschätzen lassen, statt sie hinterher auf der Rechnung zu entdecken.
Warum überhaupt nutzungsbasierte Abrechnung?
Viele Copilot-Nutzer, bzw. KI-Anwender im Allgemeinen empfinden die Umstellung auf nutzungsbasierte Abrechnung als nachträgliches Kassieren. Zwei, drei Jahre lang gab es feste Lizenzpreise. Jetzt, nach dem Vendor-Lock-in, kommt die Rechnung nach Verbrauch. So wirkt es zumindest.
Die Realität ist komplizierter. Sprachmodelle sind in dieser Zeit deutlich leistungsfähiger geworden. Mehr Leistung kostet mehr Rechenkapazität pro Anfrage, vor allem bei mehrstufigen Agenten wie Copilot Cowork, die im Hintergrund dutzende Einzelaufrufe auslösen. Gleichzeitig sinkt der nötige Aufwand auf der Eingabeseite: Bessere Modelle brauchen oft kürzere, einfachere Anweisungen für dasselbe Ergebnis. Und die Ergebnisse selbst sind heute spürbar besser als vor ein bis zwei Jahren. Der Nutzen pro Anfrage ist also mitgewachsen, nicht nur der Preis.
Dahinter steckt eine einfache Kapazitätsrechnung. Microsoft mietet oder kauft GPU-Kapazität für seine Modelle. Anthropic und OpenAI brauchen wiederum GPU-Kapazität, um die nächste Modellgeneration zu trainieren. Diese Nachfrage nach Rechenleistung war vor zwei, drei Jahren in diesem Ausmaß kaum vorherzusehen, auch nicht für die Anbieter selbst. Nutzungsbasierte Abrechnung bildet diese Kosten direkter ab als eine Pauschale es könnte.
Für die eigene Praxis ändert das nichts an der Kernaussage dieses Artikels: Wer die Kosten pro Aktion kennt und das richtige Werkzeug für die Aufgabe wählt, behält die Kontrolle, unabhängig davon, ob die Abrechnung fair wirkt oder nicht.
Was ein „Credit“ eigentlich ist
Copilot Credits sind Microsofts „Versuch“, unterschiedlich teure Modell- und API-Aufrufe in eine einzige, für Endnutzer verständliche Währung zu übersetzen. Als grobe Faustregel gilt: 1 Credit entspricht etwa 0,01 US-Dollar. Wie viele Credits eine einzelne Aktion tatsächlich verbraucht, hängt von vier Faktoren ab:
- welches Modell im Hintergrund arbeitet (kleinere Modelle sind pro Anfrage deutlich günstiger als große)
- wie lang der Input ist: Je mehr Kontext (Dokumente, E-Mails, Chatverlauf) mitgeschickt wird, desto mehr Input-Tokens fallen an
- wie lang der erzeugte Output ist
- wie viele einzelne Schritte bzw. Anfragen eine Aktion insgesamt auslöst. Bei autonomen Agents wie Copilot Cowork können das mehrere Dutzend Einzelaufrufe pro Aufgabe sein
In der Praxis lassen sich grobe Kostenbereiche pro Aktion unterscheiden:
- einfache, kurze Anfragen bewegen sich häufig im Bereich von 100–300 Credits,
- mittlere Aufgaben mit etwas mehr Kontext oder mehreren Schritten im Bereich von 300–700 Credits.
- Komplexe, mehrstufige Agent-Aufgaben können deutlich über 700 Credits liegen.
Das sind Größenordnungen, keine exakten Werte aber sie reichen aus, um vorab abzuschätzen, ob ein Anwendungsfall realistisch im Rahmen eines Prepaid-Pakets bleibt oder schnell in die Pay-as-you-go-Abrechnung rutscht.
Die zweite Quelle: reine API-Tokenpreise
Wer eigene Automatisierungen direkt über eine API baut, zahlt nicht in Credits, sondern direkt pro Token, getrennt nach Input- und Output-Tokens. Ein Blick auf die aktuellen Preise der gängigen Modellfamilien zeigt zwei Muster: Erstens kosten Output-Tokens durchgängig etwa das Fünf- bis Sechsfache von Input-Tokens. Zweitens dominiert in den meisten realen Anwendungsfällen trotzdem das Input-Volumen die Gesamtkosten, weil deutlich mehr Kontext hinein- als Text herausfließt.
| Modell | Input (pro Mio. Tokens) | Output (pro Mio. Tokens) |
| GPT-5.6 Sol | 2,00 $ | 10,00 $ |
| GPT-5.6 Terra | 1,00 $ | 6,00 $ |
| GPT-5.6 Luna | 0,10 $ | 0,60 $ |
| Claude Opus 5 | 5,00 $ | 25,00 $ |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ |
| Claude Haiku 4.5 | 1,00 $ | 5,00 $ |
Daraus lässt sich eine einfache Faustformel für die Kostenschätzung ableiten:
Euro-Kosten ≈ (Anzahl der Anfragen) × (Input-Tokens × Input-Preis + Output-Tokens × Output-Preis)
Diese Formel eignet sich hervorragend, um vorab – also vor der eigentlichen Automatisierung – eine grobe Kostenschätzung in Euro zu erhalten, bevor man sich für ein bestimmtes Modell oder Werkzeug entscheidet.
Beispiel: Globalen Font-Austausch in einer umfangreichen Powerpoint-Präsentation
Ein gutes Beispiel (Anti-Pattern) dafür, wann KI die falsche Wahl ist, liefert eine ganz praktische Aufgabe: das durchgängige Anpassen von Schriftart oder Hintergrundbild über einen kompletten, mehrere hundert Folien umfassenden PowerPoint-Foliensatz hinweg, wie es z. B: bei der Pflege großer Schulungsunterlagen regelmäßig anfällt.
Rein technisch wäre das natürlich ein passender KI-Anwendungsfall: Ein Sprachmodell könnte theoretisch jede Folie einzeln analysieren und anpassen. In der Praxis wäre das aber massiv überqualifiziert und unnötig teuer, weil sich dieselbe Aufgabe mit traditionellen Mitteln – einem kurzen Python- oder PowerShell-Skript, das direkt auf die zugrunde liegende XML-Struktur der Datei zugreift – in Sekunden und ohne jede Token-Kosten erledigen lässt.
Zur Einordnung, rein als Größenordnung gerechnet: Müsste ein Sprachmodell für einen Foliensatz mit mehreren hundert Folien jede Folie einzeln als Kontext einlesen und eine angepasste Version zurückgeben, kämen schnell mehrere Millionen Input- und Output-Tokens zusammen. Das ist je nach Modell ein Betrag im ein- bis niedrigen zweistelligen Euro-Bereich, für eine Aufgabe, die ein deterministisches Skript in Sekundenbruchteilen und praktisch kostenlos erledigt.
Nicht jede Aufgabe, die sich sprachlich beschreiben lässt, ist auch eine sinnvolle Aufgabe für KI. Strukturelle, regelbasierte Änderungen an klar definierten Dateiformaten sind fast immer ein Fall für klassische Automatisierung. KI lohnt sich dort, wo Inhalte verstanden, formuliert oder aus unstrukturierten Quellen extrahiert werden müssen, aber eher nicht, wenn ein immer gleiches, mechanisches Muster auf viele Objekte angewendet wird.
Eine praktische Checkliste für die eigene Kostenschätzung
Bevor eine Aufgabe an KI übergeben wird, lohnen sich vier kurze Fragen:
- Ist die Aufgabe strukturell und regelbasiert (dann: klassisches Skript) oder erfordert sie Sprachverständnis und Kontext (dann: KI sinnvoll)?
- Wie viele Objekte (Folien, Dokumente, Zeilen, Datensätze) müssen einzeln verarbeitet werden und damit verbunden: wie oft wiederholt sich der Token-Verbrauch?
- Reicht ein kleines, günstiges Modell (z. B. GPT-5.6 Luna oder Claude Haiku 4.5), oder ist tatsächlich die Qualität eines größeren Modells nötig?
- Wie hoch ist die grobe Euro-Schätzung nach obiger Formel und steht sie in einem vernünftigen Verhältnis zum Zeitaufwand einer manuellen oder klassisch automatisierten Lösung?
Wer diese vier Fragen vor dem Start beantwortet, vermeidet sowohl unnötig teure KI-Einsätze als auch die umgekehrte Falle – KI aus Unsicherheit über die Kosten erst gar nicht zu nutzen, obwohl sie für die konkrete Aufgabe tatsächlich die schnellere und günstigere Wahl wäre.
