AI Academy News - AI-Token 2025: Warum Denken billiger wird und der Verbrauch trotzdem steigt
AI-TOKEN 2025

Research

AI-Token 2025: Warum Denken billiger wird und der Verbrauch trotzdem steigt

Research

Die Kosten pro Leistungseinheit fallen rasant. Gleichzeitig treiben Reasoning, Nutzung und Rechenzentren den gesamten Ressourcenbedarf nach oben.

AI-Avatar ArneKI-gestützt · AI-Avatar Arne · AI Voice & Audio · AI-Academy
TB

Expert in the Loop · Fachlich geprüft von Dr. Tom Berger

26. September 2026 · 5 Min Lesezeit

Artikel teilen
Artikel anhören

Management Summary

Die Kosten pro Leistungseinheit fallen rasant. Gleichzeitig treiben Reasoning, Nutzung und Rechenzentren den gesamten Ressourcenbedarf nach oben.

Was ein AI-Token ist

Ein Token ist eine Verarbeitungseinheit für Sprachmodelle. Wörter werden dabei in kleinere Bestandteile zerlegt; als grobe Faustregel entsprechen 100 englische Token ungefähr 75 Wörtern. Die genaue Zahl hängt von Sprache, Schreibweise und Modell ab. AI-Token sind keine Kryptowährungen und besitzen keinen handelbaren Marktwert. Sie messen, wie viel Text ein Modell einliest oder ausgibt.

Diese Einheit ist für Unternehmen wichtig, weil viele Programmierschnittstellen nach Input- und Output-Token abrechnen. Lange Dokumente, umfangreiche Systemanweisungen, wiederholter Kontext und ausführliche Antworten erhöhen die Kosten. Bei sogenannten Reasoning-Modellen können zusätzlich interne Verarbeitungsschritte anfallen, die nicht direkt als sichtbarer Text erscheinen.

AI ECONOMICSKosten für gleichbleibende Modellleistung
≈ 50×Medianer Preisrückgang pro Jahr
≈ 200×Neuere Modelle ab 2024
78 Mio. $Geschätzte GPT-4-Trainingskosten
100.000Haushaltsäquivalent eines typischen AI-Rechenzentrums

Analyse 2022–2025 · Epoch AI · Stanford HAI

Leistung wird schneller günstiger

Epoch AI hat untersucht, wie stark die Kosten sinken, um ein gleichbleibendes Leistungsniveau auf etablierten Benchmarks zu erreichen.[1] Für den Zeitraum 2022 bis 2025 ergibt sich je nach Aufgabe ein sehr unterschiedlicher Rückgang. Der Median liegt bei ungefähr dem Faktor 50 pro Jahr; bei nach Januar 2024 veröffentlichten Modellen sogar bei rund Faktor 200 pro Jahr. Die Spannweite ist groß, weil sich Mathematik, Wissenschaft, Sprache und andere Aufgaben unterschiedlich entwickeln.

Dieser Vergleich ist aussagekräftiger als eine reine Preisliste. Ein günstiges Modell kann unwirtschaftlich sein, wenn es für eine Aufgabe zu viele Fehler produziert. Umgekehrt kann ein teureres Modell insgesamt günstiger sein, wenn es weniger Nacharbeit erzeugt. Entscheidend sind deshalb Kosten pro ausreichend gut gelöstem Vorgang, nicht nur Kosten pro Million Token.

Warum sinkende Stückkosten den Gesamtverbrauch erhöhen können

Billigere Inferenz macht neue Anwendungen wirtschaftlich. Dadurch steigt die Zahl der Anfragen, und Modelle bearbeiten längere Kontexte oder komplexere Aufgaben. Dieser Rebound-Effekt ist aus anderen Technologien bekannt: Wenn eine Leistung günstiger wird, wächst ihre Nutzung oft schneller als die Effizienz. Unternehmen können daher trotz sinkender Tokenpreise höhere Gesamtausgaben sehen.

Reasoning verstärkt diesen Effekt. Ein Modell kann für dieselbe sichtbare Antwort erheblich mehr interne Rechenschritte verwenden. Herstellerangaben zu monatlich verarbeiteten Token dürfen deshalb nicht direkt als Wachstum der Nutzerzahl interpretiert werden. Sie zeigen zunächst Rechenvolumen, nicht automatisch Reichweite oder geschaffenen Nutzen.

Training und Inferenz sind verschiedene Kostenblöcke

Der Stanford AI Index schätzt die reinen Rechenkosten für das Training von GPT-4 auf ungefähr 78 Millionen US-Dollar.[2] Diese Zahl umfasst nicht alle Forschungs-, Personal- und Infrastrukturkosten. Sie verdeutlicht jedoch die Größenordnung großer Trainingsläufe. Nach dem Training entstehen Inferenzkosten bei jeder Nutzung des Modells. Bei einem stark verwendeten Produkt können sie über die Lebensdauer wirtschaftlich ebenso relevant werden.

Für Anwenderunternehmen ist das Training eines Frontier-Modells selten die entscheidende Rechnung. Wichtiger ist, wie viele Vorgänge monatlich verarbeitet werden, wie lang der Kontext ist, welches Modell tatsächlich nötig ist und wie oft Antworten wiederholt oder menschlich korrigiert werden müssen.

Energie wird zum Standortfaktor

Die Internationale Energieagentur vergleicht ein typisches KI-Rechenzentrum mit dem Stromverbrauch von 100.000 Haushalten.[3] Die größten derzeit geplanten Anlagen könnten ungefähr das Zwanzigfache erreichen. Solche Vergleiche sind Näherungen, machen aber die Größenordnung der Infrastruktur sichtbar. Zugleich umfasst der weltweite Strombedarf von Rechenzentren nicht nur KI, sondern auch Cloud-Dienste, Speicherung und klassische Anwendungen.

Die IEA berichtet für 2024 einen Anstieg des globalen Stromverbrauchs um 4,3 Prozent und erwartet bis 2027 weiteres kräftiges Wachstum.[4] Rechenzentren sind dabei ein Treiber unter mehreren, neben Klimatisierung, Elektrifizierung und Industrie. Eine seriöse Einordnung darf den gesamten Zuwachs daher nicht allein KI zuschreiben.

Wie Unternehmen Tokenkosten steuern

Der erste Hebel ist Modellauswahl. Viele Routineaufgaben benötigen kein größtes Modell. Ein abgestuftes System kann einfache Klassifikation oder Extraktion an kleinere Modelle geben und nur schwierige Fälle eskalieren. Zweitens sollte Kontext gezielt ausgewählt werden. Ganze Datenbestände in jede Anfrage zu kopieren ist teuer und erhöht das Risiko irrelevanter Antworten.

Drittens helfen Caching und wiederverwendbare Ergebnisse. Wiederkehrende Anweisungen oder identische Dokumentteile müssen nicht immer neu verarbeitet werden. Viertens gehört Qualität in die Kostenrechnung: Fehler, menschliche Prüfung und Verzögerungen sind reale Aufwände. Das billigste Token ist nicht automatisch die günstigste Lösung.

Eigene Analyse

Der rapide Preisverfall verschiebt den Wettbewerb. Zugang zu Modellleistung wird weniger knapp; wichtiger werden Prozessdesign, proprietäre Daten, Qualitätssicherung und Integration. Gleichzeitig wächst der Ressourcenbedarf, weil Unternehmen mehr Anwendungsfälle automatisieren und Modelle längere Denkpfade nutzen. Effizienz pro Anfrage und Gesamtverbrauch können deshalb gleichzeitig in entgegengesetzte Richtungen laufen.

Für Führungsteams sollte die relevante Kennzahl nicht „Token pro Monat“ lauten, sondern „Kosten pro verlässlich abgeschlossenem Geschäftsvorgang“. Diese Sicht verbindet Modellpreis, Antwortqualität, menschliche Kontrolle und Infrastruktur. Sie verhindert auch, dass beeindruckende Volumenzahlen mit wirtschaftlichem Wert verwechselt werden.

Fazit

AI-Token werden als Leistungseinheit rasch günstiger, doch das bedeutet nicht automatisch sinkende Budgets oder geringeren Energiebedarf. Mehr Nutzung, längere Kontexte und Reasoning können Effizienzgewinne überkompensieren. Unternehmen sollten Modelle nach Aufgaben staffeln, Kontext begrenzen und Kosten gemeinsam mit Qualität messen.

Häufige Fragen

Sind AI-Token Kryptowährungen?

Nein. AI-Token sind Text- und Verarbeitungseinheiten eines Modells. Sie sind keine digitalen Vermögenswerte.

Warum unterscheiden sich Input- und Outputpreise?

Die Erzeugung neuer Token benötigt in vielen Systemen mehr laufende Berechnung als das Einlesen. Anbieter kalkulieren diese Schritte deshalb unterschiedlich.

Bedeutet ein niedriger Tokenpreis automatisch niedrige Gesamtkosten?

Nein. Anfragezahl, Kontextlänge, Reasoning, Fehlerquote und menschliche Nacharbeit bestimmen die tatsächlichen Kosten.

Noch keine Kurse verfügbar.

Dein nächster Schritt

Lernen, vernetzen, umsetzen

Wissen anwenden statt nur lesen – vertiefe das Thema in unseren KI-Kursen mit Zertifikat, Executive Circle, KI-Trends und AI Automation.