OpenAI vereinfacht die Nutzungsstufen seiner API, die OpenAI API Tiers. Aus fünf bezahlten Tiers werden drei: Build, Launch und Grow. Der Weg zu höheren Rate Limits wird kürzer, die Zahlungsschwellen sinken. Deine Organisation zieht automatisch um, du musst nichts tun, und an den API-Preisen ändert sich nichts.
Dieser Beitrag richtet sich an Inhaber, Entwicklerinnen und IT-Verantwortliche in kleinen und mittleren Unternehmen, die OpenAI-Modelle in eigenen Anwendungen, Agenten oder Automationen nutzen. Du erfährst, wie die neuen Stufen aussehen, welches Limit bei deiner Last zuerst bremst und welche drei Einstellungen du jetzt setzen solltest, damit die API-Rechnung planbar bleibt.
der kern in drei sätzen
OpenAI ersetzt fünf bezahlte API-Stufen durch Build (ab 5 Dollar), Launch (ab 100 Dollar) und Grow (ab 500 Dollar Guthabenkäufen), der Umzug läuft automatisch und ohne Preisänderung. Tier 1 und Tier 3 bekommen höhere Limits, und bei Agenten mit viel Kontext bremst meist das Token-Limit, nicht die Zahl der Anfragen. Setz jetzt Spend Alerts und ein Hard Limit je Projekt, damit höhere Limits nicht zu höheren Überraschungen führen.
Was sich ändert
Bisher gab es Tier 1 bis Tier 5. Jetzt fasst OpenAI je zwei Stufen zusammen: Tier 1 und 2 werden zu Build, Tier 3 und 4 zu Launch, Tier 5 wird zu Grow. Organisationen in Tier 1 und Tier 3 bekommen dadurch höhere Rate Limits. Wer in Tier 2, 4 oder 5 war, behält seine bisherigen Limits. Der Umzug kostet keine zusätzliche Zahlung.
Aus fünf werden drei
Deine Organisation zieht automatisch um. Ohne Zahlung, ohne Preisänderung.
- Tier 1höhere Limits
- Tier 2Limits bleiben
- Tier 3höhere Limits
- Tier 4Limits bleiben
- Tier 5Limits bleiben
- Buildab 5 $ Guthabenkauf
- Launchab 100 $ Guthabenkauf
- Growab 500 $ Guthabenkauf
Tier 1 und Tier 3 bekommen höhere Rate Limits. Tier 2, 4 und 5 behalten ihre bisherigen Limits.
Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.
Für die Praxis heißt das: Wer bisher in Tier 1 feststeckte und an Rate Limits stieß, hat jetzt sofort mehr Luft. Gerade kleine Teams, die ein paar Dollar Guthaben gekauft und dann einen Agenten gebaut haben, profitieren am meisten.
Wie du in die nächste Stufe kommst
Die Stufe hängt an deinen gesamten Guthabenkäufen, nicht an einem Antrag. Build erreichst du ab 5 Dollar, Launch ab 100 Dollar, Grow ab 500 Dollar. Jede Stufe hat zusätzlich ein monatliches Nutzungslimit: 500 Dollar in Build, 5.000 Dollar in Launch, 200.000 Dollar in Grow. Der Aufstieg passiert automatisch, sobald die Schwelle erreicht ist.
So steigst du auf
Die nächste Stufe hängt an deinen gesamten Guthabenkäufen, nicht an einem Antrag.
- Buildab 5 $ Guthabenkäufen insgesamt500 $Nutzungslimit pro Monat
- Launchab 100 $ Guthabenkäufen insgesamt5.000 $Nutzungslimit pro Monat
- Growab 500 $ Guthabenkäufen insgesamt200.000 $Nutzungslimit pro Monat
Der Aufstieg passiert automatisch, sobald die Schwelle erreicht ist. Die kostenlose Stufe erlaubt in unterstützten Ländern 100 $ pro Monat.
Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.
Die OpenAI Rate Limits im Überblick
OpenAI nennt die Limits je Modellgruppe. Astra, Sol und Terra teilen sich dieselben Werte, Luna als schnelles und günstiges Modell bekommt deutlich mehr Tokens pro Minute. RPM steht für Anfragen pro Minute, TPM für Tokens pro Minute.
| Stufe | Astra, Sol, Terra | Luna |
|---|---|---|
| Build | 5.000 RPM 1 Mio. TPM | 5.000 RPM 2 Mio. TPM |
| Launch | 10.000 RPM 4 Mio. TPM | 10.000 RPM 10 Mio. TPM |
| Grow | 15.000 RPM 40 Mio. TPM | 30.000 RPM 180 Mio. TPM |
Rate Limits je Stufe
Von Build bis Grow wächst der Token-Durchsatz bis zum 90-Fachen.
- Build1.000.000
- Launch4.000.000
- Grow40.000.000
Angezeigt: Tokens pro Minute. Luna, das schnelle und günstige Modell, bekommt deutlich mehr Tokens pro Minute: in Grow 180 Millionen statt 40 Millionen.
Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.
Auffällig ist der Sprung beim Token-Durchsatz. Bei Astra, Sol und Terra steigt TPM von Build bis Grow auf das 40-Fache, bei Luna auf das 90-Fache. Die Anfragen pro Minute wachsen dagegen nur auf das Drei- bis Sechsfache. Für viele Anwendungen ist deshalb TPM die Grenze, an die du zuerst stößt.
Welches Limit bremst dich zuerst?
Ob dich RPM oder TPM begrenzt, hängt davon ab, wie viele Tokens eine Anfrage verbraucht, Eingabe und Ausgabe zusammen. Eine kurze Chat-Antwort braucht einige hundert Tokens. Ein Agent, der ein langes Dokument, den Gesprächsverlauf und Werkzeugergebnisse mitschickt, kommt schnell auf 20.000 Tokens und mehr. Probiere es mit deinen eigenen Werten aus.
Rechner
Welches Limit bremst dich zuerst: Anfragen oder Tokens?
Build
250Anfragen pro Minute. Es bremst das Token-Limit.
Launch
1.000Anfragen pro Minute. Es bremst das Token-Limit.
Grow
10.000Anfragen pro Minute. Es bremst das Token-Limit.
Faustregel: Chat-Antworten brauchen einige hundert bis wenige tausend Tokens, Agenten mit langem Kontext oft 20.000 und mehr. Dann bremst TPM, nicht RPM.
Vereinfachte Rechnung: min(RPM, TPM ÷ Tokens je Anfrage). Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.
Ein Beispiel: Bei 4.000 Tokens je Anfrage schafft Build mit Sol oder Terra rechnerisch 250 Anfragen pro Minute, weil 1.000.000 Tokens geteilt durch 4.000 eben 250 ergibt. Die 5.000 erlaubten Anfragen spielen dann keine Rolle. In Launch sind es 1.000, in Grow 10.000. Wer viele kurze Aufgaben hat, etwa Klassifizieren oder Extrahieren, kommt mit Luna deutlich weiter. Welche Aufgaben sich dafür eignen, kläre ich mit Unternehmen im Rahmen von Digitalisierung und KI.
Mein Rat für Agenten: Schick nicht bei jedem Schritt den gesamten Verlauf mit. Kürzerer Kontext senkt Kosten und schont das Token-Limit zugleich. Wie stark der Aufgabenzuschnitt die Kosten bestimmt, habe ich im Beitrag Was eine Aufgabe auf Opus 5.5 kostet durchgerechnet.
Ausgaben unter Kontrolle
Mit den höheren Limits steigt auch das Risiko einer unerwarteten Rechnung. Eine Schleife in einem Agenten verbraucht in Grow in einer Minute mehr, als früher in Tier 1 überhaupt möglich war. OpenAI bietet dafür zwei Werkzeuge auf der Limits-Seite deiner Organisation: Spend Alerts und ein optionales Hard Spend Limit.
Ausgabenkontrolle
Das eine warnt. Das andere zieht die Bremse.
Spend Alert
- schickt eine Benachrichtigung
Der API-Verkehr läuft weiter.
- sinnvoll, wenn
du Ausgaben verfolgen willst, ohne den Dienst zu unterbrechen.
- meine Empfehlung
bei 50 und 80 Prozent des Monatsbudgets.
Hard Spend Limit
- stoppt betroffene Anfragen
Sie liefern den Fehler 429.
- sinnvoll, wenn
du eine harte Monatsgrenze je Organisation oder Projekt brauchst.
- meine Empfehlung
eine Grenze je Projekt, damit ein entgleister Test nicht die Produktion trifft.
Beide Kontrollen sind unabhängig vom monatlichen Nutzungslimit deiner Stufe. Du setzt sie auf der Limits-Seite deiner Organisation.
Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.
Das Nutzungslimit deiner Stufe schützt OpenAI, deine eigenen Grenzen schützen dein Budget. Setz sie, bevor ein Projekt live geht, nicht danach. Wie ich Budgetgrenzen bei Google-Diensten setze, steht im Beitrag Google Skills für Claude Code.
Aus meiner Praxis: der stille 404
Wie wichtig saubere Fehlerbehandlung ist, habe ich im September 2026 an meiner eigenen Einrichtung gesehen. Meine Code-Reviews laufen über ein OpenAI-Modell. In der Konfiguration stand ein Modellname, den die API nicht kannte. Jeder Aufruf kam mit dem Fehler 404 zurück, und weil mein Prüfschritt nur „fehlgeschlagen“ meldete, sah das aus wie ein inhaltlicher Befund statt wie ein Verbindungsfehler.
Seitdem gelten bei mir zwei Regeln. Nach jedem Modell- oder Stufenwechsel prüfe ich die Einrichtung mit einem echten Testaufruf, nicht nur die Konfigurationsdatei. Und mein Code unterscheidet die Fehlercodes: 404 heißt falsches Modell oder fehlender Zugang, 429 heißt Rate Limit oder Ausgabengrenze. Wer beides gleich behandelt, sucht an der falschen Stelle.
Was du jetzt tun solltest
Vier Schritte
- 01Limits-Seite öffnen
platform.openai.com, Einstellungen deiner Organisation, Limits. Dort stehen deine neue Stufe und die Limits je Modell.
- 02Spend Alerts setzen
Zwei Schwellen pro Monat reichen. Sie warnen dich, ohne etwas zu stoppen.
- 03Hard Limit je Projekt setzen
Getrennte Projekte für Test und Produktion. Eine Schleife im Test stoppt dann an ihrer eigenen Grenze.
- 04429 im Code abfangen
Wiederholen mit exponentiellem Backoff und die Antwort-Header protokollieren. Ein 429 kann Rate Limit oder Ausgabengrenze bedeuten.
Wenn du Modelle verschiedener Anbieter vergleichst, lohnt sich ein Blick auf den Unterschied zwischen Plattform und Modell. Wie OpenAI seine Agenten-Plattform aufstellt, beschreibe ich im Beitrag OpenAI dots: was die neuen KI-Agenten können. Wie Anthropic kleine Betriebe adressiert, zeigt der Beitrag Claude for Small Business.
Häufige Fragen
Was sind die neuen OpenAI API Tiers?
Build, Launch und Grow. Sie ersetzen die fünf bisherigen bezahlten Tiers: Tier 1 und 2 werden Build, Tier 3 und 4 werden Launch, Tier 5 wird Grow.
Muss ich für den Umzug etwas tun oder bezahlen?
Nein. Deine Organisation wechselt automatisch in die neue Stufe. Es gibt keine zusätzliche Zahlung und keine Änderung der API-Preise.
Wie komme ich in eine höhere Stufe?
Über deine gesamten Guthabenkäufe: Build ab 5 Dollar, Launch ab 100 Dollar, Grow ab 500 Dollar. Der Aufstieg passiert automatisch.
Warum hat Luna höhere Token-Limits als Sol oder Terra?
Luna ist das schnelle und günstige Modell für viele kurze Aufgaben. OpenAI erlaubt dafür mehr Tokens pro Minute, in Grow 180 Millionen statt 40 Millionen.
Wie verhindere ich eine unerwartet hohe API-Rechnung?
Setz auf der Limits-Seite Spend Alerts für Warnungen und ein Hard Spend Limit, das betroffene Anfragen mit Fehler 429 stoppt. Am sichersten mit getrennten Projekten für Test und Produktion.
Quellen und Stand
Stand: 7. Oktober 2026. Limits und Schwellen können sich ändern. Maßgeblich ist die Limits-Seite deiner Organisation.
- OpenAI: E-Mail an API-Kunden „More room to build. Simpler usage tiers on the OpenAI API“, Oktober 2026 (Umstellung, Zuordnung der Tiers, Rate Limits, Spend Alerts und Hard Spend Limit).
- OpenAI: Rate limits guide: Stufen, Schwellen, Nutzungslimits, RPM und TPM je Modell, Spend Controls, abgerufen am 7. Oktober 2026.
- OpenAI: Spend limits.
- OpenAI Platform: Limits deiner Organisation (Anmeldung nötig).
Bildhinweis: Alle Bildmotive sind KI-generiert (Gemini 3 Pro Image) und für diesen Beitrag erstellt. Die Diagramme und der Rechner sind eigene Darstellungen nach den genannten Quellen; der Rechner vereinfacht und berücksichtigt keine weiteren Limits wie Tageskontingente oder Batch.


