direkt zum inhalt

7. Oktober 2026KIUnternehmen

OpenAI API Tiers: Build, Launch und Grow ersetzen fünf StufenOpenAI API tiers: Build, Launch and Grow replace five tiers

OpenAI fasst die bezahlten API-Stufen zu Build, Launch und Grow zusammen. Ich zeige die neuen Rate Limits und Schwellen, welches Limit deine Last zuerst bremst und welche Ausgabengrenzen du jetzt setzen solltest.OpenAI merges its paid API tiers into Build, Launch and Grow. I show the new rate limits and thresholds, which limit your workload hits first and which spend limits you should set now.

OpenAI vereinfacht die Nutzungsstufen seiner API, die OpenAI API Tiers. Aus fünf bezahlten Tiers werden drei: Build, Launch und Grow. Der Weg zu höheren Rate Limits wird kürzer, die Zahlungsschwellen sinken. Deine Organisation zieht automatisch um, du musst nichts tun, und an den API-Preisen ändert sich nichts.

Dieser Beitrag richtet sich an Inhaber, Entwicklerinnen und IT-Verantwortliche in kleinen und mittleren Unternehmen, die OpenAI-Modelle in eigenen Anwendungen, Agenten oder Automationen nutzen. Du erfährst, wie die neuen Stufen aussehen, welches Limit bei deiner Last zuerst bremst und welche drei Einstellungen du jetzt setzen solltest, damit die API-Rechnung planbar bleibt.

der kern in drei sätzen

OpenAI ersetzt fünf bezahlte API-Stufen durch Build (ab 5 Dollar), Launch (ab 100 Dollar) und Grow (ab 500 Dollar Guthabenkäufen), der Umzug läuft automatisch und ohne Preisänderung. Tier 1 und Tier 3 bekommen höhere Limits, und bei Agenten mit viel Kontext bremst meist das Token-Limit, nicht die Zahl der Anfragen. Setz jetzt Spend Alerts und ein Hard Limit je Projekt, damit höhere Limits nicht zu höheren Überraschungen führen.

Drei breite Stufen aus hellem Beton in einem lichten Atrium, jede höher als die vorige, auf der obersten steht eine kleine grüne Pflanze
Drei Stufen statt fünf: Build, Launch, Grow. KI-generiertes Bild in 4K, erstellt für diesen Beitrag.

Was sich ändert

Bisher gab es Tier 1 bis Tier 5. Jetzt fasst OpenAI je zwei Stufen zusammen: Tier 1 und 2 werden zu Build, Tier 3 und 4 zu Launch, Tier 5 wird zu Grow. Organisationen in Tier 1 und Tier 3 bekommen dadurch höhere Rate Limits. Wer in Tier 2, 4 oder 5 war, behält seine bisherigen Limits. Der Umzug kostet keine zusätzliche Zahlung.

Aus fünf werden drei

Deine Organisation zieht automatisch um. Ohne Zahlung, ohne Preisänderung.

  • Tier 1höhere Limits
  • Tier 2Limits bleiben
  • Tier 3höhere Limits
  • Tier 4Limits bleiben
  • Tier 5Limits bleiben
  • Buildab 5 $ Guthabenkauf
  • Launchab 100 $ Guthabenkauf
  • Growab 500 $ Guthabenkauf

Tier 1 und Tier 3 bekommen höhere Rate Limits. Tier 2, 4 und 5 behalten ihre bisherigen Limits.

Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.

Für die Praxis heißt das: Wer bisher in Tier 1 feststeckte und an Rate Limits stieß, hat jetzt sofort mehr Luft. Gerade kleine Teams, die ein paar Dollar Guthaben gekauft und dann einen Agenten gebaut haben, profitieren am meisten.

Wie du in die nächste Stufe kommst

Die Stufe hängt an deinen gesamten Guthabenkäufen, nicht an einem Antrag. Build erreichst du ab 5 Dollar, Launch ab 100 Dollar, Grow ab 500 Dollar. Jede Stufe hat zusätzlich ein monatliches Nutzungslimit: 500 Dollar in Build, 5.000 Dollar in Launch, 200.000 Dollar in Grow. Der Aufstieg passiert automatisch, sobald die Schwelle erreicht ist.

So steigst du auf

Die nächste Stufe hängt an deinen gesamten Guthabenkäufen, nicht an einem Antrag.

  1. Buildab 5 $ Guthabenkäufen insgesamt500 $Nutzungslimit pro Monat
  2. Launchab 100 $ Guthabenkäufen insgesamt5.000 $Nutzungslimit pro Monat
  3. Growab 500 $ Guthabenkäufen insgesamt200.000 $Nutzungslimit pro Monat

Der Aufstieg passiert automatisch, sobald die Schwelle erreicht ist. Die kostenlose Stufe erlaubt in unterstützten Ländern 100 $ pro Monat.

Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.

Die OpenAI Rate Limits im Überblick

OpenAI nennt die Limits je Modellgruppe. Astra, Sol und Terra teilen sich dieselben Werte, Luna als schnelles und günstiges Modell bekommt deutlich mehr Tokens pro Minute. RPM steht für Anfragen pro Minute, TPM für Tokens pro Minute.

StufeAstra, Sol, TerraLuna
Build5.000 RPM
1 Mio. TPM
5.000 RPM
2 Mio. TPM
Launch10.000 RPM
4 Mio. TPM
10.000 RPM
10 Mio. TPM
Grow15.000 RPM
40 Mio. TPM
30.000 RPM
180 Mio. TPM

Rate Limits je Stufe

Von Build bis Grow wächst der Token-Durchsatz bis zum 90-Fachen.

  1. Build1.000.000
  2. Launch4.000.000
  3. Grow40.000.000

Angezeigt: Tokens pro Minute. Luna, das schnelle und günstige Modell, bekommt deutlich mehr Tokens pro Minute: in Grow 180 Millionen statt 40 Millionen.

Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.

Auffällig ist der Sprung beim Token-Durchsatz. Bei Astra, Sol und Terra steigt TPM von Build bis Grow auf das 40-Fache, bei Luna auf das 90-Fache. Die Anfragen pro Minute wachsen dagegen nur auf das Drei- bis Sechsfache. Für viele Anwendungen ist deshalb TPM die Grenze, an die du zuerst stößt.

Welches Limit bremst dich zuerst?

Ob dich RPM oder TPM begrenzt, hängt davon ab, wie viele Tokens eine Anfrage verbraucht, Eingabe und Ausgabe zusammen. Eine kurze Chat-Antwort braucht einige hundert Tokens. Ein Agent, der ein langes Dokument, den Gesprächsverlauf und Werkzeugergebnisse mitschickt, kommt schnell auf 20.000 Tokens und mehr. Probiere es mit deinen eigenen Werten aus.

Rechner

Welches Limit bremst dich zuerst: Anfragen oder Tokens?

  • Build

    250

    Anfragen pro Minute. Es bremst das Token-Limit.

  • Launch

    1.000

    Anfragen pro Minute. Es bremst das Token-Limit.

  • Grow

    10.000

    Anfragen pro Minute. Es bremst das Token-Limit.

Faustregel: Chat-Antworten brauchen einige hundert bis wenige tausend Tokens, Agenten mit langem Kontext oft 20.000 und mehr. Dann bremst TPM, nicht RPM.

Vereinfachte Rechnung: min(RPM, TPM ÷ Tokens je Anfrage). Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.

Ein Beispiel: Bei 4.000 Tokens je Anfrage schafft Build mit Sol oder Terra rechnerisch 250 Anfragen pro Minute, weil 1.000.000 Tokens geteilt durch 4.000 eben 250 ergibt. Die 5.000 erlaubten Anfragen spielen dann keine Rolle. In Launch sind es 1.000, in Grow 10.000. Wer viele kurze Aufgaben hat, etwa Klassifizieren oder Extrahieren, kommt mit Luna deutlich weiter. Welche Aufgaben sich dafür eignen, kläre ich mit Unternehmen im Rahmen von Digitalisierung und KI.

Langer Gang in einem Rechenzentrum mit dunklen Serverschränken und kleinen blauen Statuslichtern, vorne ein geöffneter Schrank mit ordentlich verlegten Kabeln
Rate Limits sind Kapazität, die du dir mit allen anderen teilst. Plane sie wie jede andere Ressource. KI-generiertes Bild in 4K.

Mein Rat für Agenten: Schick nicht bei jedem Schritt den gesamten Verlauf mit. Kürzerer Kontext senkt Kosten und schont das Token-Limit zugleich. Wie stark der Aufgabenzuschnitt die Kosten bestimmt, habe ich im Beitrag Was eine Aufgabe auf Opus 5.5 kostet durchgerechnet.

Ausgaben unter Kontrolle

Mit den höheren Limits steigt auch das Risiko einer unerwarteten Rechnung. Eine Schleife in einem Agenten verbraucht in Grow in einer Minute mehr, als früher in Tier 1 überhaupt möglich war. OpenAI bietet dafür zwei Werkzeuge auf der Limits-Seite deiner Organisation: Spend Alerts und ein optionales Hard Spend Limit.

Analoges Messgerät aus Messing und weißem Email an einer weißen Wand, der Zeiger steht im mittleren Bereich, oben eine schmale rote Markierung
Die rote Marke setzt du selbst, bevor du sie brauchst. KI-generiertes Bild in 4K.

Ausgabenkontrolle

Das eine warnt. Das andere zieht die Bremse.

Spend Alert

  • schickt eine Benachrichtigung

    Der API-Verkehr läuft weiter.

  • sinnvoll, wenn

    du Ausgaben verfolgen willst, ohne den Dienst zu unterbrechen.

  • meine Empfehlung

    bei 50 und 80 Prozent des Monatsbudgets.

Hard Spend Limit

  • stoppt betroffene Anfragen

    Sie liefern den Fehler 429.

  • sinnvoll, wenn

    du eine harte Monatsgrenze je Organisation oder Projekt brauchst.

  • meine Empfehlung

    eine Grenze je Projekt, damit ein entgleister Test nicht die Produktion trifft.

Beide Kontrollen sind unabhängig vom monatlichen Nutzungslimit deiner Stufe. Du setzt sie auf der Limits-Seite deiner Organisation.

Quelle: OpenAI, Rate limits guide (developers.openai.com), abgerufen am 7. Oktober 2026.

Das Nutzungslimit deiner Stufe schützt OpenAI, deine eigenen Grenzen schützen dein Budget. Setz sie, bevor ein Projekt live geht, nicht danach. Wie ich Budgetgrenzen bei Google-Diensten setze, steht im Beitrag Google Skills für Claude Code.

Aus meiner Praxis: der stille 404

Wie wichtig saubere Fehlerbehandlung ist, habe ich im September 2026 an meiner eigenen Einrichtung gesehen. Meine Code-Reviews laufen über ein OpenAI-Modell. In der Konfiguration stand ein Modellname, den die API nicht kannte. Jeder Aufruf kam mit dem Fehler 404 zurück, und weil mein Prüfschritt nur „fehlgeschlagen“ meldete, sah das aus wie ein inhaltlicher Befund statt wie ein Verbindungsfehler.

Seitdem gelten bei mir zwei Regeln. Nach jedem Modell- oder Stufenwechsel prüfe ich die Einrichtung mit einem echten Testaufruf, nicht nur die Konfigurationsdatei. Und mein Code unterscheidet die Fehlercodes: 404 heißt falsches Modell oder fehlender Zugang, 429 heißt Rate Limit oder Ausgabengrenze. Wer beides gleich behandelt, sucht an der falschen Stelle.

Was du jetzt tun solltest

Vier Schritte

  1. 01
    Limits-Seite öffnen

    platform.openai.com, Einstellungen deiner Organisation, Limits. Dort stehen deine neue Stufe und die Limits je Modell.

  2. 02
    Spend Alerts setzen

    Zwei Schwellen pro Monat reichen. Sie warnen dich, ohne etwas zu stoppen.

  3. 03
    Hard Limit je Projekt setzen

    Getrennte Projekte für Test und Produktion. Eine Schleife im Test stoppt dann an ihrer eigenen Grenze.

  4. 04
    429 im Code abfangen

    Wiederholen mit exponentiellem Backoff und die Antwort-Header protokollieren. Ein 429 kann Rate Limit oder Ausgabengrenze bedeuten.

Wenn du Modelle verschiedener Anbieter vergleichst, lohnt sich ein Blick auf den Unterschied zwischen Plattform und Modell. Wie OpenAI seine Agenten-Plattform aufstellt, beschreibe ich im Beitrag OpenAI dots: was die neuen KI-Agenten können. Wie Anthropic kleine Betriebe adressiert, zeigt der Beitrag Claude for Small Business.

Häufige Fragen

Was sind die neuen OpenAI API Tiers?

Build, Launch und Grow. Sie ersetzen die fünf bisherigen bezahlten Tiers: Tier 1 und 2 werden Build, Tier 3 und 4 werden Launch, Tier 5 wird Grow.

Muss ich für den Umzug etwas tun oder bezahlen?

Nein. Deine Organisation wechselt automatisch in die neue Stufe. Es gibt keine zusätzliche Zahlung und keine Änderung der API-Preise.

Wie komme ich in eine höhere Stufe?

Über deine gesamten Guthabenkäufe: Build ab 5 Dollar, Launch ab 100 Dollar, Grow ab 500 Dollar. Der Aufstieg passiert automatisch.

Warum hat Luna höhere Token-Limits als Sol oder Terra?

Luna ist das schnelle und günstige Modell für viele kurze Aufgaben. OpenAI erlaubt dafür mehr Tokens pro Minute, in Grow 180 Millionen statt 40 Millionen.

Wie verhindere ich eine unerwartet hohe API-Rechnung?

Setz auf der Limits-Seite Spend Alerts für Warnungen und ein Hard Spend Limit, das betroffene Anfragen mit Fehler 429 stoppt. Am sichersten mit getrennten Projekten für Test und Produktion.

Quellen und Stand

Stand: 7. Oktober 2026. Limits und Schwellen können sich ändern. Maßgeblich ist die Limits-Seite deiner Organisation.

Bildhinweis: Alle Bildmotive sind KI-generiert (Gemini 3 Pro Image) und für diesen Beitrag erstellt. Die Diagramme und der Rechner sind eigene Darstellungen nach den genannten Quellen; der Rechner vereinfacht und berücksichtigt keine weiteren Limits wie Tageskontingente oder Batch.

OpenAI is simplifying its API usage tiers, the OpenAI API tiers. Five paid tiers become three: Build, Launch and Grow. The path to higher rate limits gets shorter, and the payment thresholds go down. Your organisation moves automatically, no action is needed, and API pricing does not change.

This article is for owners, developers and IT leads in small and mid-sized companies who use OpenAI models in their own applications, agents or automations. You will learn what the new tiers look like, which limit hits your workload first and which three settings you should make now to keep your API bill predictable.

the core in three sentences

OpenAI replaces five paid API tiers with Build (from $5), Launch (from $100) and Grow (from $500 in credit purchases); the move is automatic and pricing stays the same. Tiers 1 and 3 get higher limits, and for agents with a lot of context it is usually the token limit that binds, not the number of requests. Set spend alerts and a hard limit per project now, so higher limits do not lead to bigger surprises.

Three wide steps of light concrete in a bright atrium, each higher than the last, a small green plant on the top step
Three tiers instead of five: Build, Launch, Grow. AI-generated 4K image, created for this article.

What changes

Until now there were Tier 1 to Tier 5. OpenAI now merges them: Tiers 1 and 2 become Build, Tiers 3 and 4 become Launch, Tier 5 becomes Grow. Organisations in Tier 1 and Tier 3 receive higher rate limits as a result. Organisations in Tiers 2, 4 and 5 keep their existing limits. The move requires no additional payment.

Five become three

Your organisation moves automatically. No payment, no price change.

  • Tier 1higher limits
  • Tier 2limits stay
  • Tier 3higher limits
  • Tier 4limits stay
  • Tier 5limits stay
  • Buildfrom $5 in credit purchases
  • Launchfrom $100 in credit purchases
  • Growfrom $500 in credit purchases

Tiers 1 and 3 receive higher rate limits. Tiers 2, 4 and 5 keep their existing limits.

Source: OpenAI, rate limits guide (developers.openai.com), retrieved 7 October 2026.

In practice: if you were stuck in Tier 1 and hitting rate limits, you have more room right away. Small teams that bought a few dollars of credit and then built an agent benefit most.

How you move up

Your tier depends on total credit purchases, not on an application. You reach Build from $5, Launch from $100 and Grow from $500. Each tier also has a monthly usage limit: $500 in Build, $5,000 in Launch, $200,000 in Grow. The upgrade happens automatically once you reach the threshold.

How you move up

The next tier depends on total credit purchases, not on an application.

  1. Buildfrom $5 in total credit purchases$500usage limit per month
  2. Launchfrom $100 in total credit purchases$5,000usage limit per month
  3. Growfrom $500 in total credit purchases$200,000usage limit per month

The upgrade happens automatically once the threshold is reached. The free tier allows $100 per month in supported countries.

Source: OpenAI, rate limits guide (developers.openai.com), retrieved 7 October 2026.

OpenAI rate limits at a glance

OpenAI lists the limits per model group. Astra, Sol and Terra share the same values; Luna, the fast and low-cost model, gets far more tokens per minute. RPM means requests per minute, TPM tokens per minute.

TierAstra, Sol, TerraLuna
Build5,000 RPM
1M TPM
5,000 RPM
2M TPM
Launch10,000 RPM
4M TPM
10,000 RPM
10M TPM
Grow15,000 RPM
40M TPM
30,000 RPM
180M TPM

Rate limits per tier

From Build to Grow, token throughput grows up to 90-fold.

  1. Build1,000,000
  2. Launch4,000,000
  3. Grow40,000,000

Shown: tokens per minute. Luna, the fast and low-cost model, gets far more tokens per minute: 180 million in Grow instead of 40 million.

Source: OpenAI, rate limits guide (developers.openai.com), retrieved 7 October 2026.

The jump in token throughput stands out. For Astra, Sol and Terra, TPM grows 40-fold from Build to Grow, for Luna 90-fold. Requests per minute only grow three- to sixfold. For many applications, TPM is therefore the limit you hit first.

Which limit hits you first?

Whether RPM or TPM limits you depends on how many tokens one request uses, input and output together. A short chat reply needs a few hundred tokens. An agent that sends a long document, the conversation history and tool results quickly reaches 20,000 tokens and more. Try it with your own values.

Calculator

Which limit hits you first: requests or tokens?

  • Build

    250

    requests per minute. Limited by tokens per minute.

  • Launch

    1,000

    requests per minute. Limited by tokens per minute.

  • Grow

    10,000

    requests per minute. Limited by tokens per minute.

Rule of thumb: chat replies use a few hundred to a few thousand tokens, agents with long context often 20,000 and more. Then TPM is the limit, not RPM.

Simplified calculation: min(RPM, TPM ÷ tokens per request). Source: OpenAI, rate limits guide (developers.openai.com), retrieved 7 October 2026.

An example: at 4,000 tokens per request, Build with Sol or Terra allows 250 requests per minute, because 1,000,000 tokens divided by 4,000 is 250. The 5,000 allowed requests do not matter then. In Launch it is 1,000, in Grow 10,000. If you have many short tasks, such as classifying or extracting, Luna takes you much further. Which tasks fit is something I work out with companies under digital and AI.

Long corridor in a data center with dark server racks and small blue status lights, an open rack with tidy cables in the foreground
Rate limits are capacity you share with everyone else. Plan them like any other resource. AI-generated 4K image.

My advice for agents: do not send the full history with every step. Shorter context lowers cost and spares the token limit at the same time. How strongly the way you cut a task drives cost is worked out in my article what a task costs on Opus 5.5.

Keeping spend under control

Higher limits also raise the risk of a surprise bill. A loop in an agent can use more in one minute in Grow than was possible at all in Tier 1. OpenAI offers two tools for this on your organisation's Limits page: spend alerts and an optional hard spend limit.

Analog brass and white enamel gauge on a white wall, the needle in the middle range, a slim red mark near the top
You set the red mark yourself, before you need it. AI-generated 4K image.

Spend controls

One warns you. The other pulls the brake.

Spend Alert

  • sends a notification

    API traffic continues.

  • use it when

    you want to track spend without interrupting your service.

  • my setting

    at 50 and 80 percent of the monthly budget.

Hard Spend Limit

  • stops affected requests

    They return a 429 error.

  • use it when

    you need a hard monthly cap per organisation or project.

  • my setting

    one cap per project, so a runaway test cannot hit production.

Both controls are separate from the monthly usage limit of your tier. You set them on the Limits page of your organisation.

Source: OpenAI, rate limits guide (developers.openai.com), retrieved 7 October 2026.

Your tier's usage limit protects OpenAI; your own limits protect your budget. Set them before a project goes live, not afterwards. How I set budget limits for Google services is covered in Google Skills for Claude Code.

From my own practice: the silent 404

I saw how much clean error handling matters in my own setup in September 2026. My code reviews run on an OpenAI model. The configuration named a model the API did not know. Every call came back with error 404, and because my check step only reported "failed", it looked like a finding in the code rather than a connection error.

Since then I follow two rules. After every model or tier change I test the setup with a real call, not just the configuration file. And my code tells the error codes apart: 404 means wrong model or missing access, 429 means rate limit or spend limit. If you treat both the same, you look in the wrong place.

What to do now

Four steps

  1. 01
    open the Limits page

    platform.openai.com, settings of your organisation, Limits. There you see your new tier and the limits per model.

  2. 02
    set spend alerts

    Two thresholds per month are enough. They warn you without stopping anything.

  3. 03
    set a hard limit per project

    Separate projects for test and production. A loop in a test then stops at its own limit.

  4. 04
    handle 429 in your code

    Retry with exponential backoff and log the response headers. A 429 can mean rate limit or spend limit.

If you compare models from different providers, it helps to separate platform from model. How OpenAI sets up its agent platform is covered in OpenAI dots: what the new AI agents can do. How Anthropic addresses small businesses is shown in Claude for Small Business.

Frequently asked questions

What are the new OpenAI API tiers?

Build, Launch and Grow. They replace the five previous paid tiers: Tiers 1 and 2 become Build, Tiers 3 and 4 become Launch, Tier 5 becomes Grow.

Do I have to do or pay anything for the move?

No. Your organisation moves to its new tier automatically. There is no additional payment and no change to API pricing.

How do I reach a higher tier?

Through your total credit purchases: Build from $5, Launch from $100, Grow from $500. The upgrade happens automatically.

Why does Luna have higher token limits than Sol or Terra?

Luna is the fast, low-cost model for many short tasks. OpenAI allows more tokens per minute for it, 180 million instead of 40 million in Grow.

How do I avoid an unexpectedly high API bill?

On the Limits page, set spend alerts for warnings and a hard spend limit that stops affected requests with error 429. Safest with separate projects for test and production.

Sources and status

Status: 7 October 2026. Limits and thresholds may change. Your organisation's Limits page is authoritative.

Image note: all motifs are AI-generated (Gemini 3 Pro Image) and created for this article. The diagrams and the calculator are my own illustrations based on the sources above; the calculator simplifies and ignores further limits such as daily quotas or batch.

WeiterlesenKeep reading

← zurück zum herrlichblog← back to the herrlichblog