OpenAI GPT-Live-1 und GPT-6 Astra: Was Entwickler nach dem Launch tun sollten Echtzeit-Sprache, KI-Agent und API-Praxis

 ·  ca. 10 Min. Lesezeit  ·  KI-Entwicklung

OpenAI GPT-Live-1 und GPT-6 Astra: Was Entwickler nach dem Launch tun sollten Echtzeit-Sprache, KI-Agent und API-Praxis

In einem Satz: In derselben Woche landen zwei Namen, und viele behandeln sie als «noch ein stärkeres ChatGPT» — was Entwickler wirklich blockiert, ist selten der Modellname, sondern ob Sprachschicht, Reasoning-Schicht und lokale Ausführung zusammengebunden werden sollen. Der Rest trennt Echtzeit-Sprache, Agent-Backend und API: zuerst der Anschluss, dann Rechnung und Isolation.

Zuerst zwei Dinge trennen: das sprechende Modell und das handelnde Modell

Im September 2026 legt OpenAI zwei Bausteine hintereinander hin: Am 3. beginnt die Auslieferung von GPT-6 Astra, am 10. öffnet GPT-Live-1 die API. Frühere Texte zur GPT-6-Zeitplanung haben «wann kommt es» beantwortet; Astra-Sicherheitsbedenken beantwortet «wie groß der Explosionsradius nach dem Einschalten ist». Dieser Text beantwortet die dritte Frage: Es ist da — wie schließen Entwickler es an.

Offiziell sind die Rollen sauber geschnitten. GPT-Live-1 ist das Vollduplex-Sprachfrontend: hören, sprechen, Unterbrechungen verarbeiten und entscheiden, wann die Arbeit ans Backend geht. Astra (oder Terra / Luna) ist die Schicht für Reasoning, Recherche und Tools. Die Realtime API packt Sprache, Reasoning und Toolwahl in ein Modell; GPT-Live trennt Gespräch und Aufgabe — die Sitzung läuft weiter, während das Backend arbeitet.

Schicht Modell / Schnittstelle Zuständig für Nicht zuständig für
Sprachfrontend gpt-live-1 · POST /v1/live/sessions Hören, Sprechen, Unterbrechen, Transkript, wann delegieren Geschäftsregeln, Rechte, Tool-Ausführung
Reasoning-Backend gpt-6-astra oder Terra / Luna · Responses Planen, Abrufen, Toolwahl, sprechbares Ergebnis Echtzeit-Aussprache, Unterbrechungs-Timing
Ihre Anwendung Server + Funktionen + Logs Schlüssel, Bestätigung, Persistenz, Abbruch oder Weiterlaufen im Hintergrund Den Projektschlüssel in den Browser stecken

Rollen in einem Satz

Live-1 bekommt kurze Hinweise: Sprechstil, wann das Backend helfen soll. Details, Tool-Workflows und Freigaberegeln bleiben bei Astra. Eine Sprachunterbrechung bricht Hintergrundaufgaben nicht automatisch ab — Abbruch oder Fertigstellen entscheidet Ihre Anwendung.

GPT-Live-1: so schließen Sie die Echtzeit-Sprachschicht an

GPT-Live-1 tauchte zuerst in ChatGPT auf und kam am 10. September in die API. Es hört und spricht gleichzeitig; auf dem Full Duplex Bench liegt es offiziell etwa 30 Punkte über GPT-Realtime-2.1. Gekoppelt mit Astra (mittlere Reasoning-Stärke) führt es Tau3, das End-to-End-Sprachagenten misst. Eine frühe Bewertung von Speak sagt: Sprachlerner wurden fast 80 % seltener unterbrochen als im alten Turn-System.

Was Entwickler wirklich wählen, ist die Verbindungsart, nicht «noch ein redseligeres Chat Completions»:

  • WebRTC: Browser-Sprache. Mikrofon und Lautsprecher über Medientracks, JSON-Events über den Datenkanal. Der Browser liefert nur SDP; der Projektschlüssel bleibt auf dem Server.
  • WebSocket: Audio-Integration auf dem Server, eine Verbindung für Audio und Steuer-Events.
  • Telefon / SIP: bestehende Anrufe einhängen. Wer schon LiveKit, Twilio, Telnyx oder Daily/Pipecat hat, geht über die offiziellen Partner.

Limits zählen parallele Sitzungen, nicht Tokens: Free nicht verfügbar; Tier 1 = 25 Kanäle, Tier 5 = 500. Die Sprachschicht kostet 0,05 USD pro Minute, sekundengenau, ohne Aufrundung auf volle Minuten. Wissensstand: 31. Juli 2025; derzeit keine Bilder, kein Structured Outputs, kein Fine-Tuning.

Nach dem Anlegen der Sitzung mit session.started bestätigen, dass der Kanal bereit ist, dann sprechen. Für Nebenüberwachung oder heiße Instruktionsänderungen eine serverseitige Sideband-WebSocket; Audio bleibt auf der Hauptverbindung. Transkript, Keyword-Bias und Turn-Erkennung sind eingebaut — keine extra STT-Schicht.

GPT-6 Astra: so schließen Sie das Agent-Backend an

Astra ist das Text-Reasoning-Flaggschiff, Modell-ID gpt-6-astra, über Responses / Chat Completions / Bedrock — nicht über die Live-Sitzung selbst. Unternehmens-ChatGPT-Workspaces sind standardmäßig aus; ein Admin muss sie einschalten. API-Preis etwa 10 USD pro Million Eingabe-Tokens, 50 USD pro Million Ausgabe-Tokens; berechtigte Kunden können Zero Data Retention aktivieren.

In einem Sprachprodukt gehört Astra nur in die Delegationskonfiguration, nicht in eine parallele Chat-Completion, die dasselbe Gespräch streitig macht. Offiziell gibt es zwei Delegationsarten:

Responses-Delegation Client-Delegation
Wer den Kontext vorbereitet GPT-Live übergibt den Sitzungskontext an das gewählte Responses-Modell Ihre Anwendung setzt Historie, Speicher und Fachzustand selbst zusammen
Wer die Tool-Schleife fährt OpenAI nach delegation.responses in der Sitzung Sie routen Modell, Fallback, Budget und Checkpoints selbst
Bevor das Ergebnis gesprochen wird kann direkt an Live-1 zurück und ausgesprochen werden Sie können prüfen, anonymisieren, mergen oder verwerfen
Geeignet für erst durchspielen, Toolfläche nicht komplex bestehendes Agent-Framework, oder Freigabe vor dem Aussprechen

Der Modus wird beim Anlegen der Sitzung festgelegt; ein Wechsel mittendrin wirft immutable_field_update — nur eine neue Sitzung hilft. Responses-Delegation unterstützt function und web_search sowie die Backend-Felder reasoning / text / max_output_tokens. Eigene Funktionen führt weiter Ihr Server aus, mit Rechten und Bestätigung. Für niedrigere Latenz kann delegation.responses.service_tier auf priority gesetzt werden (wenn das Projekt Fast hat).

Astras Sicherheitsgrenze lockert sich nicht automatisch, nur weil «es in der Sprache hängt». Die öffentliche Variante lehnt fortgeschrittene Offensivaufgaben weiter ab; Unternehmens-Workspaces bleiben aus. Was ein hochprivilegierter Agent auf dem Alltagsrechner kostet, steht in Astra-Sicherheitsbedenken und der Entscheidung, Rechte abzugeben.

Drei Einsatzkombinationen: zuerst das Szenario, dann das Modell

OpenAI schreibt selbst: Schichtplanung und Bestellabfragen mit günstigem Backend, komplexe Beschwerden erst auf Astra heben. Nicht standardmäßig «Sprachprodukt = durchgehend Astra».

Kombination Sprachschicht Backend Zuerst hier Nicht hier
A. Reines Gespräch GPT-Live-1 keine Delegation, oder nur web_search Übung, Führung, gesprochene FAQ Bestellungen ändern, Lager bewegen, Zahlung anfassen
B. Hochvolumen-Abfrage GPT-Live-1 Terra / Luna + nur-lesen-Tools Logistikstatus, Terminverschiebung, Bestandsabfrage lange Planungsketten und Schreiboperationen
C. Sprach-Agent GPT-Live-1 GPT-6 Astra + geprüfte Schreib-Tools komplexe Beschwerden, mehrstufige Vorgänge, Reasoning-Störungen Produktions-Schlüssel und Alltagsschreibtisch zusammenbinden

Nur Kombination C braucht die Infrastruktur-Schichten eines KI-Agenten, um Identität, Platte und Logs zu trennen. Ein 24-Stunden-Coding-Agent teilt sich ebenfalls keine .env mit der Sprachsitzung — siehe 24/7-AI-Coding-Agent bereitstellen.

Migrationsreihenfolge

Bestehende Realtime-Pipeline: erst Unterbrechung und First-Audio-Latenz vergleichen, dann die Sitzungserstellung umziehen. Bestehender Text-Agent: zuerst Client-Delegation, das vorhandene Harness hinter Live-1 hängen, die Tool-Schicht nicht neu schreiben. Neues Produkt: Responses-Delegation + Kombination B, Astra erst wenn das Szenario es braucht.

API-Praxis: WebRTC + Responses-Delegation

Die kleinste nutzbare Kette: Browser nimmt das Mikrofon auf → Ihr HTTPS-Server legt mit dem Projektschlüssel eine Live-Sitzung an und tauscht SDP → Medientrack spricht → Datenkanal liefert Transkript und Delegations-Events. Das folgende Snippet ist die offizielle Session-Konfiguration in der Astra-Variante — die Docs defaulten auf gpt-5.6-terra; ein Flaggschiff-Sprachagent tauscht auf Astra.

/** @type {import("openai/resources/live/live").SessionConfig} */
export const session = {
  model: "gpt-live-1",
  instructions: "Du bist ein Voice-Support-Assistent. Begrüßung, Rückfragen und Fortschritt sagst du selbst. Bestellabfragen, Umbuchungen und Erstattungen musst du an das Backend delegieren.",
  delegation: {
    type: "responses",
    responses: {
      model: "gpt-6-astra",
      instructions: "Nur autorisierte Bestellabfragen und Umbuchungen. Schreibvorgänge zuerst über Funktionen; weiter erst nach Bestätigung der App.",
      tools: [
        { type: "web_search" },
        {
          type: "function",
          name: "lookup_order",
          description: "Nur-Lese-Status anhand der Bestellnummer abfragen",
          parameters: {
            type: "object",
            properties: { order_id: { type: "string" } },
            required: ["order_id"]
          }
        }
      ],
      tool_choice: "auto",
      parallel_tool_calls: true
    }
  }
};

Der Server ruft mit dem Projektschlüssel POST /v1/live/sessions auf, tauscht das SDP-Offer des Browsers gegen ein Answer und gibt es an RTCPeerConnection zurück. Schlüssel und Session-Konfiguration verlassen diesen Server nicht. Wenn eine Funktion wirklich läuft, lesen Sie call_id / name / arguments aus dem verschachtelten response.output_item.done, führen die autorisierte Operation aus und hängen das Ergebnis als Responses-Item nach. response.output: [] im Terminal-Snapshot heißt nicht, dass keine ausstehenden Funktionsaufrufe existieren.

# Pseudocode: SDP auf einem vertrauenswürdigen Server tauschen. OPENAI_API_KEY nie an den Browser geben
import os, requests

def create_live_session(sdp_offer: str, session_config: dict) -> str:
    r = requests.post(
        "https://api.openai.com/v1/live/sessions",
        headers={
            "Authorization": f"Bearer {os.environ['OPENAI_API_KEY']}",
            "Content-Type": "application/sdp",
        },
        params={"model": "gpt-live-1"},
        data=sdp_offer,
        timeout=20,
    )
    r.raise_for_status()
    return r.text  # SDP-Antwort → Browser setRemoteDescription

Während der Sitzung kann session.update Backend-Modell, Hinweise und Tools heiß ändern, ohne neu zu verbinden. delegation auf null setzt Client-Modus und kann eine laufende Responses-Sitzung nicht zurückdrehen. Nebenüberwachung kann mit session.instructions.append (delegation_id: null) das Gespräch zurückholen — das betrifft nur das Live-Modell, ändert den Astra-Prompt nicht und bricht laufende Delegationen nicht ab.

Zwei leichte Fehlurteile

Backend response.completed heißt nicht, dass der Nutzer die Antwort schon gehört hat — maßgeblich sind Live-Transkript und Audio. Eine Unterbrechung durch den Nutzer heißt auch nicht, dass die Bestellabfrage im Hintergrund schon steht. Den Aufgabenstatus muss Ihre Anwendung buchen.

Rechnung, Limits und Isolation

Sprache und Reasoning sind zwei Rechnungen. Token-Preise im Vergleich stehen im Token-Preisvergleich; hier nur das, was bei Live + Astra leicht untergeht.

Posten Abrechnung Was Entwickler oft übersehen
GPT-Live-1 Sprache 0,05 USD / Minute, sekundengenau Nutzerschweigen, Assistentenrede, Lücken nach Unterbrechung zählen als Sitzungszeit
Astra / Terra / Luna Responses-Eingabe- / Ausgabe-Tokens Jede Delegation ist eine eigene Inferenz; parallele Tools addieren sich
web_search und Funktionen Tool-Preis + Ihre Infrastruktur Fehlgeschlagene Funktions-Retries treffen Astra erneut
Parallele Sitzungen Tier-Kontingent, kein Token-Kontingent Eine offene Demo-Seite füllt zuerst die 25 Kanäle, bevor das Guthaben leer ist

Die Isolationsliste ist dieselbe wie im Sicherheitstext, plus «die Sitzung bleibt offen»:

  1. Schlüssel nur auf dem Server. Der Browser schickt SDP und spielt Audio.
  2. Schreib-Tools brauchen standardmäßig eine menschliche Bestätigung. Abfragen können automatisch laufen; Rückerstattung, Lageränderung, Code-Push müssen durch Ihre Freigabe.
  3. Agent-Identität und Alltagsschreibtisch trennen. Hochprivilegierte Funktionen, Git-Token, Produktions-.env auf einen eigenen Cloud-Mac-Knoten; die Hauptmaschine prüft und merget.
  4. Logs müssen drei Sätze beantworten. Welche Live-Sitzung, welche Delegation, was geändert wurde. Sonst gibt es kein Audit.
  5. Unternehmens-Workspace aus lassen. Ein Admin schaltet ihn ein; auch ein privates Abo sollte Astra nicht in einem Schritt an ein Produktions-Repo hängen.

Richtige Lesart: GPT-Live-1 senkt die Sprechkosten, nicht den Explosionsradius. Der häufige Fehlschluss: «die Sprachschicht ist teuer, also durchgehend Astra, eine Delegation löst alles» — stabiler ist Kombination B für Volumen, Kombination C für Schwieriges, und keine Schreiboperationen auf dem Notebook.

Häufige Fragen

Sind GPT-Live-1 und GPT-6 Astra dasselbe Modell?
Nein. Live-1 ist das Vollduplex-Sprachfrontend; Astra ist das Text-Reasoning- und Tool-Backend. Offiziell sollen beide gekoppelt werden, nicht ein Modell beides zugleich erledigen.

Soll man sofort von der Realtime API auf GPT-Live-1 wechseln?
Browser und neue Sprachprodukte zuerst. Eine stabile Realtime-Pipeline kann man erst an Latenz und Unterbrechungen messen, dann umziehen. Ein Wechsel des Delegationsmodus braucht eine neue Sitzung — kein Hot-Swap.

Rechnet eine Sprachsitzung Astras Token-Rechnung mit ein?
Nicht in einer Zeile. Die Sprachschicht wird sekundengenau abgerechnet, etwa 0,05 USD pro Minute; Astra und Tools laufen über die jeweiligen Responses-Preise.

Darf der API-Schlüssel direkt in die Frontend-Seite?
Nein. Der Projektschlüssel bleibt auf einem vertrauenswürdigen Server. Der Browser schickt nur SDP; der Server ruft POST /v1/live/sessions auf und tauscht die Antwort.

ZavCloud Developer Infrastructure

Die Ausführungsebene des Sprach-Agenten auf einen eigenen Mac-Knoten

Der Browser spricht nur; Schlüssel und Schreib-Tools bleiben auf dem Server

Dediziertes Mac mini tagesweise mieten — eigenes Home und eigene Platte für Astra

Deinen Mac-Knoten konfigurieren
Neu M4-Pläne ansehen