OpenAI GPT-Live-1 и GPT-6 Astra: как разработчику ими пользоваться Речь в реальном времени, ИИ-агент и практика API

 ·  ~10 мин чтения  ·  AI-разработка

OpenAI GPT-Live-1 и GPT-6 Astra: как разработчику ими пользоваться Речь в реальном времени, ИИ-агент и практика API

Одной фразой: за одну неделю приземляются два имени, и многие принимают их за «ещё один более сильный ChatGPT» — разработчика обычно стопорит не название модели, а надо ли связывать речевой слой, слой рассуждения и локальное исполнение. Дальше речь, бэкенд агента и API разобраны по отдельности: сначала как подключать, потом счёт и изоляция.

Сначала два дела: модель, которая говорит, и модель, которая действует

В сентябре 2026 года OpenAI кладёт два кирпича подряд: 3-го начинается выдача GPT-6 Astra, 10-го GPT-Live-1 открывается в API. Более ранние тексты про сроки GPT-6 отвечали на «когда придёт»; опасения по безопасности Astra — на «какой радиус взрыва после включения». Этот текст отвечает на третий вопрос: уже здесь — как разработчику подключать.

Официально роли разрезаны чисто. GPT-Live-1 — полнодуплексный речевой фронтенд: слушать, говорить, обрабатывать перебивания и решать, когда отдать работу бэкенду. Astra (или Terra / Luna) — слой рассуждения, поиска и инструментов. Realtime API кладёт речь, рассуждение и выбор инструментов в одну модель; GPT-Live разделяет разговор и задачу — сессия продолжается, пока бэкенд работает.

Слой Модель / интерфейс За что отвечает За что не отвечает
Речевой фронтенд gpt-live-1 · POST /v1/live/sessions Слушать, говорить, перебивать, транскрипт, когда делегировать Бизнес-правила, права, исполнение инструментов
Бэкенд рассуждения gpt-6-astra или Terra / Luna · Responses Планировать, искать, выбирать инструмент, вернуть произносимый результат Произношение в реальном времени, момент перебивания
Ваше приложение Сервер + функции + журналы Ключи, подтверждение, запись, отмена или продолжение фоновой задачи Класть ключ проекта в браузер

Роли одной фразой

Live-1 — короткие подсказки: стиль речи, когда звать бэкенд. Детали, рабочие циклы инструментов и правила согласования остаются у Astra. Перебивание речи не отменяет автоматически фоновую задачу — отменить или довести до конца решает ваше приложение.

GPT-Live-1: как подключить речевой слой

GPT-Live-1 сначала появился в ChatGPT и 10 сентября вошёл в API. Он слушает и говорит одновременно; на Full Duplex Bench официально примерно на 30 пунктов выше GPT-Realtime-2.1. В паре с Astra (средняя сила рассуждения) он лидирует на Tau3, где измеряют сквозных речевых агентов. Ранняя оценка Speak: изучающих язык перебивали почти на 80 % реже, чем в старой системе очередей.

Разработчику на самом деле нужно выбрать способ соединения, а не «ещё один более разговорчивый Chat Completions»:

  • WebRTC: браузерная речь. Микрофон и динамик идут медиатреками, JSON-события — по каналу данных. Браузер отдаёт только SDP; ключ проекта остаётся на сервере.
  • WebSocket: серверная аудиоинтеграция, одно соединение для звука и управляющих событий.
  • Телефон / SIP: подключить существующие звонки. У кого уже LiveKit, Twilio, Telnyx или Daily/Pipecat — через официальных партнёров.

Лимиты считают параллельные сессии, не токены: Free недоступен; Tier 1 — 25 каналов, Tier 5 — 500. Речевой слой — 0,05 USD в минуту, посекундно, без округления до целой минуты. Срез знаний: 31 июля 2025; сейчас нет изображений, Structured Outputs и дообучения.

После создания сессии подтвердите готовность канала через session.started, затем говорите. Для бокового мониторинга или горячей смены инструкций добавьте серверный sideband WebSocket; звук остаётся на основном соединении. Транскрипт, смещение по ключевым словам и детекция очереди встроены — отдельный слой STT не нужен.

GPT-6 Astra: как подключить бэкенд агента

Astra — текстовый флагман рассуждения, ID gpt-6-astra, через Responses / Chat Completions / Bedrock — не через саму Live-сессию. Корпоративные пространства ChatGPT выключены по умолчанию; их включает администратор. Цена API около 10 USD за миллион входных токенов и 50 USD за миллион выходных; подходящие клиенты могут включить Zero Data Retention.

В голосовом продукте Astra должна появляться только в конфигурации делегирования, а не во втором параллельном чат-дополнении, которое отбирает тот же разговор. Официально два вида делегирования:

Делегирование Responses Делегирование Client
Кто готовит контекст GPT-Live отдаёт контекст сессии выбранной модели Responses Ваше приложение само собирает историю, память и бизнес-состояние
Кто крутит цикл инструментов OpenAI по delegation.responses в сессии Вы сами маршрутизируете модель, откат, бюджет и контрольные точки
До того как результат скажут можно сразу вернуть Live-1 и произнести можно проверить, обезличить, слить или отбросить
Подходит сначала прогнать, поверхность инструментов несложная уже есть фреймворк агента, или нужна ревизия до озвучки

Режим выбирается при создании сессии; смена на ходу даёт immutable_field_update — только новая сессия. Делегирование Responses поддерживает function и web_search, плюс поля бэкенда reasoning / text / max_output_tokens. Свои функции по-прежнему исполняет ваш сервер, с правами и подтверждением. Для меньшей задержки delegation.responses.service_tier можно поставить в priority (если у проекта включён Fast).

Граница безопасности Astra не ослабевает сама собой от того, что «её повесили на голос». Публичная сборка по-прежнему отказывается от продвинутых наступательных задач; корпоративные пространства выключены. Цена высокопривилегированного агента на повседневном компьютере — в опасениях по безопасности Astra и в решении отдать права.

Три комбинации: сначала сценарий, потом модель

OpenAI пишет сама: расписание и запросы заказов — на дешёвом бэкенде, сложные претензии поднимать на Astra. Не по умолчанию «голосовой продукт = Astra на всём пути».

Комбинация Речевой слой Бэкенд Сначала сюда Не сюда
A. Только разговор GPT-Live-1 без делегирования или только web_search тренировка, экскурсия, устное FAQ менять заказ, трогать склад, платежи
B. Запросы с объёмом GPT-Live-1 Terra / Luna + инструменты только на чтение статус логистики, перенос записи, остатки длинные цепочки планирования и записи
C. Речевой агент GPT-Live-1 GPT-6 Astra + проверенные инструменты записи сложные претензии, многошаговые операции, диагностика с рассуждением связывать прод-ключи и повседневный стол

Только комбинации C нужны слои инфраструктуры AI-агента, чтобы развести личность, диск и журналы. Круглосуточный coding-агент тоже не должен делить .env с голосовой сессией — см. развёртывание AI Coding Agent 24/7.

Порядок миграции

Уже есть Realtime-конвейер: сначала сверить перебивания и задержку первого звука, потом переносить создание сессии. Уже есть текстовый агент: сначала делегирование Client, повесить существующий harness за Live-1, слой инструментов не переписывать. Новый продукт: делегирование Responses + комбинация B, поднимать Astra только когда сценарий это доказал.

Практика API: WebRTC + делегирование Responses

Минимальная рабочая цепочка: браузер снимает микрофон → ваш HTTPS-сервер создаёт Live-сессию ключом проекта и меняет SDP → медиатрек говорит → канал данных отдаёт транскрипт и события делегирования. Ниже официальная конфигурация сессии в варианте Astra — в документации по умолчанию gpt-5.6-terra; флагманский речевой агент меняет на Astra.

/** @type {import("openai/resources/live/live").SessionConfig} */
export const session = {
  model: "gpt-live-1",
  instructions: "Ты голосовой ассистент поддержки. Приветствие, уточнения и прогресс говори сам. Запрос заказа, перенос и возврат обязательно делегируй бэкенду.",
  delegation: {
    type: "responses",
    responses: {
      model: "gpt-6-astra",
      instructions: "Только авторизованные запросы заказа и переносы. Запись сначала через функции; продолжай после подтверждения приложения.",
      tools: [
        { type: "web_search" },
        {
          type: "function",
          name: "lookup_order",
          description: "Только чтение статуса по номеру заказа",
          parameters: {
            type: "object",
            properties: { order_id: { type: "string" } },
            required: ["order_id"]
          }
        }
      ],
      tool_choice: "auto",
      parallel_tool_calls: true
    }
  }
};

Сервер вызывает POST /v1/live/sessions ключом проекта, меняет SDP-offer браузера на answer и отдаёт его в RTCPeerConnection. Ключ и конфигурация сессии с этого сервера не уходят. Когда функция реально исполняется, читайте call_id / name / arguments из вложенного response.output_item.done, выполняйте авторизованную операцию и дописывайте результат как item Responses. response.output: [] в снимке терминала не значит, что нет ожидающих вызовов функций.

# Псевдокод: обмен SDP на доверенном сервере. Никогда не отдавайте OPENAI_API_KEY в браузер
import os, requests

def create_live_session(sdp_offer: str, session_config: dict) -> str:
    r = requests.post(
        "https://api.openai.com/v1/live/sessions",
        headers={
            "Authorization": f"Bearer {os.environ['OPENAI_API_KEY']}",
            "Content-Type": "application/sdp",
        },
        params={"model": "gpt-live-1"},
        data=sdp_offer,
        timeout=20,
    )
    r.raise_for_status()
    return r.text  # SDP answer → браузер setRemoteDescription

В ходе сессии session.update может горячо менять модель бэкенда, инструкции и инструменты без переподключения. delegation в null переводит в режим Client и нельзя вернуть уже идущую Responses-сессию назад. Боковой надзор может вернуть разговор через session.instructions.append (delegation_id: null) — это затрагивает только Live-модель, не меняет промпт Astra и не отменяет уже идущее делегирование.

Две лёгкие ошибки

Бэкенд-событие response.completed не значит, что пользователь уже услышал ответ — ориентир: транскрипт и звук Live. Перебивание ассистента пользователем не значит, что фоновый запрос заказа уже остановился. Состояние задач должна вести ваше приложение.

Счёт, лимиты и изоляция

Речь и рассуждение — два разных счёта. Сравнение цен токенов — в сравнении цен токенов; здесь только то, что легко пропустить, когда Live и Astra связаны.

Статья Как считают Что разработчик часто пропускает
Речь GPT-Live-1 0,05 USD / минута, посекундно Молчание пользователя, речь ассистента, паузы после перебивания входят в длительность сессии
Astra / Terra / Luna входные / выходные токены Responses Каждое делегирование — отдельный вывод; параллельные инструменты складываются
web_search и функции тариф инструмента + ваша инфраструктура Повтор неудачной функции снова бьёт в Astra
Параллельные сессии квота уровня, не квота токенов Открытая демо-страница сначала забьёт 25 каналов, а не сожжёт баланс

Список изоляции тот же, что в тексте про безопасность, плюс «сессия остаётся открытой»:

  1. Ключи только на сервере. Браузер отдаёт SDP и играет звук.
  2. Инструменты записи по умолчанию требуют человеческого подтверждения. Запрос заказа может быть автоматическим; возврат, склад, пуш кода — через вашу дверь.
  3. Личность агента и повседневный стол развести. Высокопривилегированные функции, Git-токен, прод-.env — на отдельный узел Cloud Mac; основная машина только ревью и мерж.
  4. Журналы должны отвечать на три фразы. Какая Live-сессия, какое делегирование, что изменилось. Иначе аудита нет.
  5. Корпоративное пространство оставить выключенным. Администратор включает при необходимости; личная подписка тоже не должна в один шаг вешать Astra на прод-репозиторий.

Правильное чтение: GPT-Live-1 снижает стоимость говорения, не радиус взрыва. Частая ошибка: «речевой слой дорогой, значит Astra на всём пути, одно делегирование всё решит» — устойчивее комбинация B на объём, комбинация C на сложное, и никаких записей с ноутбука.

Частые вопросы

GPT-Live-1 и GPT-6 Astra — это одна модель?
Нет. Live-1 — полнодуплексный речевой фронтенд; Astra — текстовый бэкенд рассуждения и инструментов. Официально их нужно спаривать, а не поручать одной модели оба дела.

Нужно ли сразу переезжать с Realtime API на GPT-Live-1?
Сначала браузер и новые голосовые продукты. Уже стабильный Realtime-конвейер можно сначала сверить по задержке и перебиваниям, потом переносить. Смена режима делегирования требует новой сессии — горячего переключения нет.

Попадает ли счёт токенов Astra в ту же строку, что и голосовая сессия?
Нет, не в одной строке. Речевой слой тарифицируется посекундно, около 0,05 USD в минуту; Astra и инструменты идут по своим ценам Responses.

Можно ли класть ключ API прямо в фронтенд-страницу?
Нельзя. Ключ проекта остаётся на доверенном сервере. Браузер отдаёт только SDP; сервер вызывает POST /v1/live/sessions и меняет ответ.

ZavCloud Developer Infrastructure

Исполнительный слой речевого агента — на отдельный узел Mac

Браузер только говорит; ключи и инструменты записи остаются на сервере

Арендуйте выделенный Mac mini по дням — свой домашний каталог и диск для Astra

Настроить ваш выделенный узел Mac
Новинка Посмотреть планы M4