Одной фразой: за одну неделю приземляются два имени, и многие принимают их за «ещё один более сильный ChatGPT» — разработчика обычно стопорит не название модели, а надо ли связывать речевой слой, слой рассуждения и локальное исполнение. Дальше речь, бэкенд агента и API разобраны по отдельности: сначала как подключать, потом счёт и изоляция.
Сначала два дела: модель, которая говорит, и модель, которая действует
В сентябре 2026 года OpenAI кладёт два кирпича подряд: 3-го начинается выдача GPT-6 Astra, 10-го GPT-Live-1 открывается в API. Более ранние тексты про сроки GPT-6 отвечали на «когда придёт»; опасения по безопасности Astra — на «какой радиус взрыва после включения». Этот текст отвечает на третий вопрос: уже здесь — как разработчику подключать.
Официально роли разрезаны чисто. GPT-Live-1 — полнодуплексный речевой фронтенд: слушать, говорить, обрабатывать перебивания и решать, когда отдать работу бэкенду. Astra (или Terra / Luna) — слой рассуждения, поиска и инструментов. Realtime API кладёт речь, рассуждение и выбор инструментов в одну модель; GPT-Live разделяет разговор и задачу — сессия продолжается, пока бэкенд работает.
| Слой | Модель / интерфейс | За что отвечает | За что не отвечает |
|---|---|---|---|
| Речевой фронтенд | gpt-live-1 · POST /v1/live/sessions |
Слушать, говорить, перебивать, транскрипт, когда делегировать | Бизнес-правила, права, исполнение инструментов |
| Бэкенд рассуждения | gpt-6-astra или Terra / Luna · Responses |
Планировать, искать, выбирать инструмент, вернуть произносимый результат | Произношение в реальном времени, момент перебивания |
| Ваше приложение | Сервер + функции + журналы | Ключи, подтверждение, запись, отмена или продолжение фоновой задачи | Класть ключ проекта в браузер |
Роли одной фразой
Live-1 — короткие подсказки: стиль речи, когда звать бэкенд. Детали, рабочие циклы инструментов и правила согласования остаются у Astra. Перебивание речи не отменяет автоматически фоновую задачу — отменить или довести до конца решает ваше приложение.
GPT-Live-1: как подключить речевой слой
GPT-Live-1 сначала появился в ChatGPT и 10 сентября вошёл в API. Он слушает и говорит одновременно; на Full Duplex Bench официально примерно на 30 пунктов выше GPT-Realtime-2.1. В паре с Astra (средняя сила рассуждения) он лидирует на Tau3, где измеряют сквозных речевых агентов. Ранняя оценка Speak: изучающих язык перебивали почти на 80 % реже, чем в старой системе очередей.
Разработчику на самом деле нужно выбрать способ соединения, а не «ещё один более разговорчивый Chat Completions»:
- WebRTC: браузерная речь. Микрофон и динамик идут медиатреками, JSON-события — по каналу данных. Браузер отдаёт только SDP; ключ проекта остаётся на сервере.
- WebSocket: серверная аудиоинтеграция, одно соединение для звука и управляющих событий.
- Телефон / SIP: подключить существующие звонки. У кого уже LiveKit, Twilio, Telnyx или Daily/Pipecat — через официальных партнёров.
Лимиты считают параллельные сессии, не токены: Free недоступен; Tier 1 — 25 каналов, Tier 5 — 500. Речевой слой — 0,05 USD в минуту, посекундно, без округления до целой минуты. Срез знаний: 31 июля 2025; сейчас нет изображений, Structured Outputs и дообучения.
После создания сессии подтвердите готовность канала через session.started, затем говорите. Для бокового мониторинга или горячей смены инструкций добавьте серверный sideband WebSocket; звук остаётся на основном соединении. Транскрипт, смещение по ключевым словам и детекция очереди встроены — отдельный слой STT не нужен.
GPT-6 Astra: как подключить бэкенд агента
Astra — текстовый флагман рассуждения, ID gpt-6-astra, через Responses / Chat Completions / Bedrock — не через саму Live-сессию. Корпоративные пространства ChatGPT выключены по умолчанию; их включает администратор. Цена API около 10 USD за миллион входных токенов и 50 USD за миллион выходных; подходящие клиенты могут включить Zero Data Retention.
В голосовом продукте Astra должна появляться только в конфигурации делегирования, а не во втором параллельном чат-дополнении, которое отбирает тот же разговор. Официально два вида делегирования:
| Делегирование Responses | Делегирование Client | |
|---|---|---|
| Кто готовит контекст | GPT-Live отдаёт контекст сессии выбранной модели Responses | Ваше приложение само собирает историю, память и бизнес-состояние |
| Кто крутит цикл инструментов | OpenAI по delegation.responses в сессии |
Вы сами маршрутизируете модель, откат, бюджет и контрольные точки |
| До того как результат скажут | можно сразу вернуть Live-1 и произнести | можно проверить, обезличить, слить или отбросить |
| Подходит | сначала прогнать, поверхность инструментов несложная | уже есть фреймворк агента, или нужна ревизия до озвучки |
Режим выбирается при создании сессии; смена на ходу даёт immutable_field_update — только новая сессия. Делегирование Responses поддерживает function и web_search, плюс поля бэкенда reasoning / text / max_output_tokens. Свои функции по-прежнему исполняет ваш сервер, с правами и подтверждением. Для меньшей задержки delegation.responses.service_tier можно поставить в priority (если у проекта включён Fast).
Граница безопасности Astra не ослабевает сама собой от того, что «её повесили на голос». Публичная сборка по-прежнему отказывается от продвинутых наступательных задач; корпоративные пространства выключены. Цена высокопривилегированного агента на повседневном компьютере — в опасениях по безопасности Astra и в решении отдать права.
Три комбинации: сначала сценарий, потом модель
OpenAI пишет сама: расписание и запросы заказов — на дешёвом бэкенде, сложные претензии поднимать на Astra. Не по умолчанию «голосовой продукт = Astra на всём пути».
| Комбинация | Речевой слой | Бэкенд | Сначала сюда | Не сюда |
|---|---|---|---|---|
| A. Только разговор | GPT-Live-1 | без делегирования или только web_search |
тренировка, экскурсия, устное FAQ | менять заказ, трогать склад, платежи |
| B. Запросы с объёмом | GPT-Live-1 | Terra / Luna + инструменты только на чтение | статус логистики, перенос записи, остатки | длинные цепочки планирования и записи |
| C. Речевой агент | GPT-Live-1 | GPT-6 Astra + проверенные инструменты записи | сложные претензии, многошаговые операции, диагностика с рассуждением | связывать прод-ключи и повседневный стол |
Только комбинации C нужны слои инфраструктуры AI-агента, чтобы развести личность, диск и журналы. Круглосуточный coding-агент тоже не должен делить .env с голосовой сессией — см. развёртывание AI Coding Agent 24/7.
Порядок миграции
Уже есть Realtime-конвейер: сначала сверить перебивания и задержку первого звука, потом переносить создание сессии. Уже есть текстовый агент: сначала делегирование Client, повесить существующий harness за Live-1, слой инструментов не переписывать. Новый продукт: делегирование Responses + комбинация B, поднимать Astra только когда сценарий это доказал.
Практика API: WebRTC + делегирование Responses
Минимальная рабочая цепочка: браузер снимает микрофон → ваш HTTPS-сервер создаёт Live-сессию ключом проекта и меняет SDP → медиатрек говорит → канал данных отдаёт транскрипт и события делегирования. Ниже официальная конфигурация сессии в варианте Astra — в документации по умолчанию gpt-5.6-terra; флагманский речевой агент меняет на Astra.
/** @type {import("openai/resources/live/live").SessionConfig} */
export const session = {
model: "gpt-live-1",
instructions: "Ты голосовой ассистент поддержки. Приветствие, уточнения и прогресс говори сам. Запрос заказа, перенос и возврат обязательно делегируй бэкенду.",
delegation: {
type: "responses",
responses: {
model: "gpt-6-astra",
instructions: "Только авторизованные запросы заказа и переносы. Запись сначала через функции; продолжай после подтверждения приложения.",
tools: [
{ type: "web_search" },
{
type: "function",
name: "lookup_order",
description: "Только чтение статуса по номеру заказа",
parameters: {
type: "object",
properties: { order_id: { type: "string" } },
required: ["order_id"]
}
}
],
tool_choice: "auto",
parallel_tool_calls: true
}
}
};
Сервер вызывает POST /v1/live/sessions ключом проекта, меняет SDP-offer браузера на answer и отдаёт его в RTCPeerConnection. Ключ и конфигурация сессии с этого сервера не уходят. Когда функция реально исполняется, читайте call_id / name / arguments из вложенного response.output_item.done, выполняйте авторизованную операцию и дописывайте результат как item Responses. response.output: [] в снимке терминала не значит, что нет ожидающих вызовов функций.
# Псевдокод: обмен SDP на доверенном сервере. Никогда не отдавайте OPENAI_API_KEY в браузер
import os, requests
def create_live_session(sdp_offer: str, session_config: dict) -> str:
r = requests.post(
"https://api.openai.com/v1/live/sessions",
headers={
"Authorization": f"Bearer {os.environ['OPENAI_API_KEY']}",
"Content-Type": "application/sdp",
},
params={"model": "gpt-live-1"},
data=sdp_offer,
timeout=20,
)
r.raise_for_status()
return r.text # SDP answer → браузер setRemoteDescription
В ходе сессии session.update может горячо менять модель бэкенда, инструкции и инструменты без переподключения. delegation в null переводит в режим Client и нельзя вернуть уже идущую Responses-сессию назад. Боковой надзор может вернуть разговор через session.instructions.append (delegation_id: null) — это затрагивает только Live-модель, не меняет промпт Astra и не отменяет уже идущее делегирование.
Две лёгкие ошибки
Бэкенд-событие response.completed не значит, что пользователь уже услышал ответ — ориентир: транскрипт и звук Live. Перебивание ассистента пользователем не значит, что фоновый запрос заказа уже остановился. Состояние задач должна вести ваше приложение.
Счёт, лимиты и изоляция
Речь и рассуждение — два разных счёта. Сравнение цен токенов — в сравнении цен токенов; здесь только то, что легко пропустить, когда Live и Astra связаны.
| Статья | Как считают | Что разработчик часто пропускает |
|---|---|---|
| Речь GPT-Live-1 | 0,05 USD / минута, посекундно | Молчание пользователя, речь ассистента, паузы после перебивания входят в длительность сессии |
| Astra / Terra / Luna | входные / выходные токены Responses | Каждое делегирование — отдельный вывод; параллельные инструменты складываются |
| web_search и функции | тариф инструмента + ваша инфраструктура | Повтор неудачной функции снова бьёт в Astra |
| Параллельные сессии | квота уровня, не квота токенов | Открытая демо-страница сначала забьёт 25 каналов, а не сожжёт баланс |
Список изоляции тот же, что в тексте про безопасность, плюс «сессия остаётся открытой»:
- Ключи только на сервере. Браузер отдаёт SDP и играет звук.
- Инструменты записи по умолчанию требуют человеческого подтверждения. Запрос заказа может быть автоматическим; возврат, склад, пуш кода — через вашу дверь.
- Личность агента и повседневный стол развести. Высокопривилегированные функции, Git-токен, прод-
.env— на отдельный узел Cloud Mac; основная машина только ревью и мерж. - Журналы должны отвечать на три фразы. Какая Live-сессия, какое делегирование, что изменилось. Иначе аудита нет.
- Корпоративное пространство оставить выключенным. Администратор включает при необходимости; личная подписка тоже не должна в один шаг вешать Astra на прод-репозиторий.
Правильное чтение: GPT-Live-1 снижает стоимость говорения, не радиус взрыва. Частая ошибка: «речевой слой дорогой, значит Astra на всём пути, одно делегирование всё решит» — устойчивее комбинация B на объём, комбинация C на сложное, и никаких записей с ноутбука.
Частые вопросы
GPT-Live-1 и GPT-6 Astra — это одна модель?
Нет. Live-1 — полнодуплексный речевой фронтенд; Astra — текстовый бэкенд рассуждения и инструментов. Официально их нужно спаривать, а не поручать одной модели оба дела.
Нужно ли сразу переезжать с Realtime API на GPT-Live-1?
Сначала браузер и новые голосовые продукты. Уже стабильный Realtime-конвейер можно сначала сверить по задержке и перебиваниям, потом переносить. Смена режима делегирования требует новой сессии — горячего переключения нет.
Попадает ли счёт токенов Astra в ту же строку, что и голосовая сессия?
Нет, не в одной строке. Речевой слой тарифицируется посекундно, около 0,05 USD в минуту; Astra и инструменты идут по своим ценам Responses.
Можно ли класть ключ API прямо в фронтенд-страницу?
Нельзя. Ключ проекта остаётся на доверенном сервере. Браузер отдаёт только SDP; сервер вызывает POST /v1/live/sessions и меняет ответ.
ZavCloud Developer Infrastructure
Исполнительный слой речевого агента — на отдельный узел Mac
Браузер только говорит; ключи и инструменты записи остаются на сервере
Арендуйте выделенный Mac mini по дням — свой домашний каталог и диск для Astra