13 августа 2026 OpenAI и Cerebras показали не новую модель. Показали режим подачи той же GPT-5.6 Sol. Название в поиске уже разъехалось: «GPT Ultrafast», «Cerebras GPT», «быстрый инференс GPT». На 22 августа 2026 это один слой: service tier в API, железо Wafer-Scale Engine, потолок до 750 выходных токенов в секунду и заявление «до 14 раз быстрее Standard». Смысл для вайб-кодера простой: модель не стала умнее. Стала быстрее печатать. Для патча, голоса и инцидента в проде это разные деньги. Для ночного рефакторинга часто нет.

Что такое GPT Ultrafast

Ultrafast это режим обслуживания GPT-5.6 Sol в OpenAI API, а не отдельная линейка весов. OpenAI прямо пишет об этом в посте Previewing Ultrafast mode: тот же Sol, другая скорость, запуск сначала в API. Cerebras в своём разборе Accelerating GPT-5.6 Sol Ultrafast добавляет оговорку, которую маркетинг часто глотает: качество не режут. Ускоряют подачу. Не квантуют. Не учат заново.

Это важно, потому что рядом уже живёт другой «быстрый» режим. В конце июля 2026 OpenAI заменила Priority Processing на Fast mode: до 2,5 раза быстрее Standard на той же Sol и на GPU, цена вдвое. Ultrafast сидит выше этой лестницы и на другом кремнии. Путать их в одном абзаце «у нас быстрый GPT» нельзя: разные множители, разное железо, разный доступ.

На 22 августа 2026 Ultrafast это limited preview для узкой группы клиентов. Общей даты GA нет. Публичного model id, который можно просто прописать в ключ, вендоры не выложили. ChatGPT Pro этот слой не открывает: речь про API, не про чат в браузере. Если у вас нет приглашения, вы не «ещё не включили флаг». Вас нет в ёмкости.

Цифры 750 ток/с: что они значат на практике

Потолок вендора: до 750 выходных токенов в секунду. Множитель: до 14 раз относительно Standard. Если принять 14x буквально, Standard сидит около 53 ток/с. Fast mode при заявленных 2,5x даёт порядка 130 ток/с. Ultrafast на пике это уже другой порядок. Цифра «до» здесь не украшение. Нагрузка, длина промпта, reasoning effort и очередь preview могут дать меньше. Независимого прогона Artificial Analysis по самой Ultrafast на 22 августа 2026 нет: доступ закрыт, мерить некому, кроме участников превью и самих вендоров.

Считать стену часов удобнее на типичном артефакте агента, а не на абстрактном «токены в секунду».

Cerebras отдельно гонял свои тесты. На Humanity's Last Exam (2 500 вопросов) Sol Ultrafast закрыл набор за 11 часов 11 минут, Claude Fable 5 за 78 часов 27 минут, почти в 7 раз быстрее при сопоставимой точности. На GDP-Val (брифы, финмодели, инженерные отчёты) заявили 5,6x по стене часов без потери качества. По скоростям Artificial Analysis: примерно в 5 раз быстрее Opus 4.8 в Fast mode и в 11 раз быстрее Fable 5. Это прогоны Cerebras (HLE 10 июля, GDP-Val 31 июля 2026), не слепой сторонний бенчмарк. Класть их в SLA продукта рано.

Ось, которую нельзя склеить с 750 ток/с: пауза до первого токена. Throughput это уже стартовавший поток. TTFT это пустой экран до него. Длинный prefill, очередь или tool-вызов оставляют пользователя в тишине, даже если decode потом летит. Свой serving и метрики TTFT мы разбирали отдельно: time to first token и запуск инференса LLM. Ultrafast эту ось не отменяет. Он бьёт по decode на закрытом API.

Что скорость не лечит

Быстрый инференс GPT не ускоряет поиск по репозиторию, не ужимает системный промпт и не делает tool-call бесплатным. Агент, который пять раз ходит в терминал и один раз пишет файл, упрётся в круги инструментов, а не в 750 ток/с. Длинный контекст по-прежнему надо прогнать до первого нового токена. Если вы тащите в запрос весь монолит «на всякий случай», Cerebras не спасёт: prefill живёт на другой оси. Та же дисциплина, что при работе с квотой агента: резать вход, а не молиться на множитель выхода. Про соседний контур экономии токенов: лимиты Claude Code.

Почему Cerebras GPT, а не ещё один GPU

Запрос «Cerebras GPT» звучит как бренд модели. Это не модель. Это то, на чём OpenAI крутит Ultrafast. Архитектура Wafer-Scale Engine: почти целая кремниевая пластина как один чип, около 44 ГБ SRAM на пластине. Веса остаются on-chip. На GPU инференс фронтир-модели на малом батче упирается в память: каждый новый токен снова тащит веса из HBM. Cerebras этот круг режет железом, а не спекулятивным декодированием в софте.

Слои модели разносят по нескольким пластинам и прогоняют токены конвейером. Поэтому потолок «до 750» на Sol вообще возможен: 44 ГБ одной пластины на фронтир не хватило бы. Это не ваша RTX и не арендованный H100 с vLLM. Это чужой кластер за API. Локальная 27B на 3090 решает другой вопрос: свой контур, свои веса, своя карта. Её мы разбирали в статье про Qwen 3.8 для кода на RTX 3090. Ultrafast не замена домашней карте. Это ставка OpenAI на то, что фронтир может отвечать в темпе человека, не скатываясь в маленькую модель.

Партнёрство не из августа. Ранее в 2026 OpenAI законтрактовала у Cerebras низколатентный compute до 2028, в прессе сделка оценивалась свыше 10 млрд долларов. Ultrafast это первый публичный слой, где флагман OpenAI сидит на этом кремнии, а не узкая спецмодель. Rollout упирается в ёмкость, не в «научились быстрее считать». Пока пластин мало, preview узкий. Фиксированной даты GA в постах нет.

Ultrafast, Fast mode и Standard: три покупки

На 22 августа 2026 у Sol в API три разных истории про скорость. Их нельзя сводить к одной кнопке «побыстрее».

  1. Standard. Базовый слой. Прайс Sol без надбавки за скорость: 5 долларов за миллион входных токенов и 30 за миллион выходных (короткий контекст, как на публичной сетке GPT-5.6). Ориентир выхода около 53 ток/с, если верить множителю 14x от потолка Ultrafast. Это фон для ночных пачек, дешёвых ретраев и всего, где стена часов не стоит в критическом пути.
  2. Fast mode. Тот же Sol на GPU. До 2,5x к Standard, цена вдвое: 10 / 60 долларов за миллион на коротком контексте. В запросе это service_tier: "fast" (старый "priority" тоже жив). Слой уже общедоступен, его можно купить сегодня. Для интерактива, где 15 секунд на патч ещё терпимы, а 40 уже нет, часто хватает именно его.
  3. Ultrafast. Тот же Sol на Cerebras. До 14x к Standard, до 750 ток/с. Цены нет. GA нет. Это не «ещё один Fast». Это другая полка, пока закрытая.

OpenAI формулирует сдвиг так: раньше реальное время почти всегда значило меньшую или узкую модель. Ultrafast якобы ломает развилку «умный или быстрый». Для продукта это правда только если вы уже упёрлись в интеллект Sol и в стену часов одновременно. Если задача закрывается Luna или Terra, гнаться за Ultrafast рано: вы купите ёмкость, которой ещё нет, под работу, которую дешевле отдать младшей модели. Цену успешного шага, а не строку «за миллион», мы разбирали отдельно: сколько стоят токены Claude и GPT.

Кому быстрый инференс GPT нужен, кому нет

OpenAI тестировала превью на компаниях из кода, коммерции, финансовой аналитики и саппорта. Сценарии, где стена часов сама по себе меняет постановку, узкие.

Кому не нужен. Пакетная генерация, где важнее утилизация, а не один пользователь. RAG, где 80% времени это поиск. Агент с десятком tool-вызовов на один ход. Задачи, которые закрывает локальная модель или Luna. И любой контур, где вы не готовы сесть в waitlist без цены: строить прод на слое без прайса и без даты GA это ставка, не архитектура.

Практическая рамка на сегодня. Если продукт живой и задержка бьёт в лицо, сначала измерьте Fast mode: он уже продаётся. Если Fast mode не хватает и вы действительно сидите на Sol, а не на младшей модели, имеет смысл очередь на Ultrafast. Если боль в TTFT, в очереди своего GPU или в раздутом промпте, покупать Cerebras рано. Сначала режьте вход и мерьте паузу до первого токена. Каркас самого цикла «агент пишет продукт» мы держали в гайде по вайб-кодингу с нуля.

Что неизвестно и как не обмануться

На 22 августа 2026 дыр больше, чем цифр на слайде.

  1. Цены нет. Не закладывайте в юнит-экономику ни Standard 5/30, ни Fast 10/60. Ultrafast может быть третьей полкой. Может совпасть. Вендоры молчат.
  2. Даты GA нет. «Расширим, когда вырастет ёмкость» это не квартал в roadmap.
  3. Пик не равен вашему p50. 750 ток/с это потолок. Reasoning, длинный вход, очередь превью и tool-циклы съедят стену часов без всякого GPU.
  4. Нет независимого замера самой Ultrafast. Сравнения с Opus и Fable опираются на скорости Artificial Analysis для чужих моделей плюс внутренние прогоны Cerebras. Это не ваша нагрузка.
  5. Нет публичного id слоя. Пока его нет в доке, любой туториал «просто поставьте service_tier» для Ultrafast это фантазия. Fast mode так работает. Ultrafast пока нет.

TechCrunch в репортаже от 13 августа 2026 повторяет те же 14x и 750 ток/с и подчёркивает узкий preview. Это сверка новости, не второй бенчмарк. Если завтра кто-то выложит «мы померили 400 ток/с в проде», это будет ценнее слайда запуска. До тех пор держите цифры как заявку вендора.

Коротко

GPT-5.6 Sol Ultrafast это быстрый инференс той же флагманской модели на Cerebras, не новая GPT. Заявка на 13 августа 2026: до 750 выходных токенов в секунду, до 14 раз быстрее Standard, без потери качества. Патч на 2 000 токенов на этом потолке печатается примерно за 2,7 с. Fast mode на GPU при этом остаётся другой полкой: до 2,5x и уже с прайсом. Локальная карта и свой vLLM решают третий вопрос.

На 22 августа 2026 слой в limited preview, цены нет, даты GA нет. Имеет смысл ждать его, если интеллект Sol вам уже нужен и стена часов ломает голос, инцидент или живой цикл в редакторе. Не имеет смысла, если боль в промпте, в инструментах или в цене младшей модели. Первичные источники: OpenAI про Ultrafast и пост Cerebras.