Запрос «сколько стоят токены Claude» почти всегда ведёт к таблице: доллары за миллион входа и выхода. Рядом стоит «что дешевле Claude или GPT». Обе цифры выглядят как цена бензина. Тибо Соттьо из OpenAI (Codex) недавно напомнил базовую вещь: токен одной модели не равен токену другой. Ниже: прайс на 19 августа 2026, почему $/1M врёт и что мерить вместо цены куска текста.
Почему токен не единица измерения
Провайдеры продают работу модели в токенах: куски текста, на которые токенизатор режет вход и выход. Правила нарезки разные. Один файл, один дифф, один русский промпт с кодом дадут разный счётчик у Claude, GPT и любой третьей линейки.
Сравнить «пять долларов за миллион» у двух моделей это как сравнить цену куска пиццы, не глядя, на сколько кусков её нарезали. Дешёвый кусок не значит дешёвый ужин. Вы платите за объём, который насчитал чужой токенизатор, плюс за выход, кэш, ретраи и цикл инструментов.
Тибо привёл небольшой внутренний тест на смеси английского, технического, многоязычного и числового текста: токенизатор GPT-5.6 Sol насчитал заметно меньше токенов, чем оценка для Claude Opus 5. Это его выборка, не коэффициент на все задачи. Точную пару чисел не закрепляем. Независимый факт из документации Anthropic: модели Claude 4.7 и новее на тот же текст дают примерно на 30% больше токенов, чем линейка до Sonnet 4.6. Прайс за миллион сравнивает разные линейки.
Что вообще означает стоимость токена ИИ
В API почти всегда две ставки:
- Вход (input). Промпт, система, файлы, история, схемы инструментов, куски репозитория, которые вы положили в контекст.
- Выход (output). Ответ модели. У агентов сюда же часто садятся размышления, вызовы инструментов, патчи. Выход обычно в несколько раз дороже входа.
Грубый ориентир для английского: около четырёх символов на токен. Русский чаще режется мельче, тот же абзац дороже. Код, JSON и дифф ведут себя иначе, чем проза. «Миллион токенов это книга» для вайб-кодинга бесполезен: у вас цикл из контекста, патча, лога и ещё одного патча.
Отдельно живут кэш, длинный контекст, batch, fast-режим и подписка в IDE. Это уже не «стоимость токена», а модификаторы счёта. Их игнорируют, когда спорят Claude против GPT по одной ячейке таблицы.
Сколько стоят токены Claude на 19 августа 2026
Цифры ниже с официальной страницы Anthropic, API, доллары за миллион токенов. Тарифы меняют. Перед бюджетом сверяйте pricing Claude.
- Claude Haiku 4.5: вход 1, выход 5, чтение кэша 0,10.
- Claude Sonnet 5: вход 2, выход 10, чтение кэша 0,20. Вводная цена 2/10 стала постоянной, объявленный рост до 3/15 с 1 сентября отменили.
- Claude Opus 5: вход 5, выход 25, чтение кэша 0,50.
- Claude Fable 5: вход 10, выход 50, чтение кэша 1.
Выход у Claude в пять раз дороже входа по всей линейке. Batch режет обе ставки примерно пополам. Fast mode у Opus 5 и Opus 4.8: вход 10, выход 50. Для Claude 4.6 и новее окно в 1M токенов идёт по стандартной ставке, без отдельного «длинного» прайса на весь запрос. У моделей с 4.7 токенизатор тяжелее: тот же текст даёт больше токенов, чем на Sonnet 4.6 и старше.
Подписка Claude Pro или Max это не API. Лимиты там в сообщениях и недельных окнах. Сравнивать пакет с «5 долларов за миллион» нельзя: разные продукты.
Сколько стоят токены GPT-5.6
Официальный прайс OpenAI на ту же дату, тоже за миллион. Источник: Pricing | OpenAI API.
- GPT-5.6 Luna: вход 0,20, кэш 0,02, выход 1,20.
- GPT-5.6 Terra: вход 2, кэш 0,20, выход 12.
- GPT-5.6 Sol: вход 5, кэш 0,50, выход 30. Алиас gpt-5.6 ведёт на Sol.
На коротком контексте вход Sol совпадает с Opus 5: 5 за миллион. Выход у Sol дороже: 30 против 25. По ячейке выхода Opus выглядит дешевле. Это ещё не счёт за задачу. Кэш у Sol 0,50, то есть 10% от входа: повторный префикс дешевеет, полный репозиторий в каждый ход кэш не спасает.
Порог длинного контекста у Sol: вход больше 272 тысяч токенов поднимает ставку на весь запрос, вход x2, выход x1,5, то есть 10 / 45 за миллион. Fast mode у Sol: 10 / 60. Batch и Flex примерно вдвое дешевле, с задержкой.
Что дешевле, Claude или GPT
Короткий ответ: по прайсу за миллион этого не видно. Длинный ответ зависит от трёх вещей, которые таблица прячет.
1. Нарезка текста
Одинаковый вход у двух токенизаторов даёт разный счётчик. На русском плюс коде разрыв может быть больше или меньше чужой оценки. Без прогона на своих файлах коэффициент не ваш.
2. Форма счёта
Вайб-кодинг жрёт выход сильнее, чем кажется. Агент думает, вызывает grep, читает файл, пишет патч, читает тест, чинит. Видимый дифф на 80 строк может сидеть на тысячах токенов размышлений и логов. Модель с более дорогим выходом и коротким успешным циклом часто дешевле модели с дешёвым выходом и пятью ретраями.
3. Попадание в задачу
Haiku и Luna выигрывают любой прайс на переименовании и шаблонном CRUD. На многофайловом баге они проигрывают, потому что вы платите за неуспех: ещё один заход, ещё один флагман, ещё час вашего времени. Тибо формулирует это прямо: считать нужно цену успешного исхода, бенчмарк только старт, мерить на своих кейсах.
Сравнивать имеет смысл пары одного класса, не «весь Claude» против «всего GPT».
- Дешёвый слой: Haiku 4.5 (1/5) против Luna (0,20/1,20). Luna на бумаге дешевле. Если Haiku закрывает задачу с первого раза, а Luna крутит цикл, счёт перевернётся.
- Середина: Sonnet 5 (2/10) против Terra (2/12). Вход одинаковый по ячейке. Выход у Terra чуть дороже. Дальше решают кэш, длина цикла и токенизатор.
- Флагман: Opus 5 (5/25) против Sol (5/30). Вход совпал. Выход у Opus дешевле за миллион. Sol может нарезать тот же текст короче и лучше попадать в кэш. Победитель не из таблицы, из лога usage.
Для контента, не для кода, картина снова другая: см. подборку нейросетей для контента. Там тоже нельзя выбрать «самую дешёвую» по одной ставке.
Что мерить вместо цены за миллион
Единица, которая вам нужна: стоимость успешного результата. Для вайб-кодинга результат это не токен и не «красивый ответ». Это зелёный тест, влитый патч, рабочая форма, проходящая сборка. Всё остальное расход.
Минимальный набор метрик на одну задачу:
- Успех да/нет по вашему критерию. Не «модель что-то написала», а «можно мержить» или «воспроизводится баг / не воспроизводится».
- Число попыток до успеха. Каждая попытка в счёте.
- Вход, выход, кэш, thinking, если провайдер их отдаёт отдельно. Брать из usage, не оценивать «на глаз по словам».
- Деньги = сумма (токены категории × ставка категории). Учитывать fast, long-context, batch, если они реально включены.
- Ваше время. Если флагман закрыл задачу за 12 минут, а дешёвая модель за час, дешёвая почти никогда не дешевле.
Формула простая: стоимость успеха = сумма денег по неуспехам и успеху / число успехов. Если из десяти задач прошло шесть, в знаменателе шесть, не десять. Провалы не бесплатны.
Бенчмарки (SWE-bench и соседние) годятся как фильтр «модель вообще умеет патчить». Они не заменяют десяток ваших реальных тикетов: лендинг, парсер, правка легаси, миграция API. Вайб-кодинг как процесс описан отдельно: как собрать сайт с нуля через AI. Здесь только про деньги этого процесса.
Как прогнать сравнение за вечер
- Соберите 8-12 задач из своей практики. Одна задача = один критерий успеха. Не «поиграться с промптом», а «починить X» или «добавить Y».
- Зафиксируйте модель, режим reasoning/effort, включён ли кэш, лимит контекста, fast или нет. Меняете один фактор за прогон.
- Одинаковый стартовый промпт и одинаковый снимок репозитория. Не подсказывайте второй модели то, что уже вытащила первая.
- Пишите в таблицу: модель, input, output, cache read, cache write, попытки, успех, минуты, доллары.
- Считайте доллары по официальным ставкам той даты. Не по скрину из чужого треда.
- Отдельно пометьте задачи, где победил кэш, и задачи, где победила короткая траектория. Это разные рычаги.
Для выбора стека на месяц этого хватает: видно, где дешёвая модель сливает и где флагман жжёт выход вхолостую.
Где вайб-кодеры сжигают счёт
- Весь репозиторий в каждый ход. Карта проекта и правила должны попадать в кэш. Если агент каждый раз читает одни и те же 40 файлов заново, вы платите полный вход.
- Высокий effort на переименовании кнопки. Флагман с максимальным reasoning на тривиальной правке. Дешёвый слой закрывает это дешевле и быстрее.
- Цикл без стопа. Восемь ретраев по одному и тому же падающему тесту. Дешёвая ставка × восемь часто больше одного хода флагмана.
- Смешение подписки и API в одной голове. Лимит в Cursor, Claude Code или Codex это пакет. Выход за пакет уходит в on-demand. Сравнивать пакет в IDE с «5 долларов за миллион» бессмысленно, пока не видно, что биллится.
- Fast mode по привычке. У Sol это 10/60 вместо 5/30. У Opus 5 это 10/50 вместо 5/25. Имеет смысл, когда простой человека дороже удвоенного токена.
- Длинный контекст вслепую. У Sol порог 272K поднимает ставку на весь запрос. У Claude 4.6+ длинное окно идёт по базовой ставке, но токенов всё равно больше. Кладёте пачку PDF «на всякий случай» и удивляетесь счёту.
- Игнор языка. Русский промпт плюс английский код плюс JSON. Токенизатор каждой модели ведёт себя по-своему. Чужой тест на английском техническом тексте не ваш коэффициент.
Оплата самих сервисов из России это отдельный слой, не ставка токена: как оплатить нейросети из России.
Рабочая схема, не «лучшая модель»
Один флагман на всё это удобно и дорого. Дешёвый слой на всё это дёшево, пока не сломается. Практичный раскол для агента:
- Маршрутизатор и мелочь: Luna или Haiku. Поиск файла, переименование, вытащить лог, набросать тест, короткая правка стиля.
- Основной код: Sonnet 5 или Terra. Большая часть вайб-кодинга живёт здесь, если задача умещается в один-два цикла.
- Узкое место: Opus 5 или Sol. Архитектура, многофайловый баг, рефакторинг с инвариантами, место, где дешёвая модель уже дважды солгала.
Кэш на систему и карту репо включайте явно. Между разными задачами чистите контекст: старый провальный ход остаётся в счёте и сбивает следующую попытку. Не гоните Fast, пока не ясно, что тормозит: модель или чтение диффа.
Субагентам отдавайте изолированные куски, флагману оставляйте сборку. Без критерия успеха на каждом куске дешёвый слой плодит мусор, флагман переписывает его за полную ставку.
Как читать чужие таблицы и не попасть
Чеклист перед тем, как поверить заголовку «Claude дешевле GPT»:
- Дата прайса. Ставки живут неделями, не годами. Этот текст зафиксирован на 19 августа 2026.
- Какая именно модель, не бренд. Haiku это не Opus. Luna это не Sol.
- Вход и выход раздельно. Смешанная «средняя цена токена» маскирует агентов, у которых выход доминирует.
- Учтены ли кэш, long-context, fast, batch. Без этого сравнение игрушечное.
- Чей токенизатор считал объём. Если в таблице одинаковое число токенов у Claude и GPT, таблица уже врёт.
- Что такое успех. Токены на «почти правильный патч» не экономия.
Стоимость токена ИИ это строка в прайсе. Решения о стеке она не принимает. Считать $/1M нужно, чтобы не перепутать Haiku с Fable и Luna с Sol. Выбирать, что дешевле, Claude или GPT, по одной цифре нельзя. Берите десяток своих задач, пишите usage, делите деньги на число успехов. Это и есть сравнение.
