Токен в Codex, это кусочек текста, которым модель меряет всё: ваш вопрос, код из файлов, ответы инструментов и собственные рассуждения. Расход растёт не от количества сообщений, а от объёма контекста, который уезжает в модель на каждом шаге. Ниже разберём, из чего складывается счёт, почему длинный диалог дорожает сам по себе, чем токены API отличаются от лимитов подписки и какие приёмы правда экономят.
Что такое токен простыми словами
Модель не читает слова целиком. Текст режется на токены, это фрагменты примерно в несколько символов. Для русского текста токенов на ту же фразу уходит заметно больше, чем для английского, потому что кириллица дробится мельче. Код тоже дробится: отступы, скобки и имена переменных, всё это токены.
Важно, что токены бывают двух видов, и стоят они по-разному. Входные (input), это всё, что модель получила: ваш промпт, содержимое файлов, вывод команд. Выходные (output), это то, что она сгенерировала: ответ, патч, а также внутренние рассуждения. Выходные всегда дороже.
Разница в цене видна прямо в официальном прайсе. Для модели gpt-5.3-codex в прайс-листе OpenAI API указано 1,75 доллара за миллион входных токенов и 14 долларов за миллион выходных, то есть выход дороже входа в восемь раз. Та же логика в подписке: по документации ChatGPT кредиты для GPT-5.6 Sol считаются как 125 за миллион входных токенов и 750 за миллион выходных.
Отсюда первый практический вывод. Длинный вопрос стоит дёшево, а длинный ответ дорого. Просить «перепиши весь файл целиком» вместо «покажи нужный фрагмент», это самый простой способ сжечь лимит на ровном месте.
Расход падает, когда задача поставлена точно с первого раза. Этому и учат на бесплатном вебинаре по вайбкодингу, на живом проекте от идеи до результата.
Тратить меньше на переделкиКонтекст: почему длинный диалог съедает лимит
У модели нет памяти между шагами. Чтобы ответить на ваше десятое сообщение, она должна снова получить всё, что было до него. Диалог не продолжается, он пересылается заново целиком на каждом шаге.
Это и есть главная причина, по которой длинная сессия дорожает сама по себе. Схематично расход выглядит так:
- Первый запрос: улетело 5 тысяч токенов.
- Пятый запрос: улетела вся история, уже 40 тысяч.
- Двадцатый запрос: улетело 150 тысяч, хотя сам вопрос был в одну строку.
Прочитанные файлы, вывод тестов, длинные логи ошибок, всё это оседает в контексте и едет в модель снова и снова. Один раз показали Codex портянку логов на 20 тысяч токенов, и дальше вы платите за неё в каждом следующем сообщении сессии.
Место в контексте конечно. Когда история подбирается к пределу модели, срабатывает сжатие, которое в OpenAI называют compaction. В документации по compaction описано, что при пересечении порога сервер сворачивает историю в компактный зашифрованный объект, который переносит ключевое состояние и рассуждения меньшим числом токенов. Как пример настройки там приводится порог в 200 000 токенов.
Сжатие спасает сессию от обрыва, но это не бесплатная магия. Часть деталей после свёртки теряется, и модель может забыть договорённость из начала разговора. Если Codex вдруг начал делать не то, что вы просили час назад, дело чаще всего именно в этом.
Практическое правило: одна задача, одна сессия. Закончили с формой авторизации, начали новый разговор для вёрстки карточек. Это дешевле и точнее, чем тащить один бесконечный диалог через весь проект.
По теме: Codex 5.3 (GPT-5.3-Codex): что за версия и актуальна ли в 2026
Токены API и лимиты подписки: не одно и то же
Здесь путаница возникает чаще всего, потому что слово «расход» означает две разные вещи в зависимости от того, как вы подключены.
1. Подписка ChatGPT. Вы платите фиксированную сумму в месяц и упираетесь не в деньги, а в лимит сообщений в окне. По документации ChatGPT тарифы такие: Free 0 долларов, Go 8, Plus 20, Pro от 100 долларов в месяц (с вариантами лимита 5x и 20x), Business 25 долларов за пользователя при помесячной оплате. На тарифе Plus в пятичасовом окне доступно порядка 15-90 сообщений на модели GPT-5.6 Sol и 50-280 на более лёгкой Luna. Codex и обычный чат делят один и тот же лимит.
2. API по ключу. Здесь нет лимита сообщений, есть счёт за токены по прайсу выше. Расход не ограничен ничем, кроме вашего баланса, зато и потолка в 5 часов нет.
Токены никуда не деваются и в подписке, просто их пересчитывают в кредиты. По той же документации одно сообщение GPT-5.6 в среднем стоит от 5 до 40 кредитов, и разброс в восемь раз объясняется именно объёмом контекста и длиной ответа. Поэтому фраза «у меня безлимит, экономить не нужно» неверна: экономя токены, вы на подписке растягиваете количество задач в окне. Сколько именно задач дают тарифы, мы подробно разбирали в материале про лимиты Codex, а как подключиться по ключу, показано в инструкции по Codex API.
Токены уходят не на код, а на переспрашивание, когда задача сформулирована размыто. На бесплатном вебинаре по вайбкодингу показывают, как описать проект так, чтобы ИИ собрал его почти сразу.
Научиться формулировать задачуГде посмотреть расход
Проще всего следить за контекстом в десктопном приложении ChatGPT для Windows и macOS: агент Codex встроен прямо в него, и это основной способ работы для большинства. Скачать можно со страницы Codex, на Windows приложение есть в Microsoft Store.
Если вам привычнее терминал, в Codex CLI есть команда /status: она показывает текущую модель, режим песочницы и потраченные токены сессии, а в статус-строке видно, сколько контекста осталось. Облачная версия в браузере тоже существует, но следить за расходом там менее удобно. Про команды и режимы терминальной версии есть отдельный разбор Codex CLI.
Ориентир простой: как только показатель занятого контекста подбирается к 70-80 процентам, пора закрывать задачу и начинать новую сессию, а не ждать автоматического сжатия.
По теме: Лимиты Codex в ChatGPT 2026: сколько запросов дают и когда сбросятся
Шесть приёмов, которые реально сокращают расход
- Дробите задачи. Одна сессия, одна законченная задача. Новая тема, команда /new или новый разговор. Это экономит больше, чем все остальные приёмы вместе взятые.
- Указывайте конкретные файлы. Вместо «посмотри проект и почини баг» пишите «в
src/auth/login.jsне проходит валидация email». Иначе агент прочитает десятки файлов, и все они осядут в контексте до конца сессии. - Просите фрагмент, а не файл целиком. Выходные токены дороже входных в восемь раз, поэтому «покажи только изменённую функцию» дешевле, чем «выведи весь файл с правкой».
- Не вставляйте портянки логов. Из ошибки на 500 строк модели обычно нужны первые 20 и текст исключения. Остальное вы будете оплачивать в каждом следующем шаге.
- Заведите AGENTS.md. Это файл с правилами проекта в корне репозитория, который Codex читает перед работой (см. руководство OpenAI по AGENTS.md). Один раз описанные стек, команды тестов и стиль кода избавляют от повторных объяснений в каждой сессии. Держите его коротким: он тоже занимает контекст.
- Берите модель по размеру задачи. Переименовать переменные или поправить текст на кнопке спокойно сделает лёгкая модель, а тяжёлую логику приберегите для флагманской. По прайсу разница в цене между моделями кратная.
Отдельно про кэш. Если начало разговора не меняется, повторные входные токены попадают в кэш и стоят дешевле: в прайсе для gpt-5.3-codex это 0,175 доллара за миллион против 1,75, то есть в десять раз меньше. Практический смысл в том, чтобы не перетасовывать начало диалога. Стабильный контекст в начале и новые вопросы в конце, это дешевле, чем каждый раз переписывать условие задачи заново.
Частые вопросы
Что значит «недостаточно токенов» в Codex?
Сообщение о нехватке токенов означает, что кончился не сам текст, а оплаченный ресурс на его обработку. В подписке ChatGPT это упор в лимит окна: до сброса 5-часового или недельного счётчика новые задачи не запускаются. При работе по API-ключу это исчерпанный баланс на аккаунте OpenAI. Отдельная история, когда переполнился контекст сессии: тогда речь не о деньгах, а о длине диалога, и лечится это новой сессией под новую задачу.
Сколько токенов в одном русском слове?
Точной константы нет, дробление зависит от самого слова. Для кириллицы токенов уходит ощутимо больше, чем для того же текста на английском. Если нужна точность, считайте не на глаз, а по счётчику сессии в /status.
Тратятся ли токены, если Codex просто читает файлы?
Да, и это основная статья расхода. Прочитанный файл становится частью контекста и пересылается в модель на каждом следующем шаге сессии, пока не сработает сжатие.
Команда /compact экономит деньги?
Она экономит место в контексте и спасает сессию от упора в предел, но само сжатие тоже требует обработки истории. Начать новую сессию под новую задачу дешевле и надёжнее, чем сжимать старую.
Почему счёт растёт, хотя я пишу короткие сообщения?
Потому что платите вы не за сообщение, а за весь контекст, который едет вместе с ним. Двадцатый вопрос в одну строку тащит за собой всю историю разговора и все прочитанные файлы.
Что дешевле для одного человека: подписка или API?
Для регулярной работы обычно подписка: фиксированные 20 долларов на Plus предсказуемее, чем счёт по токенам, который на активной сессии с большим контекстом набегает быстро. API удобнее для автоматизации и разовых задач. Похожая механика есть и у конкурента, мы разбирали её в статье про лимиты и токены Claude Code.
На бесплатном вебинаре по вайбкодингу показываем, как ставить задачи ИИ-агенту так, чтобы он делал работу с первого раза, а не сжигал контекст на переспрашивании. Разбираем живой проект от идеи до результата.
Записаться на вебинар