Токен — это кусочек текста, с которым работает языковая модель: часть слова, целое короткое слово, знак препинания или пробел с началом следующего слова. Модель не видит букв и слов в привычном смысле — она получает текст как последовательность токенов и выдаёт ответ тоже токен за токеном. Поэтому в токенах измеряется всё: сколько текста модель может учесть за раз, сколько времени займёт ответ и сколько он стоит.
Для обычного пользователя чата токены почти незаметны — они прячутся за лимитами подписки. Но как только нейросеть встраивается в работу компании — бот на сайте, разбор писем, генерация описаний товаров, — токены превращаются в строку расходов, и её нужно уметь считать. В статье — как это сделать, с замером, который мы провели сами, и ценами с официальных страниц на сентябрь 2026 года. Короткое определение есть и в словаре терминов.
Что такое токен простыми словами
Перед тем как модель прочитает текст, специальная программа — токенизатор — режет его на кусочки из заранее составленного словаря. Словарь собирается на огромном корпусе текстов так, чтобы частые сочетания букв стали отдельными токенами. Частое английское слово целиком — один токен. Редкое слово, название или слово на языке, которого в корпусе было меньше, распадается на несколько кусочков.
Вот как два токенизатора OpenAI режут одни и те же слова. Первый, cl100k_base, использовался в моделях поколения GPT-4. Второй, o200k_base, — в более новых моделях, начиная с GPT-4o; его словарь вдвое больше, и русский язык в нём представлен лучше.
| Текст | cl100k_base | o200k_base |
| нейросети | 5 токенов: н · ей · рос · ет · и | 3 токена: ней · рос · ети |
| Калининград | 7 токенов | 4 токена: К · ал · ининг · рад |
| договор поставки | 7 токенов | 4 токена: д · оговор · постав · ки |
| neural networks | 3 токена | 3 токена: ne · ural · networks |
Видно, что кусочки не совпадают ни со слогами, ни с морфемами: токенизатор ничего не знает о грамматике, он просто выбирает самые частые сочетания. У каждого разработчика моделей токенизатор свой — у Anthropic, Google, Яндекса и Сбера словари отличаются, поэтому один и тот же текст в разных моделях занимает разное число токенов. Это важно при сравнении цен: 1000 токенов у двух провайдеров — не одинаковый объём текста.
Числа и адреса режутся тоже по-своему. В токенизаторе o200k_base число 1234567 превращается в три токена — «123», «456» и «7», а адрес termosbespalova.ru/obuchenie/ со схемой https — в 13 токенов. Модель видит не число целиком, а куски цифр, и это одна из причин, почему языковые модели без запуска кода ошибаются в арифметике: складывать приходится не числа, а фрагменты текста.
Из токенов складывается и главное ограничение модели — контекстное окно: сколько токенов модель учитывает за один раз, включая ваш вопрос, приложенные файлы, историю переписки и собственный ответ. Почему модель «забывает» начало длинного разговора и как с этим работать, разобрано в гайде контекстное окно нейросети.
Почему русский текст дороже английского: наш замер
Словари токенизаторов собирают на корпусах, где английского текста больше всего. Поэтому английские слова чаще попадают в словарь целиком, а русские режутся на части. Мы проверили, насколько это заметно, на трёх парах текстов с одинаковым смыслом: абзац о маркетинге, условие договора поставки и сообщение клиента в поддержку. Подсчёт — библиотекой tiktoken, которой OpenAI открыто публикует свои токенизаторы.
| Токенизатор | Русский, токенов | Английский, токенов | Во сколько раз больше | Знаков на токен (рус.) |
| cl100k_base (GPT-4) | 303 | 138 | 2,2 (от 2,1 до 2,33) | 2,2 |
| o200k_base (GPT-4o и новее) | 176 | 137 | 1,28 (от 1,2 до 1,35) | 3,8 |
Выводы из замера. В старом токенизаторе русский текст занимал больше чем вдвое больше токенов — и, значит, стоил больше чем вдвое дороже и быстрее упирался в контекстное окно. В новом разрыв сократился примерно до четверти-трети. Английский текст в обоих случаях — около 4,9 знака на токен, русский в новом токенизаторе — около 3,8. Для грубой оценки удобно правило: страница русского текста в 1800 знаков — это порядка 450–500 токенов в современных моделях OpenAI.
Честная оговорка: три пары текстов — не исследование, а проверка порядка величин. У других провайдеров цифры будут свои, и у российских моделей, обученных с упором на русский язык, разница может быть меньше. Точное число для своей задачи проще всего получить так: прогнать через API десяток типичных запросов и посмотреть, сколько токенов посчитал сам провайдер — он возвращает это число в каждом ответе.
Как считаются деньги: вход, выход, кэш
При работе через API провайдеры берут плату за токены по отдельным ставкам. Входящие токены — всё, что вы отправляете модели: инструкция, вопрос, документы, история переписки. Исходящие — то, что модель пишет в ответ. Исходящие почти всегда дороже: у моделей Anthropic — в 5 раз. Кэшированные — повторяющееся начало запроса (например, одна и та же длинная инструкция), которое провайдер хранит между вызовами и берёт за его повторное чтение намного меньше.
| Модель | Вход | Выход | Единица |
| Claude Opus 5.5 | $4 | $20 | за 1 млн токенов |
| Claude Sonnet 5 | $2 | $10 | за 1 млн токенов |
| Claude Haiku 4.5 | $1 | $5 | за 1 млн токенов |
| YandexGPT Pro 5.1 | 0,8 ₽ | 0,8 ₽ | за 1000 токенов, с НДС |
| YandexGPT Lite | 0,2 ₽ | 0,2 ₽ | за 1000 токенов, с НДС |
| GigaChat Max (пакет) | 0,65 ₽ | за 1000 токенов |
| GigaChat Lite (пакет) | 0,065 ₽ | за 1000 токенов |
Цены проверены на официальных страницах тарифов 26 сентября 2026 года и меняются, поэтому перед расчётом бюджета сверяйтесь с первоисточником. Обратите внимание на единицы: зарубежные провайдеры указывают цену за миллион токенов, российские — за тысячу. Для сравнения всё надо привести к одной единице и учесть, что сами токены у разных моделей разного «размера».
Кэширование — самый недооценённый способ экономии. У Anthropic чтение из кэша для Sonnet 5 стоит $0,20 за миллион токенов против $2 за обычный вход, то есть в 10 раз дешевле, а для Opus 5.5 — в 20 раз. Если бот на каждый вопрос отправляет одну и ту же инструкцию на 5000 токенов и базу знаний на 20 000, кэш снижает стоимость входа почти на порядок. Второй способ — пакетная обработка: задачи, которым не нужен мгновенный ответ, у Anthropic выполняются со скидкой 50%.
Сколько стоит реальная задача
Формула простая: число операций × (входящие токены × цена входа + исходящие токены × цена выхода). Трудность только в том, чтобы честно оценить объём. Возьмём задачу из гайда для операционного менеджера: модель разбирает входящие письма и извлекает поля заказа. Допустим, писем 1000 в месяц, на каждое уходит 2000 входящих токенов (инструкция, схема, само письмо) и 300 исходящих (JSON с полями).
| Модель | Расчёт на 1000 писем | Итого в месяц |
| Claude Sonnet 5 | 2 млн × $2 + 0,3 млн × $10 | $7, с пакетной обработкой $3,5 |
| Claude Haiku 4.5 | 2 млн × $1 + 0,3 млн × $5 | $3,5 |
| YandexGPT Pro 5.1 | 2300 тыс. токенов × 0,8 ₽ за тысячу | 1840 ₽ |
| YandexGPT Lite | 2300 тыс. токенов × 0,2 ₽ за тысячу | 460 ₽ |
Числа условные: реальный объём токенов зависит от длины писем, инструкции и токенизатора конкретной модели. Но порядок величин показательный: для большинства задач малого и среднего бизнеса стоимость токенов — сотни или тысячи рублей в месяц, а не десятки тысяч. Дороже обходятся разработка, поддержка и ошибки. Выбор между моделями поэтому чаще определяется качеством ответа, требованиями к хранению данных и доступностью из России, а не ценой токена.
Где счёт растёт незаметно. Длинная история диалога: бот, который на каждое сообщение отправляет всю переписку, платит за неё снова и снова, и каждое следующее сообщение стоит дороже предыдущего. Большие документы в каждом запросе вместо поиска нужного фрагмента. Агенты, которые делают десятки вызовов модели на одну задачу, — там счёт идёт уже на сотни тысяч токенов за задачу. Такие места стоит посчитать до запуска, а после — смотреть на фактический расход в кабинете провайдера.
Отдельная статья расходов — рассуждения. Модели с режимом размышления перед ответом пишут внутреннюю цепочку рассуждений, и эти токены оплачиваются по ставке исходящих, даже если пользователь видит только короткий итог. Для сложной задачи рассуждение может в несколько раз превышать сам ответ. Поэтому режим размышления стоит включать там, где он действительно нужен — анализ, код, многошаговые задачи, — и ограничивать его бюджет в настройках запроса, а для классификации писем или извлечения полей оставлять выключенным. Подробнее о таких моделях — в карточке ризонинг-модель словаря.
Подписка или API: где токены видны, а где нет
В чатах по подписке — ChatGPT, Claude, Алиса Про, GigaChat в приложении — токены вы напрямую не оплачиваете. Подписка стоит фиксированно, а расход ограничен лимитами: число сообщений за период, объём использования, доступ к старшим моделям. Внутри лимиты всё равно считаются в токенах, поэтому длинные документы и долгие переписки расходуют их быстрее: одно сообщение с приложенным договором на 50 страниц «весит» как десятки обычных вопросов.
API нужен, когда модель встраивается в процесс: бот на сайте, обработка писем, генерация описаний для каталога. Там платите ровно за израсходованные токены, и расход можно точно посчитать и ограничить. Для одного человека, который работает с моделью в чате, подписка почти всегда удобнее и дешевле; для автоматизации — API. Как оплачивать зарубежные сервисы из России и сколько на самом деле стоит подписка, разобрано в гайде доступ к нейросетям и оплата.
Лимит подписки кончился быстрее, чем ожидали? Скорее всего, в разговоре накопилась длинная история или приложены большие файлы: каждое новое сообщение модель читает вместе со всем предыдущим. Начните новый чат и перенесите в него только краткое резюме прошлого — расход упадёт сразу.
Как тратить меньше токенов
Первое — не отправлять лишнего. Модели не нужен весь договор, чтобы ответить на вопрос о сроке оплаты: достаточно найти нужный раздел поиском и передать его. Бот поддержки не должен отправлять всю базу знаний — только статьи, найденные по вопросу. Этот подход называют RAG, и он экономит токены так же, как снижает число выдуманных ответов.
Второе — подбирать модель под задачу. Классификация писем по пяти типам не требует флагманской модели: младшая справляется так же, а стоит в несколько раз меньше. Флагман нужен для сложных рассуждений, длинных документов и задач, где цена ошибки высока. Хорошая практика — начать со старшей модели, собрать эталонные ответы и проверить, выдерживает ли младшая то же качество.
Третье — управлять длиной ответа. Исходящие токены самые дорогие, поэтому просите ровно то, что нужно: JSON с пятью полями вместо развёрнутого объяснения, ответ до 100 слов вместо «подробно». И наконец — кэш и пакетная обработка там, где провайдер их поддерживает: повторяющиеся инструкции в начало запроса, несрочные задачи — пакетом. Если вы только начинаете, разберитесь сначала с тем, как устроена языковая модель, — многое в поведении токенов станет понятнее.
Автор: Артём Беспалов, маркетинговое ИИ-агентство «Термос Беспалова», Калининград. Замер токенов — наш, библиотекой tiktoken на трёх парах текстов, 26.09.2026.
Источники: тарифы Anthropic · тарифы Yandex AI Studio · тарифы GigaChat для юрлиц · токенизатор tiktoken от OpenAI (проверено 26.09.2026).