Термос Беспалова
Уровень · Базовый

Что такое токены в нейросетях и почему за них платят

Как модель режет текст на кусочки, почему русский текст обходится дороже английского, как посчитать стоимость своей задачи по тарифам и где на токенах можно сэкономить.

Токен — это кусочек текста, с которым работает языковая модель: часть слова, целое короткое слово, знак препинания или пробел с началом следующего слова. Модель не видит букв и слов в привычном смысле — она получает текст как последовательность токенов и выдаёт ответ тоже токен за токеном. Поэтому в токенах измеряется всё: сколько текста модель может учесть за раз, сколько времени займёт ответ и сколько он стоит.

Для обычного пользователя чата токены почти незаметны — они прячутся за лимитами подписки. Но как только нейросеть встраивается в работу компании — бот на сайте, разбор писем, генерация описаний товаров, — токены превращаются в строку расходов, и её нужно уметь считать. В статье — как это сделать, с замером, который мы провели сами, и ценами с официальных страниц на сентябрь 2026 года. Короткое определение есть и в словаре терминов.

Что такое токен простыми словами

Перед тем как модель прочитает текст, специальная программа — токенизатор — режет его на кусочки из заранее составленного словаря. Словарь собирается на огромном корпусе текстов так, чтобы частые сочетания букв стали отдельными токенами. Частое английское слово целиком — один токен. Редкое слово, название или слово на языке, которого в корпусе было меньше, распадается на несколько кусочков.

Вот как два токенизатора OpenAI режут одни и те же слова. Первый, cl100k_base, использовался в моделях поколения GPT-4. Второй, o200k_base, — в более новых моделях, начиная с GPT-4o; его словарь вдвое больше, и русский язык в нём представлен лучше.

Текстcl100k_baseo200k_base
нейросети5 токенов: н · ей · рос · ет · и3 токена: ней · рос · ети
Калининград7 токенов4 токена: К · ал · ининг · рад
договор поставки7 токенов4 токена: д · оговор · постав · ки
neural networks3 токена3 токена: ne · ural · networks

Видно, что кусочки не совпадают ни со слогами, ни с морфемами: токенизатор ничего не знает о грамматике, он просто выбирает самые частые сочетания. У каждого разработчика моделей токенизатор свой — у Anthropic, Google, Яндекса и Сбера словари отличаются, поэтому один и тот же текст в разных моделях занимает разное число токенов. Это важно при сравнении цен: 1000 токенов у двух провайдеров — не одинаковый объём текста.

Числа и адреса режутся тоже по-своему. В токенизаторе o200k_base число 1234567 превращается в три токена — «123», «456» и «7», а адрес termosbespalova.ru/obuchenie/ со схемой https — в 13 токенов. Модель видит не число целиком, а куски цифр, и это одна из причин, почему языковые модели без запуска кода ошибаются в арифметике: складывать приходится не числа, а фрагменты текста.

Из токенов складывается и главное ограничение модели — контекстное окно: сколько токенов модель учитывает за один раз, включая ваш вопрос, приложенные файлы, историю переписки и собственный ответ. Почему модель «забывает» начало длинного разговора и как с этим работать, разобрано в гайде контекстное окно нейросети.

Почему русский текст дороже английского: наш замер

Словари токенизаторов собирают на корпусах, где английского текста больше всего. Поэтому английские слова чаще попадают в словарь целиком, а русские режутся на части. Мы проверили, насколько это заметно, на трёх парах текстов с одинаковым смыслом: абзац о маркетинге, условие договора поставки и сообщение клиента в поддержку. Подсчёт — библиотекой tiktoken, которой OpenAI открыто публикует свои токенизаторы.

ТокенизаторРусский, токеновАнглийский, токеновВо сколько раз большеЗнаков на токен (рус.)
cl100k_base (GPT-4)3031382,2 (от 2,1 до 2,33)2,2
o200k_base (GPT-4o и новее)1761371,28 (от 1,2 до 1,35)3,8

Выводы из замера. В старом токенизаторе русский текст занимал больше чем вдвое больше токенов — и, значит, стоил больше чем вдвое дороже и быстрее упирался в контекстное окно. В новом разрыв сократился примерно до четверти-трети. Английский текст в обоих случаях — около 4,9 знака на токен, русский в новом токенизаторе — около 3,8. Для грубой оценки удобно правило: страница русского текста в 1800 знаков — это порядка 450–500 токенов в современных моделях OpenAI.

Честная оговорка: три пары текстов — не исследование, а проверка порядка величин. У других провайдеров цифры будут свои, и у российских моделей, обученных с упором на русский язык, разница может быть меньше. Точное число для своей задачи проще всего получить так: прогнать через API десяток типичных запросов и посмотреть, сколько токенов посчитал сам провайдер — он возвращает это число в каждом ответе.

Как считаются деньги: вход, выход, кэш

При работе через API провайдеры берут плату за токены по отдельным ставкам. Входящие токены — всё, что вы отправляете модели: инструкция, вопрос, документы, история переписки. Исходящие — то, что модель пишет в ответ. Исходящие почти всегда дороже: у моделей Anthropic — в 5 раз. Кэшированные — повторяющееся начало запроса (например, одна и та же длинная инструкция), которое провайдер хранит между вызовами и берёт за его повторное чтение намного меньше.

МодельВходВыходЕдиница
Claude Opus 5.5$4$20за 1 млн токенов
Claude Sonnet 5$2$10за 1 млн токенов
Claude Haiku 4.5$1$5за 1 млн токенов
YandexGPT Pro 5.10,8 ₽0,8 ₽за 1000 токенов, с НДС
YandexGPT Lite0,2 ₽0,2 ₽за 1000 токенов, с НДС
GigaChat Max (пакет)0,65 ₽за 1000 токенов
GigaChat Lite (пакет)0,065 ₽за 1000 токенов

Цены проверены на официальных страницах тарифов 26 сентября 2026 года и меняются, поэтому перед расчётом бюджета сверяйтесь с первоисточником. Обратите внимание на единицы: зарубежные провайдеры указывают цену за миллион токенов, российские — за тысячу. Для сравнения всё надо привести к одной единице и учесть, что сами токены у разных моделей разного «размера».

Кэширование — самый недооценённый способ экономии. У Anthropic чтение из кэша для Sonnet 5 стоит $0,20 за миллион токенов против $2 за обычный вход, то есть в 10 раз дешевле, а для Opus 5.5 — в 20 раз. Если бот на каждый вопрос отправляет одну и ту же инструкцию на 5000 токенов и базу знаний на 20 000, кэш снижает стоимость входа почти на порядок. Второй способ — пакетная обработка: задачи, которым не нужен мгновенный ответ, у Anthropic выполняются со скидкой 50%.

Сколько стоит реальная задача

Формула простая: число операций × (входящие токены × цена входа + исходящие токены × цена выхода). Трудность только в том, чтобы честно оценить объём. Возьмём задачу из гайда для операционного менеджера: модель разбирает входящие письма и извлекает поля заказа. Допустим, писем 1000 в месяц, на каждое уходит 2000 входящих токенов (инструкция, схема, само письмо) и 300 исходящих (JSON с полями).

МодельРасчёт на 1000 писемИтого в месяц
Claude Sonnet 52 млн × $2 + 0,3 млн × $10$7, с пакетной обработкой $3,5
Claude Haiku 4.52 млн × $1 + 0,3 млн × $5$3,5
YandexGPT Pro 5.12300 тыс. токенов × 0,8 ₽ за тысячу1840 ₽
YandexGPT Lite2300 тыс. токенов × 0,2 ₽ за тысячу460 ₽

Числа условные: реальный объём токенов зависит от длины писем, инструкции и токенизатора конкретной модели. Но порядок величин показательный: для большинства задач малого и среднего бизнеса стоимость токенов — сотни или тысячи рублей в месяц, а не десятки тысяч. Дороже обходятся разработка, поддержка и ошибки. Выбор между моделями поэтому чаще определяется качеством ответа, требованиями к хранению данных и доступностью из России, а не ценой токена.

Где счёт растёт незаметно. Длинная история диалога: бот, который на каждое сообщение отправляет всю переписку, платит за неё снова и снова, и каждое следующее сообщение стоит дороже предыдущего. Большие документы в каждом запросе вместо поиска нужного фрагмента. Агенты, которые делают десятки вызовов модели на одну задачу, — там счёт идёт уже на сотни тысяч токенов за задачу. Такие места стоит посчитать до запуска, а после — смотреть на фактический расход в кабинете провайдера.

Отдельная статья расходов — рассуждения. Модели с режимом размышления перед ответом пишут внутреннюю цепочку рассуждений, и эти токены оплачиваются по ставке исходящих, даже если пользователь видит только короткий итог. Для сложной задачи рассуждение может в несколько раз превышать сам ответ. Поэтому режим размышления стоит включать там, где он действительно нужен — анализ, код, многошаговые задачи, — и ограничивать его бюджет в настройках запроса, а для классификации писем или извлечения полей оставлять выключенным. Подробнее о таких моделях — в карточке ризонинг-модель словаря.

Подписка или API: где токены видны, а где нет

В чатах по подписке — ChatGPT, Claude, Алиса Про, GigaChat в приложении — токены вы напрямую не оплачиваете. Подписка стоит фиксированно, а расход ограничен лимитами: число сообщений за период, объём использования, доступ к старшим моделям. Внутри лимиты всё равно считаются в токенах, поэтому длинные документы и долгие переписки расходуют их быстрее: одно сообщение с приложенным договором на 50 страниц «весит» как десятки обычных вопросов.

API нужен, когда модель встраивается в процесс: бот на сайте, обработка писем, генерация описаний для каталога. Там платите ровно за израсходованные токены, и расход можно точно посчитать и ограничить. Для одного человека, который работает с моделью в чате, подписка почти всегда удобнее и дешевле; для автоматизации — API. Как оплачивать зарубежные сервисы из России и сколько на самом деле стоит подписка, разобрано в гайде доступ к нейросетям и оплата.

Лимит подписки кончился быстрее, чем ожидали? Скорее всего, в разговоре накопилась длинная история или приложены большие файлы: каждое новое сообщение модель читает вместе со всем предыдущим. Начните новый чат и перенесите в него только краткое резюме прошлого — расход упадёт сразу.

Как тратить меньше токенов

Первое — не отправлять лишнего. Модели не нужен весь договор, чтобы ответить на вопрос о сроке оплаты: достаточно найти нужный раздел поиском и передать его. Бот поддержки не должен отправлять всю базу знаний — только статьи, найденные по вопросу. Этот подход называют RAG, и он экономит токены так же, как снижает число выдуманных ответов.

Второе — подбирать модель под задачу. Классификация писем по пяти типам не требует флагманской модели: младшая справляется так же, а стоит в несколько раз меньше. Флагман нужен для сложных рассуждений, длинных документов и задач, где цена ошибки высока. Хорошая практика — начать со старшей модели, собрать эталонные ответы и проверить, выдерживает ли младшая то же качество.

Третье — управлять длиной ответа. Исходящие токены самые дорогие, поэтому просите ровно то, что нужно: JSON с пятью полями вместо развёрнутого объяснения, ответ до 100 слов вместо «подробно». И наконец — кэш и пакетная обработка там, где провайдер их поддерживает: повторяющиеся инструкции в начало запроса, несрочные задачи — пакетом. Если вы только начинаете, разберитесь сначала с тем, как устроена языковая модель, — многое в поведении токенов станет понятнее.

Автор: Артём Беспалов, маркетинговое ИИ-агентство «Термос Беспалова», Калининград. Замер токенов — наш, библиотекой tiktoken на трёх парах текстов, 26.09.2026.

Источники: тарифы Anthropic · тарифы Yandex AI Studio · тарифы GigaChat для юрлиц · токенизатор tiktoken от OpenAI (проверено 26.09.2026).

Гайды 2026

Разобрано до шаблонов: три гайда по 490 ₽

Всё, что в статьях идёт по верхам, здесь собрано в PDF: пошаговые схемы, готовые промпты и шаблоны, которые можно взять и применить в тот же день.

Обложка гайда «Промпты, которые работают: система и 60 готовых шаблонов»

Промпты, которые работают: система и 60 готовых шаблонов

Как писать запросы к нейросетям так, чтобы ответы можно было брать в работу без переписывания

  • Формула промпта из семи элементов с разбором «плохо / хорошо»
  • Работа с контекстом и файлами: как кормить модель данными
  • Итерации: как дорабатывать ответ, а не начинать заново
  • Few-shot и цепочки промптов со схемами

PDF, 57 стр., A4

Посмотреть фрагмент (PDF)
Обложка гайда «Свой ИИ-агент за выходные: пошагово, с кодом и без»

Свой ИИ-агент за выходные: пошагово, с кодом и без

Три рабочих проекта, выбор платформы, безопасность, стоимость и тесты: от агента в конструкторе до Python-кода с MCP

  • Цикл агента и пять архитектур со схемами
  • Честный раздел «когда агент не нужен» и дерево решений
  • Сравнение платформ no-code и кода по девяти критериям
  • Три проекта пошагово: секретарь заявок, аналитик отчёта, агент на коде

PDF, 51 стр., A4

Посмотреть фрагмент (PDF)
Обложка гайда «Claude с нуля: от первого чата до скиллов и Claude Code»

Claude с нуля: от первого чата до скиллов и Claude Code

Модели, проекты, 18 сценариев с промптами, скиллы, MCP и Claude Code для тех, кто не пишет код

  • Как выбрать модель Claude по задаче (актуально на 25.09.2026)
  • Схема интерфейса и разбор возможностей: проекты, артефакты, поиск, память, рассуждение
  • Формула запроса и приёмы, которые работают именно у Claude
  • 18 рабочих сценариев с готовыми промптами: письма, договоры, презентации, таблицы, исследования

PDF, 42 стр., A4

Посмотреть фрагмент (PDF)

Оплата на стороне платёжного сервиса. После оплаты вы вернётесь на сайт, и файл откроется сразу. Оплачивая, вы принимаете оферту.

Дальше

Что почитать дальше

Контекстное окно нейросети

Сколько токенов модель учитывает за раз и почему забывает начало разговора.

Открыть

Что такое LLM

Как устроена языковая модель: обучение, параметры и почему она предсказывает текст.

Открыть

Доступ и оплата

Как оплатить зарубежные нейросети из России и что выбрать: подписку или API.

Открыть
Вопросы

Частые вопросы

Что такое токен в нейросети простыми словами?
Кусочек текста, с которым работает модель: часть слова, короткое слово целиком или знак препинания. Модель читает и пишет текст токен за токеном, поэтому в токенах измеряются объём контекста, скорость ответа и стоимость работы через API.
Сколько токенов в одной странице русского текста?
По нашему замеру в токенизаторе o200k_base, который используют современные модели OpenAI, русский текст — около 3,8 знака на токен. Страница в 1800 знаков — порядка 450–500 токенов. У других провайдеров число будет своим, точное значение возвращает API в каждом ответе.
Почему русский текст стоит дороже английского?
Словари токенизаторов собирают на корпусах, где английского больше, поэтому русские слова режутся на большее число кусочков. В нашем замере в токенизаторе GPT-4 русский текст занимал в 2,2 раза больше токенов, чем английский того же смысла, в новом o200k — примерно в 1,3 раза.
Почему исходящие токены дороже входящих?
Входящий текст модель обрабатывает целиком за один проход, а ответ порождает по одному токену, и каждый требует отдельного шага вычислений. Поэтому у большинства провайдеров выход дороже входа — у Anthropic в 5 раз. Короткие структурированные ответы заметно экономят бюджет.
Сколько стоит нейросеть для бизнеса в месяц через API?
Зависит от объёма, но для типичных задач малого бизнеса — сотни или тысячи рублей. Например, разбор 1000 писем в месяц по 2300 токенов на письмо стоит около 1840 ₽ на YandexGPT Pro 5.1 и около $7 на Claude Sonnet 5 по тарифам сентября 2026 года.
Как сэкономить токены?
Отправлять модели только нужные фрагменты документов, выбирать младшую модель для простых задач, ограничивать длину ответа, использовать кэширование повторяющихся инструкций и пакетную обработку для несрочных задач. В чате — начинать новый разговор вместо бесконечно длинного.

Хотите посчитать стоимость нейросети в своём процессе?

Прежде чем запускать бота или автоматизацию, полезно знать, сколько она будет стоить в месяц и какая модель подходит по качеству и хранению данных. В «Термос Беспалова» считаем это на ваших реальных данных до начала разработки.

Получить консультацию

Пн–Вс, 10:00–20:00. Отвечаю лично.