
Что такое токены в нейросети и зачем они нужны
Токен — это кусочек текста, которым нейросеть измеряет всё, что вы ей пишете. Чаще всего это не целое слово, а его часть, знак или пробел. Когда в чате кончается лимит или сервис пишет «недостаточно токенов», посчитаны именно они.
Перед отправкой в модель текст проходит через токенизатор: он режет слова и знаки на такие кусочки и заменяет их числами. Разберём простыми словами, как это устроено, почему русский текст дороже английского и за что вы на самом деле платите.
Вот как токенизатор видит одну фразу:
Цветные плашки — это токены. В русской строке их 18, в английской — 13, хотя английская строка длиннее на пять символов.
Все разбиения в статье посчитаны словарём o200k_base — им пользуются актуальные модели OpenAI. У Claude и Gemini словари свои, числа получатся немного другими.
Сколько токенов в вашем тексте
Вставьте любой текст и посмотрите, на какие части его разделит токенизатор.
Здесь появятся цветные плашки токенов.
Словарь o200k_base
Почему токен не равен слову
В русской фразе слово «Съешь» разделилось на три токена: Съешь, а «мягких», «французских», «булок», «выпей» и «чаю» заняли по два. А ещё и этих уместились в один токен каждое — вместе с пробелом впереди.
Токенизатор ничего не знает про корни и окончания. Он ищет в словаре куски написания, которые чаще всего встречались в текстах, поэтому граница проходит там, где вы бы её никогда не поставили.
Пробел для токенизатора — такой же символ, как буква или запятая. Он часто приклеивается к следующему слову: ещё в начале строки и ещё внутри предложения могут быть разными элементами словаря.
С числами единого правила тоже нет: 2026, 203.0.113.42 и 8 800 555-35-35 делятся на части разного размера. В ссылках и эмодзи границы тоже не совпадают с тем, что вы считаете одним знаком.
Оценка «один токен — примерно четыре английских символа» годится для прикидки большого английского текста. Для русского ориентир свой: примерно 3–4 символа на токен, то есть страница обычного текста — порядка 500 токенов. Для прикидки хватит. Для точного счёта — нет: его даёт только токенизатор конкретной модели.
Молянов
Каждый день я использую нейронки в бизнесе, разработке, маркетинге и пиаре. Собираю с их помощью разные прикольные штуки — например, этот самый сайт. О своем опыте рассказываю в телеграм-канале. Будет здорово, если вы подпишетесь!
Как работает токенизатор и откуда берутся токены
У токенизатора есть словарь, но внутри лежат не слова с определениями, а куски написания: клиент, кли, ент, точка, запятая и тысячи других последовательностей. У каждого куска свой номер.
Зачем куски, а не целые слова? Если кормить модель по одной букве, даже короткая фраза растянется в неподъёмную цепочку. Если хранить только целые слова, придётся отдельно записать «булка», «булки», «булок», «булками», каждую фамилию и каждую опечатку. Словарь из кусков решает обе проблемы: частое хранится целиком, редкое собирается из мелких деталей.
Собирают словарь заранее, на огромном массиве текстов. Самый ходовой алгоритм — BPE, byte pair encoding: он начинает с очень мелких частей, находит частые соседние пары и склеивает их. После множества проходов частые сочетания становятся отдельными токенами. У WordPiece и SentencePiece правила другие, но идея та же.
Дальше словарь идёт в комплекте с моделью и не меняется. Во время разговора токенизатор не придумывает новых токенов — он раскладывает ваш текст готовыми кусками. Незнакомое слово, имя или опечатку он тоже соберёт, из самых мелких кусочков. Просто их будет больше.
Что нейросеть делает с токенами
После разбиения фраза превращается в последовательность чисел вроде 1234891472056. В номере не записано определение слова. Модель разворачивает его в вектор — набор чисел, в котором закодировано, с какими кусками этот токен обычно встречается в текстах.
Порядок модель тоже учитывает. Во фразах «собака укусила человека» и «человек укусил собаку» одни и те же слова, но кто кого укусил — противоположное.
Дальше модель повторяет одно действие: смотрит на всю цепочку и прикидывает следующий токен. Если продолжать фразу из первого примера, после «да выпей» следующим может стать ч, затем аю и точка. Каждый выбранный токен дописывается к тексту, и расчёт запускается заново.
Получилось: «…да выпей чаю.»
Токены нужны и на входе, и на выходе. Модель получает токены запроса и генерирует токены ответа, а приложение прогоняет их через токенизатор в обратную сторону и склеивает в привычный текст. Поэтому ответ появляется на экране постепенно — вы буквально видите, как он растёт кусок за куском.
Отсюда же разница в скорости. Запрос модель обрабатывает целиком, а ответ пишет по одному токену, поэтому десять лишних абзацев ответа заметнее по времени, чем десять лишних абзацев инструкции.
На похожем принципе работает простой генератор из статьи про цепи Маркова: он тоже выбирает продолжение по предыдущему тексту. Современная модель учитывает гораздо больше контекста, но ответ всё равно собирается по одному токену.
Почему русский текст часто занимает больше токенов
В первом блоке английские Eat, soft, French, rolls и tea поместились в отдельные токены. Русские «Съешь», «мягких», «французских», «булок» и «чаю» пришлось собирать из частей.
Дело в обучающих текстах: английского в них было в разы больше, поэтому алгоритм успел склеить частые английские сочетания в крупные токены. Русские формы такой частоты не набрали и остались наборами коротких кусков. Вдобавок у русского слова десяток форм: «булка», «булки», «булок» и «булками» для токенизатора — четыре разные последовательности символов.
Но разница меняется от фразы к фразе. Бывает почти паритет — русский и английский варианты занимают одинаковое количество токенов:
А бывает, что русский заметно дороже — 24 токена против 15, на 60% больше:
Переходить из-за этого на английские промпты не стоит. В обычном чате экономия копеечная, а точность формулировки теряется. Смысл появляется только на больших объёмах через API — и то если ответ вам тоже нужен английский: русский ответ модель всё равно напишет русскими токенами, а он обычно длиннее запроса.
Что такое контекстное окно и почему нейросеть забывает начало разговора
Контекстное окно — это сколько токенов модель держит перед глазами за одно обращение. Что не поместилось, для неё не существует.
Не поместилось — для модели этого больше нет
В окно попадает не только последнее сообщение. Приложение отправляет модели системные правила, историю разговора, прикреплённый файл, результаты поиска, текущий вопрос — и оставляет место для ответа. Короткое «ок» в длинном чате уходит модели вместе с десятками предыдущих сообщений.
Размер окна у современных моделей — сотни тысяч токенов, у самых больших — до миллиона. Звучит как бесконечность, но раздаётся быстро: договор на сто страниц — уже порядка 50 000 токенов. И если вы прикрепили его к чату и задали десять вопросов, приложение может отправлять весь текст заново при каждом обращении.
Когда место кончается, приложение выкручивается как умеет: удаляет начало разговора, сжимает старую историю или не принимает запрос. Со стороны это выглядит как «нейросеть забыла, о чём мы договаривались» — начало просто вытеснили из окна. Лечится новым чатом: начните его и вставьте в первое сообщение короткую сводку договорённостей вместо всей переписки.
Ответ тоже требует места. У провайдера обычно два лимита: размер окна и отдельный потолок на длину ответа, заметно меньше первого. Если ответ оборвался на полуслове — вы упёрлись во второй. Напишите «продолжи ровно с места обрыва» или разбейте задачу на части.
Читайте такжеДва правила работы с ИИ-агентами: контекст и самопроверкаКак держать контекст в порядке, чтобы модель не тупила на длинных задачах.Как токены влияют на стоимость
В ChatGPT, Claude или Gemini вы платите за подписку и не видите цену каждого сообщения. Другое дело API — прямой доступ к модели из программы, бота или сайта, мимо чата. Там провайдер считает каждый токен.
Входные токены — всё, что приложение отправило модели: инструкция, история чата, документ и сам вопрос. Выходные — видимый ответ и, у рассуждающих моделей, токены рассуждения: тот самый блок «думает», который модель пишет для себя перед ответом. Он тоже оплачивается.
В поле ввода может быть десять слов, а на входе — тысячи токенов из-за истории и системной инструкции. Стоимость считают по отчёту провайдера; длина сообщения на экране — только часть картины.
Формула простая:
стоимость = входные токены ÷ 1 000 000 × ставка входа + выходные токены ÷ 1 000 000 × ставка выхода.
Возьмём GPT-5.6 Luna, недорогую рабочую модель OpenAI. По ставкам на 23 августа 2026 года вход стоит $0,20 за миллион токенов, выход — $1,20:
- 500 входных токенов — $0,0001;
- 300 выходных — $0,00036;
- один запрос — $0,00046;
- тысяча запросов — $0,46.
По этому тарифу 300 выходных токенов дороже 500 входных: у большинства моделей выход стоит в несколько раз больше входа. На очень длинных запросах — у Luna это больше 272 000 входных токенов — действует повышенный тариф. Актуальные ставки смотрите на странице тарифов OpenAI; у Anthropic и Google прайсы свои.
Некоторые приложения называют «токенами» собственные баллы — внутреннюю валюту сервиса. Она списывается по курсу, который назначает сам сервис, и с токенами модели не совпадает один к одному. Отличить просто: у токенов модели цена указана за миллион входных и выходных, у баллов — пакеты вроде «5000 токенов за 490 ₽». Перед оплатой выясните, что именно списывается за один запрос.
Как уменьшить расход токенов
Сокращать сам промпт по слову бессмысленно: пять токенов из тысячи погоды не делают, а телеграфный запрос без деталей обернётся переделками. Основной расход в другом.
- Старая история. Начинайте новый чат, когда меняется тема: длинный чат дорожает сам по себе, даже если вы пишете короткие реплики.
- Документы. Прикладывайте нужную главу вместо всего файла — вложение уходит модели заново с каждым вопросом. Десять вопросов по договору дешевле задать одним сообщением списком.
- Длина ответа. Просите нужный формат и объём: «тезисно, до 10 пунктов». Выход дороже входа и дольше пишется.
- Для API — кэширование. Повторяющееся начало запроса, например длинную системную инструкцию, провайдер может считать по сниженной ставке, если оно совпадает от запроса к запросу.
- Для API — лимит ответа. Ограничивайте
max_output_tokensпод задачу и сверяйте фактический расход поusage.
Как узнать точное количество токенов
Для быстрой прикидки хватит токенизатора в начале этой статьи — он считает словарём o200k_base. Для расчёта бюджета берите инструмент той модели, которую будете вызывать: словари у всех свои, и один и тот же абзац GPT, Claude и Gemini разделят по-разному.
- OpenAI Tokenizer — без программирования, показывает границы токенов;
- Anthropic Token Counting и Google Gemini countTokens — методы для тех, кто работает через API; документация на английском.
Если вы вызываете модель через API, фактический расход возвращается в объекте usage: отдельно input_tokens, output_tokens и сумма total_tokens. Цифра почти всегда выше, чем вы насчитали по видимому тексту: приложение подмешивает системную инструкцию и описания инструментов.
Главное о токенах
Нейросеть читает текст не буквами и не словами, а токенами — кусками, на которые его режет токенизатор. Модель работает с номерами этих кусков и пишет ответ по одному токену за раз. Поэтому количество токенов не совпадает ни со словами, ни с символами, а русский текст обычно выходит дороже английского: русские слова собираются из нескольких кусков.
Все ограничения нейросетей растут из одного правила: история чата, приложенные файлы, ваш вопрос и будущий ответ делят одно контекстное окно. Когда оно переполняется, модель «забывает» начало разговора. А в API каждый входной и выходной токен превращается в деньги, причём выход обычно дороже входа.
Поэтому экономить стоит не на длине промпта, а на том, что уезжает к модели вместе с ним: на старой истории, лишних документах и слишком длинных ответах. Точное число токенов для любого текста покажет токенизатор в начале статьи.
Читайте такжеЧто такое ИИ-агент — простыми словами и на живых примерахЧто происходит, когда модель не просто отвечает, а сама делает задачу по шагам.Частые вопросы
Что значит «недостаточно токенов»?
Одно из трёх: запрос не влез в контекстное окно (начните новый чат, приложите фрагмент вместо целого файла), ответ упёрся в лимит генерации (попросите продолжить с места обрыва) или кончился баланс тарифа — подписка, API или внутренние баллы сервиса.
Можно ли пользоваться нейросетью без токенов?
Нет. Токены — способ, которым модель читает любой текст. В бесплатном чате они тоже тратятся, просто счёт оплачивает сервис.
Где взять бесплатные токены?
В бесплатных лимитах самих сервисов: у ChatGPT, Claude, Gemini и большинства агрегаторов есть бесплатный уровень с ограничением по количеству сообщений или объёму. «Бесплатные токены» сверх этого — обычно маркетинг внутренних баллов.
Где купить токены и чем подписка отличается от API?
Подписка — фиксированная цена за месяц работы в чате, токены отдельно покупать не нужно. API — оплата по факту за входные и выходные токены, включается в кабинете разработчика. У агрегаторов «токены» чаще всего означают внутренние баллы по курсу сервиса.
Сколько символов в одном токене?
В русском — примерно 3–4 символа, в английском — около пяти. Это средняя температура по больнице: точное число для своего текста быстрее узнать в токенизаторе выше.
Почему нейросеть забывает начало разговора?
Длинный чат перестаёт помещаться в контекстное окно, и приложение выбрасывает или сжимает старые сообщения. Начните новый чат и перенесите туда короткую сводку договорённостей.

Паша Молянов
Автор блога
Основатель агентства «Сделаем» и Нейроцеха. Руковожу двумя удалёнными командами, запускаю соло-проекты без сотрудников. Нейроэнтузиаст — каждый день пытаюсь что-нибудь автоматизировать с помощью ИИ. Написал книгу про менеджмент. Рассказываю про свой опыт в Телеграм-канале.
Молянов
Каждый день я использую нейронки в бизнесе, разработке, маркетинге и пиаре. Собираю с их помощью разные прикольные штуки — например, этот самый сайт. О своем опыте рассказываю в телеграм-канале. Будет здорово, если вы подпишетесь!


