Что такое токены в нейросети простыми словами и на примерах

Что такое токены в нейросети и зачем они нужны

Токен — это кусочек текста, которым нейросеть измеряет всё, что вы ей пишете. Чаще всего это не целое слово, а его часть, знак или пробел. Когда в чате кончается лимит или сервис пишет «недостаточно токенов», посчитаны именно они.

Перед отправкой в модель текст проходит через токенизатор: он режет слова и знаки на такие кусочки и заменяет их числами. Разберём простыми словами, как это устроено, почему русский текст дороже английского и за что вы на самом деле платите.

Вот как токенизатор видит одну фразу:

Цветные плашки — это токены. В русской строке их 18, в английской — 13, хотя английская строка длиннее на пять символов.

Все разбиения в статье посчитаны словарём o200k_base — им пользуются актуальные модели OpenAI. У Claude и Gemini словари свои, числа получатся немного другими.

Сколько токенов в вашем тексте

Вставьте любой текст и посмотрите, на какие части его разделит токенизатор.

Токенизатор
0 токенов · 0 символов · 0 слов

Здесь появятся цветные плашки токенов.

Словарь o200k_base

Почему токен не равен слову

В русской фразе слово «Съешь» разделилось на три токена: Съешь, а «мягких», «французских», «булок», «выпей» и «чаю» заняли по два. А  ещё и  этих уместились в один токен каждое — вместе с пробелом впереди.

Токенизатор ничего не знает про корни и окончания. Он ищет в словаре куски написания, которые чаще всего встречались в текстах, поэтому граница проходит там, где вы бы её никогда не поставили.

Пробел для токенизатора — такой же символ, как буква или запятая. Он часто приклеивается к следующему слову: ещё в начале строки и  ещё внутри предложения могут быть разными элементами словаря.

С числами единого правила тоже нет: 2026, 203.0.113.42 и 8 800 555-35-35 делятся на части разного размера. В ссылках и эмодзи границы тоже не совпадают с тем, что вы считаете одним знаком.

Оценка «один токен — примерно четыре английских символа» годится для прикидки большого английского текста. Для русского ориентир свой: примерно 3–4 символа на токен, то есть страница обычного текста — порядка 500 токенов. Для прикидки хватит. Для точного счёта — нет: его даёт только токенизатор конкретной модели.

Блог Молянов

Молянов

Verified

Каждый день я использую нейронки в бизнесе, разработке, маркетинге и пиаре. Собираю с их помощью разные прикольные штуки — например, этот самый сайт. О своем опыте рассказываю в телеграм-канале. Будет здорово, если вы подпишетесь!

Как работает токенизатор и откуда берутся токены

У токенизатора есть словарь, но внутри лежат не слова с определениями, а куски написания: клиент, кли, ент, точка, запятая и тысячи других последовательностей. У каждого куска свой номер.

Зачем куски, а не целые слова? Если кормить модель по одной букве, даже короткая фраза растянется в неподъёмную цепочку. Если хранить только целые слова, придётся отдельно записать «булка», «булки», «булок», «булками», каждую фамилию и каждую опечатку. Словарь из кусков решает обе проблемы: частое хранится целиком, редкое собирается из мелких деталей.

Собирают словарь заранее, на огромном массиве текстов. Самый ходовой алгоритм — BPE, byte pair encoding: он начинает с очень мелких частей, находит частые соседние пары и склеивает их. После множества проходов частые сочетания становятся отдельными токенами. У WordPiece и SentencePiece правила другие, но идея та же.

Дальше словарь идёт в комплекте с моделью и не меняется. Во время разговора токенизатор не придумывает новых токенов — он раскладывает ваш текст готовыми кусками. Незнакомое слово, имя или опечатку он тоже соберёт, из самых мелких кусочков. Просто их будет больше.

Что нейросеть делает с токенами

После разбиения фраза превращается в последовательность чисел вроде 1234891472056. В номере не записано определение слова. Модель разворачивает его в вектор — набор чисел, в котором закодировано, с какими кусками этот токен обычно встречается в текстах.

Порядок модель тоже учитывает. Во фразах «собака укусила человека» и «человек укусил собаку» одни и те же слова, но кто кого укусил — противоположное.

Дальше модель повторяет одно действие: смотрит на всю цепочку и прикидывает следующий токен. Если продолжать фразу из первого примера, после «да выпей» следующим может стать ч, затем аю и точка. Каждый выбранный токен дописывается к тексту, и расчёт запускается заново.

От фразы до следующего токена
«Съешь ещё этих мягких французских булок, да выпей…»
Токенизатор режет фразу на токены
Съешь ещё этих мягких французских булок, да выпей
Модель получает их номера из словаря
30433078402835513050592844521231212112424361178532533114587160362527
И дописывает ответ — по одному токену за шаг
ч1848
аю49607
.13

Получилось: «…да выпей чаю.»

Токены нужны и на входе, и на выходе. Модель получает токены запроса и генерирует токены ответа, а приложение прогоняет их через токенизатор в обратную сторону и склеивает в привычный текст. Поэтому ответ появляется на экране постепенно — вы буквально видите, как он растёт кусок за куском.

Отсюда же разница в скорости. Запрос модель обрабатывает целиком, а ответ пишет по одному токену, поэтому десять лишних абзацев ответа заметнее по времени, чем десять лишних абзацев инструкции.

На похожем принципе работает простой генератор из статьи про цепи Маркова: он тоже выбирает продолжение по предыдущему тексту. Современная модель учитывает гораздо больше контекста, но ответ всё равно собирается по одному токену.

Почему русский текст часто занимает больше токенов

В первом блоке английские Eat, soft, French, rolls и tea поместились в отдельные токены. Русские «Съешь», «мягких», «французских», «булок» и «чаю» пришлось собирать из частей.

Дело в обучающих текстах: английского в них было в разы больше, поэтому алгоритм успел склеить частые английские сочетания в крупные токены. Русские формы такой частоты не набрали и остались наборами коротких кусков. Вдобавок у русского слова десяток форм: «булка», «булки», «булок» и «булками» для токенизатора — четыре разные последовательности символов.

Но разница меняется от фразы к фразе. Бывает почти паритет — русский и английский варианты занимают одинаковое количество токенов:

А бывает, что русский заметно дороже — 24 токена против 15, на 60% больше:

Переходить из-за этого на английские промпты не стоит. В обычном чате экономия копеечная, а точность формулировки теряется. Смысл появляется только на больших объёмах через API — и то если ответ вам тоже нужен английский: русский ответ модель всё равно напишет русскими токенами, а он обычно длиннее запроса.

Что такое контекстное окно и почему нейросеть забывает начало разговора

Контекстное окно — это сколько токенов модель держит перед глазами за одно обращение. Что не поместилось, для неё не существует.

В окно попадает не только последнее сообщение. Приложение отправляет модели системные правила, историю разговора, прикреплённый файл, результаты поиска, текущий вопрос — и оставляет место для ответа. Короткое «ок» в длинном чате уходит модели вместе с десятками предыдущих сообщений.

Размер окна у современных моделей — сотни тысяч токенов, у самых больших — до миллиона. Звучит как бесконечность, но раздаётся быстро: договор на сто страниц — уже порядка 50 000 токенов. И если вы прикрепили его к чату и задали десять вопросов, приложение может отправлять весь текст заново при каждом обращении.

Когда место кончается, приложение выкручивается как умеет: удаляет начало разговора, сжимает старую историю или не принимает запрос. Со стороны это выглядит как «нейросеть забыла, о чём мы договаривались» — начало просто вытеснили из окна. Лечится новым чатом: начните его и вставьте в первое сообщение короткую сводку договорённостей вместо всей переписки.

Ответ тоже требует места. У провайдера обычно два лимита: размер окна и отдельный потолок на длину ответа, заметно меньше первого. Если ответ оборвался на полуслове — вы упёрлись во второй. Напишите «продолжи ровно с места обрыва» или разбейте задачу на части.

Читайте такжеДва правила работы с ИИ-агентами: контекст и самопроверкаКак держать контекст в порядке, чтобы модель не тупила на длинных задачах.

Как токены влияют на стоимость

В ChatGPT, Claude или Gemini вы платите за подписку и не видите цену каждого сообщения. Другое дело API — прямой доступ к модели из программы, бота или сайта, мимо чата. Там провайдер считает каждый токен.

Входные токены — всё, что приложение отправило модели: инструкция, история чата, документ и сам вопрос. Выходные — видимый ответ и, у рассуждающих моделей, токены рассуждения: тот самый блок «думает», который модель пишет для себя перед ответом. Он тоже оплачивается.

В поле ввода может быть десять слов, а на входе — тысячи токенов из-за истории и системной инструкции. Стоимость считают по отчёту провайдера; длина сообщения на экране — только часть картины.

Формула простая:

стоимость = входные токены ÷ 1 000 000 × ставка входа + выходные токены ÷ 1 000 000 × ставка выхода.

Возьмём GPT-5.6 Luna, недорогую рабочую модель OpenAI. По ставкам на 23 августа 2026 года вход стоит $0,20 за миллион токенов, выход — $1,20:

  • 500 входных токенов — $0,0001;
  • 300 выходных — $0,00036;
  • один запрос — $0,00046;
  • тысяча запросов — $0,46.

По этому тарифу 300 выходных токенов дороже 500 входных: у большинства моделей выход стоит в несколько раз больше входа. На очень длинных запросах — у Luna это больше 272 000 входных токенов — действует повышенный тариф. Актуальные ставки смотрите на странице тарифов OpenAI; у Anthropic и Google прайсы свои.

Некоторые приложения называют «токенами» собственные баллы — внутреннюю валюту сервиса. Она списывается по курсу, который назначает сам сервис, и с токенами модели не совпадает один к одному. Отличить просто: у токенов модели цена указана за миллион входных и выходных, у баллов — пакеты вроде «5000 токенов за 490 ₽». Перед оплатой выясните, что именно списывается за один запрос.

Как уменьшить расход токенов

Сокращать сам промпт по слову бессмысленно: пять токенов из тысячи погоды не делают, а телеграфный запрос без деталей обернётся переделками. Основной расход в другом.

  • Старая история. Начинайте новый чат, когда меняется тема: длинный чат дорожает сам по себе, даже если вы пишете короткие реплики.
  • Документы. Прикладывайте нужную главу вместо всего файла — вложение уходит модели заново с каждым вопросом. Десять вопросов по договору дешевле задать одним сообщением списком.
  • Длина ответа. Просите нужный формат и объём: «тезисно, до 10 пунктов». Выход дороже входа и дольше пишется.
  • Для API — кэширование. Повторяющееся начало запроса, например длинную системную инструкцию, провайдер может считать по сниженной ставке, если оно совпадает от запроса к запросу.
  • Для API — лимит ответа. Ограничивайте max_output_tokens под задачу и сверяйте фактический расход по usage.

Как узнать точное количество токенов

Для быстрой прикидки хватит токенизатора в начале этой статьи — он считает словарём o200k_base. Для расчёта бюджета берите инструмент той модели, которую будете вызывать: словари у всех свои, и один и тот же абзац GPT, Claude и Gemini разделят по-разному.

Если вы вызываете модель через API, фактический расход возвращается в объекте usage: отдельно input_tokens, output_tokens и сумма total_tokens. Цифра почти всегда выше, чем вы насчитали по видимому тексту: приложение подмешивает системную инструкцию и описания инструментов.

Главное о токенах

Нейросеть читает текст не буквами и не словами, а токенами — кусками, на которые его режет токенизатор. Модель работает с номерами этих кусков и пишет ответ по одному токену за раз. Поэтому количество токенов не совпадает ни со словами, ни с символами, а русский текст обычно выходит дороже английского: русские слова собираются из нескольких кусков.

Все ограничения нейросетей растут из одного правила: история чата, приложенные файлы, ваш вопрос и будущий ответ делят одно контекстное окно. Когда оно переполняется, модель «забывает» начало разговора. А в API каждый входной и выходной токен превращается в деньги, причём выход обычно дороже входа.

Поэтому экономить стоит не на длине промпта, а на том, что уезжает к модели вместе с ним: на старой истории, лишних документах и слишком длинных ответах. Точное число токенов для любого текста покажет токенизатор в начале статьи.

Читайте такжеЧто такое ИИ-агент — простыми словами и на живых примерахЧто происходит, когда модель не просто отвечает, а сама делает задачу по шагам.

Частые вопросы

Что значит «недостаточно токенов»?

Одно из трёх: запрос не влез в контекстное окно (начните новый чат, приложите фрагмент вместо целого файла), ответ упёрся в лимит генерации (попросите продолжить с места обрыва) или кончился баланс тарифа — подписка, API или внутренние баллы сервиса.

Можно ли пользоваться нейросетью без токенов?

Нет. Токены — способ, которым модель читает любой текст. В бесплатном чате они тоже тратятся, просто счёт оплачивает сервис.

Где взять бесплатные токены?

В бесплатных лимитах самих сервисов: у ChatGPT, Claude, Gemini и большинства агрегаторов есть бесплатный уровень с ограничением по количеству сообщений или объёму. «Бесплатные токены» сверх этого — обычно маркетинг внутренних баллов.

Где купить токены и чем подписка отличается от API?

Подписка — фиксированная цена за месяц работы в чате, токены отдельно покупать не нужно. API — оплата по факту за входные и выходные токены, включается в кабинете разработчика. У агрегаторов «токены» чаще всего означают внутренние баллы по курсу сервиса.

Сколько символов в одном токене?

В русском — примерно 3–4 символа, в английском — около пяти. Это средняя температура по больнице: точное число для своего текста быстрее узнать в токенизаторе выше.

Почему нейросеть забывает начало разговора?

Длинный чат перестаёт помещаться в контекстное окно, и приложение выбрасывает или сжимает старые сообщения. Начните новый чат и перенесите туда короткую сводку договорённостей.

Паша Молянов

Паша Молянов

Автор блога

Основатель агентства «Сделаем» и Нейроцеха. Руковожу двумя удалёнными командами, запускаю соло-проекты без сотрудников. Нейроэнтузиаст — каждый день пытаюсь что-нибудь автоматизировать с помощью ИИ. Написал книгу про менеджмент. Рассказываю про свой опыт в Телеграм-канале.

Блог Молянов

Молянов

Verified

Каждый день я использую нейронки в бизнесе, разработке, маркетинге и пиаре. Собираю с их помощью разные прикольные штуки — например, этот самый сайт. О своем опыте рассказываю в телеграм-канале. Будет здорово, если вы подпишетесь!

Ещё про AI, бизнес, менеджмент и маркетинг.

Что такое ИИ-агент и как он работает
AI

Что такое ИИ-агент и как он работает

ИИ-агент сам планирует шаги, пользуется программами и доводит задачу до результата. Разбираю, как это устроено, что агентам уже можно доверять, а что рано.

Вайбкодинг: что это и как он работает
AI

Вайбкодинг: что это и как он работает

Вайбкодинг — это когда вы объясняете задачу ИИ обычными словами, а он сам пишет код. Разбираю, как это работает и что реально можно сделать без программиста.