# ttok 1.0: новый токенизатор для GPT‑5/6 и как им пользоваться
Каноническая страница: https://plainews.ru/posts/ttok-1-0-tokenizer-gpt5
Опубликовано: 2026-10-09T11:00:57.663Z

Simon Willison выпустил ttok 1.0, заменив дефолтный токенизатор GPT‑4 на GPT‑5/6. Узнайте, что изменилось, как установить, кто получит выгоду и какие ограничения остаются.
Simon Willison объявил о выпуске **ttok 1.0**, поправив дефолтный токенизатор с GPT‑4 на GPT‑5/6. Переключение стало поводом для «мейджор‑релиза», потому что модели GPT‑5 и GPT‑6 используют иной набор токенов, а прежняя версия ttok 0.4 автоматически выбирала устаревший вариант. Теперь разработчики могут рассчитывать на корректный подсчёт токенов без ручных переключений.

## Почему смена токенизатора важна

Токенизация – фундаментальная часть работы LLM: каждый запрос разбивается на токены, а лимиты модели считаются именно по ним. Если использовать токенизатор GPT‑4 для GPT‑5/6, количество токенов будет завышено, что приводит к преждевременному исчерпанию лимита и завышенной стоимости. Переключение дефолта в ttok 1.0 устраняет эту «потерю» и делает расчёт более предсказуемым.

## Что внутри ttok 1.0

ttok 1.0 – небольшая утилита на Python, обёртка над библиотекой tiktoken. Основное изменение — в файле конфигурации задано default_model="gpt-5"; при отсутствии явного указания модель автоматически использует токенизатор GPT‑5/6. Кроме того, в релизе добавлен набор **31 фикстуры** (тестовые строки) для быстрой проверки совместимости. По результатам эксперимента Уильяма Лю, все семь моделей (5.5, 5.6 Sol/Terra/Luna, 6 Astra/Sol/Luna) выдают одинаковый размер словаря — 44 794 токена и совпадают по каждому из фикстур.

```bash
# установка
pip install ttok==1.0

# базовый пример
ttok count "Привет, мир!" --model gpt-5
```

## Как установить и использовать

Установка происходит через pip. После установки команда ttok доступна в терминале. По умолчанию она берёт токенизатор GPT‑5, но пользователь может переопределить модель через флаг --model. Вывод включает количество токенов, список токенов и их индексы, что удобно для отладки запросов к API OpenAI. Инструмент также поддерживает чтение из файлов и пайпинг, что упрощает интеграцию в CI‑скрипты.

| действие | команда | результат |
| --- | --- | --- |
| подсчёт строки | `ttok count "Текст"` | `5 токенов` |
| токенизировать файл | `cat input.txt \ | ttok count` |
| указать модель явно | `ttok count "Текст" --model gpt-4` | токены по GPT‑4 |

## Кому это нужно на практике

- **Разработчикам API‑приложений**, которые уже мигрируют с GPT‑4 на GPT‑5/6, – ttok избавит от необходимости менять конфиги каждый раз.
- **Исследователям**, сравнивающим эффективность разных моделей, – единый токенизатор гарантирует, что сравнение происходит «по‑одному».
- **Командам DevOps**, автоматизирующим проверку лимитов в пайплайнах CI/CD, – фиксированный дефолт упрощает скрипты и уменьшает количество «мутных» багов.

## Ограничения и чего в релизе нет

OpenAI официально не подтвердил, что GPT‑6 использует тот же токенизатор, что и GPT‑5. В репозитории ttok есть открытая «angry issue», где пользователи требуют официального подтверждения. Пока подтверждения нет, ttok 1.0 полагается на эксперимент Уильяма Лю, который показал совпадение токенов на тестовом корпусе, но не покрывает все возможные сценарии ввода. Кроме того, утилита пока не поддерживает кастомные токенизаторы сторонних провайдеров (Claude, Gemini) и не умеет работать с бинарными форматами входных данных.

> **Важно.** Если ваш проект использует GPT‑6 в продакшене, рекомендуется периодически проверять официальные обновления OpenAI и сравнивать результаты ttok с реальными ответами API, чтобы убедиться в отсутствии отклонений.

## Что попробовать в следующий раз

- **Интеграция с `openai`‑клиентом**: оберните вызовы openai.ChatCompletion.create в функцию, которая сначала считает токены через ttok и проверяет, не превысит ли лимит.
- **Тестирование на собственных корпусах**: добавьте свои фикстуры в файл ttok_fixtures.json, чтобы убедиться, что токенизатор стабилен на специфических доменах (юридические тексты, код).
- **Обратная связь в репозиторий**: если обнаружите расхождения между токенами ttok и реальными подсчётами OpenAI, откройте issue – это поможет ускорить официальное подтверждение от OpenAI.

## FAQ

### Как быстро проверить, какой токенизатор использует моя модель?

Выполните ttok info --model <model_name> – утилита выведет название токенизатора и размер словаря.

### Можно ли задать свой словарь токенов?

На данный момент ttok поддерживает только встроенные токенизаторы tiktoken. Добавление кастомных словарей планируется в будущих версиях.

### Что делать, если токенов в запросе больше лимита модели?

Разбейте текст на части, используя ttok split с параметром --max-tokens, затем отправляйте части последовательно.

### Почему ttok 1.0 не меняет токенизатор для GPT‑4?

Токенизатор GPT‑4 остаётся отдельным и несовместим с GPT‑5/6. Для обратной совместимости ttok оставляет возможность явно указать --model gpt-4.

## Источники

- Simon Willison: ttok 1.0
