31 марта 2026 года математики опубликовали статью с решениями трёх задач Эрдёша, где в abstract прямо написано: «proof is due entirely to an internal model at OpenAI». Это не оговорка — формулировка стала появляться в математических работах регулярно, и она означает, что у OpenAI есть модели, которых никто из пользователей ChatGPT никогда не увидит. Разбираемся, что это за модели, зачем компании нужна целая фабрика нейросетей вместо одной, и как разработчик может применить те же принципы — дистилляцию и scaffolding — чтобы выжать из публичных моделей больше, не дожидаясь следующего релиза.

Зачем разработчику разбираться в внутренней кухне лабораторий

Если вы строите продукт на GPT или любой другой LLM, вы регулярно упираетесь в одну и ту же дилемму: самая умная модель стоит дорого и работает медленно, а быстрая и дешёвая — тупее. Понимание того, как устроена «фабрика моделей» внутри OpenAI, DeepSeek или Google, даёт практический рецепт: тот же трюк с дистилляцией знаний доступен через публичный API, а часть возможностей, которые кажутся «секретными», на самом деле уже спрятаны в весах публичной модели — их просто нужно правильно вытащить через scaffolding.

Ниже — конкретные шаги, как это сделать, и разбор, почему DeepSeek смогла приблизиться к GPT-5 при бюджете обучения около $6 млн против $500 млн–$1 млрд у OpenAI.

Что скрывается за формулировкой «internal model»

Фронтиер-лаборатория не выпускает одну нейросеть — она строит конвейер: research-чекпоинты → экспериментальные модели → reward-модели → модели-учителя → генераторы синтетических данных → evaluators → дистиллированные студенты → production-модель. Наружу через API или чат попадает только последнее звено цепочки.

Кейсов, когда внутренняя модель OpenAI решала задачи раньше публичного релиза, набралось уже несколько:

ДатаСобытие
Февраль 2026Внутренняя модель построила новое решение задачи Эрдёша–Нешетрила–Рёдля
Март 2026Три доказательства задач Эрдёша, abstract прямо ссылается на internal model
Апрель 2026Ещё одна статья с пятью доказательствами тем же методом
ПозжеКонтрпример к 80-летней гипотезе Эрдёша о unit distances, проверен внешними математиками

W. T. Gowers, известный математик, писал, что рекомендовал бы такое доказательство к публикации в Annals of Mathematics, если бы его прислал человек. Kevin Weil из OpenAI подтвердил тренд: модели решают всё больше открытых задач по мере роста возможностей.

Как работает дистилляция знаний на практике

Дорогую research-модель не гоняют на каждом пользовательском запросе — вместо этого её делают учителем. Она генерирует качественные ответы и траектории рассуждений, а на этих данных обучается более дешёвый студент, которому не нужно воспроизводить учителя целиком.

Практика настолько распространена, что у OpenAI есть официальный Model Distillation workflow — взять ответы сильной модели (например, GPT-4o) и обучить на них модель подешевле. Схема через API выглядит так:

python
from openai import OpenAI
client = OpenAI()

# 1. Генерируем эталонные ответы сильной моделью и сохраняем их
response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": prompt}],
    store=True,
    metadata={"purpose": "distillation-dataset"}
)
bash
# 2. Запускаем fine-tuning дешёвой модели на сохранённых ответах
curl https://api.openai.com/v1/fine_tuning/jobs \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "training_file": "file-abc123",
    "model": "gpt-4o-mini",
    "method": {"type": "supervised"}
  }'

Тот же принцип использовали и другие компании: Apple обучала on-device foundation model с помощью внутреннего Mixture-of-Experts учителя, Google дистиллировала EmbeddingGemma из Gemini, Meta переносила логиты Llama 3.1 8B и 70B в компактные Llama 3.2 1B и 3B, а ранние модели Phi от Microsoft в значительной степени дистиллировали возможности GPT-4.

Важный нюанс: студент иногда обходит учителя на узкой задаче за счёт специализации и пост-трейнинга. Поэтому неверно считать весь open source «специально урезанной» копией секретных моделей — правильнее говорить, что публичный каталог моделей лаборатории почти никогда не показывает весь фронтир её возможностей.

Как DeepSeek догнала GPT-5 за $6 млн

DeepSeek выпустила линейку дистиллированных моделей от 1.5B до 70B параметров, обучив студентов на поведении R1. Но настоящий прорыв случился в версии V3.2: она достигла паритета с GPT-5 на ряде reasoning-бенчмарков при затратах на обучение около $6 млн — против оценочных $500 млн–$1 млрд у OpenAI.

ПараметрDeepSeek-V3.2Типичный флагман OpenAI
Активные параметры37 млрд из 671 млрд (MoE)Не раскрывается публично
Ключевая техникаDeepSeek Sparse AttentionПроприетарная архитектура
Оценочная стоимость обучения~$6 млн$500 млн–$1 млрд
Требуемый кластерБез необходимости в массиве H100/B200Крупные GPU-кластеры

Экономия достигается за счёт архитектуры Mixture-of-Experts, которая активирует лишь малую долю параметров на каждый токен, и разреженного внимания, снижающего вычислительную нагрузку на длинных контекстах. Это не магия и не утечка секретов OpenAI — это инженерное решение, которое можно повторить, если знать, куда смотреть.

Где спрятан потенциал уже открытых весов

Ключевой вывод из истории с задачей Эрдёша: между «внутренняя модель умеет это» и «публичная модель не умеет этого» не всегда есть жёсткая граница. Возможность уже может быть в публичных весах — она просто остаётся латентной, пока не подобраны правильный промпт, стратегия поиска, верификатор или бюджет на инференс.

Практический чек-лист, что попробовать перед тем, как переплачивать за топовую модель:

  1. Увеличьте test-time compute. Дайте модели больше шагов рассуждения или несколько попыток с последующим отбором лучшего варианта (self-consistency).
  2. Добавьте верификатор. Отдельная модель или скрипт, который проверяет промежуточный результат, часто поднимает качество сильнее, чем смена модели.
  3. Постройте scaffolding под задачу. Разбивка на подзадачи, инструменты, retrieval — всё это меняет эффективное качество ответа без изменения весов.
  4. Проверьте, не решает ли задачу уже публичная модель — прежде чем тратиться на дообучение или ждать следующий релиз.
python
# Пример простого self-consistency цикла
answers = []
for _ in range(5):
    r = client.chat.completions.create(
        model="gpt-5.5",
        messages=[{"role": "user", "content": task}],
        temperature=0.8,
    )
    answers.append(r.choices[0].message.content)

best = verifier(answers)  # своя функция-верификатор

Где ломается эта логика

Дистилляция и scaffolding — не бесплатный обед. Студент никогда не превзойдёт учителя по общей способности к обобщению, даже если выигрывает на конкретном бенчмарке — это специализация, а не рост интеллекта. Увеличение test-time compute поднимает счёт за инференс линейно или хуже, и в какой-то момент дешевле просто взять более сильную модель. А верификаторы сами могут ошибаться — если верификатор слабее задачи, self-consistency только усиливает уверенную, но неверную галлюцинацию.

Что попробовать дальше

Начните с малого: сохраните 50-100 реальных запросов пользователей вашего продукта, прогоните их через топовую модель с store=True, и посмотрите, насколько дешевле модель после fine-tuning справляется с той же задачей. Параллельно попробуйте на текущей модели добавить один шаг верификации перед выдачей ответа — часто это дешевле, чем апгрейд модели, и даёт сопоставимый прирост качества.

FAQ

Что такое «internal model at OpenAI» в математических статьях?

Это модель, которой OpenAI пользуется внутри компании до публичного релиза. Несколько математических работ 2026 года прямо указывают её как автора доказательства — например, решений задач Эрдёша.

Значит ли это, что публичный ChatGPT — урезанная версия?

Не совсем. Публичная production-модель оптимизируется под другие метрики — latency, стоимость, надёжность, safety — а не только под чистые возможности, как research-модель. Это разные цели оптимизации, а не намеренное урезание.

Как работает дистилляция моделей на практике?

Сильная модель генерирует качественные ответы или траектории рассуждений, а на этих данных обучается модель поменьше через supervised fine-tuning. OpenAI предоставляет официальный workflow для этого через API.

Почему DeepSeek смогла обучить модель за $6 млн?

За счёт архитектуры Mixture-of-Experts с активацией всего 37 млрд параметров из 671 млрд и техники DeepSeek Sparse Attention, снижающей вычисления на длинных контекстах — без необходимости в огромных GPU-кластерах.

Можно ли получить возможности «секретной» модели на публичной?

Иногда да. История с гипотезой Эрдёша показала, что похожий результат удалось получить и из публичной GPT-5.5 — при правильном scaffolding, верификаторе и достаточном бюджете на инференс.

Источники