# Яндекс открыл 80B-модель, которая бьёт DeepSeek при 3B активных параметрах — как её запустить
Каноническая страница: https://plainews.ru/posts/aliceai-foundation-80b-a3b-base-guide
Опубликовано: 2026-09-21T11:01:30.768Z

Яндекс открыл 80B MoE-модель с 3B активных параметров. Как скачать, запустить и выбрать формат данных для файнтюнинга — пошаговый гайд.
Яндекс выложил веса AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0 — первой своей базовой модели, обученной полностью с нуля, без заимствования весов сторонних опенсорс-проектов. При 80 млрд общих параметрах модель активирует только 3 млрд на каждый токен, что делает инференс дешевле, чем у большинства конкурентов сопоставимого качества. Если вы выбираете базу для посттрейнинга или просто хотите поэкспериментировать с сильным русскоязычным претрейном — вот с чего начать.

## Что внутри модели и почему цифры не обманывают

Архитектура — MoE (Mixture of Experts, смесь экспертов): 512 экспертов в каждом слое, из которых на один токен активируется лишь небольшое подмножество, обеспечивающее те самые 3B активных параметров. Контекстное окно — 262 144 токена, что перекрывает большинство задач с длинными документами.

Обучение шло на 18 трлн токенов. Корпус включает веб, математику, код, юридические и медицинские тексты, reasoning-трейсы и агентские взаимодействия с инструментами. Последнее — принципиальный момент: агентские данные добавили уже в претрейн, а не только в посттрейн, и это заметно улучшило агентские бенчмарки после дообучения.

На WikiWebFacts (фактологический бенчмарк с акцентом на русский язык) модель набирает 86.5 балла против 83.2 у DeepSeek-V4-Flash-Base (284B-13B) и 62.4 у Qwen3.5-35B-A3B-Base. На IMO AnswerBench и LiveCodeBench — лидирует среди сравниваемых открытых претрейнов.

## Как скачать модель

Модель опубликована на Hugging Face под именем yandex/AliceAI-Foundation-80B-A3B-Base. Для загрузки понадобится huggingface_hub или transformers.

```bash
pip install huggingface_hub
huggingface-cli download yandex/AliceAI-Foundation-80B-A3B-Base --local-dir ./aliceai-80b
```

Или через Python напрямую:

```python
from huggingface_hub import snapshot_download

snapshot_download(
    repo_id="yandex/AliceAI-Foundation-80B-A3B-Base",
    local_dir="./aliceai-80b"
)
```

> **К сведению.** Полный чекпоинт весит несколько десятков гигабайт. Убедитесь, что на диске достаточно места, и используйте флаг `--resume-download` при обрывах соединения.

## Как запустить инференс

Для базового запуска подойдёт transformers. Модель — MoE, поэтому для комфортной работы нужна видеопамять под активные параметры плюс запас под KV-кэш. На практике достаточно одного A100 80GB или двух A40 при использовании device_map="auto".

```python
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_path = "./aliceai-80b"

tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(
    model_path,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

inputs = tokenizer("Объясни теорему Пифагора простыми словами:", return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
```

Для продакшн-инференса с батчингом и большим контекстом рекомендуется vLLM — он поддерживает MoE и длинные контексты эффективнее, чем наивный generate.

```bash
pip install vllm
vllm serve ./aliceai-80b --dtype bfloat16 --max-model-len 32768
```

> **Важно.** Полный контекст 262 144 токена требует значительного объёма VRAM под KV-кэш. Для экспериментов ограничьте `--max-model-len` до 32768 или 65536.

## Какой формат данных выбрать для файнтюнинга

Яндекс публикует рекомендации по формату данных для посттрейна вместе с техническим отчётом. Базовая модель — претрейн без instruction-тюнинга, поэтому перед использованием в диалоговых сценариях её нужно дообучить.

Несколько принципов, которые команда Яндекса вынесла из собственных экспериментов:

- **Фактологический домен требует аугментаций.** Простое добавление QA-пар без вариации формата и семантического контекста даёт слабый прирост. Нужны перефразировки и разные шаблоны вопросов.
- **Reasoning-трейсы важны, но недостаточны для агентов.** Если цель — агентское поведение, добавляйте в обучающий корпус взаимодействия с инструментами (CRUD-сценарии, поисковые вызовы, SWE-задачи), а не только цепочки рассуждений.
- **Loss на валидации плохо предсказывает качество на бенчмарках.** Ориентируйтесь на целевые метрики, а не только на перплексию.

Минимальный пример конфига для SFT через trl:

```python
from trl import SFTConfig

training_args = SFTConfig(
    output_dir="./aliceai-sft",
    per_device_train_batch_size=1,
    gradient_accumulation_steps=8,
    num_train_epochs=1,
    bf16=True,
    max_seq_length=4096,
    dataset_text_field="text",
    logging_steps=10,
)
```

## Где ломается и что учесть

**Нестабильность MoE-активаций.** В ходе обучения с нуля команда столкнулась с тем, что после пересчёта гиперпараметров по scaling laws активации MoE начали расти, а затем резко вырос loss. Если вы дообучаете модель с нестандартными learning rate или batch size — следите за нормой активаций, а не только за loss.

**Scaling laws не всегда переносятся.** Рецепты, работавшие при инициализации из опенсорс-весов, пришлось переработать для длинного претрейна с нуля. Не переносите гиперпараметры из чужих репортов слепо.

**Loss на отложенной выборке — плохой ориентир.** Яндекс прямо пишет об этом в отчёте: модель с лучшим validation loss проигрывала на целевых бенчмарках. Строите пайплайн оценки — закладывайте downstream-метрики с самого начала.

**Контекст 262K — не бесплатный.** KV-кэш на полном окне требует десятков гигабайт памяти. Для большинства задач достаточно 32K–64K.

## Что попробовать дальше

Вместе с моделью Яндекс открыл два русскоязычных бенчмарка — **WikiWebFacts** и **HardMultiQA** — с протоколами оценки. Это готовая инфраструктура для измерения фактологического качества ваших дообученных версий. Технический отчёт содержит абляционные эксперименты по архитектуре (Gated RMSNorm, Z-Loss, Muon, Kimi Delta Attention) — полезное чтение перед тем, как менять что-то в архитектуре при собственном претрейне.

Следующий шаг от Яндекса — единая рассуждающая модель (ЕРМ) на базе этого претрейна, которая станет ядром агентских возможностей Алисы AI.

---

## FAQ

### Можно ли использовать AliceAI-Foundation-80B-A3B-Base в коммерческих проектах?

Да. Модель выпущена под лицензией Apache 2.0, которая разрешает коммерческое использование, модификацию и распространение без ограничений по типу продукта.

### Сколько VRAM нужно для инференса?

Для комфортного инференса с контекстом до 32K достаточно одного GPU с 80 ГБ памяти (например, A100 80GB). При использовании device_map="auto" модель распределяется на несколько карт. Полный контекст 262K токенов потребует значительно больше памяти под KV-кэш.

### Это инструктированная модель или только базовый претрейн?

Только базовый претрейн. Модель не оптимизирована для диалога и не следует инструкциям в привычном смысле. Для продуктовых сценариев необходим SFT или RLHF поверх этих весов.

### Чем AliceAI-Foundation-80B-A3B-Base отличается от предыдущей Alice AI LLM 235B?

Новая модель обучена полностью с нуля (без заимствования сторонних весов), имеет почти втрое меньше общих параметров и примерно в семь раз меньше активных, при этом превосходит 235B-версию по фактологическим знаниям, математике, коду и работе с длинным контекстом.

### Где взять технический отчёт?

Технический отчёт опубликован вместе с весами на странице модели на Hugging Face (yandex/AliceAI-Foundation-80B-A3B-Base) и в оригинальном посте на Habr от команды Яндекса.

## Источники

- Habr AI: Открываем AliceAI-Foundation-80B-A3B-Base — новую языковую модель Яндекса, обученную с нуля
