Яндекс выложил веса AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0 — первой своей базовой модели, обученной полностью с нуля, без заимствования весов сторонних опенсорс-проектов. При 80 млрд общих параметрах модель активирует только 3 млрд на каждый токен, что делает инференс дешевле, чем у большинства конкурентов сопоставимого качества. Если вы выбираете базу для посттрейнинга или просто хотите поэкспериментировать с сильным русскоязычным претрейном — вот с чего начать.

Что внутри модели и почему цифры не обманывают

Архитектура — MoE (Mixture of Experts, смесь экспертов): 512 экспертов в каждом слое, из которых на один токен активируется лишь небольшое подмножество, обеспечивающее те самые 3B активных параметров. Контекстное окно — 262 144 токена, что перекрывает большинство задач с длинными документами.

Обучение шло на 18 трлн токенов. Корпус включает веб, математику, код, юридические и медицинские тексты, reasoning-трейсы и агентские взаимодействия с инструментами. Последнее — принципиальный момент: агентские данные добавили уже в претрейн, а не только в посттрейн, и это заметно улучшило агентские бенчмарки после дообучения.

На WikiWebFacts (фактологический бенчмарк с акцентом на русский язык) модель набирает 86.5 балла против 83.2 у DeepSeek-V4-Flash-Base (284B-13B) и 62.4 у Qwen3.5-35B-A3B-Base. На IMO AnswerBench и LiveCodeBench — лидирует среди сравниваемых открытых претрейнов.

Как скачать модель

Модель опубликована на Hugging Face под именем yandex/AliceAI-Foundation-80B-A3B-Base. Для загрузки понадобится huggingface_hub или transformers.

bash
pip install huggingface_hub
huggingface-cli download yandex/AliceAI-Foundation-80B-A3B-Base --local-dir ./aliceai-80b

Или через Python напрямую:

python
from huggingface_hub import snapshot_download

snapshot_download(
    repo_id="yandex/AliceAI-Foundation-80B-A3B-Base",
    local_dir="./aliceai-80b"
)

Как запустить инференс

Для базового запуска подойдёт transformers. Модель — MoE, поэтому для комфортной работы нужна видеопамять под активные параметры плюс запас под KV-кэш. На практике достаточно одного A100 80GB или двух A40 при использовании device_map="auto".

python
from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_path = "./aliceai-80b"

tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(
    model_path,
    torch_dtype=torch.bfloat16,
    device_map="auto"
)

inputs = tokenizer("Объясни теорему Пифагора простыми словами:", return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=256)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Для продакшн-инференса с батчингом и большим контекстом рекомендуется vLLM — он поддерживает MoE и длинные контексты эффективнее, чем наивный generate.

bash
pip install vllm
vllm serve ./aliceai-80b --dtype bfloat16 --max-model-len 32768

Какой формат данных выбрать для файнтюнинга

Яндекс публикует рекомендации по формату данных для посттрейна вместе с техническим отчётом. Базовая модель — претрейн без instruction-тюнинга, поэтому перед использованием в диалоговых сценариях её нужно дообучить.

Несколько принципов, которые команда Яндекса вынесла из собственных экспериментов:

  • Фактологический домен требует аугментаций. Простое добавление QA-пар без вариации формата и семантического контекста даёт слабый прирост. Нужны перефразировки и разные шаблоны вопросов.
  • Reasoning-трейсы важны, но недостаточны для агентов. Если цель — агентское поведение, добавляйте в обучающий корпус взаимодействия с инструментами (CRUD-сценарии, поисковые вызовы, SWE-задачи), а не только цепочки рассуждений.
  • Loss на валидации плохо предсказывает качество на бенчмарках. Ориентируйтесь на целевые метрики, а не только на перплексию.

Минимальный пример конфига для SFT через trl:

python
from trl import SFTConfig

training_args = SFTConfig(
    output_dir="./aliceai-sft",
    per_device_train_batch_size=1,
    gradient_accumulation_steps=8,
    num_train_epochs=1,
    bf16=True,
    max_seq_length=4096,
    dataset_text_field="text",
    logging_steps=10,
)

Где ломается и что учесть

Нестабильность MoE-активаций. В ходе обучения с нуля команда столкнулась с тем, что после пересчёта гиперпараметров по scaling laws активации MoE начали расти, а затем резко вырос loss. Если вы дообучаете модель с нестандартными learning rate или batch size — следите за нормой активаций, а не только за loss.

Scaling laws не всегда переносятся. Рецепты, работавшие при инициализации из опенсорс-весов, пришлось переработать для длинного претрейна с нуля. Не переносите гиперпараметры из чужих репортов слепо.

Loss на отложенной выборке — плохой ориентир. Яндекс прямо пишет об этом в отчёте: модель с лучшим validation loss проигрывала на целевых бенчмарках. Строите пайплайн оценки — закладывайте downstream-метрики с самого начала.

Контекст 262K — не бесплатный. KV-кэш на полном окне требует десятков гигабайт памяти. Для большинства задач достаточно 32K–64K.

Что попробовать дальше

Вместе с моделью Яндекс открыл два русскоязычных бенчмарка — WikiWebFacts и HardMultiQA — с протоколами оценки. Это готовая инфраструктура для измерения фактологического качества ваших дообученных версий. Технический отчёт содержит абляционные эксперименты по архитектуре (Gated RMSNorm, Z-Loss, Muon, Kimi Delta Attention) — полезное чтение перед тем, как менять что-то в архитектуре при собственном претрейне.

Следующий шаг от Яндекса — единая рассуждающая модель (ЕРМ) на базе этого претрейна, которая станет ядром агентских возможностей Алисы AI.


FAQ

Можно ли использовать AliceAI-Foundation-80B-A3B-Base в коммерческих проектах?

Да. Модель выпущена под лицензией Apache 2.0, которая разрешает коммерческое использование, модификацию и распространение без ограничений по типу продукта.

Сколько VRAM нужно для инференса?

Для комфортного инференса с контекстом до 32K достаточно одного GPU с 80 ГБ памяти (например, A100 80GB). При использовании device_map="auto" модель распределяется на несколько карт. Полный контекст 262K токенов потребует значительно больше памяти под KV-кэш.

Это инструктированная модель или только базовый претрейн?

Только базовый претрейн. Модель не оптимизирована для диалога и не следует инструкциям в привычном смысле. Для продуктовых сценариев необходим SFT или RLHF поверх этих весов.

Чем AliceAI-Foundation-80B-A3B-Base отличается от предыдущей Alice AI LLM 235B?

Новая модель обучена полностью с нуля (без заимствования сторонних весов), имеет почти втрое меньше общих параметров и примерно в семь раз меньше активных, при этом превосходит 235B-версию по фактологическим знаниям, математике, коду и работе с длинным контекстом.

Где взять технический отчёт?

Технический отчёт опубликован вместе с весами на странице модели на Hugging Face (yandex/AliceAI-Foundation-80B-A3B-Base) и в оригинальном посте на Habr от команды Яндекса.

Источники