Ornith-1.0 бесплатно и локально: агентная модель, которая сама вызывает инструменты
Ornith-1.0 от DeepReinforce — MIT-лицензия, 4 размера от 9B до 397B, топ на SWE-Bench. Как скачать GGUF и подключить к агентному харнессу за 20 минут.

DeepReinforce выпустила Ornith-1.0 — семейство open-weights моделей под MIT-лицензией, заточенных под агентное кодирование. Симон Уиллисон уже гоняет 35B-вариант на своей машине и говорит, что модель уверенно ведёт агентный харнесс через десятки последовательных вызовов инструментов. Разбираемся, как это повторить.
Что такое Ornith-1.0 и почему это не очередной файн-тюн
Ornith-1.0 — это «self-scaffolding» модели: они обучены не просто генерировать код, а самостоятельно выстраивать цепочку действий агента — вызывать инструменты, интерпретировать результат, корректировать следующий шаг. Это принципиально отличает их от обычных code-completion моделей.
Семейство построено поверх двух базовых моделей — Gemma 4 (Apache 2.0) и Qwen 3.5 (Apache 2.0). Важный момент: Gemma 4 уже не обременена старыми «Gemma Terms of Use», которые ограничивали коммерческое использование предыдущих версий. Итоговая MIT-лицензия Ornith-1.0 чистая — можно встраивать в продукты без юридических сюрпризов.
Доступные варианты:
| Вариант | Архитектура | Для кого | |---|---|---| | 9B Dense | Dense | Ноутбук с 16 ГБ RAM | | 31B Dense | Dense | Рабочая станция с 32+ ГБ | | 35B MoE | Mixture of Experts | 20 ГБ VRAM / 32 ГБ RAM | | 397B MoE | Mixture of Experts | Серверный GPU или кластер |
На бенчмарках Terminal-Bench 2.1, SWE-Bench, NL2Repo и OpenClaw модели показывают state-of-the-art среди open-source решений сопоставимого размера.
Скачиваем и запускаем через LM Studio
Самый быстрый путь для локального запуска — LM Studio с GGUF-квантизацией. Уиллисон использует ornith-1.0-35b-Q4_K_M.gguf весом 20 ГБ — это разумный компромисс между качеством и требованиями к памяти.
Шаг 1. Установите LM Studio (lmstudio.ai), если ещё не стоит.
Шаг 2. В поиске LM Studio найдите модель по имени ornith-1.0-35b или скачайте GGUF вручную с Hugging Face:
```bash
Через huggingface-cli (pip install huggingface_hub)
huggingface-cli download deepreinforce-ai/Ornith-1.0-35B-MoE \ --include "ornith-1.0-35b-Q4_K_M.gguf" \ --local-dir ./models/ornith ```
Шаг 3. Загрузите модель в LM Studio через «Load Model» → укажите путь к .gguf-файлу.
Шаг 4. Включите локальный сервер (вкладка «Local Server», порт по умолчанию 1234). LM Studio поднимает OpenAI-совместимый эндпоинт:
`` http://localhost:1234/v1 ``
Подключаем к агентному харнессу
Любой агентный фреймворк, умеющий работать с OpenAI API, подойдёт без изменений — достаточно переопределить base_url и api_key.
Пример с openai Python SDK:
```python from openai import OpenAI
client = OpenAI( base_url="http://localhost:1234/v1", api_key="lm-studio", # любая строка, LM Studio не проверяет )
response = client.chat.completions.create( model="ornith-1.0-35b-Q4_K_M", # имя как в LM Studio messages=[ { "role": "user", "content": "Find the code that decodes the actor cookie in this repo." } ], tools=[ { "type": "function", "function": { "name": "search_code", "description": "Search codebase by query", "parameters": { "type": "object", "properties": { "query": {"type": "string"} }, "required": ["query"] } } } ], tool_choice="auto", )
print(response.choices[0].message) ```
Уиллисон подключал модель к llm — CLI-инструменту от Datasette — и просил её последовательно находить код в реальном репозитории. Модель без проблем прошла несколько шагов: нашла декодирование куки, потом отследила, где открывается диалог вставки по клику кнопки. Скорость генерации на его машине — около 103 токена/сек на 35B MoE.
Что попробовать с Terminal-Bench и SWE-Bench
Если хотите воспроизвести бенчмарковые результаты или просто проверить модель на реальных задачах, удобнее всего использовать готовые тест-сьюты.
```bash
Клонируем репозиторий Ornith
git clone https://github.com/deepreinforce-ai/Ornith-1 cd Ornith-1
Смотрим примеры запуска агента
ls examples/ ```
Для SWE-Bench потребуется отдельная установка swe-bench и Docker для изолированного выполнения кода — это стандартный пайплайн, Ornith подключается как любая OpenAI-совместимая модель через переменную окружения:
``bash export OPENAI_API_BASE=http://localhost:1234/v1 export OPENAI_API_KEY=lm-studio ``
Где ломается
Память и квантизация. Q4_K_M при 35B MoE занимает 20 ГБ RAM/VRAM. Если памяти меньше — берите Q3_K_S или переходите на 9B Dense. Агрессивная квантизация заметно бьёт по качеству именно в агентных задачах, где важна точность рассуждений.
Скорость на CPU. 103 токена/сек — это результат на GPU. На чистом CPU 35B MoE будет работать в 5-10 раз медленнее; для интерактивного агента это уже некомфортно. В таком случае 9B Dense на CPU даст приемлемые 15-25 токена/сек.
Молодая компания. DeepReinforce — новое имя на рынке. Самая ранняя их работа, которую удалось найти, — статья CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning (июнь 2025). Экосистема вокруг модели только формируется: документация местами неполная, community-поддержка минимальная.
Tool calling в разных фреймворках. Формат вызова инструментов может отличаться от ожиданий конкретного агентного фреймворка. Если видите ошибки парсинга — проверьте, что фреймворк умеет работать с OpenAI function calling v2, а не только со старым формат functions.
Что попробовать дальше
Если 35B MoE работает стабильно — имеет смысл посмотреть на 397B MoE через Ollama с offloading на CPU/GPU split, если есть доступ к серверу с несколькими GPU. Также стоит следить за официальным блогом DeepReinforce: судя по названию «self-improving», следующие версии могут включать механизмы дообучения на собственных трассах агента — это было бы интересным шагом вперёд для локальных coding-агентов.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.


