# Ornith-1.0 бесплатно и локально: агентная модель, которая сама вызывает инструменты
Каноническая страница: https://plainews.ru/posts/ornith-1-0-agentic-coding-local-lm-studio
Опубликовано: 2026-06-30T07:01:17.262Z

Ornith-1.0 от DeepReinforce — MIT-лицензия, 4 размера от 9B до 397B, топ на SWE-Bench. Как скачать GGUF и подключить к агентному харнессу за 20 минут.
DeepReinforce выпустила Ornith-1.0 — семейство open-weights моделей под MIT-лицензией, заточенных под агентное кодирование. Симон Уиллисон уже гоняет 35B-вариант на своей машине и говорит, что модель уверенно ведёт агентный харнесс через десятки последовательных вызовов инструментов. Разбираемся, как это повторить.

## Что такое Ornith-1.0 и почему это не очередной файн-тюн

Ornith-1.0 — это «self-scaffolding» модели: они обучены не просто генерировать код, а самостоятельно выстраивать цепочку действий агента — вызывать инструменты, интерпретировать результат, корректировать следующий шаг. Это принципиально отличает их от обычных code-completion моделей.

Семейство построено поверх двух базовых моделей — Gemma 4 (Apache 2.0) и Qwen 3.5 (Apache 2.0). Важный момент: Gemma 4 уже не обременена старыми «Gemma Terms of Use», которые ограничивали коммерческое использование предыдущих версий. Итоговая MIT-лицензия Ornith-1.0 чистая — можно встраивать в продукты без юридических сюрпризов.

Доступные варианты:

| Вариант | Архитектура | Для кого | |---|---|---| | 9B Dense | Dense | Ноутбук с 16 ГБ RAM | | 31B Dense | Dense | Рабочая станция с 32+ ГБ | | 35B MoE | Mixture of Experts | 20 ГБ VRAM / 32 ГБ RAM | | 397B MoE | Mixture of Experts | Серверный GPU или кластер |

На бенчмарках Terminal-Bench 2.1, SWE-Bench, NL2Repo и OpenClaw модели показывают state-of-the-art среди open-source решений сопоставимого размера.

## Скачиваем и запускаем через LM Studio

Самый быстрый путь для локального запуска — LM Studio с GGUF-квантизацией. Уиллисон использует ornith-1.0-35b-Q4_K_M.gguf весом 20 ГБ — это разумный компромисс между качеством и требованиями к памяти.

**Шаг 1.** Установите LM Studio (lmstudio.ai), если ещё не стоит.

**Шаг 2.** В поиске LM Studio найдите модель по имени ornith-1.0-35b или скачайте GGUF вручную с Hugging Face:

```bash

# Через huggingface-cli (pip install huggingface_hub)

huggingface-cli download deepreinforce-ai/Ornith-1.0-35B-MoE \   --include "ornith-1.0-35b-Q4_K_M.gguf" \   --local-dir ./models/ornith ```

**Шаг 3.** Загрузите модель в LM Studio через «Load Model» → укажите путь к .gguf-файлу.

**Шаг 4.** Включите локальный сервер (вкладка «Local Server», порт по умолчанию 1234). LM Studio поднимает OpenAI-совместимый эндпоинт:

`` http://localhost:1234/v1 ``

## Подключаем к агентному харнессу

Любой агентный фреймворк, умеющий работать с OpenAI API, подойдёт без изменений — достаточно переопределить base_url и api_key.

Пример с openai Python SDK:

```python from openai import OpenAI

client = OpenAI(     base_url="http://localhost:1234/v1",     api_key="lm-studio",  # любая строка, LM Studio не проверяет )

response = client.chat.completions.create(     model="ornith-1.0-35b-Q4_K_M",  # имя как в LM Studio     messages=[         {             "role": "user",             "content": "Find the code that decodes the actor cookie in this repo."         }     ],     tools=[         {             "type": "function",             "function": {                 "name": "search_code",                 "description": "Search codebase by query",                 "parameters": {                     "type": "object",                     "properties": {                         "query": {"type": "string"}                     },                     "required": ["query"]                 }             }         }     ],     tool_choice="auto", )

print(response.choices[0].message) ```

Уиллисон подключал модель к llm — CLI-инструменту от Datasette — и просил её последовательно находить код в реальном репозитории. Модель без проблем прошла несколько шагов: нашла декодирование куки, потом отследила, где открывается диалог вставки по клику кнопки. Скорость генерации на его машине — около 103 токена/сек на 35B MoE.

## Что попробовать с Terminal-Bench и SWE-Bench

Если хотите воспроизвести бенчмарковые результаты или просто проверить модель на реальных задачах, удобнее всего использовать готовые тест-сьюты.

```bash

# Клонируем репозиторий Ornith

git clone https://github.com/deepreinforce-ai/Ornith-1 cd Ornith-1

# Смотрим примеры запуска агента

ls examples/ ```

Для SWE-Bench потребуется отдельная установка swe-bench и Docker для изолированного выполнения кода — это стандартный пайплайн, Ornith подключается как любая OpenAI-совместимая модель через переменную окружения:

``bash export OPENAI_API_BASE=http://localhost:1234/v1 export OPENAI_API_KEY=lm-studio ``

## Где ломается

**Память и квантизация.** Q4_K_M при 35B MoE занимает 20 ГБ RAM/VRAM. Если памяти меньше — берите Q3_K_S или переходите на 9B Dense. Агрессивная квантизация заметно бьёт по качеству именно в агентных задачах, где важна точность рассуждений.

**Скорость на CPU.** 103 токена/сек — это результат на GPU. На чистом CPU 35B MoE будет работать в 5-10 раз медленнее; для интерактивного агента это уже некомфортно. В таком случае 9B Dense на CPU даст приемлемые 15-25 токена/сек.

**Молодая компания.** DeepReinforce — новое имя на рынке. Самая ранняя их работа, которую удалось найти, — статья CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning (июнь 2025). Экосистема вокруг модели только формируется: документация местами неполная, community-поддержка минимальная.

**Tool calling в разных фреймворках.** Формат вызова инструментов может отличаться от ожиданий конкретного агентного фреймворка. Если видите ошибки парсинга — проверьте, что фреймворк умеет работать с OpenAI function calling v2, а не только со старым формат functions.

## Что попробовать дальше

Если 35B MoE работает стабильно — имеет смысл посмотреть на 397B MoE через Ollama с offloading на CPU/GPU split, если есть доступ к серверу с несколькими GPU. Также стоит следить за официальным блогом DeepReinforce: судя по названию «self-improving», следующие версии могут включать механизмы дообучения на собственных трассах агента — это было бы интересным шагом вперёд для локальных coding-агентов.

## Источники

- Simon Willison: Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding
