← На главную
inference
Новости и гайды про inference. Не отдельная рубрика: фильтр по теме поверх ленты.
11.09.2026DeepSeek V4.1-Flash вышел с KV-кэшем в 437 раз меньше первой версии — и бьёт Opus 5 на коде
DeepSeek выпустил V4.1-Flash — модель на 552 млрд параметров с новой архитектурой, которая режет память для ИИ-агентов в 4 раза. Разбираем, что внутри и кому это нужно.
21.07.2026Qwen и Kimi K3 в вашем стеке: что нужно знать, прежде чем переключиться
Qwen 3.8 Max и Kimi K3 дешевле западных моделей — но стоит ли их использовать? Разбираем дистилляцию, риски и как встроить китайские LLM в свой стек.
23.05.2026Nemotron Diffusion: Как перестать ждать и получить LLM-генерацию со скоростью света
Узнайте, как Nemotron-Labs Diffusion ломает последовательный барьер LLM. Практический гайд по внедрению диффузионных моделей для сверхбыстрой генерации текста.