Что вообще можно запустить
Открытыми выложены не все модели линейки. Реально доступны для локального запуска
плотные модели на 27 миллиардов параметров, разреженные MoE-модели и вся малая линейка
поколения 3.5. Флагман на 2,4 триллиона параметров формально тоже открыт, но это модель
для кластера: даже в четырёхбитном кванте она не помещается ни в один домашний конфиг.
| Модель | Тип | Активных параметров | Реалистичный сценарий |
| Qwen3.8-27B | Плотная, со зрением | 27 млрд | Одна сильная видеокарта в кванте, две — в FP8 |
| Qwen3.6-35B-A3B | MoE | 3 млрд | Быстрая генерация при достаточной памяти под все веса |
| Qwen3.5-9B | Плотная | 9 млрд | Средняя игровая видеокарта |
| Qwen3.5-4B / 2B / 0.8B | Плотные | до 4 млрд | Ноутбук, встроенная графика, слабое железо |
| Qwen3.8-2.4T-A95B | MoE | 95 млрд | Только серверный кластер |
Почему MoE быстрее, чем кажется
Обозначение вида 35B-A3B читается так: 35 миллиардов параметров всего,
3 миллиарда активируются на каждый токен. Модель хранит много «экспертов», но на конкретный
токен включает только несколько. Отсюда парадокс, который сбивает с толку: 35-миллиардная
MoE-модель генерирует текст заметно быстрее плотной 27-миллиардной, хотя весит больше.
Практический вывод: памяти MoE требует по общему размеру, а скорость даёт по активному.
Если у вас хватает видеопамяти или быстрого выгружения на CPU — MoE выгоднее. Если памяти
впритык — плотная модель меньшего размера окажется практичнее.
Форматы файлов
- safetensors — оригинальный формат публикации. Полная точность,
максимальное качество, максимальный объём. Этим кормят vLLM, SGLang и transformers.
- FP8 — официальная восьмибитная сборка от самой команды Qwen
(репозитории с суффиксом
-FP8). Примерно вдвое меньше оригинала при
минимальной потере качества.
- GGUF — формат экосистемы llama.cpp. Именно его понимают Ollama
и LM Studio. Внутри квантование разной степени:
Q4_K_M — рабочий
компромисс, Q8_0 — почти без потерь и вдвое тяжелее.
- GPTQ-Int4 — четырёхбитные сборки, публикуются официально
для части моделей линейки 3.5.
- MLX — формат под Apple Silicon.
Прикидка по памяти простая: в исходном формате примерно 2 байта на параметр,
в FP8 — 1 байт, в четырёхбитном кванте — около 0,6 байта с учётом накладных расходов.
Плюс память под контекст, которая при длинном окне сопоставима с самой моделью.
Отсюда правило: 27-миллиардная модель в Q4_K_M — это около 16 ГБ файла
и минимум 20–24 ГБ видеопамяти для комфортной работы с длинным контекстом.
Чем запускать
Для одного пользователя
Ollama и LM Studio — самый короткий путь: скачали программу, выбрали модель
из каталога, получили чат и локальный API. Оба работают с GGUF, оба скрывают настройки.
На Apple Silicon альтернатива — mlx-lm для текстовых моделей
и mlx-vlm, если нужна работа с изображениями. Отдельно есть Unsloth
с собственным локальным интерфейсом и готовыми квантами.
Для сервера
Команда Qwen рекомендует три движка и публикует под них рецепты. Запуск выглядит так:
vllm serve Qwen/Qwen3.8-27B --port 8000 \
--tensor-parallel-size 4 --max-model-len 262144 \
--reasoning-parser qwen3 --enable-auto-tool-choice \
--tool-call-parser qwen3_coder
Аналогичные команды есть у SGLang (sglang serve) и TokenSpeed
(tokenspeed serve). Во всех трёх случаях поднимается OpenAI-совместимый
интерфейс на /v1, то есть код, написанный под облачный API, работает
без изменений — меняется только адрес. Простой вариант без внешних зависимостей —
transformers serve, но для нагрузки он не предназначен.
Два флага, которые чаще всего забывают. --reasoning-parser qwen3
отделяет рассуждения модели от финального ответа — без него блок размышлений попадёт
пользователю в текст. --tool-call-parser qwen3_coder нужен, если модель
должна вызывать функции: иначе вызов останется просто строкой в ответе.
Настройки генерации
Разработчик рекомендует для поколения 3.8 конкретный набор: temperature=1.0,
top_p=0.95, top_k=20, min_p=0.0, штрафы за
присутствие и повторы — по нулям. При зацикливании допускается поднять
presence_penalty в диапазоне от 0 до 2, но с оговоркой: слишком большое
значение приводит к смешению языков в ответе и лёгкой просадке качества.
Для длинных задач рекомендуется разводить бюджеты: до 262 144 токенов на рассуждения
и до 131 072 на финальный ответ в пределах миллионного контекста. Если движок
не умеет разделять эти лимиты, ставьте общий потолок с запасом — иначе модель
оборвётся на середине размышления.
Лицензии перед продакшеном
Qwen3.8-27B, Qwen3.6-27B и Qwen3.6-35B-A3B опубликованы под Apache 2.0 — это разрешительная
лицензия без сюрпризов. Флагман Qwen3.8-2.4T-A95B выложен под собственной лицензией
qwen3.8-max, её условия нужно читать отдельно. У старых поколений тоже
встречается кастомная лицензия Qwen вместо Apache. Проверяйте карточку каждой конкретной
модели: внутри одного бренда условия разные.