Qwen 3.8 → Локально

Локальный запуск

Qwen на своём железе: что влезет и чем запускать

Открытые веса Qwen — главная причина, по которой линейку так активно тащат на локальные машины. Разбираем форматы файлов, движки, команды запуска и честную арифметику по видеопамяти.

Что вообще можно запустить

Открытыми выложены не все модели линейки. Реально доступны для локального запуска плотные модели на 27 миллиардов параметров, разреженные MoE-модели и вся малая линейка поколения 3.5. Флагман на 2,4 триллиона параметров формально тоже открыт, но это модель для кластера: даже в четырёхбитном кванте она не помещается ни в один домашний конфиг.

МодельТипАктивных параметровРеалистичный сценарий
Qwen3.8-27BПлотная, со зрением27 млрдОдна сильная видеокарта в кванте, две — в FP8
Qwen3.6-35B-A3BMoE3 млрдБыстрая генерация при достаточной памяти под все веса
Qwen3.5-9BПлотная9 млрдСредняя игровая видеокарта
Qwen3.5-4B / 2B / 0.8BПлотныедо 4 млрдНоутбук, встроенная графика, слабое железо
Qwen3.8-2.4T-A95BMoE95 млрдТолько серверный кластер

Почему MoE быстрее, чем кажется

Обозначение вида 35B-A3B читается так: 35 миллиардов параметров всего, 3 миллиарда активируются на каждый токен. Модель хранит много «экспертов», но на конкретный токен включает только несколько. Отсюда парадокс, который сбивает с толку: 35-миллиардная MoE-модель генерирует текст заметно быстрее плотной 27-миллиардной, хотя весит больше.

Практический вывод: памяти MoE требует по общему размеру, а скорость даёт по активному. Если у вас хватает видеопамяти или быстрого выгружения на CPU — MoE выгоднее. Если памяти впритык — плотная модель меньшего размера окажется практичнее.

Форматы файлов

Прикидка по памяти простая: в исходном формате примерно 2 байта на параметр, в FP8 — 1 байт, в четырёхбитном кванте — около 0,6 байта с учётом накладных расходов. Плюс память под контекст, которая при длинном окне сопоставима с самой моделью. Отсюда правило: 27-миллиардная модель в Q4_K_M — это около 16 ГБ файла и минимум 20–24 ГБ видеопамяти для комфортной работы с длинным контекстом.

Чем запускать

Для одного пользователя

Ollama и LM Studio — самый короткий путь: скачали программу, выбрали модель из каталога, получили чат и локальный API. Оба работают с GGUF, оба скрывают настройки. На Apple Silicon альтернатива — mlx-lm для текстовых моделей и mlx-vlm, если нужна работа с изображениями. Отдельно есть Unsloth с собственным локальным интерфейсом и готовыми квантами.

Для сервера

Команда Qwen рекомендует три движка и публикует под них рецепты. Запуск выглядит так:

vllm serve Qwen/Qwen3.8-27B --port 8000 \
  --tensor-parallel-size 4 --max-model-len 262144 \
  --reasoning-parser qwen3 --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

Аналогичные команды есть у SGLang (sglang serve) и TokenSpeed (tokenspeed serve). Во всех трёх случаях поднимается OpenAI-совместимый интерфейс на /v1, то есть код, написанный под облачный API, работает без изменений — меняется только адрес. Простой вариант без внешних зависимостей — transformers serve, но для нагрузки он не предназначен.

Два флага, которые чаще всего забывают. --reasoning-parser qwen3 отделяет рассуждения модели от финального ответа — без него блок размышлений попадёт пользователю в текст. --tool-call-parser qwen3_coder нужен, если модель должна вызывать функции: иначе вызов останется просто строкой в ответе.

Настройки генерации

Разработчик рекомендует для поколения 3.8 конкретный набор: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, штрафы за присутствие и повторы — по нулям. При зацикливании допускается поднять presence_penalty в диапазоне от 0 до 2, но с оговоркой: слишком большое значение приводит к смешению языков в ответе и лёгкой просадке качества.

Для длинных задач рекомендуется разводить бюджеты: до 262 144 токенов на рассуждения и до 131 072 на финальный ответ в пределах миллионного контекста. Если движок не умеет разделять эти лимиты, ставьте общий потолок с запасом — иначе модель оборвётся на середине размышления.

Лицензии перед продакшеном

Qwen3.8-27B, Qwen3.6-27B и Qwen3.6-35B-A3B опубликованы под Apache 2.0 — это разрешительная лицензия без сюрпризов. Флагман Qwen3.8-2.4T-A95B выложен под собственной лицензией qwen3.8-max, её условия нужно читать отдельно. У старых поколений тоже встречается кастомная лицензия Qwen вместо Apache. Проверяйте карточку каждой конкретной модели: внутри одного бренда условия разные.

Частые вопросы

Сколько видеопамяти нужно для Qwen 3.8 27B?

В квантовании Q4_K_M сам файл занимает около 16 ГБ, а для комфортной работы с длинным контекстом нужно минимум 20–24 ГБ видеопамяти: кэш контекста на большом окне сопоставим по объёму с самой моделью. В FP8 модель просит уже около 28 ГБ, то есть практически две видеокарты.

Чем запускать Qwen локально — Ollama, LM Studio или vLLM?

Зависит от того, один вы пользователь или сервер. Для себя короче всего Ollama или LM Studio: скачали программу, выбрали модель из каталога, получили чат и локальный API, оба работают с GGUF. На Apple Silicon альтернатива — mlx-lm и mlx-vlm. Для нагрузки команда Qwen рекомендует vLLM, SGLang и TokenSpeed — все три поднимают OpenAI-совместимый интерфейс на /v1.

Какой формат весов Qwen выбрать: GGUF, FP8 или safetensors?

safetensors — оригинальная публикация, максимальное качество и максимальный объём, им кормят vLLM, SGLang и transformers. FP8 — официальная восьмибитная сборка самой команды Qwen, примерно вдвое меньше при минимальной потере качества. GGUF — формат экосистемы llama.cpp, его понимают Ollama и LM Studio; внутри Q4_K_M — рабочий компромисс, Q8_0 — почти без потерь и вдвое тяжелее.

Какие настройки генерации рекомендует разработчик для Qwen 3.8?

Набор конкретный: temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, штрафы за присутствие и повторы — по нулям. При зацикливании допускается поднять presence_penalty в диапазоне от 0 до 2, но с оговоркой: слишком большое значение приводит к смешению языков в ответе и лёгкой просадке качества.

Почему в ответе локальной Qwen видны рассуждения модели?

Потому что при запуске не указан флаг --reasoning-parser qwen3: без него служебный блок размышлений не отделяется от финального ответа и уезжает пользователю в текст. Второй флаг, который забывают так же часто, — --tool-call-parser qwen3_coder: без него вызов функции остаётся в ответе просто строкой, и движок его не разбирает.

Можно ли использовать локальную Qwen в коммерческом продукте?

Смотря какую модель. Qwen3.8-27B, Qwen3.6-27B и Qwen3.6-35B-A3B опубликованы под Apache 2.0 — разрешительная лицензия без сюрпризов. Флагман Qwen3.8-2.4T-A95B вышел под собственной лицензией qwen3.8-max, её условия надо читать отдельно. У старых поколений тоже встречается кастомная лицензия Qwen вместо Apache — проверять нужно карточку каждой конкретной модели.

Смежные разделы