Qwen 3.8 → Возможности

Возможности

Что умеет Qwen и что умеет его семейство

Половина запросов о возможностях Qwen на самом деле про соседние модели Alibaba: картинки рисует не флагман, речь синтезирует не он же. Разбираем, где заканчивается одна модель и начинается семейство.

Что умеет сама модель

Флагман Qwen3.8-Max в облачной версии принимает на вход текст, изображения и видео, а выдаёт только текст. Разработчик описывает его как модель, которая умеет вести проект целиком: планировать, выполнять шаги, проверять результат и итеративно доводить работу до конца, в том числе на задачах длиной больше десяти дней. Отдельно подчёркнута профессиональная специализация — юридические, финансовые и дизайнерские сценарии.

Важная деталь для тех, кто скачивает веса: открытая версия Qwen3.8-2.4T-A95B — чисто текстовая. Изображения и видео понимает облачная версия и открытая 27-миллиардная модель, но не открытый флагман. Это прямо написано в его карточке.

Глубина рассуждений как настройка

Поколение 3.8 вынесло режим мышления в параметр. reasoning_effort принимает три значения: xhigh — по умолчанию, для сложного анализа; medium — баланс точности и скорости; low — быстрый и дешёвый режим. Рядом работает preserve_thinking: модель переносит ход рассуждений из предыдущих реплик в следующие, вместо того чтобы восстанавливать логику заново.

Практическое следствие: одна и та же модель может отвечать за секунды или думать минуту, и это не сбой, а выбранный уровень. У открытых весов флагмана мышление отключить нельзя вообще — ответ всегда начинается с блока рассуждений.

Встроенные инструменты в облаке

К модели в облаке подключён набор инструментов, которые она вызывает сама:

Плюс общие возможности сервиса: вызов ваших собственных функций, структурированный вывод в заданном JSON-формате, кэширование контекста, пакетная обработка запросов и дообучение на своих данных. Всё это относится к облачному API, а не к скачанным весам.

Соседи по семейству

Именно тут прячется большинство «возможностей Qwen», которые ищут в поиске.

Qwen-Image

Генерация изображений. Актуальная версия в облаке — Qwen-Image-3.0-Pro: разработчик заявляет отрисовку текста высотой от 10 пикселей, 12 языков и более 20 шрифтов, плотные макеты вроде газетной полосы или меню за один проход.

Qwen3-VL

Зрительно-языковая ветка. Отдельная линейка для задач, где картинка — основной вход: документы, схемы, интерфейсы.

Qwen3-TTS и Qwen3-ASR

Синтез и распознавание речи. ASR-модели на 0,6 и 1,7 млрд параметров выложены открыто под Apache 2.0 и поддерживают более десяти языков.

Qwen3-Omni

Сквозная мультимодальная модель: текст, звук и изображение в одной архитектуре, без склейки из отдельных сервисов.

Qwen-Agent и AgentWorld

Фреймворк для агентов с вызовом функций, MCP и исполнением кода, плюс отдельная модель-«мир» для обучения агентов в симулированной среде.

Qwen3Guard

Многоязычная модель-фильтр для модерации ввода и вывода — то, что обычно нужно, когда Qwen ставят в продукт для конечных пользователей.

Практический вывод: если запрос звучит как «Qwen генерирует видео» или «Qwen озвучивает текст», речь почти всегда про отдельную модель семейства, а не про флагман. В чате они могут быть собраны в одном интерфейсе, но это разные модели с разными ценами и лицензиями.

Работа с экраном и приложениями

Отдельная строка возможностей — управление компьютером. Открытая Qwen3.8-27B показывает 84,3 на OSWorld-Verified (работа с рабочим столом), 64,8 на WebArena-Verified (работа в браузере) и 81,9 на AndroidWorld (мобильные приложения). Для сравнения, предыдущее поколение 27B давало 63,9, 48,8 и 70,3 соответственно — прирост за один шаг версии получился крупнее, чем в тексте.

В экосистеме есть и практическая обвязка под это: команда Qwen публикует MCP-сервис управления компьютером, работающий на macOS, Linux и Windows, и он подключается к Qwen Code или к любому другому агенту.

Чего модель не делает

Флагман не рисует картинки, не генерирует видео и не синтезирует речь — на выходе у него только текст. Он не работает офлайн в облачной версии и не умеет ничего, что не подключено инструментом. И он не заменяет проверку фактов: длинный контекст и режим рассуждений снижают количество ошибок, но не устраняют их.

Частые вопросы

Qwen умеет генерировать изображения?

Сам флагман — нет: на выходе у Qwen3.8-Max только текст. Картинки рисует отдельная модель семейства, Qwen-Image; актуальная облачная версия — Qwen-Image-3.0-Pro, разработчик заявляет для неё отрисовку текста высотой от 10 пикселей, 12 языков и больше 20 шрифтов. В чате обе модели собраны в одном интерфейсе, но это разные модели с разными ценами и лицензиями.

Может ли Qwen создать видео?

Нет. Облачная версия флагмана принимает видео на вход и умеет его разбирать, но генерации видео у неё нет — на выходе только текст. Отдельной модели, которая снимает видео, команда Qwen тоже не публикует: в семействе есть Qwen-Image для изображений, Qwen3-TTS и Qwen3-ASR для речи, Qwen3-VL для зрения.

Есть ли у Qwen распознавание и синтез речи?

Да, но это отдельные модели: Qwen3-TTS синтезирует речь, Qwen3-ASR распознаёт. ASR-модели на 0,6 и 1,7 млрд параметров выложены открыто под Apache 2.0 и поддерживают больше десяти языков. Сам флагман аудио не принимает и не выдаёт.

Что такое reasoning_effort и зачем его менять?

Это параметр глубины рассуждений у поколения 3.8. Значения три: xhigh — по умолчанию, для сложного анализа, medium — баланс точности и скорости, low — быстрый и дешёвый режим. Рядом работает preserve_thinking: модель переносит ход рассуждений из предыдущих реплик, а не восстанавливает логику заново. Одна и та же модель может отвечать за секунды или думать минуту — это выбранный уровень, а не сбой.

Может ли Qwen управлять компьютером?

Да, и это одна из сильных сторон поколения. Открытая Qwen3.8-27B показывает 84,3 на OSWorld-Verified (работа с рабочим столом), 64,8 на WebArena-Verified (работа в браузере) и 81,9 на AndroidWorld (мобильные приложения) — против 63,9, 48,8 и 70,3 у предыдущего поколения 27B. Команда Qwen публикует MCP-сервис управления компьютером под macOS, Linux и Windows.

Какие инструменты Qwen вызывает сам?

В облаке к модели подключён набор, который она запускает без вашего участия: web_search — поиск в интернете, web_extractor — извлечение содержимого конкретной страницы, code_interpreter — выполнение кода, t2i_search и i2i_search — поиск изображений по тексту и по картинке. У скачанных весов ничего этого нет: инструменты вы поднимаете сами.

Смежные разделы