Qwen 3.8 → API
Разработчикам
API Qwen: как подключить и сколько стоит
У Qwen два входа для разработчиков и один общий ключ. Разбираем, чем они отличаются, какой адрес подставлять, сколько стоит миллион токенов и во что упираются лимиты.
Qwen 3.8 → API
Разработчикам
У Qwen два входа для разработчиков и один общий ключ. Разбираем, чем они отличаются, какой адрес подставлять, сколько стоит миллион токенов и во что упираются лимиты.
QwenCloud (qwencloud.com) — сервис, который сама команда Qwen называет официальным API. Это витрина моделей с прайсом, документацией, песочницей и подписками. Юридически оператор — Intelligent Cloud Computing (Singapore) Private Limited.
Alibaba Cloud Model Studio (bailian.console.aliyun.com) — платформа
внутри общей облачной консоли Alibaba. Кроме моделей Qwen там есть сторонние модели,
дообучение, развёртывание и вся обвязка большого облака. Ключ в обоих случаях один и тот же —
он подставляется в переменную DASHSCOPE_API_KEY.
Логика выбора: нужен только доступ к моделям Qwen — берите QwenCloud, там проще. Нужны выделенные ресурсы, тонкая настройка, привязка к остальной инфраструктуре Alibaba Cloud — идите в Model Studio.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url="https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
)
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Кто ты?"}],
extra_body={"enable_thinking": True},
stream=True,
)
Это и есть весь переезд с OpenAI: три строки конфигурации. Ответ приходит потоком, при
включённом мышлении рассуждения идут в поле reasoning_content, а финальный
текст — в обычном content.
Грабли на стыке. В облаке параметры мышления передаются плоско:
extra_body={"enable_thinking": True, "preserve_thinking": True}. Если вы поднимаете
ту же модель локально через vLLM или SGLang, их нужно завернуть в
chat_template_kwargs. Один и тот же код без правки не заработает в обеих средах.
Model Studio работает в шести регионах, и базовый адрес у каждого свой. Регион определяет, где физически обрабатываются запросы, — это же определяет задержку.
| Регион | Базовый адрес |
|---|---|
| Сингапур | https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/compatible-mode/v1 |
| Германия, Франкфурт | https://{WorkspaceId}.eu-central-1.maas.aliyuncs.com/compatible-mode/v1 |
| Япония, Токио | https://{WorkspaceId}.ap-northeast-1.maas.aliyuncs.com/compatible-mode/v1 |
| Китай, Пекин | https://{WorkspaceId}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1 |
| Китай, Гонконг | https://{WorkspaceId}.cn-hongkong.maas.aliyuncs.com/compatible-mode/v1 |
| США, Виргиния | https://dashscope-us.aliyuncs.com/compatible-mode/v1 |
Общий международный адрес — dashscope-intl.aliyuncs.com, китайский —
dashscope.aliyuncs.com. Идентификатор рабочего пространства подставляется
из кабинета.
| Позиция | qwen3.8-max | qwen3.7-plus |
|---|---|---|
| Вход, за 1 млн токенов | $2 | $0,4 |
| Выход, за 1 млн токенов | $6 | $1,6 |
| Вход из неявного кэша | $0,25 | $0,08 |
| Запись в явный кэш | $2,5 | $0,5 |
| Чтение из явного кэша | $0,17 | $0,04 |
Кэширование здесь — не мелочь, а основной рычаг экономии. Если у вас длинный системный промпт или большой документ, который повторяется из запроса в запрос, повторное чтение обходится в двенадцать раз дешевле обычного входа. Новым пользователям QwenCloud на старте начисляет свыше 70 миллионов бесплатных токенов.
токенов окна контекста
токенов в минуту у qwen3.8-max, 5 млн — у qwen3.7-plus
запросов в минуту
Точнее по границам: максимальный вход — 991 тысяча токенов, а при включённом режиме рассуждений — 983 тысячи, потому что часть окна резервируется. Максимальный выход в обоих режимах 131 тысяча токенов, на сами рассуждения выделяется до 262 тысяч. Про то, как это проявляется в виде ошибок, — на странице о сбоях.
Кроме генерации текста сервис даёт: вызов ваших функций, структурированный вывод в JSON по схеме, продолжение с заданного префикса, пакетную асинхронную обработку со скидкой, кэширование контекста и дообучение на своих данных. Отдельно — набор встроенных инструментов, которые модель вызывает сама: поиск в интернете, извлечение содержимого страницы, интерпретатор кода и два вида поиска изображений. Они работают через Responses API.
В личном кабинете QwenCloud на qwencloud.com — раздел API Keys, там же выдаётся базовый адрес. Альтернативный вход — консоль Alibaba Cloud Model Studio. Ключ в обоих случаях подставляется в переменную окружения DASHSCOPE_API_KEY.
По прайсу на карточке модели: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных. Попадание в неявный кэш стоит 0,25 доллара за миллион, запись в явный кэш — 2,5 доллара, чтение из него — 0,17 доллара.
Да, это основной способ подключения: меняются адрес, ключ и имя модели, остальной код на клиенте OpenAI работает как есть. Разработчик заявляет также совместимость с протоколом Anthropic. Для локально поднятых движков интерфейс тот же, поэтому переезд из облака на своё железо не требует переписывания кода.
По карточке модели: 2 миллиона токенов в минуту и 15 тысяч запросов в минуту. Максимальный вход — 991 тысяча токенов, максимальный выход — 131 тысяча, окно контекста — миллион, на рассуждения выделяется до 262 тысяч токенов.
Общий международный адрес — https://dashscope-intl.aliyuncs.com/compatible-mode/v1, китайский — dashscope.aliyuncs.com. В Model Studio у каждого из шести регионов свой адрес с подстановкой идентификатора рабочего пространства: Сингапур ap-southeast-1, Франкфурт eu-central-1, Токио ap-northeast-1, Пекин cn-beijing, Гонконг cn-hongkong; у Виргинии отдельный dashscope-us.aliyuncs.com. Регион определяет и место обработки запроса, и задержку.
Это повторное использование уже отправленного куска запроса — длинного системного промпта или документа, который приходит из раза в раз. У qwen3.8-max вход стоит 2 доллара за миллион токенов, попадание в неявный кэш — 0,25, чтение из явного кэша — 0,17, то есть примерно в двенадцать раз дешевле обычного входа. Запись в явный кэш — 2,5 доллара за миллион.