В августе Alibaba выложила в открытый доступ Qwen3.8-27B — и это тот редкий случай, когда релиз открытой весов стоит обсуждать не в терминах «хороша для своих 27 миллиардов», а в терминах «а зачем я тогда плачу за API». Модель показывает результаты уровня прошлого поколения флагманов — Claude Opus 4.6/4.7, — а по свежему независимому индексу Artificial Analysis встаёт вровень с GPT-5.6 Luna. При этом запускается она на железе совершенно другого уровня: от одной потребительской видеокарты до скромного по нынешним меркам сервера — против датацентровых кластеров.
Мы прогнали её через свои рабочие задачи и делимся впечатлениями: что по цифрам, что по нашим тестам на своём AI-кластере, где она слабее лидеров — и при чём тут сорванные планы OpenAI и Anthropic задирать цены.
Table Of Contents
Что вообще вышло
Коротко о самой модели:
- 27B плотных параметров, Apache 2.0, открытые веса — скачивай и запускай где хочешь;
- гибридная архитектура (Gated DeltaNet + внимание) и MTP-декодинг — при небольшом размере модель агентная «из коробки»;
- контекст 262K нативно, до 1M через YaRN;
- нативный vision: изображения и видео, без костылей — про это ниже, это главный сюрприз;
- thinking-режим по умолчанию, с регулировкой глубины размышлений.
За первые три дня после релиза модель скачали с Hugging Face более 3 миллионов раз — это уровень интереса, который обычно бывает только у хайповых закрытых релизов.
Цифры: уровень прошлого поколения флагманов
Сначала официальные цифры Alibaba из карточки модели. Важная рамка: Opus 4.6/4.7 — это прошлое поколение флагманов Anthropic (сегодня на дворе уже Opus 5, Fable 5 и GPT-5.6). Сравнивать с ними честно по одной причине: именно «эталонный Opus 4.6/4.7» до сих пор служит планкой качества для ежедневной разработки — и именно его уровень теперь воспроизводится локально.
| Агентные и кодовые тесты | Qwen3.8-27B | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro (агентный код) | 61.7 | 53.4 |
| Terminal-Bench 2.1 (агент в терминале) | 73.0 | 78.2 |
| NL2Repo-Bench (код уровня репозитория) | 42.3 | 47.6 |
| DeepSWE 1.1 | 42.2 | — |
| GPQA Diamond | 89.2 | — |
| LiveCodeBench v6 | 90.3 | — |
По сводке независимых обзоров Qwen3.8-27B выигрывает у Opus 4.6 15 тестов из 19 общих — при том, что предыдущая Qwen3.6-27B до этого уровня и близко не стояла (DeepSWE: 13.3 → 42.2, Terminal-Bench: 63.4 → 73.0). Официальную открытую модель Muse Glimmer-30B Qwen обходит во всех восьми общих тестах.
Но самое интересное — мультимодальная часть:
| Vision и агентные мультимодальные тесты | Результат |
|---|---|
| OSWorld-Verified (computer use) | 84.3 |
| AndroidWorld (агент на Android) | 81.9 |
| MathVision (с interleaved thinking) | 94.6 |
| CharXiv RQ (графики и диаграммы) | 90.2 |
| RealWorldQA | 85.9 |
| WebArena-Verified (веб-агент) | 64.8 |
OSWorld на уровне 84 — это уже территория, куда у большинства открытых моделей даже доступа нет: модель не просто «смотрит» скриншот, а действует по нему как агент.
Что говорят независимые тесты
Вендорские цифры — вендорскими, поэтому важнее то, что показали независимые площадки после релиза. Artificial Analysis добавил модель в свой Intelligence Index (данные на 17 августа): 52 балла — это уровень GPT-5.6 Luna и DeepSeek V4-Pro. Модель, запускающаяся на железе обычных пользователей, впервые дотянулась до строчки frontier-класса в независимом индексе.
Тут стоит прочувствовать иронию: GPT-5.6 Luna — это та самая модель, которую OpenAI в конце июля вынужденно удешевила на 80% (об этом ниже). И открытая 27B догнала по интеллекту именно ту точку прайса, которую большой вендор только что защищал скидкой.
Из той же независимой оценки — важная деталь, которую мы полностью подтвердили своими тестами: при оценке индекса модель сгенерировала 160 миллионов токенов против медианы в 45 миллионов. Саймон Уиллисон в своём обзоре назвал это прямо: «excellent, but it defaults to wildly overthinking things». Это не баг для галочки в бенчмарках — это плата за качество, о которой ниже.
Info
Оговорка для честности: цифры Alibaba — vendor-reported (базлайны Qwen прогоняла на своём харнессе), а агрегаторы вроде BenchLM модель пока публично не ранжируют — накоплено 27 строк данных, но порог независимой верификации ещё не достигнут. Независимый индекс Artificial Analysis при этом планку Luna уже подтвердил.
Наш опыт: от игровой карты до своего кластера
Мы гоняем модель в двух конфигурациях — и это, пожалуй, самое практичное в посте.
Квант на одной карте. Через llama.cpp (llama-server): квант Q4_K_M ~17 ГБ + vision-проектор — на одной RTX 3090 с 24 ГБ памяти помещается и модель, и контекст до 200K. Игровая карта 2020 года тянет модель целиком, со скоростью порядка 10 токенов в секунду с учётом thinking. Для разовых задач «бросить картинку и получить разбор» этого достаточно: для оценки одного изображения кванты отлично подходят. Но важно понимать цену вопроса: квант снижает общий уровень модели. И если на одиночном ответе это почти незаметно, то в цепочках длинных агентных действий накопление ошибок квантования сказывается всерьёз — модель чаще сбивается на поздних шагах, и её реальный горизонт автономности сжимается. Поэтому сценарий «квант на одной карте» — это vision-разборы и короткие задачи, а не длинные агентные прогоны.
Ещё ниже порог входа: меньшие кванты ужимаются в 16 ГБ — но деградация там уже заметна сильно, и мы бы рассматривали это только как «посмотреть глазами», не как рабочую конфигурацию.
Полновес на своём кластере. Для честной оценки возможностей мы развернули модель в своём AI-кластере: отдельный сервер с 4×AMD Instinct MI50 32 ГБ в связке и vLLM. Полновесная модель (BF16, ~54 ГБ весов) влезает в 128 ГБ объединённой памяти с запасом, и вот что получилось на выходе:
| Метрика (vLLM, 4×MI50 32 ГБ, полновес) | Результат |
|---|---|
| Prefill (обработка входного контекста) | ~1500 t/s |
| Генерация (decode) | ~65–70 t/s |
Это уже не «терпеливо ждём ответа» — это рабочие скорости для команды. И вот что важно: MI50 — это дешёвая бывшая датацентровая карта, которую сегодня можно найти по цене игровой. Полновесной модели не нужен H100-класс: любые 64+ ГБ VRAM на узел дают вам frontier-уровень прошлого поколения локально.
Здесь стоит остановиться и прочувствовать: Claude Opus 4.6/4.7, чей уровень качества модель воспроизводит, живёт в датацентрах Anthropic и продаётся за заметные деньги за миллион токенов. А тут — тот же класс результатов на железе, которое стоит как б/у седан, без отправки данных наружу, без лимитов, без подписки. Для задач с чувствительными данными (документы клиентов, внутренние системы, юрлица из реестров) это не «удобство», а принципиально другой класс возможностей.
Главное ограничение: она думает. Долго
Скорость работы модели сама по себе невысокая, а объём thinking — очень высокий: на нетривиальную задачу модель может выдать размышлений в разы больше, чем самого ответа. Независимые данные это подтверждают (160M токенов на оценку индекса против медианы 45M — см. выше), наши тесты — тоже.
Практические следствия:
- запустить можно на бюджетном железе — от одной 24-гигабайтной карты; железо не барьер;
- главный барьер — время: для хорошего уровня модели нужно дать ей додумать. Резко срезать reasoning_effort можно, но качество падает ощутимо — «думать меньше» для неё равнозначно «отвечать хуже»;
- поэтому её профиль — не «мгновенный чат-бот», а тщательный исполнитель: валидации, разборы, агентные задачи, где важен результат, а не латентность каждого токена.
Главный сюрприз: vision и UX/UI
По нашим тестам модель очень удачная, и главное — за счёт vision она исключительно хороша в работе с изображениями и UX/UI.
Мы поставили её штатным vision-инспектором в свой процесс разработки. Живой пример из продукта ЭДО24: мы переделывали форму выбора организаций и снимали скриншоты прототипа в четырёх состояниях — свёрнутый список, активный поиск, развёрнутый список, пустой результат. Qwen3.8-27B по одним только скриншотам отвечала на вопросы уровня QA-инженера:
- сколько строк организаций видно на экране и сходится ли счётчик «Показано 8 из 25»;
- применился ли поиск — «2 из 25» при запросе «карелина»;
- скрыта или видна кнопка «Показать все» в каждом из состояний.
Она корректно считала строки в таблице, читала мелкий текст интерфейса и проверяла логику состояний UI. Единственный найденный прокол — в одном прогоне ошиблась в чтении очень мелкого текста счётчика, при этом сам скриншот и логику состояний распознала верно. Причём для таких разовых vision-проверок заштатный режим с квантом на одной карте — совершенно рабочий сценарий: картинка одна, думать над ней недолго, потери от кванта незаметны.
Практический вывод: скриншот-валидация интерфейсов, разбор макетов, проверка вёрстки по картинке, чтение таблиц и документов — здесь Qwen3.8-27B сейчас лучшее, что можно положить на локальную машину.
Честно о слабых местах
Мы принципиально не делаем из релиза икону — по нашим тестам есть модели сильнее:
- DeepSeek V4 Flash (284B MoE) заметно мощнее в коде и агентных задачах — но это в разы более тяжёлая MoE-архитектура, совсем другой класс железа для локального запуска;
- GLM-5.2/5.3 — наш основной рабочий инструмент для кодинга, уровень выше, особенно в сложных задачах и проектировании;
- невысокая скорость + очень объёмный thinking — главное практическое ограничение (см. раздел выше): на коротких рутинных запросах длинные размышления откровенно мешают;
- кванты: для одиночных vision-задач — рабочий вариант, но накопление ошибок квантования в длинных агентных цепочках срезает горизонты автономности; полновес требует уже серверного запуска (у нас — 4×MI50);
То есть расклад такой: в чистом тексте и коде Qwen3.8-27B — крепкий уровень «прошлого флагмана» и текущей Luna, но не топ. Её убийственная комбинация — открытые веса + vision + запуск на скромном железе: в этой нише у неё сейчас нет реальных конкурентов.
При чём тут цены OpenAI и Anthropic
Теперь соединим точки. Весной 2026 года OpenAI и Anthropic взяли курс на подорожание: Anthropic подняла цены на API Claude 4.6 на 35%, OpenAI двигала вверх тарифы на GPT-5. Логика была простая: «фронтир стоит денег, а куда вы денетесь».
И вот в июле–августе произошло то, что рынком читается однозначно: планы повышения цен рассыпались. OpenAI срезала цену GPT-5.6 Luna на 80% и Terra на 20%. Anthropic выпустила Opus 5 вдвое дешевле предшественника и отменила запланированное подорожание Sonnet. Аналитики фиксируют падение цен фронтирных моделей США на четверть за месяц. Комментируя разворот, обе компании ссылались на одну и ту же причину — конкуренцию со стороны китайских открытых моделей.
Qwen3.8-27B — это и есть эта конкуренция в чистом виде. Открытая модель уровня прошлого флагмана и текущей Luna по независимому индексу, работающая на домашней видеокарте или дешёвом сервере, устанавливает потолок цен: как только качество «бесплатного локального» подбирается к платному облачному, платить завышенную цену за API становится невозможно — даже компаниям, которым нужны именно флагманы, теперь есть на что давить в переговорах.
Warning
Мы не ждём, что облачные флагманы умрут: Opus 5, Fable 5 и GPT-5.6 объективно сильнее, и для самых сложных задач они остаются незаменимыми. Речь о другом — исчезает «безальтернативность», которая и позволяла поднимать цены.
Итог
- Qwen3.8-27B — открытая (Apache 2.0) модель 27B: по официальным тестам — уровень Claude Opus 4.6/4.7 (15 побед из 19 общих тестов), по независимому индексу Artificial Analysis — уровень GPT-5.6 Luna;
- запускается где угодно: Q4_K_M — на одной карте с 24 ГБ даже с контекстом 200K (для vision-разборов достаточно), меньшие кванты — на 16 ГБ (с сильной деградацией), полновес — на скромном сервере; у нас 4×MI50 32 ГБ с vLLM дали 1500 t/s prefill и 65–70 t/s генерации;
- главный козырь — vision: по нашим тестам лучше всего она в UX/UI-валидации, разборе скриншотов и работе с изображениями;
- главное ограничение — не железо, а время: очень объёмный thinking — плата за уровень; в честном сравнении она слабее DeepSeek V4 Flash и GLM-5.3/5.2 в коде;
- и именно такие модели сорвали весенние планы OpenAI и Anthropic поднимать цены: выбор «платить или не платить» появился у всех.
Если нужна помощь с развёртыванием локальных LLM под ваши задачи — с приватностью данных, vision-валидацией интерфейсов или ассистентами на своих серверах — обращайтесь, Лаборатория Павла Жукова поможет.
