14 августа 2026 Alibaba выложила веса Qwen 3.8-27B на Hugging Face. Не чат на 7B, а плотная 27B-модель с картинками, видео и окном 262 144 токена. В карточке её ставят рядом с Opus-классом на кодовых бенчмарках. Квант Q4_K_M около 17 ГБ влезает в 24 ГБ одной RTX 3090. Лицензия Apache 2.0. GGUF вышел в тот же день. На Hugging Face модель быстро стала первой в трендах, семейство Qwen у Alibaba уже самое скачиваемое среди открытых весов. Ниже практический разбор: кому нужна локальная модель для кода, когда Qwen 27B на 3090 выгоднее API и когда разумнее оставить Claude Code.
Что такое Qwen 3.8 и зачем 27B, а не Max
Qwen3.8 это поколение. Рядом вышел флагман Qwen3.8-2.4T-A95B: 2,4 трлн параметров, 95 млрд активных, своя лицензия, это кластер и API. Qwen3.8-27B другая вещь. Плотная модель на 27 млрд параметров (около 28 млрд с vision-энкодером). Официальный репозиторий: Qwen/Qwen3.8-27B. Текст, изображение и видео на входе, текст на выходе. Thinking по умолчанию включён, глубину крутят через reasoning_effort: xhigh, medium, low. Режим можно выключить на запрос.
Архитектура гибридная: из 64 слоёв полным вниманием живут 16, остальные на линейном Gated DeltaNet. Поэтому нативное окно 262k для 27B реально держать, KV-кэш растёт слабее, чем у обычной dense 27B. Расширение до 1 млн токенов через YaRN в материалах Qwen есть. На открытых весах рабочий потолок это 262k. Миллион токенов Qwen обещает на hosted Qwen Cloud, не как дефолт вашей 3090.
Для вайб-кодинга важнее не «ещё один чат», а куда уезжает код, пока агент читает файлы, гоняет тесты и смотрит скрин ошибки. Каркас процесса тот же, что в статье про вайб-кодинг с нуля: чужой API или карта под столом.
Лицензия, железо и VRAM: что проверено
Лицензия весов Apache 2.0. Коммерция, форк, перераспределение, явный патентный грант. Это не custom-лицензия флагмана Qwen3.8-Max. Для студии и фрилансера с NDA это главный аргумент «локально», сильнее любого балла в таблице.
Память по весам, без кэша контекста:
- BF16. Около 55,6 ГБ safetensors. Это 80-гиговый класс, не 3090.
- FP8. Около 28 ГБ. Уже 48 ГБ карта, не 24.
- Q4_K_M GGUF. Сборка Unsloth около 17,1 ГБ. Это как раз Qwen 27B 3090: 24 ГБ видеокарты хватает на веса плюс запас под контекст.
- IQ4_XS / Q3_K_M. 15,7 и 13,8 ГБ. Имеет смысл на 16 ГБ, если очень хотите именно 27B, а не меньшую модель.
- 2-bit на 12 ГБ. Формально влезает. Качество заметно проседает. Это компромисс, не рабочий дефолт.
Полный нативный 262k на 24 ГБ не бесплатен. Сообщество в первую неделю мерило KV-кэш примерно так: около 0,5 ГБ на 8k, около 2 ГБ на 32k, порядка 16 ГБ на всём окне. На 3090 с Q4_K_M разумный рабочий контекст это десятки тысяч токенов (32k-64k, иногда больше с квантованным кэшем), не «весь монолит за один заход». Для агента по одному сервису этого хватает. Для гигантского монорепо без нарезки нет.
Бенчмарки Qwen 3.8: таблица Alibaba и независимый индекс
Цифры с карточки модели это замеры Alibaba, часто на harness Claude Code. Это не «доказали, что 27B сильнее Opus везде». Это верхняя оценка в их постановке. На 20 августа 2026 независимой полной репликации SWE-bench Pro ещё нет. Имеет смысл смотреть две полки отдельно.
Что Alibaba ставит у Qwen3.8-27B (и рядом, из той же таблицы):
- SWE-bench Pro: 61,7. У Qwen3.6-27B 53,5. У Claude Opus 4.6 Max в той же таблице 53,4.
- LiveCodeBench v6: 90,3 против 88,8 у Opus 4.6 Max.
- Terminal Bench 2.1: 73,0. Здесь Opus 4.6 Max впереди: 78,2.
- DeepSWE 1.1: 42,2 против 13,3 у предыдущей 27B.
- OSWorld-Verified: 84,3 (компьютерное агентное использование).
На GPQA Diamond и Humanity's Last Exam в той же таблице Opus 4.6 Max выше: 91,3 и 40 против 89,2 и 30,8. Даже вендор не рисует победу по всем осям. «Opus at home» это мем про агентный код, не про универсальный интеллект.
Независимая полка: Artificial Analysis на Intelligence Index v4.1.1 даёт Qwen3.8 27B 52. Тот же балл, что у GPT-5.6 Luna на максимальном reasoning, облачной эконом-модели OpenAI. Индекс из девяти оценок, среди них Terminal-Bench v2.1, GPQA Diamond, HLE, SciCode. По Agentic Index в разборах первых дней фигурирует 51. Модель болтливая: на прогоне индекса 160 млн выходных токенов при медиане около 45 млн у сопоставимых открытых весов. Медиана скорости по API-провайдерам у AA: 31,4 токена в секунду. Медленно. На облаке это дорого. На своей карте это минуты, не доллары.
Cline после независимых цифр написала, что локальная модель впервые дотягивает до frontier-класса по их ощущению темпа. Это реакция продукта, не лабораторный отчёт. Саймон Уиллисон прогнал Q4_K_M около 17 ГБ: код, картинки, агентный цикл. На дефолтном xhigh одна игрушечная задача ушла в десятки минут и тысячи reasoning-токенов. Для повседневного кода начинайте с low или с выключенным thinking. MTP в llama.cpp у него ускорил генерацию относительно дефолтного LM Studio. Это один тестер, не паспорт 3090.
Кому нужна локальная модель для кода
Запрос «локальная модель для кода» обычно маскирует четыре разные боли. Qwen 3.8 закрывает не все.
- Код не должен уезжать. Клиентский репозиторий, внутренние ключи в .env, которые вы как раз учите модель не коммитить, медицина, финтех, госконтур. Apache 2.0 и веса на диске здесь сильнее любого NDA у API.
- Квота кончилась, а задача нет. Ночные прогоны, массовый рефактор тестов, цикл «патч, тест, ещё патч» по сотне файлов. Подписка Claude Code упирается в окно 5 часов и weekly. Своя 3090 в этот потолок не упирается. Платите электричеством и временем.
- Карта уже есть. RTX 3090 / 4090 на 24 ГБ, или Mac с большим unified memory. Покупать 3090 «под эту одну модель» окупается только если вы жжёте агента каждый день. Для пет-проекта дешевле чужой API.
- Нужен объём, не вершина интеллекта. Пояснение легаси-модуля, тесты, рутинный CRUD, черновик PR, разбор скрина. Для архитектуры с нуля и для «я три часа в тупике» локальная 27B всё ещё запасной двигатель.
Не ставьте Qwen 3.8-27B единственным инструментом, если нет GPU от 24 ГБ, нужен SLA, задача разовая или команда упирается не в цену, а в качество длинного агентного цикла. Тогда локалка это хобби, которое ещё и тормозит.
Qwen 27B 3090: какой квант ставить
RTX 3090 это 24 ГБ. Не «любой 27B на любой карте». Рабочая схема на 20 августа 2026.
Какой файл качать на 24 ГБ
- Дефолт: Q4_K_M около 17 ГБ. Веса плюс 32k-64k контекста. Это то, что имеют в виду, когда пишут «Qwen 27B 3090».
- Хотите запас качества и готовы резать окно: Q5_K_M около 19,8 ГБ. На 24 ГБ живёт тесно.
- Нужен более длинный контекст на той же карте: Q3_K_M и квантованный KV-кэш. Качество кода просядет раньше, чем вам расскажет таблица.
- BF16 на 3090 не влезает. Точка.
Ловушки первой недели
Старый llama.cpp не знает архитектуру qwen35 и не грузит файл: сначала обновите рантайм. Без --jinja модель путает think-блоки, кажется, что она «забыла» прошлый ход. Зрение в GGUF это отдельный mmproj около 0,9 ГБ. Без него картинка молча игнорируется. Для скрина UI он нужен, для чистого рефактора TypeScript нет. Скорость на 3090 Alibaba не публикует. Ориентир с чужих машин: LM Studio без MTP часто 15-30 ток/с, hosted-медиана AA около 31 ток/с. Для агента важнее цикл без красной полоски лимита, чем пик токенов в секунду.
Одна 3090 против API
Считать надо не «бесплатная модель», а три статьи: железо, электричество, ваше время на возню с квантами.
Если 3090 уже куплена, маржинальная цена токена локально около нуля. API той же Qwen3.8-27B у Artificial Analysis на дату сверки: медиана провайдеров около $0,43 за миллион входа и $3,10 за миллион выхода. Выход дороже, reasoning по умолчанию жрёт выход. На болтливом xhigh облако быстро становится дороже «просто попробовать». Локально та же болтливость крадёт минуты, не доллары.
Если карты нет, не покупайте 3090 ради одного репозитория. Подержанная 24 ГБ окупается на ежедневном агенте, который иначе сжигает подписку каждую неделю. Для лендинга раз в месяц выгоднее облако. Для пяти человек с одной картой узкое место очередь, не качество модели. API Qwen, даже дешёвый, это чужой сервер. Если спор про утечку кода, таблица $/1M не решает. Если спор про дедлайн сегодня вечером, быстрый hosted-агент почти всегда выиграет по часам.
Когда Qwen локально, когда Claude Code
Это не «кто победил Opus». Это два разных рабочих контура.
Что оставить Claude Code
Оставляйте Claude Code, когда задача широкая, вы реально застряли, нужен зрелый агентный harness и план на сильной модели. На Terminal Bench 2.1 даже в таблице Alibaba Opus 4.6 Max выше. На HLE и GPQA тоже. Длинный цикл в IDE, субагенты, компакт истории: это продукт Anthropic, не файл GGUF. Как устроены weekly и окно 5 часов: лимиты Claude Code и экономия токенов.
Когда ставить Qwen 3.8 локально
Ставьте локально, когда есть 24 ГБ, код чувствительный или квота уже красная, задача серийная. Типичный день: объяснить модуль, набросать тесты, пройтись по TODO, разобрать скрин, прогнать правки, пока Claude Code ждёт сброса окна. Apache 2.0 здесь не лозунг: свой endpoint без ключа у третьей стороны.
Гибрид, который сходится у людей с 3090:
- План и спорная архитектура: Claude Code (Opus/Sonnet по задаче).
- Массовое исполнение, тесты, переименования, второй проход по диффу: локальный Qwen 3.8 на 3090.
- Тупик после локального цикла: снова Claude Code, короткий бриф, без перетаскивания всей истории.
Не кормите локальную 27B тем же «разберись сам по всему репо», которым жгут облако. Правила те же: узкий @файл, короткая сессия, проверка диффа глазами. Модель уверенно врёт и в GGUF, и в API. Разница только в том, кому вы за это платите.
Как попробовать без розовых очков
Самый дешёвый тест: hosted-эндпоинт той же модели на трёх ваших задачах. Один баг из вчерашнего спринта, один рефактор на 200 строк, один «объясни этот сервис». Не HumanEval из твита. Если ответы не тянут, 17 ГБ качать незачем. Если тянут, берите веса или GGUF у понятного издателя: Qwen, Unsloth, ggml-org. В первую неделю уже были репозитории-двойники. Сверяйте org. Рантайм: свежий llama.cpp, Ollama, LM Studio, для сервера vLLM или SGLang. Зрение выключайте, если не кормите скрины: энкодер жрёт память. Thinking первую неделю держите на low. Если xhigh даёт чуть лучше ответ и в разы больше времени, для рутины это плохая сделка. Смотрите, сколько ваших PR доходит до зелёных тестов, а не столбец Opus в чужой таблице.
Коротко
Qwen 3.8-27B от 14 августа 2026: Apache 2.0, 262k контекста, картинки и видео, GGUF в день весов. На Hugging Face быстро №1 в трендах, семейство Qwen самое скачиваемое среди открытых моделей. Карточка Alibaba ставит её рядом с Opus 4.6 Max на SWE-bench Pro (61,7 против 53,4) и LiveCodeBench v6. На Terminal Bench, GPQA и HLE Opus в той же таблице впереди. Artificial Analysis даёт независимые 52 на Intelligence Index, на уровне GPT-5.6 Luna, плюс медлительность и прожорливый reasoning.
Локальная модель для кода имеет смысл, если уже есть 24 ГБ, код не должен уезжать на API или подписка агента кончается раньше задачи. Qwen 27B на 3090 это Q4_K_M около 17 ГБ и умеренный контекст, не BF16 и не миллион токенов. Claude Code остаётся контуром на сложные агентные петли. Qwen 3.8 закрывает объём и контур «у себя». Путать роли из-за одного столбца в бенчмарке незачем.
