Через несколько дней после официальных весов Qwen3.8-27B на Hugging Face появилась сторонняя сборка Qwen3.8-27B-Uncensored-MLX. Издатель OrcaRouter, не команда Qwen. Веса аблитерированы: направление отказа вырезано из residual stream, затем квантованы в формат Apple MLX под Apple Silicon. Для вайб-кодера на Mac это не «uncensored ради NSFW» и не игровой чат. Это локальная модель для кода, которая реже отвечает «не могу помочь» на кодовых задачах, где выровненная 27B перестраховывается. CUDA нет. Дискретной NVIDIA нет. Есть unified memory ноутбука и фреймворк MLX.

База та же, что в разборе Qwen 3.8 как локальной модели на RTX 3090: плотные 27B, Apache 2.0, гибридное внимание, нативное окно 262 144 токена, зрение. Там путь GGUF и 24 ГБ видеопамяти. Здесь путь Mac и MLX. Бенчмарки базовой карточки, таблицу Alibaba и индекс Artificial Analysis не дублируем: они про выровненную 27B и про карту, не про эту сборку.

Что это за сборка и чем она не является

Официальный репозиторий Qwen/Qwen3.8-27B вышел 13-14 августа 2026. Лицензия весов Apache 2.0: коммерция, форк, перераспределение. Это не custom-лицензия флагмана Qwen3.8-Max. Uncensored-MLX наследует Apache 2.0 от базы. Издатель пишет прямо: Alibaba эту сборку не выпускала и не сопровождает. На Hugging Face рядом есть выровненные MLX-кванты вроде mlx-community/Qwen3.8-27B-4bit (около 16 ГБ, конвертация через mlx-vlm). Если отказы вас не бесят, берите выровненную. Uncensored нужна, когда выровненная 27B отказывается писать код, который вы имеете право писать у себя.

Технически это не дообучение и не LoRA «без цензуры». Аблитерация (метод Arditi et al., 2024): в весах находят направление отказа и ортогонализуют его. Новых знаний модель не получает. На линии FP8 той же аблитерации издатель 15 августа 2026 опубликовал свой safety-eval: отказ на вредоносных промптах падает с 64-99% у базы до 0-6%, benign over-refusal на XSTest-safe с 5,6% до 0,4%, MMLU / GSM8K / MMLU-Pro в пределах ±1,3 пункта от базы. Это замеры издателя на FP8, не независимый прогон Uncensored-MLX на Mac. Отдельного SWE-bench этой MLX-сборки в карточке нет. Считайте, что кодовый потолок близок к базе, а слой «я не буду это генерировать» почти снят.

Чего в названии нет:

«Uncensored» на коде: какие отказы мешают вайб-кодеру

Выровненные модели на кодовых задачах часто путают ваш репозиторий с атакой. Типичные отказы, ради которых берут эту сборку:

Для вайб-кодинга с нуля это тот же каркас, что в статье про сбор сайта через AI: агент читает файлы, пишет патч, смотрит скрин. Разница в том, куда уезжает код и где модель говорит «нет». На Mac с Uncensored-MLX код не покидает unified memory. Отказ на легитимной кодовой задаче реже обрывает цикл.

Обещания «никаких отказов никогда» нет. Аблитерация бьёт по направлению отказа, не по всем политикам. Часть ответов всё ещё начинается с короткого дисклеймера и затем всё равно пишет код: на FP8-линии издатель мерил 30-50% таких оговорок. Это не отказ. Это артефакт выравнивания. Для агента важнее, появился ли патч, а не тон преамбулы.

Риск, лицензия, чего эта сборка не покрывает

Карточка Uncensored-MLX говорит прямо: встроенных гардрейлов почти нет, модель выполнит запросы, которые база отклонила. Репозиторий gated: сначала аккаунт Hugging Face и принятие условий. Apache 2.0 не переносит вашу ответственность. Нелегальное применение остаётся нелегальным, какой бы квант вы ни скачали. Не выкладывайте эту сборку в продукт без своего слоя модерации. Не кормите её чужими прод-секретами «потому что локально», если NDA запрещает даже локальные копии у подрядчика. Локальность решает утечку на API, не юридический контур заказчика.

Если нужен обычный ассистент в чате с семьёй или публичный бот, берите выровненную Qwen3.8-27B или облако. Uncensored-MLX это инструмент на вашей машине, для вашего кода, с вашим риск-профилем.

MLX и unified memory: почему 24 ГБ это пол, а не «любой Mac»

MLX это array-фреймворк Apple Machine Learning Research под Apple Silicon. Нет отдельной VRAM, как у 3090. Веса, KV-кэш, macOS, IDE и браузер делят один пул RAM. Цифра «4-bit весит 15 ГБ» не равна «хватит 16 ГБ Mac». На 16 ГБ после системы свободными остаются далеко не 16. Для этой 27B реалистичный пол карточки: 24 ГБ unified memory. 16 ГБ Mac для рабочего 4-bit не вариант. 2-bit около 8,7 ГБ формально встаёт, карточка помечает его как сильно деградировавший, архивный.

Для текста на MLX обычно берут mlx-lm. Qwen3.8-27B это vision-language модель, Qwen3_5ForConditionalGeneration. Карточки MLX-квантов (и выровненных, и Uncensored) ставят рантайм mlx-vlm. Старый mlx-lm архитектуру qwen3_5 может не знать. Ставьте свежий пакет: в заметках первой недели фигурируют mlx-vlm 0.6.13+ и mlx 0.32+. Если генерация падает на неизвестном типе слоя, это почти всегда версия рантайма, не «модель сломана».

Нативное окно 262k у базы остаётся. На Mac его ест кэш, не маркетинг. Гибридная схема (16 слоёв полного внимания, 48 линейных Gated DeltaNet) держит KV дешевле обычной dense 27B, но полный 262k на 24 ГБ ноутбука всё равно серверная история. На 4-bit и 24 ГБ разумный рабочий контекст это десятки тысяч токенов, не монорепо целиком. Vision-башня, нормы и conv в этой сборке оставлены в BF16; квантуются линейные веса языковой части, включая embed_tokens и lm_head. Скрин UI для вайб-кодера полезен. На чистом рефакторе TypeScript зрение можно не кормить: энкодер всё равно занимает память.

Скорость Uncensored-MLX на конкретных чипах карточка не публикует. На выровненном 4-bit MLX той же 27B в публичных прогонах на Mac mini M4 32 ГБ фигурирует ориентир около 5-6 ток/с. Это не паспорт Uncensored-сборки и не M4 Max. Для сравнения: на 3090 с GGUF в обзорах первой недели часто 15-30 ток/с. Mac выигрывает тем, что карта уже стоит на столе. По сырому токену в секунду 3090 обычно быстрее. Агентный цикл на Mac живёт минутами, не «как облачный Opus».

Какой квант ставить на Mac

В репозитории четыре affine-кванта, group size 64. Корень репо зеркалит 4-bit, поэтому orcarouter/Qwen3.8-27B-Uncensored-MLX без подпапки в LM Studio грузит 4-bit. Цифры с карточки Hugging Face, сверка 24 августа 2026:

Не путайте эту линейку с Ollama-тегом вроде qwen3.8:27b-mlx: это выровненный MLX, не Uncensored. Не путайте с GGUF Q4_K_M на 3090: другой формат, другая память, другая статья.

Ловушки первой недели на Mac

Как запустить локальную модель для кода на Mac

Два рабочих пути. GUI: LM Studio с MLX-бэкендом на Apple Silicon. Ищете Qwen3.8-27B-Uncensored-MLX, ставите токен, берёте 4-bit на 24-32 ГБ, 6-bit или 8-bit только если RAM реально свободная. CLI: свежий mlx-vlm, загрузка подпапки 4-bit/, генерация или локальный OpenAI-совместимый сервер. Дальше Cursor, Aider, OpenCode, ваш скрипт смотрят в localhost. Код не уезжает.

Минимальный контур без GUI:

  1. Обновить mlx-vlm и mlx под архитектуру qwen3_5.
  2. Скачать только нужный квант, не все четыре: 8-bit на 32 ГБ Mac незачем.
  3. Прогнать одну вашу вчерашнюю задачу, не HumanEval из твита: баг из спринта, рефактор на 200 строк, «объясни этот сервис».
  4. Если ответы не тянут, удаляйте веса. Если тянут, поднимайте сервер и подключайте агента узким @файлом, не «разберись по всему репо».

Полный 262k в конфиге не ставьте «на всякий случай». Зафиксируйте потолок контекста под RAM. На 24 ГБ с 4-bit держитесь умеренного окна. Скрин ошибки кормите, когда он есть. На слепом рефакторе зрение только занимает память.

Mac и MLX против RTX 3090

Это не спор «кто умнее». Это два железа под одну семью весов. Подробный разбор GGUF, VRAM и 3090 уже есть: локальная Qwen 3.8 на RTX 3090. Здесь только развилка.

Покупать 3090, если 32 ГБ Mac уже стоит на столе и задача не в пиковом ток/с, обычно незачем. Покупать Mac Studio 128 ГБ ради одной 27B тоже незачем: 4-bit на 32 ГБ уже рабочий дефолт. Studio имеет смысл, если хотите 8-bit, длинный контекст и запас под IDE.

Когда Mac-локалка, когда Claude Code и API

Локальная Uncensored-MLX не отменяет облачный агент. Она закрывает дыры, где облако дорого, красное по квоте или слишком вежливое.

Оставляйте Claude Code на широкую задачу, тупик и длинный агентный harness. Как устроены weekly и окно 5 часов: лимиты Claude Code и экономия токенов. Когда лимит красный, Mac не смотрит на 5-часовое окно. Платите временем генерации и зарядкой, не подпиской.

Считать «бесплатно, потому что локально» нельзя в отрыве от часов. Облачный токен той же семьи 27B на hosted-провайдерах дороже на выходе, reasoning жрёт выход. На Mac болтливый xhigh крадёт минуты, не доллары. Сколько стоят чужие токены в облаке: сколько стоят токены Claude и GPT. Если спор про утечку клиентского репо, таблица $/1M не решает. Если спор про дедлайн сегодня вечером, быстрый hosted-агент чаще выиграет по часам.

Гибрид, который сходится у людей с Mac 32 ГБ+:

  1. План, спорная архитектура, «я три часа в тупике»: Claude Code.
  2. Массовое исполнение, тесты, легаси-пояснения, задачи, на которых выровненная модель отказывается писать код: локальный Uncensored-MLX 4-bit.
  3. Короткий возврат в Claude Code без перетаскивания всей истории, если локальный цикл застрял.

Не кормите 27B на ноутбуке тем же «разберись сам по монорепо», которым жгут облако. Узкий файл, короткая сессия, дифф глазами. Модель врёт и в MLX, и в API. Разница в том, кому уезжает репозиторий и кто говорит «нет» на вашем же баге.

Коротко

Qwen3.8-27B-Uncensored-MLX это сторонний MLX-квант аблитерированной Qwen3.8-27B под Apple Silicon. Лицензия Apache 2.0 от базы. Официальный Qwen это Qwen/Qwen3.8-27B. Uncensored не про NSFW и не про игры. Это локальная модель для кода на Mac, с меньшим числом отказов на кодовых задачах и без встроенных гардрейлов. Дефолт: 4-bit ~15 ГБ на Mac с 24-32 ГБ unified memory, рантайм mlx-vlm или LM Studio, KV-quant выключен, thinking на low. 16 ГБ Mac и 2-bit не рабочий контур. 3090 остаётся путём GGUF и более высокого ток/с; Mac остаётся путём «карта уже в корпусе». Claude Code остаётся контуром на сложные петли и квоты. Сверяйте org на Hugging Face, не обещайте себе 262k на 24 ГБ и не путайте выровненный mlx-community квант с этой сборкой.