13 августа 2026 г.

Бесплатная нейросеть на своём компьютере: Meta Glimmer 30B

локальные моделиинструментыии-агентыавтоматизация

Карты на стол. 10 августа Meta выложила в открытый доступ Glimmer - модель на 30 миллиардов параметров, которая целиком умещается в одну домашнюю видеокарту. Apache 2.0, качай откуда хочешь, ставь в свой продукт, ничего никому не должен. Без подписки, без облака, без риска, что твой код или переписка уйдут на чужой сервер.

Я уже разбирал похожую историю с моделями для кода в VS Code - там локальная Qwen заменяла Cursor тем, у кого не проходит оплата или просто жалко платить за подписку каждый месяц. Glimmer - следующий шаг. Она не про автодополнение, она про агентные задачи: пусть сама вызывает инструменты, читает файлы, смотрит скриншоты и доводит многошаговую задачу до конца, а не просто подсказывает следующую строчку.

Зачем Meta вообще это сделала

Glimmer - не флагман Meta. Флагман называется Muse Spark, он закрытый и живёт только в облаке компании. Glimmer - его младший брат, обученный через дистилляцию: большая модель передала знания меньшей. Это часть манифеста Цукерберга про «персональный суперинтеллект» - он должен жить на машине у каждого, а не оставаться привилегией пары корпораций. Открывают младшую модель, флагман оставляют себе - разумная бизнес-логика, но именно младшая модель нам и нужна для практики.

Технически это плотный трансформер на 30 миллиардов параметров плюс отдельный модуль восприятия для картинок - Glimmer работает и с текстом, и со скриншотами. Контекст - 128 тысяч токенов, можно поднять и до четверти миллиона. Знания модели обрезаны на 4 января 2026 года - для свежих фактов из интернета она бесполезна, но агентные и рабочие задачи от этого не страдают.

Зачем локальная модель, если есть облако

Причины ровно те же, что и с локальным кодом. Приватность - запрос никуда не уходит, обрабатывается на твоей машине. Деньги - ноль рублей после покупки железа, никакой ежемесячной подписки и никакой пляски с картой, которую не примет американский биллинг. И доступность - модель работает даже без интернета, что не про кино, а про реальный сценарий: агент разбирает документы или гоняет тесты, пока у тебя дома отвалился провайдер.

Обратная сторона тоже есть, и я скажу о ней сразу, а не спрячу в конце. Glimmer весит меньше, чем топовые облачные модели, и решает не все задачи одинаково хорошо. Дальше расскажу, где именно.

Что нужно по железу

Модель в родной точности (BF16) требует около 58 гигабайт памяти - это уже не для дома. Но её квантуют, и официальный стартовый вариант от Meta и Unsloth занимает около 17 гигабайт весов, что комфортно влезает в 24-гигабайтную видеокарту с запасом под контекст диалога.

24 гигабайта - это RTX 3090, RTX 4090 или RTX 5090. Именно поэтому в новостях звучит «одна RTX 3090»: карта не самая новая, но с 24 гигабайтами видеопамяти её вполне хватает под 4-битный квант.

Квантование Память Кому подходит
2-бит 12-14 ГБ RTX 3060 12ГБ, RTX 4060 Ti 16ГБ - с потерей точности
4-бит (рекомендован) 17 ГБ RTX 3090/4090, есть запас под контекст
6-бит 20-22 ГБ та же RTX 3090, если хочешь точнее
8-бит 34 ГБ профессиональные карты
BF16 (полная точность) 58 ГБ серверное железо

Столбчатая диаграмма требуемой видеопамяти для Glimmer 30B по уровням квантования: 2-бит 13 ГБ, 4-бит 17 ГБ, 6-бит 21 ГБ, 8-бит 34 ГБ, BF16 58 ГБ

Есть жизнь и без Nvidia. Mac на чипах M4 Max или M5 Max с достаточной unified-памятью тянет модель, просто медленнее. AMD тоже подключилась - Ryzen AI Max и профессиональные карты Radeon AI PRO с 32 гигабайтами памяти официально поддержаны.

Как поставить: три пути

Самый быстрый путь - Ollama. Одна команда ollama run muse-glimmer качает и запускает модель. Учти только версию: поддержка Glimmer появилась в довольно свежем релизе Ollama, если у тебя стоит старая версия - сначала обнови. По умолчанию тянется 4-битный вариант на 18 гигабайт, для Apple Silicon есть отдельная сборка под MLX.

Кому нужен интерфейс с кнопками, а не терминал - берёт LM Studio. У него графический каталог моделей, Glimmer там уже заведена, и подключается всё так же, как я показывал в статье про Ollama и Continue для VS Code.

Третий путь - Unsloth, если хочешь тонкую настройку кванта или собираешься дообучать модель под свою задачу. У них есть Unsloth Desktop (нативный установщик - .dmg для Mac, .exe для Windows, .deb для Linux, скачать с unsloth.ai/download) и набор готовых GGUF-файлов на Hugging Face под все уровни квантования из таблицы выше.

Что она реально умеет и где проигрывает Qwen

Честные цифры, без розовых очков. Meta сравнивала Glimmer с Qwen3.6-27B и Gemma4-31B - моделями примерно того же класса. Картина неровная, и это нормально для модели такого размера.

На агентных бенчмарках Glimmer выигрывает заметно: на MCP Atlas (вызов инструментов через протокол MCP) у неё 75.5 против 62.5 у Qwen и 54.2 у Gemma. На DeepSearch QA - 74.6, на математическом AIME 2026 - 94.7. Здесь модель обучали прицельно, и это видно.

А вот там, где нужна работа с терминалом и управление компьютером напрямую, картина обратная. На OSWorld-Verified у Glimmer 65.9 против 75.6 у Qwen, на SWE-Bench Verified и TerminalBench Qwen тоже впереди. Общий вывод из обсуждений на Hacker News звучит трезво: Glimmer уверенно выигрывает оркестрацию инструментов и рассуждение, но проседает на чистом кодинге и работе с терминалом - там разрыв с Qwen намного меньше, а кое-где Qwen просто лучше.

Сравнение Glimmer и Qwen3.6-27B на бенчмарках MCP Atlas и OSWorld-Verified: Glimmer впереди на MCP Atlas (75.5 против 62.5), Qwen впереди на OSWorld-Verified (75.6 против 65.9)

Сценарии: что с ней реально делать

Локальный кодинг-агент для чувствительных репозиториев - тот самый случай с багом на 14 гигабайтах видеопамяти. Не для сложной архитектуры с нуля, а для рутинного разбора: найти причину падения теста, предложить фикс, написать PR-описание.

Автоматизации с вызовом инструментов через MCP - ровно то, где Glimmer выигрывает больше всего. Свой ассистент, который читает почту, дёргает API, заполняет таблицы - без ежемесячной платы за облачный вызов каждой такой мелочи.

Разбор документов и скриншотов. Модуль восприятия картинок работает не только с текстом - можно скормить скриншот интерфейса и попросить описать, что на нём происходит, или собрать данные с изображения в таблицу.

LLM-судья для собственных пайплайнов - если ты уже гоняешь генерацию контента через агентов и тебе нужен второй, более дешёвый слой проверки качества, локальная модель для этого подходит идеально: она не должна быть гением, ей нужно стабильно сверяться с критериями.

Стоит ли овчинка выделки

Если у тебя уже стоит RTX 3090 или похожая карта с 24 гигабайтами - да, ставить точно стоит, вечер на установку и дальше бесплатный локальный агент для повседневных задач. Если карты нет и покупать её только ради этого не готов - можно попробовать 2-битный вариант на более скромном железе, честно ожидая просадку по качеству.

Если весь твой рабочий день - это тяжёлый кодинг и работа с чужими сложными кодовыми базами, облачный фронтир пока обходит Glimmer с запасом, и это нормально: модель на 30 миллиардов параметров не обязана конкурировать с моделями, которые в разы крупнее. Но для агентных задач, вызова инструментов и всего, что не требует передавать данные наружу, Glimmer - первая модель от Meta, которая реально годится на роль домашнего рабочего инструмента, а не демонстрационной игрушки.

Я себе уже качаю - есть пара внутренних агентов, которым не нужна облачная мощь, зато важно, чтобы они крутились без остановки и без счёта за токены. Как обкатаю на реальных задачах - расскажу отдельно, что получилось, а что нет.

← Все статьи