18 сентября 2026 г.

Нейросеть на 27 миллиардов параметров запускается прямо в браузере

Андрей Присекин
Автор

Андрей Присекин

Создаю AI-агентов, автоматизирую бизнес-процессы

Нейросеть на 27 миллиардов параметров теперь запускается прямо во вкладке браузера - без установки, без облака и без топовой видеокарты. Модель Ternary Bonsai 2 сжали примерно до 6 гигабайт тернарными весами и научили считать на WebGPU. Открываешь ссылку, один раз ждёшь загрузку - и дальше всё работает на твоём устройстве.

Ещё год назад такое звучало бы как фантастика: чтобы запустить модель этого размера локально, нужна была видеокарта за пару тысяч долларов и вечер возни с драйверами. Теперь достаточно вкладки в Chrome. Разберу по порядку, что за трюк это сделал возможным и стоит ли он твоего внимания.

Что вообще произошло

На Hugging Face выложили Ternary Bonsai 2 - модель на 27 миллиардов параметров, собранную на базе открытой Qwen3.8-27B. Архитектуру не трогали, а вот веса перевели в тернарный формат, и за счёт этого файл модели ужался примерно до 6 гигабайт. Это примерно в девять раз меньше, чем та же модель в полной точности.

Отдельно от самой модели выложили демо-страницу на Hugging Face Spaces, где она крутится прямо в браузере через WebGPU. Никакого сервера за спиной: страница скачивает веса к тебе на устройство и дальше считает локально. За первые дни gguf-версия модели набрала сотни тысяч загрузок и попала в топ трендов Hugging Face - тема явно зацепила.

Чтобы почувствовать масштаб: та же модель в полной точности заняла бы под 60 гигабайт - это серверное железо или пара топовых видеокарт. В тернарном виде она весит как один хороший фильм в высоком качестве. Именно поэтому её вообще не страшно тянуть в браузер.

По цифрам качества авторы модели заявляют, что тернарная версия теряет считанные проценты относительно исходной. Проверить это на своих задачах можно только руками, поэтому к заявленным процентам отношусь спокойно: важнее сам факт, что модель такого размера вообще влезла в браузерную вкладку.

Что такое тернарные веса

Обычная модель хранит каждый вес как число с плавающей точкой - 16 или 32 бита на параметр. Тернарный вес хранит всего три возможных значения: минус один, ноль и плюс один. Три варианта - это примерно 1.58 бита на параметр вместо шестнадцати. Отсюда и вся экономия памяти.

Идея не новая. Её вывели в исследовании BitNet b1.58 от Microsoft: модель обучают сразу в тернарном виде, а не жмут готовую после обучения. Во время тренировки модель держит точную копию весов для расчёта градиентов, но на выходе всегда видит округлённую тернарную версию - и потому учится весам, которые переживают это округление без большой потери качества.

Есть и приятный побочный эффект для скорости. Когда веса - это только минус один, ноль и плюс один, умножение в матрице превращается в сложение и вычитание: плюс один - прибавить, минус один - вычесть, ноль - пропустить. Умножать числа больше не надо, а сложение железо делает намного дешевле. Память экономится, и вычисления упрощаются одновременно.

Почему модель поместилась в браузер

Второй герой истории - WebGPU. Это стандарт, который даёт веб-странице прямой доступ к видеокарте, минуя всякие обёртки. К середине 2026 года он включён по умолчанию во всех основных браузерах: Chrome и Edge, Firefox, Safari на свежих macOS и iOS. То есть аппаратное ускорение для нейросети есть прямо в браузере, который у тебя и так открыт.

Дальше подключается библиотека вроде Transformers.js или WebLLM. Она берёт модель, скачивает её один раз, кладёт в кэш браузера и запускает инференс на твоей видеокарте. Никакого сервера, никакого API-ключа, ни один запрос не улетает наружу. По замерам сообщества, WebGPU считает нейросети в 5-20 раз быстрее, чем старый способ через WebAssembly, - то есть это уже не игрушка, а рабочая скорость.

Схема запуска нейросети в браузере: открыл вкладку, модель скачалась один раз, дальше работает офлайн на устройстве

Собери два факта вместе - и получится сегодняшняя новость. Тернарные веса ужали 27-миллиардную модель до размера, который не страшно скачать в браузер. WebGPU дал этому браузеру доступ к железу. По отдельности обе технологии существовали и раньше, но встретились они только сейчас.

Что это даёт на практике

Главное - приватность по умолчанию. Модель работает на твоём устройстве, и переписка физически никуда не уходит. Для черновиков, личных заметок, рабочих документов под NDA это другой уровень спокойствия, чем чат в облаке, который может учиться на твоих данных.

Второе - ноль возни и ноль денег. Не надо ставить Python, качать десятки гигабайт через отдельный лончер, разбираться с драйверами и квантованием. Открыл ссылку, подождал загрузку - работаешь. Это снимает главный барьер, из-за которого локальные модели до сих пор оставались темой для гиков, а не для обычного человека.

Третье - модель работает офлайн. После первой загрузки интернет не нужен вообще. Отвалился провайдер, сидишь в самолёте, плохая связь в поездке - локальная модель в браузере продолжает отвечать. И четвёртое, менее очевидное: это ещё и способ показать модель другому человеку одной ссылкой. Не «поставь себе Python и лончер», а «открой вкладку» - порог входа падает до нуля, и это меняет то, кому вообще доступны локальные модели.

Как попробовать прямо сейчас

Порядок простой. Нужен свежий Chrome или Edge - в них поддержка WebGPU самая стабильная. Открываешь демо-страницу Ternary Bonsai 2 на Hugging Face Spaces (ищется по названию модели в разделе Spaces). Страница начинает качать веса - это те самые несколько гигабайт, и это самый долгий шаг. Дальше можно писать в окно чата, и ответы считаются локально.

Тернарный вес хранит всего три значения на параметр - минус один, ноль и плюс один

По железу требования скромные по меркам локальных моделей, но не нулевые. Нужна видеокарта или встроенная графика, которую WebGPU увидит, и запас оперативной памяти под те самые 6 гигабайт модели. На современном ноутбуке или мощном телефоне это реально - собственно, в этом и весь смысл затеи. На совсем старой машине страница может не потянуть или будет отвечать медленно.

Где подвох

Честно про ограничения. 27 миллиардов параметров в тернарном виде - это крепкая рабочая модель, но не флагман уровня облачных Claude или GPT. Она хорошо справится с черновиком, суммаризацией, простым кодом и разбором текста, но на сложных многошаговых задачах разница с большими облачными моделями будет заметна. Это инструмент «под рукой и бесплатно», а не замена всему.

Первая загрузка - несколько гигабайт. На быстром интернете это минуты, на мобильном - боль. И если очистишь кэш браузера, качать придётся заново. На ноутбуке долгая генерация греет железо и сажает батарею быстрее, чем обычный чат в облаке: считает-то твоя видеокарта, а не чужой дата-центр.

И заявленные проценты сохранённого качества - это цифры от авторов модели. Реальную пригодность под свою задачу можно понять только на практике: дать модели свои типичные запросы и посмотреть, устраивает ли результат. Как и с любой моделью, лидерборд - не гарантия.

Что это значит

Пару лет назад «локальная нейросеть» означала мощный ПК и вечер настройки. Сейчас направление движется в обратную сторону: модели учатся сжиматься так, чтобы влезать в телефон и браузер без потери здравого смысла. Тернарные веса - один из самых наглядных шагов на этом пути, и Ternary Bonsai 2 показывает, что это уже не лаборатория, а работающее демо, которое может открыть любой.

Для тебя вывод практический. Если нужен приватный ИИ под личные заметки и черновики - теперь для этого не нужны ни подписка, ни настройка, ни отдельное железо. Достаточно открыть вкладку. А общий тренд стоит держать в голове: чем дальше, тем больше полезного ИИ будет жить прямо на твоих устройствах, а не только в чужом облаке.

← Все статьи