5 августа 2026 г.

Бесплатный AI для кода в VS Code: локальная модель вместо Cursor

инструментыавтоматизациябез кода

Карты на стол. Cursor и Copilot - удобные. Но за них надо платить, а из России ещё и платить-то толком нечем. И весь твой код при этом улетает на чужие сервера.

Есть путь, где помощник для кода живёт прямо в VS Code, работает бесплатно и никуда твой код не отправляет. Локальная модель для кода в VS Code, на твоей же машине. Ставится за вечер. Ниже - что брать под своё железо, как всё собрать и где эта штука реально проседает. Без сказок, что она заменит облако один в один.

Почему подписка на Cursor и Copilot из России - это отдельный квест

Коротко: дело не только в цене. Из РФ платёж за Cursor и Copilot часто просто не проходит, а те, кто оплатил через обходы, ловят бан аккаунта. Плюс код уходит в облако - для чужих проектов это иногда стоп-фактор сам по себе.

Cursor проводит оплату через Stripe. Карты российских банков он отклоняет автоматически - и Visa, и Mastercard, и неважно, что на карте есть деньги. Народ на форуме Cursor это обсуждает годами (раз, два). У Copilot биллинг тоже американский, механика та же.

Дальше веселее. Люди пишут, что провайдеры «банят платные аккаунты с подписками, купленными за полную цену» - то есть ты заплатил через посредника, а потом тебя всё равно выкинули (обсуждение на Хабре). Там же про лимиты: оплатил $20, через пару дней упёрся в потолок, а сколько именно списывают - непрозрачно.

И отдельная история - приватность. Любой запрос агента в облаке - это твой код на чужом сервере. Для пет-проекта плевать. Для клиентского репозитория - совсем другое дело.

Локальная модель снимает все три боли разом. Ей не нужна ни карта, ни VPN, ни подписка, которую могут отклонить или забанить. И код никуда не уходит.

Что вообще собираем: Ollama плюс Continue в VS Code

Коротко: нужны две вещи. Ollama - это движок, который качает и крутит модель у тебя на машине. Continue - расширение VS Code, которое даёт этой модели руки: автодополнение по Tab, чат по коду и правки прямо в файле. Обе штуки бесплатные и с открытым кодом.

Continue - это как раз замена привычной связке «Copilot для автодополнения плюс чат». У него четыре режима: автодополнение (инлайн-подсказки, как у Copilot), чат, правки в текущем файле и лёгкий агентный режим с доступом к терминалу. Переключаются по Ctrl+.. Ставится из маркетплейса VS Code, лицензия Apache-2.0, денег не просит.

Ollama - это то, что реально запускает модель. Ты говоришь ей «скачай Qwen», она качает веса из своего реестра и поднимает локальный сервер на localhost:11434. Continue к этому серверу и подключается.

Я уже показывал похожий трюк с дешёвой GLM в облаке - там ты платишь копейки за чужой сервер. Здесь путь честнее для приватности: наружу вообще ничего не уходит, потому что и модель, и код - на твоей машине.

Не нравится терминал - вместо Ollama можно взять LM Studio, у него графический каталог моделей и кнопочки. Continue умеет подключаться и к нему. Но дальше показываю на Ollama, он тут стандарт.

Какую модель брать под твоё железо

Коротко: под автодополнение бери маленькую модель на 1.5-3 миллиарда параметров, под чат - 7B, а 14B и 32B имеют смысл только если у тебя видеокарта на 24 ГБ. Главная ошибка новичка - схватить самую большую модель и получить тормоза. Ориентир - Qwen2.5-Coder, у него есть все размеры.

Вот честная таблица, что реально тянет какое железо.

Железо Что тянет Скорость
Ноутбук без дискретной видеокарты 1.5B-3B на автодополнение, чат идёт медленно -
RTX 3060 12 ГБ (ходовая) 7B-14B в 4-битном квантовании Qwen2.5-Coder 7B Q4 ≈ 42 ток/с
RTX 4060 8 ГБ 7B комфортно, 14B впритык -
Mac M1/M2 16 ГБ 7B в 4-битном квантовании ≈ 15-25 ток/с, стриминг ощущается естественно
RTX 3090/4090 24 ГБ 32B и выше -

Логика простая. У Ollama есть прямое правило по памяти: «минимум 8 ГБ оперативки под модели на 7B, 16 ГБ под 13B и 32 ГБ под 33B» (документация Ollama). Если модель не влезла в видеопамять, она молча уползает считаться на процессоре - и всё начинает тормозить. Про эту граблю ещё скажу отдельно.

Оптимум «под всех» на сегодня - Qwen2.5-Coder 7B в 4-битном квантовании, файл всего 4.7 ГБ. На ходовой RTX 3060 на 12 ГБ он выдаёт около 42 токенов в секунду - для чата и правок нормально. Плюс к нему маленькая Qwen2.5-Coder на 1.5B под автодополнение. Сама Alibaba говорит, что 32B-версия «догнала по коду GPT-4o» (блог Qwen). Только держи в голове: GPT-4o - это фронтир 2024 года. Сегодняшние облачные модели ушли заметно дальше.

Тут же полезно понимать про деньги. Cursor Pro - это $20 в месяц. Годовая подписка - $192, это около 15 000 ₽ по курсу ЦБ (~76 ₽ за доллар), а помесячно за год набегает под 18 000 ₽. И это если платёж вообще пройдёт, без наценки посредников. Локальная Qwen на твоей же 3060 - 0 ₽ в год. Если сомневаешься, стоит ли возиться, - вот тебе весь расклад.

Ставим Ollama и качаем модель

Коротко: поставить Ollama - одна команда, скачать модель - вторая. На Windows это обычный установщик с сайта, на Mac и Linux - одна строчка в терминале. Дальше тянешь две модели: большую на 7 миллиардов параметров под чат и маленькую на 1.5 под автодополнение. Потом проверяешь, что локальный сервер поднялся, и переходишь к настройке VS Code.

На Mac или Linux ставим так: curl -fsSL https://ollama.com/install.sh | sh. На Windows качаешь установщик с ollama.com/download и ставишь как обычную программу.

Дальше тянем модели. Одна большая под чат, одна маленькая под автодополнение:

ollama pull qwen2.5-coder:7b

ollama pull qwen2.5-coder:1.5b

Проверить, что всё поднялось: набери ollama list - увидишь скачанные модели. А если открыть в браузере localhost:11434, там должно быть написано «Ollama is running». Значит, сервер живой и Continue сможет к нему подключиться.

Веса Ollama тянет из своего реестра. Из России он, по имеющимся данным, работает без VPN - жалоб именно на блокировку реестра я не нашёл, хотя качать может и небыстро. А вот Hugging Face российские адреса режет напрямую (это санкции, не Роскомнадзор) - поэтому удобнее, что Ollama качает из своего хранилища, а не оттуда.

Подключаем модель к VS Code через Continue

Коротко: ставишь расширение Continue из маркетплейса VS Code, потом в его конфиге прописываешь две модели - большую на чат и правки, маленькую на автодополнение. Обе смотрят на локальный Ollama. Автодополнению обязательно нужна отдельная быстрая модель: повесишь на него большую чат-модель - подсказки начнут заметно опаздывать и тупить, и весь смысл теряется.

Расширение ищется в маркетплейсе VS Code по слову Continue, ставится в один клик. Настройки живут в файле config.yaml в папке ~/.continue/. Вот рабочий конфиг под нашу связку:

name: local-assistant
version: 0.0.1
schema: v1
models:
  - name: Qwen2.5-Coder 7B (чат и правки)
    provider: ollama
    model: qwen2.5-coder:7b
    apiBase: http://localhost:11434
    roles:
      - chat
      - edit
  - name: Qwen2.5-Coder 1.5B (автодополнение)
    provider: ollama
    model: qwen2.5-coder:1.5b
    apiBase: http://localhost:11434
    roles:
      - autocomplete

Обрати внимание на роли. Большая модель - на chat и edit. Маленькая - на autocomplete. Это не блажь. В документации Continue прямо написано: «чат-модели, хоть и крупнее, часто работают плохо на автодополнении даже при куче подсказок» (Continue docs). Автодополнению нужна скорость. Подсказка должна выскакивать за доли секунды, пока ты печатаешь, - большая модель тут только тормозит. Поэтому туда ставят маленькую специальную модель, и даже трёхмиллиардной хватает.

Если хочешь не просто автодополнение и чат, а чтобы агент сам бегал по файлам и правил проект - посмотри в сторону Cline или Roo Code. Это отдельные расширения, автономные агенты, тоже умеют локальный Ollama. Только инлайн-автодополнения они не дают - это разные задачи. По уму ставят Continue под автокомплит и чат, а Cline докидывают под агентные заходы. Они не мешают друг другу.

Грабли, на которых спотыкаются все

Коротко: почти все затыки сводятся к двум вещам - либо взял слишком большую модель для своего железа, либо ошибся в мелочи при подключении к Continue. Ниже пять самых частых граблей с готовыми фиксами, чтобы ты не потерял на них весь вечер и не бросил всё на полпути.

Грабли были, куда без них. Собрал самые типовые.

  • Скачал модель, а в Continue её нет. Расширение не всегда подхватывает список на лету. Лечится перезапуском VS Code целиком, и проверь, что имя модели в конфиге совпадает с тегом Ollama до буквы.
  • Ollama работает, а Continue не достучится. Проверь, что сервер поднят: ollama serve, потом curl localhost:11434 должен ответить «Ollama is running». И не дописывай в адрес модели никаких /v1/chat/... - только чистый localhost:11434, иначе получишь 404.
  • Автодополнение тормозит. Верный признак, что ты повесил на него большую чат-модель. Верни туда маленькую 1.5B, как в конфиге выше.
  • Всё еле ползёт целиком. Скорее всего, модель не влезла в видеопамять и Ollama тихо считает её на процессоре. Набери ollama ps - он покажет, что где крутится, на GPU или на CPU. Уползло на CPU - бери модель поменьше. Это, по словам самих мейнтейнеров, «самый частый источник путаницы» у новичков (issue Ollama).
  • Модель как будто забывает начало файла. По умолчанию Ollama держит контекст всего в 2048 токенов (FAQ Ollama). На длинном файле она просто не видит его целиком. Поднимается параметром num_ctx, но помни - чем больше контекст, тем больше жрёт памяти, а её у тебя не резиновое количество.

Где локалка честно слабее облака

Коротко: локальная модель влезает в домашнюю видеокарту. И решает примерно вдвое меньше задач, чем облачный фронтир. Она медленнее без хорошей GPU, хуже держит большой контекст и чаще спотыкается на длинных агентных цепочках. Берёшь её за приватность и ноль рублей. Мощность облака она не повторяет, и это нормально.

Давай без розовых очков. Есть бенчмарк Aider на 225 задачах по коду. Топовые облачные модели решают под 88%, Claude Opus - 72%, а Qwen3 32B - та, что ещё как-то влезает в домашнюю 24-гиговую карту - около 40% (таблица Aider). То есть локально ты решаешь примерно половину от того, что дал бы облачный фронтир. Это честная цифра, её надо знать заранее.

Где ещё проседает. Скорость: без нормальной видеокарты, на голом процессоре, даже автодополнение не всегда попадает в комфортные доли секунды. Контекст: заявленные в описании модели сотни тысяч токенов ты локально не получишь, память не даст. Агентные задачи: там, где надо сделать восемь шагов подряд, одна ошибка на третьем валит всю цепочку - и вот тут разрыв с облаком виден сильнее всего.

Вывод простой. Уходя на локалку, ты меняешь часть мощности на приватность и нулевую стоимость. Для автодополнения, чата по коду, объяснений и правок в одном-двух файлах - за глаза. Собрать сложный проект с нуля руками агента - тут облако пока честно сильнее.

Сколько это экономит и кому реально надо

Коротко: Cursor Pro - около 15 000 ₽ в год, Copilot Pro - около 7 600 ₽, и это без наценки посредников за обход оплаты. Локальная модель - 0 ₽ навсегда, один раз тратишься на железо. Реально надо тем, у кого не проходит оплата, важна приватность кода или просто жаба душит платить за подписку.

Посчитаем на пальцах. Курс ЦБ в июле - около 76 ₽ за доллар (ЦБ РФ). Cursor Pro - $20 в месяц, годовая подписка $192, это около 15 000 ₽ в год. Copilot Pro - $100 в год, примерно 7 600 ₽. Но для нас это даже не потолок, а пол: прямая оплата не проходит, а посредники берут сверху 15-25% от стоимости за каждый платёж (разбор на vc.ru). Локальная Qwen на твоём железе - ноль рублей в год и ноль квеста с картой.

Кому это точно стоит собрать: у кого оплата в принципе не проходит и надоело искать обходы; кто пишет код по чужим проектам и не хочет, чтобы он утекал в облако; и кто просто не готов отдавать 15 000 ₽ в год за то, что можно крутить у себя. Кому не надо: если ты каждый день собираешь сложные проекты целиком через агента и облако у тебя оплачено - оставайся на нём, локалка тебя пока замедлит.

А дальше - вопрос вкуса. Мне нравится, когда инструмент мой, живёт на моей машине и ничего не просит. Ты собирал уже что-то локально под себя, или всё ещё сидишь на подписках? Расскажи, интересно, кто на чём.

← Все статьи