Локальный ИИ-агент это программа, которая держит нейросеть прямо на вашем компьютере и умеет выполнять шаги сама: читать файлы, править их, запускать команды. Ни облака, ни оплаты подписки ей не нужно, зато нужна память. Ниже разберём, сколько памяти требуется на самом деле, чем «локальная модель» отличается от агента, какими программами всё это ставят в 2026 году и в каких случаях возня с локальным запуском не окупается.
Локальная модель и локальный агент это разные вещи
Модель это файл с весами плюс движок, который по вашему тексту достраивает ответ. Она умеет ровно одно: говорить. Скачали, запустили, получили чат в окне терминала или приложения.
Агент это модель плюс три добавки: инструменты (доступ к папке с файлами, к терминалу, к поиску), цикл выполнения (модель делает шаг, видит результат, решает, что дальше) и права, которые вы ей выдали. Без этой обвязки нейросеть напишет вам, какую команду выполнить, но не выполнит её. Разницу между агентом и обычным чат-ботом мы подробно раскладывали в материале про ИИ-агентов простыми словами.
Практический вывод простой: скачать модель через Ollama это ещё не агент. Агентом её делает программа сверху, и выбирать придётся две вещи отдельно, модель и обвязку.
Зачем держать агента у себя, а не в облаке
- Приватность. Текст запроса, содержимое файлов и код не уходят на чужой сервер. Это главный аргумент для медицинских, юридических и бухгалтерских документов, договоров и внутренних баз.
- Работа без интернета. После того как модель скачана, она отвечает в самолёте, на даче и при упавшем провайдере. Сеть понадобится только для веб-поиска и обновления моделей.
- Нет подписки и оплаты картой. Оплата зарубежных сервисов из России отдельная задача, а локальный запуск её просто снимает: программы бесплатные, платите вы только электричеством и железом.
- Нет лимитов и счётчика токенов. Можно гонять модель хоть сутки: закончится не квота, а ваше терпение.
- Свобода эксперимента. Можно менять модели, дообучать под себя, встраивать в свои скрипты и не ждать, пока сервис добавит нужную функцию.
Запущенная модель это движок, а результат появляется, когда на нём собрано что-то рабочее. На бесплатном вебинаре по вайбкодингу показываем, как собрать первый проект.
Занять местоЧто реально требуется от железа
Правило одно: модель должна целиком поместиться в память, и лучше в видеопамять, а не в оперативную. Размер скачиваемого файла это нижняя граница, сверху добавляется место под контекст (историю диалога) и под саму систему, обычно ещё пара гигабайт.
Ориентиры по реальным весам моделей из каталога Ollama на август 2026:
- 8 ГБ памяти. Работают только небольшие модели: Gemma 3 на 4 млрд параметров весит 3,3 ГБ, Qwen3 на 4 млрд весит 2,5 ГБ. Для коротких ответов, черновиков и разбора текста годится, для агента со сложной задачей нет.
- 16 ГБ памяти. Рабочий минимум. Сюда влезает
qwen3:8b(5,2 ГБ) иqwen3:14b(9,3 ГБ), а также gpt-oss:20b от OpenAI: файл 14 ГБ, и разработчики прямо пишут, что модель рассчитана на системы с 16 ГБ памяти. - 24-32 ГБ памяти. Открывается
gemma3:27b(17 ГБ), которую Google описывает как самую способную модель своего семейства, работающую на одной видеокарте, иqwen3:30b(19 ГБ). - 80 ГБ видеопамяти. Уровень старшей
gpt-oss:120b(65 ГБ). Это уже не домашний компьютер, а серверная карта или аренда.
Отдельно про Mac: у чипов Apple Silicon память общая для процессора и графики, поэтому MacBook с 16 или 24 ГБ тянет модели, для которых на Windows понадобилась бы дискретная видеокарта такого же объёма. На Windows и Linux считайте по видеопамяти карты, а не по оперативке: если модель в неё не влезла, часть слоёв уедет на процессор и скорость упадёт в разы.
Начинайте с модели на размер меньше, чем позволяет память. Модель, которая едва влезла, оставляет ноль места под длинный контекст, и агент начинает забывать начало задачи ровно там, где становится интересно.
По теме: Яндекс ИИ-агент: что умеет Алиса AI и как пользоваться в 2026
Чем запускают модели: Ollama и LM Studio
Два инструмента закрывают почти все бытовые сценарии, и оба бесплатные.
Ollama это движок с командной строкой и локальным API. У него есть и обычное приложение для macOS и Windows с чатом и перетаскиванием файлов, но ценность в другом: Ollama поднимает у вас сервер на порту 11434, к которому потом подключаются все остальные программы. Ставится одним установщиком, модели качаются командой ollama pull.
LM Studio это приложение с графическим интерфейсом: каталог моделей с поиском, чат, настройки и встроенный сервер API. Подходит тем, кому не хочется видеть терминал вообще: выбрали модель в списке, нажали загрузить, начали общаться.
- Скачайте установщик Ollama с официального сайта и поставьте как обычную программу.
- Откройте терминал (в Windows это PowerShell) и проверьте установку командой
ollama --version. - Скачайте первую модель под свою память, например
ollama pull qwen3:8bдля машины с 16 ГБ. - Запустите чат командой
ollama run qwen3:8bи задайте пару вопросов, чтобы оценить скорость ответа. - Если скорость устраивает, попробуйте модель на ступень больше. Если модель отвечает по слову в секунду, берите меньше.
Железо и установка это техника, а ценность даёт навык ставить агенту задачи так, чтобы он доводил их до конца. На бесплатном вебинаре по вайбкодингу разбираем это на живом проекте и отдаём гайд в подарок.
Записаться на вебинарКак из локальной модели получить именно агента
Дальше к запущенной модели нужно приделать руки. В 2026 году это делают тремя способами.
Готовое агентское приложение. 16 июля 2026 года команда LM Studio выпустила Bionic, отдельную программу для Mac и Windows: она разбирает документы, PDF и таблицы в песочнице, работает внутри папки с кодом, запускает команды оболочки и делает автоматические контрольные точки, чтобы правки можно было откатить. Модель при этом может быть локальной, то есть ваши файлы остаются на диске.
Кодовый агент на локальной модели. Codex CLI от OpenAI умеет работать не с облаком, а с вашим Ollama. По инструкции Ollama флаг --oss переключает Codex на локальный сервер и по умолчанию берёт модель gpt-oss:20b, а флаг -m меняет её на другую. Там же предупреждение: агенту нужно контекстное окно от 64 тысяч токенов, иначе он теряет нить задачи. Сами команды и режимы Codex мы разбирали в обзоре Codex CLI, с локальной моделью они те же.
Своя обвязка. Локальный API Ollama совместим с форматом OpenAI, поэтому любой скрипт или бот, который вы написали под облачную модель, переключается на локальную сменой адреса. Это способ для тех, кто уже собирает что-то своё.
# 1. скачать и попробовать модель
ollama pull qwen3:8b
ollama run qwen3:8b
# 2. поднять агента на локальной модели
npm install -g @openai/codex
ollama pull gpt-oss:20b
codex --oss -m gpt-oss:20b
По теме: Нейросеть в телеграм-боте 2026: как подключить и сколько стоит
Что локальный агент делает хуже и когда он не нужен
Честная часть, без которой картина не складывается.
- Качество на сложных задачах. Модель на 8-20 млрд параметров уверенно пересказывает, сортирует и пишет простой код, но на длинной многошаговой задаче чаще сбивается и придумывает несуществующие функции. Проверять её приходится плотнее.
- Скорость. На процессоре без нормальной видеокарты ответ печатается заметно медленнее, чем в браузере, и разница особенно чувствуется в агентском режиме, где модель делает десятки шагов подряд.
- Короткий контекст. Большое окно контекста занимает память так же, как сама модель, поэтому «закинуть весь проект целиком» на домашнем железе обычно не выйдет.
- Возня с обслуживанием. Модели обновляются, форматы меняются, диск занимают десятки гигабайт, а ноутбук во время работы греется и быстрее садится.
- Не всё есть локально. Веса моделей Claude и GPT закрыты, локально их не поставить. Что из Claude всё-таки живёт на компьютере, мы разбирали в отдельной статье про локальный Claude.
Локальный вариант не окупает возню, если у машины 8 ГБ памяти и нет видеокарты, если задача разовая, если вы работаете с открытыми данными, где приватность не критична, или если вам нужен максимум качества по коду. В последнем случае логичнее смотреть на облачные инструменты, их мы сравнивали в обзоре ИИ-агентов по задачам и ценам. Рабочий компромисс у многих выглядит так: маленькая локальная модель на чувствительные документы и рутину, облачный агент на сложные проекты.
Частые вопросы
Нужна ли видеокарта или хватит процессора?
Хватит процессора, Ollama и LM Studio умеют считать на нём. Но скорость будет заметно ниже, и чем крупнее модель, тем сильнее разница. Видеокарта нужна не для того, чтобы «получилось», а для того, чтобы было комфортно.
Сколько это стоит?
Сами программы бесплатны, модели с открытыми весами тоже. Платите вы за железо и электричество. Именно поэтому локальный запуск часто выбирают в России: не нужна зарубежная карта и подписка.
Точно работает без интернета?
Да, после того как модель скачана. Интернет понадобится, только если агент лезет в веб-поиск или вы решили подключить облачную модель как запасную.
Можно ли запустить локально Claude, GPT или Gemini?
Нет, у этих моделей веса закрыты. Локально запускают модели с открытыми весами: gpt-oss от OpenAI, Qwen, Gemma, DeepSeek и другие. Названия похожи на облачные, но это разные модели.
С какой модели начать?
На 16 ГБ памяти возьмите qwen3:8b для общих задач или gpt-oss:20b, если планируете агентский режим. На слабой машине начните с gemma3:4b: она весит 3,3 ГБ и запустится почти везде.
Локальный агент решает вопрос приватности, но сам по себе денег не приносит: ценность появляется, когда вы им что-то собираете. На бесплатном вебинаре по вайбкодингу показываем, как ставить задачи ИИ-агенту и довести первый проект до рабочего состояния.
Записаться на вебинар