Отдельный сервер с видеокартой нужен в одном случае: если вы сами обучаете модель или дообучаете готовую на своих данных. Для всего остального (текст, сайт, бот, разбор документов) хватает готовых нейросетей в браузере или по API. Ниже: чем отличаются обучение с нуля, дообучение и запуск модели, сколько под каждую задачу нужно видеопамяти, что стоит аренда GPU в России в 2026 году и где можно обойтись бесплатно.
Зачем нейросети видеокарта, а не обычный процессор
Работа нейросети сводится к перемножению больших матриц: процессор считает их на десятках ядер, видеокарта на тысячах. При этом главный ресурс карты даже не скорость, а объём видеопамяти (VRAM). Веса модели должны поместиться в память целиком, иначе она либо не запустится, либо начнёт подгружаться из оперативной памяти и еле шевелиться. Поэтому в характеристиках сервера для нейросетей смотрят не на название карты, а на её гигабайты.
Без видеокарты запуск тоже возможен: llama.cpp и Ollama умеют считать на процессоре и обычной оперативной памяти. Расплата это скорость: по замерам в гайде по расчёту VRAM модель на 7 миллиардов параметров в 4-битном квантовании выдаёт на процессоре порядка 2-5 токенов в секунду против 30-80 на видеокарте.
Три разные задачи, которые путают между собой
Фраза «обучение нейросетей» обозначает три разных сценария, и требования к железу у них отличаются в тысячи раз.
- Обучение с нуля. Масштаб виден по официальной карточке Llama 3.1: на обучение семейства ушло 39,3 миллиона GPU-часов на картах H100-80GB (модельная карточка Meta). Это задача корпораций с дата-центрами, арендой одной карты она не решается.
- Дообучение (файнтюнинг). Вы берёте готовую открытую модель и доучиваете её на своих данных: терминологии, базе документов, стиле ответов. Экономные методы LoRA и QLoRA укладываются в одну видеокарту, и это единственный сценарий обучения, реально доступный небольшой команде.
- Запуск готовой модели (инференс). Модель уже обучена, вы просто задаёте ей вопросы. Требования скромные, часто хватает домашнего компьютера.
Чем именно настраивают модель при дообучении, мы разбирали в статье про инструменты для обучения нейросети, а откуда взять обучающий материал, в разборе про данные для обучения нейросети. Если цель звучит как «хочу, чтобы ИИ отвечал по моим правилам», начните с более простого пути: настроить нейросеть под себя чаще всего получается инструкциями и базой знаний, без обучающего кода.
Железо это только средство. Интереснее другое: что вы на нём соберёте и кому это будет полезно.
Занять местоСколько нужно видеопамяти: конкретные ориентиры
Для запуска модели в 4-битном квантовании (самый частый вариант дома) ориентиры такие, по таблице требований VRAM для локальных моделей:
- 3 млрд параметров: файл около 1,9 ГБ, минимум примерно 3 ГБ видеопамяти;
- 7-8 млрд: файл около 4,9 ГБ, минимум примерно 6 ГБ;
- 14 млрд: файл около 8,7 ГБ, минимум примерно 10 ГБ;
- 32 млрд: файл около 18,8 ГБ, минимум примерно 20 ГБ;
- 70 млрд: файл около 40 ГБ, минимум примерно 42 ГБ.
К этому добавляется память под контекст: тот же источник отмечает, что модели на 8 млрд параметров при контексте 8 тысяч токенов нужно уже около 7,5 ГБ вместо 6. Чем длиннее диалог и чем больше документов вы подкладываете, тем сильнее растёт аппетит.
Для дообучения запас нужен больше. По разбору требований к видеопамяти при файнтюнинге (Spheron, 2026), QLoRA для модели на 7 млрд параметров укладывается примерно в 8 ГБ и помещается на карту с 16 ГБ, а обычная LoRA в половинной точности требует уже около 20 ГБ. Полное дообучение всех весов в одну потребительскую карту не влезает.
По теме: Яндекс и обучение нейросетям в 2026: с чего начать бесплатно
Что реально запускается на обычном компьютере
Если в компьютере есть игровая видеокарта на 8-12 ГБ или Mac на Apple Silicon с 16 ГБ памяти, модель на 7-8 млрд параметров запустится и будет отвечать с приличной скоростью. Проще всего через Ollama.
- Посмотрите объём видеопамяти своей карты (в Windows это «Диспетчер задач», вкладка «Производительность», раздел GPU) и сверьте с таблицей выше.
- Скачайте Ollama с официального сайта ollama.com для Windows, macOS или Linux.
- Запустите модель одной командой, например
ollama run qwen3:8b. Первый запуск скачает файл весов, дальше модель стартует за секунды. Если терминал непривычен, у Ollama есть своё окно чата. - Начните с модели поменьше и поднимайтесь вверх, пока ответы не станут медленными.
Честное ограничение: модель на 8 миллиардов параметров заметно слабее облачных флагманов. Она хороша для приватных задач, но сложный код и серьёзный анализ вытянет хуже, чем привычный чат в браузере.
Считать видеопамять полезно, но результат приносит не она, а готовый продукт: сайт, бот или ассистент под свою задачу. На бесплатном вебинаре по вайбкодингу показываем весь путь на живом примере, участникам отдаём гайд в подарок.
Записаться на вебинарАренда GPU в России: цены 2026 года
Покупать карту ради нескольких экспериментов невыгодно: она дорогая и быстро устаревает. Российские провайдеры сдают видеокарты почасово. Ориентиры из подборки облачных GPU для машинного обучения за 2026 год (тарифы immers.cloud):
- Tesla T4 на 16 ГБ: 19,93 ₽ в час, хватает для запуска моделей до 8 млрд параметров;
- RTX 3090 на 24 ГБ: 66,76 ₽ в час;
- RTX 4090 на 24 ГБ: 82,76 ₽ в час, рабочая лошадка для дообучения методом QLoRA;
- A100 на 80 ГБ: 211,77 ₽ в час;
- H100: 341,77 ₽ в час, уровень серьёзных исследовательских задач.
У крупных облаков ценник другой. По рейтингу облаков для AI/ML за 2026 год, в Yandex Cloud час GPU на платформе V4 стоит 1 016,90 ₽ с НДС при посекундной тарификации, у Timeweb Cloud цены начинаются от 50 ₽ в час, а Cloud4Y считает от 18 341 ₽ в месяц. Разница это уровень сервиса: гарантии доступности, поддержка, требования к хранению данных. Для личных экспериментов переплачивать за это незачем.
Бесплатные варианты тоже есть, но с оговорками. Google Colab даёт доступ к видеокарте бесплатно, однако в официальном FAQ Colab прямо сказано: типы карт меняются со временем, лимиты не публикуются и плавают, а ноутбук на бесплатном тарифе работает максимум 12 часов и отключается при простое. Kaggle Notebooks выдают недельную квоту GPU (по обзору бесплатных облачных GPU около 30 часов в неделю на картах с 16 ГБ). Для учёбы и небольшого дообучения этого хватает, для процесса, который нельзя прерывать, нет.
Прежде чем считать бюджет на видеокарту, ответьте себе на один вопрос: есть ли у вас данные, которых нет у готовой модели? Если нет, сервер не даст ничего, кроме счёта за аренду.
По теме: Специалист по нейросетям: обучение с нуля и план на 2026
Как не переплатить за аренду
- Проверьте, поместится ли задача в карту подешевле. Переход с A100 на RTX 4090 экономит больше половины стоимости часа, если 24 ГБ вам хватает.
- Отладьте код на бесплатном Colab или Kaggle с маленькой моделью, и только потом берите платную карту под финальный прогон. Больше всего денег сгорает на сервере, который крутится, пока вы ищете опечатку.
- Выключайте сервер сразу после расчёта: почасовая тарификация считает и простой, забытая на выходные карта обойдётся в несколько тысяч рублей.
- Держите данные в отдельном хранилище, а не на диске сервера, тогда машину можно спокойно удалять и поднимать заново.
Кому свой сервер не нужен вообще
Это главная мысль статьи, и она экономит деньги и месяцы времени. Большинству задач, с которыми приходят к нейросетям, не нужен ни свой сервер, ни аренда, ни дообучение.
- Бот, отвечающий клиентам по вашей базе знаний, делается подключением готовой модели к вашим документам.
- Ассистент, который пишет тексты в вашем стиле, получается из подробной инструкции и нескольких примеров прямо в промпте.
- Сайт или сервис с ИИ внутри вызывает чужую модель по API, а ваш код живёт на обычном дешёвом хостинге без видеокарт.
- Приватность и работа без интернета оправдывают локальный запуск, но это не обучение, а инференс.
Своя обученная модель оправдана в трёх случаях: у вас уникальный массив данных, узкая повторяющаяся задача с огромным объёмом запросов (тогда своя маленькая модель дешевле чужой большой) или запрет на передачу данных наружу. В остальном разумнее начать с готовых нейросетей, которые не нужно обучать, и вернуться к железу, только если упрётесь в реальное ограничение.
Частые вопросы
Можно ли обучить нейросеть без видеокарты?
Технически да, практически нет: даже небольшое дообучение на процессоре растянется на дни вместо часов. А вот запускать готовую модель на процессоре реально, если мириться со скоростью в несколько токенов в секунду.
Какую видеокарту купить для обучения нейросетей?
Смотрите на объём памяти, а не на игровые тесты: 24 ГБ дают заметно больше свободы, чем 12. Но сначала арендуйте такую же карту на несколько часов и проверьте, что задача решается. Это стоит несколько сотен рублей и часто отменяет саму покупку.
Сколько стоит обучить нейросеть с нуля?
Столько, что вопрос закрывается сам собой: миллионы GPU-часов из карточки Llama 3.1 в пересчёте на аренду дают бюджет крупной компании. Реалистичен только файнтюнинг, он измеряется десятками часов.
Подойдёт ли обычный VPS без видеокарты?
Для сайта, бота или сервиса, который обращается к чужой нейросети по API, обычного VPS достаточно: тяжёлая работа идёт на стороне провайдера модели. Для локального запуска модели такой сервер не годится.
Если по итогу оказалось, что свой сервер вам не нужен, а результат от ИИ нужен, начните с готовых сервисов. На бесплатном мастер-классе показываем 10 базовых нейросетей, которые закрывают рабочие задачи без своего железа и без кода.
Смотреть мастер-класс