Как бесплатно работать с AI-агентами и нейросетями в 2026
Список моделей, за которые не просят денег, перетасовывается каждый месяц и при этом почти не пустеет. OpenRouter отдает их по фильтру free, NVIDIA раздает ключ к сотне моделей внутри программы для разработчиков, Ollama крутит облачные модели на бесплатном тарифе, Groq и Cerebras держат постоянные бесплатные планы. Отдельно от этого бесплатны сами оболочки агентов: OpenCode, Cline, Kilo Code и Aider живут на открытом коде. Ниже карта того, что реально работает на 29 августа 2026: где брать ключи, какие у бесплатных тарифов лимиты и чем приходится платить вместо денег.
Все цифры в гайде это состояние на конец августа 2026. Бесплатные тарифы в этой области живут месяцами: в июне Google закрыл бесплатный вход в свой Gemini CLI, в марте закрылся бесплатный тариф Chutes. Проверяйте лимиты на странице провайдера перед тем, как строить на них рабочий процесс.
Что появляется нового и что из этого держится дольше пары недель, разбираем в канале Точки над ИИ.
Бесплатное бывает двух разных сортов
Сначала стоит развести два понятия, которые в разговоре обычно склеиваются. Языковая модель это мотор. Она умеет одно: получить текст и вернуть текст. Спросили, ответила, забыла. Все, что называется нейросетью в бытовом смысле, живет на этом уровне.
Агент это машина, собранная вокруг мотора. Программа берет модель, дает ей инструменты (прочитать файл, записать файл, запустить команду, сходить в интернет) и запускает в цикле: подумал, сделал, посмотрел на результат, решил, что дальше. Модель внутри та же самая. Меняется то, что вокруг нее.
Две половины стоят по-разному и раздаются бесплатно по разным причинам. Оболочка открыта и бесплатна навсегда. Модель бесплатна временно и с потолком.
Из этого следует простая вещь. Счетов у вас всегда два: за оболочку и за мотор. Оболочку почти всегда можно взять за ноль, потому что она открытый код и живет на вашей машине. Мотор дают бесплатно по трем причинам: провайдер выводит новую модель на рынок и хочет отзывов, провайдер продает железо и раздает пробники, провайдер берет ваши запросы себе на обучение. Все три мотива временные, поэтому каталоги свободных моделей и перетасовываются каждый месяц.
| Модель (LLM) | Агент |
|---|---|
| Отвечает текстом | Делает работу за несколько шагов |
| Ничего не помнит между вопросами | Держит контекст проекта и файлы |
| Не видит ваш компьютер | Читает, пишет, запускает команды |
| Платите за токены | Оболочка чаще всего бесплатна |
Если тема агентов пока новая, начните со стартового гайда про работу с AI-агентами: там разобрано, где агенты живут, какие у них режимы и чем папка проекта отличается от чата.
Где брать бесплатные модели: карта источников
Ниже то, что на конец августа 2026 отдает работающий ключ без карты и без подписки. Порядок примерно по полезности для агентной работы.
OpenRouter: один ключ на все свободные модели
Самая известная точка входа. Каталог с фильтром free собирает модели, которые провайдеры отдают через шлюз бесплатно. В конце августа там держатся Nemotron 3 Ultra от NVIDIA с окном на миллион токенов, MiniMax M3, GLM 5.2, Cohere North Mini Code, Poolside Laguna и еще с десяток позиций. Названия в этом списке живут неделями, сама механика годами.
Лимиты: 20 запросов в минуту и 50 запросов в сутки. Если на счете лежит хотя бы 10 долларов купленных кредитов, суточный потолок поднимается до 1000 запросов, при этом сами модели остаются бесплатными. Для агентной работы это важный нюанс: один вопрос агента к модели это один запрос, а агент за одну задачу делает их десятками. Пятидесяти в сутки хватает на пробу, тысячи на нормальный день.
NVIDIA: сотня моделей внутри программы для разработчиков
На build.nvidia.com лежит каталог из сотни с лишним моделей, включая DeepSeek, Llama, Qwen, Mistral и собственные Nemotron. Регистрация в бесплатной программе для разработчиков дает ключ без карты, интерфейс совместим с OpenAI, то есть подставляется в любой инструмент, который умеет работать с чужим адресом API. Практический потолок по отзывам около 40 запросов в минуту, его можно попросить поднять.
Groq и Cerebras: скорость
Оба держат постоянные бесплатные планы и оба выигрывают в скорости за счет своего железа. На бесплатном плане Groq лежат gpt-oss на 120 и 20 миллиардов параметров, модели Qwen и связки compound, лимиты около 30 запросов в минуту и тысячи в сутки. Cerebras дает примерно 30 запросов в минуту при заметно большем суточном объеме токенов, что удобно для пакетной обработки.
Ollama Cloud: облачные модели на бесплатном тарифе
Тот же Ollama, что запускает модели на вашем ноутбуке, держит облачные версии больших моделей. На бесплатном тарифе доступна одна модель одновременно и лимит меряется временем работы видеокарты: сессия обновляется раз в пять часов, поверх лежит недельный потолок. В каталоге облачных моделей сейчас Qwen 3.5, gpt-oss, Gemma 4, DeepSeek V4 Flash, GLM, Kimi, MiniMax и Nemotron. Отдельно приятно, что в апреле Ollama выпустил команду ollama launch opencode, которая одним движением поднимает связку из бесплатной оболочки и облачной модели.
OpenCode Zen: бесплатные модели на время беты
Шлюз внутри OpenCode. Несколько моделей стоят там ноль, пока идет их бета: Big Pickle, MiMo, Nemotron 3 Ultra, Ling 3.0 Flash Fin и другие. Ротация быстрая, вчерашний бесплатный флагман становится платным на той же неделе, когда бесплатным становится следующий. Важное условие: в бесплатный период данные могут уходить на улучшение модели.
Остальные, коротко
- Google AI Studio. Бесплатный ключ к Gemini: на младших моделях порядка полутора тысяч запросов в сутки, на старшей около полусотни. Запросы бесплатного тарифа используются для улучшения моделей, кроме пользователей из ЕС и Британии.
- Mistral. Тариф Experiment дает около миллиарда токенов в месяц, это один из самых щедрых постоянных лимитов на рынке. Условие: по умолчанию ваши запросы идут в обучение, отказ переключается вручную в настройках приватности.
- GitHub Models. Пробный доступ к набору моделей прямо по гитхабовскому аккаунту, порядка 15 запросов в минуту. Удобно, когда все и так живет на GitHub.
- SambaNova. Двести тысяч токенов в сутки на модель, карта не нужна, пока к аккаунту не привязан способ оплаты.
- Hugging Face. Небольшой месячный кредит на инференс плюс несколько минут в сутки на мощной видеокарте в Spaces. Для агента маловато, для экспериментов с открытыми моделями достаточно.
- Cloudflare Workers AI. Суточный бесплатный объем на два десятка моделей, окно контекста небольшое.
- GigaChat. Для физических лиц миллион токенов младшей модели в месяц. Российский вариант без вопросов с доступом и оплатой.
Два имени из прошлогодних подборок стоит вычеркнуть: бесплатный тариф Chutes закрылся в марте 2026, а Together берет деньги с первого токена.
Лимиты у провайдеров независимые. Три ключа от трех разных сервисов складываются в тройной дневной запас, и большинство оболочек умеет переключаться между провайдерами прямо в настройках. Это самый простой способ вытянуть бесплатный день целиком.
Локальный запуск: бесплатно навсегда, платите железом
Отдельный сорт бесплатного. Модель скачивается к вам на диск и работает без интернета, без лимитов и без чужих серверов. Платить не нужно вообще, потолок задает память компьютера.
Два основных способа запуска. Ollama это команда в терминале и локальный сервер, к которому подключаются агенты. LM Studio это обычное приложение с окошком, там же встроенный клиент MCP, поэтому подключать коннекторы можно мышкой. Про сами коннекторы у нас есть разбор того, что такое MCP.
| Память | Что реально идет | На что годится |
|---|---|---|
| 8 ГБ | Модели на 4-8 миллиардов параметров | Черновики, переписывание, простые правки |
| 16 ГБ | gpt-oss на 20 млрд, qwen3-coder на 30 млрд, Gemma 4 на 12 млрд | Рабочие задачи по коду, длинный контекст |
| 32 ГБ и выше | Модели покрупнее и окна на сотни тысяч токенов | Полноценная агентная работа офлайн |
Отдельно стоит отметить архитектуру с разреженными экспертами. В такой модели из тридцати миллиардов параметров на каждый шаг работают три, поэтому qwen3-coder на 30 миллиардов помещается в шестнадцать гигабайт и по качеству подтягивается к моделям в разы крупнее. Пару лет назад это требовало серверной видеокарты.
Локальная модель проигрывает облачной в качестве и выигрывает в трех вещах: она не считает запросы, не уходит в интернет и не исчезает из каталога.
Разумный режим для многих: локальная модель на рутине (переименовать, разобрать, переписать, поискать по файлам) и облачная на сложном. Особенно это оправдано, когда в работе документы, которые нельзя отправлять наружу.
Бесплатные оболочки: чем работать
Здесь ситуация лучше, чем с моделями. Хорошие агенты открыты и бесплатны сами по себе, вопрос только в том, какой ключ вы им дадите.
Полностью открытые
- OpenCodeоткрытый код. Агент в терминале с поддержкой семидесяти пяти с лишним провайдеров. Читает файлы, планирует правки, запускает код и проверяет себя. С Ollama работает полностью локально, наружу не уходит ничего.
- ClineApache-2.0. Расширение для редактора, свой ключ подставляется в настройках. Классический вариант для тех, кто живет в VS Code.
- Kilo CodeMIT. Больше пятисот моделей у шестидесяти провайдеров, режим оркестратора разбивает задачу на подзадачи, расход по каждому шагу виден в реальном времени. Вырос из Roo Code, который в мае 2026 ушел в архив, так что мигрировать стоит именно сюда или в Cline.
- Aiderтерминал. Работает через git: каждое изменение ложится отдельным коммитом, откатить можно любой шаг. Хорошо дружит с локальными моделями.
- Goose и OpenHands. Оба ставятся на своей машине, оба берут любой ключ. OpenHands ближе к автономной работе над задачей целиком.
Бесплатные тарифы у больших
- Codex. С мая 2026 бесплатен для всех: пятьдесят агентных сообщений в сутки, три параллельных агента и тысяча терминальных автодополнений в месяц. Облачная часть в бесплатный тариф не входит.
- Antigravity. Среда от Google плюс терминальный агент с командой
agy, бесплатная на время публичного превью. Квоту с момента запуска резали несколько раз, сейчас речь о двух десятках агентных запросов в сутки с обновлением раз в пять часов. - GitHub Copilot Free. Две тысячи автодополнений и полсотни запросов в чат в месяц, агентный режим в урезанном виде. Разумно как знакомство.
- Jules. Асинхронный агент Google: получает задачу, поднимает виртуальную машину, правит репозиторий и открывает пул-реквест. На бесплатном тарифе пятнадцать задач в сутки.
Отдельный прием: знакомая оболочка с чужим мотором
Многие агенты умеют говорить не только со своим провайдером. У Claude Code это переменные окружения: адрес API переводится на шлюз, и внутри привычного интерфейса начинает работать чужая модель. У OpenRouter под это сделан совместимый режим, отдельный локальный прокси не нужен. Так же подключаются NVIDIA, DeepSeek, локальные Ollama и LM Studio.
Пустая строка в третьей переменной обязательна: если ее просто не задать, агент попробует уйти к своему обычному провайдеру.
Прием рабочий, но у него есть цена. Агент, заточенный под конкретную модель, на чужой ведет себя иначе: хуже держит длинные цепочки инструментов, чаще ломает формат вызовов, местами теряет функции. Для проб этого достаточно, для ежедневной работы честнее взять оболочку, которая изначально рассчитана на много провайдеров.
История про Gemini CLI: почему нельзя строить процесс на одном канале
Хороший пример того, как быстро протухают бесплатные тарифы. Год Gemini CLI был лучшим бесплатным входом в агентную работу: логин личным гугл-аккаунтом, тысяча запросов в сутки, никаких ключей и карт. На этой щедрости выросли сотни инструкций и рабочих процессов.
19 мая 2026 Google анонсировал переезд, 18 июня отключил бесплатное обслуживание Gemini CLI для личных аккаунтов и подписок Pro и Ultra, отправив индивидуальных пользователей в новый Antigravity CLI. Репозиторий остался открытым под Apache 2.0, закрылся именно канал доступа. По замерам сообщества квота упала примерно с тысячи запросов в сутки до двух десятков.
Вывод простой и повторяемый: держите под рукой второй и третий ключ, а инструмент выбирайте такой, где провайдер меняется одной строкой в настройках. Оболочка на много провайдеров переживает такие новости за минуту.
Три бесплатных набора под разные задачи
Ноутбук есть, денег нет вообще
Ни одного запроса наружу, ни одного лимита. Требует шестнадцать гигабайт памяти и терпения к скорости.
Подходит, когда важна приватность или когда интернет ненадежен. По качеству это уровень хорошего младшего помощника: рутину тянет, архитектурные решения лучше принимать самому.
Нужно качество, лимиты терпимы
Ключи от трех провайдеров сразу (например OpenRouter, NVIDIA и Groq), оболочка Kilo Code или OpenCode, переключение между ними по мере исчерпания суточной квоты. Здесь доступны действительно сильные модели с большим окном контекста, и в хороший день такой набор закрывает полноценную рабочую сессию.
Кода нет, нужен просто умный собеседник
Уровень чата, без агента. Бесплатные входы стали заметно щедрее: в ChatGPT текстовые чаты с августа 2026 перестали упираться в счетчик сообщений (в США за это показывают рекламу), Claude дает порядка пятнадцати-сорока сообщений за пять часов, Gemini режет старшую модель примерно на полусотне запросов в сутки. Рядом DeepSeek, Qwen, Kimi и Le Chat с щедрыми бесплатными режимами.
Из России без дополнительных решений обычно открываются DeepSeek, Qwen, Le Chat, Kimi, а также GigaChat и Алиса. ChatGPT, Claude и Gemini ограничивают доступ сами, и это отдельный сюжет: как устроен доступ и оплата, разобрано в гайде про оплату ChatGPT и Claude из России. Для ресерча со ссылками рядом стоит Perplexity, для работы со своими документами NotebookLM, оба с рабочими бесплатными тарифами.
Чем вы платите вместо денег
Бесплатное здесь честнее называть словом бесплатное для кошелька. Цена есть всегда, просто она в другой валюте.
- Данными. На части тарифов ваши запросы идут в обучение моделей. У Mistral на тарифе Experiment это условие доступа, у Google в бесплатном AI Studio так по умолчанию, у моделей в бете на шлюзах об этом написано прямым текстом.
- Временем. Лимиты по минутам и суткам, очереди на популярных моделях, просадки в часы пик. Работа, которая на платном ключе занимает час, на бесплатном растягивается на вечер.
- Качеством. Свободные модели обычно на поколение позади лучших платных. На простых задачах разницы почти нет, на сложной архитектуре она видна сразу.
- Стабильностью. Модель может исчезнуть из каталога в любой день, а лимиты урезать без анонса. Планировать процессы на конкретное имя модели рискованно.
Проверяйте условия обработки данных до того, как отправите в бесплатную модель рабочий документ. Персональные данные, коммерческая тайна, содержимое NDA и чужие ключи доступа в бесплатный тариф не отправляются. Для такой работы либо платный тариф с обещанием не использовать данные, либо локальная модель.
Как выжать из бесплатного максимум
- Планируйте сильной моделью, выполняйте дешевой. Разбор задачи и план стоят десятков токенов, а механические правки тысяч. Умную суточную квоту тратьте на первое.
- Держите три ключа. Лимиты у провайдеров независимые и складываются.
- Берегите контекст. Половина квоты уходит на то, что агент раз за разом перечитывает лишние файлы. Короткий файл с описанием проекта экономит больше, чем любая оптимизация промптов.
- Разгружайте рутину на локальную модель. Переименования, разбор логов, черновые формулировки прекрасно делаются офлайн.
- Не гоняйте агента вхолостую. На бесплатном тарифе каждая непродуманная задача стоит суточной квоты. Сформулированный запрос экономит десяток запросов.
Ровно эти привычки мы ставим на кэмпе Точки над ИИ: с чего начинать задачу, когда переключать модель и как не сжигать контекст впустую. Ближе всего тема лежит к модулю про личную эффективность с AI, а живые находки по бесплатным моделям выкладываем в канале Точки над ИИ.
Грабли
- Считать запросы как сообщения. Один вопрос человека это десятки обращений агента к модели. Пятьдесят запросов в сутки заканчиваются за одну задачу.
- Строить рабочий процесс на одной бесплатной модели. Через месяц ее не будет, и вместе с ней встанет все, что на ней держалось.
- Отправлять в бесплатную модель то, что нельзя отдавать. Договоры, персональные данные, ключи доступа. Читайте условия до первого запроса.
- Тянуть модель, которая не влезает в память. Она запустится, начнет уходить в файл подкачки и будет выдавать по слову в секунду. Ориентируйтесь на объем памяти.
- Судить о качестве по одному ответу. Бесплатные модели заметнее платных проседают под нагрузкой, поэтому вечерний результат может отличаться от утреннего на той же модели.
- Забыть, что бесплатный агент это чужой код на вашей машине. Открытая оболочка получает доступ к файлам и терминалу. Смотрите на автора, активность репозитория и права, которые вы выдаете.
С чего начать за вечер
- Определитесь с половинами. Отдельно выберите оболочку и отдельно источник модели. Это два независимых решения.
- Возьмите два ключа. OpenRouter для широкого каталога и NVIDIA для запаса по запросам. Оба выдаются без карты за пять минут.
- Поставьте одну оболочку. OpenCode, если вам нормально в терминале, Cline или Kilo Code, если привычнее редактор.
- Прогоните настоящую задачу. Возьмите то, что вы правда собирались делать сегодня. Так сразу становится видно, где кончается квота.
- Поставьте Ollama и скачайте одну локальную модель. Она станет запасным аэродромом на день, когда все лимиты кончились.
- Запишите, на чем закончилась квота. Через неделю по этой записи будет понятно, есть ли смысл в платном тарифе и каком именно.
Обычно после такой недели вопрос звучит иначе: какие задачи оправдывают платный ключ и какие спокойно живут на бесплатном. Ответ у каждого свой, и он находится на практике за несколько дней.
Частые вопросы
- Можно ли работать с AI-агентом совсем без денег?
- Да. Оболочки агентов вроде OpenCode, Cline, Kilo Code, Aider и Goose открыты и бесплатны сами по себе, а модель к ним подключается по бесплатному ключу или запускается локально через Ollama. Ограничением становятся суточные лимиты запросов и качество свободных моделей, деньги при этом не нужны вообще.
- Чем бесплатная модель отличается от бесплатного агента?
- Модель это мотор, который умеет только отвечать текстом. Агент это программа вокруг мотора: она крутит цикл подумал, сделал, посмотрел, дает модели инструменты и доступ к файлам. Оболочка агента чаще всего бесплатна навсегда, потому что это открытый код. Модель под ней стоит денег или лимитируется по количеству запросов.
- Где брать бесплатные модели для агентного кодинга?
- Основные источники на конец августа 2026: OpenRouter с фильтром free, каталог NVIDIA на build.nvidia.com, Groq и Cerebras со своими бесплатными планами, Google AI Studio, GitHub Models, SambaNova, Hugging Face, бесплатный тариф Ollama Cloud и бесплатные модели шлюза OpenCode Zen. Набор меняется каждый месяц, поэтому список стоит перепроверять.
- Сколько запросов дают бесплатно на OpenRouter?
- На моделях с приставкой free действуют 20 запросов в минуту и 50 запросов в сутки. Если на счете хотя бы 10 долларов купленных кредитов, суточный потолок поднимается до 1000 запросов. Сами модели при этом остаются бесплатными, купленные кредиты просто снимают ограничение.
- Хватит ли моего ноутбука, чтобы запустить модель локально?
- На 8 гигабайтах памяти работают модели на 4-8 миллиардов параметров, они годятся для черновиков и простых правок. На 16 гигабайтах уже идут gpt-oss на 20 миллиардов и qwen3-coder на 30 миллиардов с разреженной архитектурой, этого хватает для рабочих задач по коду. От 32 гигабайт открываются модели покрупнее и длинный контекст.
- Чем платит пользователь бесплатного тарифа?
- Тремя вещами. Данными: на части бесплатных тарифов ваши запросы уходят в обучение моделей, у Mistral на тарифе Experiment и в бесплатном Google AI Studio это условие по умолчанию. Временем: лимиты, очереди и просадки в часы пик. Стабильностью: бесплатная модель может исчезнуть из каталога в любой день.
- Почему перестал работать бесплатный Gemini CLI?
- 18 июня 2026 Google отключил бесплатный вход по личному аккаунту в Gemini CLI и перевел индивидуальных пользователей на Antigravity CLI с командой agy. Сам репозиторий Gemini CLI остался открытым под лицензией Apache 2.0, закрылся именно бесплатный канал доступа. Квота при переезде упала с тысячи запросов в сутки примерно до двух десятков.
- Что из бесплатного работает из России без VPN?
- Обычно открываются DeepSeek, Qwen, Le Chat от Mistral, Kimi, российские GigaChat и Алиса. ChatGPT, Claude и Gemini ограничивают доступ с российских адресов сами, без сторонних решений они не открываются. Как устроен доступ и оплата западных сервисов, разобрано в отдельном гайде на этом сайте.
Что запомнить
- Счетов всегда два: за оболочку агента и за модель под ней. Оболочка почти всегда бесплатна навсегда, модель бесплатна временно и с потолком.
- Модель отвечает текстом. Агент это цикл с инструментами и доступом к файлам вокруг той же модели.
- Свободные модели дают OpenRouter, NVIDIA, Groq, Cerebras, Google AI Studio, Mistral, GitHub Models, SambaNova, Ollama Cloud и OpenCode Zen.
- На OpenRouter бесплатные модели ограничены 20 запросами в минуту и 50 в сутки, с 10 долларами кредитов потолок поднимается до 1000 в сутки.
- Один вопрос человека превращается в десятки обращений агента к модели. Суточные лимиты уходят быстрее, чем кажется.
- Лимиты у разных провайдеров независимые, поэтому три ключа складываются в тройной запас.
- Локальная модель через Ollama или LM Studio бесплатна навсегда: на 16 гигабайтах памяти идут gpt-oss 20B и qwen3-coder 30B.
- Оболочки OpenCode, Cline, Kilo Code, Aider, Goose и OpenHands бесплатны сами по себе. Roo Code ушел в архив в мае 2026.
- Codex дает 50 агентных сообщений в сутки, Jules 15 задач, Antigravity около двух десятков запросов.
- История Gemini CLI, где 18 июня 2026 закрылся бесплатный вход, показывает главное правило: не строить процесс на одном канале доступа.
- Вместо денег платите данными, временем, качеством и стабильностью. Рабочие документы под NDA в бесплатный тариф не отправляются.
Бесплатный набор доводится до рабочего состояния за вечер, и этого достаточно, чтобы понять, какие задачи вы готовы делать с агентом каждый день. Дальше вопрос уже про то, как поставить сам процесс.
На кэмпе Точки над ИИ мы собираем такой процесс под ваши задачи и подбираем связку из оболочки и моделей под ваш бюджет. Свежие находки по бесплатным моделям и лимитам выходят в канале Точки над ИИ.