Перейти к содержанию
Публикация AiManual

Бесплатные LLM API в 2026: проверка шести сервисов с Claude, Gemini, Qwen и MiniMax

Проверка шести сервисов с бесплатным доступом к LLM через API: Atria, Routeway, Selora, ShareLLM, Vireonix и OdiRouter. Реальные лимиты (100 млн токенов, 50 RPM

Коротко

Что будет в материале

  1. 01

    Что проверялось и как: методика теста шести бесплатных LLM API

  2. 02

    Atria: 100 млн токенов сразу после регистрации и три API

  3. 03

    Routeway: бесплатные маршруты с суффиксом :free при балансе $0.00

  4. 04

    Selora, ShareLLM, Vireonix и OdiRouter: что показали остальные четыре сервиса

Что проверялось и как: методика теста шести бесплатных LLM API

Под проверку попали шесть сервисов с бесплатным доступом к LLM через API: Atria, Routeway, Selora, ShareLLM, Vireonix и OdiRouter. Рабочие маршруты нашлись у Atria и Routeway, Vireonix даёт доступ без ключа и аккаунта, а часть бесплатных маршрутов стабильно отвечает ошибками 502, 503 и 504.

Цифры, на которые стоит ориентироваться до регистрации: Atria начисляет 100 000 000 токенов сразу после создания аккаунта и фактически выставляет 50 RPM, Routeway даёт 5 RPM и 200 запросов в сутки на маршрутах с суффиксом :free при балансе $0.00. У части сервисов лимит выражен деньгами: $5 за 4 часа и $30 в неделю.

Подвохи, которые видно только на реальных запросах: неудачные обращения в Routeway списывают дневную квоту, reasoning-модель может вернуть HTTP 200 с пустым content, если не хватило max_tokens, а название маршрута в /v1/models не всегда совпадает с полем model в ответе API. Ниже - разбор по каждому сервису и практические выводы.

К каждому сервису отправлялись живые запросы через /v1/chat/completions, каталог моделей через /v1/models и альтернативные эндпоинты там, где они есть. Фиксировались код ответа, заголовки лимитов, тело ответа и поле model. Для reasoning-моделей делался отдельный прогон с разными значениями max_tokens. Исходный разбор с логами и полными ответами опубликован на Habr: Где ещё дают LLM API бесплатно: проверяю очередные находки.

Правило отбора простое: маршрут, который стабильно падает, в список рабочих не попадает, даже если он есть в каталоге и выглядит привлекательно. Так deepseek-v4-flash:free в Routeway выпал из списка после четырёх ошибок 502 подряд.

Какие эндпоинты и заголовки смотрелись

Проверялись три формата запросов: Chat Completions, Responses API и Anthropic Messages. Первый отдаёт привычный ответ в стиле OpenAI, два других нужны там, где важно видеть ход рассуждений модели или уже написана интеграция под Claude API.

Заголовки лимитов полезнее документации: они показывают не обещанные значения, а те, что сервер реально выставил конкретному аккаунту.

ЗаголовокЧто показывает
x-ratelimit-limit-minuteРазрешённое число запросов в минуту
x-ratelimit-limit-dayРазрешённое число запросов в сутки
x-ratelimit-remaining-dayСколько запросов из суточной квоты осталось
x-rpm-limitФактический RPM, который сервер назначил аккаунту

Отдельная часть методики - сверка поля model в ответе с именем маршрута из каталога. Расхождение здесь меняет всё: лимиты, скорость и качество ответов принадлежат той модели, которая реально отвечает.

Почему HTTP 200 не всегда означает рабочий ответ

reasoning-модели сначала тратят токены на рассуждение и только потом формируют финальный текст. Если max_tokens выставлен впритык, весь бюджет уходит в reasoning, сервер возвращает HTTP 200, а поле content приходит пустым. Код 200 в такой ситуации ничего не подтверждает: проверять нужно и наличие текста в ответе.

Atria: 100 млн токенов сразу после регистрации и три API

Сразу после регистрации Atria начисляет 100 000 000 токенов. Это самый крупный стартовый запас среди шести сервисов, и он не привязан к разовым промо-запросам.

Модель доступна одна: Atria-Dawn-Preview. Это агентная модель Shanghai AI Lab на базе 744B MoE GLM-5.2, рассчитанная на исследовательские, инженерные и многошаговые задачи с инструментами. Контекст 256K, максимальный output 65 536 токенов, принимает только текст.

Какой API выбрать: Chat Completions, Responses или Anthropic Messages

Chat Completions возвращает только текстовый ответ. Минимум разбирательства, подходит для кода, который уже написан под OpenAI-совместимый формат.

Responses API отдельно возвращает reasoning и финальный ответ. Anthropic Messages отдаёт блоки thinking и text. Оба варианта удобны, если нужно понять, как модель рассуждала, или если интеграция уже заточена под Claude API.

Все три API реально ответили HTTP 200 на тестовых запросах: Chat Completions, Responses API и Anthropic Messages. Это редкость для бесплатных сервисов, где обычно работает один совместимый эндпоинт, остальные заявлены формально.

Реальные лимиты Atria: 60 RPM в документации против 50 RPM на практике

В документации указано 60 RPM на аккаунт, причём лимит общий для Chat Completions, Responses и Messages: израсходовали минуту на одном эндпоинте - остаток уменьшился и на остальных.

На практике сервер во всех ответах возвращал x-rpm-limit: 50. Планировать нагрузку стоит от 50 RPM, а не от 60.

Проверка на границу: 51 запрос примерно за минуту. Результат - 47 ответов HTTP 200, ни одного HTTP 429 и 4 локально отменённые задачи (их прервал клиент, а не сервер). Жёсткую границу через 429 поймать не удалось, похоже, лимит срабатывает мягко. Суточный RPD для Atria отдельно не указан: ориентира на день в документации нет.

Routeway: бесплатные маршруты с суффиксом :free при балансе $0.00

После регистрации баланс в Routeway был $0.00, и это не мешает работе: бесплатные маршруты живут отдельно от баланса. После серии тестов на счету по-прежнему $0.00, а 12 API-запросов прошли успешно.

Каталог /v1/models вернул 263 модели. Бесплатными отмечены отдельные маршруты с суффиксом :free, и это единственный надёжный признак нулевой цены. В аккаунте автора были доступны три: deepseek-v4-flash:free, minimax-m2.7:free и muse-glimmer-30b:free. Полные логи проверки - в исходном разборе на Habr.

Какие маршруты :free реально отвечают

  • minimax-m2.7:free - HTTP 200 и ответ API WORKS. Reasoning приходит внутри ответа в блоке <think>, следом идёт финальный текст. Маршрут стабилен.
  • muse-glimmer-30b:free - первая попытка дала ошибку, зато следующие три запроса подряд вернули HTTP 200 и ответ API WORKS.
  • deepseek-v4-flash:free - четыре запроса и четыре HTTP 502. В список рабочих не включён.

Практический вывод: суффикс :free говорит только о цене, а не о работоспособности. Проверять маршрут нужно коротким запросом и смотреть на код ответа и поле model.

5 RPM и 200 запросов в сутки: как не сжечь квоту впустую

Routeway отдаёт лимиты прямо в заголовках: x-ratelimit-limit-minute: 5 и x-ratelimit-limit-day: 200. Пять запросов в минуту и 200 в сутки на бесплатном тарифе.

Неприятная деталь: неудачные запросы тоже списывают дневную квоту. x-ratelimit-remaining-day уменьшался даже после 502 и 429. Логика сервиса понятна (запрос всё равно ушёл на апстрим), но для практики это значит: не стоит долбить нерабочий маршрут десятком повторов. Один-два отказа, и переключайтесь на другой :free маршрут, иначе 200 запросов закончатся раньше, чем вы получите рабочие результаты.

429 model_overloaded - это не ваш лимит

MiniMax M2.7 один раз ответил так: HTTP 429 с причиной model_overloaded. Следующие запросы снова прошли с HTTP 200. Значит, потолок нащупала сама модель на стороне сервиса, а не аккаунт пользователя. Различать эти случаи полезно: при исчерпании квоты 429 держится долго, при перегрузке модели уходит через несколько секунд или минут.

Selora, ShareLLM, Vireonix и OdiRouter: что показали остальные четыре сервиса

Atria и Routeway дали больше всего конкретики: там нашлись работающие маршруты и воспроизводимые цифры по лимитам. По остальным четырём картина короче, и придумывать за них характеристики не стоит.

Условия доступа различаются сильнее, чем модели. Кому-то нужен аккаунт и ключ, кому-то нет; лимит может считаться запросами, минутными окнами или деньгами.

Vireonix: доступ без ключа и аккаунта

Vireonix работает без ключа и аккаунта: запрос можно отправить сразу, регистрация не нужна. Для быстрой пробы идеи это самый низкий порог входа из шести сервисов. Обратная сторона: без аккаунта нечего привязывать к персональной квоте, и как сервис считает лимиты в таком режиме, в доступных данных не раскрыто. Воспринимайте его как способ быстро проверить запрос, а не как основу для продакшена.

Денежные окна $5 за 4 часа и $30 в неделю

Часть сервисов считает лимит деньгами, а не запросами: $5 за 4 часа и $30 в неделю. Механика другая: расход считается по прайсу моделей, поэтому длинный запрос с большим контекстом съедает окно заметно быстрее, чем несколько коротких. Окно на 4 часа обновляется чаще недельного, и для серии экспериментов это удобнее: после исчерпания достаточно подождать, а не ждать до конца недели.

Важная оговорка по данным: в исходной проверке денежные окна $5 за 4 часа и $30 в неделю не привязаны к конкретному сервису из шести, а детальных цифр по лимитам Selora, ShareLLM и OdiRouter в доступных материалах нет. Перед регистрацией уточняйте условия в аккаунте: сервисы в этой нише меняют правила часто, а бесплатный доступ закрывают без предупреждения.

Ошибки 502, 503 и 504: что они значат и что делать

Расшифровка кодов простая. 502 (Bad Gateway) значит, что сервис не получил валидный ответ от провайдера модели. 503 (Service Unavailable) значит, что сервис или апстрим временно недоступен. 504 (Gateway Timeout) значит, что шлюз не дождался ответа за отведённое время.

Для пользователя все три означают одно: проблема не в вашем запросе и не в ключе. Повторять тот же вызов по кругу бессмысленно, а в Routeway ещё и расточительно, потому что неудачные запросы списывают дневную квоту. deepseek-v4-flash:free выдал 502 четыре раза подряд и в список рабочих не попал.

Рабочая схема для интеграции: fallback на другой маршрут или другой сервис, ограничение в 2-3 попытки на вызов и логирование заголовков лимитов вместе с кодом ответа. Так видно, где закончилась квота, а где упал апстрим.

Как отличить перегрузку сервиса от исчерпания лимита

  • 429 с пометкой model_overloaded - перегружена конкретная модель. Повтор через паузу обычно проходит.
  • 429 без такой пометки - вероятно, исчерпана квота аккаунта. Проверьте x-ratelimit-remaining-day и x-rpm-limit.
  • 502, 503, 504 - сбой на стороне сервиса или апстрима, к состоянию аккаунта отношения не имеет.

Пустой content при HTTP 200: как правильно тестировать reasoning-модели

Если max_tokens выставлен впритык, весь бюджет уходит в рассуждение, сервер возвращает HTTP 200, а content приходит пустым. Такой ответ легко принять за рабочую интеграцию и потом долго искать причину пустых строк в базе или в логах агента.

Похожая механика уже разбиралась на DeepSeek-V4-Flash: в материале про reasoning_effort в измерениях режим Low генерировал на 25-100% больше токенов, чем High, а практический тест зафиксировал баги с пустыми assistant-сообщениями. Бюджет токенов и качество ответа стоит измерять отдельно: пустой content говорит о нехватке лимита, а не о слабости модели.

Как выбрать max_tokens для reasoning-модели

Единого числа нет: длина рассуждения зависит от задачи, а у разных моделей разная склонность к длинным цепочкам. Рабочий порядок действий такой: выставить заведомо большой max_tokens, убедиться, что финальный текст приходит, и только потом снижать значение до комфортного по стоимости. Если ответ пришёл пустым при HTTP 200, первым делом увеличивайте max_tokens, а не меняйте модель или ключ.

Разделение reasoning и ответа в Responses API и Anthropic Messages

Responses API возвращает reasoning и финальный ответ отдельными блоками, Anthropic Messages отдаёт thinking и text. Для отладки это удобнее Chat Completions, где виден только итоговый текст и непонятно, сколько токенов ушло на рассуждение. В Routeway рассуждение можно увидеть и на обычном Chat Completions: minimax-m2.7:free кладёт его в блок <think> внутри ответа, а после идёт финальный текст. Если max_tokens мал, финального текста может не оказаться вовсе.

Названия маршрутов в /v1/models не всегда совпадают с реальной моделью

Каталог /v1/models показывает маршруты, а не всегда те модели, что отвечают. В Routeway каталог вернул 263 модели, бесплатные отмечены суффиксом :free, но поле model в ответе может отличаться от имени запрошенного маршрута. Причина в маршрутизации: под одним именем может стоять другая модель или другой апстрим.

Как проверить, какая модель реально отвечает

Метод простой: отправить короткий запрос и сравнить поле model в ответе с именем маршрута.

resp = client.chat.completions.create(model=route_name, messages=[...])
if resp.model != route_name:
    print('отвечает другая модель:', resp.model)

Если значения расходятся, держите это в голове при выборе: скорость, лимиты и качество будут от той модели, которая отвечает фактически. Для сравнения моделей это критично, потому что замеры на одном маршруте не переносятся на другой.

Кому какой бесплатный LLM API подходит: практические выводы

Для прототипирования и быстрых тестов

Vireonix - если не хочется возиться с ключом и регистрацией: запрос отправляется сразу. Routeway - если нужен бесплатный маршрут :free при балансе $0.00: пять запросов в минуту хватает для проверки идеи, а 200 запросов в сутки заставляют считать попытки. Atria выигрывает по объёму: 100 млн токенов после регистрации закрывают долгие эксперименты, а три API позволяют не переписывать код при смене формата.

Для агентов и многошаговых задач

Atria-Dawn-Preview рассчитана именно на такой сценарий: агентная модель Shanghai AI Lab на базе 744B MoE GLM-5.2, ориентированная на исследовательские, инженерные и многошаговые задачи с инструментами. Три API упрощают интеграцию: Anthropic Messages подойдёт, если код уже написан под Claude API, Chat Completions - если под OpenAI-совместимый формат, Responses API - если нужно видеть цепочку рассуждений между шагами.

Для длинного контекста

Контекст 256K и output до 65 536 токенов есть у Atria-Dawn-Preview. Ограничение прямое: модель принимает только текст, изображения и аудио она не обработает. При выборе модели по контексту полезно смотреть не только на заявленное окно, но и на KV-cache и стоимость инференса: на эту тему есть отдельный разбор о том, действительно ли DeepSeek отстал от Qwen и GLM или так выглядит из-за бенчмарков и условий запуска.

Общее правило для бесплатных API: не привязывайтесь к одному сервису, сверяйте поле model в ответе, следите за max_tokens у reasoning-моделей и не долбите маршруты, которые стабильно отдают 502, 503 и 504. Расширить список провайдеров можно в подборке бесплатного API-доступа к 150+ нейросетям: там разобраны OpenRouter, Google AI Studio, Groq, NVIDIA, Mistral и GitHub Models с лимитами и примерами кода.

Подписаться на канал