Hermes Agent не привязан к одной модели — он работает с 35+ провайдерами, от премиальных облачных API до локальных моделей на вашем железе. Но именно этот выбор определяет, насколько хорошо агент справляется с кодом, как быстро отвечает и сколько это стоит. В этом материале разберём, какие модели лучше всего работают с Hermes, чем отличаются облачные и локальные варианты, сколько это стоит и — отдельно — где взять бесплатные облачные API.

Как Hermes работает с моделями

Сначала — как Hermes вообще выбирает модель. Ключ задаётся переменной окружения в ~/.hermes/.env, выбор — командой hermes model или прямо в сессии через /model. Для быстрого переключения есть короткие алиасы: sonnet, opus, gpt5, codex, gemini, deepseek, grok, qwen, kimi, glm и другие.

Три вещи, которые отличают Hermes в плане моделей:

  • Любой провайдер — Anthropic, OpenAI, Google, DeepSeek, xAI, OpenRouter, Hugging Face и ещё три десятка. Секреты — в .env, настройки — в config.yaml.
  • Резервная цепочка (fallback) — если основной провайдер упал, Hermes автоматически переключается на следующий в цепочке (hermes fallback add).
  • Локальные модели через custom-провайдер — любой OpenAI-совместимый endpoint (Ollama, LM Studio, vLLM) подключается указанием base_url.

Критерии выбора модели для агента

Для агента модель важнее, чем для чата. Чат-боту достаточно связно отвечать, а агенту нужно корректно вызывать инструменты, держать длинный контекст и рассуждать по шагам. Ключевые критерии:

  • Tool use / function calling — способность модели правильно выбирать и вызывать инструменты (терминал, файлы, браузер, API). Это база агентной работы.
  • Длина контекста — сколько кода и истории диалога модель удерживает одновременно. Для больших репозиториев критично.
  • Качество рассуждения (reasoning) — многошаговое планирование и отладка.
  • Скорость — токены в секунду; для интерактивной работы важна отзывчивость.
  • Цена — за миллион токенов, и как она растёт на длинных задачах.

Облачные модели по семействам

Claude (Anthropic)

Три уровня: Opus (флагман, максимальное качество), Sonnet (баланс цены и силы, традиционно силён в коде), Haiku (быстрый и дешёвый). Контекстное окно у старших моделей достигает 1 миллиона токенов — этого хватает для крупных кодовых баз. Claude считается одним из лучших вариантов для агентных задач и кодинга, но и одним из самых дорогих. Подключение — ANTHROPIC_API_KEY.

GPT и o-серия (OpenAI)

Универсальные модели с сильным рассуждением: GPT-5.x для общего круга задач и o-серия для многошаговых рассуждений. Хороший tool use, широкая экосистема. Подключение — OPENAI_API_KEY или OAuth (hermes auth add openai-codex). Цены — средний и выше сегмент.

Gemini (Google)

Линейка Gemini Pro и быстрый Gemini Flash. Отличается огромным контекстом и мультимодальностью (текст + изображения). Flash — отличный бюджетный вариант с хорошей скоростью. Подключение — GOOGLE_API_KEY / GEMINI_API_KEY, плюс есть бесплатный уровень через Google AI Studio (см. ниже).

DeepSeek

Китайская линейка V3 и reasoning-модель R1. Одно из лучших соотношений цена/качество на рынке: сильное рассуждение по цене в разы ниже западных флагманов. Для пользователей из РФ удобен доступом без VPN — в отличие от западных провайдеров, которые блокируют регион. Подключение — DEEPSEEK_API_KEY.

Qwen (Alibaba)

Qwen 2.5/3 и специализированная Qwen-Coder. Открытые веса + облачный API. Очень сильна в кодинге при низкой цене, хорошо подходит для локального запуска. Подключение — DASHSCOPE_API_KEY или через OpenRouter.

Прочие

  • Grok (xAI) — быстрый, сильный reasoning; XAI_API_KEY (есть и SuperGrok OAuth).
  • Kimi (Moonshot) — открытая MoE-модель K2, заточена под агентные задачи и кодинг; KIMI_API_KEY.
  • GLM (Zhipu) и MiniMax — недорогие китайские модели; GLM_API_KEY / MINIMAX_API_KEY.
  • Llama (Meta) — открытые веса, доступна через OpenRouter, Groq, Together или локально. Гибкость и приватность.
  • Mistral — европейские модели, часть с открытыми весами.

Бесплатные облачные API

Есть несколько способов пользоваться облачными моделями бесплатно (с лимитами на частоту и объём запросов — условия меняются, проверяйте на сайтах):

  • Groq Cloud — бесплатный уровень с очень быстрым инференсом на собственных LPU-чипах. Отдаёт открытые модели (Llama, Mixtral, Qwen и др.). OpenAI-совместимый API, в Hermes подключается как custom с base_url https://api.groq.com/openai/v1. Один из лучших вариантов «бесплатно и быстро».
  • Google AI Studio (Gemini) — бесплатный уровень для Gemini Flash с дневными лимитами. Подключение — GEMINI_API_KEY (или GOOGLE_API_KEY).
  • OpenRouter :free — модели с суффиксом :free доступны бесплатно с ограничениями по частоте. Удобно для проб, один ключ на всё.
  • Hugging Face Serverless Inference — бесплатные лимиты на запросы к открытым моделям; HF_TOKEN.
  • Cloudflare Workers AI — бесплатный ежедневный лимит запросов к открытым моделям, OpenAI-совместимый endpoint.
  • Mistral La Plateforme — бесплатный уровень на экспериментальные модели.
  • Together AI и Fireworks — стартовые кредиты при регистрации, хватает на тесты.

Практический совет: связка «Groq бесплатно + Gemini Flash бесплатно» закрывает большинство задач без единого рубля, а для серьёзной работы подключается DeepSeek по цене в разы ниже западных флагманов.

Локальные модели

Локальный запуск даёт полную приватность и нулевую стоимость запросов, но требует железа — прежде всего видеопамяти (VRAM). Основные инструменты:

  • Ollama — самый простой способ: ollama pull qwen2.5-coder и готово. Поднимает OpenAI-совместимый endpoint на http://localhost:11434/v1, который напрямую подключается к Hermes.
  • LM Studio — графический интерфейс, скачивание моделей с Hugging Face, встроенный OpenAI-совместимый сервер.
  • llama.cpp — движок для запуска GGUF-моделей, основа Ollama; максимальная гибкость.
  • vLLM — высокопроизводительный сервинг для GPU, если нужно обслуживать много запросов.

Ориентир по видеопамяти (квантование 4 бита):

  • 7B — примерно 5–8 ГБ VRAM;
  • 13–14B — около 10–12 ГБ;
  • 32B — порядка 20–24 ГБ;
  • 70B — от 40 ГБ и выше.

Для локального кодинга хорошо себя показывают Qwen2.5-Coder, DeepSeek-R1 (дистилляты), Llama 3.x, Mistral и Gemma. Скорость напрямую зависит от GPU: на видеокарте это десятки токенов в секунду, на CPU — единицы, что для агентной работы уже некомфортно.

Сравнительная таблица моделей

Цены ориентировочные, по порядку величины (дорого / средне / дёшево) — точные тарифы за токен меняются, смотрите актуальные на сайтах провайдеров.

Модель Тип Сильные стороны Цена (порядок)
Claude Opus / Sonnet Облачная Код, агентные задачи, огромный контекст Дорого
GPT-5 / o-серия Облачная Универсальность, рассуждение Средне–дорого
Gemini Pro / Flash Облачная Контекст, мультимодальность; Flash — скорость Средне / дёшево
DeepSeek V3 / R1 Облачная + открытые веса Цена/качество, reasoning, доступ из РФ Очень дёшево
Qwen / Qwen-Coder Облачная + открытые веса Кодинг, локальный запуск Дёшево
Grok Облачная Скорость, рассуждение Средне
Kimi K2 / GLM / MiniMax Облачная Агентные задачи, невысокая цена Дёшево
Llama / Mistral (локально) Локальная Приватность, без платы за токены Бесплатно (после покупки железа)
Groq / Gemini free / OpenRouter :free Облачная (free tier) Бесплатно, быстрый старт Бесплатно (с лимитами)

Облачные vs локальные

Критерий Облачные Локальные
Цена Оплата за токены; есть бесплатные уровни Бесплатно после покупки железа
Скорость Стабильно высокая у провайдера Зависит от GPU; на CPU медленно
Качество Frontier-модели (Claude, GPT, Gemini) сильнее Открытые модели уступают, но догоняют
Приватность Данные уходят провайдеру Полный контроль, данные не покидают машину
Контроль Ограничен Полный: квантование, тюнинг, свои модели
Надёжность Зависит от провайдера (fallback спасает) Не зависит от интернета

Что выбрать: рекомендации по сценариям

  • Максимальное качество кода — Claude Sonnet/Opus, GPT-5, Gemini Pro.
  • Бюджет при хорошем качестве — DeepSeek (V3/R1), Qwen, Gemini Flash.
  • Полная приватность — локально через Ollama: Qwen2.5-Coder, DeepSeek-R1, Llama 3.
  • Бесплатно и быстро — Groq Cloud (open models) + Gemini Flash free tier.
  • Доступ из РФ без сложностей — DeepSeek (дёшево, доступен без VPN) или локальные модели.
  • Надёжность в продакшене — основной провайдер + fallback-цепочка из резервных.

Как подключить модель в Hermes

Облачный провайдер — просто ключ в ~/.hermes/.env:

DEEPSEEK_API_KEY=sk-...
ANTHROPIC_API_KEY=sk-ant-...
GOOGLE_API_KEY=...
XAI_API_KEY=...

Локальная или OpenAI-совместимая модель — через custom-провайдер с base_url. Например, Ollama:

model:
  aliases:
    local-qwen:
      model: qwen2.5-coder:14b
      provider: custom
      base_url: "http://localhost:11434/v1"

Аналогично подключается Groq (base_url https://api.groq.com/openai/v1 с ключом) или любой другой OpenAI-совместимый endpoint. Переключение в сессии — /model local-qwen, резервная цепочка — hermes fallback add.

Заключение

Единого «лучшего» ответа нет — выбор модели под Hermes сводится к треугольнику «качество / цена / приватность». Для большинства задач отличной отправной точкой будет DeepSeek или Gemini Flash (дёшево и быстро), для сложного кода — Claude или GPT, для приватных проектов — локальный Ollama с Qwen или Llama, а для экспериментов без бюджета — бесплатные Groq и Google AI Studio. Благодаря резервной цепочке и алиасам Hermes позволяет не выбирать что-то одно: можно держать премиум-модель для сложных задач и дешёвую/бесплатную для рутины, переключаясь одной командой.

Источники