Какие модели лучше работают с Hermes: облачные и локальные — сравнение, цены, рекомендации
Hermes Agent не привязан к одной модели — он работает с 35+ провайдерами, от премиальных облачных API до локальных моделей на вашем железе. Но именно этот выбор определяет, насколько хорошо агент справляется с кодом, как быстро отвечает и сколько это стоит. В этом материале разберём, какие модели лучше всего работают с Hermes, чем отличаются облачные и локальные варианты, сколько это стоит и — отдельно — где взять бесплатные облачные API.
Как Hermes работает с моделями
Сначала — как Hermes вообще выбирает модель. Ключ задаётся переменной окружения в ~/.hermes/.env, выбор — командой hermes model или прямо в сессии через /model. Для быстрого переключения есть короткие алиасы: sonnet, opus, gpt5, codex, gemini, deepseek, grok, qwen, kimi, glm и другие.
Три вещи, которые отличают Hermes в плане моделей:
- Любой провайдер — Anthropic, OpenAI, Google, DeepSeek, xAI, OpenRouter, Hugging Face и ещё три десятка. Секреты — в .env, настройки — в config.yaml.
- Резервная цепочка (fallback) — если основной провайдер упал, Hermes автоматически переключается на следующий в цепочке (
hermes fallback add). - Локальные модели через custom-провайдер — любой OpenAI-совместимый endpoint (Ollama, LM Studio, vLLM) подключается указанием
base_url.
Критерии выбора модели для агента
Для агента модель важнее, чем для чата. Чат-боту достаточно связно отвечать, а агенту нужно корректно вызывать инструменты, держать длинный контекст и рассуждать по шагам. Ключевые критерии:
- Tool use / function calling — способность модели правильно выбирать и вызывать инструменты (терминал, файлы, браузер, API). Это база агентной работы.
- Длина контекста — сколько кода и истории диалога модель удерживает одновременно. Для больших репозиториев критично.
- Качество рассуждения (reasoning) — многошаговое планирование и отладка.
- Скорость — токены в секунду; для интерактивной работы важна отзывчивость.
- Цена — за миллион токенов, и как она растёт на длинных задачах.
Облачные модели по семействам
Claude (Anthropic)
Три уровня: Opus (флагман, максимальное качество), Sonnet (баланс цены и силы, традиционно силён в коде), Haiku (быстрый и дешёвый). Контекстное окно у старших моделей достигает 1 миллиона токенов — этого хватает для крупных кодовых баз. Claude считается одним из лучших вариантов для агентных задач и кодинга, но и одним из самых дорогих. Подключение — ANTHROPIC_API_KEY.
GPT и o-серия (OpenAI)
Универсальные модели с сильным рассуждением: GPT-5.x для общего круга задач и o-серия для многошаговых рассуждений. Хороший tool use, широкая экосистема. Подключение — OPENAI_API_KEY или OAuth (hermes auth add openai-codex). Цены — средний и выше сегмент.
Gemini (Google)
Линейка Gemini Pro и быстрый Gemini Flash. Отличается огромным контекстом и мультимодальностью (текст + изображения). Flash — отличный бюджетный вариант с хорошей скоростью. Подключение — GOOGLE_API_KEY / GEMINI_API_KEY, плюс есть бесплатный уровень через Google AI Studio (см. ниже).
DeepSeek
Китайская линейка V3 и reasoning-модель R1. Одно из лучших соотношений цена/качество на рынке: сильное рассуждение по цене в разы ниже западных флагманов. Для пользователей из РФ удобен доступом без VPN — в отличие от западных провайдеров, которые блокируют регион. Подключение — DEEPSEEK_API_KEY.
Qwen (Alibaba)
Qwen 2.5/3 и специализированная Qwen-Coder. Открытые веса + облачный API. Очень сильна в кодинге при низкой цене, хорошо подходит для локального запуска. Подключение — DASHSCOPE_API_KEY или через OpenRouter.
Прочие
- Grok (xAI) — быстрый, сильный reasoning;
XAI_API_KEY(есть и SuperGrok OAuth). - Kimi (Moonshot) — открытая MoE-модель K2, заточена под агентные задачи и кодинг;
KIMI_API_KEY. - GLM (Zhipu) и MiniMax — недорогие китайские модели;
GLM_API_KEY/MINIMAX_API_KEY. - Llama (Meta) — открытые веса, доступна через OpenRouter, Groq, Together или локально. Гибкость и приватность.
- Mistral — европейские модели, часть с открытыми весами.
Бесплатные облачные API
Есть несколько способов пользоваться облачными моделями бесплатно (с лимитами на частоту и объём запросов — условия меняются, проверяйте на сайтах):
- Groq Cloud — бесплатный уровень с очень быстрым инференсом на собственных LPU-чипах. Отдаёт открытые модели (Llama, Mixtral, Qwen и др.). OpenAI-совместимый API, в Hermes подключается как custom с base_url
https://api.groq.com/openai/v1. Один из лучших вариантов «бесплатно и быстро». - Google AI Studio (Gemini) — бесплатный уровень для Gemini Flash с дневными лимитами. Подключение —
GEMINI_API_KEY(илиGOOGLE_API_KEY). - OpenRouter :free — модели с суффиксом
:freeдоступны бесплатно с ограничениями по частоте. Удобно для проб, один ключ на всё. - Hugging Face Serverless Inference — бесплатные лимиты на запросы к открытым моделям;
HF_TOKEN. - Cloudflare Workers AI — бесплатный ежедневный лимит запросов к открытым моделям, OpenAI-совместимый endpoint.
- Mistral La Plateforme — бесплатный уровень на экспериментальные модели.
- Together AI и Fireworks — стартовые кредиты при регистрации, хватает на тесты.
Практический совет: связка «Groq бесплатно + Gemini Flash бесплатно» закрывает большинство задач без единого рубля, а для серьёзной работы подключается DeepSeek по цене в разы ниже западных флагманов.
Локальные модели
Локальный запуск даёт полную приватность и нулевую стоимость запросов, но требует железа — прежде всего видеопамяти (VRAM). Основные инструменты:
- Ollama — самый простой способ:
ollama pull qwen2.5-coderи готово. Поднимает OpenAI-совместимый endpoint наhttp://localhost:11434/v1, который напрямую подключается к Hermes. - LM Studio — графический интерфейс, скачивание моделей с Hugging Face, встроенный OpenAI-совместимый сервер.
- llama.cpp — движок для запуска GGUF-моделей, основа Ollama; максимальная гибкость.
- vLLM — высокопроизводительный сервинг для GPU, если нужно обслуживать много запросов.
Ориентир по видеопамяти (квантование 4 бита):
- 7B — примерно 5–8 ГБ VRAM;
- 13–14B — около 10–12 ГБ;
- 32B — порядка 20–24 ГБ;
- 70B — от 40 ГБ и выше.
Для локального кодинга хорошо себя показывают Qwen2.5-Coder, DeepSeek-R1 (дистилляты), Llama 3.x, Mistral и Gemma. Скорость напрямую зависит от GPU: на видеокарте это десятки токенов в секунду, на CPU — единицы, что для агентной работы уже некомфортно.
Сравнительная таблица моделей
Цены ориентировочные, по порядку величины (дорого / средне / дёшево) — точные тарифы за токен меняются, смотрите актуальные на сайтах провайдеров.
| Модель | Тип | Сильные стороны | Цена (порядок) |
|---|---|---|---|
| Claude Opus / Sonnet | Облачная | Код, агентные задачи, огромный контекст | Дорого |
| GPT-5 / o-серия | Облачная | Универсальность, рассуждение | Средне–дорого |
| Gemini Pro / Flash | Облачная | Контекст, мультимодальность; Flash — скорость | Средне / дёшево |
| DeepSeek V3 / R1 | Облачная + открытые веса | Цена/качество, reasoning, доступ из РФ | Очень дёшево |
| Qwen / Qwen-Coder | Облачная + открытые веса | Кодинг, локальный запуск | Дёшево |
| Grok | Облачная | Скорость, рассуждение | Средне |
| Kimi K2 / GLM / MiniMax | Облачная | Агентные задачи, невысокая цена | Дёшево |
| Llama / Mistral (локально) | Локальная | Приватность, без платы за токены | Бесплатно (после покупки железа) |
| Groq / Gemini free / OpenRouter :free | Облачная (free tier) | Бесплатно, быстрый старт | Бесплатно (с лимитами) |
Облачные vs локальные
| Критерий | Облачные | Локальные |
|---|---|---|
| Цена | Оплата за токены; есть бесплатные уровни | Бесплатно после покупки железа |
| Скорость | Стабильно высокая у провайдера | Зависит от GPU; на CPU медленно |
| Качество | Frontier-модели (Claude, GPT, Gemini) сильнее | Открытые модели уступают, но догоняют |
| Приватность | Данные уходят провайдеру | Полный контроль, данные не покидают машину |
| Контроль | Ограничен | Полный: квантование, тюнинг, свои модели |
| Надёжность | Зависит от провайдера (fallback спасает) | Не зависит от интернета |
Что выбрать: рекомендации по сценариям
- Максимальное качество кода — Claude Sonnet/Opus, GPT-5, Gemini Pro.
- Бюджет при хорошем качестве — DeepSeek (V3/R1), Qwen, Gemini Flash.
- Полная приватность — локально через Ollama: Qwen2.5-Coder, DeepSeek-R1, Llama 3.
- Бесплатно и быстро — Groq Cloud (open models) + Gemini Flash free tier.
- Доступ из РФ без сложностей — DeepSeek (дёшево, доступен без VPN) или локальные модели.
- Надёжность в продакшене — основной провайдер + fallback-цепочка из резервных.
Как подключить модель в Hermes
Облачный провайдер — просто ключ в ~/.hermes/.env:
DEEPSEEK_API_KEY=sk-...
ANTHROPIC_API_KEY=sk-ant-...
GOOGLE_API_KEY=...
XAI_API_KEY=...
Локальная или OpenAI-совместимая модель — через custom-провайдер с base_url. Например, Ollama:
model:
aliases:
local-qwen:
model: qwen2.5-coder:14b
provider: custom
base_url: "http://localhost:11434/v1"
Аналогично подключается Groq (base_url https://api.groq.com/openai/v1 с ключом) или любой другой OpenAI-совместимый endpoint. Переключение в сессии — /model local-qwen, резервная цепочка — hermes fallback add.
Заключение
Единого «лучшего» ответа нет — выбор модели под Hermes сводится к треугольнику «качество / цена / приватность». Для большинства задач отличной отправной точкой будет DeepSeek или Gemini Flash (дёшево и быстро), для сложного кода — Claude или GPT, для приватных проектов — локальный Ollama с Qwen или Llama, а для экспериментов без бюджета — бесплатные Groq и Google AI Studio. Благодаря резервной цепочке и алиасам Hermes позволяет не выбирать что-то одно: можно держать премиум-модель для сложных задач и дешёвую/бесплатную для рутины, переключаясь одной командой.
Источники
- Документация Hermes: hermes-agent.nousresearch.com/docs
- Провайдеры и модели Hermes: руководство по провайдерам
- Репозиторий: github.com/NousResearch/hermes-agent
А есть конкретные цифры, во сколько обходится миллион токенов у облачных провайдеров против локального запуска? Хочется понять, с какого объёма запросов своя железка начинает окупаться.
У меня как раз похожая связка — Ollama с Qwen для рутины и DeepSeek для сложных задач, переключаюсь одной командой. А резервная цепочка реально выручает, когда облачный провайдер вдруг отваливается.
@Мария, а переключение между моделями реально удобное или это только для тех, кто не боится лезть в конфиги? Хочется, чтобы такая гибкость не превращалась в настройку на полдня.
Прочитала статью и всё равно не до конца поняла, насколько локальные модели реальны для обычного человека, а не для программиста. У меня ноутбук без видеокарты, так что вариант с Ollama, видимо, отпадает, и остаются только облачные. Отдельно зацепило упоминание бесплатных API — на них правда можно работать или это только попробовать? И если брать одну модель для повседневных задач, на какой остановиться, чтобы потом не было сюрпризов в счетах?
Получается, модель можно поменять прямо в середине работы и ничего не потеряется? Я как раз выбираю между бесплатной версией и платной, и не хочется потом всё настраивать заново.