Hermes Agent · Урок 06
Выберите экономичную модель для Hermes
Ознакомьтесь с ценами на модели ИИ, перенаправляйте рутинные задачи на модели с низкой стоимостью и установите лимит бюджета Hermes в $20 на первый день.

0 из 24 завершено
Последнее тестирование и обновление: Июнь 2026
Hermes не выбирает модель за вас, и этот выбор является самым большим фактором в ежемесячном счете.
Новички, которые выбирают самую дорогую модель, могут тратить $200 в месяц на работу, которую $10 модель выполняет. Направляйте дешевые задачи к дешевым моделям.
В этом уроке предполагается, что одна модель уже настроена. См. L02: Установка и первый запуск и Модели ИИ L01 для настройки.
Разница в цене в двести раз
Та же рабочая нагрузка, четыре модели, разница в цене 200×. Вот реальный сценарий затрат. Начинающий отправляет 100 сообщений в день. В среднем: 500 токенов на ввод, 1000 токенов на вывод. Та же рабочая нагрузка, четыре разные модели:
- DeepSeek V4 Flash → ~1,20 $/месяц
- Kimi K2.6 → ~2 $/месяц
- Claude Sonnet 4.5 → ~50 $/месяц
- Claude Opus 4.8 → ~250 $/месяц
Вопросы одинаковые, а ответы совпадают в пределах 35% задач согласно исходному видео. Цена отличается в двести раз. Выбор модели, а не интерфейса, оболочки или навыков, определяет счет.
Исправление заключается в одноразовом изменении ментального подхода: перестаньте думать «какая модель лучшая?» и начните думать «какая модель дешевая и и достаточно хороша для этой конкретной задачи?”
Читайте цены на модели правильно
Цена указана за миллион токенов, с тремя числами на модель. Обычно есть три числа:
- Цена ввода: сколько вы платите за токены, которые отправляете (запрос + контекст).
- Цена вывода: сколько вы платите за токены, которые генерирует модель. Обычно в 3-5 раз дороже за токен, чем входной.
- Цена кешированного ввода (иногда): скидка за повторяющийся контекст. DeepSeek и OpenAI предлагают это.
| Модель | Ввод $/1M | Вывод $/1M | Кешированный ввод $/1M | Уровень |
|---|---|---|---|---|
| DeepSeek V4 Flash | $0.10 | $0.30 | $0.02 | Исполнитель (дешево) |
| Kimi K2.6 | $0.15 | $0.60 | N/A | Исполнитель (дешево) |
| MiniMax M3 | $0.20 | $0.80 | N/A | Исполнитель (дешево) |
| Claude Sonnet 4.5 | $3.00 | $15.00 | $0.30 | Рецензент (средне) |
| Claude Opus 4.8 | $15.00 | $75.00 | $1.50 | Оркестратор (дорого) |
| Claude Fable 5 | $25.00 | $125.00 | N/A | Мифос (редко) |
Две вещи, на которые стоит обратить внимание. Выход стоит в 3–5 раз дороже, чем вход: длинные ответы стоят дороже, чем предполагает число входа. Разброс сверху вниз примерно в 250 раз. Эта таблица цен — не ошибка округления. Это счет.
Пирамида рейтингов
Как думать о маршрутизации: складывать модели по тому, как часто их следует вызывать, а не по тому, насколько они хороши.
Четыре уровня, сверху вниз:
- Оркестратор (редко, дорого). Opus 4.8, Fable 5. Планирует работу, решает, когда эскалировать. Вызывается, возможно, 1–5 раз на задачу. ~95% вашего стоимость если дать ему работать без ограничений.
- Рецензент (иногда, средний диапазон). Сонет 4.5, GPT-5.x. Проверяет результаты работы исполнителя. Проводит выборочные проверки и полировку. Вызывается, когда что-то выглядит неправильно.
- Пул исполнителей (постоянный, дешевый). V4 Flash, Kimi K2.6, MiniMax M3. Выполняет фактическую работу: рефакторинг, суммаризация, форматирование, запуск cron. Вызывается 50–500 раз на задачу. Здесь происходит примерно 95% вашего количества вызовов жизни.
- Направленные результаты. Конкретные задачи: рефакторинг Python-файла, суммаризация 3 PDF, запуск cron в 7 утра, параллельное исследование суб-агентов.
Основной путь — уровень 1 → уровень 3 (планирует оркестратор, выполняют исполнители). Второстепенный путь — уровень 2 ↔ уровень 3 (рецензент выборочно проверяет исполнителей).
Фон: L01: Что такое агент Hermes? (модель против каркаса). Для контекста уровня начните с уроков AI моделей.
Маршрутизация по задаче
Сопоставьте задачу с уровнем, затем с моделью.
| Задача | Уровень | Выбрать | Почему |
|---|---|---|---|
| Рефакторинг / обзор / исследование / cron | Исполнитель | V4 Flash / Kimi / M3 | Дешево, быстро, достаточно хорошо: 95% вызовов попадают сюда |
| Суммаризация длинных документов | Исполнитель | V4 Flash | 1M контекст, проверено на источниках |
| Творческое письмо в один проход | Оркестратор | Opus / Sonnet | Важны детали |
| Сложное рассуждение / визуализация / планирование | Оркестратор | Opus / Fable 5 / GPT-5.x | Когда действительно нужен лучший результат |
| Делегирование суб-агента (параллельно) | Оркестратор (скорость) или Исполнитель (стоимость) | Opus для срочных задач, V4 Flash на ночь | Компромисс между скоростью и стоимостью |
Руководство по принятию решений:
- Если ваша основная цель — сэкономить деньги → начните с V4 Flash. Переходите на Opus только когда достигнете предела.
- Если ваша основная цель — качественный результат → начните с Opus. Внимательно следите за счетом и переходите на дешевый вариант, где это возможно.
- Если ваша основная цель — баланс → используйте многоуровневую маршрутизацию. По умолчанию V4 Flash, Opus для трудных задач.
Ценообразование по пересечению инструментов: L09: Hermes Agent vs Claude Code vs Mavis.
Обязательный первый шаг: установить лимит бюджета
Сделайте это сегодня, до вашего первого счёта, прежде чем вы забудете. Для каждого поставщика моделей, которого вы используете:
- Войдите в панель управления поставщика (Anthropic, OpenAI, DeepSeek и т. д.).
- Найдите Оплата раздел.
- Установите жёсткий месячный лимит. $20 разумно для новичка. $50, если вы выполняете интенсивную работу по расписанию.
- Настройте уведомления по email на 50%, 80% и 100% лимита.
Реальная стоимость для задачи новичка (работающие примеры)
Задача 1: Рефакторинг скрипта на Python длиной 100 строк. V4 Flash: ~$0,02. Opus: ~$0,80. Используйте V4 Flash. Задача хорошо определена.
Задача 2: Прочитайте три научные статьи по 100 страниц каждая, объедините их резюме. V4 Flash: ~0,30 $ (проверено на исходном видео, все три документа за 2 минуты). Opus: ~3,00 $. Используйте V4 Flash.
Задача 3: «Решите эту логическую задачу.» V4 Flash: проходит. Opus: проходит. Используйте V4 Flash, если вы доверяете ответу; Opus — если нужно проверить.
Задача 4: Делегирование субагента для параллельного исследования. V4 Flash: 14 минут, полный вывод (по источнику). Opus: ~3–5 минут для той же работы. Для делегирования с ограничением по времени используйте Opus. Для ночных исследований — V4 Flash.
Задача 5: Одноразовое творческое письмо (вступление к блогу). V4 Flash: непоследовательно, многословно, промахи цели. Opus: более отточенные первые варианты. Используйте Opus для креативных одноразовых задач. Важна полировка.
Переключение моделей в середине сеанса
Вы можете переключаться, не теряя контекста. В TUI выполните hermes model и выберите из списка. В настольном приложении используйте переключатель моделей в боковой панели. V4 Flash в настоящее время бесплатен на Hermes News Portal.
Перенаправьте одну дорогую задачу
Просмотрите свои расходы за последние 30 дней и перенаправьте одну задачу на дешевую модель.
Упражнение
Откройте панель управления вашим поставщиком моделей. Посмотрите использование за последние 30 дней и найдите самую дорогую модель, которую вы запускали. Спросите себя: могла ли V4 Flash выполнить эту работу за 1/10 стоимости?
Запишите две вещи в текстовый файл:
- Одна задача из последних 30 дней, которая должна была быть направлена на дешевую модель. Будьте конкретны: «ежедневный сводный файл по cron» лучше, чем «работа по суммированию».
- Одна задача, которая действительно требовала дорогой модели. Полировка, видение, сложный одноразовый подход. Это доказывает, что вы понимаете, что правило маршрутизации не всегда «дешево».
Смотрите полный разбор
22-минутное исходное видео подробно показывает цифры затрат голосом Рона:
Для более широкой классификации моделей (Opus 4.8, Fable 5, GPT 5.4, Gemini 3.1 Pro, GLM 5.1, Kimi 2.5 и прочие):
Что дальше
- L07: Как защитить вашего агента Hermes.
- L09: Hermes Agent vs Claude Code vs Mavis.
- L04: Объяснение умений агентов Hermes и наборов умений.