Hermes Agent · Урок 06

Выберите экономичную модель для Hermes

Ознакомьтесь с ценами на модели ИИ, перенаправляйте рутинные задачи на модели с низкой стоимостью и установите лимит бюджета Hermes в $20 на первый день.

Бумажная модель ручной резки распределительной станции, отправляющая карточки задач на эффективные движки под ограниченным счетчиком монет
Время чтения
11 мин
Последнее обновление
Июнь 2026

0 из 24 завершено

Завершить & далее →

Последнее тестирование и обновление: Июнь 2026

Hermes не выбирает модель за вас, и этот выбор является самым большим фактором в ежемесячном счете.

Новички, которые выбирают самую дорогую модель, могут тратить $200 в месяц на работу, которую $10 модель выполняет. Направляйте дешевые задачи к дешевым моделям.

В этом уроке предполагается, что одна модель уже настроена. См. L02: Установка и первый запуск и Модели ИИ L01 для настройки.

Разница в цене в двести раз

Та же рабочая нагрузка, четыре модели, разница в цене 200×. Вот реальный сценарий затрат. Начинающий отправляет 100 сообщений в день. В среднем: 500 токенов на ввод, 1000 токенов на вывод. Та же рабочая нагрузка, четыре разные модели:

  • DeepSeek V4 Flash → ~1,20 $/месяц
  • Kimi K2.6 → ~2 $/месяц
  • Claude Sonnet 4.5 → ~50 $/месяц
  • Claude Opus 4.8 → ~250 $/месяц

Вопросы одинаковые, а ответы совпадают в пределах 35% задач согласно исходному видео. Цена отличается в двести раз. Выбор модели, а не интерфейса, оболочки или навыков, определяет счет.

Исправление заключается в одноразовом изменении ментального подхода: перестаньте думать «какая модель лучшая?» и начните думать «какая модель дешевая и и достаточно хороша для этой конкретной задачи?

Читайте цены на модели правильно

Цена указана за миллион токенов, с тремя числами на модель. Обычно есть три числа:

  • Цена ввода: сколько вы платите за токены, которые отправляете (запрос + контекст).
  • Цена вывода: сколько вы платите за токены, которые генерирует модель. Обычно в 3-5 раз дороже за токен, чем входной.
  • Цена кешированного ввода (иногда): скидка за повторяющийся контекст. DeepSeek и OpenAI предлагают это.
МодельВвод $/1MВывод $/1MКешированный ввод $/1MУровень
DeepSeek V4 Flash$0.10$0.30$0.02Исполнитель (дешево)
Kimi K2.6$0.15$0.60N/AИсполнитель (дешево)
MiniMax M3$0.20$0.80N/AИсполнитель (дешево)
Claude Sonnet 4.5$3.00$15.00$0.30Рецензент (средне)
Claude Opus 4.8$15.00$75.00$1.50Оркестратор (дорого)
Claude Fable 5$25.00$125.00N/AМифос (редко)

Две вещи, на которые стоит обратить внимание. Выход стоит в 3–5 раз дороже, чем вход: длинные ответы стоят дороже, чем предполагает число входа. Разброс сверху вниз примерно в 250 раз. Эта таблица цен — не ошибка округления. Это счет.

Пирамида рейтингов

Как думать о маршрутизации: складывать модели по тому, как часто их следует вызывать, а не по тому, насколько они хороши.

Диаграмма уровней: оркестратор (класс Opus, редкий) передает исполнительному пулу (V4 Flash, Kimi, M3, частые), который распределяет на задачи рефакторинга, суммаризации, cron и подагентов

Четыре уровня, сверху вниз:

  1. Оркестратор (редко, дорого). Opus 4.8, Fable 5. Планирует работу, решает, когда эскалировать. Вызывается, возможно, 1–5 раз на задачу. ~95% вашего стоимость если дать ему работать без ограничений.
  2. Рецензент (иногда, средний диапазон). Сонет 4.5, GPT-5.x. Проверяет результаты работы исполнителя. Проводит выборочные проверки и полировку. Вызывается, когда что-то выглядит неправильно.
  3. Пул исполнителей (постоянный, дешевый). V4 Flash, Kimi K2.6, MiniMax M3. Выполняет фактическую работу: рефакторинг, суммаризация, форматирование, запуск cron. Вызывается 50–500 раз на задачу. Здесь происходит примерно 95% вашего количества вызовов жизни.
  4. Направленные результаты. Конкретные задачи: рефакторинг Python-файла, суммаризация 3 PDF, запуск cron в 7 утра, параллельное исследование суб-агентов.

Основной путь — уровень 1 → уровень 3 (планирует оркестратор, выполняют исполнители). Второстепенный путь — уровень 2 ↔ уровень 3 (рецензент выборочно проверяет исполнителей).

Фон: L01: Что такое агент Hermes? (модель против каркаса). Для контекста уровня начните с уроков AI моделей.

Маршрутизация по задаче

Сопоставьте задачу с уровнем, затем с моделью.

ЗадачаУровеньВыбратьПочему
Рефакторинг / обзор / исследование / cronИсполнительV4 Flash / Kimi / M3Дешево, быстро, достаточно хорошо: 95% вызовов попадают сюда
Суммаризация длинных документовИсполнительV4 Flash1M контекст, проверено на источниках
Творческое письмо в один проходОркестраторOpus / SonnetВажны детали
Сложное рассуждение / визуализация / планированиеОркестраторOpus / Fable 5 / GPT-5.xКогда действительно нужен лучший результат
Делегирование суб-агента (параллельно)Оркестратор (скорость) или Исполнитель (стоимость)Opus для срочных задач, V4 Flash на ночьКомпромисс между скоростью и стоимостью

Руководство по принятию решений:

  • Если ваша основная цель — сэкономить деньги → начните с V4 Flash. Переходите на Opus только когда достигнете предела.
  • Если ваша основная цель — качественный результат → начните с Opus. Внимательно следите за счетом и переходите на дешевый вариант, где это возможно.
  • Если ваша основная цель — баланс → используйте многоуровневую маршрутизацию. По умолчанию V4 Flash, Opus для трудных задач.

Ценообразование по пересечению инструментов: L09: Hermes Agent vs Claude Code vs Mavis.

Обязательный первый шаг: установить лимит бюджета

Сделайте это сегодня, до вашего первого счёта, прежде чем вы забудете. Для каждого поставщика моделей, которого вы используете:

  1. Войдите в панель управления поставщика (Anthropic, OpenAI, DeepSeek и т. д.).
  2. Найдите Оплата раздел.
  3. Установите жёсткий месячный лимит. $20 разумно для новичка. $50, если вы выполняете интенсивную работу по расписанию.
  4. Настройте уведомления по email на 50%, 80% и 100% лимита.

Реальная стоимость для задачи новичка (работающие примеры)

Задача 1: Рефакторинг скрипта на Python длиной 100 строк. V4 Flash: ~$0,02. Opus: ~$0,80. Используйте V4 Flash. Задача хорошо определена.

Задача 2: Прочитайте три научные статьи по 100 страниц каждая, объедините их резюме. V4 Flash: ~0,30 $ (проверено на исходном видео, все три документа за 2 минуты). Opus: ~3,00 $. Используйте V4 Flash.

Задача 3: «Решите эту логическую задачу.» V4 Flash: проходит. Opus: проходит. Используйте V4 Flash, если вы доверяете ответу; Opus — если нужно проверить.

Задача 4: Делегирование субагента для параллельного исследования. V4 Flash: 14 минут, полный вывод (по источнику). Opus: ~3–5 минут для той же работы. Для делегирования с ограничением по времени используйте Opus. Для ночных исследований — V4 Flash.

Задача 5: Одноразовое творческое письмо (вступление к блогу). V4 Flash: непоследовательно, многословно, промахи цели. Opus: более отточенные первые варианты. Используйте Opus для креативных одноразовых задач. Важна полировка.

Переключение моделей в середине сеанса

Вы можете переключаться, не теряя контекста. В TUI выполните hermes model и выберите из списка. В настольном приложении используйте переключатель моделей в боковой панели. V4 Flash в настоящее время бесплатен на Hermes News Portal.

Перенаправьте одну дорогую задачу

Просмотрите свои расходы за последние 30 дней и перенаправьте одну задачу на дешевую модель.

Упражнение

Откройте панель управления вашим поставщиком моделей. Посмотрите использование за последние 30 дней и найдите самую дорогую модель, которую вы запускали. Спросите себя: могла ли V4 Flash выполнить эту работу за 1/10 стоимости?

Запишите две вещи в текстовый файл:

  1. Одна задача из последних 30 дней, которая должна была быть направлена на дешевую модель. Будьте конкретны: «ежедневный сводный файл по cron» лучше, чем «работа по суммированию».
  2. Одна задача, которая действительно требовала дорогой модели. Полировка, видение, сложный одноразовый подход. Это доказывает, что вы понимаете, что правило маршрутизации не всегда «дешево».

Смотрите полный разбор

22-минутное исходное видео подробно показывает цифры затрат голосом Рона:

Для более широкой классификации моделей (Opus 4.8, Fable 5, GPT 5.4, Gemini 3.1 Pro, GLM 5.1, Kimi 2.5 и прочие):

Что дальше

Проверьте свое понимание

В1.Для новичка, отправляющего 100 сообщений в день с в среднем 500 входными и 1000 выходными токенами, реалистичная месячная стоимость DeepSeek V4 Flash приблизительно равна:
В2.В схеме многоуровневой маршрутизации, какой процент всех вызовов должен приходиться на дешёвый уровень исполнения?
В3.Какая задача НЕ подходит для модели дешевого исполнителя?
В4.Краткий ответ: назовите самую важную оборонительную привычку из этого урока.
В5.Что такое "многоуровневая маршрутизация"?
В6.Верно или неверно: выходные токены стоят так же, как входные токены, поэтому заглавная цена ввода модели рассказывает всю историю.