Hermes Agent · Учебник 14
Тестируйте навыки агента Hermes с NVIDIA SkillEvaluator
Добавьте консультативное сканирование NVIDIA к установкам навыков Hermes, изучите результаты и оцените, улучшает ли один из ваших собственных навыков реальную работу агента.

0 из 24 завершено
Последнее тестирование и обновление: 20 августа 2026 г. Поведение Hermes было проверено с помощью агента Hermes main на коммите bf4f5e17, текущей документации по навыкам Hermes, документации NVIDIA SkillEvaluator и бенчмарка NVIDIA от 12 августа.
NVIDIA протестировала более 300 проверенных навыков в более чем 30 продуктах и сообщила прямой результат: по их бенчмарку предоставление агенту соответствующего навыка повышало среднюю точность на 41 пункт и эффективность на 39 пунктов.
Это действительно не означает, что каждый SKILL.md делает агента лучше. Расплывчатый навык может тратить токены впустую. Слишком широкое описание может загрузиться для неправильной задачи. Злонамеренный навык может тихо поручить Hermes читать секреты или выполнять разрушительные команды. Полезная часть выпуска NVIDIA — не заголовочное число. Важен метод: осмотреть пакет, определить задачи, которые он должен и не должен выполнять, а затем выполнить ту же работу с навыком и без него.
Hermes теперь подключается к части этого рабочего процесса. Если на вашем компьютере установлен NVIDIA SkillEvaluator, hermes skills install может выполнить сканирование уровня 1 без ключа, пока загруженный навык все еще находится в карантине. Hermes показывает результаты по файлам и строкам до обычного подтверждения установки.
Этот урок поможет вам использовать эту функцию, не путая предупреждение с гарантией — или эталон Codex с прямым эталоном Hermes.
Предварительные условия: выполнены L04: Навыки агента Hermes и наборы навыков сначала. Для загруженной существующей библиотеки, L13: Безопасная очистка навыков Hermes с помощью Curator является уроком по обслуживанию компонентов.
Что вы завершите
К концу этого урока вы сможете:
- включите необязательное сканирование NVIDIA, используемое при установках Hermes hub;
- объясните, какой сканер может блокировать установку, а какой только дает рекомендации;
- читайте находки PII, секретные, Unicode, лицензий, lint и безопасности, не рассматривая каждое совпадение как вредоносное;
- вручную проверяйте локальный навык Hermes;
- разрабатывайте положительные и отрицательные сценарии оценки для одного навыка;
- выполняйте контролируемое сравнение с навыком и без навыка на поддерживаемом каркасе; и
- честно сообщайте об улучшении навыка, стоимости, токенах и ограничениях.
Что на самом деле выпустила NVIDIA
ОценщикНавыков — это открытая платформа для оценки артефактов агентов, начиная с навыков. Она имеет три независимых уровня:
| Уровень | Вопрос | Типичные проверки |
|---|---|---|
| Уровень 1: валидация | Безопасен ли этот пакет и корректно ли он сформирован? | Схема, качество, PII, скрытая передача Unicode, лицензия, проверка скрипта, безопасность |
| Уровень 2: уникальность | Является ли руководство дублированным или перекрывающимся? | Повторяющиеся инструкции внутри одного навыка и сходство по каталогу |
| Уровень 3: живая оценка | Изменяет ли навык реальную производительность агента? | Сравнительное выполнение задач с навыком и без него, оценка, траектории, токены, время |
Tier 3 использует фреймворк NVIDIA Harbor для создания изолированных экспериментов. Каждый случай выполняется дважды с одинаковым запросом, моделью, входными данными, средой и оценщиком. Одной версии присваивается навык, другой нет. Разница в баллах составляет Прирост навыка, измеряемый в баллах.
Опубликованные NVIDIA данные показывают эти средние показатели по всему каталогу для Codex и Claude Code:
| Измерение | Без навыка | С навыком | Прирост навыка |
|---|---|---|---|
| Правильность | 46 | 87 | +41 |
| Обнаруживаемость | 42 | 82 | +40 |
| Эффективность | 39 | 78 | +39 |
| Эффективность | 43 | 78 | +35 |
| Безопасность | 97 | 98 | +1 |
Это именно баллы, а не процентное увеличение или вероятность успешного выполнения. Они также являются средними по кураторскому каталогу проверенных навыков, а не обещанием для вашего навыка. NVIDIA сообщает, что 85% опубликованных навыков использовали одну попытку для задачи, 15% — две, и публикация не содержит доверительных интервалов. Рассматривайте эти цифры как доказательство того, что навыки могут иметь значение, — и как причину измерять эффективность вашего рабочего процесса.
Что добавил Hermes — и чего не добавил
В Hermes уже была встроенная защита умений. Она сканирует загруженные в карантин пакеты, применяет политику доверия к источнику, записывает происхождение и решает, разрешена ли установка. Опасный вердикт остаётся заблокированным; --force это не универсальное обходное решение.
Интеграция NVIDIA — второе мнение которое выполняется после того, как встроенный защитник разрешил пакет, и до того, как Hermes попросит вас подтвердить установку. В текущем исходном коде Hermes оно запрашивает именно этот поднабор Уровня 1:
PII, Unicode, lint, лицензия, безопасность
С security проверка делегируется отдельно установленному бинарнику NVIDIA SkillSpector. Если SkillSpector отсутствует или его доказательства неполные, Hermes сообщает, что проверка безопасности не была выполнена. Он не превращает отсутствующие доказательства в чистый результат незаметно.
Граница имеет значение:
| Возможность | Встроенный защитник Hermes | Опциональный пропуск SkillEvaluator |
|---|---|---|
| Работает на установках hub | Да | Да, когда бинарник включен PATH |
| Принимает решение о допуске/блокировке | Да | Нет |
| Показывает найденные файлы и строки | Да | Да |
| Выдает предупреждения о возможных PII и учетных данных | Да | Да |
| Проверяет Unicode, лицензию и синтаксис скрипта | Частично, согласно правилам Hermes | Да, в выбранном подмножестве Tier 1 |
| Выполняет анализ сходства Tier 2 | Нет | Нет, не в установочном хуке |
| Работает на Tier 3 с тестами или без них | Нет | Нет, не в установочном хуке |
| Для этого пропуска во время установки необходим ключ API | Нет | Нет |
Функция включена по умолчанию в конфигурации Hermes, но она молча ничего не делает до тех пор, пока skillevaluator не будет установлена. Вот почему обновленная установка Hermes может вести себя точно так же, как и раньше.
Шаг 1: обновите Hermes и установите дополнительные сканеры
Сначала обновите Hermes через тот же канал установки, который вы уже используете:
Гермес обновление
Гермес версия
uv --version
Текущая документация Hermes фиксирует установочные инструменты следующим образом:
uv инструмент install --python 3.13 \
"skillevaluator @ git+https://github.com/NVIDIA/SkillEvaluator.git@v0.1.0"
uv инструмент install \
"git+https://github.com/NVIDIA/SkillSpector.git@v2.9.5"
Если ваша оболочка не может найти команды после этого, выполните uv tool update-shell, откройте новый терминал и проверьте:
оценщикнавыков --help
офицернавыков --help
Hermes читает skills.tier1_advisory из ~/.hermes/config.yaml. По умолчанию используется true. Добавляйте этот блок только если вы ранее отключили его или хотите, чтобы выбор был явным:
навыки:
консультация_уровня1: true
Чтобы позже отключить интеграцию с советником:
навыки:
консультация_уровня1: ложь
Для этих детерминированных проверок во время установки не требуется ключ API OpenAI, Anthropic или NVIDIA.
Шаг 2: проверьте перед установкой
Выберите настоящую стороннюю способность, которую вы уже рассматривали. Не устанавливайте случайный пакет только ради того, чтобы индикатор сканера загорелся.
Гермес навыки поиск kubernetes
Гермес навыки inspect openai/skills/k8s
Гермес навыки install openai/skills/k8s
Поток установки теперь должен иметь четыре видимых этапа:
загрузка в карантин
→ встроенное сканирование безопасности Hermes и принятие решений по политике
→ консультационные выводы SkillEvaluator уровня 1
→ ваше подтверждение установки
Если в выводе никогда не упоминается SkillEvaluator, проверьте skillevaluator --help в той же оболочке, которая запускает Hermes. Интеграция ищет бинарный файл в PATH; установка его в другой среде недостаточна.
Читайте вывод по классам
Вывод PII может идентифицировать реальный личный адрес электронной почты, локальное имя пользователя, абсолютный путь к домашней директории или строку подключения. Они также могут сопоставлять примеры из документации, такие как git@github.com. Рассматривайте строку как объект для проверки, а не как приговор.
Находки класса Secrets включают приватные ключи, ключи доступа к облаку, токены, вебхуки, JWT и строки подключения с учетными данными. Hermes выделяет их красным. Остановитесь и тщательно проверьте файл перед продолжением. Секрет, встроенный в пакет навыков, обычно следует удалить и заменить, а не оставлять из-за того, что навык кажется полезным.
Находки Unicode ищут невидимые или обманчивые символы, такие как управляющие символы направления текста и текст нулевой ширины. Они могут скрывать инструкции или делать команду отличной от того, что получает оболочка.
Находки скриптового анализа (lint) указывают на небезопасные или некорректные вспомогательные скрипты. Читайте вызываемую команду, аргументы, сетевые назначения и область файловой системы.
Выводы по лицензии являются рисками при внедрении, а не доказательством злонамеренного поведения. Отсутствие или несовместимая лицензия всё равно может сделать навык непригодным для командного или коммерческого использования.
Результаты по безопасности получаются от SkillSpector, когда он установлен и успешно завершает работу. Это гипотезы для исследования. Автоматические сканеры могут пропускать тонкие проявления поведения и могут помечать допустимые инструкции по администрированию.
Шаг 3: вручную проверить один локальный навык Hermes
Установочный хук охватывает загрузки из хаба. Ваши собственные навыки, измененные навыки и ранее установленные пакеты заслуживают такого же внимания.
Найдите каталог навыка в ~/.hermes/skills/, затем воспроизведите подмножество установки Hermes:
оценщикнавыков проверить ~/.hermes/skills/my-skill \
--проверки pii,unicode,lint,license,security \
--без_удвоения
Для более широкой гигиены написания включите схему и качество:
оценщикнавыков проверить ~/.hermes/skills/my-skill \
--проверки schema,pii,license,quality,unicode,lint \
--без_удвоения
Вторая команда сознательно пропускает внешнюю проверку безопасности. Это быстрый детерминированный проход записи, который выполняется до настройки более глубокой проверки сканера. Для полного запуска безопасности уровня 1 следуйте текущему руководству NVIDIA по установке Semgrep, SkillSpector и Gitleaks, затем убедитесь, что каждая требуемая проверка действительно завершена.
Используйте файлы отчетов, когда необходим проверяемый аудит:
оценщикнавыков проверить ~/.hermes/skills/my-skill \
--проверки schema,pii,license,quality,unicode,lint \
--без_удвоения \
-r cli,json,html \
-o reports/my-skill
Не добавляйте в коммит артефакты отчетов, содержащие личные пути, зафиксированные подсказки или секреты. Просмотрите их и отредактируйте перед совместным использованием.
Шаг 4: составьте набор оценки, который может что-то доказать
Живой бенчмарк полезен ровно настолько, насколько полезны его кейсы. Начните с одного навыка, чья задача достаточно узкая для оценки, например:
- превращать заметки с собрания в журнал решений;
- просмотреть pull request, используя фиксированный чеклист;
- извлечь цитаты из исследовательской записки;
- создать план развертывания без его выполнения.
Сгенерировать начальный набор данных из четырех категорий:
оценщикнавыков создать_датасет_оценки ~/.hermes/skills/my-skill --полный
Это записывает evals/evals.json внутри навыка. Просмотрите каждый случай перед использованием токенов модели.
Ваш набор данных должен охватывать:
| Тип случая | Что он доказывает | Пример для навыка проверки PR |
|---|---|---|
| Явный | Пользователь прямо запрашивает навык | «Используйте чеклист безопасности PR для этого diff.» |
| Неявный | Задача требует навыка без его упоминания | «Просмотрите это изменение аутентификации перед слиянием.» |
| Контекстуальный | Навык должен адаптироваться к предоставленному контексту | «Просмотрите это изменение только в документации; сосредоточьтесь на сломанных ссылках.» |
| Отрицательный | Навык должен оставаться выгруженным | «Напишите заметки о выпуске на основе этих объединённых заголовков PR.» |
Защищает негативные случаи обнаруживаемость. Навык, который активируется при каждом упоминании «review», «file» или «GitHub», может выглядеть занятым, одновременно ухудшая несвязанную работу.
Для каждого случая определите наблюдаемый ожидаемый результат или утверждение. «Даёт хороший ответ» не является критерием оценки. Лучшие критерии будут такими:
- называет три изменённые границы аутентификации;
- указывает точный файл для каждой блокирующей проблемы;
- не изменяет репозиторий;
- различает обязательные исправления и необязательные предложения;
- остаётся выгруженным для случая заметок о выпуске.
Шаг 5: запустите парное живое оценивание
Tier 3 — это отдельный и более тяжёлый рабочий процесс. Ему нужен поддерживаемый агент CLI, учетная запись оценщика/поставщика модели и бэкенд для выполнения. Docker — самая безопасная документированная отправная точка для ненадёжных навыков, поскольку каждое испытание запускается в изолированном контейнере.
Сначала проведите проверку готовности:
оценщикнавыков врач --агенты codex --режим-среды docker
Затем начните с одного агента и небольшого проверенного набора данных:
оценщикнавыков уровень3 оценивать ~/.hermes/skills/my-skill \
--агенты codex \
--режим-среды docker
Для менее шумного сравнения повторяйте каждый случай, а не доверяйте одному стохастическому запуску:
оценщикнавыков уровень3 оценивать ~/.hermes/skills/my-skill \
--агенты codex \
--режим-среды docker \
--n-попыток 3
NVIDIA Build может предоставлять оценщику и поддерживаемым агентам в Docker или локальном режиме один NVIDIA_API_KEY; Поставщики, совместимые с OpenAI, Anthropic, Bedrock и OpenAI имеют разные требования. Сохраняйте учетные данные оператора в среде хоста. SkillEvaluator отклоняет попытки контрабанды защищённых переменных учетных данных через evals/config.yml.
Шаг 6: прочитайте результат без попыток обмануть систему
Обратите внимание как минимум на пять вещей:
- Правильность: Соответствует ли конечный артефакт требованиям кейса?
- Эффективность: Выполнил ли агент задуманную последовательность действий, а не просто выглядел компетентным?
- Обнаруживаемость: Загружался ли навык для соответствующих задач и избегал ли негативных кейсов?
- Производительность: Избегал ли агент избыточных поисков, повторных чтений и безвыходных вызовов инструментов?
- Безопасность: Соблюдал ли навык границы в отношении секретов, разрушительных действий и авторизации?
Затем отдельно проанализируйте использование токенов, затраченное время и траектории. Положительное среднее значение может скрывать одну критическую регрессию. Читайте не только итоговый балл, но и неудачные случаи.
Используйте эту структуру принятия решений:
| Результат | Вероятное действие |
|---|---|
| Положительный эффект, чистые негативные случаи | Сохраняйте навык и добавляйте больше репрезентативных случаев |
| Корректность улучшается, количество токенов растет | Сократите инструкции, перенесите детали в ссылки, уберите повторяющиеся указания |
| Явные случаи проходят, неявные случаи не проходят | Перепишите описание и условия срабатывания |
| Негативные случаи нагружают навык | Сузьте описание; уберите ключевые слова-приманки |
| Безопасность регрессирует | Остановитесь; исправьте навык перед публикацией или его планированием |
| Нет стабильного улучшения результатов при повторных попытках | Упростите навык или примите, что базовый агент уже справляется с задачей |
Не переписывайте оценку после того, как увидели плохой результат, просто чтобы сделать диаграмму зеленой. Обновляйте случаи только тогда, когда контракт оценки действительно был неверным, и сохраняйте это изменение видимым в системе контроля версий.
Практический рабочий процесс Hermes
Вот инструкция, которую я рекомендую пользователям Hermes:
Перед установкой
проверка исходного кода → встроенный защитник Hermes → консультация SkillEvaluator → подтверждение человеком
Перед публикацией собственного навыка
Валидация уровня 1 → обзор явных/неявных/контекстуальных/отрицательных случаев → тест прокси уровня 3
Перед запланированием или предоставлением учетных данных
одноразовая задача Hermes → проверить вызовы инструментов и результаты → одобрять только требуемый доступ
После обновлений
повторное сканирование → повторный запуск наименьшего представительного набора оценки → сравнение токенов, времени и сбоев
Тест прокси уровня 3 может улучшить кросс-совместимость SKILL.md, но последний шаг Hermes всё ещё необходим. Hermes имеет собственный системный запрос, обнаружение навыков, инструменты, память и поведение при выполнении. Подъём Codex показывает, что инструкции помогли Codex в этом тесте; это не снимает необходимость проверки Hermes.
Устранение неполадок
| Симптом | Что это обычно означает | Исправить |
|---|---|---|
| Установка Hermes не показывает раздел SkillEvaluator | Необязательный бинарный файл отсутствует в процессе Hermes PATH | Запуск skillevaluator --help в той же оболочке обновите путь оболочки, затем перезапустите Hermes |
| Проверка безопасности сообщает «не выполнено» | SkillSpector отсутствует или вернул неполные данные | Установите пин SkillSpector, задокументированный Hermes, и запустите снова; не называйте результат чистым |
| Письмо с документацией помечено как PII | Детерминированное сканирование совпало с известным ложноположительным классом | Проверьте строку и замените реальные персональные данные; документируйте безопасные примеры, а не подавляйте их слепо |
--force Не удается установить навык | Встроенный защитник Hermes вынес опасный вердикт | Не обходите это; проверьте или исправьте пакет у его источника |
| Терапевт 3-го уровня не проходит | Агент CLI, учетные данные, Docker, модель или бэкенд не готовы | Исправьте указанную проверку готовности перед запуском платных испытаний |
| Skill Lift высок в одном случае и отрицателен в другом | Навык помогает одному рабочему процессу, но вредит другому | Разделите навык, сузьте его триггеры или сохраните отдельные специализированные навыки |
| Результат уровня 3 называется эталоном Hermes | Оценивался комплект средств Codex, Claude Code или OpenCode | Перемаркируйте его как прокси-результат и проведите отдельную контролируемую проверку Hermes |
Практическое упражнение
Используйте некритичный навык, который не требует учетных данных для производства
- Запустите быструю детерминированную проверку и сохраните отчет JSON локально
- Исправьте или явно проверьте все находки, связанные с ПДН, Unicode, лицензиями и lint
- Создайте четыре случая: явный, неявный, контекстный и отрицательный
- Добавьте наблюдаемые ожидаемые результаты или утверждения
- Запуск
doctor, затем оценку через Docker с одним агентом. - Сравните итоговый балл, токены, время и наихудшую индивидуальную регрессию.
- Один раз выполните ту же ограниченную задачу в Hermes перед тем, как полагаться на навык.
Критерии успеха
Вы закончите, когда сможете показать:
- какие проверки уровня 1 были выполнены, а какие нет;
- точное распределение на уровне строк для каждого найденного материала;
- как минимум один случай, когда навык должен оставаться выгруженным;
- результат с использованием навыка и без навыка на названной поддерживаемой тестовой установке;
- честное заявление о том, обобщается ли результат на Hermes или нет.
Самопроверка
В1. Какой компонент принимает окончательное решение о разрешении/блокировке во время установки хаба Hermes?
- A) Опубликованный бенчмарк NVIDIA
- B) Встроенный защитник навыков Hermes
- C) SkillEvaluator уровня 3
- D) Поле автора навыка
В2. Почему набор для оценки должен содержать отрицательные случаи?
В3. Запуск Codex уровня 3 сообщает о +25 улучшении навыка для вашего кросс-совместимого навыка. Что вы можете утверждать?
- A) Агент Hermes теперь на 25% точнее
- B) Навык улучшил каждый поддерживаемый каркас на 25 очков
- C) Навык улучшил измеренный показатель Codex на 25 очков в рамках этой оценки
- D) Навык безопасно запланировать с учетными данными для продакшена
В4. Что следует заключить, когда SkillSpector отсутствует, а проверка безопасности сообщает о неполноте?
Ответы
A1. B. Встроенный охранник Hermes остаётся слоем контроля. Установочный хук SkillEvaluator носит рекомендательный характер.
A2. Отрицательные случаи доказывают, что навык остается неактивным, когда он не имеет отношения к делу. Они выявляют слишком обобщенные описания и ловушку, которая может ухудшить работу, не связанную с этим.
A3. C. Skill Lift — это разница в очках для измеренной платформы, модели, случаев, оценщика и среды. Это не процент и автоматически не обобщается на Hermes.
A4. У вас нет мнения по поводу этого отсутствующего теста. Не переводите неполные доказательства в чистый результат безопасности.
Источники
- Технический блог NVIDIA: Оценка производительности навыков AI-агента с NVIDIA SkillEvaluator
- Репозиторий NVIDIA SkillEvaluator
- Документация NVIDIA SkillEvaluator: Валидация уровня 1
- Документация NVIDIA SkillEvaluator: оценочные датасеты
- Документация NVIDIA SkillEvaluator: агенты и песочницы
- Документация NVIDIA SkillEvaluator: отчеты и результаты
- Документы Hermes Agent: Система навыков
- Источник Hermes: адаптер advisory SkillEvaluator
- Источник Hermes: процесс установки хаба
- Источник Hermes: 29 тестов адаптера
- Объявление NVIDIA AI в X
- Объявление Nous Research в X