Назад к блогу
ИИ-агентыHermes AgentАвтоматизация

Настройка ИИ-агента: 9 решений, на которых он ломается

Дмитрий Риппа30 августа 2026 г.обновлено 30 августа 2026 г.14 мин чтения

Настройка ИИ-агента — это не пятнадцать минут установщика, а девять решений, каждое из которых потом либо экономит вам деньги, либо тихо их жжёт. Я собрал их из документации Hermes Agent, из трёх свежих русских разборов и из собственной работы с агентами в проде. Порядок здесь такой же, как в реальной установке: сверху то, что выбирается один раз и меняется тяжело.

Меня зовут Дмитрий Риппа, я делаю Rippa Digital — мы разрабатываем и внедряем ИИ-агентов, а свою платформу для обменных сервисов держим в проде с весны 2026 года. Агентами я пользуюсь каждый день в собственной работе, поэтому половина того, что ниже, — это не пересказ, а собранные шишки.

Почему настройка решает больше, чем выбор модели

Потому что провал происходит не в модели, а вокруг неё. Цифры, которых я не встретил ни в одной русской статье по теме:

Что измерялиРезультатИсточник
Доля POC с ИИ-агентами, не дошедших до прода88 %IDC через CIO.com
Пилоты генеративного ИИ без измеримого эффекта на P&L95 %MIT NANDA, 300 внедрений
Успешность лучшего агента на GPT-4 в бенчмарке WebArena14,41 % против 78,24 % у человекаarXiv 2307.13854
Успешность агента на обычных офисных задачахпроваливает около 70 %Carnegie Mellon, arXiv 2412.14161
Падение при повторных прогонахс 60 % за один прогон до 25 % за восемь подрядarXiv 2511.14136
Цепочка из трёх агентов по 70 % каждыйдаёт 34 %Fiddler AI

Последняя строка — самая полезная при настройке. Надёжность в цепочке перемножается, а не усредняется. Три шага по семьдесят процентов дают результат хуже подбрасывания монеты, и это арифметика, а не качество модели.

Ещё одна цифра, которая объясняет остальные: среди тех, у кого агенты дошли до прода, 89 % внедрили наблюдаемость, а у застрявших в пилоте её обычно нет вовсе. Логи и счётчики — не украшение, а различие между двумя группами.

1. Где живёт агент: ноутбук или сервер

Сервер, если агент нужен вам не только за рабочим столом. Это первое решение, и оно определяет всё остальное.

Hermes работает через мессенджер — Telegram, Discord, Slack, Signal. Смысл в том, что агент доступен с телефона, а значит, он не должен зависеть от того, закрыт ли у вас ноутбук. Отсюда сервер, и сервер в локации, где мессенджер работает без плясок.

Обратная сторона: часть инструментов на сервере не заработает. Computer use, то есть управление экраном, на голом VPS бесполезен. Это нормально, просто знайте заранее и не ищите потом ошибку.

2. Подписка или токены

Проверьте это до установки, иначе потеряете вечер.

Не всякая подписка на модель пускает сторонние приложения. Подписка Claude Code не работает с Hermes — доступ сторонним клиентам она не даёт, и придётся покупать токены отдельно. Подписки, у которых в документации есть инструкция по настройке агента, работают: если провайдер сам описывает, как подключить Hermes или OpenClaw, вопрос снят.

Признак, по которому это видно заранее: ищите в документации провайдера страницу про сторонние клиенты. Нет страницы — считайте, что не работает.

И отдельно: на маркетплейсах попадаются подозрительно дешёвые предложения доступа. Дёшево там потому, что аккаунт общий. Для личных экспериментов это ваш риск, для рабочего контура — недопустимо.

3. Основная модель: почему экономия здесь возвращается счётом

Основная модель — это мозг, который настраивает сам себя. Поставите слабую — получите агента, который плохо себя конфигурирует, а иногда и ломает.

Логика простая. В Hermes агент правит собственные настройки, пишет себе скиллы и планирует задачи. Все эти операции требуют рассуждения. Дешёвая модель справится с ответом на вопрос, но не с тем, чтобы аккуратно поменять свою же конфигурацию.

Для локальной модели есть жёсткий минимум: 64 тысячи токенов контекста. Ниже этого агент не сможет удержать в голове ни системный промт, ни описание инструментов, ни саму задачу.

Настройка ИИ-агента, на которой всё ломается молча

Модель для сжатия контекста обязана иметь окно не меньше основной модели. Если оно меньше, середина разговора выбрасывается — без ошибки, без предупреждения, без следа в интерфейсе.

Это написано в документации Hermes прямым текстом:

The summary model must have a context window at least as large as the main agent model's. … The compressor then drops the middle turns without a summary, silently losing conversation context.

Разберём, почему так. Когда разговор доходит до порога, Hermes не обрезает его, а вызывает отдельную модель, чтобы та пересказала середину. Голова и хвост сохраняются, середина заменяется пересказом. Но пересказывающая модель получает всю середину одним вызовом. Если её окно меньше — вызов не проходит.

Сессия дошла до 50 % окна основной моделиголовасередина — уходит на пересказхвостотдельная модель для сжатияокно ≥ основногосередина возвращается пересказом,разговор продолжаетсяокно меньшевызов падает, серединавыбрасывается без следа

Правая ветка не даёт ни ошибки, ни уведомления. Агент просто перестаёт помнить, о чём вы договорились в середине разговора.

Именно поэтому симптом выглядит не как поломка, а как поглупевший агент. Он уверенно переспрашивает то, что вы обсудили час назад, и вы думаете, что дело в модели. Дело в одной строке конфигурации.

Проверить это в двух минутах: найдите в config.yaml блок auxiliary.compression и сравните окно указанной там модели с окном основной. Если в основном стоит модель на миллион токенов, а в сжатии — на двести пятьдесят тысяч, вы уже теряете разговоры.

5. Порог сжатия и режим хвоста

Порог по умолчанию — половина окна модели, threshold: 0.50. Трогать его без причины не нужно, а вот про режим хвоста стоит знать.

Hermes умеет два режима. Актуальный lean держит небольшой дословный хвост с указателями на восстановление. Старый legacy сохраняет пятую часть от порога дословно — и на больших окнах это, цитируя комментарий в коде, «hoards 100-240K tokens per compaction», то есть удерживает от ста до двухсот сорока тысяч токенов на каждое сжатие.

Разница измерена: на реальных сессиях в пятьсот тысяч токенов остаётся около 49 тысяч в режиме lean против 162 тысяч в legacy. Втрое меньше платного контекста при тех же задачах.

Ещё две настройки того же блока: protect_last_n держит последние сообщения несжатыми, protect_first_n прикалывает первые. Первое отвечает за то, чтобы агент помнил, что вы говорили только что. Второе — чтобы он не забыл, зачем вообще всё началось.

6. Вспомогательные модели: восемь мест, где вы платите зря

У Hermes отдельные слоты под задачи: vision, web_extract, approval, compression, session_search, skills_hub, mcp, flush_memories. По умолчанию многие берут основную модель, и это самая частая переплата.

СлотЧто делаетКакую модель ставить
web_extractпересказывает веб-страницыдешёвую: задача простая, токенов много
approvalпроверяет каждую команду на вредоносностьдешёвую, но не тупую: работает постоянно
compressionсжимает контекстокно не меньше основной, скорость важнее ума
visionраспознаёт картинкимультимодальную, иначе слот бесполезен
skills_hubищет скиллыдешёвую
mcpработает с внешними инструментамисреднюю: нужна структурность вывода

Слот approval — тот, где экономия окупается быстрее всего. Он вызывается на каждую команду агента, то есть счётчик крутится постоянно и незаметно. Ставить туда дорогую модель — всё равно что нанять юриста читать каждую строку вашего терминала.

И наоборот: на поиск и создание скиллов ставьте хорошую модель. Скилл пишется один раз, а используется потом сотни раз, и плохо написанный будет ошибаться столько же раз.

7. Автоодобрение: что агенту нельзя доверять

OWASP вынес это в отдельную уязвимость своего топ-10 для LLM — она называется Excessive Agency, избыточные полномочия. Смысл: агент получает больше прав, чем нужно для задачи, и рано или поздно ими пользуется.

Как это выглядит на практике, показывают два публичных случая. Агент поддержки Cursor выдумал несуществующую политику — сообщил пользователям, что продуктом нельзя пользоваться на нескольких устройствах, — и люди начали отменять подписки. Другой агент, попав в цикл повторов, создал 847 дублей клиентских записей, прежде чем это заметили.

Настройка здесь состоит из трёх вопросов, и ответить на них надо до запуска: что агент делает без подтверждения, что делает с подтверждением, чего не делает никогда. Третий список — самый важный и самый короткий: удаление, платежи, переписка от вашего имени с клиентом.

8. Субагенты: зачем делегировать, если можно просто спросить

Затем, что контекст стоит денег, а субагент начинает с чистого.

Механика такая: главная сессия не решает задачу сама, а пишет техническое задание и критерии приёмки, отдаёт их субагенту, получает отчёт. Субагент работает в собственной чистой сессии. По умолчанию их три параллельно.

Выигрыш двойной. Во-первых, три задачи идут одновременно. Во-вторых, и это важнее, в главную сессию возвращается только отчёт, а не весь путь к нему. Кодовые задачи особенно прожорливы: прочитать файлы, понять, переписать — это десятки тысяч токенов, которые иначе осели бы в вашей основной сессии навсегда.

Практическое правило: если задача займёт больше десяти шагов, она идёт субагенту. Если задача займёт часы — используйте цель, которая переживает сжатия и держит агента на курсе, пока промежуточные сессии сворачиваются.

9. Скиллы и то, что переживёт обновление

Правки ядра стираются при обновлении. Это единственный пункт, который люди узнают на своей шкуре.

Hermes умеет сам записывать скиллы: если задача повторяется или уникальна для вас, агент фиксирует шаги — откуда начали, к чему пришли, как это повторить. Механизм отличный, но у него есть граница. Всё, что вы поправили в самом ядре, исчезнет при следующем обновлении.

Отсюда правило: любая ваша правка живёт либо в скилле, либо в локальном патче, либо в SOUL.md — но не в исходниках. И config.yaml побеждает .env для всего, что не является секретом; порядок приоритетов такой: аргументы командной строки, переменные окружения, config.yaml, .env, значения по умолчанию.

Ещё одна мелочь, которая экономит нервы: секреты в логах Hermes затираются автоматически. Это не повод складывать ключи куда попало, но это значит, что лог можно показать подрядчику, не вычищая его вручную.

Проверка за десять минут: что настроено не так прямо сейчас

Если агент у вас уже стоит, пройдите по этому списку — он покрывает пять из девяти решений выше и не требует ничего, кроме доступа к конфигурации.

  1. Окно модели сжатия. Откройте auxiliary.compression и сравните окно указанной модели с окном основной. Меньше — вы уже теряете разговоры.
  2. Режим хвоста. Найдите tail_mode. Если там legacy, переключите на lean: на длинных сессиях это втрое меньше удерживаемого контекста.
  3. Слот approval. Посмотрите, какая модель проверяет команды. Если та же, что и основная, вы платите премиальную цену за проверку каждой строки.
  4. Слот web_extract. Если он не переопределён, страницы пересказывает основная модель — самая дорогая операция на единицу пользы во всей системе.
  5. Правки в ядре. Вспомните, меняли ли вы что-то в исходниках. Если да, эта правка исчезнет при ближайшем обновлении; перенесите её в скилл или патч.
  6. Список запретов. Если у вас нигде не записано, чего агент не делает никогда, — считайте, что он может всё. Это и есть Excessive Agency.

Первые два пункта чинятся одной строкой каждый и дают самый заметный эффект.

Где настройка не спасёт

Ни одна настройка не спасёт три вещи, и честнее сказать это до того, как вы потратите месяц.

Задача без критерия готовности. Если вы не можете описать, что считается выполненным, агент не сможет тоже. Пятьдесят семь процентов провалившихся проектов назвали причиной «ждали слишком многого слишком быстро» — это формулировка той же болезни.

Данные, которых нет. Агент не выдумает вам структуру там, где её не было. Если сейчас информация лежит в трёх таблицах, двух чатах и в голове у Марины, сначала решается это, а потом всё остальное. Про то, как это выглядит в конкретной отрасли, у нас есть отдельный разбор — ИИ-агенты для недвижимости.

Цепочка длиннее трёх шагов без человека внутри. Смотрите арифметику из начала статьи: три шага по семьдесят процентов дают тридцать четыре. Пока надёжность одного шага не поднялась, длинная автономная цепочка — это лотерея, и чинить её настройкой бесполезно.

Есть и четвёртый случай, о котором не принято говорить. Если вам нужна одна простая автоматизация, агент может оказаться дороже человека. Существует мнение внутри самой ниши, что бизнесу выгоднее взять сотрудника на автоматизацию в штат, чем платить подрядчику за каждый сценарий. Для одного-двух сценариев с этим трудно спорить.

Как это устроено у нас

Главное, что мы делаем осознанно, — следим за контекстом руками и не полагаемся на автоматическое сжатие. Я смотрю расход и сбрасываю сессию сам, попросив агента заранее подготовиться к сбросу: записать состояние туда, откуда он его потом поднимет. Автосжатие работает, но оно теряет нюансы, а подготовленный сброс — нет. Это дороже по дисциплине и дешевле по токенам.

Второе — правило про доступ к данным, которое мы держим и в разработке, и в работе с ИИ-агентами для клиентов: у агента столько прав, сколько нужно задаче, и ни одним больше. Список того, чего он не делает никогда, пишется до запуска, а не после инцидента.

Практикующие идут в этом дальше. В свежем русском разборе Hermes автор описывает схему из трёх агентов на разных серверах: клиентские проекты не уходят в облако, а ключи, доступы к базам и адреса лежат на отдельной машине и обрабатываются третьим агентом на локальной модели — чтобы данные физически не покидали её. Схема требовательная, но направление правильное: разделять не по задачам, а по уровню доступа к данным.

Третье — из нашей собственной платформы. TEX, Telegram Mini App для обменных сервисов, работает в проде с весны 2026 года при 50–150 заявках в день. Ноль потерянных заявок там держится не на модели, а на outbox-паттерне: заявка сначала фиксируется, потом доставляется. Это ровно тот принцип, который переносится на агентов — сначала записать намерение, потом исполнять. Сбой на середине тогда означает повтор, а не потерю.

Частые вопросы

Сколько времени занимает настройка ИИ-агента? Установка — пятнадцать-двадцать минут. Настройка до состояния, в котором агент делает работу, а не демонстрирует возможности, — от нескольких дней до недели. Разница между этими двумя цифрами и есть содержание статьи.

Можно ли обойтись бесплатными моделями? Для знакомства да. Для работы — нет, и не из-за качества ответов, а из-за окна контекста: локальной модели нужно минимум 64 тысячи токенов, иначе агент не удержит даже описание своих инструментов.

Что делать, если агент начал «тупить» после часа работы? Первым делом сравните окно модели в блоке auxiliary.compression с окном основной модели. Если оно меньше — вы теряете середину разговоров, и это чинится одной строкой.

Нужен ли отдельный сервер? Если агент нужен с телефона и круглосуточно — да. Если только за рабочим столом — достаточно ноутбука, и часть инструментов там даже работает лучше.

Чем это отличается от обычного чат-бота? Тем, что агент выполняет действия, а не отвечает на сообщения. Отсюда все девять решений выше: у чат-бота нет прав, нет цепочки шагов и нечему ломаться на втором месяце.


Главное, что я вынес из этих девяти пунктов: настройка ИИ-агента — это не про то, чтобы он заработал. Заработает он и на значениях по умолчанию. Настройка — это про то, во сколько он вам обойдётся через два месяца и заметите ли вы, когда он начнёт терять контекст.

Восемьдесят восемь процентов проектов не доходят до прода не потому, что модели плохи. Модели уже достаточно хороши, чтобы впечатлить на демонстрации. Ломается всё остальное — и почти всё остальное настраивается.

Проверка из середины статьи занимает десять минут и не требует ничего, кроме доступа к конфигурации. С неё я бы и начал.

Настроим или разберёмся вместе

Расскажите, какая задача стоит перед агентом — посмотрим конфигурацию и скажем, что в ней течёт.