
Веб-агенты много времени проводят за чтением страниц: ищут, открывают, разбирают форумы, документацию, новости. Каждое такое чтение раньше стоило денег и времени — полная загрузка страницы, прогон через модель, сжатие, и только потом результат попадал в работу. Nous Research переписала этот путь и заявляет о выигрыше в десятки раз по обоим показателям.
Чистый текст вместо лишних прогонов
У Hermes Agent два веб-инструмента: web_search ищет страницы, web_extract достаёт с них читаемое содержимое. Узким местом был именно extract. Теперь скрейпинг-бэкенды передают агенту уже очищенный контент напрямую, без промежуточных шагов обработки, которые ничего не добавляли к результату.
Второй приём — работа с памятью. Большие страницы не загружаются в контекст целиком, а сохраняются локально и подгружаются по частям, по мере необходимости. Контекстное окно не забивается мусором, а биллинг по токенам не растёт на каждой длинной странице.
Что происходит с длинными страницами
Логика обработки привязана к размеру страницы, и пороги у Nous жёсткие. Страница меньше 5 тысяч символов уходит агенту как есть — модель к ней даже не вызывается. От 5 тысяч до 500 тысяч символов делается один проход сжатия через вспомогательную модель, на выходе около 5 тысяч символов. Страница до 2 миллионов символов режется на куски по 100 тысяч, каждый сжимается параллельно, а потом из них собирается общий конспект. Всё, что больше, агент отклоняет и просит уточнить запрос или источник.
Сжатие здесь — компрессор, а не пересказ: цитаты, блоки кода и ключевые факты сохраняются в исходном виде. Если сжатие не успело отработать, Hermes отдаёт первые 5 тысяч символов сырого текста вместо бесполезной ошибки.
Дешёвую модель можно посадить на чтение
Сжатием по умолчанию занимается основная модель агента. На дорогих рассуждающих моделях каждое чтение длинной страницы заметно бьёт по счёту. Поэтому extract разрешено вынести на отдельную дешёвую и быструю модель — в документации в пример идёт gemini-3-flash-preview. Основная модель остаётся на сложных задачах, а рутинное сжатие веб-страниц уходит туда, где токены дешевле. Отсюда и берётся большая часть заявленной экономии.
Бесплатный поиск SearXNG и платный extract
Hermes не привязан к одному провайдеру. По умолчанию стоит Firecrawl с бесплатным лимитом в 500 кредитов в месяц, но доступны Tavily, Exa, Parallel, Brave, DuckDuckGo и поиск через Grok от xAI. Поиск и извлечение можно развести по разным провайдерам: бесплатный self-hosted SearXNG берёт на себя поиск, а Firecrawl — извлечение контента.
Тут стоит оговориться. SearXNG умеет только искать — извлекать текст со страниц он не может. Так что полностью бесплатной связки не выходит: за качественный extract всё равно придётся платить отдельному провайдеру либо поднимать self-hosted Firecrawl у себя. Настраивается всё через hermes tools или правку config.yaml.
Где у красивых цифр оговорка
60 и 49 раз — это числа самой Nous, независимых замеров пока нет. Реальный выигрыш сильно зависит от того, как настроена связка: какой бэкенд для extract, какая модель посажена на сжатие, насколько большие страницы агент обычно читает. На дешёвой вспомогательной модели и лёгких страницах экономия будет одна, на дорогой основной модели и форумах с тысячами комментариев — совсем другая.
Есть и потеря в точности. Сжатие на огромных страницах всё равно отбрасывает часть данных, и для структурного парсинга, где важны конкретные поля, Nous сама советует использовать не extract, а браузерные инструменты. Так что «быстрее и дешевле» здесь — про обзорное чтение, а не про аккуратное вытаскивание данных из таблиц.
Кому это важно
Выигрыш чувствуют те, кто гоняет агентов по вебу пачками: ресёрч, мониторинг, сбор материалов. Для них чтение страниц было статьёй расходов, теперь её можно прижать настройкой бэкендов и вспомогательной модели. Обновление в характерном для Nous духе — не новая громкая модель, а доведение рантайма до ума, чтобы открытые агенты по стоимости эксплуатации не проигрывали проприетарным.
Проверочной точкой станут независимые замеры на реальных нагрузках. Пока цифры держатся на словах команды — но даже половина от заявленного делает веб-чтение в Hermes заметно практичнее, чем было.