Google AI выпускает EnvHarness для адаптации статичных сред агентов
Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Google Cloud AI Research, Университет Вашингтона в Сент-Луисе и Университет Северной Каролины в Чапел-Хилл выпустили EnvHarness — программируемый слой, адаптирующий статичные среды агентов под обучающуюся на них политику. Система оборачивает существующие среды в подключаемые компоненты, изменяющие начало эпизода, действия и наблюдения, сохраняя исходный симулятор и верификатор. На пяти бенчмарках в четырёх доменах полученные таким образом навыки дают прирост до 9,0 баллов на отложенных задачах при сокращении шагов выполнения на 9,8%.
Ключевые факты
- EnvHarness выпущен исследователями из Google Cloud AI Research, Университета Вашингтона в Сент-Луисе и Университета Северной Каролины в Чапел-Хилл.
- Система оборачивает существующие среды в подключаемые компоненты, работающие через стандартный интерфейс reset()/step(), оставляя базовый симулятор, задачи и созданный человеком верификатор нетронутыми.
- LLM-дизайнер EnvRigger автоматически пишет эти обёртки, ориентируясь на недостатки, выявленные в собственных прогонах политики.
- На пяти бенчмарках в четырёх доменах полученные таким образом навыки дают прирост до 9,0 баллов на отложенных задачах при сокращении шагов выполнения на 9,8%.
- EnvHarness поставляется как Python-библиотека под лицензией Apache-2.0 с драйверами воспроизведения для шести сред, а новый бенчмарк подключается реализацией одного интерфейса.
Подход EnvHarness
EnvHarness переворачивает привычный ход генерации новых сред, оборачивая существующую среду в подключаемые компоненты, работающие строго через стандартный интерфейс reset()/step(). Эти компоненты меняют, где начинается эпизод, что агент может делать и что он видит, при этом базовый симулятор, задачи и созданный человеком верификатор остаются нетронутыми. Формально компонент — это преобразование E' = w(E), которое переписывает члены состояния, действия, наблюдения и перехода; член вознаграждения намеренно исключён. Поскольку ни одно вмешательство не достигает бэкенда симулятора, каждая изменённая задача сохраняет исходный, созданный человеком верификатор, а поскольку ничего не затрагивает код конкретного бенчмарка, одна реализация покрывает все домены.
EnvRigger и извлечение навыков
LLM-дизайнер EnvRigger автоматически пишет эти обёртки, ориентируясь на недостатки, выявленные в собственных прогонах политики. На пяти бенчмарках в четырёх доменах полученные таким образом навыки дают прирост до 9,0 баллов на отложенных задачах при сокращении шагов выполнения на 9,8%. В статье EnvHarness названы две издержки генерации большего числа сред: конвейеры генерации доменно-специфичны и не переносятся, а написанные LLM верификаторы приходится перегенерировать и жёстко фильтровать, так и не добиваясь полного доверия.
Развёртывание и требования
EnvHarness поставляется как Python-библиотека под лицензией Apache-2.0 с драйверами воспроизведения для шести сред. Новый бенчмарк подключается реализацией одного интерфейса (reset / step / observe / evaluate / get_env_state / save_state / from_state); ниже по потоку ничего не меняется. Жёсткое требование — перезапускаемая среда, что исключает живые пользовательские аккаунты и физических роботов.
1 источник
Google AI выпускает EnvHarness для адаптации статичных сред агентов



