mimile
На главную

Google AI выпускает EnvHarness для адаптации статичных сред агентов

AI-дайджест

Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Google AI выпускает EnvHarness для адаптации статичных сред агентов

Google Cloud AI Research, Университет Вашингтона в Сент-Луисе и Университет Северной Каролины в Чапел-Хилл выпустили EnvHarness — программируемый слой, адаптирующий статичные среды агентов под обучающуюся на них политику. Система оборачивает существующие среды в подключаемые компоненты, изменяющие начало эпизода, действия и наблюдения, сохраняя исходный симулятор и верификатор. На пяти бенчмарках в четырёх доменах полученные таким образом навыки дают прирост до 9,0 баллов на отложенных задачах при сокращении шагов выполнения на 9,8%.

Ключевые факты

  • EnvHarness выпущен исследователями из Google Cloud AI Research, Университета Вашингтона в Сент-Луисе и Университета Северной Каролины в Чапел-Хилл.
  • Система оборачивает существующие среды в подключаемые компоненты, работающие через стандартный интерфейс reset()/step(), оставляя базовый симулятор, задачи и созданный человеком верификатор нетронутыми.
  • LLM-дизайнер EnvRigger автоматически пишет эти обёртки, ориентируясь на недостатки, выявленные в собственных прогонах политики.
  • На пяти бенчмарках в четырёх доменах полученные таким образом навыки дают прирост до 9,0 баллов на отложенных задачах при сокращении шагов выполнения на 9,8%.
  • EnvHarness поставляется как Python-библиотека под лицензией Apache-2.0 с драйверами воспроизведения для шести сред, а новый бенчмарк подключается реализацией одного интерфейса.

Подход EnvHarness

EnvHarness переворачивает привычный ход генерации новых сред, оборачивая существующую среду в подключаемые компоненты, работающие строго через стандартный интерфейс reset()/step(). Эти компоненты меняют, где начинается эпизод, что агент может делать и что он видит, при этом базовый симулятор, задачи и созданный человеком верификатор остаются нетронутыми. Формально компонент — это преобразование E' = w(E), которое переписывает члены состояния, действия, наблюдения и перехода; член вознаграждения намеренно исключён. Поскольку ни одно вмешательство не достигает бэкенда симулятора, каждая изменённая задача сохраняет исходный, созданный человеком верификатор, а поскольку ничего не затрагивает код конкретного бенчмарка, одна реализация покрывает все домены.

EnvRigger и извлечение навыков

LLM-дизайнер EnvRigger автоматически пишет эти обёртки, ориентируясь на недостатки, выявленные в собственных прогонах политики. На пяти бенчмарках в четырёх доменах полученные таким образом навыки дают прирост до 9,0 баллов на отложенных задачах при сокращении шагов выполнения на 9,8%. В статье EnvHarness названы две издержки генерации большего числа сред: конвейеры генерации доменно-специфичны и не переносятся, а написанные LLM верификаторы приходится перегенерировать и жёстко фильтровать, так и не добиваясь полного доверия.

Развёртывание и требования

EnvHarness поставляется как Python-библиотека под лицензией Apache-2.0 с драйверами воспроизведения для шести сред. Новый бенчмарк подключается реализацией одного интерфейса (reset / step / observe / evaluate / get_env_state / save_state / from_state); ниже по потоку ничего не меняется. Жёсткое требование — перезапускаемая среда, что исключает живые пользовательские аккаунты и физических роботов.

1 источник

Google AI выпускает EnvHarness для адаптации статичных сред агентов