mimile
Басты бетке

Google AI агенттердің статикалық орталарын бейімдеу үшін EnvHarness шығарды

ЖИ-дайджест

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.

Google AI агенттердің статикалық орталарын бейімдеу үшін EnvHarness шығарды

Google Cloud AI Research, Сент-Луистегі Вашингтон университеті және Чапел-Хиллдегі Солтүстік Каролина университетінің зерттеушілері EnvHarness жүйесін шығарды — бұл статикалық агент орталарын оларда оқытылатын саясатқа бейімдейтін бағдарламаланатын қабат. Жүйе қолданыстағы орталарды эпизодтың басталуын, әрекеттер мен бақылауларды өзгертетін қосылатын компоненттерге орап, бастапқы симулятор мен верификаторды сақтайды. Төрт домендегі бес бенчмаркте осылайша алынған дағдылар кейінге қалдырылған тапсырмаларда 9,0 балға дейін өсім беріп, орындау қадамдарын 9,8%-ға қысқартады.

Негізгі фактілер

  • EnvHarness жүйесін Google Cloud AI Research, Сент-Луистегі Вашингтон университеті және Чапел-Хиллдегі Солтүстік Каролина университетінің зерттеушілері шығарды.
  • Жүйе қолданыстағы орталарды reset()/step() стандартты интерфейсі арқылы жұмыс істейтін қосылатын компоненттерге орап, бастапқы симуляторды, тапсырмаларды және адам жасаған верификаторды өзгеріссіз қалдырады.
  • LLM-дизайнер EnvRigger бұл орауыштарды саясаттың өз жүгіртпелерінде анықталған кемшіліктерге сүйене отырып автоматты түрде жазады.
  • Төрт домендегі бес бенчмаркте осылайша алынған дағдылар кейінге қалдырылған тапсырмаларда 9,0 балға дейін өсім беріп, орындау қадамдарын 9,8%-ға қысқартады.
  • EnvHarness Apache-2.0 лицензиясы бойынша алты ортаға арналған қайталау драйверлері бар Python кітапханасы ретінде жеткізіледі, ал жаңа бенчмарк бір интерфейсті іске асыру арқылы қосылады.

EnvHarness тәсілі

EnvHarness жаңа орталарды генерациялаудың әдеттегі барысын төңкеріп, қолданыстағы ортаны тек reset()/step() стандартты интерфейсі арқылы жұмыс істейтін қосылатын компоненттерге орайды. Бұл компоненттер эпизодтың қай жерде басталатынын, агенттің не істей алатынын және не көретінін өзгертеді, ал базалық симулятор, тапсырмалар және адам жасаған верификатор өзгеріссіз қалады. Формальды түрде компонент — бұл E' = w(E) түрлендіруі, ол күй, әрекет, бақылау және ауысу мүшелерін қайта жазады; сыйақы мүшесі әдейі алынып тасталған. Ешбір араласу симулятордың бэкендіне жетпейтіндіктен, әрбір өзгертілген тапсырма бастапқы, адам жасаған верификаторды сақтайды, ал ештеңе нақты бенчмарк кодына тиіспейтіндіктен, бір іске асыру барлық домендерді қамтиды.

EnvRigger және дағдыларды алу

LLM-дизайнер EnvRigger бұл орауыштарды саясаттың өз жүгіртпелерінде анықталған кемшіліктерге сүйене отырып автоматты түрде жазады. Төрт домендегі бес бенчмаркте осылайша алынған дағдылар кейінге қалдырылған тапсырмаларда 9,0 балға дейін өсім беріп, орындау қадамдарын 9,8%-ға қысқартады. EnvHarness мақаласында көбірек орталарды генерациялаудың екі шығыны аталған: генерация құбырлары доменге тән және тасымалданбайды, ал LLM жазған верификаторларды қайта генерациялап, қатаң сүзгіден өткізуге тура келеді, бірақ толық сенімге қол жеткізілмейді.

Орналастыру және талаптар

EnvHarness Apache-2.0 лицензиясы бойынша алты ортаға арналған қайталау драйверлері бар Python кітапханасы ретінде жеткізіледі. Жаңа бенчмарк бір интерфейсті (reset / step / observe / evaluate / get_env_state / save_state / from_state) іске асыру арқылы қосылады; төменгі ағында ештеңе өзгермейді. Қатаң талап — қайта іске қосылатын орта, бұл тірі пайдаланушы аккаунттары мен физикалық роботтарды жоққа шығарады.

1 дереккөз

Google AI агенттердің статикалық орталарын бейімдеу үшін EnvHarness шығарды