Дети по-прежнему превосходят ИИ в обучении языку, несмотря на огромный разрыв в данных
Материал подготовлен искусственным интеллектом на основе нескольких источников — ссылки на оригиналы приведены ниже.

Дети осваивают язык, используя значительно меньше данных, чем большие языковые модели; этот разрыв исследователи называют разрывом в эффективности данных. Когнитивный учёный из Стэнфорда Майкл К. Франк отмечает, что для воссоздания этапа, который дети проходят за год, LLM требуется обработать всю сумму человеческих знаний. Понимание этого разрыва может привести к созданию более эффективных моделей ИИ и новым знаниям о развитии разума.
Ключевые факты
- LLM может обработать более чем в 100 000 раз больше слов, чем человек встречает при освоении родного языка.
- Модель Llama 3.1 от Meta, выпущенная два года назад, была предварительно обучена на 15 триллионах токенов.
- Подросток в языково богатой семье мог услышать около 100 миллионов слов, а к 20 годам с учётом грамотности — до 300 миллионов.
- Когнитивный учёный из Джорджтаунского университета Итан Готлиб Уилкокс говорит, что передовые модели могут обучаться на объёме данных, в 10 раз превышающем Llama 3.1.
Разрыв в эффективности данных
Разница в эффективности обучения между детьми и большими языковыми моделями называется разрывом в эффективности данных. Когнитивный учёный из Стэнфордского университета Майкл К. Франк противопоставляет прогресс LLM тому факту, что для воссоздания этапа, который дети проходят за год, требуется обработать всю сумму человеческих знаний. Когнитивный учёный из Джорджтаунского университета Итан Готлиб Уилкокс отмечает, что Claude увидел объём языка, который целый город переживает за одно поколение.
Масштаб обучения моделей
Открытая модель Llama 3.1 от Meta, выпущенная два года назад, была предварительно обучена на 15 триллионах токенов. Передовые модели могут обучаться на объёме данных, в 10 раз большем, по словам Итана Готлиба Уилкокса. Запас легкодоступных обучающих данных может иссякнуть уже в 2030-х годах.
Ориентиры человеческого обучения
Подросток, выросший в языково богатой семье, мог услышать около 100 миллионов слов. Добавление грамотности может увеличить это количество примерно до 300 миллионов слов к 20 годам. Если бы все слова, использованные для обучения современной LLM, были напечатаны на бумаге, стопка достигла бы Международной космической станции.
1 источник
Дети по-прежнему превосходят ИИ в обучении языку, несмотря на огромный разрыв в данных






