mimile
Басты бетке

Балалар деректердегі үлкен алшақтыққа қарамастан тіл үйренуде жасанды интеллекттен озық

ЖИ-дайджест

Материал бірнеше дереккөз негізінде жасанды интеллектпен дайындалды — түпнұсқаларға сілтемелер төменде.

Балалар деректердегі үлкен алшақтыққа қарамастан тіл үйренуде жасанды интеллекттен озық

Балалар үлкен тілдік модельдерге қарағанда әлдеқайда аз деректерді пайдаланып тілді меңгереді; зерттеушілер бұл айырмашылықты деректер тиімділігіндегі алшақтық деп атайды. Стэнфордтың когнитивті ғалымы Майкл К. Франк балалардың бір жылда өтетін кезеңін қайта жасау үшін LLM адамзат білімінің барлық жиынтығын өңдеуі керек екенін атап өтеді. Бұл алшақтықты түсіну тиімдірек жасанды интеллект модельдеріне және ақыл-ойдың дамуы туралы жаңа білімге әкелуі мүмкін.

Негізгі фактілер

  • LLM адамның ана тілін меңгеру кезінде кездесетін сөздерден 100 000 еседен астам көп сөзді өңдей алады.
  • Meta компаниясының екі жыл бұрын шығарылған Llama 3.1 моделі 15 триллион токенге алдын ала оқытылған.
  • Тілге бай отбасындағы жасөспірім шамамен 100 миллион сөз ести алады, ал 20 жасқа дейін сауаттылықты ескергенде 300 миллионға дейін жетеді.
  • Джорджтаун университетінің когнитивті ғалымы Итан Готлиб Уилкокс озық модельдер Llama 3.1-ден 10 есе көп деректер көлемінде оқытыла алатынын айтады.

Деректер тиімділігіндегі алшақтық

Балалар мен үлкен тілдік модельдер арасындағы оқыту тиімділігіндегі айырмашылық деректер тиімділігіндегі алшақтық деп аталады. Стэнфорд университетінің когнитивті ғалымы Майкл К. Франк LLM прогрессін балалардың бір жылда өтетін кезеңін қайта жасау үшін адамзат білімінің барлық жиынтығын өңдеу қажеттігімен салыстырады. Джорджтаун университетінің когнитивті ғалымы Итан Готлиб Уилкокс Claude тұтас бір қаланың бір ұрпақ бойы бастан кешіретін тіл көлемін көргенін атап өтеді.

Модельдерді оқыту ауқымы

Meta компаниясының екі жыл бұрын шығарылған ашық Llama 3.1 моделі 15 триллион токенге алдын ала оқытылған. Итан Готлиб Уилкокстың айтуынша, озық модельдер 10 есе көп деректер көлемінде оқытыла алады. Оңай қолжетімді оқыту деректерінің қоры 2030-жылдардың өзінде таусылуы мүмкін.

Адамның оқу бағдарлары

Тілге бай отбасында өскен жасөспірім шамамен 100 миллион сөз ести алады. Сауаттылықты қосу бұл көрсеткішті 20 жасқа дейін шамамен 300 миллион сөзге дейін арттыруы мүмкін. Егер қазіргі LLM оқыту үшін пайдаланылған барлық сөздер қағазға басылса, бұл бума Халықаралық ғарыш станциясына дейін жетер еді.

1 дереккөз

Балалар деректердегі үлкен алшақтыққа қарамастан тіл үйренуде жасанды интеллекттен озық