پرش به محتوای اصلی
پرش به محتوای مقاله

شکاف بهره‌وری داده: چرا کودکان با ۱۰۰۰ برابر دادهٔ کمتر از AI یاد می‌گیرند؟

·۲ شهریور ۱۴۰۵۱۷ دقیقه مطالعه۲ بازدید
کودکان از هوش مصنوعی پیشی می‌گیرند—و ما هنوز نمی‌دانیم چرا
کودکان از هوش مصنوعی پیشی می‌گیرند—و ما هنوز نمی‌دانیم چرا
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر رویکرد از آموزش متنی خالص به استفاده از داده‌های «تجربه زیسته» نوزادان (مانند پروژه SAYCam) برای حذف پیش‌فرض‌های فطری در یادگیری زبان.

تصور کنید برای یادگیری یک زبان، مجبور باشید تمام کتاب‌های موجود در تمام کتابخانه‌های جهان را بخوانید، در حالی که کودکی در کنار شما تنها با شنیدن صحبت‌های والدینش به همان مهارت می‌رسد. این تضاد تکان‌دهنده، همان «شکاف بهره‌وری داده» است که نشان می‌دهد مدل‌های فعلی ما برای رسیدن به سطحی از روانی که یک کودک در یک سال به دست می‌آورد، باید کل دانش بشری را ببلعند.

به نقل از مایکل سی. فرانک، دانشمند علوم شناختی دانشگاه استنفورد، ما در حال حاضر برای بازسازی نقاط عطفی که در یک اتاق پذیرایی رخ می‌دهد، «جنگل‌ها را می‌سوزانیم و تمام دانش بشری را استخراج می‌کنیم». در حالی که یک مدل زبانی بزرگ (LLM) برای رسیدن به تسلط زبانی به تریلیون‌ها توکن (Token) نیاز دارد، یک کودک انسان تنها با شنیدن حدود ۱۰ تا ۳۰ میلیون کلمه به این هدف می‌رسد. این موضوع نشان می‌دهد که شرکت‌هایی مانند OpenAI، متا و گوگل دیپ‌مایند در حال مصرف کل ذخایر دانش بشری هستند تا دستاوردی را بازسازی کنند که در یک محیط خانگی طی یک سال اتفاق می‌افتد.

در دهه گذشته، اهرم اصلی پیشرفت در صنعت، مقیاس‌پذیری بود. برای مثال، مدل Llama 3.1 شرکت متا (Meta) که در سال ۲۰۲۴ منتشر شد، در مرحله پیش‌آموزش (Pretraining) به ۱۵ تریلیون توکن نیاز داشت. اما دانشمندان هشدار می‌دهند که این مسیر پایدار نیست؛ چرا که ذخیره داده‌های باکیفیت اینترنتی احتمالاً تا دهه ۲۰۳۰ به پایان می‌رسد. اتان گاتلیب ویلکاک، دانشمند علوم شناختی و زبان‌شناس دانشگاه جورج‌تاون، اشاره می‌کند که مدل‌های پیشرو ممکن است روی ۱۰ برابر داده‌های Llama 3.1 آموزش ببینند، اما اینترنت محدود است و داده‌های بیشتری برای استخراج وجود ندارد. او معتقد است اگر AI قرار است تکامل یابد، باید «یاد گرفتنِ یادگیری» را از کودکان بیاموزد.

ابعاد واقعی شکاف

برای درک این تفاوت، حجم فیزیکی داده‌ها را تصور کنید. اگر داده‌های آموزشی یک LLM مدرن را چاپ می‌کردید، ارتفاع کاغذها از ایستگاه فضایی بین‌المللی فراتر می‌رفت. در مقابل، ۱۰۰ میلیون کلمه‌ای که یک پیش‌نوجوان در محیطی غنی از نظر زبانی می‌شنود، تنها ۲۰ متر ارتفاع دارد. ویلکاک اشاره می‌کند مدلی مانند Claude حجم زبانی را دیده است که یک شهر کامل در یک نسل تجربه می‌کند.

کودکان از هوش مصنوعی پیشی می‌گیرند—و ما هنوز نمی‌دانیم چرا

کاهش این شکاف تنها یک کنجکاوی علمی نیست، بلکه یک ضرورت فنی برای آینده AI است. بهینه‌سازی یادگیری و بستن این شکاف امکانات زیر را فراهم می‌کند:

  • آموزش موثر AI روی داده‌های ویدئویی، که بسیار متراکم‌تر هستند و استخراج آن‌ها نسبت به متن دشوارتر است.
  • ساخت چت‌بات‌های با عملکرد بالا برای جوامع زبان‌های اقلیتی که تریلیون‌ها توکن ندارند و تنها میلیون‌ها توکن برای آن‌ها موجود است. برای مثال، زبان‌هایی مانند «سامی» (Sami) ممکن است تنها ده‌ها میلیون توکن داشته باشند که تقریباً معادل میزان مواجهه یک نوپا با زبان است. دیوید ساموئل، پژوهشگر دانشگاه اسلو، بر نیاز به مدل‌هایی تأکید می‌کند که برای این زبان‌های کوچک، به اندازه مدل‌های انگلیسی توانمند باشند.
  • ایجاد مدل‌هایی که توسط دانشگاه‌ها و آزمایشگاه‌های کوچک‌تر، بدون نیاز به منابع محاسباتی عظیم (Hyperscale)، قابل آموزش باشند و بدین ترتیب پژوهش‌های AI دموکراتیزه شود.

نبرد بزرگ زبان‌شناختی

این شکاف، بحث‌های قدیمی بین دو مکتب فکری را زنده کرده است. در دهه ۱۹۵۰، نوآم چامسکی استدلال کرد که کودکان با یک «غریزه زبانی» یا دستور زبان سخت‌افزاری متولد می‌شوند. او مفهوم «فقر محرک» (Poverty of the Stimulus) را مطرح کرد؛ یعنی زبان، به‌ویژه نحو (Syntax)، بسیار پیچیده است و مواجهه کودکان با آن چنان «فقیر» و محدود است که نمی‌توانند آن را صرفاً از طریق تجربه بیاموزند. ریچارد فوترل از دانشگاه کالیفرنیا (Irvine) می‌گوید استدلال اصلی چامسکی این بود که زبان را نمی‌توان صرفاً بر اساس آمار یاد گرفت.

در مقابل، بی. اف. اسکینر یادگیری زبان را نتیجه شرطی‌سازی محیطی و تقویت (Reinforcement) می‌دید؛ مشابه روشی که یک سگ را برای نشستن در ازای جایزه آموزش می‌دهند. برای سال‌ها، حوزه AI از مسیر چامسکی پیروی کرد و به «هوش مصنوعی نمادین» (Symbolic AI) روی آورد که در آن قوانین دستور زبان صراحتاً در برنامه‌ها کدنویسی می‌شدند. این رویکرد که یادگیری زبان را بیشتر شبیه به یک کلاس گرامر می‌دید تا تجربه غوطه‌وری در محیط، در مقیاس بزرگ شکست خورد و به «زمستان AI» در دهه ۱۹۷۰ کمک کرد.

کودکان هوش مصنوعی را شکست می‌دهند—و ما هنوز نمی‌دانیم چرا

ظهور معماری ترنسفورمر (Transformer) و مدل‌هایی مانند BERT و GPT-2 در سال‌های ۲۰۱۸ و ۲۰۱۹ ثابت کرد که تطبیق الگوهای آماری می‌تواند نحو زبان را یاد بگیرد. آلیسون گوپنیک از دانشگاه برکلی اعتراف می‌کند که اکثر مردم فکر نمی‌کردند بتوان صرفاً با نگاه کردن به آمار یک نمونه بزرگ، گرامر را کشف کرد. با این حال، مایکل سی. فرانک اشاره می‌کند که آموزش GPT-2 روی ۳۰ میلیون کلمه، نتیجه‌اش یک «تولیدکننده مهملات» است، نه یک کودک. این همان تفاوت بنیادین بین یک یادگیرنده آماری قدرتمند و یک مغز بیولوژیک است.

BabyLM: شبیه‌سازی نوزاد

برای بررسی این موضوع، الکس وارستات و همکارانش رقابت BabyLM را راه انداختند؛ مسابقه‌ای سالانه برای آموزش مدل‌ها روی مجموعه‌داده‌های «توسعه‌ای پذیرفتنی». این داده‌ها تنها ۱۰۰ میلیون کلمه (و ۱۰ میلیون برای رده نوزاد) هستند که از منابع زیر استخراج شده‌اند:

  • کتاب‌های داستان و گفتگوها
  • زیرنویس فیلم‌ها
  • نسخه‌های ساده ویکی‌پدیا و ویکی‌پدیا معمولی
  • نسخه‌های پیاده‌شده‌ای از صحبت‌های واقعی که خطاب به کودکان گفته شده است

پژوهشگران برای ارزیابی این مدل‌ها از معیارهای روان‌شناسی زبان استفاده می‌کنند. یکی از روش‌ها اندازه‌گیری «غافلگیری» (Surprisal) است؛ یعنی مدل چقدر احتمال می‌دهد یک جمله درست یا غلط باشد. برای مثال، مدل روی تفاوت بین «کلیدهای کمد روی میز هستند» و «کلیدهای کمد روی میز است» آزمایش می‌شود. در حالی که یک انسان از کلمه «است» غافلگیر می‌شود، پژوهشگران بررسی می‌کنند که آیا مدل نیز سردرگمی مشابهی نشان می‌دهد یا خیر.

یک یافته غافلگیرکننده، شکست «یادگیری برنامه‌ریزی شده» (Curriculum Learning) بود. برخلاف انسان‌ها که از ورودی‌های ساده به پیچیده یاد می‌گیرند (شروع با زبان کودکانه و پیشرفت به سمت گفتار پیچیده)، آرون مولر از دانشگاه بوستون دریافت که ترنسفورمرها لزوماً برای یادگیری موثر به این ترتیب داده‌ها نیاز ندارند.

برنده سال ۲۰۲۴، مدل GPT-BERT، نمونه‌ای از بهره‌وری بود. این مدل به طور ترکیبی برای پیش‌بینی توکن بعدی و همچنین به عنوان یک «مدل زبانی ماسک‌شده» (برای پر کردن جاهای خالی، شبیه به بازی Mad Libs) آموزش دیده بود. وقتی روی ۱۰۰ میلیون کلمه پیش‌آموزش دید، در برخی محک‌های گرامری BabyLM از Llama 2 70B (که ۱۵ هزار برابر داده بیشتری داشت) بهتر عمل کرد، هرچند این مدل‌ها هنوز زمخت هستند و اغلب نمی‌توانند متنی روان تولید کنند.

یادگیری از طریق حواس

پژوهشگران اکنون معتقدند حلقه مفقوده، «تجسم» (Embodiment) است. کودکان از متن‌های ایستا یاد نمی‌گیرند، بلکه از طریق بینایی، شنوایی و کاوش فعال دنیا را می‌شناسند. آن‌ها در «جنگلی از زانوها» زندگی می‌کنند و اشیاء به دلیل کوتاه بودن دست‌هایشان، دقیقاً در مقابل چشمانشان قرار دارند.

پروژه SAYCam مایکل فرانک از دوربین‌های سرپوشی روی نوزادان استفاده کرد تا تجربه زیسته آن‌ها را ثبت کند. این پروژه هر هفته دو ساعت از زندگی هر کودک بین شش ماه تا دو و نیم سالگی را ضبط کرد. برندن لیک از دانشگاه پرینستون با ۶۱ ساعت از این تصاویر خام، مدلی ساخت که کلمات را بدون نیاز به پیش‌فرض‌های فطری (مانند این فرض که کلمه «کفش» به کل شیء اشاره دارد و نه بند کفش) به اشیا مرتبط می‌کرد. لیک اشاره کرد که این یک شروع است، اما هنوز یک کودک دو ساله را نمی‌سازد.

در سطحی پیشرفته‌تر، عری هاسون اولین ۱۰۰۰ روز زندگی ۱۷ کودک را ثبت کرده است. او با نصب دوربین و میکروفون در تمام نقاط خانه (به جز اتاق خواب و حمام)، روزانه ۱۲ ساعت داده صوتی-تصویری جمع‌آوری کرد. این اولین مجموعه‌داده «ورودی» در مقیاس بزرگ است تا ببینند آیا AI می‌تواند از زاویه دید یک کودک یاد بگیرد، هرچند هاسون می‌گوید این تنها آغاز راه است.

اجزای مفقود: عاملیت و اجتماعی بودن

با این حال، مدل‌های چندوجهی (Multimodal) هنوز از نوزادان عقب‌ترند. آلیسون گوپنیک استدلال می‌کند کلید کار «کاوش فعال» است. کودکان مصرف‌کننده غیرفعال داده نیستند؛ آن‌ها با جهان آزمایش می‌کنند تا «توانمندسازی» (Empowerment) خود را به حداکثر برسانند، یعنی توانایی ایجاد تأثیری پیش‌بینی‌پذیر بر جهان. این موضوع در مطالعات روی دانش‌آموزانی که از بازی‌های شبیه به Minecraft برای یادگیری علت و معلول استفاده می‌کنند، مشهود است. این ناتوانی در درک عمیق علت و معلول، مشابه همان چالشی است که در ناکامی مدل‌های زبانی در ابداع نظریات علمی به دلیل نبود مدل‌های جهانی مورد بحث قرار گرفت.

الیزابت بوناویتز از هاروارد به بعد اجتماعی اشاره می‌کند. کودکان درباره نیت و دانش معلمان خود استدلال می‌کنند، در حالی که LLMها در انزوا یاد می‌گیرند. بوناویتز اشاره می‌کند که کودکان اطلاعات را متفاوت تفسیر می‌کنند وقتی می‌دانند یک بزرگسال در حال آموزش دادن به آن‌هاست. AI فعلی فاقد رانه‌ای برای «باباسوگند» (Babbling) و مشاهده واکنش‌های اجتماعی برای اصلاح خروجی‌های خود است. اگرچه BabyLM مسیری را برای تعامل مدل‌ها با یکدیگر باز کرد، اما این مدل‌های اجتماعی هنوز نتوانسته‌اند از مدل‌های استاندارد پیشی بگیرند.

تحلیل: تغییر پارادایم در هوش مصنوعی

برای جامعه فنی، این پژوهش‌ها سیگنالی از تغییر رویکرد از «مقیاس‌بندی با زور بازو» (Brute Force Scaling) به «بهره‌وری معماری» است. شکاف بهره‌وری داده ثابت می‌کند که ترنسفورمر، با وجود قدرت زیاد، آینه‌ای از بیولوژی نیست. بلکه یک موتور آماری است که فاقد یکپارچگی حسی-حرکتی قشر مغز انسان است.

اگر نسل بعدی AI بتواند کاوش فعال و استدلال اجتماعی را ادغام کند، ما از عصر «استخراج اینترنت» فراتر خواهیم رفت. این امر توسعه AI را دموکراتیزه می‌کند و مرز پیشرو را از کسانی که بیشترین داده‌ها را دارند، به سمت کسانی می‌برد که کارآمدترین مکانیسم‌های یادگیری را طراحی می‌کنند. این موضوع در حال حاضر توسط بنچمارک NanoGPT Slowrun (منتشر شده توسط Q Labs در مارس ۲۰۲۶) بررسی می‌شود که تمرکز آن صرفاً روی زاویه بهره‌وری داده است.

در نهایت، استفاده از LLMها به عنوان «موش‌های آزمایشگاهی زبان‌شناختی» به دانشمندان اجازه می‌دهد فرضیاتی درباره شناخت انسان را آزمایش کنند که تست آن‌ها روی کودکان واقعی غیراخلاقی یا غیرممکن است. با شبیه‌سازی درجات مختلف دوزبانگی یا محروم کردن مدل‌ها از برخی فرم‌های گرامری، پژوهشگران می‌توانند با AI به عنوان یک «ارگانیسم مدل» برای روشن کردن پیچیدگی‌های ذهن انسان برخورد کنند. الیزابت بوناویتز که زمانی تردید داشت، اکنون مدل‌ها را راهی برای مطالعه شناخت می‌بیند، مشابه روشی که روان‌شناسان تطبیقی ذهن حیوانات را مطالعه می‌کنند.

کودکان هوش مصنوعی را شکست می‌دهند—و ما هنوز نمی‌دانیم چرا

برای اینکه ببینید آیا این تغییر در صنعت در حال رخ دادن است، منتظر موج بعدی مدل‌های چندوجهی از متا و استارتاپ مخفی Flapping Airplanes باشید که هر دو در حال ادغام روان‌شناسی رشد در خط لوله‌های آموزشی خود هستند. همان‌طور که وارستات اشاره می‌کند، برای ۱۰۰ هزار سال، انسان‌ها تنها موجودات زبانی در جهان بودند؛ اکنون ما بالاخره یک ارگانیسم مدل داریم تا در کنار خودمان مطالعه کنیم.

گام بعدی شما

  • دنبال کردن پیشرفت‌های مدل‌های Sovereign AI که سعی می‌کنند با داده‌های محدود زبانی، بهره‌وری را جایگزین مقیاس کنند.
  • بررسی بنچمارک NanoGPT Slowrun (منتشر شده در مارس ۲۰۲۶) که تمرکز آن صرفاً روی بهره‌وری داده است.
  • مطالعه مقالات مربوط به ادغام روان‌شناسی رشد در خط لوله‌های آموزش مدل‌های چندوجهی.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این شکاف ثابت می‌کند که تکیه بر افزایش حجم داده برای رسیدن به هوش عمومی (AGI) با بن‌بست مواجه است. بر اساس تخصص دانشمندان علوم شناختی، تنها با ادغام حس‌های محیطی و عاملیت اجتماعی می‌توان به بهره‌وری مغز انسان رسید.

تأثیر برای ایران

این رویکرد برای توسعه مدل‌های زبانی فارسی بسیار حیاتی است؛ چرا که حجم داده‌های باکیفیت فارسی در مقایسه با انگلیسی بسیار کمتر است و رسیدن به بهره‌وری «مقیاس نوزاد» تنها راه رقابت است.

·نگاه ما
تحریریه دات‌هوش

این پژوهش‌ها نشان می‌دهند که معماری ترنسفورمر، علی‌رغم قدرت آماری، یک آینه بیولوژیک نیست بلکه یک موتور استخراج الگو است. جابجایی پارادایم از «مقیاس‌بندی خام» به «بهره‌وری معماری» به این معناست که برنده آینده، لزوماً کسی نیست که بیشترین داده را دارد، بلکه کسی است که بهینه‌ترین مکانیسم یادگیری را طراحی می‌کند. استفاده از LLMها به عنوان «موش‌های آزمایشگاهی زبانی» اکنون به ابزاری اخلاقی برای درک شناخت انسانی تبدیل شده است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.