پرش به محتوای اصلی
پرش به محتوای مقاله

گارتنر: ۷۵٪ داده‌های توسعه هوش مصنوعی تا سال ۲۰۲۶ مصنوعی خواهند بود

·۵ شهریور ۱۴۰۵۴ دقیقه مطالعه۱ بازدید
دیوار داده هوش مصنوعی واقعی است. آنچه درباره رفع آن با داده مصنوعی نمی‌گویند.
دیوار داده هوش مصنوعی واقعی است. آنچه درباره رفع آن با داده مصنوعی نمی‌گویند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر پارادایم از «جمع‌آوری داده» به «تولید داده»؛ گارتنر برای نخستین بار عدد ۷۵٪ را به عنوان سهم داده‌های مصنوعی تا سال ۲۰۲۶ معرفی کرد که نشان‌دهنده سرعت بسیار بیشتر از پیش‌بینی‌های قبلی است.

اگر امروز در حال آموزش یک مدل زبانی هستید، احتمالاً متوجه شده‌اید که دیگر متنی باکیفیت برای استخراج از وب باقی نمانده است. این کمبود، دیگر یک پیش‌بینی تئوریک نیست، بلکه یک محدودیت عملی برای تیم‌های مهندسی است که در سال ۲۰۲۶ ویژگی‌های جدید هوش مصنوعی را عرضه می‌کنند.

تصور کنید می‌خواهید یک آسمان‌خراش بسازید اما فولاد تمام شده است؛ در دنیای هوش مصنوعی، «فولاد» همان داده‌های پاک و قابل‌استفاده است. با مسدود شدن دسترسی خزنده‌های وب توسط ناشران و افزایش هزینه‌های لایسنس، وبِ باز تا حد نهایی خود استخراج شده است. طبق تحقیقات Epoch AI، متون عمومی باکیفیت تولیدشده توسط انسان بین سال‌های ۲۰۲۶ تا ۲۰۳۲ به‌طور گسترده تمام می‌شوند. این کمبود، صنعت را مجبور به چرخش به سمت داده‌های مصنوعی (Synthetic Data) کرده است؛ یعنی اطلاعاتی که توسط یک هوش مصنوعی برای آموزش هوش مصنوعی دیگر تولید می‌شود.

ابعاد این تغییر

اجرای مدل‌های پیشرو (Frontier Models) در زمان حال، همین گذار را نشان می‌دهد. برخی تخمین‌ها حاکی از آن است که در حال حاضر ۳۰ تا ۶۰ درصد از توکن‌های آموزشی در این مدل‌ها، به‌جای استخراج از وب، به‌صورت مصنوعی تولید شده‌اند.

بر اساس گزارش Gartner، سهم داده‌های مصنوعی در توسعه هوش مصنوعی از ۱٪ در سال ۲۰۲۱ به حدود ۷۵٪ تا پایان سال ۲۰۲۶ خواهد رسید که جهشی عظیم است. برای مقابله با این «دیوار داده»، بخش تحقیقات آسیا در مایکروسافت (Microsoft Research Asia) ابزاری به نام SynthLLM توسعه داده است. این ابزار با استفاده از الگوریتم‌های گراف، مفاهیم سطح بالا را بازترکیب می‌کند تا نمونه‌های مصنوعی جدیدی بسازد و بدین ترتیب وابستگی به استخراج داده از وب را کاهش دهد.

دیوار داده هوش مصنوعی واقعی است؛ راه‌حل پنهان: داده‌های مصنوعی

اما تکیه مطلق به داده‌های تولیدشده توسط هوش مصنوعی، یک حالت شکست بحرانی به نام «فروپاشی مدل» (Model Collapse) ایجاد می‌کند. این اتفاق زمانی رخ می‌دهد که یک مدل به‌طور مکرر روی خروجی‌های خودش آموزش ببیند، بدون اینکه به توزیع‌های واقعی جهان متصل باشد؛ در نتیجه تنوع پاسخ‌ها منقبض شده و خطاها در هر نسل تکثیر و تشدید می‌شوند.

جزئیات پیاده‌سازی

برای جلوگیری از این وضعیت، تیم‌های مهندسی در حال اتخاذ نسبت‌های ترکیبی و مکانیسم‌های خاصی هستند:

  • قانون ۳۰ تا ۵۰ درصد: تیم‌ها معمولاً سهم داده‌های مصنوعی را به ۳۰ تا ۵۰ درصد از مجموعه آموزشی محدود می‌کنند و باقی‌مانده را به عنوان «بذرهای» منتخب و تولیدشده توسط انسان حفظ می‌کنند.
  • کیفیت مدل معلم: سقف کیفیت داده‌های مصنوعی توسط «مدل معلم» تعیین می‌شود؛ مدل‌های قوی‌تر، سیگنال آموزشی به‌طور معناداری بهتری تولید می‌کنند.
  • راه‌اندازی سرد (Cold Start Bootstrapping): برای ویژگی‌های جدیدی که داده‌های کاربردی ندارند، تیم‌ها ابتدا توزیع‌های هدف را تعریف کرده، با نمونه‌های واقعی بذرپاشی می‌کنند و سپس پرسوناهای متنوع و موارد خاص (Edge Cases) را تولید می‌کنند. در این مرحله، حذف داده‌های تکراری (Deduplication) باید به‌شدت انجام شود، زیرا مدل‌های زبانی اغلب خروجی‌های تقریباً مشابهی تولید می‌کنند که فقط بازنویسی‌های سطحی هستند.

در بخش‌های تحت نظارت و رگولاتوری، رویکرد متفاوت است. داده‌های مصنوعی بیمار برای اعتبارسنجی معماری و مهندسی اولیه پرامپت مفید هستند، اما نمی‌توان از آن‌ها برای ادعاهای دقت بالینی یا تصمیماتی که به برازش توزیع واقعی وابسته هستند، استفاده کرد. در این موارد، الگوی ترکیبی اجباری است: داده‌های مصنوعی برای سرعت و داده‌های واقعیِ ناشناس‌شده (De-identified) برای دفاع‌پذیری علمی و قانونی.

ارزیابی، خطرناک‌ترین نقطه کور باقی‌مانده است. ارزیابی یک مدل صرفاً بر اساس یک مجموعه داده مصنوعی (Synthetic Holdout Set)، به‌طور سیستماتیک عملکرد مدل را بیش از حد واقعی نشان می‌دهد. تیم‌ها باید فارغ از حجم داده، یک مجموعه ارزیابی واقعی را حفظ کنند تا اطمینان یابند مدل در محیط عملیاتی واقعاً کار می‌کند.

چک‌لیست اعتبارسنجی

برای کسانی که در حال حاضر خط لوله‌های داده (Pipelines) می‌سازند، رعایت این پنج گام ضروری است:

۱. سنجش آمادگی: تنها زمانی از تولید مصنوعی استفاده کنید که داده‌های واقعی واقعاً کمیاب، محدود یا نامتوازن باشند.
۲. تطبیق مودالیته: برای متن از LLMها، برای داده‌های جدولی از مدل‌های آماری یا VAEها، و برای تصویر و ویدیو از GANها یا مدل‌های انتشار (Diffusion) استفاده کنید.
۳. اعتبارسنجی توزیع‌ها: مراحل اجباری در خط لوله باید توزیع‌های مصنوعی را پیش از آموزش، در برابر توزیع‌های مرجع واقعی اعتبارسنجی کنند.
۴. ردیابی منشأ (Provenance): منشأ داده‌ها را از روز اول ردیابی کنید تا برای برچسب‌گذاری‌های رگولاتوری و دفاع در برابر فروپاشی نامحسوس مدل استفاده شود.
۵. حفظ ارزیابی واقعی: هرگز اجازه ندهید داده‌های مصنوعی به‌طور کامل جایگزین مجموعه ارزیابی دنیای واقعی شما شوند.

این تغییر، فرض بنیادین مقیاس‌پذیری هوش مصنوعی را عوض می‌کند؛ ما از عصر «داده‌های بیشتر» به عصر «اعتبارسنجی بهتر» می‌رویم. مزیت رقابتی دیگر متعلق به کسانی نیست که بزرگ‌ترین خزنده‌های وب را دارند، بلکه متعلق به کسانی است که منضبط‌ترین زیرساخت‌های داده مصنوعی را ساخته‌اند.

در آینده، منتظر ظهور «برچسب‌های منشأ» استاندارد برای توکن‌های آموزشی باشید، زیرا فشار رگولاتوری برای تفکیک داده‌های انسانی از مصنوعی افزایش خواهد یافت.

چرا این موضوع مهم است؟

این گزارش نشان می‌دهد که مدل‌های بنیادی به سقف رشد داده‌های انسانی رسیده‌اند و بقای آن‌ها به تخصص در تولید داده‌های مصنوعی وابسته است. اعتبار مدل‌های آینده دیگر بر اساس حجم داده‌های استخراج‌شده، بلکه بر اساس متدولوژی‌های جلوگیری از فروپاشی مدل سنجیده می‌شود.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که دسترسی محدودی به مجموعه‌های داده عظیم انگلیسی دارند، تسلط بر تولید داده‌های مصنوعی فرصتی برای رقابت در ساخت مدل‌های تخصصی با داده‌های کم است.

·نگاه ما
تحریریه دات‌هوش

برتری رقابتی در سال‌های آینده دیگر در اختیار کسانی نیست که بزرگ‌ترین خزنده‌های وب (Scrapers) را دارند، بلکه متعلق به کسانی است که منظم‌ترین زیرساخت‌های تولید داده مصنوعی را ساخته‌اند. این یعنی مهندسی داده از یک فعالیت «جمع‌آوری» به یک فعالیت «تولید کنترل‌شده» تبدیل شده است. در واقع، کیفیت مدل‌های آینده نه با حجم داده، بلکه با دقتِ فیلترهای اعتبارسنجی داده‌های مصنوعی سنجیده خواهد شد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.