تصور کنید پژوهشگری هستید که ساعت ۲ صبح، پس از سه ساعت انتظار برای اجرای یک مدل، متوجه میشود بهبود حاصل شده تنها ۰.۰۱۴ است و حالا باید تصمیم بگیرد آیا این نتیجه تصادفی است یا یک پیشرفت واقعی. گلوگاه پیشرفت علم دیگر توانایی نوشتن کد نیست، بلکه توانایی تصمیمگیری درباره این است که کدام آزمایش ارزش اجرا شدن دارد.
Discovery Loop، سرمایهگذاری جدیدی است که توسط اسطورههای هوش مصنوعی گوگل یعنی جف دین (Jeff Dean)، سانجای گماوات (Sanjay Ghemawat)، کوک لـه (Quoc Le) و اوریول وینیالس (Oriol Vinyals) بنیانگذاری شده است. طبق مستندات منتشر شده در ۱۳ اوت ۲۰۲۶، هدف این پروژه تبدیل پژوهش از یک فرآیند دستی و انسانی به یک زیرساخت برنامهریزیپذیر و مقیاسپذیر است.
برای دههها، چرخه پژوهش یک فعالیت متوالی انسانی بوده است: پژوهشگر فرضیهای میسازد، کد را تغییر میدهد، مدل را آموزش میدهد و نتیجه را تفسیر میکند. در حالی که زیرساختهای محاسباتی میتوانند هزاران آزمایش را بهطور موازی اجرا کنند، انسان همچنان بهعنوان «زمانبند» (Scheduler) مرکزی و اصلیترین گلوگاه باقی مانده است. همانطور که در تحلیلهای پیشین ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، اتوماسیون در لایههای زیرین، همواره نیاز به نظارت در لایههای بالایی دارد؛ اما Discovery Loop قصد دارد این نظارت را به سطح «طراحی استراتژی» منتقل کند.
این سامانه بهجای تولید کدهای پراکنده، بر اتوماسیون اکتشافات در مهندسی یادگیری ماشین تمرکز کرده و در مراحل بعدی به علوم گستردهتری که نتایج آنها قابل اندازهگیری است، گسترش مییابد.
معماری پژوهشی ششلایه
برای گذار از تولید کد ساده به اکتشاف خودکار، این سیستم پژوهش را به شش لایه متقابل تقسیم میکند:
- هدف پژوهش (Research Goal): تعریف اهداف سطح بالا و محدودیتها توسط معمار انسانی. این لایه مانند یک «قرارداد پژوهشی» عمل میکند و معیارهایی مثل تابع زیان (Loss Function)، محدودیت حافظه (مثلاً کمتر از ۸ گیگابایت) و بودجه محاسباتی (مثلاً ۵۰۰ ساعت GPU) را تعیین میکند.
- موتور فرضیه (Hypothesis Engine): این لایه تولید ایده را به یک مسئله جستوجو تبدیل میکند. یک مدل زبانی بزرگ (LLM) میتواند هزاران ایده تولید کند، اما این موتور آزمایشهایی را اولویتبندی میکند که بیشترین ارزش اطلاعاتی یا احتمال موفقیت را دارند.
- برنامهریز آزمایش (Experiment Planner): تعادل میان «بهرهبرداری» از موفقیتهای شناختهشده و «کاوش» در معماریهای رادیکال را مدیریت میکند تا سیستم در بهینههای محلی (Local Optima) گیر نکند. این بخش از مفاهیمی چون بهینهسازی بیزی و یادگیری فعال استفاده میکند.
- موتور اجرا (Execution Engine): لایهای از سیستمهای توزیعشده که زمانبندی و تخصیص منابع را در هزاران ساعت محاسباتی مدیریت میکند و پیچیدگیهایی مثل تکرار آزمایشها و مدیریت آرتیفکتها را بر عهده دارد.
- موتور ارزیابی (Evaluation Engine): «قانون اساسی» سیستم است. برای جلوگیری از سوءاستفاده از پاداش (Reward Hacking) — جایی که AI بدون بهبود واقعی، فقط نمره بنچمارک را بالا میبرد — این لایه باید خارج از کنترل عامل باشد و قوانین ارزیابی در آن تغییرناپذیر باشند. این رویکرد سختگیرانه در ارزیابی، یادآور متدهای ترکیبی است که در تحلیلهای ما درباره BrassCoders برای شکار باگهای منطقی بررسی شد، جایی که تکیه صرف بر LLM بدون لایههای اعتبارسنجی منجر به نتایج نادرست میشود.
- حافظه پژوهشی (Research Memory): برخلاف تاریخچه چت، این یک گراف دانش (Knowledge Graph) است که تبار فرضیهها، شکستها و نتایج را ردیابی میکند تا سیستم از تکرار اشتباهات گذشته اجتناب کند.

تبدیل آزمایشها به اشیاء درجه اول
در این رویکرد، «آزمایش» دیگر یک اجرای گذرا نیست، بلکه یک شیء ماندگار است. هر آزمایش دارای یک شناسه منحصربهفرد، شناسه والد، فرضیه، تغییرات کد (Diff)، پیکربندی و معیارهای ارزیابی است. نتایج نیز به صورت اشیاء ساختاریافته ذخیره میشوند که شامل وضعیت، توان عملیاتی (Throughput) و متادیتای محیطی (مانند نوع GPU) است.
این ساختار اجازه میدهد سیستم یک گراف تبار (Lineage Graph) بسازد که روابطی مثل «مشتق شده از» یا «ابطال میکند» را ثبت کند. حافظه پژوهشی در اینجا بیشتر به کنترل نسخه (Version Control) شبیه است تا تاریخچه گفتگو؛ درست همانطور که Git تغییرات کد را ردیابی میکند، این زیرساخت تغییرات در دانش و فرضیات را ثبت میکند.
چالش سیستمهای توزیعشده
با توجه به پیشینه بنیانگذاران در خلق فناوریهایی چون MapReduce، Spanner و TensorFlow، Discovery Loop پژوهش خودکار را یک مسئله سیستمهای توزیعشده میبیند. اجرای ۱۰,۰۰۰ آزمایش همزمان نیازمند ارکستراسیون پیچیدهای برای مدیریت ناهمگونی سختافزاری و حذف موارد تکراری است.
در این مدل، موازیسازی معادله پژوهش را تغییر میدهد. انسانها بهصورت متوالی (A $\rightarrow$ B $\rightarrow$ C) فکر میکنند، اما این سیستم میتواند صدها مسیر را همزمان کاوش کند. البته برای جلوگیری از تولید «۱۰,۰۰۰ آزمایش بد با سرعت بیشتر»، یک تابع اولویتبندی بر اساس سود مورد انتظار، ارزش اطلاعاتی، هزینه و ریسک اعمال میشود.
ریسکهای بهینهسازی خودکار
اتوماسیون، نیاز به انضباط آماری را افزایش میدهد. به نقل از تحلیلگران پروژه، سیستم با چندین حالت شکست مواجه است:
- سوءاستفاده از پاداش: یافتن حفرههایی در بنچمارک برای افزایش مصنوعی امتیازات.
- اکتشافات کاذب: در ۱۰۰,۰۰۰ آزمایش، برخی نتایج صرفاً بر اساس شانس موفق به نظر میرسند (مسئله مقایسههای متعدد).
- آلودگی آزمایش: تغییر همزمان چندین متغیر که تشخیص علت بهبود را غیرممکن میکند.
- فرار محاسباتی: مصرف بیرویه منابع برای بهبودهای ناچیز در صورت نبود سیاست توقف سختگیرانه.
- آلودگی حافظه: انباشت دادههای نویزی که نیازمند چرخه پالایش (از نتیجه خام به اصل تاییدشده) است.
از کمکخلبان به موتور پژوهش
این تحول، گذاری از نسل اول (تکمیل کد) به نسل پنجم (پژوهش خودکار) است. در نسل اول، انسان از AI برای پیشنهاد کد استفاده میکرد؛ اما در نسل پنجم، انسان هدف را تعریف میکند و سیستم استراتژی پژوهش، فرضیات، آزمایشها و شواهد را مدیریت کرده و در نهایت استراتژی پژوهش را بهبود میبخشد.
در این پارادایم، مهندس نرمافزار به یک «معمار پژوهش» تبدیل میشود. نقش انسان از پیادهسازی و طراحی آزمایش به فرمولبندی مسئله و قضاوت علمی ارتقا مییابد. توسعهدهنده دیگر محصول را نمیسازد، بلکه سیستمی را میسازد که بهترین محصولات را کشف میکند. این تغییر بنیادین در نقش توسعهدهندگان، دقیقاً با تغییر پارادایم برنامهنویسی ارشد از تولید خط به خط به ارکستراسیون همسو است که در آن تمرکز از «نوشتن» به «مدیریت سیستمهای هوشمند» منتقل شده است.
Discovery Loop قصد دارد ابتدا خودش را به عنوان مشتری اول به کار بگیرد و پشته فناوری خود را بهینه کند تا نرخ بهبود یک چرخه خودکار را با پژوهش انسانی مقایسه کند. هدف نهایی، ایجاد یک حلقه بازگشتی است که در آن پژوهش بهتر به مدلهای بهتر و مدلهای بهتر به پژوهشهای کارآمدتر منجر شوند.
گام بعدی شما
- بررسی مفاهیم بهینهسازی بیزی (Bayesian Optimization) برای درک نحوه اولویتبندی آزمایشها در سیستمهای خودکار.
- مطالعه درباره سوءاستفاده از پاداش (Reward Hacking) در مدلهای تقویتشده برای درک اهمیت لایه ارزیابی مستقل.
- تحلیل تفاوت بین «تولید کد» و «مدیریت چرخه پژوهش» در ابزارهای فعلی AI.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell و نقش آنها در مقیاسدهی این موتورها مراجعه کنید.




گفتگو