پرش به محتوای اصلی
پرش به محتوای مقاله

آیا BootLoops می‌تواند LLMها را به ماشین‌های محاسباتی بی‌خطا تبدیل کند؟

·۹ مهر ۱۴۰۵۶ دقیقه مطالعه
انتشار BootLoops ۱.۰: ابزار متن‌باز تسخیر مدل‌های زبانی بزرگ برای علم توسط اشنارتس
انتشار BootLoops ۱.۰: ابزار متن‌باز تسخیر مدل‌های زبانی بزرگ برای علم توسط اشنارتس
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

نخستین چارچوب متن‌باز که LLMها را از تولید محتوا به حل انتگرال‌های ریاضی پیچیده و شناسایی خطاهای محاسباتی در مقالات منتشرشده تبدیل می‌کند؛ در حالی که پیش از این، AI بیشتر برای پیش‌نویس مقالات استفاده می‌شد.

تصور کنید ابزاری داشته باشید که بتواند پیچیده‌ترین انتگرال‌های فیزیک نظری را که سال‌ها وقت گروه‌های پژوهشی را می‌گیرد، در ۲۰ دقیقه حل کند. متیو شوارتز (Matthew Schwartz)، فیزیکدان نظری، با انتشار BootLoops 1.0 در ۱ اکتبر ۲۰۲۶، ثابت کرد که هوش مصنوعی زاینده (Generative AI) می‌تواند از فضای «حدس و گمان» یا همان vibes خارج شده و نتایج ریاضی دقیق و قابل‌راستی‌آزمایی را در ۲۲ حوزه مختلف علمی تولید کند. این ابزار یک کیت متن‌باز است که مدل‌های زبانی بزرگ (LLMs) را به ابزارهای با دقت بالا برای علوم کمی تبدیل می‌کند و تحت مجوز MIT منتشر شده است.

این تحول در حالی رخ می‌دهد که صنعت از رابط‌های ساده‌ی چت به سمت گردش‌های کاری عامل‌محور (Agentic) حرکت می‌کند. همان‌طور که در تحلیل قبلی ما درباره‌ی زیرساخت‌های استنتاج محلی مانند Ollama و vLLM اشاره کردیم، تمرکز بر لایه‌ی زیرساختی و همزمانی بود، اما BootLoops مستقیماً روی لایه‌ی کاربرد تمرکز دارد تا مدل را برای رعایت سخت‌گیرانه‌ی قواعد ریاضی محدود کند. برای اکثر پژوهشگران، AI تاکنون تنها یک ابزار برای نوشتن پیش‌نویس بوده است؛ اما شوارتز در حال تبدیل آن به یک موتور محاسباتی اصلی است.

زیربنای فیزیکی

شوارتز این پروژه را در تابستان ۲۰۲۶ با استفاده از مدل Claude Fable 5 آغاز کرد. او این مسیر را بر اساس تجربیات پیشین خود با Claude Opus 4.5 پیش برد که پیش‌تر در پست «فیزیکِ وایب» (Vibe Physics) در دسامبر ۲۰۲۵ به آن‌ها اشاره کرده بود. این بهره‌برداری از مدل‌های پیشرفته در حوزه‌های علمی، در راستای سیاست‌های جدید آنتروپیک است که دسترسی سازمان‌های علوم زیستی به مدل‌های پرخطر را برای پیشبرد پژوهش‌های تخصصی آزاد کرده است. هدف اصلی او یکپارچه‌سازی روش‌های دامنه پراکندگی در یک چارچوب واحد بر اساس S-matrix و بوت‌استرپ نیمه‌عددی بود. این رویکردهای مکمل، یک دامنه را از طریق محدودیت‌های فیزیکی و ارزیابی‌های عددی با دقت بالا محصور می‌کنند تا زمانی که تنها یک پاسخ دقیق باقی بماند.

در فیزیک ذرات، دامنه‌های پراکندگی، بقایای برخورد در برخورددهنده بزرگ هادرونی (LHC) را به ذرات تولید شده مرتبط می‌کنند. محاسبه یک انتگرال فینمن (Feynman integral) پیشرو می‌تواند سال‌ها زمان یک گروه پژوهشی را بگیرد. طبق گزارش unite.ai، مدل Claude توانست نتایج یکی از مقالات خود شوارتز را در ۲۰ دقیقه بازتولید کند؛ کاری که پیش‌تر هفته‌ها کدنویسی دستی می‌طلبید. مدل حتی الگوریتم بهینه‌تری را شناسایی کرد که خود فیزیکدان پیش از آن از آن بی‌خبر بود.

زمانی که مدل برای عبور از لگاریتم‌ها (ساده‌ترین خانواده توابع در این محاسبات) به سمت کلاس دشوارتر «توابع بیضوی» (elliptic functions) سوق داده شد، مدل توانست ماشین‌آلات منتقل شده را تعمیم دهد و بخش بزرگی از نرم‌افزار جدید را خودش بنویسد. در نهایت، این ابزار ۳۰ انتگرال را به‌طور کامل محاسبه کرد: ۱۵ مورد بازتولید نتایج شناخته شده و ۱۵ مورد که هرگز پیش از این محاسبه نشده بودند، از جمله انتگرال‌های فینمن بیضوی. شوارتز مسائلی را که با نقاط قوت این مدل همسو هستند، «Claude-shaped» یا «به شکل کلود» می‌نامد.

پیشرفت‌های میان‌رشته‌ای

ابزار BootLoops 1.0 نتایجی را به دست آورده که دهه‌ها از دسترس پژوهشگران انسانی دور بود:

  • اکولوژی: این ابزار توانست معادله‌ای از سال ۲۰۰۵ توسط اکولوژیست «رامپال اتین» درباره تئوری تنوع زیستی خنثی را حل کند که ۲۰ سال در مقیاس بزرگ بدون پاسخ مانده بود. هنگامی که این مدل روی داده‌های سرشماری جنگل‌ها در جزیره بارو کلرادو در کانال پاناما اعمال شد، فاش کرد که تغییرات ترکیب گونه‌ها ۴.۵ برابر سریع‌تر از آنچه تئوری خنثی اجازه می‌دهد، رخ می‌دهد. شوارتز همچنین با همکاری پروفسور جیمز اودوایر، یک مدل پیش‌بینی مینیمال از تاریخچه زندگی گونه‌ها ساخت که تطابق نزدیکی با داده‌ها دارد.
  • ژنتیک جمعیت: سیستم یک انتگرال ۳۰ ساله را درباره نحوه اثرگذاری انتخاب طبیعی بر جهش‌های نادر حل کرد. شوارتز و همکارش مایکل دزای، این مدل را روی gnomAD (بزرگترین کاتالوگ عمومی تغییرات ژنتیکی انسان) اعمال کردند و آن را با ۱.۴۶ میلیون کپی ژنوم و تقریباً ۷۳۰ هزار اکسوم انسانی تطبیق دادند. آن‌ها همچنین ۵.۷ میلیارد جفت از جهش‌های نزدیک را از پروژه ۱۰۰۰ ژنوم تحلیل کردند و شواهدی از «تبدیل ژنی» (gene conversion) یافتند؛ مکانیزمی که تقریباً هر تحلیلی که از تغییرات ژنتیکی پیوند‌یافته استفاده می‌کند، نادیده می‌گیرد.
  • اقتصاد: در یک همکاری که منجر به مقاله کاری NBER شماره ۳۵۷۸۲ در سپتامبر ۲۰۲۶ شد، این گردش کار ۴۴۵۲ بسته بازتولید از پنج مجله اقتصادی را تحلیل کرد. سیستم تناقضاتی را در ۳۴۶۰ مقاله یا پیوست شناسایی کرد و ۳۰,۰۰۰ روتین را از ابزارهای تجاری مانند MATLAB و Stata به کدهای متن‌باز منتقل کرد. در ۴۹۶ مقاله، زمان اجرای محاسبات بیش از ۱۰ برابر کاهش یافت در حالی که دقت حفظ یا بهبود یافت و برای ۹۲۳ مقاله، افزونه‌های جدیدی توسعه داده شد.
  • زبان‌شناسی: این گروه AccStack را تولید کردند؛ یک پایگاه داده تکیه کلمات (word-stress) که ۶۰۷۲ زبان و کتابشناسی شامل ۱۶۰,۰۰۰ اثر در حوزه واج‌شناسی را پوشش می‌دهد.

همکاری‌های تخصصی

فراتر از پیشرفت‌های اصلی، این ابزار در طیف گسترده‌ای از مسائل کمی تخصصی به کار گرفته شده است:

  • ژئوشیمی: توسعه مدلی از پیشرفت «رویداد اکسیداسیون بزرگ» در طول چهار دوره یخ‌چالی با همکاری دیوید جانستون.
  • اخترفیزیک: یک مطالعه دموگرافیک روی چرخه حیات لکه‌های خورشیدی که با همکاری سیسیلیا گارفارو به لکه‌های ستاره‌ای تعمیم یافت.
  • زیست‌شناسی تکاملی: محاسبات دقیق شواهد بیزی برای درخت‌های تکاملی با همکاری اسکات ادواردز و پل لوئیس.
  • ریاضیات: ارائه یک راه حل دقیق برای «مسئله نهایی» جورج واتسون (۱۹۳۹) در مورد احتمال بازگشت در یک گشت تصادفی سه‌بعدی.
  • کیهان‌شناسی: ابزاری برای تطبیق پارامترهای کیهان‌شناسی با داده‌های ساختار در مقیاس بزرگ، شامل تریسپکتروم تک-حلقه (one-loop trispectrum) و طیف توان کامل دو-حلقه.

معماری فنی و مقیاس

این گردش کار از طریق جلسات Claude Code روی ماشین‌های مجازی گوگل کلاد (Google Cloud VMs) اجرا می‌شود و با GitHub و Overleaf یکپارچه شده است. یک جلسه اصلی (Master Session)، چندین عامل فرعی را مدیریت می‌کند که نتایج میانی را در فایل‌های markdown ذخیره می‌کنند تا از فساد جلسه (Session Corruption) جلوگیری شود. این ترتیب باعث می‌شود هر بلوک کد به یک عامل واحد محدود شود و یک خطای واحد، کل جلسه را خراب نکند.

در بازه سه ماهه، این ساختار ۳۶ دست‌نوشته در ۱۸ حوزه مختلف با همکاری ۱۹ نویسنده تولید کرد. پروژه تقریباً ۴۰۰ مسئله کاندید را پردازش کرد، هرچند در سایت پروژه ذکر شده که کاربردهای BootLoops 1.0 در واقع ۲۲ حوزه را در بر می‌گیرد. شوارتز اشاره می‌کند که این سیستم مدل-ناپذیر (Model-agnostic) است و می‌تواند با Gemini یا ChatGPT نیز عمل کند.

نقاط شکست و راهکارهای اصلاحی

با وجود موفقیت‌ها، شوارتز چندین حالت شکست تکراری AI را مستند کرده است. مدل‌ها مکرراً پیش از موعد اعلام پیروزی می‌کردند، تخمین‌های زمانی کاملاً نادرست ارائه می‌دادند یا زمانی که یک ابزار ساده کفایت می‌کرد، به سراغ محاسبات ناکارآمد چندروزه می‌رفتند. او همچنین اشاره کرد که مدل اغلب هنگام فشرده‌سازی جلسات طولانی، زمینه (Context) را از دست می‌داد و طبقه‌بندی‌کننده‌های حفاظتی (safeguard classifiers) مدل Fable 5 به طور منظم در حین کار فعال می‌شدند. این چالش‌های پردازشی در حالی رخ می‌دهد که آنتروپیک برای بهینه‌سازی مدل‌های خانواده Fable، هزینه خواندن حافظه پنهان در نسخه Fable 5.1 را تا ۷۵٪ کاهش داده است تا کارایی در جلسات طولانی بهبود یابد.

برای کاهش این خطاها، شوارتز یک استاندارد پذیرش سخت‌گیرانه اجرا کرد: یک مسئله تنها زمانی «حل‌شده» تلقی می‌شود که فرم تابعی کامل آن شناخته شده باشد و یک اسکریپت پایتون بتواند آن را با دقت دلخواه روی یک لپ‌تاپ ارزیابی کند. او در نقش یک داور خصمانه عمل کرد، بر مشاهده شخصی نمودارها پافشاری نمود، مهارت‌های پروتکل را در بدنه ابزار کدگذاری کرد و به مدل دستور داد تا «هوشمندانه‌تر فکر کند، نه سخت‌تر».

مالکیت و شرایط

اگرچه Anthropic بودجه را تأمین کرد و شوارتز به عنوان پژوهشگر مهمان در آنجا فعالیت می‌کرد، اما ابزار توسط خود شوارتز نگهداری می‌شود. مخزن پروژه دارای یک کامیت واحد در ۱ اکتبر ۲۰۲۶ برای نسخه ۱.۰ است و متون و اشکال آن تحت مجوز CC BY 4.0 هستند. کدها با پایتون ۳.۱۲ و برخی اجزای Julia نوشته شده و برای لینوکس x8664 و کانتینرهای دبیان (x8664 و arm64) تایید شده‌اند؛ سیستم‌عامل macOS بخشی از تست‌های انتشار نبود.

این مخزن شامل ۴۹ بسته ابزار است که به صورت ۶ مخزن مجزا منتشر شده‌اند. صراحتاً ذکر شده است که این ابزارها «ابزارهای پژوهشی» هستند و برای تصمیمات نظارتی، بالینی، اکچوئری (بیمه‌ای)، پرداخت یا تصمیمات مربوط به ایمنی عمومی مناسب نیستند. در حالی که حق چاپ متعلق به Anthropic PBC است، این انتشار یک محصول رسمی پشتیبانی شده توسط Anthropic نیست.

این تغییر در شیوه عمل نشان می‌دهد که گلوگاه اکتشافات علمی دیگر در دسترس بودن داده‌ها نیست، بلکه توانایی تبدیل کدهای تجاری قدیمی (Legacy) به چارچوب‌های باز و قابل‌راستی‌آزمایی است. با خودکارسازی «کارهای طاقت‌فرسای» انتقال و تایید، BootLoops به فیزیکدانان و اقتصاددانان اجازه می‌دهد تا به جای سینتکس محاسبات، بر پیامدهای نظری تمرکز کنند.

گام بعدی شما

  • اگر از گردش‌های کاری قدیمی در MATLAB یا Stata استفاده می‌کنید، مخزن BootLoops را بررسی کنید تا ببینید آیا امکان انتقال آن‌ها به پایتون برای بازتولیدپذیری بهتر وجود دارد یا خیر.
  • برای درک نحوه مدیریت عامل‌های فرعی جهت جلوگیری از خطاهای زنجیره‌ای، ساختار ذخیره‌سازی markdown در این پروژه را مطالعه کنید.
  • در پروژه‌های محاسباتی خود، استاندارد «ارزیابی روی لپ‌تاپ» را جایگزین تکیه بر خروجی‌های مستقیم مدل کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف کارهای تکراری در تبدیل کدهای قدیمی به فرمت‌های باز، سرعت بازتولید نتایج علمی را به‌شدت افزایش می‌دهد. اعتبار این دستاورد از تخصص متیو شوارتز در فیزیک نظری و تأیید نتایج توسط داده‌های واقعی در حوزه‌های مختلف نشأت می‌گیرد.

تأثیر برای ایران

این ابزار برای پژوهشگران ایرانی در حوزه‌های فیزیک و اقتصاد که با محدودیت دسترسی به نرم‌افزارهای تجاری گران‌قیمت مانند MATLAB مواجه‌اند، فرصتی برای انتقال محاسبات به محیط‌های متن‌باز و رایگان فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

انتقال تمرکز از تولید متن به تولید کد محاسباتی دقیق، پارادایم استفاده از LLMها را از «دستیار نویسنده» به «پژوهشگر کمکی» تغییر می‌دهد. نکته کلیدی در BootLoops، پذیرش این واقعیت است که مدل‌ها به‌تنهایی قابل اعتماد نیستند و تنها در ترکیب با یک سیستم نظارتی سخت‌گیرانه و محیط‌های اجرای کد (Code Execution)، می‌توان به نتایج علمی دست یافت. این رویکرد، مفهوم «تولید» را به «راستی‌آزمایی» تغییر می‌دهد.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.