پرش به محتوای اصلی
پرش به محتوای مقاله

OpenAI: ۱۰ هزار عامل هوش مصنوعی مسئله ناویر-استوکس را حل کردند

·۲۲ شهریور ۱۴۰۵۷ دقیقه مطالعه۲ بازدید
گردآورده
ردار توالی - شماره ۹۳۲: هفته گذشته در هوش مصنوعی: دیپ‌سیک وی۴.۱-فلش، اطلس آلفاژنوم، میوز متا و پیشرفت ریاضی پیشنهادی اوپن‌ای‌
ردار توالی - شماره ۹۳۲: هفته گذشته در هوش مصنوعی: دیپ‌سیک وی۴.۱-فلش، اطلس آلفاژنوم، میوز متا و پیشرفت ریاضی پیشنهادی اوپن‌ای‌
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از ۱۰ هزار عامل موازی برای حل یک مسئله ریاضی هزاره، اولین نمونه واقعی از تبدیل استنتاج به یک فرآیند سازمان‌یافته پژوهشی است، نه یک پاسخ لحظه‌ای.

تصور کنید ۱۰ هزار پژوهشگر دیجیتال به مدت ۸۸ ساعت به‌طور شبانه‌روزی روی یک مسئله ریاضی کار کنند تا پاسخی بیابند که دهه‌ها از ذهن انسان گریزان بود. این دقیقاً همان اتفاقی است که در آزمایشگاه OpenAI رخ داده تا یکی از سخت‌ترین مسائل ریاضی جهان، یعنی مسئله وجود و همواری ناویر-استوکس (Navier–Stokes existence and smoothness problem)، به یک راهکار احتمالی برسد. این تلاش گسترده با استفاده از یک مدل داخلی که فراتر از GPT-6 Astra است، انجام شده است.

طبق اعلام OpenAI، این دستاورد حاصل یک سامانهٔ چندعاملی (Multi-agent System) — شبیه به یک سازمان پژوهشی که در آن هر کارمند وظیفه‌ای خاص دارد و نتایج را با هم به اشتراک می‌گذارند — است. این سیستم توانست یک «شکست زمانی محدود» (finite-time breakdown) را از شرایط اولیه هموار با تحریکات خارجی هموار استخراج کند. پس از این مرحله، ۱۷ ساعت زمان صرف تأیید رسمی (Formal Verification) این یافته‌ها با استفاده از اثبات‌کنندهٔ قضیه Lean شد. به نقل از مستندات این شرکت، این نتیجه با ایجاد یک گردابه مارپیچی داخلی (self-similar inward-spiraling vortex)، گزاره‌های C و D از جایزه هزاره را حل می‌کند؛ هرچند عامل‌ها پیش از آن مجبور بودند ابتدا یک پرسش دشوار درباره «انفجار اویلر» (Euler blowup) بدون نیروی خارجی را حل کنند تا مسیر اصلی هموار شود.

این پیشرفت در حالی رخ می‌دهد که صنعت هوش مصنوعی از ساخت مدل‌های صرفاً بزرگ‌تر، به سمت بهینه‌سازی نحوه به‌کارگیری محاسبات حرکت کرده است. در حالی که نقاط عطف قبلی بر تعداد خام پارامترها متمرکز بود، روند فعلی بر تبدیل توکن‌ها به نتایج قابل تأیید تأکید دارد. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی ریسک‌های امنیتی سیستم‌های خودمختار، مانند حمله سایبری RubyGems اشاره کردیم، اکنون صنعت تلاش می‌کند همان استقلال عامل‌ها را برای پژوهش‌های سطح بالای علمی به کار بگیرد. رویکرد محاسباتی OpenAI بسیار افشاگر است: پژوهشگران جست‌وجوهای موازی را هماهنگ کردند، اکتشافات میانی را به اشتراک گذاشتند و تلاش‌ها را به سمت نتایج امیدوارکننده‌تر هدایت کردند، به‌گونه‌ای که فرآیند استنتاج شبیه به عملکرد یک سازمان پژوهشی واقعی شد.

چرخش به سمت کارایی محاسباتی

در ۱۰ سپتامبر ۲۰۲۴، شرکت DeepSeek مدل V4.1-Flash را منتشر کرد. این مدل که یک مدل ۵۵۲ میلیارد پارامتری از نوع ترکیب خبره‌ها (Mixture-of-Experts یا MoE) است، برای جایگزینی نسخه قدیمی Pro طراحی شده است. معماری این مدل دارای یک رمزگذار-رمزگشای علی نامتقارن (asymmetric Causal Encoder–Decoder) است که در آن ۸ میلیارد پارامتر در ورودی و ۱۶ میلیارد پارامتر در خروجی فعال هستند. این مدل همچنین از پشتیبانی چندوجهی بومی از طریق deepseek-flash و یک حافظه KV cache به‌شدت کوچک‌تر بهره می‌برد. طبق ارزیابی‌های DeepSeek، مدل Flash در توانمندی، هزینه و سرعت از پیشینیان خود پیشی گرفته است و همین امر باعث شده شرکت بازنشسته کردن نقاط انتهایی (endpoints) نسخه Pro را آغاز کند.

برای توسعه‌دهندگان، این تغییر یعنی «بودجه هوشمندی» ارزان‌تر شده است. اکنون یک عامل می‌تواند صفحه نمایش را بررسی کند، اقدامی را پیشنهاد دهد، آن را اجرا کند، نتیجه را چک کند و چندین بار تلاش مجدد انجام دهد بدون اینکه بودجه محاسباتی‌اش تمام شود. این موضوع باعث می‌شود حلقه‌های بازخورد پیچیده برای کاربردهای واقعی عملی شوند. همان‌طور که DeepSeek حجم محاسباتی قابل پرداخت برای توسعه‌دهندگان را گسترش می‌دهد، می‌بینیم که قابلیت‌های ممتاز دیروز، به اسب‌های بارکش کوچک‌تر و سریع‌تر امروز تبدیل می‌شوند. این تغییر در دسترسی به مدل‌ها، در کنار تحولاتی چون تبدیل توکن‌های هوش مصنوعی به ابزارهای مالی از طریق OpenRouter، در حال بازتعریف اقتصاد زیرساختی این صنعت است.

نقشه‌برداری از ژنوم انسان

Google DeepMind مسیر متفاوتی را انتخاب کرده و با پیش‌محاسبه داده‌های عظیم، هزینه‌های استنتاج در آینده را کاهش داده است. AlphaGenome Atlas یک کاتالوگ ۱ پتابایتی است که اثرات مولکولی را برای تقریباً ۹ میلیارد جایگزینی تک‌حرفی (تغییرات تک‌نوکلئوتیدی یا SNVs) در ژنوم انسان پیش‌بینی می‌کند. این منبع در حال حاضر برای دسترسی‌های وب و API دانشگاهی به‌صورت رایگان در دسترس است و دسترسی تجاری از طریق گوگل کلاود به‌زودی ارائه خواهد شد.

  • امتیاز اثرگذاری گونه (AVI): این سیستم از امتیاز AVI استفاده می‌کند تا به پژوهشگران کمک کند تغییراتی را که برای بررسی دقیق‌تر اولویت دارند، شناسایی کنند.
  • هوش یکپارچه: این ابزار داده‌های AlphaGenome و AlphaMissense را با یکدیگر ترکیب می‌کند.
  • دامنه گسترده: این سیستم اثرات را حتی در نواحی غیرکدکننده پروتئین شناسایی می‌کند و مانند یک شاخص پیش‌بینی‌کننده برای یک کد برنامه‌نویسی عمل می‌کند که هیچ مستنداتی ندارد.
  • زیرساخت علمی: دیپ‌مایند با تبدیل استنتاج پیش‌محاسبه شده به یک زیرساخت مشترک، به دانشمندان اجازه می‌دهد آزمایش‌های بهتری را برای اعتبارسنجی بیولوژیکی انتخاب کنند.

ردیاب توالی - شماره ۹۳۲: هفته گذشته در هوش مصنوعی: دیپ‌سیک وی۴.۱-فلش، اطلس آلفاژنوم، میوز متا و پیشرفت ریاضی پیشنهادی اوپن‌ای

عامل‌های شخصی و حاکمیت سازمانی

Meta عامل شخصی Muse را معرفی کرد که در یک ماشین مجازی امن اختصاصی (Muse Secure VM) اجرا می‌شود. این عامل که توسط Muse Spark قدرت گرفته، می‌تواند پس از بستن یک اپلیکیشن به کار خود ادامه دهد و از سرویس‌های متصل برای پیشبرد وظایف استفاده کند. این سرویس به‌صورت رایگان در ایالات متحده روی iOS، اندروید و وب‌سایت muse.ai در حال عرضه است و عینک‌های هوش مصنوعی نیز برای مراحل بعدی برنامه‌ریزی شده‌اند. برای تضمین ایمنی، متا یک عامل مجزا به نام Sentinel را توصیف کرده است که فعالیت‌های خروجی را نظارت می‌کند و همچنین برای اقدامات حساس، تایید کاربر را می‌طلبد.

هم‌زمان، بازار به نیاز برای نظارت بر عامل‌ها واکنش نشان می‌دهد. شرکت Cymphony با جذب ۳۰ میلیون دلار سرمایه (شامل ۲۵ میلیون دلار در سری A که توسط Sequoia Capital و SMBC Fin Atlas Beyond Fund رهبری شد) پلتفرمی برای حاکمیت (Governance) راه‌اندازی کرد. Cymphony نقشه‌ی این موضوع را ترسیم می‌کند که کارکنان و عامل‌های هوش مصنوعی چگونه به داده‌ها و سیستم‌های سازمانی دسترسی پیدا می‌کنند و بدین ترتیب مجوزهای پیچیده و تاریخچه اجرا را که برای صلاحیت روزمره ضروری است، مدیریت می‌کند.

اقتصاد جدید هوش مصنوعی

سرمایه‌ها به‌سرعت به سمت شرکت‌هایی می‌رود که می‌توانند این مدل‌ها را به ابزارهای تخصصی تبدیل کنند. Cognition اخیراً بیش از ۲ میلیارد دلار سرمایه با ارزش‌گذاری ۴۸ میلیارد دلار در سری E (به رهبری Andreessen Horowitz و Accel) جذب کرد. درآمد سالانه (run-rate) محصول Devin این شرکت از ۴۹۲ میلیون دلار در ماه مه به نزدیک ۹۰۰ میلیون دلار رسیده است.

Mistral نیز یک دور جذب سرمایه ۳ میلیارد یورویی در سری D با ارزش‌گذاری پس از سرمایه‌گذاری بیش از ۲۱ میلیارد یورو را به پایان رساند که توسط Samsung Electronics به همراه Scaleup Europe Fund و PSG Equity رهبری شد. Mistral این مورد را بزرگ‌ترین جذب سرمایه در تاریخ یک شرکت فناوری اروپایی توصیف می‌کند.

سایر تحولات و جذب سرمایه‌های قابل توجه عبارتند از:

  • Harvey: جذب ۵۵۰ میلیون دلار با ارزش‌گذاری ۱۵.۶ میلیارد دلار (به رهبری Lightspeed Venture Partners و Diffusion) برای ساخت مدل‌های اختصاصی هوش مصنوعی حقوقی.
  • XDOF: استارتاپ داده‌های عملیات از راه دور رباتیک (teleoperation) که در آستانه سری B با ارزش‌گذاری ۱.۲ میلیارد دلار به رهبری 8VC است و درآمدش به ۵۰ میلیون دلار نزدیک می‌شود.
  • UniPat AI: علی‌بابا قرار است سرمایه‌گذاری ۳۰۰ میلیون دلاری در این استارتاپ آموزش و بنچ‌مارک با ارزش‌گذاری ۲.۵ میلیارد دلار را رهبری کند و شرکت‌های Tencent و HSG نیز در آن مشارکت دارند.
  • Listen Labs: این شرکت یک پیشنهاد ۱۲۵ میلیون دلاری سری C با ارزش‌گذاری ۱.۵ میلیارد دلار را رد کرد، زیرا در حال مذاکره برای تصاحب ۲ میلیارد دلاری توسط Salesforce بود.
  • Mecka AI: در آستانه یک دور جذب سرمایه به رهبری Sequoia با ارزش‌گذاری ۵۰۰ میلیون دلار برای جمع‌آوری داده‌های حرکتی انسان از زاویه دید اول شخص (egocentric).

حتی ByteDance نیز وارد این میدان شده است. ژانگ ییمینگ، بنیان‌گذار این شرکت، شخصاً بر روی یک «مدل جهانی» (world model) ویدیوهای فضایی بلادرنگ مبتنی بر Seedance برای محیط‌های سه-بعدی تعاملی (پخش زنده، بازی‌ها و هدست‌های Pico) نظارت می‌کند. گزارش‌ها حاکی از انتشار احتمالی در اکتبر با رندرینگ ابری در نرخ ۲۰ فریم بر ثانیه و تأخیر حدود ۰.۰۵ ثانیه است.

مرزهای فنی در حافظه و یادگیری تقویتی

پژوهش‌های آکادمیک و آزمایشگاهی در حال مقابله با گلوگاه‌های مدل‌های با بافتار (Context) طولانی هستند. NVIDIA مکانیزم‌های جدید توجه حلقوی زیگزاگ بسته‌بندی شده و آگاه از شاخه (EAGLE-3, DFlash, DSpark) و انتقال مسیر جانبی TapChannel را در NeMo-RL ادغام کرد. این تغییرات گلوگاه‌های موازی‌سازی بافتار و خط لوله (pipeline) را برطرف کرده و سرعت یادگیری تقویتی (RL) را برای مدل‌های کلاس ۱۲۲ میلیارد پارامتری با بافتارهای ۲۵۶ هزار توکنی تا ۱.۸۸ برابر افزایش داده است.

در دانشگاه ییل، پژوهشگران شبکه‌های کالمن دلتا (KDNs) را توسعه دادند. این شبکه‌ها حافظه تداعی‌گر قانون دلتا را به عنوان یک مدل فضای حالت خطی-گوسی (SSM) مدل می‌کنند و هم حالت حافظه و هم عدم قطعیت را منتشر می‌کنند. KDNها در معیارهای Perplexity و بازیابی RULER در مقیاس‌های ۷۵۰ میلیون/۵۰ میلیارد و ۱.۳ میلیارد/۱۰۰ میلیارد روی داده‌های FineWeb-Edu، مدل‌های Mamba-3 و مدل‌های پایه gated delta را شکست دادند.

در همین حال، محققان USC و دانشگاه ایالتی آریزونا دریافتند که مدل‌ها «عدم پاسخ‌دهی ساختاری» (structural unanswerability) در ریاضی و کد را به‌صورت خطی رمزگذاری می‌کنند، به طوری که میانگین AUC پروب آن‌ها ۰.۹۳۹ است. آن‌ها کشف کردند که این «جهت شناسایی» تقریباً بر محورهای امتناع امنیتی (safety-refusal) عمود است (میانگین کسینوس ≈ ۰.۰۸۷). این بدان معناست که یک پاسخ اشتباه اما مطمئن، اغلب ناشی از شکست در مسیریابی (routing) است و نه کمبود دانش. هدایت این محور می‌تواند رفتار امتناع از پاسخ را بین ۳۳ تا ۵۲ درصد تغییر دهد.

مسیر رسیدن به نتایج قابل تأیید

در نهایت، صنعت با اخلاقیات سرعت دست‌وپنجه نرم می‌کند. داریو آمودی خواستار «تنظیم سرعت پیشرو» (pace the frontier) شده و پیشنهاد داد ارزیابان شخص ثالث مستقر مانند METR و محدودیت‌های نرخ (rate limits) در سطح صنعت میان آزمایشگاه‌های کشورهای دموکراتیک اعمال شود. شرکت Anthropic پیش از این به‌طور یک‌جانبه متعهد شده است که از ارزیابان مستقر استفاده کند.

این موج از به‌روزرسانی‌ها نشان می‌دهد که پیروز مرحله بعدی هوش مصنوعی، لزوماً صاحب بزرگ‌ترین مدل نیست، بلکه سیستمی است که بتواند عامل‌های خود را بهتر هماهنگ کند. چه این سیستم ۱۰ هزار عامل برای حل یک جایزه ریاضی باشد، چه یک اطلس ژنومی ۱ پتابایتی یا یک عامل واحد برای مدیریت تقویم، هدف اکنون «کار قابل تأیید» است. صنعت به سمت سیستم‌هایی حرکت می‌کند که بتوانند توکن‌ها را به نتایجی تبدیل کنند که واقعاً قابل بررسی باشند.

منتظر واکنش جامعه مستقل ریاضی به ادعای ناویر-استوکس OpenAI باشید، زیرا تأیید رسمی در Lean تنها اولین قدم به سوی پذیرش جهانی علمی است.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، معماری MoE مدل‌های Flash را برای کاهش هزینه استنتاج در پروژه‌های خود بررسی کنید.
  • برای پژوهشگران ریاضی، بررسی خروجی‌های Lean در مورد مسئله ناویر-استوکس برای تأیید ادعای OpenAI ضروری است.
  • مدیران سازمان‌ها باید برای استقرار عامل‌های خودمختار، ابزارهای حاکمیتی مشابه Cymphony را در نقشه راه خود قرار دهند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این تحول نشان می‌دهد که هوش مصنوعی از تولید متن به تولید «اثبات‌های علمی» تغییر مسیر داده است. با تکیه بر اعتبار ابزارهای تأیید رسمی مانند Lean، مرز بین حدس‌های مدل و حقایق ریاضی از بین می‌رود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی توسعه‌دهندگان ایرانی به مدل‌های پیشرفته OpenAI و ابزارهای حاکمیتی مانند Cymphony محدود است و بیشتر جنبه آموزشی برای پژوهشگران دارد.

·نگاه ما
تحریریه دات‌هوش

جایگزینی «اندازه مدل» با «هماهنگی عامل‌ها» به عنوان معیار پیشرفت، نشان می‌دهد که ما از عصر مدل‌های تک‌منظوره به عصر سازمان‌های دیجیتال کوچ می‌کنیم. نکته کلیدی این است که OpenAI دیگر به دنبال پاسخ مستقیم نیست، بلکه یک زیرساخت برای «جست‌وجوی سیستماتیک» ساخته است. این یعنی ارزش افزوده آینده در لایه ارکستراسیون (Orchestration) است، نه لزوماً در وزن‌های مدل.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.