پرش به محتوای اصلی
پرش به محتوای مقاله

سامانه Schema دقت مدل‌های هوش مصنوعی در بنچمارک ARC-AGI-3 را به ۹۹٪ رساند

·۲۵ تیر ۱۴۰۵۲۰ دقیقه مطالعه
مدل‌های مرزی با تجهیزات ما به ~۹۹٪ در ARC-AGI-3 عمومی دست یافتند — شماتیک
مدل‌های مرزی با تجهیزات ما به ~۹۹٪ در ARC-AGI-3 عمومی دست یافتند — شماتیک
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی رویکردی که در آن مدل جهان به جای یک بردار معنایی، به صورت یک برنامه کدنویسی شده (`.py`) ذخیره می‌شود و قبل از هر اقدام در دنیای واقعی، در یک شبیه‌ساز داخلی تست می‌شود.

تصور کنید در محیطی هستید که هیچ قانون یا راهنمایی برایتان وجود ندارد و تنها راه یادگیری، برخورد با دیوارها و اشیاء است. اگر یک مدل زبانی بخواهد در چنین شرایطی عمل کند، معمولاً در هزاران تلاش بی‌ثمر غرق می‌شود، اما سامانه Schema بازی را تغییر داده است.

طبق گزارش منتشرشده در ۱۶ ژوئیه ۲۰۲۶، این چارچوب توانسته است مدل‌های پیشرو را به دقت ۹۸.۹۸٪ در مجموعه داده‌های عمومی ARC-AGI-3 برساند؛ عددی که تقریباً با کارایی عملیاتی انسان برابری می‌کند. این جهش با اجبار هوش مصنوعی به ساخت یک برنامه قابل راستی‌آزمایی و ویرایش از جهان — پیش از هرگونه اقدام — محقق شده است.

ARC-AGI-3 یکی از سخت‌ترین محک‌های استدلالی برای هوش مصنوعی است. این بنچمارک به عامل (Agent) یک محیط بازی می‌دهد بدون اینکه هیچ توضیحی درباره آنچه می‌بیند ارائه کند. در این محیط، هیچ لیستی از اشیاء، هیچ برگه قوانینی، هیچ هدف اعلام‌شده‌ای و هیچ پاداش شکل‌یافته‌ای (Shaped Reward) وجود ندارد. عامل در هر گام تنها یک شبکه ۶۴ در ۶۴ شامل ۱۶ شاخص رنگی و مجموعه‌ای از اقدامات مجاز را دریافت می‌کند.

برای موفقیت، عامل باید دقیقاً مانند یک فیزیکدان عمل کند: او باید فرضیاتی درباره این موضوع بسازد که شبکه چه چیزی را نمایش می‌دهد و اقدامات چگونه آن را تغییر می‌دهند، در حالی که مدل او از بازی هنوز موقتی و آزمایشی است. سپس باید با رسیدن مشاهدات جدید، هم مدل و هم برنامه خود را بازنگری کند.

همان‌طور که در تحلیل قبلی ما درباره‌ی نحوه ارکستراسیون مدل‌های تخصصی توسط Sakana AI برای رقابت با غول‌های پیشرو اشاره کردیم، Schema نشان می‌دهد که «هارنس» (Harness) یا همان فرآیندی که مدل را احاطه کرده، به اندازه وزن‌های خود مدل اهمیت دارد. به نقل از مستندات schema-harness.github.io، مدل‌هایی که در تنظیمات استاندارد شکست می‌خورند، وقتی مجبور شوند یک مدل جهان رسمی را حفظ کنند، به طرز شگفت‌آوری می‌درخشند.

سازوکار: تفکر به سبک فیزیکدانان

سامانه Schema با تقسیم مسئله به دو لایه انتزاعی مشترک، حلقه عامل‌محور را حل می‌کند. ایده مرکزی این است که نمایش نهان جهان (Latent World Representation) نباید یک بردار ریاضی باشد، بلکه باید یک «برنامه» باشد. این تغییر باعث می‌شود مدل جهان به صورت یک فایل متنی قابل تفسیر باشد (که می‌توان آن را خواند و تغییرات یا diff آن را بررسی کرد)، از طریق بازپخش (Replay) قابل راستی‌آزمایی باشد و چون برنامه‌ریزی درون یک شبیه‌ساز از نظر محاسباتی رایگان است، قابل جست‌وجو باشد.

  • لایه اول: مبنی‌سازی وضعیت (State Grounding). عامل پیکسل‌های خام را به اشیاء، متغیرها و روابط تبدیل می‌کند. او باید از دل پیکسل‌های خام ابداع کند که جهان چیست؛ مثلاً تصمیم بگیرد کدام پیکسل‌ها «بازیکن»، «دیوار» یا «شمارنده» محسوب می‌شوند. این بخش بر اساس مفاهیمی از VIGA ساخته شده است که برنامه‌های صحنه را از ورودی‌های بصری (که بسیار غنی‌تر از شبکه‌های ARC بودند) از طریق تحلیل-توسط-سنتز در برابر یک موتور گرافیکی استخراج می‌کرد.
  • لایه دوم: کشف مکانیزم (Mechanism Discovery). عامل کشف می‌کند که وضعیت جهان تحت تأثیر اقدامات خاص (مانند دیوارهای فنری، حلقه‌های سوخت‌گیری یا چرخاننده‌های رنگ) چگونه تغییر می‌کند و این قوانین را به صورت یک برنامه اجرایی (تابع step()) می‌نویسد. این فرآیند مشابه WorldCoder است، با این تفاوت که WorldCoder یک نمایش وضعیت پیش‌ساخته را فرض می‌کند و بر یادگیری برنامه‌های انتقال از روی مسیرها (Trajectories) تمرکز دارد.

برخلاف سیستم‌هایی که این دو لایه را جداگانه حل می‌کنند، Schema هر دو را در قالب یک برنامه واحد و قابل ویرایش کدگذاری می‌کند. اگر پیش‌بینی‌ای شکست بخورد، عامل می‌تواند یا قانون را اصلاح کند و یا خودِ نمایش وضعیت را تغییر دهد. این دقیقاً بازتاب روش کار فیزیکدانان است: وقتی پیش‌بینی‌ها به‌طور مداوم شکست می‌خورند، آن‌ها تنها قانون را تغییر نمی‌دهند، بلکه تعریف خود از «وضعیت» را بازنگری می‌کنند.

زمینه: رابطه‌داری و نسبیت

سازندگان Schema برای توضیح این فرآیند به پیدایش نسبیت خاص اشاره می‌کنند. وقتی آزمایش مییلسون-مورلی نتوانست محیطی (Medium) را که نور قرار بود در آن موج بزند شناسایی کند، لورنتس سعی کرد با وصله زدن قوانین و استفاده از فرضیات «انقباض» برای جذب نتیجه صفر، اتر (Aether) را حفظ کند. در مقابل، اینشتین جسارت به خرج داد و اتر را به عنوان بخشی از وضعیت حذف کرد و هم‌زمانی را نسبی (نسبت به چارچوب) دانست. نتیجه این تغییر در تعریف وضعیت، الکترودینامیک ساده‌تر و دقیق‌تری از اجسام متحرک بود.

در ARC-AGI-3 نیز عامل باید به همین ترتیب هر دو لایه را از صفر بسازد. شبکه نه اشیاء را شناسایی می‌کند و نه اهداف را؛ بنابراین عامل باید تصمیم بگیرد کدام الگوها با موجودیت‌هایی مانند بازیکن، دیوارها و شمارنده‌ها مطابقت دارند.

حتی گزاره هدف — که در Schema به صورت is_goal پیاده شده است — باید کاملاً از طریق تعامل استنباط شود. چون مبنی‌سازی وضعیت و کشف مکانیزم به صورت مشترک حل می‌شوند، نمایشی که در ابتدا معقول به نظر می‌رسد، اگر هیچ قانون انتقال سازگاری نتواند آزمایش‌های بعدی را توضیح دهد، متهم شده و جایگزین می‌شود.

حلقه کنترل و حافظه

برای حذف آزمون و خطاهای بیهوده، Schema از یک چرخه چهار مرحله‌ای بیرونی استفاده می‌کند که توسط حافظه‌ای پایدار شامل world_model.py (کد مدل)، notes.md (یادداشت‌ها) و یک Timeline (خط زمانی که فقط قابل افزودن است) پشتیبانی می‌شود:

۱. مشاهده: دریافت شبکه ۶۴ در ۶۴؛ هر شیء در شبکه توسط خود عامل ابداع و تعریف می‌شود.
۲. تامل: یک دوره استدلال باز که شامل یک حلقه داخلی است:

  • نظریه‌پردازی: ویرایش تئوری بازی به عنوان یک برنامه step(state, action) از طریق دستور write_code.
  • تأیید: اجرای run_backtest برای بازپخش تمام انتقال‌های ثبت شده جهت تطبیق دقیق. این کار باگ‌های دقیق مدل را شناسایی می‌کند.
  • برنامه‌ریزی: اجرای جست‌وجوی اول‌سطح (BFS) درون برنامه تأیید شده برای یافتن کوتاه‌ترین مسیر به هدف. این جست‌وجو هیچ هزینه واقعی در محیط بازی ندارد.
  • تعهد: استفاده از commit_actions به عنوان تنها کانال ارتباطی برای انجام اقدام.
    ۳. اجرا: اجرای صف دستورات متعهده با بررسی خودکار در هر گام. اگر پیش‌بینی‌ها با خطا مواجه شوند (مثلاً در اثر ۷۷ سلول اشتباه در اثر تغییر رنگ یک نشانگر به زرشکی در ردپای LS20)، برنامه فوراً لغو می‌شود.
    ۴. ثبت: افزودن هر انتقال واقعی به Timeline، تا عامل به حافظه کاری محدود یا پنجره‌های زمینه (Context Window) که به طور خودکار فشرده می‌شوند، وابسته نباشد.

تحلیل عملکرد و بنچمارک‌ها

معیار رسمی مورد استفاده، «کارایی نسبی اقدام انسانی» (RHAE) است. این معیار تعداد اقدامات استفاده شده توسط عامل را با یک خط مبنا (Baseline) انسانی (میانگین بالایی از اولین تجربه‌ی انسان) برای هر سطح تکمیل شده مقایسه می‌کند.

جزئیات محاسبه RHAE:

  • فرمول: امتیاز هر سطح برابر است با (اقدامات انسان ÷ اقدامات عامل)² که حداکثر آن ۱.۱۵ است.
  • وزن‌دهی: در هر بازی، سطوح از ۱ تا n وزن‌دهی می‌شوند، بنابراین سطوح انتهایی تأثیر بیشتری در امتیاز نهایی دارند.
  • سقف تکمیل: یک بازی نمی‌تواند امتیاز ۱۰۰٪ بگیرد مگر اینکه تمام سطوح آن پاکسازی شوند.
  • جریمه: به دلیل تربيعی بودن نسبت، هر اقدام اکتشافی اضافی امتیاز را به‌شدت کاهش می‌دهد. تکمیل سطح با کارایی یکی نیست؛ عاملی که ۶ سطح از ۷ را می‌گذرد اما ۲.۷ برابر بودجه انسانی هزینه کند، ممکن است امتیازی زیر ۱۴٪ کسب کند.

با استفاده از Claude Opus 4.8 و Fable 5، سامانه Schema به دقت ۹۸.۹۸٪ در مجموعه عمومی رسید. در حالی که با GPT-5.6 Sol این رقم ۹۵.۳۵٪ بود. این نتایج نشان‌دهنده قدرت بالای این مدل در کدنویسی عامل‌محور است، مشابه آنچه پیش‌تر در برتری OpenAI در زمینه کدنویسی عامل‌محور با مدل Sol مشاهده شد. این نتایج از یک قانون جایگزین (Fallback) ثابت استفاده کردند: ابتدا Opus 4.8 و Sol xhigh اجرا شدند؛ بازی‌هایی که امتیاز زیر ۸۰ گرفتند، مجدداً با Fable 5 و Sol max اجرا شدند.

برای مقایسه، عملکرد رسمی و تأیید شده برای Sol max در زمان عرضه در ماه مارس، تنها ۱۳.۳۳٪ در مجموعه عمومی و ۷.۷۸٪ در مجموعه نیمه‌خصوصی بود. در یک آزمون کنترل‌شده (Ablation)، استفاده از همان ترکیب Opus 4.8 و Fable 5 اما با یک هارنس معمولی (Claude Code)، منجر به امتیاز ۴۲.۸۳٪ شد. این نشان‌دهنده بهبود ۵۶.۱۵ درصدی است که صرفاً به دلیل هارنس Schema ایجاد شده و تفاوت را در فرآیند نشان می‌دهد، نه در توانایی ذاتی مدل.

مطالعات موردی در کارایی

در ۱۴ مورد از ۲۵ بازی عمومی، عامل توانست یک مدل جهان بسازد که تاریخچه را دقیقاً بازتولید کند. این امر باعث شد هوش مصنوعی ۱.۶ تا ۵ برابر کمتر از انسان اقدام کند، زیرا «هزینه کشف» یک مکانیزم را تنها یک بار پرداخت کرد.

شواهد مزیت برنامه‌محور:

  • سطح ۴ بازی M0R0: خط مبنای انسانی ۵۰۰ اقدام کرد، اما Schema تنها با ۴۲ اقدام پیروز شد. پس از تأیید مدل، عامل ۳۳۰۰ گره و ۸۹۱ وضعیت متمایز را از طریق BFS بررسی کرد تا یک برنامه ۱۹ مرحله‌ای بیابد و از آزمون و خطای واقعی اجتناب کند. عامل صراحتاً ذکر کرد که برای جلوگیری از حالت‌های شکست، ابتدا BFS را اجرا می‌کند.
  • مورد RE86: سامانه با Opus 4.8 توانست ۳۹۳ تطابق دقیق از ۳۹۴ گام را در کل تاریخچه (به جز یک ریست) در بازبینی ثبت کند. این ثبات پیش‌گویانه اجازه داد یک برنامه ۶۱ مرحله‌ای را در یک بار اجرا (One-shot) بدون هیچ پیش‌بینی اشتباهی به پایان برساند. این مقیاس — صدها فریم دقیق ۶۴ در ۶۴ — در بازی انسانی بدون کمک وجود ندارد.
  • مورد KA59: عامل با استفاده از Timeline یک قانون محتمل اما غلط را رد کرد. او با مقایسه دقیق دو توالی حرکتی گذشته، تشخیص داد که توالی‌های مختلف جهت، الگوی هزینه یکسانی (+1, +0, +1, +1, +0) تولید می‌کنند. این ثابت کرد قانون قبلی یک «دایره» (Epicycle) بوده و فرضیه را باطل کرد. این کار نیازمند یادآوری دقیق کل اجراهاست، چیزی که انسان‌ها معمولاً با درک کلی (Gestalt) جایگزین می‌کنند.

تفاوت Fable و Opus در هزینه کشف

مقایسه Fable 5 و Opus 4.8 در یک هارنس واحد نشان داد که انتخاب مدل بر «هزینه کشف» تأثیر می‌گذارد؛ یعنی عامل چگونه تصمیم می‌گیرد کدام آزمایش را برای تمایز بین فرضیات اجرا کند. Fable تمایل بیشتری دارد که پس از شکست، خودِ «نمایش جهان» را زیر سؤال ببرد، عدم قطعیت‌های کلیدی را شناسایی کند و تعاملاتی را انتخاب کند که فرضیات را از هم جدا کند.

تحلیل تطبیقی:

  • DC22 (پرتال): مدل Opus مدل دقیقی از حرکت و سه کلید ساخت اما یک انتقال را گم کرد و از طریق BFS به این نتیجه رسید که هدف در آن مدل غیرقابل دسترس است. اما Fable ابتدا فرضیه این را داد که مناطق رنگی جعبه‌های آیتم با کلید فاز هستند، آن را رد کرد و سپس فرضیه جابجایی محتوای سلولی در اندازه یکان را مطرح کرد. پس از یک Probe متمایزکننده، Fable کشف کرد پرتال کار می‌کند، کد خود را به جابجایی سلولی به‌روزرسانی کرد، ۱۷۵ تطابق دقیق به دست آورد و سطح را با مسیری ۲۴ مرحله‌ای پاک کرد.
  • LF52 (ارابه): هر دو یک ارابه روی ریل را دیدند. Opus بیش از ۱۰۰ نوبت صرف این پرسش کرد که آیا یک میخ می‌تواند از روی ارابه بپرد یا خیر؛ او «ارابه به عنوان قطعه میانی» را رد کرد اما «ارابه به عنوان سلول فرود» را تست نکرد. Fable ارابه را دقیقاً به مختصات اتصال راند، با این expectation که این گام نشان دهد ارابه و تخته چگونه ترکیب می‌شوند. Fable کشف کرد که تخته تغییر شکل می‌دهد و هسته ارابه به عنوان یک سلول اضافی قرار می‌گیرد، که اجازه داد ژنراتور پرش او فوراً انتقال را مدیریت کند.
  • SB26 (انتزاع DFS): هر دو مدل قانون جست‌وجوی اول‌عمق (DFS) را یافتند. Fable یک انتزاع کدنویسی شده و قابل استفاده مجدد (def traverse(box)) ایجاد کرد و آن را با متحرک شدن پرتال‌ها یا عمیق‌تر شدن توده‌ها تکامل داد. این کار هزینه سطوح بعدی را به ۱۵-۲۸ اقدام کاهش داد. Opus مدام فرضیه خود را به بلوک‌های رنگی یا ترتیب خواندن شبکه تغییر می‌داد. در سطح ۶، Opus حدود ۱۶ نوبت گیر کرد تا متوجه شود شکل تایل (Tile Shape) متغیر گم‌شده است، در حالی که بازنگری‌های ساختاریافته Fable، شمای علّی را حفظ کرده بود.

محدودیت‌ها و واقعیت‌های نهایی

باید توجه داشت که نمرات ۹۸.۹۸٪ و ۹۵.۳۵٪ خوداظهاری شده‌اند و هنوز توسط ARC Prize تأیید نشده‌اند. همچنین این نتایج فقط برای ۲۵ بازی عمومی صادق است.

تأییدیه و برون‌یابی:

  • عمومی در برابر نیمه‌خصوصی: Sol max در مجموعه عمومی ۱۳.۳۳٪ و در نیمه‌خصوصی ۷.۷۸٪ امتیاز گرفت. این ثابت می‌کند که موفقیت در مجموعه عمومی به طور خطی به مجموعه نیمه‌خصوصی منتقل نمی‌شود. اینکه امتیاز ۹۸.۹۸٪ عمومی در مجموعه نیمه‌خصوصی به چه عددی تبدیل می‌شود، نامعلوم است.
  • دفتر pairing: در نتایج حفظ شده Claude، ۱۴ بازی با Opus و ۱۱ بازی با Fable انجام شد که ۱۹ بازی امتیاز دقیق ۱۰۰ گرفتند. برای Sol، ۱۵ بازی با xhigh و ۱۰ بازی با max بود که ۲۰ بازی امتیاز ۱۰۰ گرفتند. ترکیب Claude در مجموع ۱.۰۲٪ با ۱۰۰ فاصله داشت (بقیه بازی‌ها بین ۸۹.۸۷ تا ۹۹.۱۰ بودند)، در حالی که ترکیب Sol میانگین ۱۰۰ داشت (پنج بازی بین ۶۰.۹۳ تا ۸۷.۸۰ بودند).

این تغییر در معماری عامل‌ها نشان می‌دهد که مرز بعدی، مدل‌های بزرگ‌تر نیست، بلکه «حلقه‌های داخلی» ساختاریافته‌تر است. این رویکرد یادآور نوآوری‌های اخیر در بهینه‌سازی مدل‌هاست، مانند به‌کارگیری مسیریاب‌های معنایی در vLLM برای شکستن رکوردهای بنچمارک‌های سخت که نشان می‌دهد مدیریت هوشمندانه جریان داده‌ها بر توان محاسباتی خام اولویت دارد. توانایی استخراج یک ساختار علّی از جهان از طریق چرخه اقدام و ادراک — یعنی کشف مکانیزم به عنوان یک قابلیت عمومی — پیش‌نیاز اصلی دستیابی به یک عامل (Agency) عمومی است.

منتظر تاییدیه رسمی ARC Prize باشید تا ببینید آیا هارنس Schema لبه رقابتی خود را در مجموعه‌های نیمه‌خصوصی نیز حفظ می‌کند یا خیر.

گام بعدی شما

  • اگر توسعه‌دهنده عامل‌های هوش مصنوعی هستید، به جای افزایش اندازه مدل، بر روی ساختارهای «شبیه‌ساز داخلی» (Internal Simulator) تمرکز کنید.
  • مستندات Schema را برای درک نحوه جداسازی State Grounding از Mechanism Discovery مطالعه کنید.
  • منتظر تأییدیه رسمی ARC Prize باشید تا ببینید آیا این روش در محیط‌های کاملاً ناشناخته نیز کار می‌کند یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار بنچمارک ARC، نشان می‌دهد که ساختار فرآیندی (Harness) می‌تواند تأثیری بیشتر از افزایش پارامترهای مدل داشته باشد. این تغییر رویکرد، مسیر توسعه عامل‌های خودمختار را از مدل‌های صرفاً پیش‌بینی‌کننده به سمت مدل‌های قانون‌گذار می‌برد.

تأثیر برای ایران

این خبر بیشتر برای پژوهشگران مدل‌های بنیادی و توسعه‌دهندگان عامل‌های هوشمند در ایران اهمیت دارد تا کاربران عادی، زیرا مسیر جدیدی برای افزایش کارایی مدل‌های موجود بدون نیاز به سخت‌افزار عظیم ارائه می‌دهد.

·نگاه ما
تحریریه دات‌هوش

قدرت واقعی Schema در این است که «استدلال» را از «حدس زدن» جدا می‌کند. با تبدیل جهان به کد، مدل از فضای احتمالی توکن‌ها خارج شده و وارد فضای قطعی برنامه‌نویسی می‌شود. این رویکرد ثابت می‌کند که برای رسیدن به AGI، ما به مدل‌هایی نیاز داریم که بتوانند به جای تخمین زدن، «قوانین بازی» را استخراج و کدنویسی کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.