پرش به محتوای اصلی
پرش به محتوای مقاله

SearchSwarm-30B: دستیابی به امتیاز ۷۳.۳ در BrowseComp-ZH با هوش تفویض‌محور

·۱۹ خرداد ۱۴۰۵۲ دقیقه مطالعه
SearchSwarm-30B: دستیابی به امتیاز ۷۳.۳ در BrowseComp-ZH با هوش تفویض‌محور
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تغییر بنیادین در اینجا، انتقال منطق تفویض وظایف از دستورات متنی (Prompts) به وزن‌های مدل است؛ یعنی مدل دیگر تنها با دستورالعمل راهنمایی نمی‌شود، بلکه «دانش تفویض» را بخشی از معماری داخلی خود کرده است.

باید بدانید که عامل‌های هوش مصنوعی فعلی در مواجهه با پژوهش‌های عمیق و طولانی، به دلیل محدودیت حافظه دچار فروپاشی می‌شوند. اما مدل SearchSwarm-30B با تغییر بازی در سطح وزن‌ها، این بن‌بست را می‌شکند.

همان‌طور که در تحلیل قبلی ما درباره‌ی TheoremBench اشاره کردیم، مدل‌های زبانی در تجزیه براهین پیچیده ریاضی به دلیل سوگیری‌های ساختاری شکست می‌خورند. تا امروز، مدیریت این تجزیه تنها به مهندسی پرامپت (Prompt Engineering) متکی بود که در مقیاس واقعی بسیار شکننده است و باعث اشغال سریع حافظه مدل می‌شود.

به نقل از تحلیل فنی منتشر شده در ۹ ژوئن ۲۰۲۶ در arxiv.org، پژوهشگران با طراحی یک چارچوب هدایت‌کننده، مجموعه‌ای از تصمیمات تفویض صحیح را برای تنظیم دقیق (Fine-tuning) مدل تولید کردند. نتیجه این فرآیند، مدل SearchSwarm-30B-A3B است که در بنچمارک‌های زیر نتایج قابل توجهی ثبت کرد:

  • امتیاز BrowseComp: ۶۸.۱
  • امتیاز BrowseComp-ZH: ۷۳.۳
  • سازوکار: عامل‌های فرعی وظایف را اجرا کرده و تنها نتایج خلاصه‌شده را بازمی‌گردانند تا بودجه‌ی پنجره متنی (Context Window) عامل اصلی حفظ شود.

این رویکرد، پارادایم عامل‌محور را از «ارکستراسیون مبتنی بر پرامپت» به «هوش درونی‌شده در وزن‌ها» تغییر می‌دهد. بر اساس مستندات این پژوهش، با تثبیت منطق تفویض در وزن‌های مدل، ریسک سرریز حافظه در وظایف بلندمدت به حداقل می‌رسد. برای جامعه فنی، این نتایج ثابت می‌کند که SFT (Supervised Fine-tuning) متمرکز بر فرآیند تفویض، به اندازه آموزش برای کسب دانش خام حیاتی است.

گام بعدی شما

  • منتظر انتشار وزن‌های مدل و چارچوب آموزشی (Harness) آن باشید تا قابلیت انتقال این منطق تفویض به محیط‌های غیرمرورگر را بسنجید.
  • عملکرد مدل‌های ۳۰ میلیارد پارامتری را در مدیریت حافظه با مدل‌های بزرگ‌تر مقایسه کنید تا بهره‌وری هزینه استنتاج را ارزیابی کنید.

اما سوال اصلی این است که آیا این مدل می‌تواند در محیط‌های کدنویسی پیچیده نیز چنین تفویض دقیقی داشته باشد؟ تحلیل ما درباره‌ی عامل‌های کدنویسی را دنبال کنید.

چرا این موضوع مهم است؟

این پیشرفت با تکیه بر متدولوژی‌های تایید شده در منابع علمی، ثابت می‌کند که می‌توان محدودیت‌های سخت‌افزاری پنجره متنی را با بهینه‌سازی نرم‌افزاری در سطح وزن‌ها دور زد. این موضوع اعتبار رویکرد آموزش فرآیند-محور را در مقابل آموزش داده-محور افزایش می‌دهد.

تأثیر برای ایران

به دلیل **وزن‌های باز** بودن مدل، پژوهشگران و توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای محدود و هزینه‌بر، این معماری تفویض‌محور را روی سرورهای داخلی خود پیاده‌سازی و بهینه‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تحلیل ما نشان می‌دهد که SearchSwarm-30B صرفاً یک مدل با حافظه بیشتر نیست، بلکه در واقع «مهارت مدیریت» را در سطح ریاضیاتی وزن‌ها یاد گرفته است. این جابجایی از لایه‌ی پرامپت به لایه‌ی وزن‌ها، گامی حیاتی برای رسیدن به عامل‌های خودمختاری است که بدون دخالت انسان، پروژه‌های چندروزه را مدیریت می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.