پرش به محتوای اصلی
پرش به محتوای مقاله

عامل‌های جست‌وجوی Iris در محک‌های استدلال وب از رقبای وزن‌باز پیشی گرفتند

·۲۲ شهریور ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
Iris-mini و Iris-pro قدرتمندترین عامل‌های جستجوی متن‌باز در کلاس خود هستند.
Iris-mini و Iris-pro قدرتمندترین عامل‌های جستجوی متن‌باز در کلاس خود هستند.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی خط لوله آموزشی «SFT-RL صعودی» و مهندسی معکوس سؤالات از ساختار لینک‌های وب برای اجبار مدل به استدلال زنجیره‌ای به‌جای بازیابی ساده.

اگر تصور می‌کنید عامل‌های هوش مصنوعی صرفاً موتورهای جست‌وجوی سریع‌تر هستند، نتایج جدید آزمایشگاه AllSpark این باور را به چالش می‌کشد. این مدل‌ها ثابت کردند که جست‌وجوی وب می‌تواند از یک ابزار بازیابی ساده به یک مهارت استدلالی بنیادی تبدیل شود. این رویکرد تفاوت‌های بنیادینی با روش‌های سنتی دارد، همان‌طور که در مقایسه‌ی عامل‌های هوش مصنوعی با موتورهای جست‌وجوی سنتی در پردازش الگوها مشاهده شد.

به نقل از مستندات منتشر شده در ۱۳ سپتامبر ۲۰۲۶، مدل‌های Iris-mini و Iris-pro در حال حاضر پیشتاز کلاس‌های وزنی خود در محک‌های استدلال پیچیده وب هستند. این دستاورد نشان می‌دهد که آموزش تخصصی برای جست‌وجو می‌تواند منجر به بهبود توانایی‌های استدلالی کلی در وظایف اداری نامرتبط شود.

بسیاری از عامل‌های فعلی بر بازیابی ساده متکی هستند، اما AllSpark استدلال می‌کند که یک «عامل» واقعی باید بتواند سرنخ‌های غیرمستقیم متعدد را به هم زنجیر کند. این تغییر، هدف را از «یافتن یک سند» به «حل یک معما» با استفاده از وب به‌عنوان یک پایگاه‌داده تغییر می‌دهد. برای متخصصان فنی، این یک حرکت به سمت تفکر سیستم ۲ (System 2 thinking) برای عامل‌های وب خودمختار است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، دسترسی به وزن‌ها برای بازبینی سازوکارهای استدلال حیاتی است.

معماری فنی و آموزش

مدل Iris-mini با ۳۵ میلیارد پارامتر و Iris-pro با ۳۹۷ میلیارد پارامتر، بر پایه سری Qwen (به‌طور مشخص نسخه‌های Qwen3.6-35B-A3B و Qwen3.5-397B-A17B) ساخته شده‌اند. هر دو مدل دارای پنجرهٔ زمینه (Context Window) ۲۵۶,۰۰۰ توکنی هستند. تیم توسعه از یک فرآیند منحصر‌به‌فرد به نام «صعود SFT-RL» استفاده کرده است که در آن تنظیم نظارت‌شده (SFT) و یادگیری تقویتی (RL) به‌صورت متناوب روی جست‌وجوی زنده وب اجرا می‌شوند. در این چرخه، کارآمدترین مسیرهای حل مسئله و سخت‌ترین وظایفی که در هر دور حل شده‌اند، به عنوان ورودی به چرخه آموزشی بعدی بازمی‌گردند.

برای جلوگیری از اتکای مدل به تطبیق ساده کلمات کلیدی، AllSpark سؤالات آموزشی را از ساختار لینک‌های وب مهندسی معکوس کرد. این خط لوله ابتدا گرافی از اصطلاحات و روابط را از یک صفحه بذر و لینک‌های خروجی آن می‌سازد. سپس سؤالاتی چندمرحله‌ای تولید می‌کند که نیازمند زنجیره کردن گام‌های متصل است. در این مسیر، هر اصطلاح میانی با یک عبارت جایگزین (Paraphrase) عوض می‌شود تا هیچ سرنخی از طریق جست‌وجوی متنی ساده قابل حل نباشد. این سازوکار مدل را مجبور می‌کند تا به جای انجام یک جست‌وجوی متنی مستقیم، از طریق زنجیره شواهد استدلال کند.

فیلتر داده‌ها و اعتبارسنجی

طبق گزارش AllSpark، برای تضمین کیفیت آموزش، یک فرآیند فیلترینگ دو مرحله‌ای سخت‌گیرانه اجرا شده است:

  • تولید توسط معلم: یک مدل قدرتمند (Teacher Model)، مسیرهای حل مسئله شامل استدلال‌ها، پرس‌وجوهای جست‌وجو و نتایج به‌دست‌آمده را تولید می‌کند.
  • فیلتر اول: کل مسیر از نظر صحت پاسخ، عمق جست‌وجو و وجود حلقه‌های تکراری بررسی می‌شود.
  • فیلتر دوم: یک مدل داور، بازبینی گام‌به‌گام را بر اساس معیارهای استخراج‌شده از خودِ داده‌ها (و نه قوانین دستی از پیش تعیین شده) انجام می‌دهد.

تنها سؤالاتی وارد مجموعه آموزشی می‌شوند که یک مدل مرجع بدون دسترسی به ابزارها قادر به حل آن‌ها نیست، اما با دسترسی به منابع درست می‌تواند پاسخ دهد. برای حفظ استقلال از سرویس‌های خارجی، مدل داور و سیستم‌های خلاصه‌ساز نتایج، درون خوشه (Cluster) آموزشی و توسط مدل بزرگ Qwen خود تیم اجرا می‌شوند.

ایریس‌مینی و ایریس‌پرو قدرتمندترین عامل‌های جستجوی متن‌باز در کلاس خود هستند.

عملکرد در محک‌ها

بر اساس مقاله AllSpark، این مدل‌ها در چهار محک اصلی مورد آزمایش قرار گرفتند. امتیازات Iris حاصل عملکرد یک تک‌عامل بدون کمک گرفتن از عامل‌های کمکی یا گام‌های اعتبارسنجی اضافی است:

  • BrowseComp: یافتن حقایق نادر از سرنخ‌های غیرمستقیم. Iris-mini امتیاز ۸۲.۲ و Iris-pro امتیاز ۸۸.۶ را کسب کردند.
  • BrowseComp-ZH: نسخه چینی محک فوق. Iris-mini امتیاز ۸۴.۸ و Iris-pro امتیاز ۸۵.۱ را گرفتند.
  • DeepSearchQA: ارزیابی کامل بودن شواهد. Iris-mini امتیاز ۸۶.۹ و Iris-pro امتیاز ۹۲.۹ را ثبت کردند.
  • Humanity's Last Exam: سؤالات آکادمیک سطح خبره. Iris-mini امتیاز ۵۲.۳ و Iris-pro امتیاز ۵۶.۴ را کسب کردند.

در کلاس مدل‌های کوچک‌تر، Iris-mini در سه محک از چهار محک پیشتاز است و در BrowseComp با ۳.۴ امتیاز از رقیب بعدی یعنی XYZ-Aquila-mini جلو زده است، هرچند در DeepSearchQA عقب‌تر است. Iris-pro نیز در کلاس مدل‌های بزرگ، در اکثر موارد پیشتاز است یا با سیستم‌هایی که محاسبات (Compute) بسیار بیشتری می‌طلبند، برابری می‌کند. این نتایج در کنار بررسی سرویس‌های پیشرو در ارزیابی کیفیت و کارایی جست‌وجوی هوش مصنوعی، استانداردهای جدیدی را برای سنجش دقت مدل‌های جست‌وجو تعریف می‌کند.

شکاف مدیریت زمینه

AllSpark به یک نقطه کور صنعتی اشاره می‌کند: مدیریت زمینه در زمان اجرا (Runtime Context Management). آن‌ها استدلال می‌کنند که استراتژی‌های مدیریت، تأثیری بیشتر از تفاوت‌های ذاتی سیستم‌ها دارند. برای جداسازی این اثر، تیم محک‌ها را با و بدون مدیریت زمینه آزمایش کرد، در حالی که ابزارها، محدودیت‌های زمینه و مدل داور را ثابت نگه داشت.

یافته‌ها نشان داد که عملکرد Iris-mini در BrowseComp هنگام استفاده از استراتژی‌های «حذف تاریخچه»، تا ۲۱.۲ امتیاز جهش می‌کند. این موضوع به دلیل بودجه توکن نیست، بلکه به دلیل مصرف سریع‌تر است؛ Iris-mini برای وظایف مشابه به گام‌های بیشتری نیاز دارد و زودتر به سقف پنجره زمینه می‌رسد. در محک Humanity's Last Exam، این بهبود کمتر بود زیرا آن آزمون بیشتر بر دانش دامنه و استدلال آکادمیک متکی است تا جست‌وجوی وب.

برای حل این مشکل، مکانیزم «تلاش دوم» پیاده شد. اگر جست‌وجوی اول شکست بخورد، سیستم تلاش ناموفق را در یک یادداشت کوتاه از منابع ردشده خلاصه کرده و به اجرای بعدی اضافه می‌کند تا از تکرار جست‌وجوهای قبلی جلوگیری شود.

ایریس‌مینی و ایریس‌پرو قدرتمندترین عامل‌های جستجوی متن‌باز در کلاس خود هستند.

تحلیل: جست‌وجو به‌عنوان یک مهارت بنیادی

این انتشار، این فرض را که عامل‌های جست‌وجو متخصصانی محدود هستند، به چالش می‌کشد. AllSpark گزارش می‌دهد که مدل‌های Iris در استفاده کلی از ابزارها و کارهای اداری بهبود یافته‌اند، در حالی که هرگز برای این وظایف آموزش ندیده‌اند. این نشان می‌دهد توانایی مدیریت اطلاعات ناقص — که هسته جست‌وجوی وب است — در واقع یک مهارت استدلالی بنیادی است که به سایر گردش‌کارهای عامل‌محور منتقل می‌شود.

علاوه بر این، کشف خطاهای «داده مرجع» (Ground Truth) در محک‌ها، نیاز به ارزیابی‌های بهتر را نشان می‌دهد. در یک مورد از BrowseComp-ZH درباره «بازی تاج و تخت»، عامل به‌درستی پاسخ «بولتون» را داد (اشاره به دومین ازدواج سانسا استارک با رمزی بولتون)، اما چون داده مرجع «لنیستر» را ثبت کرده بود، پاسخ مدل غلط علامت زده شد.

AllSpark وزن‌های مدل را در Hugging Face و کدها را در GitHub منتشر کرده است. این مجموعه شامل Iris Harness برای نقاط انتهایی سازگار با OpenAI است که حلقه عامل، ابزارها، استراتژی‌های مدیریت زمینه و هر چهار محک را در بر می‌گیرد. تیم توسعه قصد دارد خط لوله‌های ساخت داده و آموزش را در آینده منتشر کند.

گام بعدی شما

  • اگر توسعه‌دهنده عامل هستید، Iris Harness را از گیت‌هاب دریافت کنید تا استراتژی‌های مدیریت زمینه (Context Management) را روی مدل‌های خود تست کنید.
  • در پیاده‌سازی‌های خود، مکانیزم «خلاصه شکست‌ها» را برای جلوگیری از تکرار جست‌وجوهای ناموفق جایگزین پاک‌سازی کامل تاریخچه کنید.

اما تأثیر این مدل‌ها بر کاهش هزینه‌های استنتاج در مقیاس سازمانی موضوع دیگری است — به تحلیل ما درباره بهینه‌سازی‌های جدید در مدل‌های Qwen مراجعه کنید، یا برای درک بهتر اقتصاد این سیستم‌ها، گزارش Mixedbread درباره کاهش ۱۰ برابری هزینه عامل‌های جست‌وجو را مطالعه کنید.

چرا این موضوع مهم است؟

این دستاورد با تکیه بر اعتبار معماری Qwen، ثابت می‌کند که مهارت جست‌وجوی پیشرفته یک قابلیت جانبی نیست، بلکه پیش‌نیاز استدلال در دنیای واقعی است. این موضوع باعث می‌شود توسعه‌دهندگان به‌جای افزایش حجم داده، بر طراحی مسیرهای استدلالی پیچیده تمرکز کنند.

تأثیر برای ایران

به‌دلیل وزن‌باز بودن مدل‌ها در Hugging Face، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به APIهای پولی، پیشرفته‌ترین عامل‌های جست‌وجوی فعلی را به‌صورت محلی (On-premises) مستقر و شخصی‌سازی کنند.

·نگاه ما
تحریریه دات‌هوش

تمرکز AllSpark بر آموزش «معکوس» نشان می‌دهد که برای رسیدن به استدلال واقعی، باید مدل را در موقعیتی قرار داد که بازیابی ساده متن پاسخگو نباشد. این رویکرد، پارادایم آموزش عامل‌ها را از «تولید داده‌های پاسخ» به «طراحی چالش‌های استدلالی» تغییر می‌دهد. احتمالاً در آینده، محک‌های استانداردی جایگزین شوند که به‌جای تطبیق متنی، زنجیره شواهد را بسنجند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.