پرش به محتوای اصلی
پرش به محتوای مقاله

Mixedbread: هزینه عامل‌های جستجو ۱۰ برابر کمتر از GPT-5.6 Sol

·۲۳ مرداد ۱۴۰۵۵ دقیقه مطالعه
لوگوی Toast 1: دستگاهی مدرن با طراحی مینیمال و بدنه‌ای سفید رنگ روی پیش‌زمینه‌ای گرادیانتی.
لوگوی Toast 1: دستگاهی مدرن با طراحی مینیمال و بدنه‌ای سفید رنگ روی پیش‌زمینه‌ای گرادیانتی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی یک عامل بازیابی تخصصی که برای نخستین بار توانسته است کیفیت مدل‌های پیشرو را در وظایف سازمانی حفظ کند، در حالی که هزینه و زمان استنتاج را به طور چشمگیری کاهش داده است.

اگر برای هر پرس‌وجوی پیچیده در اسناد سازمانی، هزینه‌های گزافی بابت توکن‌های مدل‌های پیشرو می‌پردازید، بازی تغییر کرده است. در ۱۴ اوت ۲۰۲۶، شرکت Mixedbread ابزاری به نام Toast 1 را عرضه کرد که هزینه عملیات جست‌وجو را تا ۱۰ برابر کاهش می‌دهد بدون آنکه کیفیت پاسخ‌ها فدا شود. این ابزار یک عامل بازیابی اختصاصی است که برای مدیریت فرآیند گران‌قیمت و پرنویز جمع‌آوری شواهد طراحی شده و در عین حال، عملکردی مشابه قدرتمندترین مدل‌های زبانی بزرگ (LLM) جهان دارد.

Introducing Toast 1

بسیاری از سازمان‌ها در حال حاضر برای هر دو مرحله‌ی جست‌وجو و استدلال از مدل‌های غولی مثل GPT-5.6 Sol یا Claude Opus 5 استفاده می‌کنند. این روش به‌شدت ناکارآمد است؛ زیرا این مدل‌های همه‌فن‌حریف، بخش بزرگی از توان محاسباتی و پنجرهٔ زمینه (Context Window) — که شبیه میز کاری است که جا برای چند ورق دارد، نه برای کل کتابخانه — را صرف فیلتر کردن اسناد می‌کنند. این وضعیت درست مثل این است که یک شریک ارشد در یک شرکت حقوقی را استخدام کنید تا ۶ ساعت در بایگانی‌ها بگردد، پیش از آنکه حتی شروع به نوشتن لایحه کند.

نیاز به تخصص‌گرایی

مدل‌های پیشرو اکنون قادر به انجام کارهای واقعی دانش‌محور، از جمله استدلال و تحلیل مجموعه‌های پیچیده از اسناد هستند. با این حال، آن‌ها گران‌ترین مدل‌ها در پشته‌ی هوش مصنوعی محسوب می‌شوند. از آنجایی که دسترسی به هوش مصنوعی به‌طور فزاینده‌ای به صورت اندازه‌گیری‌شده (Metered) درآمده است، نیاز به عامل‌های تخصصی که قابلیت‌های مدل‌های پیشرو را با کسری از هزینه ارائه دهند، رشد کرده است. این رویکرد در راستای تلاش‌های اخیر صنعت برای بهینه‌سازی هزینه‌هاست، مشابه آنچه Castform و Neon با استفاده از یادگیری تقویتی برای کاهش هزینه‌های جست‌وجو به دنبال آن بودند.

Toast 1 با تفکیک وظایف این مشکل را حل می‌کند. این ابزار می‌تواند به‌عنوان یک عامل (Agent) مستقل یا یکی از زیر-عامل‌هایی عمل کند که مدل پیشرو به آن‌ها تکیه می‌کند. طبق مستندات Mixedbread، این سیستم تمام چرخه جست‌وجو را بر عهده می‌گیرد: با دریافت یک پرس‌وجوی اولیه، آن را به زیر-پرس‌وجوها تجزیه می‌کند، شواهد را جمع‌آوری کرده، منابع را بررسی می‌کند و در نهایت زمینه‌ی مرتبط را پیش از بازگرداندن، گلچین می‌کند.

این سازوکار به مدل پیشرو اجازه می‌دهد فقط به‌عنوان یک استدلال‌گر سطح بالا عمل کند که تنها داده‌های مرتبط‌ترین را می‌بیند. با صرف پنجره زمینه و توان محاسباتی بر روی استدلال، اقدام و تولید پاسخ‌های نهایی، سیستم در وظایف واقعی به نتایج جامع بهتری دست می‌یابد. Mixedbread تأکید می‌کند که Toast 1 یک مرز جدید (Pareto frontier) در زمینه هزینه و سرعت برای هر وظیفه در گردش‌کارهای عامل‌محور ایجاد کرده است.

عملکرد و بنچمارک‌ها

بر اساس گزارش Mixedbread، نتایج در وظایف پیچیده سازمانی بسیار چشمگیر است:

  • تحلیل مالی: در محک Databricks OfficeQA Pro V2، که صحت پاسخ‌ها را در ۹۰ پرسش در موقعیت‌های مالی واقعی سازمانی ارزیابی می‌کند، مدل GPT-5.6 Sol هنگام استفاده از Toast 1 به‌عنوان یک زیر-عامل در محیط Codex، به صحت ۷۰٪ با هزینه تقریبی ۱.۱۵ دلار برای هر وظیفه رسید. این بالاترین امتیاز در میان سیستم‌های ارزیابی‌شده توسط Databricks است. در مقام مقایسه، بهترین عملکرد قبلی متعلق به Claude Fable 5 در Databricks Genie بود که به ۶۰٪ صحت با هزینه تقریبی ۴ دلار رسیده بود. جالب اینجاست که همین مدل GPT-5.6 Sol در محیط Codex بدون استفاده از Toast 1 تنها به ۳۳٪ صحت دست یافت.
  • دانش حقوقی: در محک Harvey LAB's Law Firm Knowledge، که دانش حقوقی سازمانی را در مقیاس بزرگ تست می‌کند، محیط اغلب پر از نویز است و موقعیت‌های مشابهی وجود دارد که تنها با جزئیات ساده‌ای با هم تفاوت دارند. در زیرمجموعه‌ای از ۳۳ وظیفه، کیفیت پاسخ‌های GPT-5.6 Sol صرف‌نظر از روش جست‌وجو ثابت ماند، اما کارایی به‌شدت تغییر کرد. جایگزینی جست‌وجوی سیستم فایل (Filesystem search) یک عامل معمولی با Mixedbread Search، مصرف توکن را از ۸۰.۶ میلیون به ۴۷ میلیون کاهش داد. با اضافه شدن Toast 1 به‌عنوان زیر-عامل اختصاصی جست‌وجو، این رقم باز هم کاهش یافت و به ۲۳ میلیون توکن رسید.
  • کارایی: این گردش‌کار حقوقی شاهد کاهش هزینه بیش از ۶۰٪ بود و در نیمی از مراحل (Turns) مورد نیاز یک عامل معمولی به پایان رسید. معرفی Toast 1 مجهز به Mixedbread Search، در حالی که کیفیت پاسخ‌ها را حفظ کرده بود، ۳.۵ برابر توکن کمتری مصرف کرد.

مشخصات فنی

Toast 1 به‌گونه‌ای طراحی شده است که مستقل از زیرساخت (Backend-agnostic) باشد، به این معنی که با هر ایندکس جست‌وجویی کار می‌کند، هرچند بهترین عملکرد را با Mixedbread Search دارد. این مدل بخشی از یک روند گسترده‌تر به سمت عامل‌های جست‌وجوی تخصصی است و در کنار مدل‌هایی مانند SID-1 و Context-1 شرکت Chroma قرار می‌گیرد. این تخصص‌گرایی در جست‌وجو یادآور موفقیت مدل Ontology 1 در ارتقای دقت جست‌وجوی محصولات است که توانست استانداردهای جست‌وجوی تجاری را جابه‌جا کند.

برای جست‌وجوی عمیق مستقل، Toast 1 به‌طور خاص برای این هدف آموزش دیده و از مدل‌هایی مانند Kimi K3 یا GLM-5.2 پیشی می‌گیرد. معیارهای عملکردی آن عبارتند از:

  • اجرای استاندارد: هزینه تقریبی ۰.۰۱۶ تا ۰.۰۲۳ دلار برای هر پرس‌وجو با تأخیر میانه ۸ ثانیه.
  • پیکربندی Fusion: با کیفیت‌ترین تنظیمات با هزینه تقریبی ۰.۰۵ تا ۰.۰۷ دلار برای هر پرس‌وجو و تأخیر میانه ۱۱ ثانیه.
  • سرعت مقایسه‌ای: در حالی که Toast 1 در حد چند ثانیه عمل می‌کند، عامل‌های بازیابی مدل‌های پیشرو در همان ارزیابی، بین ۲۰ ثانیه تا ۴ دقیقه زمان می‌بردند. در عمل، Toast 1 بین ۷ تا ۱۱ برابر ارزان‌تر از سیستم‌هایی با عملکرد مشابه بود.

چرخش اقتصادی

این عرضه نشان‌دهنده چرخش به سمت «طراحی مشترک» (Co-design) در پشته‌های هوش مصنوعی است. Toast 1 نماینده رویکردی است که در آن مدل، بدنه عامل (Agent harness) و primitives بازیابی به‌گونه‌ای طراحی شده‌اند که با هم کار کنند. به‌جای یک مدل غول‌پیکر که همه کار می‌کند، صنعت به سمت سلسله‌مراتبی از عامل‌های تخصصی می‌رود.

با سپردن «کارهای سخت و تکراری» (Grunt work) بازیابی به مدلی سبک مثل Toast 1، توسعه‌دهندگان می‌توانند صورت‌حساب API خود را بدون کاهش دقت، به‌شدت پایین بیاورند. برای کاربر نهایی، این به معنای عامل‌های هوش مصنوعی است که سریع‌تر (Snappier) به نظر می‌رسند و در حوزه‌های داده‌محور مانند حقوق و مالی قابل‌اعتمادتر هستند. دیگر گلوگاه، هوش مدل نیست، بلکه کارایی شواهدی است که به آن خورانده می‌شود.

ادغام و قیمت‌گذاری

توسعه‌دهندگان می‌توانند از طریق API شرکت Mixedbread یا ادغام OpenCode برای عامل‌های کدنویسی از این ابزار استفاده کنند. عامل‌های کدنویسی می‌توانند ادغام را با دستور npx skills add mixedbread-ai/skills انجام دهند.

قیمت‌گذاری در زمان عرضه به این صورت است:

  • ۰.۳۰ دلار برای هر میلیون توکن ورودی
  • ۰.۰۳۶ دلار برای هر میلیون توکن ورودی کش‌شده (نوشتن در کش رایگان است)
  • ۰.۷۲ دلار برای هر میلیون توکن خروجی

جست‌وجوی Mixedbread که توسط Toast 1 فراخوانی می‌شود، با نرخ ویژه‌ای قیمت‌گذاری شده است. کاربران جدید می‌توانند یک کلید API با ۵ دلار اعتبار رایگان برای تست سیستم دریافت کنند.

گام بعدی شما

  • اگر از مدل‌های پیشرو برای RAG استفاده می‌کنید، ساختار عامل خود را به مدل‌های تخصصی‌تر برای بازیابی تغییر دهید.
  • هزینه توکن‌های مصرفی در مرحله جست‌وجو را اندازه‌گیری کنید تا متوجه شوید چه مقدار از بودجه شما صرف «گشتن در بایگانی» می‌شود.
  • از اعتبار ۵ دلاری رایگان Mixedbread برای تست سرعت Toast 1 در داده‌های واقعی سازمانتان استفاده کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این رویکرد با کاهش ۱۰ برابری هزینه، استقرار عامل‌های هوش مصنوعی را در مقیاس واقعی سازمانی ممکن می‌کند. تخصص در لایه بازیابی، اعتماد به پاسخ‌های مدل را افزایش و تأخیر را به شدت کاهش می‌دهد.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به این سرویس دشوار است، اما معماری «عامل‌های تخصصی» الگویی ارزان‌تر برای پیاده‌سازی RAG با مدل‌های متن‌باز در ایران است.

·نگاه ما
تحریریه دات‌هوش

جایگزینی مدل‌های Generalist با سلسله‌مراتبی از عامل‌های تخصصی، پایان عصر «مدل واحد برای همه کارها» است. این رویکرد نشان می‌دهد که هوش مصنوعی در حال حرکت از مرحله‌ی «افزایش اندازه مدل» به مرحله‌ی «بهینه‌سازی جریان کار» است. در واقع، ارزش افزوده دیگر در خودِ مدل نیست، بلکه در نحوه توزیع وظایف بین مدل‌های سبک و سنگین نهفته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.