پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Fast کوهیر چگونه تأخیر در عامل‌های هوش مصنوعی را کاهش می‌دهد؟

·۹ مهر ۱۴۰۵۶ دقیقه مطالعه
مقایسه مدل Embed 5 شرکت Cohere با Voyage 4 Large، Gemini Embedding 2 و OpenAI
مقایسه مدل Embed 5 شرکت Cohere با Voyage 4 Large، Gemini Embedding 2 و OpenAI
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مفهوم بازیابی نامتقارن که اجازه می‌دهد از یک مدل با کیفیت بالا برای فهرست‌بندی و مدلی سریع‌تر برای پرس‌وجو در یک فضای برداری مشترک استفاده شود، بدون نیاز به بازسازی کل ایندکس.

دقت بازیابی داده‌ها در هوش مصنوعی سازمانی با معرفی کوهیر امبد ۵ (Cohere Embed 5) در ۳۰ سپتامبر ۲۰۲۶ وارد مرحله‌ای جدید شد. این خانواده جدید از مدل‌ها به توسعه‌دهندگان اجازه می‌دهد تا مجموعه‌داده‌های عظیم را با بردارهای بسیار دقیق فهرست‌بندی کنند و سپس برای پرس‌وجو از مدل‌هایی با تأخیر کم استفاده کنند، بدون آنکه نیاز باشد کل بدنه داده‌های خود را دوباره فهرست‌بندی (Re-index) کنند.

این به‌روزرسانی در حالی رخ می‌دهد که سازمان‌ها از سیستم‌های ساده‌ی تولید بازیابی‌افزا (RAG) به سمت گردش‌کارهای پیچیده‌تر و عامل‌محور (Agentic) حرکت می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی اتوماسیون تحلیل احساسات با مدل‌های جمینای از طریق ابزارهایی مانند n8n اشاره کردیم، گلوگاه اصلی این عامل‌ها معمولاً تأخیر انباشته‌شده از ده‌ها جست‌وجوی متوالی است. این چالش با تلاش‌های گسترده‌تر در صنعت برای کاهش هزینه‌ها و زمان استنتاج در عامل‌های هوش مصنوعی هم‌سو است. کوهیر با جداسازی فرآیند فهرست‌بندی از مسیر پرس‌وجو، مستقیماً به این چالش پاسخ داده است.

دو سطح، یک فضای برداری

خانواده Embed 5 در دو نسخه‌ی متمایز Embed 5 Pro و Embed 5 Fast عرضه شده است. دستاورد معماری کلیدی و حیاتی این است که هر دو سطح از یک فضای بردار معنایی (Embedding Space) مشترک استفاده می‌کنند. این به معنای آن است که شما می‌توانید برای ایجاد فهرست (Index) خود از مدل Pro برای دستیابی به حداکثر کیفیت استفاده کنید و سپس برای پاسخ به پرس‌وجوهای زنده کاربران، مدل Fast را به کار بگیرید تا هزینه و تأخیر به حداقل برسد.

طبق مستندات فنی کوهیر، فهرستی که با مدل Pro ساخته شده و توسط مدل Fast پرس‌وجو می‌شود، ۹۸.۴٪ از کیفیت یک ساختار تمام‌-Pro (یعنی Pro-on-Pro) را حفظ می‌کند. این قابلیت به‌طور خاص برای بارهای کاری عامل‌محور طراحی شده است، جایی که سرعت پرس‌وجو محدودیت اصلی است. در مقابل، یک ساختار تمام-Fast نمره ۹۶.۶ را (زمانی که نسبت به معیار ۱۰۰ برای Pro-on-Pro نرمال‌سازی شد) کسب کرد. کوهیر برای تأیید این نتایج، تمامی جفت‌های بدنه و پرس‌وجو را در ۴۰ مجموعه داده توسعه آزمایش کرده است تا از صحت این اعداد اطمینان حاصل کند.

جزئیات استقرار و API

هر دو سطح مدل هم‌اکنون به‌صورت عمومی در دسترس هستند. توسعه‌دهندگان می‌توانند از طریق Cohere API، Model Vault، Microsoft Foundry و Amazon SageMaker به آن‌ها دسترسی داشته باشند. برای سازمان‌هایی که به زیرساخت خصوصی نیاز دارند، امکان سرویس‌دهی از طریق vLLM در محیط‌های VPC خصوصی یا محیط‌های درون‌سازمانی (On-premise) فراهم است.

جزئیات فنی پیاده‌سازی عبارت است از:

  • شناسه مدل‌ها: API از شناسه‌های embed-v5.0-pro و embed-v5.0-fast از طریق اندپوینت v2 Embed استفاده می‌کند.
  • ابعاد خروجی: هر دو مدل از ابعاد ۲۰۴۸، ۱۵۳۶، ۱۰۲۴، ۷۶۸، ۵۱۲ یا ۲۵۶ پشتیبانی می‌کنند. مقدار پیش‌فرض ۲۰۴۸ است.
  • فرمت‌های خروجی: بردارها به صورت float، int8 یا binary بازگردانده می‌شوند.
  • دسته‌بندی: API برای مدیریت جذب داده‌ها در مقیاس بزرگ، از عملیات Batch Embed پشتیبانی می‌کند.

عملکرد و محک‌ها

بر اساس گزارش‌های منتشر شده، Embed 5 Pro در محک ViDoRe V3 به میانگین ۸۵.۸ رسید که نشان‌دهنده ۸.۸ امتیاز رشد نسبت به Embed 4 است. این عدد مدل کوهیر را در جایگاه برتر نسبت به چندین پیشرو در صنعت قرار می‌دهد:

  • Embed 5 Pro: ۸۵.۸
  • Embed 5 Fast: ۸۴.۵
  • Voyage 4 Large: ۸۳.۷
  • Gemini Embedding 2: ۸۳.۲
  • OpenAI text-embedding-3-large: ۷۵.۵

کوهیر تسلط ویژه‌ای در بخش مالی نشان داده است. مدل Pro در محک‌های FinanceBench (۸۰.۱)، FinQA (۹۰.۰) و ViDoRe V3 Finance (۸۵.۰) رتبه اول را دارد و مدل Fast در هر سه مورد از این محک‌های مالی رتبه دوم را کسب کرده است.

با این حال، شرکت اشاره کرد که نتایج در عملکرد چندزبانه متغیر است. در حالی که Pro در میانگین زبان‌های اروپایی با نمره ۷۷ پیشتاز است، Gemini Embedding 2 در ۹ زبان از ۱۰ زبان دیگر، از جمله ژاپنی، عربی، هندی و تلوگو، عملکرد بهتری داشت. با این وجود، هر دو سطح Embed 5 در مجموع بیش از ۱۰۰ زبان را پوشش می‌دهند.

قابلیت‌های چندوجهی و زمینه

برخلاف بسیاری از مدل‌های برداری که فقط متنی هستند، هر دو سطح Embed 5 ورودی‌های متنی، تصویری و ترکیبی (متن + تصویر) را می‌پذیرند. این یعنی مدل می‌تواند تصویر یک صفحه را مستقیماً بردارسازی کند یا یک تصویر را با متادیتای آن در یک بردار واحد ادغام (Fuse) کند.

این قابلیت برای اسنادی که نویسه‌خوانی نوری (OCR) سنتی در آن‌ها شکست می‌خورد — مانند نمودارهای پیچیده، اسلایدهای ارائه و چارت‌ها — حیاتی است. با ادغام تصاویر و متادیتا، مدل اطلاعاتی را حفظ می‌کند که معمولاً در طول فرآیند استخراج متن از دست می‌روند.

مقایسه پنجره زمینه

این مدل‌ها از یک پنجره زمینه (Context Window) عظیم ۱۲۸ هزار توکنی (دقیقاً ۱۳۱,۰۷۲ توکن) پشتیبانی می‌کنند. این ویژگی باعث می‌شود هنگام پردازش دفترچه‌های راهنمای طولانی یا گزارش‌های مالی، نیاز به تکه‌بندی (Chunking) کمتری باشد. شکاف با رقبا در این بخش بسیار چشم‌گیر است:

  • Cohere Embed 5 (Pro/Fast): ۱۲۸,۰۰۰ توکن
  • Voyage 4 Large: ۳۲,۰۰۰ توکن
  • Gemini Embedding 2: ۸,۱۹۲ توکن
  • OpenAI text-embedding-3-large: ۸,۱۹۱ توکن

بهینه‌سازی ذخیره‌سازی با یادگیری ماتروشکا

برای حل مشکل هزینه‌های ذخیره‌سازی در مقیاس بالا، کوهیر از یادگیری نمایش ماتروشکا (Matryoshka representation learning) استفاده کرده است. این تکنیک به کاربران اجازه می‌دهد ابعاد بردار را بدون سقوط کامل کیفیت، کوتاه (Truncate) کنند.

برای یک بدنه ۱۰۰ میلیون تکه‌ای، نیاز به فضای ذخیره‌سازی بر اساس دقت و ابعاد انتخابی به شدت کاهش می‌یابد:

  • Float32 (۲۰۴۸ بُعد): ۸ کیلوبایت برای هر بردار (۸۱۹ گیگابایت کل)
  • Int8 (۱۰۲۴ بُعد): ۱ کیلوبایت برای هر بردار (۱۰۰ گیگابایت کل)
  • Binary (۲۵۶ بُعد): ۳۲ بایت برای هر بردار (۳.۲ گیگابایت کل)

کوهیر پیکربندی int8 با ۱۰۲۴ بُعد را به عنوان «نقطه بهینه» (Sweet Spot) برای حفظ کیفیتی نزدیک به دقت کامل در عین کاهش هزینه‌ها توصیه می‌کند. بردارهای باینری نیز برای جست‌وجوی اولیه (First-pass) پیش از مرحله نهایی بازرتبه‌بندی (Reranking) پیشنهاد می‌شوند.

قیمت‌گذاری و توان عملیاتی

قیمت‌ها بر اساس سرعت مدل تنظیم شده‌اند تا با مراحل مختلف خط لوله RAG سازگار باشند:

  • Embed 5 Pro: ۰.۱۲ دلار به ازای هر ۱ میلیون توکن متنی.
  • Embed 5 Fast: ۰.۰۸ دلار به ازای هر ۱ میلیون توکن متنی.
  • ورودی‌های تصویری: ۰.۴۰ دلار به ازای هر ۱ میلیون توکن برای هر دو سطح.

این کاهش هزینه با جهشی در سرعت همراه است. طبق اعلام کوهیر، مدل Fast در هر ثانیه ۳۷۷.۳ سند را پردازش می‌کند، در حالی که این عدد برای مدل Pro برابر با ۱۵۹.۷ سند است؛ این یعنی توان عملیاتی مدل Fast تقریباً ۲.۴ برابر بیشتر از سطح Pro است.

تحلیل فنی

برای جامعه یادگیری ماشین، مهم‌ترین تغییر در اینجا حرکت به سمت «بازیابی نامتقارن» (Asymmetric Retrieval) است. کوهیر با اثبات اینکه یک مدل کوچک‌تر و سریع‌تر می‌تواند با کمترین افت کیفیت از یک فهرست با دقت بالا پرس‌وجو کند، این فرض را به چالش می‌کشد که باید از یک مدل واحد برای هر دو طرف خط لوله RAG استفاده کرد. تنها شرط سخت برای این الگو این است که هر دو مدل فهرست‌بندی و پرس‌وجو باید از ابعاد خروجی یکسانی استفاده کنند.

البته یک نکته درباره بنچمارک‌ها وجود دارد. کوهیر از معیار جدیدی به نام RCP-nDCG@10 استفاده کرده که مجموعه‌ای ثابت از کاندیدها را بازرتبه‌بندی می‌کند. این یعنی این عدد بیشتر کیفیت بازرتبه‌بندی را می‌سنجد تا نرخ بازیابی (Recall) در مرحله اول. تا زمانی که بازتولید مستقل این اعداد صورت نگیرد — هرچند کوهیر کد ارزیابی را منتشر کرده است — صنعت باید این‌ها را به عنوان اعداد گزارش‌شده توسط سازنده ببیند.

توسعه‌دهندگان باید اکنون ارزیابی کنند که آیا هزینه‌های فعلی آن‌ها توسط فهرست‌بندی یا پرس‌وجو هدایت می‌شود. اگر دومی اولویت دارد، الگوی «فهرست Pro / پرس‌وجوی Fast» مسیری روشن برای کاهش تأخیر بدون قربانی کردن کیفیت مبنی‌سازی (Grounding) پایگاه دانش است.

منتظر بازتولید مستقل معیار RCP-nDCG@10 توسط جامعه باشیم تا ببینیم آیا برتری نسبت به Gemini و Voyage در محیط‌های واقعی و غیرسازنده‌ای نیز حفظ می‌شود یا خیر.

گام بعدی شما

  • اگر از مدل‌های OpenAI یا Gemini برای RAG استفاده می‌کنید، هزینه و تأخیر مدل Fast کوهیر را با ابعاد ۱۰۲۴-int8 تست کنید.
  • برای اسنادی که دارای نمودار و جدول هستند، قابلیت ادغام تصویر و متن Embed 5 را جایگزین OCRهای سنتی کنید.
  • در صورت استفاده از vLLM، مدل‌های جدید را در محیط VPC خود مستقر کنید تا حریم خصوصی داده‌های سازمانی حفظ شود.

اما تأثیر این مدل‌ها بر کاهش هزینه‌های زیرساختی در مقیاس پتا‌بایت حتی شگفت‌انگیزتر است — به تحلیل ما درباره بهینه‌سازی‌های حافظه در مدل‌های زبانی مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با کاهش ۲.۴ برابری تأخیر در پرس‌وجوها، موانع عملیاتی برای استقرار عامل‌های هوش مصنوعی در مقیاس سازمانی را برمی‌دارد. اعتبار این ادعا با انتشار کد ارزیابی و برتری در محک‌های تخصصی مالی تقویت شده است.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به سرویس‌های کوهیر دشوار است؛ اما امکان استقرار مدل‌ها از طریق vLLM در سرورهای داخلی، راهکاری برای سازمان‌های ایرانی است.

·نگاه ما
تحریریه دات‌هوش

معماری بازیابی نامتقارن کوهیر، پارادایم «یک مدل برای همه کارها» را در RAG می‌شکند. این رویکرد نشان می‌دهد که دقت در مرحله ذخیره‌سازی (Indexing) اهمیت بسیار بیشتری نسبت به دقت در مرحله پرس‌وجو (Query) دارد. در واقع، کوهیر استدلال می‌کند که می‌توانیم «هوش» را در مرحله آفلاین ذخیره کنیم و در مرحله آنلاین، با یک مدل سریع‌تر و ارزان‌تر، آن را استخراج کنیم.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.