پرش به محتوای اصلی
پرش به محتوای مقاله

مدل Mercury 2.5 هوش مصنوعی را ۴۰٪ ارتقا داد اما تأخیر را ثابت نگه داشت

·۱۸ شهریور ۱۴۰۵۴ دقیقه مطالعه۳ بازدید
لوگوی مروری ۲.۵ با عنوان «آغاز»، نمادی از شروع دوره جدیدی در توسعه هوش مصنوعی.
لوگوی مروری ۲.۵ با عنوان «آغاز»، نمادی از شروع دوره جدیدی در توسعه هوش مصنوعی.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

بزرگ‌ترین مدل زبانی مبتنی بر انتشار تا به امروز که توانسته است افزایش ۴۰ درصدی هوش را بدون افزایش تأخیر (Latency) در محیط تولید عملیاتی کند.

اگر برای اپلیکیشن‌های صوتی یا جست‌وجوی آنی کد می‌زنید، احتمالاً با «مالیات تأخیر» دست‌وپنجه نرم کرده‌اید؛ همان مکث آزاردهنده‌ای که کاربر هنگام دریافت پاسخ می‌شنود. شرکت Inception در ۸ سپتامبر ۲۰۲۶ با معرفی Mercury 2.5 ادعا کرد که توانسته است سطح هوش مدل را ۴۰٪ افزایش دهد، بدون آنکه سرعت پاسخ‌دهی فدا شود.

مرکوری ۲.۵ – آغاز: نسل جدیدی از هوش مصنوعی با قابلیت استدلال پیشرفته و چندوجهی

بسیاری از شرکت‌ها در حال حاضر بین کیفیت استدلال و سرعت پاسخ‌دهی گیر کرده‌اند. در حالی که مدل‌های زبانی بزرگ (LLM) — مثل کتابخانه‌داری که میلیاردها صفحه را خوانده و حالا با همان لحن کتاب‌ها جواب می‌دهد — معمولاً برای دقت بیشتر، سرعت را قربانی می‌کنند، Inception از یک مدل انتشار (Diffusion Model) استفاده کرده است تا هزینه‌ها را پایین نگه دارد و پاسخ‌ها را تقریباً آنی کند. این استراتژی باعث می‌شود Mercury 2.5 بتواند با مدل‌های بهینه‌شده‌ای مثل GPT-5.6 Luna (Low) و Claude Haiku 4.5 رقابت کند. این رقابت در حوزه مدل‌های سریع و بهینه، یادآور عملکرد جمینای ۳.۸ فلش است که اخیراً در بنچمارک‌های کدنویسی نتایج درخشانی به ثبت رساند.

لوگوی مروری ۲.۵ با عنوان «آغاز»، نمادی از شروع دوره جدیدی در هوش مصنوعی.

زمینه توسعه

به نقل از اعلامیه Inception، مدل Mercury 2.5 حاصل یک حلقه بازخورد از داده‌های واقعی مشتریان و موارد شکست در محیط عملیاتی است. همان‌طور که در تحلیل قبلی ما درباره‌ی بهینه‌سازی مدل‌های لبه اشاره کردیم، تمرکز بر داده‌های دنیای واقعی به‌جای بنچمارک‌های آزمایشگاهی، دقت مدل را در محیط تولید به‌شدت بالا می‌برد. از زمان عرضه نسخه دوم، تعداد توسعه‌دهندگان این مدل را چندین برابر افزایش داده‌اند. این رشد در جامعه توسعه‌دهندگان، مشابه پذیرش گسترده مدل‌های وزن‌باز گوگل است که اکوسیستم AI را به سمت شخصی‌سازی بیشتر سوق داده است.

شروتی کوپارکار، مدیر ارشد محصول در گروه محاسبات شتاب‌یافته NVIDIA، اشاره کرد که ترکیب هوش و سرعت پایدار در این مدل، نشان می‌دهد معماری‌های جدید با چه سرعتی روی پلتفرم انویدیا به بلوغ می‌رسند. طبق مستندات فنی، Mercury 2.5 بزرگ‌ترین مدل زبانی مبتنی بر انتشار است که تاکنون آموزش دیده است. این مدل روی GPUهای استاندارد انویدیا به توان عملیاتی ۱۱۰۷ توکن (Token) — تکه‌های کوچکی از متن، شبیه برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — در ثانیه می‌رسد و از پنجره زمینه (Context Window) ۲۶۰ هزار توکنی پشتیبانی می‌کند.

لوگوی مرحله جدید «Mercury 2.5 – Inception» با طراحی مینیمال و مدرن.

عملکرد در محیط عملیاتی

Inception برای اثبات کارایی مدل در دنیای واقعی، چندین محک ارائه داده است:

  • عامل‌های صوتی: شرکت OpenCall که عامل‌های تلفنی می‌سازد، گزارش داد که تأخیر پاسخ‌دهی در Mercury 2.5 به ۱۷۰ میلی‌ثانیه رسیده است. اولیور سیلورستاین، مدیرعامل این شرکت، تأیید کرد که زمان پاسخ‌دهی در بدترین حالت (P99) از چندین دقیقه به تنها یک ثانیه کاهش یافته است.
  • دستیارهای کدنویسی: شرکت Augment Code از این مدل برای فشرده‌سازی زمینه و جست‌وجوی ابزارها استفاده می‌کند. طبق گزارش آن‌ها، انتقال این فرآیندها به Mercury تأخیر را ۸۲٪ (از ۱۵۰ ثانیه به ۲۷ ثانیه) و هزینه‌ها را ۹۰٪ کاهش داد.
  • زیرساخت جست‌وجو: این مدل می‌تواند خط لوله‌های پیچیده تولید بازیابی‌افزا (RAG) — مثل دانش‌آموزی که قبل از جواب دادن، اول کتاب درسی را باز می‌کند و از آن نقل می‌آورد — را با چنان سرعتی اجرا کند که تمام مراحل برنامه‌ریزی، بازنویسی پرس‌وجو و چک کردن پاسخ‌ها در یک تعامل کاربر جای بگیرد.

قابلیت‌های فنی

علاوه بر سرعت، Mercury 2.5 ویژگی‌های جدیدی را برای توسعه‌دهندگان آورده است:

  • استدلال قابل تنظیم: امکان تغییر عمق منطق مدل توسط برنامه‌نویس.
  • فراخوانی موازی ابزارها: اجرای هم‌زمان چندین ابزار توسط مدل.
  • JSON منطبق با طرح: تضمین اینکه خروجی دقیقاً از ساختارهای داده‌ای تعریف‌شده پیروی کند.

قیمت‌گذاری و دسترسی

قیمت استاندارد این مدل ۰.۲۰ دلار برای هر میلیون توکن ورودی و ۰.۷۵ دلار برای هر میلیون توکن خروجی است. با این حال، Inception در زمان عرضه تخفیف ۸۰ درصدی ارائه داده که هزینه را به ۰.۰۴ دلار برای ورودی و ۰.۱۵ دلار برای خروجی می‌رساند. این مدل از طریق API شرکت Inception، Baseten و OpenRouter در دسترس است. در حالی که Mercury همچنان از مدل توکن‌محور پیروی می‌کند، برخی شرکت‌ها مانند Oxlo.ai تلاش کرده‌اند هزینه استنتاج را از تعداد توکن‌ها جدا کنند تا مدل‌های اقتصادی‌تری ارائه دهند.

لوگوی نسخه ۲.۵ Mercury با عنوان Inception

این عرضه نشان‌دهنده تغییری در نحوه ساخت گردش‌های کاری عامل‌محور (Agentic) است. شرکت‌ها می‌توانند کارهای پشتیبانی مثل مسیریابی و جست‌وجوی ابزار را به یک مدل انتشار سریع بسپارند و مدل‌های گران‌قیمت‌تر را فقط برای استدلال‌های بسیار پیچیده رزرو کنند. این رویکرد ترکیبی، هزینه کل مالکیت عامل‌های هوش مصنوعی را به‌شدت کاهش می‌دهد.

لوگوی مروری ۲.۵: آغاز یک تحول در هوش مصنوعی

برای کسانی که اپلیکیشن‌های صوت‌محور می‌سازند، پیش‌نمایش Mercury Voice با زمان تا نخستین توکن (TTFT) زیر ۱۷۰ میلی‌ثانیه بسیار حیاتی است. همچنین Mercury Router اکنون می‌تواند پرامپت‌ها را بر اساس ترکیبی از کیفیت و هزینه، به‌طور خودکار به بهترین مدل باز یا بسته هدایت کند.

Inception آموزش مدل بعدی و بزرگ‌تر خود را آغاز کرده تا مرزهای کارایی مدل‌های انتشار را در ماه‌های آینده جابه‌جا کند.

گام بعدی شما

  • اگر از مدل‌های گران‌قیمت برای کارهای ساده‌ای مثل مسیریابی (Routing) استفاده می‌کنید، مدل Mercury 2.5 را برای کاهش هزینه و تأخیر تست کنید.
  • برای اپلیکیشن‌های صوتی، روی کاهش TTFT تمرکز کنید و قابلیت‌های Mercury Voice را بررسی نمایید.
  • ساختار خروجی‌های خود را با Schema-aligned JSON هماهنگ کنید تا خطاهای تجزیه داده در اپلیکیشن کاهش یابد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل با تکیه بر اعتبار معماری Diffusion، سد تأخیر در سیستم‌های بلادرنگ را می‌شکند. نتیجه این است که تجربه کاربر در دستیارهای صوتی از حالت «گفتگو با ماشین» به «مکالمه انسانی» نزدیک‌تر می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های API و تحریم‌ها، دسترسی مستقیم توسعه‌دهندگان ایرانی به Inception دشوار است؛ اما استفاده از واسطه‌هایی مثل OpenRouter مسیر ادغام این مدل در محصولات داخلی را هموار می‌کند.

·نگاه ما
تحریریه دات‌هوش

استفاده از معماری انتشار برای مدل‌های زبانی، پارادایم استنتاج را از تولید توکن‌به‌توکن به سمت بهینه‌سازی کلی خروجی می‌برد. این رویکرد نشان می‌دهد که آینده عامل‌های هوش مصنوعی نه در مدل‌های تک‌سایز، بلکه در لایه‌های سلسله‌مراتبی است که در آن مدل‌های سریع، نقش «فیلتر و مسیریاب» برای مدل‌های استدلالی سنگین را ایفا می‌کنند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.