پرش به محتوای اصلی
پرش به محتوای مقاله

پلتفرم Pipette شکاف ۴۵ درصدی عملکرد مدل‌های محلی را افشا کرد

·۴ شهریور ۱۴۰۵۵ دقیقه مطالعه۲ بازدید
پیپت: مجموعه بنچمارک بازتولیدپذیر برای سنجش مدل‌های روی‌دستگاه، کوانتیزاسیون، زمان اجرا و سخت‌افزار
پیپت: مجموعه بنچمارک بازتولیدپذیر برای سنجش مدل‌های روی‌دستگاه، کوانتیزاسیون، زمان اجرا و سخت‌افزار
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی اولین چارچوب متن‌باز که عملکرد AI را نه به عنوان ویژگی مدل، بلکه به عنوان حاصل ترکیب مدل، کوانتش، محیط اجرا و سخت‌افزار اندازه‌گیری می‌کند.

۷۸.۴٪ در برابر ۳۳.۸٪؛ این است فاصلهٔ تکان‌دهنده در حفظ سرعت دو مدل تقریباً یکسان با ۳۵۰ میلیون پارامتر روی یک گوشی موبایل وقتی حجم متن ورودی زیاد می‌شود. برای پایان دادن به این پیش‌بینی‌ناپذیری، شرکت Liquid AI هفته‌ی گذشته چارچوب متن‌باز Pipette را منتشر کرد؛ سیستمی که عملکرد روی دستگاه را نه یک ویژگی مدل، بلکه یک ویژگی سیستمی می‌بیند.

بیشتر کارت‌های مدل، کیفیت را در شرایط سرورهای قدرتمند و با دقت کامل (Full-precision) گزارش می‌کنند که به‌ندرت پیش‌بینی می‌کند یک مدل روی گوشی هوشمند چه رفتاری دارد. برای یک توسعه‌دهنده، این کار شبیه تست کردن ماشین در محیط خلاء است و انتظار دارد همان ماشین در یک طوفان بارانی هم همان‌طور حرکت کند. Pipette واحد اندازه‌گیری را به یک پیکربندی کامل تغییر می‌دهد: مدل + کوانتش (Quantization) — شبیه فشرده‌سازی یک فایل حجیم برای جا شدن در فلش، بدون از دست دادن زیاد کیفیت — + محیط اجرا + سخت‌افزار.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی بهینه‌سازی مدل‌های کوچک اشاره کردیم، توازن بین دقت و سرعت کلید موفقیت در لبه است. این پلتفرم که با همکاری Artificial Analysis (به عنوان تأییدکننده مستقل متدولوژی) ساخته شده، تحت مجوز Apache 2.0 عرضه شده است. این زیرساخت شامل سه بخش pipette-mgmt ،pipette-clients و pipette-scores است و مجموعه‌ای از داده‌های عمومی، داشبورد ابری و اپلیکیشن‌های بومی برای iOS و اندروید را ارائه می‌دهد. طبق اعلام این شرکت، مجموعه داده‌های اولیه بیش از ۱۰۰۰ پیکربندی را روی ۳۰ مدل مختلف و با طول متن از ۲۵۶ تا ۸۱۹۲ توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — پوشش می‌دهد.

محدوده فنی و سخت‌افزاری

بر اساس مستندات Pipette، نتایج تأییدشده اولیه از سه دستگاه پرچم‌دار به‌دست آمده است:

  • مک‌بوک پرو با تراشه M5 Max
  • آیفون ۱۷ پرو
  • گلکسی S26 اولترا

معرفی Dyna-2: مدل جهان-عمل رباتیکی با پیش‌آموزش بر یک میلیون ساعت ویدیوی انسانی

نتایج مربوط به AMD Ryzen AI Max+ 395 و Radeon 8060S به‌زودی اضافه خواهند شد. این مجموعه از نسخه‌های لاماسی‌پلاس‌پلاس (llama.cpp) برای سیستم‌عامل‌های macOS، iOS، ویندوز و اندروید استفاده می‌کند. نکته مهم این است که در حالی که سرعت روی دستگاه اندازه‌گیری شده، نمرات کیفیت (از آزمون‌های IFBench، GPQA Diamond و MATH-500) از سیستم‌های مرجع NVIDIA H100 80GB گرفته شده تا سازگاری حفظ شود؛ یعنی عدد کیفیت نمایش داده شده در کنار توان عملیاتی گوشی، روی خود گوشی تولید نشده است.

کاربردهای عملی و استقرار

این ابزار برای هر تیمی که مدلی را روی سخت‌افزاری که مالک آن نیست مستقر می‌کند، حیاتی است. این گروه‌ها شامل موارد زیر هستند:

  • توسعه‌دهندگان مستقل و استارتاپ‌های مرحله Seed: می‌توانند از داشبورد و اپلیکیشن‌ها بدون نیاز به مدیریت زیرساخت استفاده کنند.
  • تیم‌های محصول بازار متوسط: می‌توانند کلاینت‌ها را روی ناوگان دستگاه‌های داخلی خود اجرا کنند.
  • تولیدکنندگان بزرگ OEM، فروشندگان تراشه و سازمان‌های سازمانی: می‌توانند کل خط لوله را پشت دیوارهٔ آتش (Firewall) خودشان مدیریت کنند.

این موضوع برای صنایعی که به دلیل تأخیر، حریم خصوصی یا نبود اتصال، مجبور به استنتاج (Inference) — لحظه‌ای که مدل واقعاً جواب تولید می‌کند، مثل خودِ آشپزی و نه دوره آموزش آشپز — روی دستگاه هستند، حیاتی است. این صنایع شامل الکترونیک مصرفی، صنعت خودرو، رباتیک صنعتی، تجهیزات مراقبت‌های بهداشتی، خدمات مالی و دفاعی است.

تیم‌های مهندسی می‌توانند از Pipette برای چندین وظیفه حساس استفاده کنند:

  • انتخاب: انتخاب مدل و کوانتش مناسب پیش از نهایی کردن یک Sprint.
  • تدارکات: اعتبارسنجی تصمیمات خرید SoC و سخت‌افزار.
  • رگرسیون: تست عملکرد هنگام به‌روزرسانی محیط اجرا، سیستم‌عامل یا درایور.
  • برنامه‌ریزی: برنامه‌ریزی ظرفیت برای نیازهای خاص طول متن (Context Length).
  • تأیید: بررسی مستقل ادعاهای عملکردی فروشندگان سخت‌افزار.

یافته‌های کلیدی عملکرد

داده‌های Liquid AI نشان می‌دهد که پروفایل‌های سیستمی اغلب تضادهای بزرگی را در سطح وظایف پنهان می‌کنند. به عنوان مثال، روی آیفون ۱۷ پرو با کوانتش Q4_K_M، مدل MiniCPM5-1B یک workload با ورودی ۲۰۴۸ و خروجی ۲۵۶ توکن را در ۳.۴۷ ثانیه تمام می‌کند. در مقابل، مدل LFM2.5-1.2B-Instruct به ۴.۱۲ ثانیه زمان نیاز دارد؛ یعنی ۱۵.۸٪ سرعت بیشتر برای MiniCPM، با وجود اینکه LFM در آزمون MATH-500 نمره ۹.۰ واحد بالاتری دارد.

یافته حیاتی دیگر مربوط به فعال‌سازی پراکنده (Sparse Activation) است. روی گلکسی S26 اولترا با ۲۰۴۸ توکن ورودی، مدل LFM2.5-8B-A1B حدود ۲.۴ برابر سریع‌تر از Qwen3.5-4B و ۲.۶ برابر سریع‌تر از Ministral-3-3B-Instruct-2512 رمزگشایی می‌کند. این مدل هرچند در هر توکن فقط ۱.۵ میلیارد از ۸.۵ میلیارد پارامتر خود را فعال می‌کند، اما همچنان ۵.۲۹ گیگابایت حافظه اشغال می‌کند چون تمام وزن‌های خبره (Expert Weights) باید در رم حضور داشته باشند.

مقیاس‌پذیری متن نیز در پارامترهای یکسان متفاوت است. در گلکسی S26 اولترا با کوانتش Q4_K_M، مدل Granite-4.0-H-350M حدود ۷۸.۴٪ از توان عملیاتی رمزگشایی خود را هنگام افزایش متن ورودی از ۲۵۶ به ۴۰۹۶ توکن حفظ می‌کند، اما مدل Granite-4.0-350M تنها ۳۳.۸٪ از آن را نگه می‌دارد.

در نهایت، پروفایل‌های تقریباً یکسان می‌توانند تفاوت‌های عمیقی را پنهان کنند. روی M5 Max با کوانتش Q4_K_M و ۲۰۴۸ توکن ورودی، مدل‌های Granite-4.1-8B و Ministral-3-8B-Instruct-2512 تنها ۲.۴٪ در توان عملیاتی رمزگشایی و ۱.۲٪ در اوج مصرف رم با هم تفاوت دارند. با این حال، Granite در IFBench ۷.۳ امتیاز جلوتر است، در حالی که Ministral در GPQA Diamond ۱۴.۰ امتیاز پیشتازی می‌کند.

متدولوژی اندازه‌گیری

برای تضمین تکرارپذیری، Pipette از پروتکل سخت‌گیرانه‌ای استفاده می‌کند: شکل‌های ثابت توکن، رمزگشایی حریصانه (Greedy decoding)، حذف دوره‌های گرم‌کردن (Warm-up) و پنج بار تکرار اندازه‌گیری. سیستم پیش از هر اجرا، یک بررسی مخصوص پلتفرم برای شرایط حرارتی و بار سخت‌افزار انجام می‌دهد و هر اجرای ناموفقی که از این گیت‌های آمادگی عبور نکند، منتشر نمی‌شود.

ارزیابی‌ها از پروتکل جداگانه‌ای با امتیازدهی قطعی و کور (Model-blind) استفاده می‌کنند. بخش pipette-scores هرگز منشأ تولید متن را نمی‌بیند. هر ثبت داده شامل نسخه بنچمارک، شکل توکن، آرتیفکت مدل، نوع کوانتش، نسخه و تنظیمات محیط اجرا و سخت‌افزار/سیستم‌عامل دستگاه است.

این سطح از دقت به تیم‌ها اجازه می‌دهد خرید SoC را اعتبارسنجی کنند یا اثر به‌روزرسانی درایور سیستم‌عامل را بسنجند. برای متخصصان، این یعنی عصر تکیه بر بنچمارک‌های «میانگین» مدل‌ها به پایان رسیده است. دیگر نمی‌توان مدل را فقط بر اساس تعداد پارامتر انتخاب کرد؛ بلکه باید دقیق‌ترین کوانتش و محیط اجرای متناسب با سقف حرارتی و حافظه سخت‌افزار هدف را یافت.

این تغییر، توسعه را به سمت رویکرد «اول استقرار» (Deployment-first) می‌برد. توسعه‌دهندگان باید به‌جای بهینه‌سازی برای جدول‌های رده‌بندی، برای سیلیکونی بهینه‌سازی کنند که کاربر در دست دارد.

توسعه‌دهندگان علاقه‌مند می‌توانند بدون نیاز به لیست انتظار، بلافاصله به داشبورد و اپلیکیشن‌های Pipette دسترسی پیدا کنند تا پیکربندی‌های روی دستگاه خود را تست کنند. انتشار نتایج ارسال شده توسط جامعه کاربران همچنان در مرحله بتا است.

گام بعدی شما

  • اگر در حال توسعه اپلیکیشن‌های محلی هستید، از داشبورد Pipette برای مقایسه مدل‌های SLM روی سخت‌افزارهای هدف استفاده کنید.
  • در انتخاب مدل، به‌جای تعداد پارامتر، به نرخ حفظ توان عملیاتی (Throughput Retention) در پنجره‌های متنی بلند توجه کنید.
  • اثر کوانتش‌های مختلف (مانند Q4_K_M) را روی تأخیر پاسخ‌دهی در دستگاه‌های اندرویدی تست کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف حدس و گمان در استقرار مدل‌های محلی، ریسک مالی خرید سخت‌افزار اشتباه را برای شرکت‌ها کاهش می‌دهد. اعتبار این داده‌ها به دلیل همکاری با Artificial Analysis و استفاده از متدولوژی باز، استانداردی جدید برای گزارش عملکرد مدل‌ها ایجاد می‌کند.

تأثیر برای ایران

برای توسعه‌دهندگان ایرانی که به دلیل محدودیت‌های API و هزینه‌های ارزی به مدل‌های محلی و Open Weights روی سخت‌افزارهای موجود متکی هستند، این ابزار مسیر بهینه‌ترین مدل را برای سخت‌افزارهای در دسترس مشخص می‌کند.

·نگاه ما
تحریریه دات‌هوش

تمرکز بر «اول استقرار» نشان می‌دهد که جنگ مدل‌های کوچک (SLM) از رقابت روی دقت، به رقابت روی بهره‌وری سخت‌افزاری منتقل شده است. این ابزار ثابت می‌کند که پارامترها دیگر معیار مناسبی برای پیش‌بینی سرعت نیستند و متغیرهای محیطی مانند Runtime تأثیری برابر با معماری مدل دارند. در واقع، بهینه‌سازی لایه نرم‌افزاریِ اجرا، اکنون به اندازه آموزش مدل اهمیت یافته است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.