۷۸.۴٪ در برابر ۳۳.۸٪؛ این است فاصلهٔ تکاندهنده در حفظ سرعت دو مدل تقریباً یکسان با ۳۵۰ میلیون پارامتر روی یک گوشی موبایل وقتی حجم متن ورودی زیاد میشود. برای پایان دادن به این پیشبینیناپذیری، شرکت Liquid AI هفتهی گذشته چارچوب متنباز Pipette را منتشر کرد؛ سیستمی که عملکرد روی دستگاه را نه یک ویژگی مدل، بلکه یک ویژگی سیستمی میبیند.
بیشتر کارتهای مدل، کیفیت را در شرایط سرورهای قدرتمند و با دقت کامل (Full-precision) گزارش میکنند که بهندرت پیشبینی میکند یک مدل روی گوشی هوشمند چه رفتاری دارد. برای یک توسعهدهنده، این کار شبیه تست کردن ماشین در محیط خلاء است و انتظار دارد همان ماشین در یک طوفان بارانی هم همانطور حرکت کند. Pipette واحد اندازهگیری را به یک پیکربندی کامل تغییر میدهد: مدل + کوانتش (Quantization) — شبیه فشردهسازی یک فایل حجیم برای جا شدن در فلش، بدون از دست دادن زیاد کیفیت — + محیط اجرا + سختافزار.
همانطور که در تحلیلهای قبلی ما دربارهی بهینهسازی مدلهای کوچک اشاره کردیم، توازن بین دقت و سرعت کلید موفقیت در لبه است. این پلتفرم که با همکاری Artificial Analysis (به عنوان تأییدکننده مستقل متدولوژی) ساخته شده، تحت مجوز Apache 2.0 عرضه شده است. این زیرساخت شامل سه بخش pipette-mgmt ،pipette-clients و pipette-scores است و مجموعهای از دادههای عمومی، داشبورد ابری و اپلیکیشنهای بومی برای iOS و اندروید را ارائه میدهد. طبق اعلام این شرکت، مجموعه دادههای اولیه بیش از ۱۰۰۰ پیکربندی را روی ۳۰ مدل مختلف و با طول متن از ۲۵۶ تا ۸۱۹۲ توکن (Token) — تکههای کوچکی از متن، مثل برشهای یک کیک طولانی که مدل تکهتکه میخورد — پوشش میدهد.
محدوده فنی و سختافزاری
بر اساس مستندات Pipette، نتایج تأییدشده اولیه از سه دستگاه پرچمدار بهدست آمده است:
- مکبوک پرو با تراشه M5 Max
- آیفون ۱۷ پرو
- گلکسی S26 اولترا

نتایج مربوط به AMD Ryzen AI Max+ 395 و Radeon 8060S بهزودی اضافه خواهند شد. این مجموعه از نسخههای لاماسیپلاسپلاس (llama.cpp) برای سیستمعاملهای macOS، iOS، ویندوز و اندروید استفاده میکند. نکته مهم این است که در حالی که سرعت روی دستگاه اندازهگیری شده، نمرات کیفیت (از آزمونهای IFBench، GPQA Diamond و MATH-500) از سیستمهای مرجع NVIDIA H100 80GB گرفته شده تا سازگاری حفظ شود؛ یعنی عدد کیفیت نمایش داده شده در کنار توان عملیاتی گوشی، روی خود گوشی تولید نشده است.
کاربردهای عملی و استقرار
این ابزار برای هر تیمی که مدلی را روی سختافزاری که مالک آن نیست مستقر میکند، حیاتی است. این گروهها شامل موارد زیر هستند:
- توسعهدهندگان مستقل و استارتاپهای مرحله Seed: میتوانند از داشبورد و اپلیکیشنها بدون نیاز به مدیریت زیرساخت استفاده کنند.
- تیمهای محصول بازار متوسط: میتوانند کلاینتها را روی ناوگان دستگاههای داخلی خود اجرا کنند.
- تولیدکنندگان بزرگ OEM، فروشندگان تراشه و سازمانهای سازمانی: میتوانند کل خط لوله را پشت دیوارهٔ آتش (Firewall) خودشان مدیریت کنند.
این موضوع برای صنایعی که به دلیل تأخیر، حریم خصوصی یا نبود اتصال، مجبور به استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، مثل خودِ آشپزی و نه دوره آموزش آشپز — روی دستگاه هستند، حیاتی است. این صنایع شامل الکترونیک مصرفی، صنعت خودرو، رباتیک صنعتی، تجهیزات مراقبتهای بهداشتی، خدمات مالی و دفاعی است.
تیمهای مهندسی میتوانند از Pipette برای چندین وظیفه حساس استفاده کنند:
- انتخاب: انتخاب مدل و کوانتش مناسب پیش از نهایی کردن یک Sprint.
- تدارکات: اعتبارسنجی تصمیمات خرید SoC و سختافزار.
- رگرسیون: تست عملکرد هنگام بهروزرسانی محیط اجرا، سیستمعامل یا درایور.
- برنامهریزی: برنامهریزی ظرفیت برای نیازهای خاص طول متن (Context Length).
- تأیید: بررسی مستقل ادعاهای عملکردی فروشندگان سختافزار.
یافتههای کلیدی عملکرد
دادههای Liquid AI نشان میدهد که پروفایلهای سیستمی اغلب تضادهای بزرگی را در سطح وظایف پنهان میکنند. به عنوان مثال، روی آیفون ۱۷ پرو با کوانتش Q4_K_M، مدل MiniCPM5-1B یک workload با ورودی ۲۰۴۸ و خروجی ۲۵۶ توکن را در ۳.۴۷ ثانیه تمام میکند. در مقابل، مدل LFM2.5-1.2B-Instruct به ۴.۱۲ ثانیه زمان نیاز دارد؛ یعنی ۱۵.۸٪ سرعت بیشتر برای MiniCPM، با وجود اینکه LFM در آزمون MATH-500 نمره ۹.۰ واحد بالاتری دارد.
یافته حیاتی دیگر مربوط به فعالسازی پراکنده (Sparse Activation) است. روی گلکسی S26 اولترا با ۲۰۴۸ توکن ورودی، مدل LFM2.5-8B-A1B حدود ۲.۴ برابر سریعتر از Qwen3.5-4B و ۲.۶ برابر سریعتر از Ministral-3-3B-Instruct-2512 رمزگشایی میکند. این مدل هرچند در هر توکن فقط ۱.۵ میلیارد از ۸.۵ میلیارد پارامتر خود را فعال میکند، اما همچنان ۵.۲۹ گیگابایت حافظه اشغال میکند چون تمام وزنهای خبره (Expert Weights) باید در رم حضور داشته باشند.
مقیاسپذیری متن نیز در پارامترهای یکسان متفاوت است. در گلکسی S26 اولترا با کوانتش Q4_K_M، مدل Granite-4.0-H-350M حدود ۷۸.۴٪ از توان عملیاتی رمزگشایی خود را هنگام افزایش متن ورودی از ۲۵۶ به ۴۰۹۶ توکن حفظ میکند، اما مدل Granite-4.0-350M تنها ۳۳.۸٪ از آن را نگه میدارد.
در نهایت، پروفایلهای تقریباً یکسان میتوانند تفاوتهای عمیقی را پنهان کنند. روی M5 Max با کوانتش Q4_K_M و ۲۰۴۸ توکن ورودی، مدلهای Granite-4.1-8B و Ministral-3-8B-Instruct-2512 تنها ۲.۴٪ در توان عملیاتی رمزگشایی و ۱.۲٪ در اوج مصرف رم با هم تفاوت دارند. با این حال، Granite در IFBench ۷.۳ امتیاز جلوتر است، در حالی که Ministral در GPQA Diamond ۱۴.۰ امتیاز پیشتازی میکند.
متدولوژی اندازهگیری
برای تضمین تکرارپذیری، Pipette از پروتکل سختگیرانهای استفاده میکند: شکلهای ثابت توکن، رمزگشایی حریصانه (Greedy decoding)، حذف دورههای گرمکردن (Warm-up) و پنج بار تکرار اندازهگیری. سیستم پیش از هر اجرا، یک بررسی مخصوص پلتفرم برای شرایط حرارتی و بار سختافزار انجام میدهد و هر اجرای ناموفقی که از این گیتهای آمادگی عبور نکند، منتشر نمیشود.
ارزیابیها از پروتکل جداگانهای با امتیازدهی قطعی و کور (Model-blind) استفاده میکنند. بخش pipette-scores هرگز منشأ تولید متن را نمیبیند. هر ثبت داده شامل نسخه بنچمارک، شکل توکن، آرتیفکت مدل، نوع کوانتش، نسخه و تنظیمات محیط اجرا و سختافزار/سیستمعامل دستگاه است.
این سطح از دقت به تیمها اجازه میدهد خرید SoC را اعتبارسنجی کنند یا اثر بهروزرسانی درایور سیستمعامل را بسنجند. برای متخصصان، این یعنی عصر تکیه بر بنچمارکهای «میانگین» مدلها به پایان رسیده است. دیگر نمیتوان مدل را فقط بر اساس تعداد پارامتر انتخاب کرد؛ بلکه باید دقیقترین کوانتش و محیط اجرای متناسب با سقف حرارتی و حافظه سختافزار هدف را یافت.
این تغییر، توسعه را به سمت رویکرد «اول استقرار» (Deployment-first) میبرد. توسعهدهندگان باید بهجای بهینهسازی برای جدولهای ردهبندی، برای سیلیکونی بهینهسازی کنند که کاربر در دست دارد.
توسعهدهندگان علاقهمند میتوانند بدون نیاز به لیست انتظار، بلافاصله به داشبورد و اپلیکیشنهای Pipette دسترسی پیدا کنند تا پیکربندیهای روی دستگاه خود را تست کنند. انتشار نتایج ارسال شده توسط جامعه کاربران همچنان در مرحله بتا است.
گام بعدی شما
- اگر در حال توسعه اپلیکیشنهای محلی هستید، از داشبورد Pipette برای مقایسه مدلهای SLM روی سختافزارهای هدف استفاده کنید.
- در انتخاب مدل، بهجای تعداد پارامتر، به نرخ حفظ توان عملیاتی (Throughput Retention) در پنجرههای متنی بلند توجه کنید.
- اثر کوانتشهای مختلف (مانند Q4_K_M) را روی تأخیر پاسخدهی در دستگاههای اندرویدی تست کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو