پرش به محتوای اصلی
پرش به محتوای مقاله

تقطیر مدل: اجرای هوش مصنوعی آفلاین روی گوشی‌های ارزان‌قیمت با Outward

·۱۹ مهر ۱۴۰۵۱۲ دقیقه مطالعه
ماجراجویی که فقط وقتی پیش می‌رود که بیرون بروید
ماجراجویی که فقط وقتی پیش می‌رود که بیرون بروید
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده موفقیت‌آمیز از تقطیر برای رساندن یک مدل ۲۷۰ میلیونی به سطح کیفی مدل ۴ میلیاردی در یک کاربرد خاص (داستان‌سرایی)، در حالی که تمام استنتاج روی CPU مرورگر موبایل انجام می‌شود.

تصور کنید بازی‌ای را تجربه کنید که تنها زمانی پیش می‌رود که شما واقعاً در دنیای واقعی قدم بزنید و اشیایی را پیدا کنید. Outward، پروژه‌ای که در ۱۱ اکتبر ۲۰۲۶ برای چالش هوش مصنوعی متن‌باز Hacktoberfest معرفی شد، ثابت می‌کند که یک مدل با ۲۷۰ میلیون پارامتر می‌تواند تقریباً به اندازه مدلی با ۱۵ برابر این اندازه عمل کند، به شرطی که با «معلم» درستی آموزش دیده باشد. این پروژه با اجرای یک داستان‌سرای پیچیده به‌طور کاملاً آفلاین در مرورگر موبایل، این ادعا را به اثبات می‌رساند.

بسیاری از اپلیکیشن‌های «فعال شوید» (get active) بر اساس معیارهای ایجاد حس گناه، مانند شمارش گام‌ها یا حلقه‌های قرمز رنگ، برای ترغیب کاربران عمل می‌کنند. اما Outward جایگزین این روش را «کنجکاوی» قرار داده است. در این بازی، فصل بعدی یک داستان ماجراجویانه تا زمانی باز نمی‌شود که کاربر یک ماموریت واقعی در دنیای فیزیکی را به پایان برساند؛ مثلاً ۱۰ دقیقه پیاده‌روی برای پیدا کردن یک علامت خاص روی پیاده‌رو. این برنامه برای هر کسی طراحی شده است که زمان حضورش در دنیای دیجیتال به‌طور نامحسوسی از زمان حضورش در فضای باز بیشتر شده است. این رویکرد یادآور تلاش‌های مشابهی است که در پروژه Plot Buddy برای کاهش اعتیاد به نمایشگر از طریق مدل‌های زبانی کوچک مشاهده کردیم.

همان‌طور که در پوشش پیشین ما درباره‌ی Verdantra و استفاده از هوش مصنوعی محلی برای یادداشت‌برداری در طبیعت دیدیم، Outward مرزهای استنتاج (Inference) — که مثل لحظه‌ی آشپزی واقعی است، نه دوره‌ی آموزش آشپز — را روی دستگاه جابه‌جا می‌کند. این سیستم تضمین می‌کند که داستان بر اساس یافته‌های واقعی کاربر (مثل یک قلب گچی، یک گودال آب یا یک گربه ولگرد) شکل بگیرد، نه اینکه صرفاً گزینه‌ای را از یک لیست پیش‌فرض انتخاب کند. در واقع، داستان نمی‌تواند پیش برود مگر اینکه کاربر چیزی را با چشمان خود دیده باشد.

چرخه گیم‌پلی

بازی Outward را نمی‌توان روی کاناپه بازی کرد. بازیکن نقش شخصیت اصلی داستانی را دارد که پیشروی او به تحرک فیزیکی گره خورده است. برای مثال، ماموریتی از سوی «بایگانی‌دار» (The Archivist) ممکن است چنین باشد: «۱۰ دقیقه پیاده‌روی کن و نشانی را که کسی عمداً گذاشته پیدا کن».

بازیکنان می‌توانند بین بازه‌های زمانی ۱۰، ۳۰ یا ۶۰ دقیقه برای پیاده‌روی انتخاب کنند. اپلیکیشن از طریق GPS مسافت را ردیابی می‌کند و برای فعال شدن داستان، به ترتیب به ۲۵۰ متر، ۷۰۰ متر یا ۱.۴ کیلومتر نیاز است تا داستان «بیدار» شود. پس از طی مسافت، بازیکن یافته خود را توصیف می‌کند (مثلاً: «یک قلب گچی که روی پیاده‌رو کشیده شده») و مدل محلی این توصیف را در تار و پود پلات داستان می‌بافد. این یافته‌ها در یک دفترچه یادداشت میدانی ثبت شده و همراهی کوچک به نام Sprig (یک جوانه برگ) این موفقیت را با بازیکن جشن می‌گیرد.

فلسفه طراحی

سه اصل اساسی برای توسعه Outward تعریف شده تا این ابزار به جای اعتیاد به صفحه، وسیله‌ای برای گسست از دنیای دیجیتال باشد:

  • پیاده‌روی همان داستان است: هر فصل دقیقاً حول محور یافته‌ی خاص کاربر نوشته می‌شود. یافته کاربر تبدیل به خودِ پلات می‌شود، نه اینکه صرفاً یک متن تزئینی به داستان اضافه شود.
  • گوشی در جیب: در طول ماموریت، صفحه صراحتاً از کاربر می‌خواهد گوشی را کنار بگذارد. هیچ نقشه یا فیدی برای اسکرول کردن وجود ندارد. اپلیکیشن زمان خاموش بودن صفحه را به عنوان یک معیار مثبت ثبت می‌کند.
  • قابلیت آفلاین واقعی: برنامه برای محیط‌هایی مثل پارک‌ها، مسیرهای پیاده‌روی و حتی زیرزمین‌ها طراحی شده است. پس از نصب اولیه، در حالت Airplane Mode کاملاً فعال می‌ماند و هیچ سیگنالی برای پیشروی در داستان نیاز نیست.

معماری داستان‌سرای آفلاین

چالش فنی اصلی، جای دادن یک داستان‌سرای باکیفیت در تب مرورگر موبایل بدون نیاز به اتصال ابری بود. یک مدل ۴ میلیارد پارامتری (4B) برای این محیط بسیار بزرگ است، اما یک مدل ۲۷۰ میلیونی معمولی، ظرافت لازم برای هدایت پلات بر اساس ورودی کاربر را ندارد.

برای حل این مشکل، توسعه‌دهنده از یک خط لوله‌ی تقطیر (Distillation) استفاده کرد:

  • آموزش مدل معلم: یک مدل Qwen3.5-4B با استفاده از لورا (LoRA با r32) روی پلتفرم Tinker و با ۶۴۸ فصل نمونه که توسط انسان بررسی شده بودند، تنظیم دقیق شد. این «معلم نسخه ۳» توانایی هدایت پلات را از ۶٪ به ۳۹٪ نسبت به مدل پایه رساند. آموزش بر اساس یک روباریک ۵ امتیازی متمرکز بر استفاده از یافته‌ها، انسجام، هدایت پلات، ایمنی و طول متن بود. نتایج روی ۵۰ پرامپت آزمایشی نشان داد که انسجام از ۹۳٪ به ۹۹٪ رسیده و میانگین طول متن از ۹۳ کلمه به ۸۲ کلمه بهینه شده است.
  • تولید داده‌های مصنوعی: مدل معلم ۷۵۰۰ نمونه (۲۵۰۰ پرامپت ضرب در ۳) تولید کرد که پس از عبور از روباریک ایمنی و فیلترهای حفاظتی، ۳۱۸۶ مثال باکیفیت باقی ماندند.
  • تقطیر مدل شاگرد: یک مدل Gemma 3 270M روی این مثال‌ها به‌طور کامل (Full-fine-tuned) در یک نوت‌بوک Kaggle تنظیم شد و سپس به فرمت Q4_0 GGUF کوانتیزه گردید.

به نقل از گزارش dev.to، کل هزینه این فرآیند تنها ۲.۵۶ دلار اعتبار Tinker بود. مدل شاگرد ۲۴۱ مگابایتی نمره ۴.۷۵ را در ارزیابی ۵ امتیازی کسب کرد که تقریباً با نمره ۴.۷۹ مدل معلم ۴ میلیاردی برابری می‌کند. در تست‌های زنده، مدل هر فصل را در ۲ تا ۳ ثانیه روی دستگاه می‌نویسد و به سرعت تقریبی ۵۳ توکن در ثانیه روی CPU دست می‌یابد.

اجرا روی دستگاه و حریم خصوصی

این برنامه به صورت یک اپلیکیشن وب پیشرونده (PWA) ساخته شده است که پس از یک بار نصب، در حالت Airplane Mode اجرا می‌شود. صفحه تنظیمات با دانلود مدل داستان‌سرا (۲۴۱ مگابایت) و یک مدل صوتی (۴۴ مگابایت)، «کیف شما را می‌بندد» و سپس به کاربر اطلاع می‌دهد که اکنون می‌توان آفلاین شد.

برای اجرای مدل Gemma، از wllama (نسخه‌ای از llama.cpp برای WASM) استفاده شده است که مدل را روی CPU یا WebGPU گوشی اجرا می‌کند. مجموع حجم نصب ۳۱۱ مگابایت است که شامل مدل (۲۴۱ مگابایت)، Whisper (۴۴ مگابایت)، ران‌تایم‌ها (۲۴ مگابایت)، روایت‌ها (۲.۴ مگابایت) و خود اپلیکیشن (۰.۱ مگابایت) است.

برای بهره‌گیری از عملکرد چندرشته‌ای (Multi-threaded)، اپلیکیشن روی Render میزبانی می‌شود تا هدرهای Cross-Origin-Opener-Policy (COOP) و Cross-Origin-Embedder-Policy (COEP) فعال شوند. این هدرها دسترسی به SharedArrayBuffer را باز می‌کنند که برای اجرای WASM در چندین رشته CPU ضروری است؛ در غیر این صورت، استنتاج روی تک‌رشته اجرا می‌شد و سرعت به‌شدت کاهش می‌یافت.

حریم خصوصی در اینجا یک ویژگی ساختاری است، نه یک تنظیم ساده. چون مدل، موتور تبدیل گفتار به متن Whisper tiny.en (نسخه int8 با حجم ۴۴ مگابایت) و سیستم ردیابی GPS همگی محلی اجرا می‌شوند، هیچ داده‌ای از مکان، ضبط صدای کاربر یا مسیرهای پیاده‌روی هرگز از دستگاه خارج نمی‌شود. برنامه در پارک‌ها، مسیرهای کوهستانی و زیرزمین‌ها بدون هیچ اختلالی کار می‌کند.

ایمنی و تحویل محتوا

به دلیل تشویق به گشت‌وگذار فیزیکی، یک لایه ایمنی سخت‌گیرانه با فایل rules.json پیاده شده تا هوش مصنوعی از درخواست از کاربر برای بازدید از مناطق خطرناک (مانند جاده‌ها، لبه‌های آب، ملک خصوصی، صخره‌نوردی یا گشت‌وگذار در تاریکی) جلوگیری کند.

مکانیزم‌های ایمنی:

  • سیستم فیلتر دوگانه: قوانین ایمنی هم توسط فیلتر جاوااسکریپت روی گوشی و هم توسط فیلتر پایتون در زمان آموزش اعمال می‌شوند. یک فایل تست مشترک تضمین می‌کند که هر دو فیلتر یکسان عمل کنند؛ اگر اختلافی باشد، CI (GitHub Actions) با خطا متوقف می‌شود.
  • اعتبارسازی خروجی: فیلتر بررسی می‌کند که مدل حتماً از یافته کاربر استفاده کرده باشد، طول متن را رعایت کند، مثال‌ها را کپی نکند، پرامپت را تکرار نکند و خود را به عنوان هوش مصنوعی معرفی نکند. این بخش حیاتی بود زیرا مدل ۲۷۰ میلیونی خام تمایل داشت با کپی کردن کلمه به کلمه داستان‌های نمونه، ارزیابی‌ها را «پاس» کند.
  • سیستم جایگزین: اگر خروجی تایید نشود، بازیکن یک فصل پیش‌نویس شده توسط انسان دریافت می‌کند. اپلیکیشن صراحتاً این‌ها را به عنوان «نوشته شده روی این گوشی» یا «پیش‌نویس شده» برچسب می‌زند.

زیرساخت و توزیع

محتوا از طریق سرور Fastify روی Render (پلن Starter، منطقه سنگاپور) توزیع می‌شود که از طریق یک Blueprint در render.yaml مستقر شده است. سرور مدیریت نسخه‌های مدل را بر عهده دارد و «فصل‌های داستانی» جدید (مانند Second Atlas) را به صورت بسته‌های کش‌شده ارسال می‌کند.

جزئیات ران‌تایم Render:

  • ذخیره‌ساز مدل: سرور از یک دیسک دائمی ۱ گیگابایتی استفاده می‌کند. هنگام بوت، فایل content/models.json را می‌خواند، نسخه پین‌شده مدل شاگرد را از Hugging Face دانلود کرده و نسخه‌های قدیمی را برای جلوگیری از پر شدن دیسک حذف می‌کند.
  • محدودیت پهنای باند: برای جلوگیری از هزینه‌های پیش‌بینی نشده، سرور بایت‌های ارسالی ماهانه را ردیابی می‌کند. پس از رسیدن به سقف MODEL_BANDWIDTH_BUDGET_GB (۶۰ گیگابایت)، سرور یک ریدایرکت ۳۰۲ به فایل مشابه در Hugging Face صادر می‌کند. اپلیکیشن طوری طراحی شده که ابتدا Render را امتحان کند و سپس به‌طور خودکار به Hugging Face سوییچ کند.
  • استراتژی کشینگ: فایل‌های مدل و دارایی‌های هش‌شده به عنوان immutable برای یک سال سرو می‌شوند. اما index.html و Service Worker روی no-cache تنظیم شده‌اند تا به‌روزرسانی‌های برنامه سریعاً به گوشی‌های نصب شده برسد.
  • مانیتورینگ سلامت: یک اندپوینت زنده /api/health به کاربران اجازه می‌دهد کامیت مستقر شده، آمادگی مدل و میزان پهنای باند ماهانه فعلی را بررسی کنند.

صوت و روایت

برای روایت متون ثابت (شخصیت George و بایگانی‌دار) از ElevenLabs استفاده شده است که در مجموع ۲.۴ مگابایت صوت کش‌شده است. اما متن‌های تولید شده در لحظه توسط صدای پیش‌فرض (Native) گوشی خوانده می‌شوند و برای شخصیت Sprig، قابلیت زیرنویس‌های سبک کارائوکه و لب‌خوانی (Lip-sync) پیاده شده است.

فصل‌های جدید از طریق یک «کارخانه داستان» روی مک توسعه‌دهنده ساخته می‌شوند. این فرآیند شامل یک طرح کلی پلات نوشته شده توسط انسان، پیش‌نویس متنی با Qwen در Tinker، ویرایش انسانی و در نهایت رندر کردن روایت صوتی است. تولید فصل دوم (The Second Atlas) تنها ۰.۰۰۷ دلار اعتبار Tinker هزینه داشت.

تحلیل: تغییر به سمت کنترل در سطح وزن‌ها (Weight-Level Control)

پروژه Outward نشان می‌دهد که جهش بعدی در هوش مصنوعی موبایل از طریق «پرامپت‌نویسی بهتر» نیست، بلکه از توانایی دستکاری وزن‌های مدل حاصل می‌شود. توسعه‌دهنده اشاره کرد که یک مدل ۲۷۰ میلیونی خام حتی با یک پرامپت One-shot عالی، تنها نمره ۳.۶۶ گرفت؛ تقطیر تنها راه رسیدن به آستانه ۴.۷۵ بود.

این موضوع شکاف فزاینده بین توسعه مبتنی بر APIهای بسته و نوآوری در مدل‌های با وزن‌های باز (Open-weight) را برجسته می‌کند. در سیستم‌های بسته، توسعه‌دهندگان مجبور به استفاده از مدل‌های عظیم و تأخیر (Latency) بالا هستند. اما وزن‌های باز اجازه ساخت مدل‌های «متخصص» و بسیار کوچک را می‌دهند که برای سخت‌افزار خاص و محدودیت‌های حریم خصوصی بهینه شده‌اند. توسعه‌دهنده از Claude Code به عنوان برنامه‌نویس جفت برای پیاده‌سازی حلقه آموزش Tinker، روباریک ارزیابی و تست‌های تطبیق فیلتر ایمنی استفاده کرد.

مزایای نوآوری باز:

  • استقلال سخت‌افزاری: وزن‌های باز یعنی داستان‌سرا با کاربر سفر می‌کند. هیچ محدودیت نرخ درخواست (Rate limit)، قطعی سرور یا نیاز به API Key در کلاینت وجود ندارد.
  • حریم خصوصی در طراحی: چون مدل محلی اجرا می‌شود، پیاده‌روی، ضبط صدا و داستان هرگز گوشی را ترک نمی‌کنند.
  • بهره‌وری هزینه: کل هزینه ابری برای آموزش هر دو مدل ۲.۵۶ دلار بود. هزینه میزبانی حدود ۷.۲۵ دلار در ماه است و ۱۰۰ نصب حدود ۱۱ دلار هزینه می‌برد.

برای کاربر عادی، این به معنای آن است که هوش مصنوعی از یک «مقصد» (اپلیکیشنی که برای چت باز می‌کنید) به یک «لایه نامرئی» تبدیل می‌شود که تجربیات دنیای واقعی را بدون نیاز به بسته داده یا به خطر انداختن حریم خصوصی، ارتقا می‌دهد.

برای مشاهده این سیستم در عمل، می‌توانید PWA را از دموی Render نصب کنید و در بخش تنظیمات، حالت Practice را فعال کنید تا بدون نیاز به پیاده‌روی، سرعت استنتاج محلی را تست کنید. منوی Diagnostics همچنین به کاربران اجازه می‌دهد تعداد توکن در ثانیه و مدل دقیق نصب شده روی سخت‌افزار خود را مشاهده کنند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر تخصص در تقطیر مدل، ثابت می‌کند که کیفیت استدلال لزوماً با اندازه مدل رابطه مستقیم ندارد. این دستاورد مسیر را برای اپلیکیشن‌های محلی و خصوصی باز می‌کند که بدون نیاز به اینترنت یا سرورهای گران‌قیمت، عملکردی در سطح مدل‌های بزرگ دارند.

تأثیر برای ایران

به دلیل اجرای کاملاً محلی و آفلاین، این مدل هیچ محدودیتی در دسترسی برای کاربران ایرانی ندارد و برای توسعه‌دهندگان داخلی الگویی از کاهش هزینه استنتاج است.

·نگاه ما
تحریریه دات‌هوش

برتری Outward در این است که نشان می‌دهد برای کاربردهای خاص، دستکاری وزن‌های مدل بسیار موثرتر از مهندسی پرامپت است. در حالی که مدل‌های بسته ما را به مدل‌های غول‌پیکر و تأخیر بالا محدود می‌کنند، وزن‌های باز اجازه می‌دهند مدل‌های «متخصص» و بسیار کوچک بسازیم که برای سخت‌افزارهای ضعیف بهینه شده‌اند. این رویکرد، هوش مصنوعی را از یک مقصد (اپلیکیشنی که باز می‌کنیم) به یک لایه نامرئی تبدیل می‌کند که تجربه دنیای واقعی را تقویت می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.