پرش به محتوای اصلی
پرش به محتوای مقاله

درون سازوکار تقطیر پرامپت برای محدود کردن دسترسی به شبکه‌های اجتماعی

·۱۹ مهر ۱۴۰۵۸ دقیقه مطالعه
مادربزرگ دیجیتال: قفل برنامه‌ها تا زمانی که چمن لمس کنی!
مادربزرگ دیجیتال: قفل برنامه‌ها تا زمانی که چمن لمس کنی!
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

استفاده از تقطیر پرامپت برای تبدیل یک شخصیت پیچیده ۳۷۰۰ توکنی به یک مدل ۴ میلیاردی با ورودی ۴۱ توکنی، که باعث افزایش دقت از ۳۳٪ به ۹۳٪ روی سخت‌افزار بسیار ضعیف شد.

تصور کنید یک گوشی اندرویدی ارزان‌قیمت مدل ۲۰۲۰، حالا میزبان مادری است که با لحنی تند و تیز، تمام اپلیکیشن‌های شما را می‌بندد تا ۱۰۰۰ قدم پیاده‌روی کنید. Touch Grass, Babu که توسط عایشه مشیت برای چالش هوش مصنوعی متن‌باز Hacktoberfest ۲۰۲۶ (هفته اول: Touch Grass) ساخته شده، مدیریت زمان صفحه را به یک بازی روانی با ریسک بالا برای فرار از ناامیدی مادر تبدیل کرده است.

بیشتر مسدودکننده‌های اپلیکیشن بر پایه تایمرهای ساده یا اعلان‌هایی هستند که کاربران به‌راحتی نادیده می‌گیرند. طبق گزارش توسعه‌دهنده، این پروژه با تغییر پارادایم و ترکیب استنتاج (Inference) — مثل لحظه‌ای که مدل واقعاً جواب تولید می‌کند، نه دوره‌ی آموزش آشپز — در محیط محلی و داده‌های حسگرهای فیزیکی، شرط «لمس چمن» یا بیرون رفتن از خانه را اجباری می‌کند. هدف این برنامه به‌جای رویکردهای خشک و استریل اینفلوئنسرهای بهره‌وری یا «برادرهای آلفای» سیلیکون ولی با روتین‌های بیداری در ساعت ۴ صبح، تحریک محرک‌های روان‌شناختی مانند احساس گناه و ترس از ناامیدی والدین است.

بستر اعتیاد به اسکرول

مشیت این برنامه را پس از آن ساخت که متوجه شد مسدودکننده‌های استاندارد حفره‌های زیادی دارند. حتی با وجود چندین مسدودکننده، عادت اسکرول کردن (Doomscrolling) همچنان پابرجا بود. همان‌طور که در تحلیل‌های قبلی ما درباره‌ی اعتیاد دیجیتال و مکانیسم‌های پاداش اشاره کردیم، این عادت به‌سادگی از بین نمی‌رود. این رویکرد برای بازگرداندن کاربر به محیط طبیعی، مشابه استراتژی اپلیکیشن OUTSIDE است که با مدل LLaMA 3.3 سعی در کاهش زمان صفحه و تشویق کاربران به گشت‌وگذار در دنیای واقعی است. الهام‌بخش این پروژه، آرکتایپ خاص مادران جنوب آسیا است؛ کسی که قادر است در یک نفس، هم اعتمادبه‌نفس فرزندش را تخریب کند، وضعیت نشستنش را اصلاح کند و او را برای خرید گشنیز به مغازه بفرستد.

در اینجا انگیزه، برخلاف تایمرهای مدیتیشن، ترس از «دمپایی معروف مادر» است؛ مادری که لزوماً عصبانی نیست، بلکه بدتر از آن، ناامید شده است. برنامه به‌طور خاص روی این حس تمرکز می‌کند که «نسرت، همسایه دیواربه‌دیوار» همین حالا ازدواج کرده و زندگی‌اش بهتر پیش می‌رود، در حالی که کاربر زمانش را در گوشی تلف می‌کند.

نبرد با سخت‌افزار

پیاده‌سازی این برنامه روی یک گوشی Realme C17 (پردازنده اسنپ‌دراگون ۴۶۰ و ۶ گیگابایت رم) با گلوگاه محاسباتی شدیدی همراه بود. توسعه‌دهنده این گوشی ارزان‌قیمت سال ۲۰۲۰ را انتخاب کرد چون با وجود قدرت محدود، در دوران پاندمی همراه او بود. این گوشی متن را با سرعت بسیار پایین ۱.۶ توکن (Token) — تکه‌های کوچکی از متن، مثل برش‌های یک کیک طولانی که مدل تکه‌تکه می‌خورد — در ثانیه پردازش می‌کرد.

در ابتدا، شخصیت هوش مصنوعی توسط یک پرامپت سیستمی ۳۷۰۰ توکنی تعریف شده بود. این پرامپت، «مادر» را به عنوان شخصیتی خشک، به‌شدت سارکاستیک (طعنه‌زن)، واقعاً دلسوز و اکیداً «غیر درمانگر» تعریف می‌کرد. به نقل از مستندات پروژه، در سرعت این دستگاه، صرفاً خواندن این پرامپت شخصیت ۳۸ دقیقه زمان می‌برد تا مدل بتواند حتی یک کلمه از تیکه‌هایش را تولید کند. این تأخیر تعامل در لحظه را غیرممکن می‌کرد؛ همان‌طور که توسعه‌دهنده اشاره کرده، در ۳۸ دقیقه می‌توان یک بیزنس کشاورزی را راه انداخت و تمام محصولات را آبیاری کرد.

حل تأخیر از طریق تقطیر پرامپت

برای رفع این مشکل، مشیت یک خط لوله تقطیر (Distillation) با استفاده از ابزار Tinker پیاده کرد. در این فرآیند، یک مدل «معلم» (Qwen3.6-35B-A3B) پاسخ‌ها را بر اساس شخصیت کامل تولید کرد و سپس از این داده‌ها برای آموزش یک مدل «شاگرد» استفاده شد.

  • مجموعه داده: حدود ۴۴۰ سناریو ساخته شد که مواردی چون اسکرول بی‌هدف، عادت‌های شبانه، بهانه‌های کاربر و مدارک واقعی یا جعلی از حضور در فضای باز را پوشش می‌داد.
  • فرآیند انتخاب: این خط لوله از تولید Best-of-N، یک مدل داور و فیلترهای مبتنی بر قانون برای تضمین کیفیت استفاده کرد.
  • مدل شاگرد: مدل Qwen3.5-4B که از طریق لورا (LoRA) — مثل وقتی به یک پزشک عمومی تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — با رنک ۳۲ برای ۳ Epoch تنظیم دقیق شد.
  • نتیجه: شخصیت مدل از ۳۷۰۰ توکن به تنها ۴۱ توکن کاهش یافت. حالا ورودی مدل فقط یک تگ متنی کوچک است: [time: 14:35 | app: Township | today: 2h14m].
  • بهبود عملکرد: دقت رعایت قوانین از ۳۳٪ در مدل پایه به ۹۳٪ در نسخه تنظیم‌شده رسید. امتیاز «باقی ماندن در شخصیت» (In-character score) نیز از ۰.۴۰/۲ به ۱.۹۷/۲ افزایش یافت.

با انتقال شخصیت به درون وزن‌ها (Weights)، مدل دیگر نیازی به سخنرانی طولانی درباره نحوه رفتار یک مادر سارکاستیک آسیایی ندارد؛ او این رفتار را در ذات خود می‌داند.

مهندسی روی دستگاه

مدل به فرمت GGUF تبدیل و با روش کوانتایزیشن (Quantization) به Q4_K_M رسید که منجر به فایلی ۲.۸ گیگابایتی شد. برای اجرا روی اندروید، از llama.cpp با یک پل JNI سفارشی استفاده شد. به‌دلیل محدودیت رم، اندروید استودیو برای این گوشی بیش از حد «غول‌آسا» بود و پروژه تنها با SDK خط فرمان، Gradle و adb ساخته شد.

بهینه‌سازی نیازمند مدیریت دقیق CPU بود. پردازنده اسنپ‌دراگون ۴۶۰ دارای چهار هسته سریع و چهار هسته کند است. توسعه‌دهنده دریافت که صرفاً افزایش تعداد رشته‌ها (Threads) باعث کندی شدید سیستم می‌شود. با اختصاص چهار رشته به‌طور خاص به هسته‌های سریع با استفاده از sched_setaffinity و اطلاعات ظرفیت CPU از JNI، سرعت پایدار ۱.۴ توکن در ثانیه حاصل شد.

مکانیسم «بانک تیکه‌ها»

حتی در سرعت ۱.۴ توکن در ثانیه، تولید یک تیکه در لحظه یک دقیقه زمان می‌برد و دمای گوشی را به ۷۰ درجه سانتی‌گراد می‌رساند و دستگاه را عملاً به یک «اجاق گاز» تبدیل می‌کند. برای جلوگیری از این اتفاق، برنامه از WorkManager استفاده می‌کند تا پاسخ‌ها را هنگام شارژ شدن گوشی پیش‌تولید کند و برای محافظت از سخت‌افزار، توقف‌های خنک‌کننده (Cooldown) را در نظر می‌گیرد.

این پاسخ‌ها در یک «بانک تیکه‌ها» ذخیره می‌شوند که بر اساس موارد زیر دسته‌بندی شده‌اند:

  • نوع اپلیکیشن: چه پینترست باشد، چه یوتیوب شورتس، Township, Hill Climb Racing یا هر بازی دیگری.
  • ساعت روز: برای اطمینان از اینکه استراتژی تیکه‌ها بر اساس ساعت تغییر می‌کند.
  • مدت زمان اسکرول: ردیابی دقیق اینکه کاربر چه مدت در حال اسکرول بوده است.

وقتی کاربر بعد از ۱۵ دقیقه در حال اسکرول باشد، برنامه فوراً یک تیکه پیش‌ساخته را فراخوانی می‌کند. مثلاً اگر دو ساعت در پینترست باشید، مادر می‌گوید: «موفق شدی زندگی‌ای را طراحی کنی که تو در آن حضور نداری». او تمام بهانه‌ها و «فقط پنج دقیقه دیگر»هایی که در واقع به ۴۷ دقیقه تبدیل شدند را می‌شناسد.

تأیید حضور در فضای باز

برای باز کردن قفل گوشی، برنامه مدارکی فیزیکی برای «لمس چمن» می‌خواهد. برای اینکه کاربر صرفاً از سقف اتاقش عکس نگیرد، سه بررسی محلی انجام می‌شود:

۱. برچسب‌گذاری تصاویر ML Kit: یک مدل بینایی محلی برای برچسب‌هایی مثل «آسمان»، «چمن»، «درختان» یا «گیاهان» جست‌وجو می‌کند. این برچسب‌های فضای باز باید بر برچسب‌های فضای داخلی غلبه کنند.
۲. حسگر نور: برنامه بررسی می‌کند که سطح نور محیط با نور روز واقعی همخوانی داشته باشد.
۳. شمارش گام: کاربر باید ۱۰۰۰ قدم ثبت کند تا ثابت شود واقعاً از پشت میز خود فاصله گرفته است. این نوع استفاده از محیط واقعی برای تغییر رفتار کاربر، یادآور پروژه Outland است که با مدل Gemma، محیط دنیای واقعی را به یک بازی نقش‌آفرینی تبدیل کرد.

استراتژی شبانه

رفتار مدل بعد از ساعت ۱۰:۳۰ شب تغییر می‌کند. در این ساعت، برنامه دیگر کاربر را به پیاده‌روی یا گشت‌وگذار نیمه‌شب دعوت نمی‌کند. در عوض، استراتژی به مجبور کردن کاربر به خوابیدن تغییر می‌کند. گوشی تا صبح قفل می‌ماند تا حتی اهمال‌کاری کاربر هم «ساعت اداری» داشته باشد.

حریم خصوصی و وزن‌های باز

این برنامه هیچ دسترسی به اینترنت ندارد. هیچ داده‌ای به سرورهای خارجی ارسال نمی‌شود، هیچ هزینه API وجود ندارد و هیچ داده‌ای در اپلیکیشن‌های شخص ثالث ذخیره نمی‌شود. این معماری تضمین می‌کند ردیابی استفاده از اپلیکیشن‌ها — که توسعه‌دهنده اعتراف می‌کند اگر توسط یک شرکت بزرگ انجام می‌شد «تکان‌دهنده» بود — کاملاً محلی باقی بماند.

به‌دلیل وزن‌های باز (Open Weights) — یعنی دستور پخت مدل علناً منتشر شده، نه فقط غذای آماده — توسعه‌دهنده توانست رفتار هسته مدل را بدون وابستگی به APIهای بسته تغییر دهد. این به جامعه اجازه می‌دهد مدل را بررسی، اصلاح یا بهبود ببخشند. این برنامه بدون سیگنال یا اشتراک، تنها بر اساس «غریزه مادری» کار می‌کند.

جزئیات فنی پیاده‌سازی

  • سرویس پیش‌زمینه: برای خواندن اپلیکیشن فعال از طریق Usage Access. برنامه به‌طور خاص فیدهای اجتماعی و هر اپلیکیشنی که اندروید آن را به عنوان «بازی» شناسایی کند، زیر نظر می‌گیرد.
  • سیستم Overlay: ایجاد یک لایه تمام‌صفحه بعد از رسیدن به آستانه ۱۵ دقیقه. توسعه‌دهنده اطمینان حاصل کرد که دکمه‌های Back و Home باعث دور زدن تیکه‌ها نشوند.
  • پایداری: برنامه برای مقاومت در برابر بستن‌های ساده طراحی شده است. اگر کاربر برنامه را ببندد، «مادر» همچنان در پس‌زمینه فعال می‌ماند. حتی ری‌استارت گوشی او را حذف نمی‌کند، چون او «دیروز به دنیا نیامده است».
  • مشخصات مدل: مدل نهایی Qwen3.5-4B (Q4_K_M GGUF) است که در Hugging Face میزبانی شده است.

این پروژه ثابت می‌کند که عامل‌های هوش مصنوعی پیچیده برای سخت‌افزارهای پرچم‌دار نیاز ندارند، به شرطی که توسعه‌دهنده حاضر باشد پرامپت‌نویسی خام را با تنظیم دقیق هدفمند جایگزین کند. این کار با نشان دادن اینکه چگونه تقطیر می‌تواند «شخصیت» را از نظر محاسباتی ارزان کند، معیارهای AI لبه (Edge AI) را جابه‌جا می‌کند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، تکنیک تقطیر پرامپت را برای کاهش تأخیر در مدل‌های محلی بررسی کنید.
  • برای تجربه این مکانیسم بدون نصب APK، دمو وب در touch-grass-babu.onrender.com را امتحان کنید تا ببینید آیا می‌توانید از تیکه‌های مادر هوش مصنوعی جان سالم به در ببرید.
  • بررسی کنید که چگونه می‌توان از حسگرهای سخت‌افزاری گوشی برای Grounding یا مبنی‌سازی رفتار مدل‌ها استفاده کرد.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه با تکیه بر تخصص در بهینه‌سازی مدل‌های لبه، ثابت می‌کند که هوش مصنوعی کاربردی نیازمند ابرکامپیوترها نیست. این رویکرد هزینه استنتاج را برای توسعه‌دهندگان کاهش داده و حریم خصوصی را با حذف وابستگی به ابر (Cloud) تضمین می‌کند.

تأثیر برای ایران

این رویکرد برای توسعه‌دهندگان ایرانی که با محدودیت دسترسی به GPUهای قدرتمند و هزینه‌های بالای API مواجه‌اند، یک الگوی بهینه برای اجرای مدل‌های محلی روی سخت‌افزارهای موجود است.

·نگاه ما
تحریریه دات‌هوش

این پروژه پارادایم «بزرگ‌تر بهتر است» را در مدل‌های زبانی به چالش می‌کشد و نشان می‌دهد که تخصص (Specialization) از طریق تقطیر، می‌تواند جایگزین حجم عظیم پارامترها شود. در واقع، انتقال شخصیت از لایه پرامپت به لایه وزن‌ها، هزینه محاسباتی را به شدت کاهش می‌دهد بدون اینکه کیفیت خروجی آسیب ببیند. این رویکرد راه را برای ساخت عامل‌های هوشمند بسیار سبک باز می‌کند که روی سخت‌افزارهای قدیمی و ارزان‌قیمت اجرا شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.