پرش به محتوای اصلی
پرش به محتوای مقاله

درون سازوکار GnLOLot برای استخراج منطق استدلالی از داده‌های متنی

·۲۹ تیر ۱۴۰۵۳ دقیقه مطالعه۲ بازدید
تنظیم دقیق MiniCPM5-1B با داده‌های Claude Fable 5 برای ساخت مدل فکری ۶۵۷ مگابایتی
تنظیم دقیق MiniCPM5-1B با داده‌های Claude Fable 5 برای ساخت مدل فکری ۶۵۷ مگابایتی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

شبیه‌سازی رفتار استدلالی Claude در یک مدل ۱ میلیارد پارامتری از طریق SFT روی ردپاهای متنی، بدون استفاده از روش‌های پیچیده تقطیر وزنی.

تصور کنید یک مدل استدلالی پیشرفته داشته باشید که به‌ جای نیاز به سرورهای عظیم، تنها ۶۵۷ مگابایت از حافظه لپ‌تاپ شما را اشغال می‌کند. این دیگر یک تصور نیست؛ مدل MiniCPM5-1B-Claude-Opus-Fable5-Thinking اجازه می‌دهد فرآیند «تفکر» مدل‌های غول‌آسای ابری را به‌ طور کامل در محیط شخصی خود اجرا کنید، بدون آنکه نیازی به کلیدهای API یا وابستگی به ابر داشته باشید. طبق گزارش وب‌سایت marktechpost.com، توسعه‌دهنده‌ای با نام مستعار GnLOLot این مدل را برای کسانی طراحی کرده است که به دنبال جایگزینی سبک و خصوصی برای وظایف استدلالی پایه هستند. این رویکرد یادآور تلاش‌های اخیر برای دستیابی به دقت بالا بدون وابستگی به ابر است که توسط تیم OpenClaw پیاده‌سازی شد.

این دستاورد در حالی رخ می‌دهد که صنعت هوش مصنوعی به سمت استدلال «سیستم ۲» حرکت می‌کند؛ یعنی حالتی که مدل‌ها پیش از ارائه پاسخ نهایی، برای برنامه‌ریزی درنگ می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی قابلیت‌های برنامه‌ریزی مدل‌های زبانی و اینکه حالت /plan در Claude Code چگونه خطاهای بازبینی کد را به‌شدت کاهش می‌دهد اشاره کردیم، این پروژه جامعه‌محور تلاش می‌کند همین رفتار معماری را در ابعادی بسیار کوچک پیاده‌سازی کند تا منطق استدلال به‌ جای خوشه‌های ابری، در فایلی قرار بگیرد که برای اکثر لپ‌تاپ‌های مدرن قابل اجرا باشد.

معماری فنی

این مدل بر پایه openbmb/MiniCPM5-1B ساخته شده است؛ یک مدل زبانی کوچک (SLM) با ۱.۰۸ میلیارد پارامتر که از معماری LlamaForCausalLM بهره می‌برد. این ساختار شامل ۲۴ لایه، مکانیزم Grouped-Query Attention و پنجرهٔ زمینه (Context Window) — یا همان میز کاری مدل که تعیین می‌کند چه مقدار متن را هم‌زمان در ذهن نگه می‌دارد — معادل ۱۳۱,۰۷۲ توکن است. به نقل از مستندات OpenBMB، این مدل پایه در دسته مدل‌های ۱ میلیارد پارامتری، عملکردی در سطح SOTA (بهترین حالت فعلی) در مجموعه مقایسه‌ای خود دارد.

نکته مهم این است که مدل پایه از پیش دارای یک قالب تفکر بومی (Native Thinking Template) است. استدلال در این مدل از طریق پارامتر enable_thinking فعال می‌شود که دو حالت «با تفکر» (Think) و «بدون تفکر» (No Think) را فراهم می‌کند. مدل مشتق‌شده فعلی، این قالب را حفظ کرده و از فرمت فراخوانی ابزار (Tool-call) مدل MiniCPM5 استفاده می‌کند.

برای ارتقای مدل، توسعه‌دهنده از تنظیم نظارت‌شده (SFT) روی داده‌های Fable 5 استفاده کرده است. این مرحله پس-آموزشی (Post-training) به‌طور خاص با هدف بهبود توانایی‌های کدنویسی و دقت مدل در پیروی از دستورات (Instruction Following) انجام شده است. این تمرکز بر کدنویسی محلی در حالی است که محدودیت‌های حافظه در مدل‌های کوچک‌تر، گاهی باعث ناکارآمدی عامل‌های کدنویسی محلی می‌شود.

مکانیسم کار: SFT در برابر Distillation

بر اساس بررسی‌های فنی، بسیار حیاتی است که بدانیم این پروژه یک distillation (تقطیر) کلاسیک نیست. در تقطیر واقعی، سیگنال‌ها از طریق logitها یا وزن‌های مدل استاد به مدل کوچک‌تر منتقل می‌شوند تا حجم آن کاهش یابد. اما چون توسعه‌دهنده به وزن‌های داخلی یا logitهای مدل Claude دسترسی نداشت، از رویکرد متفاوتی استفاده کرد.

در این روش، توسعه‌دهنده تعداد زیادی گفتگو با مدل استاد (Claude) ضبط کرد و پاسخ‌ها و ردپاهای متنی استدلال آن را به صورت متن ثبت نمود. سپس مدل کوچک را با استفاده از این ردپاها تحت تنظیم نظارت‌شده (SFT) قرار داد. در نتیجه، مدل ۱ میلیارد پارامتری یاد می‌گیرد که فرمت و سبک پاسخ‌دهی را تقلید کند، اما لزوماً توانایی استدلال در مقیاس مرزی (Frontier-scale) مدل استاد را جذب نکرده است. این تلاش برای شبیه‌سازی تفکر در مدل‌های کوچک، در راستای رقابت با ماشین‌های تفکر پیشرفته‌ای مانند Inkling است که در عملیات‌های عامل‌محور پیشتازی می‌کنند.

مشخصات استقرار و اجرا

  • پنجرهٔ زمینه: ۱۲۸ هزار توکن (که از فایل config.json مدل پایه با مقدار ۱۳۱,۰۷۲ به ارث رسیده است).
  • نسخه‌های کوانتیده (Quantization) در قالب GGUF:
    • Q4_K_M: حدود ۶۵۷ مگابایت (کم‌حجم‌ترین اثر انگشت حافظه).
    • Q5_K_M: حدود ۷۵۱ مگابایت.
    • Q8_0: حدود ۱.۱ گیگابایت (پیشنهاد پیش‌فرض توسعه‌دهنده).
    • F16: حدود ۲.۱ گیگابایت.
  • سازگاری: این مدل مستقیماً در llama.cpp، Ollama، LM Studio، jan و KoboldCpp بارگذاری می‌شود.
  • تنظیمات پیشنهادی: برای فعال‌سازی «حالت تفکر»، دمای (Temperature) ۰.۹ و top_p برابر ۰.۹۵ توصیه شده است. مدل ممکن است پیش از پاسخ نهایی، بلوک‌های استدلالی تولید کند که اپلیکیشن‌های پایین‌دستی می‌توانند آن‌ها را حذف کنند.

از دیدگاه کاربردی، شما اکنون می‌توانید یک مدل «استدلالی» را روی دستگاه‌های لبه (Edge Device) اجرا کنید، اما با یک معامله: چون مدل تنها «فرمت» استدلال را تقلید می‌کند و نه هوش زیربنایی یک مدل غول‌پیکر را، نمی‌تواند منطق‌های پیچیده سطح مرزی را اجرا کند. این مدل ظاهرِ یک فرآیند تفکر را بازسازی می‌کند که برای ساختاردهی به خروجی‌ها مفید است، اما ممکن است در دقت واقعیات عمیق دچار نقص باشد.

همچنین این پروژه یک پرسش باز در مورد مجوز (Licensing) ایجاد کرده است؛ زیرا وزن‌های پایه تحت مجوز Apache-2.0 هستند، اما تنظیم دقیق از خروجی‌های یک مدل تجاری (Claude) استفاده کرده است. علاوه بر این، هیچ بنچمارک یا مجموعه‌داده آموزشی منتشر نشده است و ادعاهای مربوط به توانایی مدل فعلاً غیرقابل راستی‌آزمایی است.

گام بعدی شما

  • اگر اولاما (Ollama) دارید، با دستور ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M سریع‌ترین نسخه را تست کنید.
  • از این مدل برای ساختارهای خروجی منظم استفاده کنید، اما نتایج استدلالی را با یک مدل بزرگ‌تر تطبیق دهید.
  • بررسی کنید که آیا حذف بلوک‌های تفکر (Thinking blocks) در اپلیکیشن نهایی شما، تجربه کاربری را بهبود می‌بخشد یا خیر.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مدل ثابت می‌کند که رفتارهای پیچیده مدل‌های ابری را می‌توان در ابعاد بسیار کوچک شبیه‌سازی کرد. این موضوع برای حریم خصوصی داده‌ها و کاهش هزینه‌های استنتاج در دستگاه‌های محلی اهمیت استراتژیک دارد.

تأثیر برای ایران

به دلیل ماهیت محلی و وزن‌های باز این مدل، توسعه‌دهندگان ایرانی می‌توانند بدون نیاز به VPN یا پرداخت هزینه‌های API، قابلیت‌های استدلالی پایه را در اپلیکیشن‌های آفلاین خود پیاده کنند.

·نگاه ما
تحریریه دات‌هوش

این پروژه نشان می‌دهد که «قالب استدلال» (Reasoning Format) تا حد زیادی از «توانایی استدلال» (Reasoning Capability) مستقل است. تقلید از ردپاهای متنی مدل‌های پیشرو، مدل‌های کوچک را به ابزارهایی تبدیل می‌کند که خروجی‌های سازمان‌یافته‌تری می‌دهند، حتی اگر عمق تحلیل آن‌ها افزایش نیابد. این رویکرد، مسیر جدیدی برای ساخت مدل‌های کمکی (Copilots) باز می‌کند که صرفاً وظیفه هدایت ساختاری پاسخ را بر عهده دارند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.