تصور کنید یک مدل استدلالی پیشرفته داشته باشید که به جای نیاز به سرورهای عظیم، تنها ۶۵۷ مگابایت از حافظه لپتاپ شما را اشغال میکند. این دیگر یک تصور نیست؛ مدل MiniCPM5-1B-Claude-Opus-Fable5-Thinking اجازه میدهد فرآیند «تفکر» مدلهای غولآسای ابری را به طور کامل در محیط شخصی خود اجرا کنید، بدون آنکه نیازی به کلیدهای API یا وابستگی به ابر داشته باشید. طبق گزارش وبسایت marktechpost.com، توسعهدهندهای با نام مستعار GnLOLot این مدل را برای کسانی طراحی کرده است که به دنبال جایگزینی سبک و خصوصی برای وظایف استدلالی پایه هستند. این رویکرد یادآور تلاشهای اخیر برای دستیابی به دقت بالا بدون وابستگی به ابر است که توسط تیم OpenClaw پیادهسازی شد.
این دستاورد در حالی رخ میدهد که صنعت هوش مصنوعی به سمت استدلال «سیستم ۲» حرکت میکند؛ یعنی حالتی که مدلها پیش از ارائه پاسخ نهایی، برای برنامهریزی درنگ میکنند. همانطور که در تحلیل قبلی ما دربارهی قابلیتهای برنامهریزی مدلهای زبانی و اینکه حالت /plan در Claude Code چگونه خطاهای بازبینی کد را بهشدت کاهش میدهد اشاره کردیم، این پروژه جامعهمحور تلاش میکند همین رفتار معماری را در ابعادی بسیار کوچک پیادهسازی کند تا منطق استدلال به جای خوشههای ابری، در فایلی قرار بگیرد که برای اکثر لپتاپهای مدرن قابل اجرا باشد.
معماری فنی
این مدل بر پایه openbmb/MiniCPM5-1B ساخته شده است؛ یک مدل زبانی کوچک (SLM) با ۱.۰۸ میلیارد پارامتر که از معماری LlamaForCausalLM بهره میبرد. این ساختار شامل ۲۴ لایه، مکانیزم Grouped-Query Attention و پنجرهٔ زمینه (Context Window) — یا همان میز کاری مدل که تعیین میکند چه مقدار متن را همزمان در ذهن نگه میدارد — معادل ۱۳۱,۰۷۲ توکن است. به نقل از مستندات OpenBMB، این مدل پایه در دسته مدلهای ۱ میلیارد پارامتری، عملکردی در سطح SOTA (بهترین حالت فعلی) در مجموعه مقایسهای خود دارد.
نکته مهم این است که مدل پایه از پیش دارای یک قالب تفکر بومی (Native Thinking Template) است. استدلال در این مدل از طریق پارامتر enable_thinking فعال میشود که دو حالت «با تفکر» (Think) و «بدون تفکر» (No Think) را فراهم میکند. مدل مشتقشده فعلی، این قالب را حفظ کرده و از فرمت فراخوانی ابزار (Tool-call) مدل MiniCPM5 استفاده میکند.
برای ارتقای مدل، توسعهدهنده از تنظیم نظارتشده (SFT) روی دادههای Fable 5 استفاده کرده است. این مرحله پس-آموزشی (Post-training) بهطور خاص با هدف بهبود تواناییهای کدنویسی و دقت مدل در پیروی از دستورات (Instruction Following) انجام شده است. این تمرکز بر کدنویسی محلی در حالی است که محدودیتهای حافظه در مدلهای کوچکتر، گاهی باعث ناکارآمدی عاملهای کدنویسی محلی میشود.
مکانیسم کار: SFT در برابر Distillation
بر اساس بررسیهای فنی، بسیار حیاتی است که بدانیم این پروژه یک distillation (تقطیر) کلاسیک نیست. در تقطیر واقعی، سیگنالها از طریق logitها یا وزنهای مدل استاد به مدل کوچکتر منتقل میشوند تا حجم آن کاهش یابد. اما چون توسعهدهنده به وزنهای داخلی یا logitهای مدل Claude دسترسی نداشت، از رویکرد متفاوتی استفاده کرد.
در این روش، توسعهدهنده تعداد زیادی گفتگو با مدل استاد (Claude) ضبط کرد و پاسخها و ردپاهای متنی استدلال آن را به صورت متن ثبت نمود. سپس مدل کوچک را با استفاده از این ردپاها تحت تنظیم نظارتشده (SFT) قرار داد. در نتیجه، مدل ۱ میلیارد پارامتری یاد میگیرد که فرمت و سبک پاسخدهی را تقلید کند، اما لزوماً توانایی استدلال در مقیاس مرزی (Frontier-scale) مدل استاد را جذب نکرده است. این تلاش برای شبیهسازی تفکر در مدلهای کوچک، در راستای رقابت با ماشینهای تفکر پیشرفتهای مانند Inkling است که در عملیاتهای عاملمحور پیشتازی میکنند.
مشخصات استقرار و اجرا
- پنجرهٔ زمینه: ۱۲۸ هزار توکن (که از فایل config.json مدل پایه با مقدار ۱۳۱,۰۷۲ به ارث رسیده است).
- نسخههای کوانتیده (Quantization) در قالب GGUF:
- Q4_K_M: حدود ۶۵۷ مگابایت (کمحجمترین اثر انگشت حافظه).
- Q5_K_M: حدود ۷۵۱ مگابایت.
- Q8_0: حدود ۱.۱ گیگابایت (پیشنهاد پیشفرض توسعهدهنده).
- F16: حدود ۲.۱ گیگابایت.
- سازگاری: این مدل مستقیماً در llama.cpp، Ollama، LM Studio، jan و KoboldCpp بارگذاری میشود.
- تنظیمات پیشنهادی: برای فعالسازی «حالت تفکر»، دمای (Temperature) ۰.۹ و top_p برابر ۰.۹۵ توصیه شده است. مدل ممکن است پیش از پاسخ نهایی، بلوکهای استدلالی تولید کند که اپلیکیشنهای پاییندستی میتوانند آنها را حذف کنند.
از دیدگاه کاربردی، شما اکنون میتوانید یک مدل «استدلالی» را روی دستگاههای لبه (Edge Device) اجرا کنید، اما با یک معامله: چون مدل تنها «فرمت» استدلال را تقلید میکند و نه هوش زیربنایی یک مدل غولپیکر را، نمیتواند منطقهای پیچیده سطح مرزی را اجرا کند. این مدل ظاهرِ یک فرآیند تفکر را بازسازی میکند که برای ساختاردهی به خروجیها مفید است، اما ممکن است در دقت واقعیات عمیق دچار نقص باشد.
همچنین این پروژه یک پرسش باز در مورد مجوز (Licensing) ایجاد کرده است؛ زیرا وزنهای پایه تحت مجوز Apache-2.0 هستند، اما تنظیم دقیق از خروجیهای یک مدل تجاری (Claude) استفاده کرده است. علاوه بر این، هیچ بنچمارک یا مجموعهداده آموزشی منتشر نشده است و ادعاهای مربوط به توانایی مدل فعلاً غیرقابل راستیآزمایی است.
گام بعدی شما
- اگر اولاما (Ollama) دارید، با دستور
ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_Mسریعترین نسخه را تست کنید. - از این مدل برای ساختارهای خروجی منظم استفاده کنید، اما نتایج استدلالی را با یک مدل بزرگتر تطبیق دهید.
- بررسی کنید که آیا حذف بلوکهای تفکر (Thinking blocks) در اپلیکیشن نهایی شما، تجربه کاربری را بهبود میبخشد یا خیر.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو