چرا اجرای محلی، عملیترین مسیر برای کاربرِ ایرانی است
سرویسهای ابریِ هوش مصنوعی مثلِ ChatGPT و Claude از ایران مسدودند و نسخهٔ کاملشان پرداختِ بینالمللی میخواهد. اما یک راهِ سوم هست که هر دو مانع را دور میزند: اجرای مدل روی کامپیوترِ خودتان. مدلهای «متنباز» (open-weight) را میتوان دانلود کرد و بهصورتِ کاملاً محلی اجرا کرد — بدونِ اینترنتِ خارجی، بدونِ پرداخت، و با حفظِ کاملِ حریمِ خصوصی، چون هیچ دادهای از سیستمِ شما بیرون نمیرود. این راهنما قدمبهقدم نشان میدهد چطور شروع کنید، چه انتظاری داشته باشید، و کجا این مسیر بهصرفه است و کجا نه.
چه چیزی لازم دارید
برای شروع به سختافزارِ خیلی خاصی نیاز ندارید. یک مدلِ کوچک (حدودِ ۷ تا ۸ میلیارد پارامتر) روی سیستمی با حدودِ ۸ گیگابایت رم اجرا میشود؛ روی پردازندهٔ معمولی کندتر است و با کارتِ گرافیک بهمراتب سریعتر. یک نکتهٔ فنیِ مفید: مدلها معمولاً در نسخههای «فشردهشده» (quantized) هم عرضه میشوند که حافظهٔ کمتری میخواهند و با افتِ کیفیتِ ناچیز روی سیستمهای معمولی جا میشوند — ابزارهایی که در ادامه میگوییم بهطورِ پیشفرض همین نسخههای بهینه را میگیرند. هرچه رم و کارتِ گرافیکِ قویتری داشته باشید، مدلهای بزرگتر و باکیفیتتر را هم میتوانید اجرا کنید. نکتهٔ مهم این است: لازم نیست بهترین سختافزار را داشته باشید تا شروع کنید.
سادهترین راه: Ollama
راحتترین نقطهٔ شروع، ابزارِ رایگانی به نامِ Ollama است. آن را نصب میکنید و با یک فرمانِ ساده، مدلِ دلخواه را دانلود و اجرا میکنید — مثلِ ollama run llama3. اگر با خطِ فرمان راحت نیستید، LM Studio یک گزینهٔ گرافیکی است که همان کار را با چند کلیک انجام میدهد. و کسانی که محیطی شبیهِ ChatGPT میخواهند میتوانند Open WebUI را کنارِ Ollama نصب کنند تا یک پنجرهٔ گفتوگوی مرتب داشته باشند. هر سه رایگاناند و کاملاً محلی کار میکنند؛ هیچچیز به سرورِ خارجی فرستاده نمیشود.
ده دقیقهٔ اول، قدمبهقدم
۱) از سایتِ Ollama نسخهٔ ویندوز، مک یا لینوکس را نصب کنید. ۲) ترمینال (یا Command Prompt در ویندوز) را باز کنید. ۳) فرمانِ ollama run qwen2.5 را بزنید؛ بارِ اول مدل دانلود میشود (چند گیگابایت، کمی صبر میخواهد) و دفعاتِ بعد فوری بالا میآید. ۴) حالا میتوانید مثلِ یک چتِ معمولی فارسی بنویسید و جواب بگیرید — همهچیز روی سیستمِ خودتان. اگر سرعت کم بود، یک مدلِ کوچکتر را امتحان کنید؛ اگر کیفیت کم بود و سختافزار اجازه داد، یک مدلِ بزرگتر.
از کدام مدل شروع کنیم
برای شروع، یک مدلِ کوچک و متعادل انتخاب کنید: Llama (نسخهٔ ۸ میلیاردی) یا Qwen گزینههای خوبیاند که هم کیفیتِ قابلِقبولی دارند و هم روی سیستمِ معمولی اجرا میشوند. برای کارِ فارسی، Qwen معمولاً از بقیه روانتر است. اگر سختافزارِ قویتری دارید، میتوانید سراغِ نسخههای بزرگترِ همین مدلها بروید که کیفیتِ بالاتری دارند. DeepSeek هم اگر تمرکزتان استدلال و محاسبه است گزینهٔ خوبی است. قاعدهٔ کلی: اول کوچک را امتحان کنید، بعد بر اساسِ سرعت و کیفیت یک پله بالا یا پایین بروید. علاوه بر مدلهای عمومی، نسخههای تخصصی هم هست: مدلهایی که برای کدنویسی تنظیم شدهاند، یا مدلهای «چندوجهی» که میتوانند عکس را هم بفهمند. برای شروع لازم نیست سراغشان بروید، اما خوب است بدانید با همان ابزار در دسترساند.
کجا اجرای محلی میدرخشد
اجرای محلی برای چند کار بهخصوص ارزشمند است: کار با اسنادِ حساس (قرارداد، اطلاعاتِ شخصی، دادهٔ کاری) که نمیخواهید به سرورِ کسی برود؛ استفادهٔ بیحدومرز بدونِ نگرانی از هزینه یا سهمیه؛ و کار در شرایطی که دسترسیِ پایدار به سرویسهای خارجی ندارید. برای نوشتن، ترجمه، خلاصهسازی و کدنویسیِ ساده، یک مدلِ محلی معمولاً کاملاً کافی است.
چه انتظاری داشته باشید
صادقانه بگوییم: کیفیتِ این مدلها معمولاً یک پله پایینترِ از پیشروهای بسته مثلِ ChatGPT است — نزدیک، ولی نه دقیقاً برابر. چند محدودیتِ دیگر هم هست: مدلِ محلی بهطورِ پیشفرض به اینترنت وصل نیست (پس اخبارِ روز یا جستوجوی زنده ندارد)، دانشش تا تاریخِ آموزشش است، و راهاندازیِ اولش کمی صبر میخواهد. در عوض، سه چیز را بهدست میآورید که در مسیرِ ابری ندارید: رایگانبودن، استقلال از مسدودسازی، و حریمِ خصوصیِ کامل. برای بیشترِ کارهای روزمره همین کافی است.
اگر کند یا سنگین بود
اگر اجرا کند بود یا سیستم سنگین شد، چند ترفندِ ساده کمک میکند: برنامههای دیگر را ببندید تا رم آزاد شود؛ یک مدلِ کوچکتر یا نسخهٔ فشردهترِ (quantized) همان مدل را انتخاب کنید؛ و اگر کارتِ گرافیک دارید، مطمئن شوید ابزار از آن استفاده میکند (Ollama و LM Studio معمولاً خودکار این کار را انجام میدهند). برای کارهای کوتاه، حتی یک مدلِ ۳ تا ۴ میلیاردی هم میتواند کافی باشد و خیلی سبکتر اجرا شود.
ابری یا محلی؟ کوتاه و روشن
اگر بیشترین کیفیت و جستوجوی زنده میخواهید و پرداختِ بینالمللی برایتان ممکن است، مسیرِ ابری — در صورتِ دسترسی — جلوتر است. اما اگر دسترسیِ پایدار، رایگانبودن و حریمِ خصوصی برایتان مهمتر است — که برای بیشترِ کاربرانِ ایرانی همینطور است — اجرای محلی برندهٔ روشن است. خیلیها هم از هر دو استفاده میکنند: محلی برای کارهای روزمره و حساس، و ابری هر وقت در دسترس بود برای کارهای سنگینتر.
جمعبندی
برای کاربرِ ایرانی، اجرای محلیِ مدلهای متنباز پایدارترین مسیر است: نه مسدود میشود، نه پولی میخواهد، و دادهتان پیشِ خودتان میماند. از کوچک شروع کنید — Ollama را نصب کنید و یک مدلِ ۸ میلیاردیِ Llama یا Qwen را امتحان کنید — و هرچه جلوتر رفتید و سختافزارتان اجازه داد، به مدلهای بزرگتر ارتقا دهید. مهم این است که همین امروز، با همان سیستمی که دارید، میتوانید شروع کنید.




گفتگو