پرش به محتوای اصلی
پرش به محتوای مقاله

درون اختلافی که DiffusionGemma را از LM Studio دور کرد

·۱۶ تیر ۱۴۰۵۲ دقیقه مطالعه۱ بازدید
نمودار عملکرد DiffusionGemma در ژوئیه ۲۰۲۶: نقاط قوت، محدودیت‌ها و زمان اجرا در Ollama
نمودار عملکرد DiffusionGemma در ژوئیه ۲۰۲۶: نقاط قوت، محدودیت‌ها و زمان اجرا در Ollama
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تضاد میان پشتیبانی سریع vLLM و توقف کامل llama.cpp؛ در حالی که مدل‌ها به سرعت رشد می‌کنند، زیرساخت‌های Local Hosting به‌دلیل اختلافات مدیریتی در پروژه‌های متن‌باز، به گلوگاه تبدیل شده‌اند.

تصور کنید قدرتمندترین ابزار سال ۲۰۲۶ را در اختیار داشته باشید، اما یک خط کد در یک پروژه متن‌باز، کل دسترسی شما را به آن ببندد. این اتفاقی است که همین حالا برای هزاران کاربرِ مدل‌های محلی رخ داده است.

طبق گزارشی که ۷ جولای ۲۰۲۶ در وب‌سایت dev.to منتشر شد، مدل DiffusionGemma — که یک مدل انتشار (Diffusion Model) است و شبیه به هنرمندی عمل می‌کند که ابتدا یک بوم پر از برف و نویز می‌بیند و سپس ذره‌ذره آن را به یک تصویر دقیق تبدیل می‌کند — با یک بن‌بست فنی مواجه شده است. در واقع، کل اکوسیستم میزبانی محلی به‌دلیل یک «درخواست تغییر کد» (Pull Request) شماره ۲۴۴۲۳ در پروژه لاماسیمپلاس‌پلاس (llama.cpp) متوقف شده است.

همان‌طور که در تحلیل‌های قبلی ما درباره‌ی پایداری استک‌های هوش مصنوعی محلی اشاره کردیم، وابستگی شدید ابزارها به یک موتور واحد می‌تواند ریسک‌های پیش‌بینی‌نشده‌ای ایجاد کند. در اینجا، اولاما (Ollama) و LM Studio که هر دو از موتور llama.cpp استفاده می‌کنند، عملاً فلج شده‌اند. دلیل این وضعیت، یک اختلاف دیدگاه طراحی است: یکی از نگهبانان پروژه اصرار دارد که به‌جای یک اصلاح سریع برای این مدل خاص، یک سرور کلی برای تمام مدل‌های انتشار ساخته شود. این موضوع باعث شده است درخواستی که از ۱۰ ژوئن قابلیت ادغام داشت، همچنان در وضعیت بلاتکلیفی باقی بماند.

وضعیت فعلی اجرای DiffusionGemma به شرح زیر است:

  • vLLM: تنها گزینه پیشنهادی برای پشتیبانی روز اول؛ قابلیت موازی‌سازی تانسور برای چندین GPU در ۲۶ ژوئن از طریق PR #46177 اضافه شد.
  • llama.cpp: نیاز به ساخت دستی (Build) از یک شاخه‌ی (Branch) خاص با فعال‌سازی CUDA دارد و هنوز در نسخه‌ی اصلی نیست.
  • Ollama: پشتیبانی داخلی ندارد. کاربران باید llama.cpp را دستی بسازند و از یک Modelfile سفارشی به‌عنوان پل ارتباطی استفاده کنند.
  • LM Studio: کاملاً مسدود است تا زمانی که موتور اصلی به‌روزرسانی شود.

برای کسانی که قصد راه‌اندازی این مدل را دارند، طبق مستندات فنی، از کوانتلاسیون (Quantization) — که شبیه به فشرده‌سازی یک عکس برای اشغال فضای کمتر است اما کمی از کیفیت می‌کاهد — مدل nvfp4 در vLLM استفاده نکنید. این حالت به‌دلیل عدم تطابق اندازه لایه‌های مدل با مضربی از ۱۲۸، توسط هسته‌های MoE رد می‌شود. همچنین توصیه می‌شود تا زمان ادغام PR #46454، به‌جای فرمت GGUF از وزن‌های BF16 استفاده کنید.

گام بعدی شما

  • اگر سخت‌افزار مناسب دارید، همین حالا مدل را روی vLLM مستقر کنید تا از سرعت ۴ برابری آن بهره‌مند شوید.
  • مخزن GitHub پروژه llama.cpp را برای ادغام PR #24423 زیر نظر بگیرید.
  • وضعیت به‌روزرسانی‌های پشتیبانی را در سایت diffrun.dev دنبال کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است؛ به بررسی ما درباره‌ی بهینه سازی‌های حافظه در تراشه‌های نسل جدید مراجعه کنید.

چرا این موضوع مهم است؟

این بن‌بست فنی، تضاد میان سرعت توسعه مدل‌ها و سرعت آماده‌سازی زیرساخت‌های توزیع را آشکار می‌کند. بر اساس تجربه استقرار مدل‌های محلی، تا زمانی که استانداردهای لایه‌ی اجرا (Inference Layer) یکپارچه نشوند، هر به‌روزرسانی بزرگ با تاخیرهای پیش‌بینی‌نشده روبرو خواهد بود.

تأثیر برای ایران

به‌دلیل وابستگی برنامه‌نویسان ایرانی به ابزارهای رایگان و محلی مثل Ollama برای دور زدن محدودیت‌های API، این مسدودیت باعث می‌شود دسترسی به DiffusionGemma تنها برای کسانی که مهارت نصب vLLM را دارند ممکن باشد.

·نگاه ما
تحریریه دات‌هوش

این اتفاق نشان می‌دهد که «دموکراسی» در پروژه‌های متن‌باز گاهی به «دیکتاتوری» تبدیل می‌شود؛ جایی که سلیقه‌ی یک توسعه‌دهنده می‌تواند دسترسی میلیون‌ها کاربر به تکنولوژی‌های بهینه را متوقف کند. وابستگی کل بازار ابزارهای محلی به یک کتابخانه واحد (llama.cpp)، نقطه شکست (Single Point of Failure) خطرناکی است که ضرورت ایجاد جایگزین‌های متنوع‌تر را بیش از پیش می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.