پرش به محتوای اصلی
پرش به محتوای مقاله

AI Video Studio با مدل‌های محلی نیاز به کلید API را حذف کرد

·۱۸ مهر ۱۴۰۵۴ دقیقه مطالعه
راهنما
نحوه افزودن هوش مصنوعی محلی به اپلیکیشن ویدیویی رایگان بدون نیاز به API و اجرا روی کامپیوتر شخصی
نحوه افزودن هوش مصنوعی محلی به اپلیکیشن ویدیویی رایگان بدون نیاز به API و اجرا روی کامپیوتر شخصی
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

پیاده‌سازی موفق یک مدل ۴ میلیاردی محلی که با استفاده از JSON Schema، محدودیت‌های شمارش کلمات و فرمت‌بندی را در یک برنامه دسکتاپ کاملاً رایگان حل کرده است.

تصور کنید ابزارهای تولید محتوا دیگر شما را مجبور به مدیریت کلیدهای پیچیده API و پرداخت هزینه برای هر درخواست نکنند. این رویا در ۹ اکتبر ۲۰۲۶ به واقعیت تبدیل شد؛ زمانی که توسعه‌دهنده AI Video Studio یک مدل زبانی کوچک (SLM) — شبیه به یک دستیار متخصص که فقط روی یک موضوع خاص آموزش دیده و فضای کمی اشغال می‌کند — را مستقیماً در این برنامه متن‌باز ویندوزی جای داد. این اقدام به طور موثری اصلی مانعی را که کاربران جدید را از تولید اولین ویدیوهایشان باز می‌داشت، از بین برد.

بیشتر برنامه‌های هوش مصنوعی به سرویس‌های ابری متکی هستند که کاربر را مجبور به مدیریت چندین کلید API و پرداخت هزینه به ازای هر درخواست می‌کند. برای ابزاری رایگان که پیش از این برای دسترسی به تصاویر استوک به یک کلید API نیاز داشت، افزودن یک لایه احراز هویت دیگر معمولاً منجر به راندن کاربران و ترک برنامه می‌شد. هدف نهایی این بود که هوش برنامه از ابر به سخت‌افزار خود کاربر منتقل شود. این رویکرد یادآور تلاش‌های مشابه در معماری WorldScript Studio برای حذف وابستگی حیاتی به سرویس‌های هوش مصنوعی است که بر جداسازی زیرساخت برنامه از مدل‌های خارجی تأکید داشت.

بستر فنی

این برنامه فیلم‌نامه‌ها را به ویدیوهای کوتاهی تبدیل می‌کند که شامل تصاویر استوک، صدای عصبی و زیرنویس‌های کلمه-به-کلمه است. پیش از این، کاربران مجبور بودند فیلم‌نامه‌ها را به صورت دستی و در یک فرمت سخت‌گیرانه شامل «Visual: / Voice:» بنویسند. برای خودکارسازی این فرآیند، توسعه‌دهنده یک هوش مصنوعی محلی را که همراه با خود برنامه عرضه می‌شود، ادغام کرد.

به نقل از گزارش وب‌سایت dev.to، این پیاده‌سازی برای ایجاد تعادل بین عملکرد و مصرف حافظه از ترکیب فنی زیر استفاده می‌کند:

  • مدل: Qwen3 4B (فایل GGUF ۴ بیتی، ۲.۵ گیگابایت) تحت لایسنس Apache 2.0.
  • محیط اجرا: llama-server متعلق به لاماسی‌پلاس‌پلاس (llama.cpp) با لایسنس MIT که به صورت یک فرآیند مجزا (Separate Process) در پس‌زمینه اجرا می‌شود.
  • نحوه توزیع: نصاب برنامه مدل را تنها یک‌بار دانلود کرده و صحت آن را از طریق کد SHA-256 تأیید می‌کند. مدل در مسیری خارج از پوشه نصب برنامه قرار می‌گیرد تا به‌روزرسانی‌های احتمالی برنامه باعث دانلود مجدد مدل نشود.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی مدل‌های لبه (Edge AI) اشاره کردیم، انتقال پردازش به سخت‌افزار کاربر، حریم خصوصی را به شدت افزایش می‌دهد. این گرایش به پردازش محلی در سیستم‌عامل‌ها نیز دیده می‌شود، مشابه آنچه در توزیع Linux-AI OS برای حذف ترس از ترمینال با هوش مصنوعی محلی مشاهده کردیم.

جزئیات پیاده‌سازی

برای حفظ پایداری سیستم، برنامه llama-server را به عنوان یک فرآیند مجزا اجرا می‌کند، تنها یک درخواست می‌فرستد و بلافاصله آن را می‌بندد. این موضوع حیاتی است زیرا فرآیند رندرینگ ویدیو به شدت به حافظه رم نیاز دارد و باید فضای اشغال شده توسط مدل را پس بگیرد.

بر اساس مستندات توسعه‌دهنده، تست‌های انجام‌شده روی سه اندازه مختلف از مدل، یک آستانه بحرانی را برای اندازه مدل نشان داد:

  • Qwen2.5 0.5B (۴۹۱ مگابایت): این مدل محدودیت‌های طول متن را نادیده گرفت و جملات کامل را در جاهایی قرار داد که باید کلمات کلیدی برای جست‌وجوی تصاویر می‌بودند.
  • Qwen2.5 1.5B (۱.۱ گیگابایت): این مدل عمدتاً جملات ورودی را عیناً کپی کرد و در برخی موارد آن‌ها را دو بار تکرار نمود.
  • Qwen3 4B (۲.۵ گیگابایت): این مدل توانست با موفقیت متن را بازنویسی کند و به طول مورد نظر برسد.

برای حل مشکل رایج مدل‌های زبانی در شمارش دقیق کلمات، برنامه از یک رویکرد دوگانه استفاده می‌کند. اول، خروجی را از طریق یک طرحواره JSON (JSON Schema) که شامل لیستی از صحنه‌هاست، اجبار می‌کند. دوم، تعداد دقیق صحنه‌ها را (با برابر قرار دادن minItems و maxItems) هم در پرامپت و هم در طرحواره تنظیم می‌کند. این کار تضمین می‌کند که یک ویدیوی ۳۰ ثانیه‌ای همیشه دقیقاً از هشت جمله کوتاه (هر کدام حدود ۱۰ کلمه) تشکیل شود.

افزودن یک مثال موفق از تبادل کاربر/دستیار به عنوان نمونه (Few-shot prompting)، نتایج را بیشتر بهبود بخشید. این کار مانع از کپی کردن جملات توسط مدل شد و آن را به بازنویسی تشویق کرد؛ هرچند باعث شد مدل اندازه مثال را تقلید کند که این موضوع دوباره نیاز به تثبیت تعداد صحنه‌ها را تقویت کرد.

عملکرد سیستم به شدت به سخت‌افزار وابسته است. با استفاده از نسخه Vulkan در llama.cpp، برنامه می‌تواند از واحد پردازش گرافیکی (GPU) شرکت‌های انویدیا، ای‌ام‌دی و اینتل استفاده کند. در یک کارت گرافیک RTX 4060، تولید فیلم‌نامه حدود ۳ ثانیه زمان می‌برد، در حالی که این زمان روی یک پردازنده استاندارد به ۲۳ ثانیه می‌رسد. توسعه‌دهنده به طور صریح تعداد لایه‌های GPU (از جمله مقدار ۰) را ارسال می‌کند تا اطمینان حاصل شود که گزینه «خاموش کردن» GPU به طور مطلق عمل می‌کند.

برای جلوگیری از کرش کردن سیستم، یک مهلت زمانی (Timeout) سه دقیقه‌ای و یک بررسی حافظه آزاد (Free-memory check) پیش از شروع سرور تعبیه شده است. اگر مدل محلی به دلیل کمبود رم یا کندی بیش از حد PC شکست بخورد، سیستم به یک جداکننده جملات ساده و غیر هوش مصنوعی بازمی‌گردد تا کاربر هرگز بدون نتیجه نماند.

این چرخش به سمت «هوش مصنوعی نامرئی» نشان می‌دهد که برنامه‌های کاربردی در آینده به جای APIهای ابری عمومی، با مدل‌های کوچک و تخصصی عرضه می‌شوند. این رویکرد در واقع پاسخی به چالش‌های وابستگی به ارائه‌دهندگان است، مشابه آنچه در بحث لایه انتزاعی SDK برای رهایی از وابستگی به یک مدل هوش بررسی کردیم. برای کاربر، این یعنی حریم خصوصی کامل و هزینه صفر؛ و برای توسعه‌دهنده، کاهش چشمگیر نرخ ریزش کاربران در مراحل ابتدایی (Onboarding).

اگرچه نسخه فعلی فقط برای ویندوز است و گاهی جزئیات کوچکی را اشتباه می‌نویسد — مثلاً تغییر دادن عبارت «هر روز کاری» به «هر روز» — اما یک نقشه راه برای ادغام هوش مصنوعی محلی ارائه می‌دهد. این پروژه در گیت‌هاب برای مطالعه سایر توسعه‌دهندگان باز است.

کاربران علاقه‌مند می‌توانند پیاده‌سازی این سیستم را در مخزن گیت‌هاب AI Video Studio بررسی کنند یا قابلیت‌های استنتاج محلی را روی سخت‌افزار خود تست نمایند.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، مخزن گیت‌هاب AI Video Studio را برای بررسی نحوه مدیریت فرآیندهای مجزای llama-server مطالعه کنید.
  • سخت‌افزار خود را برای اجرای مدل‌های ۴ میلیاردی تست کنید تا متوجه تفاوت سرعت استنتاج روی GPU و CPU شوید.
  • از طرحواره‌های JSON برای محدود کردن خروجی مدل‌های کوچک استفاده کنید تا از توهمات ساختاری جلوگیری شود.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این پروژه ثابت می‌کند که مدل‌های زبانی کوچک (SLM) می‌توانند جایگزین APIهای گران‌قیمت در ابزارهای کاربردی شوند. این تغییر، تجربه کاربری را با حذف مراحل احراز هویت بهبود می‌بخشد و حریم خصوصی داده‌ها را تضمین می‌کند.

تأثیر برای ایران

این رویکرد برای توسعه‌دهندگان ایرانی که با محدودیت‌های پرداخت ارزی و تحریم APIهای ابری مواجه‌اند، یک راهکار جایگزین و قدرتمند برای ساخت ابزارهای هوشمند محلی است.

·نگاه ما
تحریریه دات‌هوش

استفاده از مدل‌های ۴ میلیاردی به جای مدل‌های غول‌پیکر نشان می‌دهد که برای کارهای ساختاریافته مثل بازنویسی متن، «دقت در فرمت» مهم‌تر از «دانش کلی» است. ترکیب JSON Schema با مدل‌های کوچک، عملاً ضعف‌های استدلالی آن‌ها را می‌پوشاند و خروجی قابل پیش‌بینی ایجاد می‌کند. این رویکرد، مدل‌های کوچک را از یک اسباب‌بازی به ابزارهای تولیدی تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.