تصور کنید ابزارهای تولید محتوا دیگر شما را مجبور به مدیریت کلیدهای پیچیده API و پرداخت هزینه برای هر درخواست نکنند. این رویا در ۹ اکتبر ۲۰۲۶ به واقعیت تبدیل شد؛ زمانی که توسعهدهنده AI Video Studio یک مدل زبانی کوچک (SLM) — شبیه به یک دستیار متخصص که فقط روی یک موضوع خاص آموزش دیده و فضای کمی اشغال میکند — را مستقیماً در این برنامه متنباز ویندوزی جای داد. این اقدام به طور موثری اصلی مانعی را که کاربران جدید را از تولید اولین ویدیوهایشان باز میداشت، از بین برد.
بیشتر برنامههای هوش مصنوعی به سرویسهای ابری متکی هستند که کاربر را مجبور به مدیریت چندین کلید API و پرداخت هزینه به ازای هر درخواست میکند. برای ابزاری رایگان که پیش از این برای دسترسی به تصاویر استوک به یک کلید API نیاز داشت، افزودن یک لایه احراز هویت دیگر معمولاً منجر به راندن کاربران و ترک برنامه میشد. هدف نهایی این بود که هوش برنامه از ابر به سختافزار خود کاربر منتقل شود. این رویکرد یادآور تلاشهای مشابه در معماری WorldScript Studio برای حذف وابستگی حیاتی به سرویسهای هوش مصنوعی است که بر جداسازی زیرساخت برنامه از مدلهای خارجی تأکید داشت.
بستر فنی
این برنامه فیلمنامهها را به ویدیوهای کوتاهی تبدیل میکند که شامل تصاویر استوک، صدای عصبی و زیرنویسهای کلمه-به-کلمه است. پیش از این، کاربران مجبور بودند فیلمنامهها را به صورت دستی و در یک فرمت سختگیرانه شامل «Visual: / Voice:» بنویسند. برای خودکارسازی این فرآیند، توسعهدهنده یک هوش مصنوعی محلی را که همراه با خود برنامه عرضه میشود، ادغام کرد.
به نقل از گزارش وبسایت dev.to، این پیادهسازی برای ایجاد تعادل بین عملکرد و مصرف حافظه از ترکیب فنی زیر استفاده میکند:
- مدل: Qwen3 4B (فایل GGUF ۴ بیتی، ۲.۵ گیگابایت) تحت لایسنس Apache 2.0.
- محیط اجرا: llama-server متعلق به لاماسیپلاسپلاس (llama.cpp) با لایسنس MIT که به صورت یک فرآیند مجزا (Separate Process) در پسزمینه اجرا میشود.
- نحوه توزیع: نصاب برنامه مدل را تنها یکبار دانلود کرده و صحت آن را از طریق کد SHA-256 تأیید میکند. مدل در مسیری خارج از پوشه نصب برنامه قرار میگیرد تا بهروزرسانیهای احتمالی برنامه باعث دانلود مجدد مدل نشود.
همانطور که در تحلیلهای پیشین ما دربارهی مدلهای لبه (Edge AI) اشاره کردیم، انتقال پردازش به سختافزار کاربر، حریم خصوصی را به شدت افزایش میدهد. این گرایش به پردازش محلی در سیستمعاملها نیز دیده میشود، مشابه آنچه در توزیع Linux-AI OS برای حذف ترس از ترمینال با هوش مصنوعی محلی مشاهده کردیم.
جزئیات پیادهسازی
برای حفظ پایداری سیستم، برنامه llama-server را به عنوان یک فرآیند مجزا اجرا میکند، تنها یک درخواست میفرستد و بلافاصله آن را میبندد. این موضوع حیاتی است زیرا فرآیند رندرینگ ویدیو به شدت به حافظه رم نیاز دارد و باید فضای اشغال شده توسط مدل را پس بگیرد.
بر اساس مستندات توسعهدهنده، تستهای انجامشده روی سه اندازه مختلف از مدل، یک آستانه بحرانی را برای اندازه مدل نشان داد:
- Qwen2.5 0.5B (۴۹۱ مگابایت): این مدل محدودیتهای طول متن را نادیده گرفت و جملات کامل را در جاهایی قرار داد که باید کلمات کلیدی برای جستوجوی تصاویر میبودند.
- Qwen2.5 1.5B (۱.۱ گیگابایت): این مدل عمدتاً جملات ورودی را عیناً کپی کرد و در برخی موارد آنها را دو بار تکرار نمود.
- Qwen3 4B (۲.۵ گیگابایت): این مدل توانست با موفقیت متن را بازنویسی کند و به طول مورد نظر برسد.
برای حل مشکل رایج مدلهای زبانی در شمارش دقیق کلمات، برنامه از یک رویکرد دوگانه استفاده میکند. اول، خروجی را از طریق یک طرحواره JSON (JSON Schema) که شامل لیستی از صحنههاست، اجبار میکند. دوم، تعداد دقیق صحنهها را (با برابر قرار دادن minItems و maxItems) هم در پرامپت و هم در طرحواره تنظیم میکند. این کار تضمین میکند که یک ویدیوی ۳۰ ثانیهای همیشه دقیقاً از هشت جمله کوتاه (هر کدام حدود ۱۰ کلمه) تشکیل شود.
افزودن یک مثال موفق از تبادل کاربر/دستیار به عنوان نمونه (Few-shot prompting)، نتایج را بیشتر بهبود بخشید. این کار مانع از کپی کردن جملات توسط مدل شد و آن را به بازنویسی تشویق کرد؛ هرچند باعث شد مدل اندازه مثال را تقلید کند که این موضوع دوباره نیاز به تثبیت تعداد صحنهها را تقویت کرد.
عملکرد سیستم به شدت به سختافزار وابسته است. با استفاده از نسخه Vulkan در llama.cpp، برنامه میتواند از واحد پردازش گرافیکی (GPU) شرکتهای انویدیا، ایامدی و اینتل استفاده کند. در یک کارت گرافیک RTX 4060، تولید فیلمنامه حدود ۳ ثانیه زمان میبرد، در حالی که این زمان روی یک پردازنده استاندارد به ۲۳ ثانیه میرسد. توسعهدهنده به طور صریح تعداد لایههای GPU (از جمله مقدار ۰) را ارسال میکند تا اطمینان حاصل شود که گزینه «خاموش کردن» GPU به طور مطلق عمل میکند.
برای جلوگیری از کرش کردن سیستم، یک مهلت زمانی (Timeout) سه دقیقهای و یک بررسی حافظه آزاد (Free-memory check) پیش از شروع سرور تعبیه شده است. اگر مدل محلی به دلیل کمبود رم یا کندی بیش از حد PC شکست بخورد، سیستم به یک جداکننده جملات ساده و غیر هوش مصنوعی بازمیگردد تا کاربر هرگز بدون نتیجه نماند.
این چرخش به سمت «هوش مصنوعی نامرئی» نشان میدهد که برنامههای کاربردی در آینده به جای APIهای ابری عمومی، با مدلهای کوچک و تخصصی عرضه میشوند. این رویکرد در واقع پاسخی به چالشهای وابستگی به ارائهدهندگان است، مشابه آنچه در بحث لایه انتزاعی SDK برای رهایی از وابستگی به یک مدل هوش بررسی کردیم. برای کاربر، این یعنی حریم خصوصی کامل و هزینه صفر؛ و برای توسعهدهنده، کاهش چشمگیر نرخ ریزش کاربران در مراحل ابتدایی (Onboarding).
اگرچه نسخه فعلی فقط برای ویندوز است و گاهی جزئیات کوچکی را اشتباه مینویسد — مثلاً تغییر دادن عبارت «هر روز کاری» به «هر روز» — اما یک نقشه راه برای ادغام هوش مصنوعی محلی ارائه میدهد. این پروژه در گیتهاب برای مطالعه سایر توسعهدهندگان باز است.
کاربران علاقهمند میتوانند پیادهسازی این سیستم را در مخزن گیتهاب AI Video Studio بررسی کنند یا قابلیتهای استنتاج محلی را روی سختافزار خود تست نمایند.
گام بعدی شما
- اگر توسعهدهنده هستید، مخزن گیتهاب AI Video Studio را برای بررسی نحوه مدیریت فرآیندهای مجزای llama-server مطالعه کنید.
- سختافزار خود را برای اجرای مدلهای ۴ میلیاردی تست کنید تا متوجه تفاوت سرعت استنتاج روی GPU و CPU شوید.
- از طرحوارههای JSON برای محدود کردن خروجی مدلهای کوچک استفاده کنید تا از توهمات ساختاری جلوگیری شود.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو