تصور کنید بخواهید یکی از قدرتمندترین مدلهای هوش مصنوعی جهان را اجرا کنید، اما به جای یک مرکز داده مخفی، از قدرت لپتاپ خود و هزاران داوطلب دیگر در سراسر جهان استفاده کنید. اکنون اجرای مدلهای غولپیکر ۴۰۵ میلیارد پارامتری بر روی یک واحد پردازش گرافیکی (GPU) معمولی، از طریق پیوستن به یک شبکه غیرمتمرکز ممکن شده است.
Petals — محصول کارگاه پژوهشی BigScience — سیستمی برای استنتاج (Inference) — که شبیه به لحظه آشپزی واقعی است، نه یادگیری دستور پخت — به سبک بیتتورنت است. در این ساختار، بار محاسباتی بین جمعیتی جهانی از کاربران تقسیم میشود تا هیچکس مجبور نباشد تمام وزنهای مدل را در حافظه خود جای دهد.
همانطور که در تحلیلهای قبلی ما دربارهی امنیت مدلهای بازمتن اشاره کردیم، میل به کنترل محلی و شفافیت در اجرا، توسعهدهندگان را به سمت جایگزینهای وزنهای باز (Open Weights) — یعنی مدلهایی که دستور پخت آنها علناً منتشر شده است — سوق میدهد تا از محدودیتهای شرکتهای بزرگ عبور کنند. این گرایش به مدلهای وزنباز در کنار نیاز به زیرساختهای بهینه، بحثهایی را درباره تفاوت میان سرویسهای مدیریتشده و زیرساختهای سختافزاری در محیطهای عملیاتی ایجاد کرده است.
طبق مستندات petals.dev که در ۲۳ جولای ۲۰۲۶ بهروزرسانی شده است، این سامانه از مدلهای سنگین زیر پشتیبانی میکند:
- Llama 3.1 (تا ۴۰۵ میلیارد پارامتر)
- Mixtral (نسخه 8x22B)
- Falcon (مدلهای 40B و 180B)
- BLOOM (نسخه 176B)
بر اساس گزارشهای فنی، سرعت اجرا بسته به اندازه مدل متفاوت است. برای مدل Llama 2 (70B)، سرعت استنتاج در دستههای تکگانه به ۶ توکن در ثانیه میرسد. در مدل عظیمتر Falcon (180B)، این سرعت تا ۴ توکن در ثانیه است که برای چتباتهای تعاملی و برنامههای آنی کاملاً کافی است. کاربران برخلاف APIهای متمرکز، میتوانند مسیرهای سفارشی را در مدل اجرا کرده یا وضعیتهای پنهان را با استفاده از PyTorch و کتابخانه Hugging Face Transformers بررسی کنند.
این رویکرد، دسترسی به هوش مصنوعی پیشرو را دموکراتیزه میکند و قدرت را از مراکز داده عظیم به سیستمهای خانگی و نمونههای Google Colab منتقل میکند. این پروژه با تبدیل وزنهای مدل به بلوکهای دادهای مشترک، سد سختافزاری را میشکند که پیش از این کاربران را به استفاده از مدلهای کوچک و کوانتیده محدود میکرد.
گام بعدی شما
- برای شناسایی گرههای فعال و مدلهای جدید، سرور دیسکورد Petals را رصد کنید.
- اگر توسعهدهنده هستید، تست اجرای مدلهای 405B را در محیط Colab آغاز کنید.
- بررسی کنید کدام بخش از حافظه VRAM شما میتواند میزبان یک تکه از مدل باشد.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو