پرش به محتوای اصلی
پرش به محتوای مقاله

Reame هزینه استنتاج را با ذخیره‌سازی حافظه در دیسک کاهش داد

·۲۰ تیر ۱۴۰۵۹ دقیقه مطالعه
سرور استنتاج LLM مبتنی بر CPU با کش دیسک، حدس‌زنی خودتنظیم، بایگانی تولید و چندکاربره. سخت‌افزار شما، قلمرو شما.
سرور استنتاج LLM مبتنی بر CPU با کش دیسک، حدس‌زنی خودتنظیم، بایگانی تولید و چندکاربره. سخت‌افزار شما، قلمرو شما.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

معرفی مکانیزم Palimpsest و حافظه KV دیسک‌محور که به‌جای تکیه بر VRAM گران‌قیمت، از فضای دیسک برای ذخیره وضعیت مدل استفاده می‌کند تا هزینه استنتاج در کارهای تکراری را به نزدیک صفر برساند.

اگر برای هر درخواست به مدل‌های زبانی هزینه می‌پردازید، تصور کنید سیصدمین درخواست شما تقریباً رایگان باشد چون سرور دقیقاً یادش است با نود و نه مورد قبلی چه کرده است. این وعدهٔ اصلی Reame است؛ سروری که در ۱۱ ژوئیه ۲۰۲۶ عرضه شد تا سخت‌افزارهای ارزان‌قیمتی که همین حالا دارید را به مرکز پردازش هوش مصنوعی تبدیل کند. Reame به‌گونه‌ای طراحی شده است که با پردازنده‌های ۲ هسته‌ای ARM و vCPUهای اشتراکی به عنوان شهروندان درجه اول برخورد کند، نه به عنوان یک جایگزین کند و کند. این سرور سبک و کاملاً تست‌شده که بر پایه lllama.cpp ساخته شده، با تضمین اینکه هیچ محاسباتی هرگز دو بار انجام نشود، سخت‌افزارهایی را هدف قرار می‌دهد که کاربران از پیش دارند، به‌جای تمرکز بر خوشه‌های گران‌قیمت GPU. در واقع، این سیستم دقیقاً برای سخت‌افزاری طراحی شده است که شما در حال حاضر هزینه آن را می‌پردازید.

این تغییر مسیر درست زمانی رخ می‌دهد که توسعه‌دهندگان با اقتصاد واحد در مدل‌های SaaS با حاشیه سود کم یا محدودیت‌های شدید حریم خصوصی در کارهای حقوقی و پزشکی دست‌وپنجه نرم می‌کنند. همان‌طور که در تحلیل قبلی ما درباره‌ی تنظیم کارآمد با پارامتر اندک (PEFT) اشاره کردیم که چگونه به مدل‌ها کمک می‌کند مهارت‌های خود را حفظ کنند، Reame در نقطه مقابل این خط لوله قرار دارد: او می‌خواهد اجرای آن مدل‌ها روی ارزان‌ترین سخت‌افزار ممکن، فوق‌سریع و بهینه باشد. تصور کنید سیستمی دارید که در آن صدمین درخواست به هوش مصنوعی شما تقریباً رایگان است، زیرا سرور دقیقاً به خاطر می‌آورد که با نود و نه درخواست قبلی چگونه برخورد کرده است.

بستر نظری: اولویت با پردازنده

طبق اعلام تیم توسعه، Reame جایگزینی برای ChatGPT نیست و قصد ندارد استدلال‌های پیچیده (Frontier Reasoning)، دستیارهای کدنویسی عامل‌محور (Agentic Coding Assistants) یا نوشتارهای خلاقانه و طولانی را در مقیاس بزرگ مدیریت کند. این سخت‌افزارها برای «مغزهای» ۱۰۰ میلیارد پارامتری ساخته نشده‌اند. در عوض، Reame برای بارهای کاری هوش مصنوعی محدود و تکراری طراحی شده است؛ جایی که پاسخ دقیقاً در متن ارسالی (Context) است، نه در دانش کلی و عمومی مدل.

در این سناریوهای خاص، یک مدل کوچک می‌تواند با مدل‌های غول‌پیکر رقابت کند. این رویکرد یادآور موفقیت مدل‌های بسیار کوچک است، مانند مدل ۲۳۰ میلیون پارامتری Liquid AI که توانست در استخراج داده‌ها از رقبای ۱ میلیارد پارامتری پیشی بگیرد. تیم Reame اندازه‌گیری کردند که در استخراج اطلاعات از متون طولانی با استفاده از یک مدل ۷ میلیارد پارامتری روی یک پردازنده رایگان ۲ هسته‌ای ARM، به دقت ۱۰۰٪ رسیده است. با تمرکز بر این بخش کوچک اما حیاتی، Reame به کاربران اجازه می‌دهد اسناد خود را به‌صورت خصوصی، برای همیشه و با هزینه نهایی صفر پردازش کنند.

معماری در برابر جایگزین‌ها

وقتی Reame را با ابزارهایی مثل اولاما (Ollama) مقایسه می‌کنیم، تفاوت در اهداف بنیادی است. اولاما برای اجرای راحت و تفننی مدل‌های مختلف بهینه شده است. اما Reame برای سرویس‌دهی جدی به یک بار کاری خاص روی سخت‌افزاری که هیچ هزینه‌ای ندارد، طراحی شده است. تفاوت کلیدی این است: اولاما مدل‌ها را اجرا می‌کند، اما Reame «به خاطر می‌سپارد» که آن‌ها را اجرا کرده است.

سرورهای عمومی هر درخواست را انگار اولین بار است می‌بینند: محاسبه می‌کنند، دور می‌اندازند و تکرار می‌کنند. در GPU، هزینه محاسبه به‌اندازه کافی ارزان است که این روند پذیرفته شود. اما در CPU ارزان، محاسبه گران‌ترین منبع موجود است و دور ریختن نتایج محاسبات یک «گناه نابخvscodeنی» است. Reame با استفاده از یک سیستم حافظه و گمانه‌زنی خاص، این اتلاف را به‌طور کامل حذف می‌کند.

جزئیات: معماری یادآوری

پایه و اساس Reame بر این تز ساده است که در CPU، محاسبه گران‌ترین منبع است. برای حل این مشکل، این سرور یک KV Cache (حافظه کلید-مقدار) دیسک‌محور، پایدار و مشترک (Shared-prefix) را با مکانیسم‌های زیر پیاده‌سازی می‌کند:

  • اسنپ‌شات‌های دیسکی: پیشوندهای پرامپت با استفاده از فشرده‌سازی zstd و چک‌سام‌ها (Checksums) روی دیسک ذخیره می‌شوند. این اسنپ‌شات‌ها دارای بودجه‌بندی LRU (کم‌کاربرترین‌ها حذف شوند) هستند و حتی پس از ری‌استارت شدن فرآیند سیستم نیز باقی می‌مانند.
  • هشینگ بلوکی: پرامپت‌ها به بلوک‌های توکن با اندازه ثابت تقسیم می‌شوند؛ یک زنجیره هش (Chain Hash) هر اسنپ‌شات KV را در هر مرز بلوک کلیدگذاری می‌کند. اگر پرامپت جدیدی پیشوندی مشترک داشته باشد، Reame طولانی‌ترین مرز کش‌شده را بازیابی کرده و فقط بخش انتهایی و منحصربه‌فرد آن را رمزگشایی می‌کند.
  • پرداخت تک‌باره: به دلیل این معماری، یک پرامپت سیستمی فقط یک بار توسط اولین کاربر پردازش (پرداخت) می‌شود و برای تمام درخواست‌های بعدی در تمام جلسات بازاستفاده می‌گردد.

علاوه بر حافظه ساده، ویژگی Palimpsest معرفی شده است. این یک آرشیو n-gram روی دیسک است که هر تولید متنی تکمیل‌شده را به خاطر می‌سپارد. هر تولید تمام‌شده به این آرشیو تغذیه می‌شود و درخواست‌های آینده، پیش‌نویس‌های خود را با هزینه صفر از این آرشیو می‌گیرند. این قابلیت برای بارهای کاری تخصصی طراحی شده است که تکرار می‌شوند و به سیستم اجازه می‌دهد بدهی‌های محاسباتی خود را در طول زمان تسویه کند.

جزئیات: سرعت‌بخشی با رمزگشایی گمانه‌زنانه

برای افزایش تعداد توکن در ثانیه، سرور از مکانیزمی به نام Il Suggeritore استفاده می‌کند. این ابزار، رمزگشایی محدود به دستور زبان (Grammar-constrained decoding) را معکوس می‌کند. در حالی که رمزگشایی محدود استاندارد از ساختار برای «ممنوع کردن» توکن‌ها استفاده می‌کند، Il Suggeritore از ساختار برای «پیشنهاد» توکن‌ها استفاده می‌کند. این باعث می‌شود توکن‌های فرمت، بولت‌ها و شماره‌گذاری لیست‌ها به‌صورت رایگان گمانه‌زنی شوند، حتی در محتوایی که مدل قبلاً هرگز تولید نکرده است.

این سیستم با رمزگشایی گمانه‌زنانه خودتنظیم‌گر (Self-regulating) جفت شده است:

  • پیشنهاد توکن: یک مدل پیش‌نویس کوچک یا جست‌وجوی n-gram با هزینه صفر، توکن‌ها را پیشنهاد می‌دهد و مدل هدف آن‌ها را در یک پاس دسته‌ای (Batched Pass) تأیید می‌کند. این روند از قضیه پذیرش Leviathan/Chen پیروی می‌کند، به گونه‌ای که توکن رد شده از توزیع باقی‌مانده بازنمونه‌برداری می‌شود تا توزیع خروجی دقیقاً همان توزیع مدل هدف باقی بماند.
  • کنترل تطبیقی: یک کنترل‌کننده بازخورد، طول پیش‌نویس را تطبیق می‌دهد و اندازه‌گیری می‌کند که آیا گمانه‌زنی روی سخت‌افزار خاص کاربر سودده هست یا خیر.
  • غیرفعال‌سازی خودکار: اگر نرخ پذیرش یا اقتصاد پیش‌نویس منفی شود (که در vCPUهای اشتراکی شلوغ رایج است، جایی که مدل پیش‌نویس به‌کندی مدل هدف اجرا می‌شود)، Reame گمانه‌زنی را در زمان اجرا (Runtime) غیرفعال می‌کند.

جزئیات: کیفیت و مقیاس‌پذیری چندکاربره

برای کاربرانی که به دقت بالاتر بدون نیاز به مدل بزرگتر نیاز دارند، Reame قابلیت The Conclave را معرفی کرده است. با فعال کردن پرچم --best-of N، سرور از اجماع به عنوان یک اهرم کیفیت استفاده می‌کند:

  • تولید متناوب: سرور N پاسخ احتمالی را در یک دسته متناوب تولید می‌کند. تلاش شماره ۰، لنگر حریصانه (Greedy Anchor) دست‌نخورده است، در حالی که «کاوشگران» بذر (Seed) را تغییر داده و دما (Heat) را افزایش می‌دهند.
  • کلونینگ KV: زمان‌بند (Scheduler) متوجه پرامپت‌های یکسان می‌شود و به‌جای پیش-پرکردن (Prefill) برای N بار، حافظه KV پرامپت را کلون می‌کند. این سیستم کش اهداکننده را کپی کرده و فقط آخرین توکن پرامپت را رمزگشایی می‌کند (که از طریق argmax تایید شده که با پیش-پرکردن کامل برابر است).
  • انتخاب اکثریت: سیستم برنده را از طریق اکثریت در نتیجه نهایی انتخاب می‌کند. برای متون ادبی، از یک مدل جایگزین Jaccard text-medoid استفاده می‌کند. به محض اینکه اکثریت مطلق به توافق برسند، تولیدات باقی‌مانده در میانه‌ی راه متوقف می‌شوند. رابط خط فرمان (CLI) گزارش می‌دهد CONCLAVE consensus=k/N تا فراخوان‌ها تنها در صورت اختلاف در کنکلاو، سطح درخواست را ارتقا دهند.

سرویس‌دهی چندکاربره از طریق دسته‌های متناوب (Interleaved Batches) مدیریت می‌شود. N تولید هم‌زمان در قالب دسته‌های چند-سکانسی پیش می‌روند و هر خواندن از وزن‌های مدل را به اشتراک می‌گذارند. از آنجایی که خواندن وزن‌ها در رمزگشایی CPU (که محدود به حافظه است) غالب است، این کار هزینه هر کاربر را به‌شدت کاهش می‌دهد.

داده‌های عملکرد اندازه‌گیری‌شده

کارایی Reame در سخت‌افزارهای متنوع در تست‌های اندازه‌گیری‌شده زیر به اثبات رسیده است:

  • لایه رایگان Oracle Cloud (۲ هسته ARM، ۱۲ گیگابایت رم، ۰ یورو در ماه):
    • مدل Qwen2.5-7B (Q4_K_M, KV q8_0) به سرعت ۳.۳ توکن در ثانیه رسید.
    • مدل TriLM 3.9B ternary (TQ2_0) از حدود ۱.۱ گیگابایت رم کل استفاده کرد و به سرعت ۱۰ توکن در ثانیه رسید.
    • مدل OLMoE 7B-A1B (MoE) سرعت ۱۷.۸ توکن در ثانیه را ثبت کرد (۵.۴ برابر سریع‌تر از مدل‌های متراکم ۷ میلیارد پارامتری) در حالی که دقت ۱۰۰٪ را در تست ۸-سوزنی (8-needle) متون طولانی حفظ کرد.
  • اپل M3 Pro (۶ رشته):
    • مدل Qwen2.5-1.5B (Q4_K_M) به سرعت ۵۲ توکن در ثانیه رسید.
    • استفاده از The Conclave (--best-of 5 در مقابل تک‌مدل) پاسخ ۳ آزمون ریاضی را بین ۰.۵ تا ۲ پاسخ صحیح بهبود بخشید، در حالی که جریمه زمانی واقعی ۲.۵ برابر بود، نه ۵ برابر.
    • گمانه‌زنی آرشیو درخواست‌های تکراری (Palimpsest) برای Qwen2.5-1.5B سرعت را از ۲۲ به ۵۱ توکن در ثانیه (۲.۳ برابر افزایش) رساند.
    • پیش‌نویس فرم‌ها (Suggeritore) برای تولید لیست در Qwen2.5-1.5B زمان را از ۴.۴ ثانیه به ۲.۱ ثانیه (۲.۱ برابر) کاهش داد.
    • جست‌وجوی پرامپت در یک تسک بازنویسی (Rewrite)، افزایش سرعت ۱.۴۴ برابری ایجاد کرد.
    • سرویس‌دهی متناوب در مقابل سریال برای ۳ کاربر هم‌زمان TinyLlama، افزایش سرعت ۱.۶ برابری داشت.
    • استفاده از The Conclave در یک آزمون ۸ سوالی، زمان را از ۹۷ ثانیه به حدود ۵۰ ثانیه کاهش داد.
  • سرور مجازی اشتراکی Contabo (۱۸ vCPU با تخصیص بیش از حد):
    • یک مدل ۱.۵ میلیارد پارامتری با یک پیش‌نویس ۰.۵ میلیارد (نرخ پذیرش ۸۷٪)، شتاب ۳.۲ برابری ایجاد کرد.
    • مدل TinyLlama 1.1B با کش دیسکی گرم در مقابل کش سرد، شتاب ۴.۸ برابری در کل مسیر (End-to-End) نشان داد.

پیاده‌سازی و سازگاری

Reame برای استقرار بدون پیکربندی (Zero-configuration) طراحی شده است. با یک دستور ساده، reame run qwen2.5-1.5b مدل به مسیر ~/.reame/models دانلود شده، رشته‌ها (Threads) و تنظیمات KV برای میزبان به‌طور خودکار پیکربندی شده و وارد محیط گفتگو می‌شود. این سرور یک API REST کاملاً سازگار با OpenAI روی پورت ۸۰۸۰ ارائه می‌دهد، شامل /v1/chat/completions، /v1/completions (با استریم SSE)، /v1/sessions (برای ذخیره/بارگذاری/حذف اسنپ‌شات‌های KV) و یک نقطه انتهایی /metrics برای داده‌های گمانه‌زنی و کش.

برای محیط‌های تولیدی، کاربران می‌توانند فایل پیکربندی را تنظیم کنند. موارد برجسته شامل گزینه‌های kv_cache_type (مانند f16 برای دقت بالا، q8_0 یا q4_0 برای کاهش رم کانتکست به نصف یا یک‌چهارم) و محدودیت max_size_mb برای کش دیسکی LRU است. سرور همچنین از احراز هویت Bearer از طریق تنظیم api_key پشتیبانی می‌کند. مقدار پیکربندی parallel تعیین‌کننده سرویس‌دهی متناوب چندکاربره است.

این پروژه تحت مجوز MIT منتشر شده و برای هسته‌های تنسور به llama.cpp متکی است. پیش‌نیازهای آن شامل CMake ≥ 3.16، کامپایلر C++17 و وابستگی‌هایی مانند Boost، nlohmann-json و zstd است. برای شفافیت، توسعه‌دهندگان نتایج منفی را نیز گنجانده‌اند: آن‌ها اندازه‌گیری کردند که یک Conclave با ۵ مدل ۱.۵ میلیارد پارامتری همچنان در استدلال پایین‌تر از یک مدل ۳ میلیارد پارامتری قرار می‌گیرد؛ این ثابت می‌کند که اجماع، نوسانات را اصلاح می‌کند، اما سوگیری‌های سیستماتیک (Systematic Bias) را خیر. این تلاش برای بهینه‌سازی مصرف منابع در لایه حافظه، با گزارش Oxlo.ai درباره بهینه‌سازی پهنای باند حافظه برای کاهش مصرف برق LLMها همسو است. علاوه بر این، نرم‌افزار در برابر ۲۱۰ مورد تست ایزوله سنجیده شده که در آن هر لایه قابل شبیه‌سازی (Mockable) است.

تطبیق با کاربردهای واقعی

بسته به هدف، Reame جفت‌مدل‌های متفاوتی را پیشنهاد می‌دهد:

  • استخراج سند و RAG: مدل‌های Qwen2.5 (۱.۵ تا ۷ میلیارد)؛ چون پاسخ‌ها در کانتکست هستند و کش دیسک به‌شدت سودمند است.
  • خط لوله‌های دسته‌ای (مثلاً تگ‌گذاری ۱۰ هزار محصول، توضیحات متا، دسته‌بندی ایمیل): مدل‌های Qwen2.5 (۱.۵ تا ۳ میلیارد)؛ ماهیت تکراری این کارها به پیش‌نویس‌های Palimpsest کمک می‌کند (هزینه صفر در هر توکن و بدون محدودیت نرخ/Rate Limit).
  • SaaSهای با حاشیه سود پایین: مدل‌های Qwen2.5 (۱.۵ تا ۷ میلیارد)؛ یک VPS ۵ دلاری از هزینه‌های متغیر API جلوگیری می‌کند.
  • بخش‌های حساس (حقوقی/پزشکی/بخش عمومی): مدل Qwen2.5 7B برای حاکمیت کامل بر داده‌ها (Full Data Sovereignty).
  • تکمیل خودکار کد شخصی: مدل Qwen2.5-Coder 1.5B (تکمیل در سطح خط از طریق Continue.dev + API سازگار با OpenAI).

این رویکرد پیش‌فرض قدیمی را که «هوش مصنوعی محلی نیاز به GPU قدرتمند دارد» به‌طور بنیادی تغییر می‌دهد. با تبدیل دیسک به امتداد حافظه مدل، یک VPS ۵ دلاری می‌تواند اقتصاد واحد یک ویژگی AI تولیدی را حفظ کند. مزیت نهایی واضح است: سرور هر چه بیشتر اجرا شود، سریع‌تر می‌شود.

شما می‌توانید با نصب از طریق Homebrew (brew install reame) یا ساخت از طریق سورس کد شروع کنید. منتظر ویژگی‌های آینده مانند دیمون حافظه مشترک ARCA، پیش-پرکردن گرم (Warm-ahead prefill) و سرویس‌دهی درجه اول برای مدل‌های MoE باشید.

گام بعدی شما

  • اگر توسعه‌دهنده هستید، Reame را از طریق Homebrew (brew install reame) نصب کنید و یک مدل کوچک را روی vCPUهای ارزان تست کنید.
  • برای کارهای تکراری، قابلیت Palimpsest را فعال کنید تا سرعت پاسخ‌دهی مدل در درخواست‌های دوم به بعد را اندازه بگیرید.
  • اگر دغدغه حریم خصوصی دارید، مدل ۷ میلیارد پارامتری را روی سخت‌افزار شخصی استقرار دهید تا داده‌ها هرگز از محیط شما خارج نشوند.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این ابزار با حذف نیاز به GPU برای مدل‌های کوچک، سد ورود به دنیای هوش مصنوعی محلی را برای استارتاپ‌ها و شرکت‌های کوچک می‌شکند. اعتبار این ادعا با داده‌های عملکردی روی سخت‌افزارهای رایگان (Free Tier) تأیید شده است.

تأثیر برای ایران

این ابزار برای توسعه‌دهندگان ایرانی که با محدودیت بودجه برای خرید GPU یا هزینه‌های دلاری APIها روبرو هستند، فرصتی طلایی است تا مدل‌های کاربردی را روی VPSهای ارزان‌قیمت داخلی یا خارجی مستقر کنند.

·نگاه ما
تحریریه دات‌هوش

Reame با جابه‌جایی مرکز ثقل از محاسبات لحظه‌ای (Compute) به سمت بازیابی حافظه (Memory Retrieval)، پارادایم سرویس‌دهی مدل‌های کوچک را تغییر می‌دهد. این رویکرد نشان می‌دهد که برای بسیاری از کاربردهای تجاری، «به خاطر آوردن» نتایج قبلی بسیار ارزان‌تر و سریع‌تر از «دوباره فکر کردن» مدل است. در واقع، Reame مدل زبانی را از یک ماشین محاسبه به یک سیستم نمایشی با حافظه بلندمدت تبدیل می‌کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.