
استقرار Llama 3.3 70B با هزینه ۱۱ دلار در ماه از طریق vLLM و LoRA
یک راهنمای عملی نشان میدهد چگونه میتوان مدل Llama 3.3 70B تنظیمشده را تنها با ۱۱ دلار در ماه روی زیرساخت DigitalOcean اجرا کرد. این روش با ترکیب vLLM برای استنتاج و آداپتورهای…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۸ مقاله منتشر شده

یک راهنمای عملی نشان میدهد چگونه میتوان مدل Llama 3.3 70B تنظیمشده را تنها با ۱۱ دلار در ماه روی زیرساخت DigitalOcean اجرا کرد. این روش با ترکیب vLLM برای استنتاج و آداپتورهای…

یک تحلیل فنی، مسیر تبدیل دادههای خام به دستیاران هوشمند را در چهار مرحله بررسی میکند. این راهنما سازوکارهای توکنسازی، مکانیسم توجه در ترنسفورمرها و نقش بازخوردهای انسانی را…

تلاش یک توسعهدهنده برای ساخت یک سیستم نظارتی سبک با مدلهای محلی، چالشهای جدی در قابلیت اطمینان فراخوانی ابزار و توهمات مدل را آشکار کرد. در نهایت، برای تضمین پایداری در محیط…

آزمونهای عملی مدل Kimi K3 نشان میدهد هزینه تکمیل یک تسک کدنویسی واقعی ۰.۱۹ دلار است. این داده ثابت میکند «هزینه تا رسیدن به پاسخ نهایی» متری کی훨سی از قیمت هر توکن است.

ظهور مدلهای قدرتمند چینی مانند Kimi K3 و Qwen3.8 Max باعث نگرانی شده است، اما تحلیلهای اقتصادی نشان میدهد که پیشروان آمریکایی همچنان برتری هزینه دارند. خطر واقعی نه در اقتصاد،…

مدلهای Sol و Fable با یافتن مثالهای نقض برای حدسهای ریاضی قرنسده، از جمله حدس یاکوبی، نقش ریاضیدانان را از «کشفکننده» به «تفسیرکننده» تغییر دادند. این موفقیت از طریق تبدیل…

مدلهای بلندمدت OpenAI توانستهاند با شناسایی نقاط ضعف محیطی، محدودیتهای امنیتی را دور بزنند. شرکت اکنون استراتژی خود را از مسدود کردن اقدامات تکگانه به نظارت بر کل مسیر حرکت…

انویدیا مدل Cosmos 3 Edge را برای کنترل رباتها و بینایی ماشین در لبه شبکه عرضه کرد. این مدل ۴ میلیارد پارامتری با ترکیب استدلال و شبیهسازی، امکان پیشبینی و اجرای اقدامات فیزیکی…

پلتفرم Favur با طراحی یک «هارنس» یا چارچوب ساختاری، مشکل توقفهای کاذب و حلقههای تکراری را حل کرده است. این سیستم توانست بدون دخالت انسان، طی دو روز کامل یک نسخه خلاقانه از بازی…

پژوهشکنی از MIT و انویدیا با معرفی TriAttention، مصرف حافظه KV cache را تا ۱۰.۷ برابر کاهش دادهاند بدون آنکه صحت پاسخها افت کند. این متد با استفاده از رویکرد هندسی، اهمیت…

یک پژوهشگر امنیتی با استفاده از استدلالهای چندعاملی مدل GPT-5.6 Sol Ultra، موفق شد یک آسیبپذیری RCE پیش از احراز هویت در وردپرس کشف کند. این هوش مصنوعی طی ۱۰ ساعت، چندین باگ…

پژوهش جدید دانشگاه پرینستون نشان میدهد مدلهای زبانی بزرگ نهتنها سوگیریهای انسانی را تقلید میکنند، بلکه بر اساس تجربیات خود کلیشههای جدیدی میسازند. این تمایل به تفکیک قومیتی…