چرا برای بهینهسازی واقعی هوش مصنوعی باید پایتون را کنار گذاشت؟
پروژه tiny-vllm یک موتور آموزشی مبتنی بر C++ و CUDA است که معماری vLLM را بازسازی میکند. این ابزار به توسعهدهندگان میآموزد چگونه استنتاج Llama 3.2 را از صفر پیاده کنند و بر…
موضوع
Open-source models, open weights, local hosting, licensing
۱٬۲۵۳ مقاله منتشر شده
پروژه tiny-vllm یک موتور آموزشی مبتنی بر C++ و CUDA است که معماری vLLM را بازسازی میکند. این ابزار به توسعهدهندگان میآموزد چگونه استنتاج Llama 3.2 را از صفر پیاده کنند و بر…
شرکت StepFun مدل Step 3.7 Flash را معرفی کرد؛ یک مدل ۱۹۸ میلیارد پارامتری بهینه برای پردازندههای NVIDIA. این مدل استدلال چندوجهی در مقیاس سازمانی را با پنجره متنی ۲۵۶ هزار توکنی…
شرکت Mistral AI از یک آزمایشگاه مدلسازی به ارائهدهنده کامل زیرساخت، پلتفرم و مشاوره تبدیل شده است. این شرکت با راهاندازی مرکز داده اختصاصی در پاریس، بر استقرار محلی و مدلهای…
شرکت Liquid AI مدل LFM2.5-8B-A1B را معرفی کرد؛ یک مدل MoE برای اجرا روی دستگاه که تنها ۱.۵ میلیارد پارامتر فعال دارد. این مدل با کاهش شدید توهمات و بهبود استدلال، امکان اجرای هوش…
پروژه متنباز A3M Router برای نخستین بار رتبه اول جدول RouterArena را از رقبای تجاری ربود. این ابزار با استفاده از یک سازوکار امتیازدهی موازی، هزینههای عملیاتی را بهشدت کاهش…
گوگل با معرفی برد Coral، امکان اجرای محلی مدل Gemma 3 270M را روی سختافزار RISC-V فراهم کرد. این اقدام هدفش کاهش وابستگی به ابر در گجتهای پوشیدنی و حذف هزینههای API است.
پلتفرم Biohub مدل متنباز ESMFold2 را معرفی کرد که در پیشبینی ساختار پروتئین از AlphaFold پیشی میگیرد. این ابزار با نرخ موفقیت ۸۸ درصدی، مسیر کشف داروهای ضدسرطان و بیماریهای…
همبستگی میان کیفیت و هزینه در مدلهای کدنویسی فروپاشیده است. آزمایشگاههای چینی اکنون قابلیتهای نزدیک به مدلهای پیشرو را با کسری از هزینه جایگزینهای غربی ارائه میدهند.
شرکت Cursor معماری Composer 2 را معرفی کرد؛ مدلی تخصصی برای مهندسی نرمافزار که بر پایه Kimi 2.5 ساخته شده است. این سیستم با استفاده از تکنیکهای Delta Sync و Router Replay،…
یک بنچمارک جدید از IBM و Artificial Analysis نشان میدهد که پیشرفتهترین مدلهای هوش مصنوعی در عیبیابی زیرساختهای سازمانی شکست میخورند. یافتهها حاکی از یک رابطه معکوس…
موتور استنتاج TokenSpeed با بهینهسازی حافظه و ادغام کرنلها، رکورد ۵۸۰ توکن در ثانیه را برای مدل Qwen3.5-397B روی پردازندههای NVIDIA Blackwell ثبت کرد. این پیشرفت بهویژه برای…
ربات Reachy Mini اکنون میتواند تمام مراحل تبدیل گفتار به گفتار را بهصورت محلی اجرا کند. این تغییر نیاز به سرورهای ابری و کلیدهای API را حذف کرده و حریم خصوصی کامل و هزینه صفر…