پرش به محتوای اصلی

موضوع

مدل‌های بازوزن

Open-source models, open weights, local hosting, licensing

۱٬۲۵۷ مقاله منتشر شده

هوش مصنوعی خطرناک در راه است، فارغ از هر اقدامی

مدل‌های بازمتن اثربخشیِ محدودیت‌های صادراتی آمریکا را کاهش دادند

دولت آمریکا دسترسی خارجی به مدل‌های پیشرفته Anthropic را به دلیل مخاطرات امنیتی مسدود کرد. با این حال، کارشناسان هشدار می‌دهند که محدود کردن یک شرکت بی‌فایده است، زیرا قابلیت‌های…

۴ دقیقه خواندن
چرا افزودن لایه‌های بیشتر در مدل‌های عمیق دیگر جواب نمی‌دهد؟

جریان باقی‌مانده در برابر NAG: گذار به مدل‌های بهینه‌تر و عمیق‌تر

پژوهشگران با معرفی معماری NAG مانع از زوال سیگنال در مدل‌های ترنسفورمر می‌شوند. این رویکرد با جداسازی اندازه از جهت در جریان باقی‌مانده، امکان ایجاد مدل‌های بسیار عمیق و بهینه را…

۲ دقیقه خواندن۱
چرا مدل‌های چندوجهی در استناد به تصاویر اسناد طولانی شکست می‌خورند؟

چرا مدل‌های چندوجهی در استناد به تصاویر اسناد طولانی شکست می‌خورند؟

پژوهشگران چارچوب VinQA را برای ارزیابی توانایی مدل‌های هوش مصنوعی در استناد دقیق به عناصر بصری (جداول و نمودارها) در پاسخ‌های طولانی معرفی کردند. نتایج نشان می‌دهد تنظیم دقیق…

۲ دقیقه خواندن
گزارش arXiv: اشتراک‌گذاری کد و داده در مقالات هوش مصنوعی ۶ برابر شده است

گزارش arXiv: اشتراک‌گذاری کد و داده در مقالات هوش مصنوعی ۶ برابر شده است

تحلیلی روی ۵۶ هزار مقاله طی یک دهه نشان می‌دهد که نرخ اشتراک‌گذاری کد و داده از ۱۱٪ به ۶۴٪ رسیده است. این داده‌ها حاکی از یک چرخش فرهنگی بنیادین به سوی «علم باز» و پایان بحران…

۱ دقیقه خواندن
هوش مصنوعی را روی کامپیوترِ خودتان اجرا کنید: راهنمای عملیِ مدل‌های متن‌باز
آموزش کاربردی

هوش مصنوعی را روی کامپیوترِ خودتان اجرا کنید: راهنمای عملیِ مدل‌های متن‌باز

هوش مصنوعیِ ابری مثلِ ChatGPT و Claude از ایران مسدود است و پرداختِ بین‌المللی می‌خواهد — اما مدل‌های متن‌باز روی سیستمِ خودتان اجرا می‌شوند: رایگان، بدونِ مسدودسازی و کاملاً…

۴ دقیقه خواندن
پرداخت برای هوش مصنوعی خارجی از ایران: واقعیت، خطرها و جایگزین رایگان
آموزش کاربردی

پرداخت برای هوش مصنوعی خارجی از ایران: واقعیت، خطرها و جایگزین رایگان

برای کاربر داخل ایران، پرداخت به هوش مصنوعیِ خارجی (ChatGPT، Claude) ذاتاً سخت است: تحریم‌ها سرویس‌ها را مسدود کرده‌اند و کارت ایرانی روی سرویس بین‌المللی کار نمی‌کند. روش‌هایی که…

۵ دقیقه خواندن۱
گزارش arXiv: کاهش ۳۶ درصدی موفقیت جیل‌بریک در مدل‌های استدلالی با متد Safe

گزارش arXiv: کاهش ۳۶ درصدی موفقیت جیل‌بریک در مدل‌های استدلالی با متد Safe

پژوهشگران روشی به نام Safe Trigger ابداع کرده‌اند که به مدل‌های استدلالی اجازه می‌دهد با تحلیل مسیر تفکر خود، درخواست‌های مضر را شناسایی و مسدود کنند. این رویکرد نیاز به داده‌های…

۱ دقیقه خواندن
چگونه تبدیل دستورالعمل‌های متنی به وزن‌های رفتاری، هزینه‌ی استنتاج را می‌کاهد؟

چگونه تبدیل دستورالعمل‌های متنی به وزن‌های رفتاری، هزینه‌ی استنتاج را می‌کاهد؟

پژوهشگران چارچوب **Skill-to-LoRA** (S2L) را معرفی کرده‌اند که دستورالعمل‌های متنی حجیم در پرامپت‌ها را با آداپتورهای سبک **LoRA** جایگزین می‌کند. این رویکرد باعث کاهش ۶.۶ درصدی…

۲ دقیقه خواندن
پدیده Idle-drift در Claude Haiku 4.5؛ وقتی برنامه‌ریزی دقیق به بی‌عملی منجر

پدیده Idle-drift در Claude Haiku 4.5؛ وقتی برنامه‌ریزی دقیق به بی‌عملی منجر

بنچمارک جدید CoffeeBench نشان می‌دهد که برخی مدل‌های زبانی با وجود توانایی برنامه‌ریزی دقیق، در محیط‌های اقتصادی بلندمدت دچار «بی‌عملی» می‌شوند. Claude Haiku 4.5 در این آزمون…

۱ دقیقه خواندن
چرا ادغام تک‌مرحله‌ای مدل‌های زبانی در وظایف تخصصی شکست می‌خورد؟

چرا ادغام تک‌مرحله‌ای مدل‌های زبانی در وظایف تخصصی شکست می‌خورد؟

پژوهشگران متد METIS را برای حل مشکل «پاک‌شدن اطلاعات» در ادغام مدل‌ها معرفی کردند. این روش با جایگزینی تجمیع یک‌باره با یک پروتکل تکرارشونده، مانع از تداخل وظایف شده و عملکرد…

۱ دقیقه خواندن۲
ابزارهای رایگان هوش مصنوعی برای کارهای روزمره؛ کدام‌ها از داخل ایران در دسترس‌اندویژه
آموزش کاربردی

ابزارهای رایگان هوش مصنوعی برای کارهای روزمره؛ کدام‌ها از داخل ایران در دسترس‌اند

هوش مصنوعی پر است از ابزارهای رایگان، اما برای کاربر ایرانی پرسشِ اصلی این نیست که کدام بهتر است؛ این است که کدام واقعاً از داخل باز می‌شود و کدام برای ثبت‌نام یا ارتقا به شماره و…

۶ دقیقه خواندن۳