پرش به محتوای اصلی

موضوع

مدل‌های بازوزن

Open-source models, open weights, local hosting, licensing

۲٬۰۴۲ مقاله منتشر شده

Dep-LLM و چالش مدل‌های نظارت‌شده: تشخیص افسردگی بدون آموزش مجدد

Dep-LLM و چالش مدل‌های نظارت‌شده: تشخیص افسردگی بدون آموزش مجدد

چارچوب Dep-LLM با تقلید از استدلال‌های روان‌پزشکی، تشخیص افسردگی را بدون نیاز به آموزش یا تنظیم دقیق مدل انجام می‌دهد. این سیستم با تحلیل چندعاملی و وزن‌دهی بر اساس سطح اطمینان،…

۲ دقیقه خواندن
چرا معماری ترکیبی CPU-GPU نیاز به کوانتیزه کردن مدل‌های MoE را از بین می‌برد؟

چرا معماری ترکیبی CPU-GPU نیاز به کوانتیزه کردن مدل‌های MoE را از بین می‌برد؟

پژوهشگران با طراحی یک معماری ترکیبی، اجرای مدل‌های Mixture-of-Experts (MoE) با دقت اصلی را روی سخت‌افزارهای مصرف‌کننده و با عملکردی در سطح مراکز داده ممکن کرده‌اند. این سیستم با…

۲ دقیقه خواندن
پروتکل Alert-Confirm و افشای نقاط کور هوش مصنوعی در تشخیص بحران‌های روانی

پروتکل Alert-Confirm و افشای نقاط کور هوش مصنوعی در تشخیص بحران‌های روانی

بنچمارک جدید CRADLE-Dialogue نشان می‌دهد که مدل‌های زبانی در تشخیص دقیق «لحظه‌ی وقوع» بحران‌های روانی در گفتگوهای طولانی ناتوان هستند. این شکاف فنی، استفاده از AI به عنوان سیستم…

۱ دقیقه خواندن
چرا Visual-SDPO در اصلاح خطاهای بصری کدنویسی، GRPO را شکست می‌دهد؟

چرا Visual-SDPO در اصلاح خطاهای بصری کدنویسی، GRPO را شکست می‌دهد؟

چارچوب جدید Visual-SDPO با استفاده از بازخوردهای بصری رندر شده، مدل‌های زبانی را برای تولید کدهای دقیق‌تر در نمودارها و رابط‌های کاربری آموزش می‌دهد. این روش با هدف قرار دادن…

۲ دقیقه خواندن
چرا مدل‌های زبانی باز ارزیابی‌های تنظیم MIMO را ۶ برابر کاهش می‌دهند؟

چرا مدل‌های زبانی باز ارزیابی‌های تنظیم MIMO را ۶ برابر کاهش می‌دهند؟

مدل‌های زبانی باز (Open LLMs) می‌توانند با پیشنهاد پیش‌فرض‌های ساختاری غیرمنتظره، تعداد تکرارهای مورد نیاز برای تنظیم کنترل‌کننده‌های صنعتی پیچیده را تا ۶ برابر کاهش دهند. این…

۲ دقیقه خواندن
دستیابی DeepSeek-R1-8B به امتیاز ۰.۹۱۲ در تحلیل مالی با ترکیب LoRA و NEFTune

دستیابی DeepSeek-R1-8B به امتیاز ۰.۹۱۲ در تحلیل مالی با ترکیب LoRA و NEFTune

پژوهشگران با ترکیب روش‌های LoRA و NEFTune، مدل DeepSeek-R1-8B را برای شناسایی موجودیت‌های نام‌گذر مالی بهینه کردند. این رویکرد ترکیبی در استخراج داده‌های ساختارمند از گزارش‌های…

۱ دقیقه خواندن
ای.ال.ال.ا — عامل منطق محلی توکار
آموزش کاربردی

جایگزینی «اعتماد» با «معماری»: استراتژی E.L.L.A برای توقف نشت داده‌ها

پروژه E.L.L.A با حذف فیزیکی مسیرهای ارسال داده به ابر، نشت اطلاعات را از طریق محدودیت‌های معماری غیرممکن می‌کند. این دستیار محلی ویندوز، امنیت را به جای تکیه بر قوانین اخلاقی، بر…

۴ دقیقه خواندن
معرفی North Mini Code، نخستین مدل Cohere برای توسعه‌دهندگان
آموزش کاربردی

چگونه مدل ۳۰ میلیاردی North Mini Code غول‌های ۱۲۰ میلیاردی کدنویسی را شکست داد؟

شرکت Cohere مدل North Mini Code را معرفی کرد؛ یک مدل ۳۰ میلیاردی که در مهندسی نرم‌افزار عامل‌محور، عملکرد مدل‌های ۱۲۰ میلیاردی را پشت سر می‌گذارد. این دستاورد مدیون استفاده از…

۹ دقیقه خواندن۱
آیا شرکت‌های فناوری می‌توانند عاشق مدل‌های ارزان‌تر هوش مصنوعی شوند؟

برایان آرمسترانگ: ۸۰٪ از حجم عملیات هوش مصنوعی به مدل‌های ارزان منتقل می‌شوند

صنعت هوش مصنوعی از رویکرد «هرچه بزرگ‌تر، بهتر» به سمت بهره‌وری هزینه‌ای حرکت می‌کند. پیش‌بینی می‌شود ظرف ۱۸ ماه آینده، اکثریت وظایف پردازشی به مدل‌های کوچک‌تر و ارزان‌تر منتقل…

۴ دقیقه خواندن۱
همان نگهبانان، ایستگاه‌های عوارضی جدید در بازار مجوز محتوا برای هوش مصنوعی

گزارش بروکینگز: سقوط ۶ برابری نرخ ارجاع، تهدیدی برای بقای رسانه‌ها

گزارش جدید مؤسسه بروکینگز هشدار می‌دهد که مدل‌های مجوز محتوای هوش مصنوعی در حال تکرار انحصار گوگل هستند. این ساختار باعث ایجاد یک «تله دوجانبه» شده که در آن غول‌های فناوری هم…

۹ دقیقه خواندن۱
ثبت لاگ حسابرسی برای گردش‌کارهای n8n با فراخوانی ابزارهای MCP
آموزش کاربردی

چرا گزارش‌های n8n برای مدیریت عامل‌های هوش مصنوعی کافی نیستند؟

Cordon یک درگاه متن‌باز است که حفره‌های نظارتی در جریان‌های کاری n8n را می‌پوشاند. این ابزار به توسعه‌دهندگان اجازه می‌دهد آرگومان‌های ارسالی به ابزارها را رصد کرده و برای عملیات…

۴ دقیقه خواندن