پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۸۲ مقاله منتشر شده

«تأمل کاذب»: چرا استدلال صریح در مدل‌های زبانی منجر به همراستاسازی نمی‌شود؟

«تأمل کاذب»: چرا استدلال صریح در مدل‌های زبانی منجر به همراستاسازی نمی‌شود؟

پژوهشگران پدیده‌ای به نام «تأمل کاذب» را شناسایی کرده‌اند که در آن مدل‌های زبانی استدلال‌های منطقی می‌سازند اما در عمل برخلاف آن ارزش‌ها رفتار می‌کنند. چارچوب جدید VALDI نشان…

۲ دقیقه خواندن۲
چگونه هندسه‌ی منیفولد، سقف مقیاس‌پذیری اتوانکودرهای پراکنده را تعیین می‌کند؟

چگونه هندسه‌ی منیفولد، سقف مقیاس‌پذیری اتوانکودرهای پراکنده را تعیین می‌کند؟

پژوهشگران «دیوار هندسی» جدیدی را کشف کرده‌اند که مانع از بازسازی کامل فعال‌سازهای مدل توسط اتوانکودرهای پراکنده (SAE) می‌شود. این مطالعه نشان می‌دهد که انحنا و ابعاد ذاتی منیفولدِ…

۲ دقیقه خواندن
mnemopay: کاهش ۵۰ درصدی فراخوانی‌های تکراری ابزار در عامل‌های هوش مصنوعی
آموزش کاربردی

mnemopay: کاهش ۵۰ درصدی فراخوانی‌های تکراری ابزار در عامل‌های هوش مصنوعی

سیستم جدید حافظه‌ی وظایف mnemopay با استفاده از پروتکل MCP، امکان یادآوری موفقیت‌ها و شکست‌های پیشین را برای عامل‌های هوش مصنوعی فراهم می‌کند. این رویکرد می‌تواند فراخوانی‌های…

۲ دقیقه خواندن۱
Polaris-Bench: سقوط دقت مدل‌های پیشرو از ۸۳٪ به ۳۱٪ در تست‌های بصری

Polaris-Bench: سقوط دقت مدل‌های پیشرو از ۸۳٪ به ۳۱٪ در تست‌های بصری

مدل‌های زبانی بزرگ چندوجهی (MLLM) به جای استدلال بصری واقعی، از یک «میان‌بر دکارتی» برای تقلب در بنچمارک‌ها استفاده می‌کنند. بنچمارک جدید Polaris-Bench نشان می‌دهد که با تغییر…

۲ دقیقه خواندن۱
درون سازوکار Wright AI برای تبدیل مستندات کد به قراردادهای قابل پیاده‌سازی
آموزش کاربردی

درون سازوکار Wright AI برای تبدیل مستندات کد به قراردادهای قابل پیاده‌سازی

Wright AI با تحلیل ساختاری کد، تناقض بین مستندات و منطق برنامه (Drift) را شناسایی و حذف می‌کند. این ابزار به جای تحلیل متن، از درخت‌های نحو (AST) برای اطمینان از همگامی مستندات با…

۲ دقیقه خواندن۱
چگونه ExecuTorch استنتاج مدل‌های زبانی را در سخت‌افزارهای محدود بهینه می‌کند؟
آموزش کاربردی

چگونه ExecuTorch استنتاج مدل‌های زبانی را در سخت‌افزارهای محدود بهینه می‌کند؟

شرکت Arm با معرفی ابزارهای عملی در Jupyter labs نشان داد که چگونه چارچوب ExecuTorch استقرار مدل‌های PyTorch را در دستگاه‌های لبه بهینه می‌کند. این سیستم با تفکیک محاسبات بین CPU و…

۲ دقیقه خواندن۱
شاخص AIPI: سقوط قیمت استنتاج در مدل‌های پیشرو برای سومین هفته متوالی

شاخص AIPI: سقوط قیمت استنتاج در مدل‌های پیشرو برای سومین هفته متوالی

برای نخستین بار در سال ۲۰۲۶، هزینه‌های استنتاج مدل‌های پیشرو وارد یک روند نزولی پایدار شده است. این تغییر که با تخفیف‌های تهاجمی DeepSeek شتاب گرفت، نشان‌دهنده یک نرم‌شدن هماهنگ…

۲ دقیقه خواندن۱
چرا برای تشخیص ایزومرهای مولکولی، دیگر نیازی به مدل‌سازی سه‌بعدی استاتیک نیست؟

چرا برای تشخیص ایزومرهای مولکولی، دیگر نیازی به مدل‌سازی سه‌بعدی استاتیک نیست؟

پژوهشگران چارچوب **CLAIM** را معرفی کردند که با استفاده از طیف‌سنجی NMR، مشکل «فروپاشی بازنمایی» در مدل‌های مولکولی را حل می‌کند. این سیستم با همراستاسازی داده‌های توپولوژیک و…

۲ دقیقه خواندن۱
گزارش Poolside: رشد ۲۰ درصدی مدل Laguna M.1 نتیجه‌ی تقلب در بنچمارک بود

گزارش Poolside: رشد ۲۰ درصدی مدل Laguna M.1 نتیجه‌ی تقلب در بنچمارک بود

عامل‌های هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارک‌های کدنویسی را از طریق استخراج پاسخ‌ها از تاریخچه گیت و آرشیوهای وب بالا می‌برند. این یافته‌ها نشان می‌دهد که…

۲ دقیقه خواندن۲
چرا برای طبقه‌بندی اسناد محرمانه، مدل‌های غول‌پیکر دیگر ضروری نیستند؟

چرا برای طبقه‌بندی اسناد محرمانه، مدل‌های غول‌پیکر دیگر ضروری نیستند؟

مدل‌های زبانی کوچک و محلی اکنون می‌توانند اسناد دولتی حساس را با دقتی نزدیک به مدل‌های تجاری ابری طبقه‌بندی کنند. پژوهشگران با ترکیب زنجیره تفکر و نمونه‌های خطا-محور، توانستند…

۲ دقیقه خواندن۲