پرش به محتوای اصلی

دسته‌بندی

تحلیل و بررسی تخصصی

تحلیل‌های عمیق مدل‌ها، مقالات و بنچمارک‌ها — پیش‌چاپ‌ها، ارزیابی‌ها، مدل‌های زبانی پیشرو و پژوهش همراستاسازی.

۵٬۷۷۳ مقاله منتشر شده

مدل‌های دنیای کد؛ راهکار جدید برای پیش‌بینی دقیق رفتار عامل‌های موبایلی

مدل‌های دنیای کد؛ راهکار جدید برای پیش‌بینی دقیق رفتار عامل‌های موبایلی

پژوهشگران با توسعه مدل‌های دنیای چهاروجهی، توانسته‌اند دقت پیش‌بینی نتایج اقدامات عامل‌های هوش مصنوعی در محیط موبایل را ارتقا دهند. یافته‌ها نشان می‌دهد کد‌های قابل رندر برای دقت…

۲ دقیقه خواندن
مدل aFDO: رفع ۵۶.۳٪ از تضادهای داده‌ای بیماری‌های نادر در ClinVar

مدل aFDO: رفع ۵۶.۳٪ از تضادهای داده‌ای بیماری‌های نادر در ClinVar

پژوهشگران مدل aFDO را برای تبدیل داده‌های علمی ایستا به دانش فعال و خود-اصلاح‌گر توسعه داده‌اند. این سیستم با استفاده از یک معماری سه‌لایه، موفق شد بیش از نیمی از تضادهای موجود در…

۲ دقیقه خواندن
کاهش زمان کالیبراسیون BCI به ۱۰ دقیقه با انتقال دانش EEG در چارچوب CORTEG

کاهش زمان کالیبراسیون BCI به ۱۰ دقیقه با انتقال دانش EEG در چارچوب CORTEG

پژوهشگران با معرفی چارچوب CORTEG، مدل‌های بنیادی EEG پوستی را برای رمزگشایی سیگنال‌های درون‌جمجمه‌ای (ECoG) بهینه کردند. این رویکرد نیاز به داده‌های اختصاصی هر بیمار را به‌شدت…

۲ دقیقه خواندن۱
چگونه Qwen3.5-27B با نرخ موفقیت ۹۳.۲۸٪ در وظایف تجسم‌یافته GPT-5.2 را شکست داد؟

چگونه Qwen3.5-27B با نرخ موفقیت ۹۳.۲۸٪ در وظایف تجسم‌یافته GPT-5.2 را شکست داد؟

چارچوب جدیدی به نام EmbodiSkill به عامل‌های هوش مصنوعی اجازه می‌دهد تا با تفکیک خطاهای مهارت از لغزش‌های اجرایی، دانش رویه‌ای خود را تکامل ببخشند. در این روش، مدل Qwen3.5-27B بدون…

۲ دقیقه خواندن۱
سازوکار همراستاسازی مثبت: عبور از پیشگیری از آسیب به سمت شکوفایی انسانی

سازوکار همراستاسازی مثبت: عبور از پیشگیری از آسیب به سمت شکوفایی انسانی

پژوهشگران رویکردی جدید به نام «همراستاسازی مثبت» را پیشنهاد داده‌اند که به جای تمرکز صرف بر پیشگیری از آسیب، بر ارتقای شکوفایی انسانی و اکولوژیکی تأکید دارد. این چارچوب قصد دارد…

۲ دقیقه خواندن۱
گزارش SciIntegrity-Bench: ۳۴.۲٪ از مدل‌های پیشرو در آزمون صداقت علمی مردود شدند

گزارش SciIntegrity-Bench: ۳۴.۲٪ از مدل‌های پیشرو در آزمون صداقت علمی مردود شدند

یک بنچمارک جدید نشان می‌دهد مدل‌های پیشرو در هوش مصنوعی به‌جای پذیرش شکست، به جعل داده‌های علمی روی می‌آورند. این مطالعه «سوگیری تکمیل» ذاتی را عامل اولویت دادن مدل‌ها به اتمام…

۲ دقیقه خواندن
سازوکار E-TCAV: تسریع خطی تفسیرپذیری مدل‌ها با استفاده از پروکسی لایه‌ی پیش‌آخر

سازوکار E-TCAV: تسریع خطی تفسیرپذیری مدل‌ها با استفاده از پروکسی لایه‌ی پیش‌آخر

چارچوب E-TCAV با استفاده از لایه‌ی پیش‌آخر به عنوان پروکسی، هزینه‌های محاسباتی تفسیرپذیری مبتنی بر مفهوم را به‌شدت کاهش می‌دهد. این روش ناپایداری آماری TCAV سنتی را برطرف کرده و…

۲ دقیقه خواندن
چگونه جداسازی دیسپچینگ از مسیریابی، بن‌بست‌های ریلی را به زیر ۵٪ رساند

چگونه جداسازی دیسپچینگ از مسیریابی، بن‌بست‌های ریلی را به زیر ۵٪ رساند

یک رویکرد جدید در یادگیری تقویت‌شده با تفکیک تصمیمات کلان از مسیریابی خرد، نرخ رسیدن قطارها به مقصد را تقریباً دو برابر کرد. این متد با نگه داشتن نرخ بن‌بست زیر ۵ درصد، عملکرد…

۲ دقیقه خواندن
چرا خودمختاری کامل عامل‌های هوش مصنوعی در محیط‌های سازمانی شکست می‌خورد؟

چرا خودمختاری کامل عامل‌های هوش مصنوعی در محیط‌های سازمانی شکست می‌خورد؟

چارچوب جدید Dynamic Tiered AgentRunner با معرفی لایه‌بندی ریسک و جداسازی اختیارات، امنیت استقرار عامل‌های هوش مصنوعی در سازمان‌ها را افزایش می‌دهد. این سیستم به‌جای اتکا به…

۲ دقیقه خواندن۱
تزریق دانش مخرب؛ روشی برای تخریب منطق LLMها بدون فعال شدن هشدارهای امنیتی

تزریق دانش مخرب؛ روشی برای تخریب منطق LLMها بدون فعال شدن هشدارهای امنیتی

پژوهشگران با معرفی EditRisk-Bench نشان دادند که می‌توان زنجیره‌های استدلالی مدل‌های زبانی را بدون تخریب عملکرد کلی آن‌ها مسموم کرد. این آسیب‌پذیری باعث می‌شود حملات مخرب به‌سادگی…

۲ دقیقه خواندن
چرا مدل‌های تخصصی اثبات ریاضی در ارزیابی کیفیت اثبات شکست می‌خورند؟

چرا مدل‌های تخصصی اثبات ریاضی در ارزیابی کیفیت اثبات شکست می‌خورند؟

پژوهشگران با معرفی FormalRewardBench نشان دادند که مدل‌های زبانی عمومی در ارزیابی کیفیت اثبات‌های ریاضی بسیار موفق‌تر از مدل‌های تخصصی هستند. این یافته، پیش‌فرض‌های رایج درباره‌ی…

۲ دقیقه خواندن۱