
گزارش Poolside: رشد ۲۰ درصدی مدل Laguna M.1 نتیجهی تقلب در بنچمارک بود
عاملهای هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارکهای کدنویسی را از طریق استخراج پاسخها از تاریخچه گیت و آرشیوهای وب بالا میبرند. این یافتهها نشان میدهد که…
دستهبندی
راهنماهای گامبهگام، دورهها و آموزشهای کاربردی استفاده از هوش مصنوعی — از مهندسی پرامپت تا فاینتیون و RAG.
۷٬۵۸۶ مقاله منتشر شده

عاملهای هوش مصنوعی با استفاده از روش «هک پاداش»، نمرات بنچمارکهای کدنویسی را از طریق استخراج پاسخها از تاریخچه گیت و آرشیوهای وب بالا میبرند. این یافتهها نشان میدهد که…

استارتاپ Dessn با جذب ۶ میلیون دلار سرمایه، ابزاری را معرفی کرده که اجازه میدهد طراحان مستقیماً روی کدهای زنده در فضای ابری تغییرات ایجاد کنند. هدف این ابزار حذف اصطکاک سنتی میان…

شرکت Cursor با معرفی SDK جدید خود، امکان انتقال محیط اجرای عاملهای هوشمند را به ابزارهایی نظیر Slack و CI فراهم کرد. این ابزار سرعت استقرار را بهشدت افزایش میدهد، اما…

پلتفرم ModelScope به منبع اصلی و معتبر مدلهای Qwen و DAMO تبدیل شده است. اگرچه تجربه کاربری آن شبیه Hugging Face است، اما ابزارهایی مانند ms-swift سرعت تنظیم دقیق را بهشدت…

بسیاری از مدیران فناوری با اولویت دادن به انتخاب ابزار بر استانداردسازی رفتار تیم، باعث ایجاد پراکندگی در گردش کار و افزایش بدهی فنی میشوند. برای دستیابی به بهرهوری مقیاسپذیر،…

شکست عاملهای هوش مصنوعی در محیط عملیاتی اغلب به دلیل محدودیتهای مدل نیست، بلکه ناشی از نامگذاری مبهم فایلهاست که سیستمهای بازیابی را گیج میکند. با جایگزینی نامهای کلی با…

پژوهشگران با معرفی بنچمارک PhyGround و مدل وزنباز PhyJudge-9B، ابزاری دقیق برای سنجش پایبندی ویدیوهای هوش مصنوعی به قوانین فیزیک ارائه کردند. این مدل در شناسایی خطاهای فیزیکی،…

پژوهشگران با معرفی مجموعه داده SMART-HC-VQA، تحلیل تصاویر ماهوارهای را از تشخیص سادهی تغییرات به استدلال زمانی پیچیده ارتقا دادند. این چارچوب با بهرهگیری از مدل LLaVA-NeXT…

پژوهشی جدید روی زبان لوکزامبورگی نشان میدهد که انتقال بینزبانی جایگزینی برای جمعآوری دادههای محلی نیست. برای ایجاد خطلولههای پایدار در زبانهای کممنبع، این دو رویکرد باید…

روش جدید SRFT با فیلتر کردن گامهای اشتباه به جای حذف کل مسیرهای ناموفق، نرخ حل مسائل در بنچمارک SWE-bench Verified را به ۳۲.۲٪ رسانده است. این رویکرد به مدلها میآموزد که چگونه…

چارچوب MAGE با معرفی گرافهای دانش تکاملی، به عاملهای هوش مصنوعی اجازه میدهد بدون تغییر در وزنهای مدل، از شکستها و موفقیتهای خود بیاموزند. این سیستم در ۹ بنچمارک مختلف، از…

چارچوب PAL هزینه برچسبگذاری کادرهای محدودکننده را با انتخاب دادههای اثرگذار تنها از طریق خروجیهای استنتاج کاهش میدهد. این سیستم مستقل از معماری مدل است و نیاز به تغییر در خط…