
پژوهش جدید: شکست CLIP و BLIP در تشخیص تفاوتهای جزئی محصولات
آزمایشهای جدید نشان میدهد مدلهای هوش مصنوعی چندوجهی در شناسایی تفاوتهای کوچک بین برندها و سایز محصولات شکست میخورند. این نقص در دقت، کنترل کیفیت خودکار در تجارت الکترونیک را…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۶۱ مقاله منتشر شده

آزمایشهای جدید نشان میدهد مدلهای هوش مصنوعی چندوجهی در شناسایی تفاوتهای کوچک بین برندها و سایز محصولات شکست میخورند. این نقص در دقت، کنترل کیفیت خودکار در تجارت الکترونیک را…

یک خطلوله (Pipeline) جدید با جایگزینی امتیازدهی کلی با روش «دیکشنری ویژگیها»، خطاهای ظریف برچسب محصول را شناسایی میکند. این سیستم با ترکیب EasyOCR برای متن و Moondream2 برای…

پروژه Gitlord با تبدیل هر تعامل عاملهای هوش مصنوعی به یک کامیت گیت، سیستمی برای کنترل نسخه (Version Control) گفتگوها ایجاد کرده است. این ابزار به توسعهدهندگان اجازه میدهد…

پروژه Petals با توزیع بار محاسباتی میان کاربران، امکان اجرای مدلهای عظیم مانند Llama 3.1 را روی GPUهای معمولی فراهم میکند. در این مدل غیرمتمرکز، هر کاربر بخش کوچکی از مدل را…

شرکت Cursor سامانه Cursor Router را معرفی کرد که با تحلیل پیچیدگی هر درخواست، آن را به بهینهترین مدل میسپارد. این رویکرد کیفیت خروجی مدلهای پیشرو را حفظ کرده و همزمان…

پروژه Order Supervisor با استفاده از Temporal، معماری عاملهای هوش مصنوعی را تغییر داده تا بتوانند بدون مصرف مداوم منابع، برای روزها در حالت خواب بمانند و تنها با دریافت…

فراخوانیهای استاندارد API از طریق REST باعث ایجاد تأخیرات تجمعی میشود که سرعت عاملهای خودکار را بهشدت میگیرد. معماری جدید «آداپتور محلی» با اجرای ابزارها به عنوان فرآیندهای…

کاخ سفید و وزارت انرژی آمریکا طرح «مأموریت جنسیس» (Genesis Mission) را معرفی کردند. این برنامه ۵ میلیارد دلاری از هوش مصنوعی برای حل چالشهای زیرساختی در حوزههای سلامت، انرژی و…

پلتفرم Apogee Watcher در حال بررسی پروتکل زمینه مدل (MCP) است تا جایگزینی امن برای خروجیهای CSV باشد. این رویکرد به جای انتقال دستی دادهها، دسترسی محدود و احرازنشده به APIها را…

تستهای باینری سنتی در ارزیابی مدلهای زبانی شکست میخورند زیرا نمرات خروجی، تخمینهایی آماری و آلوده به نویز هستند. تیمهای مهندسی باید تفاوت میان ابهام در دادهها و ناسازگاری…

مقایسهٔ جامع دو مدل پرچمدار نشان میدهد که Claude Opus 4.8 در بنچمارکهای پیچیدهٔ کدنویسی پیشرو است، اما GPT-5.6 با استراتژی مدلهای لایهبندیشده (Sol, Terra, Luna)، هزینههای…

سیسکو دو مدل زبانی کوچک با وزنهای باز برای شناسایی نقاط ضعف نرمافزاری عرضه کرد. این مدلها در مقایسه با مدلهای عظیم مانند GPT-5.5، هزینههای اسکن کد را به شدت کاهش داده و…