
«خطای بازیابی»؛ دلیل اصلی فریبدهنده بودن نتایج ارزیابی RAG
نوسان در نتایج ارزیابی سیستمهای RAG معمولاً به دلیل عدم قطعیت در لایهی بازیابی است، نه ناپایداری مدل زبانی. با تثبیت پارامترهای جستوجو و نسخهبندی تکهها، میتوان نویز را حذف و…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۵۶۶ مقاله منتشر شده

نوسان در نتایج ارزیابی سیستمهای RAG معمولاً به دلیل عدم قطعیت در لایهی بازیابی است، نه ناپایداری مدل زبانی. با تثبیت پارامترهای جستوجو و نسخهبندی تکهها، میتوان نویز را حذف و…

سامسونگ با تأسیس بخش اختصاصی RX، تولید رباتهای انساننما را از سال جاری آغاز میکند. این شرکت ۱۳ میلیارد دلار برای ساخت مراکز تولید در کره جنوبی و قطبهای پژوهشی در جهان اختصاص…

دیپسیک ثابت کرد که مدلهای زبانی کوچک میتوانند پیچیدگیهای استدلالی مدلهای عظیم را تنها از طریق تنظیم نظارتشده (SFT) به ارث ببرند. این دستاورد، باور پیشین صنعت مبنی بر…

یک چارچوب جدید برای عاملهای هوش مصنوعی، زنجیرههای شکنندهی پرامپت را با طرحوارههای تایپشده و ارزیابی گامبهگام جایگزین کرده است. این تغییر باعث کاهش شدید توهمات و زمان…

بررسی سه گزارش جامع از ابزارهای هوش مصنوعی نشان میدهد مهندسان با سیستمهای رتبهبندی متناقض و پراکنده روبهرو هستند. این تضاد باعث شده تا هزینهٔ واقعی داشتن یک «پشتهٔ ابزاری»…

متا ابزار Astryx را بهصورت متنباز عرضه کرد؛ سیستمی با بیش از ۱۵۰ مؤلفه که تفاوت کلیدی آن، جداسازی منطق رفتاری از ظاهر بصری برای تسهیل دسترسی عاملهای هوش مصنوعی است.

پلتفرم AgentCrew با معرفی معماری MCN، ساختاری کمکد ارائه داده که در آن نحوه همکاری عاملها از منطق کاری آنها تفکیک شده است. این سیستم از یک گذرگاه پیام مرکزی و مسیریابی مبتنی بر…

یک راهنمای عملی نشان میدهد چگونه میتوان مدل Llama 3.3 70B تنظیمشده را تنها با ۱۱ دلار در ماه روی زیرساخت DigitalOcean اجرا کرد. این روش با ترکیب vLLM برای استنتاج و آداپتورهای…

معماری جدید IRC-A با جداسازی «هارنس» (زمینه عملیاتی) از «پروتکل انتقال»، عاملهای هوش مصنوعی را از گرافهای صلب به شبکههای غیرمتمرکز منتقل میکند. این رویکرد تأخیر را کاهش و…

مهندسان در هنگام استقرار Letta نباید بازیابی ساده اطلاعات را معیار موفقیت بدانند. تمرکز اصلی در اولین اجرا باید بر تأیید جداسازی حافظه و پاکسازی وضعیت برای جلوگیری از نشت دادهها…

آزمونهای عملی مدل Kimi K3 نشان میدهد هزینه تکمیل یک تسک کدنویسی واقعی ۰.۱۹ دلار است. این داده ثابت میکند «هزینه تا رسیدن به پاسخ نهایی» متری کی훨سی از قیمت هر توکن است.

یک توسعهدهنده دریافت که تقسیم گردشکارهای هوش مصنوعی به چندین عامل تخصصی، بدون بهبود کیفیت، هزینههای سنگینی ایجاد میکند. با ادغام این مراحل در یک جلسه واحد، هزینهها ۸۷.۷ درصد…