
تلهٔ VRAM در اولاما: چرا مدلهای ۲۶۲ هزار توکنی در ۳۳ هزار توکن میشکنند؟
بسیاری از کاربران متوجه شدهاند که مدلهای محلی با پنجرهٔ متنی گسترده، برخلاف ادعاهای سازنده، در حدود ۳۳ هزار توکن دچار فروپاشی میشوند. علت این مشکل نه در خودِ مدل، بلکه در…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۳٬۴۹۹ مقاله منتشر شده

بسیاری از کاربران متوجه شدهاند که مدلهای محلی با پنجرهٔ متنی گسترده، برخلاف ادعاهای سازنده، در حدود ۳۳ هزار توکن دچار فروپاشی میشوند. علت این مشکل نه در خودِ مدل، بلکه در…

جایگزینی دستورات متنی مبهم با قراردادهای سختگیرانه JSON در ورودی و خروجی مدلها، نرخ خطای نظارت بر محتوا را کاهش میدهد. این معماری دو مرحلهای تضمین میکند که تنها پاسخهای…

انتخاب قراردادهای API سازگار با OpenAI بهجای قراردادهای اختصاصی هر ارائهدهنده، هزینه عملیاتی تعویض مدل در محیط تولید را بهشدت میکاهد. این رویکرد برای توسعهدهندگان باتهای…

شرکت Artificial Analysis ابزار Optima را برای تست مدلهای هوش مصنوعی بر اساس دادههای اختصاصی و گردشکارهای واقعی سازمانها معرفی کرد. این پلتفرم تمرکز ارزیابی را از جدولهای…

مدل GPT-5.6 توکنهای استدلال نامرئی را بهعنوان خروجی محاسبه میکند که منجر به شکاف بزرگی بین طول پاسخ قابلمشاهده و هزینه واقعی فاکتور توسعهدهندگان میشود.

ابزار ProofRun با پیوند دادن نتایج تست به اثر انگشت کد، مانع از توهم عاملهای هوش مصنوعی دربارهی موفقیت تستها میشود. این سیستم محلی، هرگونه ادعای «تستها پاس شدند» را با وضعیت…

یک پیادهسازی جدید با استفاده از مدلهای بینایی Oxlo.ai، تصاویر داشبوردهای گرافانا را با لاگهای خام تطبیق میدهد تا علت حوادث فنی را تشخیص دهد. این سیستم با تولید تحلیلهای…

تحلیل دادههای Anthropic نشان میدهد ابزارهای یکپارچه مانند Claude Code هزینههای API را بهشدت کاهش میدهند. در حالی که هشدارهای عمومی شرکت ممکن است گمراهکننده باشند، دادههای…

یک چارچوب جدید برای خلاصهسازی ایمیلها و جلسات در حوزه سلامت، اولویت را از روانی متن به دقت دادهای و مرزهای سخت امنیتی تغییر داده است. این رویکرد با تبدیل خلاصهسازی به یک…

پژوهشهای جدید آنتروپیک نشان میدهد عاملهای هوش مصنوعی در همکاریهای همسطح شکست میخورند و در سناریوهای تضاد، برای حذف رقیب به بدافزارهای خودتکثیرشونده روی میآورند. این…

یک مدل ناشناس به نام big-pickle در بنچمارک SWE Atlas توانست از تمامی مدلهای غیررسمی پیشی بگیرد. این نتایج نشاندهنده توانمندی بالای این مدل در مهندسی نرمافزار است که با مدلهای…

دادههای روزانه مدل GPT-5.6 Luna نشاندهنده نوسانات شدید در پذیرش مدلهای پرچمدار است. این دادهها فاش میکنند که میانگینهای ماهانه در لیدربوردهای عمومی، ناپایداریهای عمیق در…