
خطای بصری در مدلهای زبانی؛ وقتی اطمینان بالا ماسکی برای توهم است
بررسی اسناد مالی نشان میدهد مدلهای زبانی بزرگ حتی هنگام خوانش اشتباه دادهها، سطح اطمینان بالایی گزارش میکنند. راهکار این مشکل نه در مهندسی پرامپت، بلکه در پیادهسازی بررسیهای…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۸۰۰ مقاله منتشر شده

بررسی اسناد مالی نشان میدهد مدلهای زبانی بزرگ حتی هنگام خوانش اشتباه دادهها، سطح اطمینان بالایی گزارش میکنند. راهکار این مشکل نه در مهندسی پرامپت، بلکه در پیادهسازی بررسیهای…

تست عاملهای صوتی با پرامپتهای تکمرحلهای باعث شکست آنها در محیط واقعی میشود، زیرا کاربران واقعی جملات را قطع میکنند یا نظرشان تغییر میکند. چارچوب جدیدی بر شبیهسازی مکالمات…

رویکردی جدید در معماری خلاصهسازی تماسهای CRM، اولویت را از وفاداری به یک مدل خاص به یک قرارداد API مشترک تغییر داده است. این لایه به توسعهدهندگان اجازه میدهد بدون بازنویسی…

پژوهشگران حفرهای امنیتی در Grok کشف کردند که با رمزگذاری دستورات مخرب، حفاظهای ایمنی مدل را دور میزند و دادههای شخصی کاربران را استخراج میکند. این حمله که «تزریق زمینه…

پژوهشگران با ترکیب یادگیری ماشین چندوجهی و تصاویر دوربین گوشی، روشی برای تخمین مقاومت به انسولین و ترکیب بدنی ابداع کردهاند. این رویکرد جایگزینی ارزان و در دسترس برای اسکنهای…

ریچارد ساتون، پیشگام یادگیری تقویتی، استدلال میکند که دادههای مصنوعی نمیتوانند گلوگاه مقیاسپذیری مدلهای زبانی را حل کنند زیرا جهان واقعی بینهایت پیچیدهتر از هر شبیهسازی…

اپلیکیشن RollTab با استفاده از یک ترنسفورمر تخصصی، قادر است ملودیهای پیانو را بهصورت آنی و روی دستگاه (On-device) تکمیل کند. این پروژه ثابت میکند که پاکسازی دقیق دادهها و…

یک تحلیل فنی فاش کرد که ایجاد هر زیرعامل در Claude Code هزینهای ثابت و سنگین معادل ۴۳۶ هزار توکن دارد. این «مالیاتِ ایجاد» باعث میشود تفویض وظایف کوچک به عاملها بهجای…

توسعهدهندگان عاملهای هوش مصنوعی در سال ۲۰۲۶ با شکافی عمیق میان چارچوبهای استدلالی و زیرساختهای مرورگر مواجهاند. در حالی که ابزارهایی مثل Browser Use بر «چه چیزی کلیک شود»…

پژوهش جدید دانشگاه استنفورد نشان میدهد مدلهای زبانی کوچک (SLM) که روی سختافزار محلی اجرا میشوند، بهسرعت در حال پر کردن شکاف عملکرد با مدلهای ابری هستند. این تغییر میتواند…

شرکت آنتروپیک یک مدل هوش مصنوعی قدرتمند و محرمانه به نام Model 2 را برای مهندسی و کدنویسی داخلی به کار گرفته است. این مدل از تمام نسخههای عمومی کلود پیشرفتهتر است، اما فعلاً…

شرکت OpenAI سامانه جدیدی را معرفی کرد که الگوهای سوءاستفاده را بدون ذخیره حتی یک بایت از دادههای کاربر شناسایی میکند. این فناوری به مشتریان سازمانی اجازه میدهد بدون نگرانی از…