
LLM در برابر Regex؛ گذار از الگوهای صلب به تشخیص قصد پویا
راهنمای فنی جدیدی روش انتقال از الگوهای صلب Regex به طبقهبندی قصد مبتنی بر LLM را بررسی میکند. توسعهدهندگان میتوانند با استفاده از خروجیهای ساختاریافته JSON و پرامپتنویسی با…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۶۸۸ مقاله منتشر شده

راهنمای فنی جدیدی روش انتقال از الگوهای صلب Regex به طبقهبندی قصد مبتنی بر LLM را بررسی میکند. توسعهدهندگان میتوانند با استفاده از خروجیهای ساختاریافته JSON و پرامپتنویسی با…

پژوهش جدید دیوید آفریقا و جیکوب پفائو نشان میدهد که مدلهای زبانی فاقد سازوکار منسجم برای «ناصادق بودن» هستند. حتی با آموزش هدفمند برای دروغ گفتن، مدلها تنها عادتهای محدود کسب…

کندی عملکرد عاملهای مرورگر معمولاً ناشی از محدودیتهای مدلهایی مثل GPT-5 نیست، بلکه نتیجهٔ «تورم پرامپت» است. ارسال دادههای تکراری و اسکرینشاتهای حجیم، پنجرهٔ زمینه را اشغال…

یک ریاضیدان هشدار میدهد که توانایی مدلهای زبانی در حل حدسهای دیرینه، تجربه «مقدس» کشف انسانی را از بین میبرد. این رویکرد ادعا میکند که AI اگرچه اثباتهای ظریفی تولید میکند،…

ارزیابی فنی سه دستیار کدنویسی هوش مصنوعی نشان میدهد که چکلیستهای سنتی، «توافق با انسان» را با «دقت فنی» اشتباه میگیرند. با معرفی بازبینی مستقل برای یافتههای پیشبینینشده،…

مدل جدید Claude Opus 5 با کاهش چشمگیر هزینه در هر تسک، موفق شد در اکثر معیارهای سنجش از رقیب خود Fable 5 پیشی بگیرد. این مدل در کارهای اداری و کدنویسی پیشرو است، اما در سطوح بالای…

جدول امتیازات ARC Prize چارچوبی جدید برای اندازهگیری هوش مصنوعی معرفی کرد که عملکرد حل مسئله را در برابر هزینه محاسباتی میسنجد. این دادهها تفاوت میان استنتاج ساده مدلهای زبانی…

شرکت TwelveLabs با معرفی زیرساخت Jockey، رویکرد سنتی «مجموعهای از فریمها» را در تحلیل ویدیو به چالش میکشد. این سیستم با ایجاد یک لایه حافظه اختصاصی، ویدیو را بهجای تصاویر…

شرکت OpenAI با اختصاص ۱۰ میلیون دلار دسترسی به API، مدلهای پیشرو خود را در سامانه «مأموریت جنسیس» وزارت انرژی آمریکا ادغام میکند. این همکاری با هدف دوبرابر کردن سرعت اکتشافات…

تحلیل فنی ۱۷۰ مدل هوش مصنوعی نشان میدهد Claude Opus 5 در صدر سلسلهمراتب هوشمندی قرار دارد، در حالی که مدلهای Mercury 2 و Gemma 3n در سرعت و هزینه پیشتایند. این دادهها شکاف…

محک جدید Drone-Bench نشان میدهد مدلهای هوش مصنوعی پیشرو در حال حاضر قادر به اجرای زنجیرهای از وظایف برای نظارت خودمختار نیستند. اگرچه این مدلها در تکوظیفهها موفقاند، اما در…

مدل Llama 4 Scout پنجره متنی ۱۰ میلیون توکنی را ادعا میکند، اما تحلیلهای فنی نشان میدهد این عدد صرفاً یک گسترش ریاضی است. در حالی که مدل در یافتن تکه-اطلاعات موفق است، توانایی…