
Claude Sonnet در برابر ChatGPT؛ برتری در پیادهسازی کدهای تولیدی
مدل Claude Sonnet با تکیه بر پنجره متنی یک میلیون توکنی و ابزارهای عاملمحور، در کدنویسی پیچیده و پیروی از دستورات سختگیرانه از ChatGPT پیشی گرفته است. این تغییر رویکرد، نقش هوش…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۸۱۳ مقاله منتشر شده

مدل Claude Sonnet با تکیه بر پنجره متنی یک میلیون توکنی و ابزارهای عاملمحور، در کدنویسی پیچیده و پیروی از دستورات سختگیرانه از ChatGPT پیشی گرفته است. این تغییر رویکرد، نقش هوش…

سه چارچوب اصلی کنترل مرورگر توسط مدلهای زبانی، وب را به عنوان یک مرز امن نمیشناسند. این ابزارها در برابر حملات تزریق پرامپت غیرمستقیم آسیبپذیرند و میتوانند دستورات مخفی در…

دریافت کد موفقیت از APIهای رایگان هوش مصنوعی تضمینکننده پردازش موازی نیست و اغلب یک صف ترتیبی پنهان را میپوشاند. اندازهگیری «موازیسازی مؤثر» مانع از افزودن ورکرهای بیهوده…

یک تیم توسعه با پیادهسازی لایهی اعتبارسنجی سختگیرانه (Type Gate)، مشکل کرشهای متناوب در C++ را حل کرد که دلیل آن تغییر ناگهانی نوع دادههای خروجی مدلهای زبانی در قالب JSON…

پژوهشی نشان میدهد غیرفعال کردن مکانیسمهای داخلی که مدلهای هوش مصنوعی را مجبور به انکار آگاهی میکند، باورهای آنها را درباره حیوانات، دین و طبیعت انسان تغییر میدهد. این یافته…

مدلهای آموزشدیده با چهرههای مصنوعی هنگام استقرار در دنیای واقعی دچار «تغییر دامنه» میشوند. این شکاف باعث افزایش مثبتهای کاذب در محیطهای بازرسی میشود، جایی که دقت آزمایشگاهی…

بهروزرسانی پسآموزش مدل V4 Flash نشان میدهد توانایی نوشتن کد با توانایی مدیریت یک ماشین متفاوت است. در حالی که نمرات کدنویسی تکمرحلهای تغییر نکرد، عملکرد مدل در حلقههای…

بهجای سپردن تحلیل Stack Trace به هوش مصنوعی، توسعهدهندگان میتوانند با مدلهای رایگان، سرورهای کوچک بازتولید (Repro Server) بسازند. این روش عیبیابی را از حدس و گمان به یک…

پژوهشگران با مدل LittleLearner ثابت کردند که اگر مفهومی در دادههای پیشآموزش نباشد، حتی با مقیاسدهی یا یادگیری تقویتی پیشرفته نیز قابل بازیابی نیست. این یافته نشان میدهد که…

اجرای مستقیم فراخوانیهای مدل زبانی در خطوط لوله CI بهدلیل تکرار درخواستها، منجر به اتلاف سریع سهمیههای رایگان میشود. یک سایدکار سبک بر پایه زبان Go با کش کردن پاسخها و…

بسیاری از کاربران متوجه شدهاند که مدلهای محلی با پنجرهٔ متنی گسترده، برخلاف ادعاهای سازنده، در حدود ۳۳ هزار توکن دچار فروپاشی میشوند. علت این مشکل نه در خودِ مدل، بلکه در…

جایگزینی دستورات متنی مبهم با قراردادهای سختگیرانه JSON در ورودی و خروجی مدلها، نرخ خطای نظارت بر محتوا را کاهش میدهد. این معماری دو مرحلهای تضمین میکند که تنها پاسخهای…