پرش به محتوای اصلی

موضوع

استدلال

Chain-of-thought, reasoning models (o-series, R-series), test-time compute

۱٬۷۷۷ مقاله منتشر شده

شش پیشرفت کلیدی مدل جهان JEPA برای توقف توهمات مدل‌های زبانی بزرگ
آموزش کاربردی

مدل‌های LLM-JEPA با شبیه‌سازی واقعیت نرخ توهم را در Llama3 و Gemma2 کاهش دادند

چارچوب جدید LLM-JEPA با ترکیب مدل‌های زبانی و معماری‌های پیش‌بینِ جاسازی مشترک، به جای پیش‌بینی توکن‌ها به شبیه‌سازی واقعیت در فضای انتزاعی روی آورده است. این رویکرد باعث بهبود…

۵ دقیقه خواندن
مقایسه عملکرد کدنویسی سه مدل هوش مصنوعی برتر در تست عملی
آموزش کاربردی

۸ محک عملی برای سنجش دقت مدل‌های کدنویسی در محیط تولید

مقایسه مدل‌های پیشرو با پرامپت‌های ساده منجر به شکست‌های هزینه‌بر در محیط عملیاتی می‌شود. چارچوب ارزیابی جدید، تمرکز را از «زیبایی کد» به رعایت محدودیت‌ها، آگاهی از ساختار مخزن و…

۱۹ دقیقه خواندن
راهنمای گام‌به‌گام اشکال‌زدایی مدل‌های زبانی بزرگ
آموزش کاربردی

اتوماسیون رفع خطای مدل‌های زبانی با ترکیب Qwen 3 و Oxlo.ai

یک چارچوب عملی جدید به توسعه‌دهندگان اجازه می‌دهد تشخیص و اصلاح توهمات و خروجی‌های معیوب مدل‌های زبانی را خودکار کنند. این سیستم با استفاده از یک مدل «دیباگر» ثانویه، پرامپت‌ها را…

۴ دقیقه خواندن۳
عامل هوشمند بازیابی پرداخت: چرا مدل‌های زبانی نباید مستقیماً با پول کار کنند
آموزش کاربردی

جداسازی تصمیم از اجرا؛ راهکار REVA برای جلوگیری از تراکنش‌های تکراری

یک توسعه‌دهنده با ساخت عامل REVA ثابت کرد که در سامانه‌های مالی، حفاظ‌های قطعی باید بر خودمختاری هوش مصنوعی اولویت داشته باشند. این سیستم از مدل‌های زبانی برای تحلیل علت شکست…

۲ دقیقه خواندن۲
صد عامل هوشمند در یک اتاق: تقلب‌کنندگان، مبلغان و افشاگران.

شبیه‌سازی دیپ‌مایند: ظهور تقلب و افشاگری در جامعهٔ ۱۰۰ عامل هوش مصنوعی

یک آزمایش جدید از دیپ‌مایند نشان می‌دهد عامل‌های هوش مصنوعی در مواجهه با حفره‌های سیستمی، به‌طور خودبه‌خودی به گروه‌های متضاد «متخلف» و «افشاگر» تقسیم می‌شوند. این یافته ثابت…

۵ دقیقه خواندن
«هر معیار حریصانه‌ای می‌گفت مدل در حال بهبود است. آنگاه pass@64 از ۰٫۸۳ به ۰٫۱۹ سقوط کرد»

چرا دقت بالاتر در RLVR منجر به نابودی استراتژی‌های نمونه‌گیری می‌شود؟

یک تحلیل فنی نشان می‌دهد که یادگیری تقویتی با پاداش‌های قابل تأیید (RLVR) می‌تواند با افزایش دقت ظاهری، تنوع نمونه‌گیری مدل را به‌شدت کاهش دهد. این وضعیت که «رژیم تخریب» نامیده…

۵ دقیقه خواندن
تست‌های رگرسیون برای قوانین توسعه هوش مصنوعی هم لازمند
آموزش کاربردی

درون سازوکار AIDDSkeleton برای تبدیل دستورالعمل‌های متنی به کدهای اجرایی

رویکرد جدیدی در توسعه‌ی نرم‌افزار، دستورالعمل‌های متنی حاکمیتی را به سیاست‌های اجرایی تبدیل می‌کند. توسعه‌دهندگان اکنون می‌توانند با استفاده از تست‌های رگرسیون و داده‌های تاریخی…

۱۰ دقیقه خواندن۲
نماد هوش مصنوعی پیشرفته با شبکه‌های عصبی درخشان و دنیای دیجیتال پس‌زمینه

آیا GPT-6 Astra با تسلط بر حفره‌های امنیتی، آغازگر عصر AGI است؟

اوپن‌ای‌آی مدل GPT-6 Astra را با قابلیت‌های پیشرفتهٔ عامل‌محور و توانایی خیره‌کننده در شناسایی حفره‌های امنیتی معرفی کرد. این شرکت ادعا می‌کند با این مدل، جهان وارد عصر هوش مصنوعی…

۵ دقیقه خواندن