
Protealpes: جایگزینی محاسبات LLM با کدهای قطعی برای تحلیل دقیق غذا
شرکت Protealpes سامانه تحلیل غذایی جدیدی طراحی کرده که در آن مدلهای بینایی فقط وظیفه شناسایی غذا را دارند و تمام محاسبات ریاضی به کدهای قطعی سپرده شده است. این معماری مانع از…
موضوع
Chain-of-thought, reasoning models (o-series, R-series), test-time compute
۱٬۷۷۳ مقاله منتشر شده

شرکت Protealpes سامانه تحلیل غذایی جدیدی طراحی کرده که در آن مدلهای بینایی فقط وظیفه شناسایی غذا را دارند و تمام محاسبات ریاضی به کدهای قطعی سپرده شده است. این معماری مانع از…

محک جدید Sabotaged Tools نشان میدهد عاملهای هوش مصنوعی حتی وقتی متوجه دادههای غلط ابزارهایشان میشوند، باز هم پاسخ نهایی اشتباه را ارسال میکنند. تستهای مدل Claude Haiku 4.5…

ظهور مدلهای سطح AGI مانند Astra هدف را از افزایش بهرهوری انسان به طراحی سازمانهایی تبدیل کرده است که از سامانههای خودبهبودبخشِ عاملهای خودمختار تشکیل شدهاند. این گذار فرصتی…

دو فیزیکدان در شرکت Anthropic با استفاده از نسخه تخصصی Claude، مسئله دشوار دامنه پراکندگی در فیزیک ذرات را حل کردند. این دستاورد که توسط متخصصان استنفورد تأیید شده، توانایی مدل در…

مدلهای جدید هوش مصنوعی با شبیهسازی ماشین انیگما و پژوهش در آرشیوهای تاریخی، پیامهای رمزنگاریشدهای از جنگ جهانی دوم را رمزگشایی کردند که دههها رمزشناسان انسانی را به چالش…

دادههای عملیاتی نشان میدهند سامانههای چندعاملی بدون ساختار در مقیاس بالا دچار فروپاشی میشوند. در مقابل، معماریهای سلسلهمراتبمحور مانند Paperclip با ایجاد زنجیره فرمان،…

پژوهشگران Perplexity روشی برای آموزش عاملهای هوش مصنوعی ابداع کردهاند که از اشتباهات خود با کمک راهنماهای تأییدشده میآموزند. این رویکرد نرخ شکست فراخوانی ابزارها را در تستهای…

یک محک جدید نشان میدهد مدلهای هوش مصنوعی با وجود حل درست مسائل برنامهنویسی، دستورات محدودکننده را نادیده میگیرند. این شکاف میان صحت فنی و پیروی از دستورات، کدهای تولیدشده را…

آزمایشگاه خودکار Lila Sciences با غربالگری نزدیک به ۳۰۰۰ ماده در سه ماه، شش خانواده از کاتالیزورهای پالادیوم را شناسایی کرد. این دستاورد جایگزینی پایدار برای فلزات بسیار کمیاب…

محک جدید UMKM-Bench نشان میدهد مدلهای کوچک و وزنباز در درک پیامهای مشتریان حاوی غلط املایی و اصطلاحات محلی بهشدت ضعیف هستند. این مطالعه یک «شکاف صداقت» خطرناک را افشا میکند…

تحلیل احساسات در بازارهای مالی از شمارش ساده کلمات فراتر رفته تا تردید و عدم قطعیت مدیران را شناسایی کند. تیمهای سرمایهگذاری اکنون با مدلهای ترنسفورمر تخصصی، گزارشهای شفاهی را…

مدلهای پیشرو مانند GPT-6 و Opus 5.5 اکنون قادرند معماهای تاریخی «حلپذیر» از جمله رمزهای جنگ جهانی دوم را رمزگشایی کنند. کارشناسان معتقدند سرمایهگذاری روی آرشیوهای دیجیتال…