
چگونه ردپای عاملهای هوش مصنوعی به جریانهای کاری خودبهبودبخش تبدیل میشود؟
لنگچین با تأسیس یک مرکز پژوهشی جدید، بر روی «یادگیری مستمر» برای عاملهای هوش مصنوعی تمرکز کرده است. هدف این است که ردپاهای اجرایی مدلها به دادههای آموزشی تبدیل شوند تا…
دستهبندی
تحلیلهای عمیق مدلها، مقالات و بنچمارکها — پیشچاپها، ارزیابیها، مدلهای زبانی پیشرو و پژوهش همراستاسازی.
۵٬۷۱۱ مقاله منتشر شده

لنگچین با تأسیس یک مرکز پژوهشی جدید، بر روی «یادگیری مستمر» برای عاملهای هوش مصنوعی تمرکز کرده است. هدف این است که ردپاهای اجرایی مدلها به دادههای آموزشی تبدیل شوند تا…

استفاده از فایلهای دستورالعمل حجیم در Claude Code باعث اتلاف هزاران توکن در هر درخواست میشود. جایگزینی این روش با سیستم «مهارتها» میتواند این هزینه را به ۵۰ توکن کاهش دهد.

نسخه ۲.۱.۱۳۹ ابزار Claude Code با معرفی دستور /goal، امکان تعریف شرایط پایان برای کارهای خودکار را فراهم کرد. در این سیستم، یک مدل مجزا از خانواده Haiku وظیفه ارزیابی هر گام را بر…

شرکت Zyphra با معرفی ZAYA1-8B-Diffusion-Preview، نخستین مدل MoE را ارائه کرد که از ساختار خودبازگشتی به مدل انتشار گسسته تبدیل شده است. این معماری با تولید همزمان ۱۶ توکن، سرعت…

یک استراتژی جدید با ترکیب مدل Mistral Nemo و ابزار vLLM، هزینه استنتاج را تا ۹۵٪ کاهش میدهد. این پیکربندی روی GPUهای ارزانقیمت، سرعت پاسخدهی را ۳ برابر کرده و نیاز به پرداخت…

پروژهی جدید OWASP با نام Agent Memory Guard، عاملهای هوش مصنوعی را در برابر حملات مسمومیت حافظه محافظت میکند. این ابزار با استفاده از امضاهای رمزنگاری و تحلیل معنایی، مانع از…

زبان آزمایشی Aperio با جایگزینی نحو سنتی با مدلهای ساختاری به نام loci، فاصله بین تفکر انسانی و کد را میگیرد. هدف این پروژه کاهش هزینه توکنها و تأخیر در عاملهای کدنویسی است.

چارچوب Soul Spec با تفکیک اصول، هویت و گردش کار در فایلهای مجزا، مدیریت شخصیتهای هوش مصنوعی را متحول میکند. این معماری بر اساس یافتههای اخیر Anthropic است که ثابت میکند آموزش…

یک پروکسی جدید به نام mcp-auth-adapter امکان اتصال سرورهای MCP به سرویسهای احراز هویت سازمانی مثل Okta را فراهم میکند. این ابزار با سادهسازی فرآیند ثبتنام و فیلتر کردن…

مدل محلی Qwen 3.6 27B اکنون در بنچمارک SWE-bench Verified تنها ۳.۶ درصد با Claude Opus 4.6 فاصله دارد. برای توسعهدهندگانی که هزینههای بالای API دارند، خرید یک GPU RTX 4090 در…

مدل DeepSeek-V4 با ارائه استدلالهای سطح پیشرو و پنجره متنی یک میلیون توکنی، شکاف بین مدلهای وزنباز و تجاری را از بین برد. این مدل در بنچمارکهای کلیدی با Claude Opus 4.6-Max…

پلتفرم Arxiv نویسندگانی را که محتوای تأییدنشدهی هوش مصنوعی (مانند ارجاعات جعلی) ارسال کنند، برای یک سال محروم میکند. این تصمیم در پاسخ به حجم بالای محتوای بیکیفیت و تلاش برای…