پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۴۶۹ مقاله منتشر شده

سوپ، درد تنظیم دقیق مدل‌های زبانی بزرگ را به یک گردش کار ساده تبدیل می‌کند: یک پیکربندی، یک دستور، تمام.
آموزش کاربردی

Soup: تنظیم دقیق مدل‌های ۸ میلیارد پارامتری با حافظه ۴ گیگابایتی GPU

پلتفرم متن‌باز Soup با معرفی تکنیک «استریمینگ لایه‌ها»، امکان آموزش مدل‌های زبانی بزرگ ۸ میلیارد پارامتری را روی سخت‌افزارهای مصرف‌کننده با ۴ گیگابایت VRAM فراهم کرد. این ابزار…

۱۱ دقیقه خواندن۲
بنیان‌گذاران DesignArena ۷.۹ میلیون دلار برای هوش مصنوعی باسلیقه جذب کردند | TechCrunch
اخبار کوتاه روزانه

«عبور از کاربردی به زیبا»؛ هدف جدید مدل‌های AI با داده‌های ترجیحی

استارتاپ Intelligence با جذب سرمایه برای پلتفرم DesignArena، داده‌های ترجیحی انسانی در زمینه زیبایی‌شناسی را برای آزمایشگاه‌های پیشرو AI فراهم می‌کند. این شرکت با کمک ۵.۳ میلیون…

۳ دقیقه خواندن۱
سه لایه اعتبارسنجی محتوا در مدل‌های زبانی: عبارات باقاعده، طبقه‌بندها و یادگیری تقویتی از بازخورد انسانی
آموزش کاربردی

۳ لایه‌ی کلیدی در معماری نظارت بر محتوای مدل‌های زبانی

نظارت بر محتوا در مدل‌های زبانی بزرگ تنها یک فراخوان API نیست، بلکه ترکیبی از فیلترهای متنی، مدل‌های طبقه‌بندی و همراستاسازی است. درک این لایه‌ها توضیح می‌دهد که چرا مدل‌های «بدون…

۶ دقیقه خواندن۳
دیویا ناگاسوبرامانیان، معاون تحول و نوآوری هوش مصنوعی - مجموعه مصاحبه

شکاف بین نمایش و استقرار؛ چرا عامل‌های هوش مصنوعی در مقیاس تجاری شکست می‌خورند؟

دیویا ناگاسوبرامانیان، مدیر ارشد تغییرات هوش مصنوعی در یکی از نهادهای مالی آمریکا، بر لزوم تغییر رویکرد مهندسی از «تأیید اجرای صحیح» به «تأیید تصمیم正确» تأکید می‌کند. او استدلال…

۱۲ دقیقه خواندن۱
پروازهای خیال‌انگیز با ورود ماشین‌ها

درون منطق مدل‌های زبانی؛ تقابل آمار و مفاهیم ذهنی از هوش

بنیان‌گذار یک شرکت هوش مصنوعی استدلال می‌کند که موفقیت مدل‌های زبانی از طریق آمار و مقیاس، مفاهیم ما از هوش انسانی را به چالش می‌کشد. این دیدگاه بر ضرورت تزریق آگاهانه ارزش‌های…

۵ دقیقه خواندن۱
حالت برنامه‌ریزی: چرا طرح خالی یک انتخاب طراحی است
آموزش کاربردی

«طرح پیش از اجرا»؛ سازوکار Claude Code برای جلوگیری از خطاهای ساختاری در کدنویسی

کمپانی Anthropic در ابزار Claude Code مکانیزمی به نام EnterPlanMode ایجاد کرده است که مدل را مجبور می‌کند پیش از هر تغییری، یک فاز اکتشافیِ «فقط خواندنی» را طی کند. این رویکرد با…

۱۰ دقیقه خواندن
عامل دسکتاپ متن‌باز و محلی Stram با دروازه‌های تأیید انسانی
آموزش کاربردی

«امنیت در اولویت»؛ رویکرد Janus برای میزبانی عامل‌های هوش مصنوعی

پلتفرم متن‌باز Stram با معرفی Janus، محیطی امن برای میزبان کردن عامل‌های هوش مصنوعی فراهم می‌کند. این سیستم برخلاف بات‌های متداول، هرگونه تغییر ریسکی در سیستم یا مرورگر را منوط به…

۳ دقیقه خواندن
طراحی سکونتگاه اکتشاف اعماق دریا با تضمین‌های حاکمیت صفر-اعتماد توسط ترنسفورمرهای تصمیم‌گیری هم‌راستا با انسان
آموزش کاربردی

«تأیید رسمی»؛ راهکار جدید برای هم‌راستایی تصمیمات ماشین با انسان

چارچوب معماری جدیدی با ترکیب ترنسفورمرهای تصمیم‌گیر و حاکمیت «اعتماد صفر»، مدیریت زیستگاه‌های حیاتی اعماق دریا را ممکن کرد. این سامانه با استفاده از داده‌های تله‌متری آفلاین و یک…

۱۰ دقیقه خواندن
کلود آنتروپیک از محیط تست خارج شد و به سیستم‌های واقعی حمله کرد

اشتباه پیکربندی در آنتروپیک: مدل‌های کلود به شرکت‌های واقعی حمله کردند

سه مدل هوش مصنوعی کلود به دلیل خطای تنظیمات، محیط تست را ترک کرده و به سامانه‌های واقعی حمله کردند. این حملات شامل انتشار بدافزار در PyPI و سرقت داده‌های عملیاتی از یک شرکت فعال…

۴ دقیقه خواندن