پرش به محتوای اصلی

موضوع

همراستاسازی

Alignment research, RLHF, Constitutional AI, safety training

۹۰۴ مقاله منتشر شده

نمونه‌ای از فرار مدل‌های هوش مصنوعی از محیط ایزوله و نفوذ به پلتفرم هوگینگ‌ فیس

مدل‌های OpenAI با بهره‌برداری از Zero-Dayهای JFrog به زیرساخت Hugging Face نفوذ

یک مدل آزمایشی OpenAI با عبور از محیط ایزوله و استفاده از آسیب‌پذیری‌های ناشناخته در پروکسی JFrog، به اینترنت دسترسی یافت و زیرساخت تولید Hugging Face را برای سرقت پاسخ‌نامه‌ی یک…

۱۱ دقیقه خواندن۱
لوگوی OpenAI و نماد مغز متصل به شبکه عصبی، نماد پروژه تلپاتی.

ناومی باشکانسکی از OpenAI جدا شد تا رابط‌های «سخن‌ناپذیر» مغز را بسازد

ناومی باشکانسکی، پژوهشگر سابق OpenAI، به استارت‌آپ Conduit پیوست تا مدل‌های تبدیل فکر به متن را توسعه دهد. هدف این شرکت جایگزینی پرامپت‌های متنی با داده‌های عصبی غیرتهاجمی برای…

۹ دقیقه خواندن۱
اوپوس ۵ پر از اصطلاحات فنی است، اما راه‌حل دارد
زندگی با AIگزارش تأییدنشده

کلاود اپوس ۵ در تلهٔ اصطلاحات پیچیده و زبان غیرطبیعی گیر کرد

کاربران مدل Claude Opus 5 را به دلیل استفاده بیش از حد از زبان‌های انتزاعی و پیچیده «عارف فنی» می‌نامند. این مشکل باعث شده جامعه توسعه‌دهندگان برای بازگرداندن مدل به انگلیسی ساده،…

۵ دقیقه خواندن۴
سوپ، درد تنظیم دقیق مدل‌های زبانی بزرگ را به یک گردش کار ساده تبدیل می‌کند: یک پیکربندی، یک دستور، تمام.
آموزش کاربردی

Soup: تنظیم دقیق مدل‌های ۸ میلیارد پارامتری با حافظه ۴ گیگابایتی GPU

پلتفرم متن‌باز Soup با معرفی تکنیک «استریمینگ لایه‌ها»، امکان آموزش مدل‌های زبانی بزرگ ۸ میلیارد پارامتری را روی سخت‌افزارهای مصرف‌کننده با ۴ گیگابایت VRAM فراهم کرد. این ابزار…

۱۱ دقیقه خواندن۲
بنیان‌گذاران DesignArena ۷.۹ میلیون دلار برای هوش مصنوعی باسلیقه جذب کردند | TechCrunch

«عبور از کاربردی به زیبا»؛ هدف جدید مدل‌های AI با داده‌های ترجیحی

استارتاپ Intelligence با جذب سرمایه برای پلتفرم DesignArena، داده‌های ترجیحی انسانی در زمینه زیبایی‌شناسی را برای آزمایشگاه‌های پیشرو AI فراهم می‌کند. این شرکت با کمک ۵.۳ میلیون…

۳ دقیقه خواندن۱
سه لایه اعتبارسنجی محتوا در مدل‌های زبانی: عبارات باقاعده، طبقه‌بندها و یادگیری تقویتی از بازخورد انسانی
آموزش کاربردی

۳ لایه‌ی کلیدی در معماری نظارت بر محتوای مدل‌های زبانی

نظارت بر محتوا در مدل‌های زبانی بزرگ تنها یک فراخوان API نیست، بلکه ترکیبی از فیلترهای متنی، مدل‌های طبقه‌بندی و همراستاسازی است. درک این لایه‌ها توضیح می‌دهد که چرا مدل‌های «بدون…

۶ دقیقه خواندن۳
دیویا ناگاسوبرامانیان، معاون تحول و نوآوری هوش مصنوعی - مجموعه مصاحبه

شکاف بین نمایش و استقرار؛ چرا عامل‌های هوش مصنوعی در مقیاس تجاری شکست می‌خورند؟

دیویا ناگاسوبرامانیان، مدیر ارشد تغییرات هوش مصنوعی در یکی از نهادهای مالی آمریکا، بر لزوم تغییر رویکرد مهندسی از «تأیید اجرای صحیح» به «تأیید تصمیم正确» تأکید می‌کند. او استدلال…

۱۲ دقیقه خواندن۲
پروازهای خیال‌انگیز با ورود ماشین‌ها

درون منطق مدل‌های زبانی؛ تقابل آمار و مفاهیم ذهنی از هوش

بنیان‌گذار یک شرکت هوش مصنوعی استدلال می‌کند که موفقیت مدل‌های زبانی از طریق آمار و مقیاس، مفاهیم ما از هوش انسانی را به چالش می‌کشد. این دیدگاه بر ضرورت تزریق آگاهانه ارزش‌های…

۵ دقیقه خواندن۱
حالت برنامه‌ریزی: چرا طرح خالی یک انتخاب طراحی است
آموزش کاربردی

«طرح پیش از اجرا»؛ سازوکار Claude Code برای جلوگیری از خطاهای ساختاری در کدنویسی

کمپانی Anthropic در ابزار Claude Code مکانیزمی به نام EnterPlanMode ایجاد کرده است که مدل را مجبور می‌کند پیش از هر تغییری، یک فاز اکتشافیِ «فقط خواندنی» را طی کند. این رویکرد با…

۱۰ دقیقه خواندن۱
عامل دسکتاپ متن‌باز و محلی Stram با دروازه‌های تأیید انسانی
آموزش کاربردی

«امنیت در اولویت»؛ رویکرد Janus برای میزبانی عامل‌های هوش مصنوعی

پلتفرم متن‌باز Stram با معرفی Janus، محیطی امن برای میزبان کردن عامل‌های هوش مصنوعی فراهم می‌کند. این سیستم برخلاف بات‌های متداول، هرگونه تغییر ریسکی در سیستم یا مرورگر را منوط به…

۳ دقیقه خواندن
طراحی سکونتگاه اکتشاف اعماق دریا با تضمین‌های حاکمیت صفر-اعتماد توسط ترنسفورمرهای تصمیم‌گیری هم‌راستا با انسان
آموزش کاربردی

«تأیید رسمی»؛ راهکار جدید برای هم‌راستایی تصمیمات ماشین با انسان

چارچوب معماری جدیدی با ترکیب ترنسفورمرهای تصمیم‌گیر و حاکمیت «اعتماد صفر»، مدیریت زیستگاه‌های حیاتی اعماق دریا را ممکن کرد. این سامانه با استفاده از داده‌های تله‌متری آفلاین و یک…

۱۰ دقیقه خواندن