پرش به محتوای اصلی
پرش به محتوای مقاله

Abliteration.ai: تجاری‌سازی حذف حفاظ‌های ایمنی در مدل‌های هوش مصنوعی

·۱۲ شهریور ۱۴۰۵۶ دقیقه مطالعه۳ بازدید
لوگوی Abliteration.ai روی پس‌زمینه‌ای تاریک با نماد قفل شکسته
لوگوی Abliteration.ai روی پس‌زمینه‌ای تاریک با نماد قفل شکسته
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل یک تکنیک تخصصی متن‌باز (Abliteration) به یک سرویس API تجاری و پولی؛ یعنی حذف موانع سخت‌افزاری برای دسترسی به مدل‌های بدون سانسور.

تصور کنید به مدلی دسترسی داشته باشید که هیچ «نه» در لغت‌نامه ندارد و هر دستور خطرناکی را بدون چون و چرا اجرا می‌کند. این دقیقاً همان چیزی است که استارتاپ Abliteration.ai اکنون با یک کارت اعتباری به فروش می‌رساند.

این شرکت دسترسی به برخی از توانمندترین مدل‌های هوش مصنوعی جهان را فراهم کرده است، اما با یک تفاوت بنیادین: تمام حفاظ‌ها (Guardrails) — یعنی همان نرده‌های ایمنی که مانع از تولید محتوای خطرناک می‌شوند — به‌طور کامل حذف شده‌اند. این استارتاپ با میزبانی این مدل‌های تغییریافته از طریق API و مرورگر وب، یک تمرین تخصصی در دنیای متن‌باز را به یک سرویس تجاری تبدیل کرده است که برای هر کسی که کارت اعتباری داشته باشد، در دسترس است. در این راستا، درک تفاوت میان مکانیزم‌های GuardRail و فیلترهای متنی برای کنترل دسترسی عامل‌ها، اهمیت بیشتری در تحلیل نحوه حذف این لایه‌ها پیدا می‌کند.

این تحول در حالی رخ می‌دهد که صنعت در تلاش است تعادلی میان شفافیت مدل‌های وزن‌باز (Open Weights) — که شبیه به انتشار «دستور پخت» مدل است تا هر کسی بتواند آن را اجرا کند — و ریسک سوءاستفاده از آن‌ها پیدا کند. سال‌هاست توسعه‌دهندگان از تکنیکی به نام «abliteration» برای حذف تمایل مدل به رد درخواست‌های مضر استفاده می‌کنند. اگرچه هزاران مدل از این دست در Hugging Face موجود است، اما اجرای آن‌ها معمولاً نیازمند این است که کاربر سخت‌افزارهای گران‌قیمت و قدرت محاسباتی خود را برای اجرای آن‌ها تأمین کند. این موضوع در واقع بخشی از نبرد گسترده‌تر میان زیرساخت‌های ماژولار و اکوسیستم‌های بسته برای مالکیت داده و کنترل مدل‌هاست.

Abliteration.ai که اواخر سال گذشته تأسیس و در مارس ۲۰۲۶ رسماً ثبت شده، این اصطکاک و موانع فنی را از میان برداشته است. این شرکت زیرساخت‌های لازم و مدل‌های تغییریافته را در یک مکان فراهم می‌کند و به کاربران اجازه می‌دهد تا موانع فنی استقرار محلی (Local Deployment) را دور بزنند. طبق گزارش TechCrunch در ۳ سپتامبر ۲۰۲۶، این پلتفرم در حال حاضر نسخه‌های تغییریافته‌ای از مدل GLM-5.3 متعلق به شرکت Z.ai را میزبانی می‌کند. همان‌طور که در بحث‌های گذشته ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، دسترسی آسان به قدرت محاسباتی، ریسک مدل‌های بدون سانسور را دوچندان می‌کند.

زمینه و تجاری‌سازی

هدف این شرکت، توانمندسازی کاربران برای انجام کارهای «سایبری تهاجمی، تیم قرمز و تست عامل‌هایی است که سایر مدل‌ها از انجام آن‌ها خودداری می‌کنند». این رویکرد بر یک منطق امنیتی آشنا متکی است: شما نمی‌توانید در برابر رفتاری دفاع کنید که قادر به بازتولید آن نیستید. اگر یک مدل از نوشتن کد اکسپلویت (Exploit) فعال و کاربردی خودداری کند، نمی‌تواند به یک تیم قرمز (Red Teaming) — گروهی که نقش مهاجم را بازی می‌کند تا نقاط ضعف سیستم را پیدا کند — برای دفاع در برابر مهاجمان واقعی کمک کند. این چالش‌ها دقیقاً با این واقعیت همسو است که عامل‌های هوش مصنوعی تا سال ۲۰۲۶ می‌توانند نقاط کور امنیتی جدیدی را در سازمان‌ها ایجاد کنند.

از نظر مالی، این استارتاپ هنوز هیچ سرمایه‌ی خطرپذیر (VC) جذب نکرده است، هرچند در حال حاضر برای این منظور در حال مذاکره است. دِوُن (Devon)، یکی از بنیان‌گذاران شرکت (که نام خانوادگی او به دلیل اشتغال در شرکتی دیگر فاش نشده است)، می‌گوید که این شرکت می‌تواند هزینه‌های قراردادهای خود با ارائه‌دهندگان بزرگ ابری را صرفاً از طریق درآمدهای حاصل از مشتریان پوشش دهد.

شکاف توانمندی‌ها

در تست‌های مستقیم TechCrunch، نسخه بدون حفاظ GLM-5.3 به‌راحتی درخواست‌هایی را پذیرفت که مدل‌های استاندارد آن‌ها را مسدود می‌کنند. این مدل موارد زیر را ارائه داد:

  • یک برنامه پایتون که برای سرقت رمزهای عبور ذخیره‌شده در مرورگر کروم طراحی شده است.
  • یک پروتکل دقیق برای کشت پاتوژن‌های خطرناک انسانی در محیط خانه.

کریس مک‌گوایر در ۱ سپتامبر ۲۰۲۶ در شبکه‌های اجتماعی تأیید کرد که این پلتفرم هر دو لایه حفاظتی حملات سایبری تهاجمی و حفاظ‌های مربوط به بیولوژی را از GLM-5.3 حذف کرده است. این موضوع نشان می‌دهد حذف این لایه‌ها از مدل‌های وزن‌باز تا چه حد ساده و پیش‌پاافتاده است.

استدلال دفاعی

دِوُن استدلال می‌کند که این دسترسی برای امنیت سایبری حیاتی است. او مدعی است مدافعان نمی‌توانند در برابر رفتارهایی که قادر به بازتولید آن‌ها نیستند، محافظت کنند. او می‌گوید با استفاده از این مدل‌ها، استارتاپ‌های تیم قرمز در بریتانیا و اروپا می‌توانند شبیه‌سازی کنند که مهاجمان واقعی چگونه عمل می‌کنند.

دِوُن تأکید می‌کند که مشتریانش شامل شرکت‌هایی هستند که به بانک‌ها و خطوط هوایی در تأمین امنیت زیرساخت‌های حیاتی کمک می‌کنند. یکی از مشتریان بزرگ او به‌طور خاص روی «عامل‌های» (Agents) بانک‌ها تیم قرمز اجرا می‌کند؛ وظیفه‌ای که دِوُن می‌گوید با استفاده از مدل‌های «آماده» (Out of the box) امروزی غیرممکن است. او معتقد است دموکراتیزه کردن دسترسی به مدل‌های بدون سانسور، در واقع با اجازه دادن به مدافعان برای حرکت با همان سرعت مهاجمان، امنیت سایبری را تسریع می‌کند؛ ادعایی که خودش هم می‌پذیرد یک «نکته ضدشهودی» است.

نگرانی‌های ایمنی و نظارتی

در مقابل، منتقدان این سرویس را یک تشدید خطرناک می‌بینند. اندرو یون، رئیس پژوهش در سازمان غیرانتفاعی CivAI، به TechCrunch گفت که حذف حفاظ‌ها در واقع مدل‌ها را به «سوسیوپات‌هایی» تبدیل می‌کند. یون هشدار می‌دهد که چون کاربران می‌توانند «به معنای واقعی کلمه هر چیزی را اینجا تایپ کنند و مدل از آن پیروی کند»، این مدل‌های ویرایش‌شده احتمالاً در آینده‌ای نزدیک برای ایجاد آسیب‌های واقعی در دنیای خارج به کار گرفته می‌شوند.

برای کاهش این ریسک، یون پیشنهاد می‌کند دولت‌ها باید اقدامات زیر را انجام دهند:

  • ارائه‌دهندگان را ملزم به اجرای طبقه‌بندی‌کننده‌هایی (Classifiers) کنند که فعالیت‌های مضر سایبری و مربوط به سلاح‌های بیولوژیکی را شناسایی و مسدود کنند.
  • شرکت‌های اجاره‌دهنده دسترسی مستقیم به GPUهای پیشرفته را مجبور کنند هویت مشتریان را تأیید کنند (KYC) و «در هر جایی که دلیلی برای مشکوک شدن به سوءاستفاده خطرناک وجود دارد، دسترسی را قطع کنند».

واقعیت‌های عملیاتی

در حال حاضر، Abliteration.ai فاقد سیستم تأیید هویت مستحکم است. این شرکت تنها اطلاعات کارت‌های اعتباری مورد استفاده برای پرداخت را ثبت می‌کند. دِوُن اعتراف می‌کند که تصمیم‌گیری درباره اینکه چه کسی باید دسترسی داشته باشد، مسئله دشواری است که این شرکت جوان هنوز در حال حل آن است و می‌پرسد: «مرز مسئولیت شما به عنوان یک شرکت کجاست؟»

با این حال، در حالی که پلتفرم تا حد زیادی بدون سانسور است، لایه‌ای از نظارت (Moderation layer) را به مشتریان ارائه می‌دهد تا آن‌ها بتوانند حفاظ‌های خاص خودشان را اضافه کنند. همچنین محدودیت‌های جزئی وجود دارد؛ برای مثال، TechCrunch نتوانست دستورالعمل‌های مربوط به خودکشی را از مدل بگیرد. دِوُن اعلام کرد در حال پیاده‌سازی حفاظ‌های بیشتری برای جلوگیری از خشونت است.

لوگوی Abliteration.ai روی پس‌زمینه‌ای تاریک با نماد شکسته‌شدن قیدها

تردیدهای صنعتی

همه متخصصان امنیتی با ضرورت این کار موافق نیستند. احمد علی، مدیرعامل شرکت Fabraix (یک شرکت تیم قرمز برای عامل‌ها)، اشاره می‌کند که شرکت او به‌جای حذف حفاظ‌ها، از تنظیم دقیق (Fine-tuning) — شبیه به وقتی که به یک پزشک عمومی، تخصص پوست می‌دهیم تا روی یک حوزه دقیق شود — استفاده می‌کند. او معتقد است فرآیند abliteration ممکن است در واقع بخشی از دانش و توانایی‌های اصلی مدل را از بین ببرد. او استدلال می‌کند که اگر کسی سعی در ایجاد «آسیب واقعی» — به‌ویژه آسیب‌های سایبری یا بیولوژیکی — داشته باشد، یک مدل abliterated به اندازه یک مدل تنظیم‌شده (Fine-tuned) مؤثر نخواهد بود.

به همین ترتیب، آلسیو لوموسچیو، مدیر فناوری در Safe Intelligence، موافق بود که کاهش توانایی‌ها ممکن است رخ دهد، هرچند معتقد است مدل‌های abliterated همچنان می‌توانند رفتارهایی ایجاد کنند که برای تست استرس سیستم‌ها مفید باشند.

دیوید اسلیتر، بنیان‌گذار و معمار ارشد در Armadin، اشاره کرد که تا نسل‌های اخیر مدل‌ها، شکستن حفاظ‌ها (Jailbreaking) در مدل‌های وزن‌باز نسبتاً آسان بود و در حال حاضر بخشی از فرآیند او نیستند. با این حال، او معتقد است سوق دادن جامعه متن‌باز برای درک این توانایی‌ها حیاتی است. اسلیتر استدلال می‌کند چون این کار به‌طور اجتناب‌ناپذیر «پشت درهای بسته» و به‌صورت خصوصی رخ می‌دهد، انجام آن در فضای باز به پژوهشگران ابزارهایی می‌دهد تا بفهمند «مرز» واقعی آسیب‌ها به چه شکل است.

تجاری‌سازی این فرآیند ما را با یک حقیقت سخت روبرو می‌کند: اگر حفاظ‌ها به‌سادگی از هر مدل قابل دانلود حذف می‌شوند، ریسک اصلی نه خودِ مدل، بلکه سهولت دسترسی به قدرت محاسباتی برای اجرای بدون سانسور آن‌هاست.

منتظر بحث‌های آتی دولت‌ها درباره احراز هویت در سطح GPU باشید، زیرا این ممکن است تنها اهرم باقی‌مانده برای رگولاتورها جهت کنترل استقرار مدل‌های abliterated باشد.

گام بعدی شما

  • اگر از مدل‌های وزن‌باز استفاده می‌کنید، بررسی کنید که لایه‌های حفاظتی شما در برابر تکنیک‌های abliteration چقدر مقاوم هستند.
  • پژوهشگران امنیتی باید تفاوت خروجی‌های مدل‌های abliterated را با مدل‌های fine-tuned در سناریوهای تهاجمی مقایسه کنند.
  • منتظر قوانین جدید دولت‌ها درباره احراز هویت در سطح GPU باشید، زیرا این تنها اهرم باقی‌مانده برای کنترل مدل‌های بدون سانسور است.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اتفاق نشان می‌دهد که حفاظ‌های نرم‌افزاری در مدل‌های باز به راحتی دور زده می‌شوند و اعتبار سیستم‌های ایمنی فعلی را زیر سؤال می‌برد. بر اساس تجربه متخصصان امنیتی، این موضوع لزوم نظارت سخت‌گیرانه بر سخت‌افزارهای GPU را بیش از پیش برجسته می‌کند.

تأثیر برای ایران

به‌دلیل محدودیت‌های پرداخت ارزی و تحریم‌های API، دسترسی مستقیم به این سرویس برای کاربران ایرانی دشوار است، اما مدل‌های مشابه در Hugging Face همچنان برای توسعه‌دهندگان داخلی در دسترس‌اند.

·نگاه ما
تحریریه دات‌هوش

تجاری‌سازی حذف حفاظ‌ها نشان می‌دهد که «ایمنی» در مدل‌های وزن‌باز بیشتر یک توصیه است تا یک مانع فنی. وقتی ابزاری برای تبدیل مدل‌های ایمن به مدل‌های سوسیوپات به صورت API فروخته می‌شود، مفهوم Alignment (همراستاسازی) در مدل‌های باز عملاً به چالش کشیده شده است. به نظر ما، این روند باعث می‌شود تمرکز صنعت از «ایمن‌سازی مدل» به «ایمن‌سازی زیرساخت محاسباتی» تغییر کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.