پرش به محتوای اصلی
پرش به محتوای مقاله

Abliteration.ai: تجاری‌سازی حذف Safety لایه‌ها در مدل‌های Open-Weight

·۱۵ شهریور ۱۴۰۵۵ دقیقه مطالعه۱ بازدید
حذف محدودیت‌های ایمنی از مدل‌های هوش مصنوعی باز، اکنون یک سرویس تجاری آماده است.
حذف محدودیت‌های ایمنی از مدل‌های هوش مصنوعی باز، اکنون یک سرویس تجاری آماده است.
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

تبدیل فرآیند فنی Abliteration از یک متد پژوهشی به یک سرویس تجاری (Turnkey Service) برای حذف سیستماتیک حفاظ‌های ایمنی در مدل‌های خاص مثل GLM-5.3.

تصور کنید ابزاری در دست دارید که هرگز به شما نمی‌گوید «نمی‌توانم در این مورد کمک کنم»، حتی وقتی از آن می‌خواهید یک حفره امنیتی را در یک سامانه پیچیده پیدا کند. این دقیقاً همان چیزی است که Abliteration.ai اکنون به عنوان یک سرویس تجاری عرضه می‌کند.

در حالی که آزمایشگاه‌های بزرگ هوش مصنوعی برای جلوگیری از تولید محتوای مضر یا کمک به حملات سایبری، حفاظ‌ها (Guardrails) — شبیه به نرده‌های ایمنی در لبه یک پرتگاه که اجازه نمی‌دهند کاربر از مسیر خارج شود — را در مدل‌ها تعبیه می‌کنند، این سیستم‌ها اغلب دچار «امتناع بیش از حد» (Over-refusal) می‌شوند. این یعنی مدل حتی درخواست‌های قانونی پژوهشگران امنیتی یا برنامه‌نویسان را هم رد می‌کند. استارتاپ آمریکایی Abliteration.ai حالا این شکاف بین همراستاسازی ایمنی و کاربردی بودن را هدف قرار داده و حذف این محدودیت‌های اخلاقی را به یک سرویس آماده (Turnkey Service) تبدیل کرده است. هدف آن‌ها مدل‌های وزن‌باز است تا کاربران بتوانند محدودیت‌های اخلاقی تعبیه شده در فرآیند آموزش اولیه را دور بزنند و در واقع، «هوش بدون فیلتر» را به عنوان یک سرویس خریداری کنند.

تکنولوژی اصلی این شرکت فرآیندی به نام «Abliteration» است. برخلاف مهندسی پرامپت (Prompt Engineering) — که مثل هنر سؤال درست پرسیدن است تا مدل را فریب دهند — یا روش‌های jailbreak که سعی می‌کنند مدل را با عبارات هوشمندانه به نادیده گرفتن قوانینش ترغیب کنند، این تکنیک مستقیماً وزن‌ها (Weights) — یعنی همان دستور پخت داخلی مدل که تعیین می‌کند هر سیگنال چطور پردازش شود — را تغییر می‌دهد.

این فرآیند با شناسایی الگوهای فعال‌سازی داخلی (Internal Activation Patterns) خاصی شروع می‌شود که باعث تحریک پاسخ «امتناع» در مدل می‌گردند. پس از اینکه این الگوها نقشه‌برداری شدند، شرکت وزن‌های مدل را طوری تغییر می‌دهد که این فعال‌سازی‌ها سرکوب شوند. نتیجه مدلی است که دیگر «محرک» امتناع را نمی‌شناسد و بدون هیچ اعتراضی به پرسش‌های حساس یا محدود شده پاسخ می‌دهد، بدون اینکه با پاسخ‌های کلیشه‌ای مانند «من نمی‌توانم در این مورد کمک کنم» مواجه شوید. این یک تغییر بنیادین از دستکاری‌های خارجی به سمت اصلاحات ساختاری داخلی است.

همان‌طور که در تحلیل‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن اشاره کردیم، دسترسی به لایه‌های داخلی مدل، قدرت تغییر رفتار آن را به شدت افزایش می‌دهد. Abliteration.ai اخیراً مدل abliterated-model-large-v2 را بر پایه مدل GLM-5.3 شرکت Z.AI عرضه کرد. به گزارش این استارتاپ، انتخاب سری GLM استراتژیک بود؛ زیرا ادعا می‌کنند نسخه‌های قبلی GLM به گونه‌ای آموزش دیده بودند که برای کارهای عملی امنیتی بیش از حد محدودکننده بودند. با این حال، مدل GLM-5.3 به دلیل داشتن توانایی‌های سایبری است که در مرحله پس‌آموزش (Post-training) به سرعت رشد کرده‌اند، شناخته شده است. Abliteration.ai با حذف لایه‌های ایمنی از این معماری خاص، قصد دارد ابزاری قدرتمند برای متخصصان امنیت سایبری، تست‌کننده‌های نفوذ (Penetration Testers) و توسعه‌دهندگانی فراهم کند که فیلترهای ایمنی استاندارد را مانع جریان کاری خود می‌بینند.

برای اثبات ادعای خود و اعتبارسنجی کارایی مدل تغییریافته، Abliteration.ai داده‌های ارزیابی داخلی خود را در سه محک (Benchmark) کلیدی منتشر کرد: CyberGym، Terminal-Bench 4.0 و ExploitGym. بر اساس مستندات این شرکت، مدل تغییریافته GLM-5.3 در محک CyberGym به امتیاز ۸۴.۵ درصد و در Terminal-Bench 4.0 به ۴۱.۸ درصد رسید. همچنین این مدل توانست ۱۰۵ تسک در ExploitGym را در بازه زمانی دو ساعت حل کند.

با این حال، داده‌های خود شرکت نشان می‌دهد که آن‌ها لزوماً پیشرو بازار در تمام معیارها نیستند. برای مثال، مدل GPT-5.5 با امتیاز ۸۵.۶ درصد در CyberGym عملکرد بهتری داشت و مدل‌های GPT-5.6 Sol و Fable 5 در ExploitGym برتری نشان دادند. Abliteration.ai شفاف‌سازی کرده است که این مقایسه‌ها محدود هستند، زیرا از ابزارهای سنجش (Harnesses) و بودجه‌های محاسباتی متفاوتی استفاده شده است و همین موضوع مقایسه مستقیم و دقیق (Apples-to-apples) را دشوار می‌کند.

این تجاری‌سازیِ حذف ایمنی، یک موازنه امنیتی خطرناک را در اکوسیستم مدل‌های وزن‌باز (Open Weights) — یعنی مدل‌هایی که دستور پختشان علناً منتشر شده — آشکار می‌کند. وقتی یک شرکت وزن‌های یک مدل قدرتمند را منتشر می‌کند، کنترل خود را بر نحوه همراستاسازی آن مدل از دست می‌دهد. اگرچه وزن‌های باز باعث ترویج نوآوری و شفافیت می‌شوند، اما همزمان نقشه‌راهی را برای بازیگرانی فراهم می‌کنند تا حفاظ‌های ایمنی را حذف کنند. این رویکرد مشابه تلاشاتی است که در مدل‌های دیگر نیز دیده شده است، مانند انتشار مدل SuperQwen3.8 با ساختار بدون سانسور که امکان دسترسی به قابلیت‌های مدل را بدون محدودیت‌های معمول فراهم کرد. Abliteration.ai صرفاً اولین شرکتی است که این فرآیند را در مقیاس صنعتی به یک مدل کسب‌وکار تبدیل کرده است. توانایی حفظ مهارت‌های کدنویسی، سایبری و قابلیت‌های عامل‌محور (Agentic) در عین حذف امتناع، این مدل‌ها را برای هر دو گروه پژوهشگران امنیتی قانونی و احتمالاً فعالیت‌های مخرب، بسیار جذاب می‌کند.

پیامد گسترده‌تر این اتفاق برای صنعت هوش مصنوعی، ایجاد شکافی عمیق بین مدل‌های «بسته» (که ارائه‌دهنده کنترل کامل روی فیلترهای ایمنی دارد) و مدل‌های «باز» است که می‌توان آن‌ها را به صورت جراحی‌شده توسط شخص ثالث تغییر داد. با دسترس‌پذیرتر شدن و تجاری شدن تکنیک‌هایی مانند Abliteration، اثربخشی آموزش‌های ایمنی در مرحله اولیه همراستاسازی کاهش می‌یابد. اگر یک مکانیسم ایمنی را بتوان با تغییر وزن‌ها سرکوب کرد، یعنی همراستاسازی (Alignment) یک ویژگی دائمی و ذاتی مدل نیست، بلکه صرفاً لایه‌ای است که می‌توان آن را جدا کرد. این موضوع فشار بر توسعه‌دهندگان هوش مصنوعی افزایش می‌دهد تا روش‌های استوارتر و عمیق‌تری برای ادغام ایمنی بیابند که به راحتی از طریق تحلیل الگوهای فعال‌سازی قابل شناسایی و سرکوب نباشند. در حال حاضر، Abliteration.ai به عنوان یک اثبات مفهوم (Proof of Concept) عمل می‌کند که نشان می‌دهد بازار پرداخت‌کننده و قابل‌توجهی برای هوش مصنوعی‌ای وجود دارد که هرگز نمی‌گوید «نه».

گام بعدی شما

  • اگر پژوهشگر امنیت هستید، تفاوت پاسخ‌های مدل‌های abliterated را با مدل‌های استاندارد در تسک‌های Red Teaming بررسی کنید.
  • روی متدهای جدید همراستاسازی مطالعه کنید که به جای لایه‌های سطحی، در ساختار عمیق مدل ادغام شده‌اند.
  • ابزارهای تحلیل الگوهای فعال‌سازی (Activation Analysis) را برای درک نحوه تصمیم‌گیری مدل‌ها یاد بگیرید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این اتفاق اعتبار روش‌های فعلی همراستاسازی را زیر سؤال می‌برد و ثابت می‌کند که مدل‌های وزن‌باز را نمی‌توان به طور کامل «ایمن» نگه داشت. این موضوع تخصص در تحلیل لایه‌های داخلی مدل را به مزیتی استراتژیک برای هر دو طیف حمله و دفاع تبدیل می‌کند.

تأثیر برای ایران

این ابزار برای متخصصان امنیت سایبری و تست نفوذ در ایران که با محدودیت‌های اخلاقی مدل‌های بسته روبرو هستند، فرصتی برای تحلیل ابزارهای تهاجمی فراهم می‌کند.

·نگاه ما
تحریریه دات‌هوش

تجاری کردن Abliteration نشان می‌دهد که «ایمنی» در مدل‌های وزن‌باز فعلاً یک لایه تزئینی است، نه یک ویژگی ساختاری. این رویکرد احتمالاً منجر به یک مسابقه تسلیحاتی می‌شود: سازندگان مدل‌ها برای جلوگیری از این جراحی‌ها، روش‌های پیچیده‌تری برای پنهان کردن الگوهای امتناع ابداع می‌کنند و در مقابل، ابزارهای حذف ایمنی دقیق‌تر می‌شوند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.