پرش به محتوای اصلی
پرش به محتوای مقاله

درون مکانیسم رد درخواست‌های پیچیده در مدل Fable آنتروپیک

·۱۸ تیر ۱۴۰۵۱۱ دقیقه مطالعه
لوگوی آزمایشگاه COMBINE و عنوان مقاله: «Fable مدل مفیدی نیست»
لوگوی آزمایشگاه COMBINE و عنوان مقاله: «Fable مدل مفیدی نیست»
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

افشای این نکته که مدل Fable از یک سیستم رد-سریع (Rejection-based) مبتنی بر کلمات کلیدی استفاده می‌کند که حتی در برابر فرمول‌های ریاضی انتزاعی نیز ناکارآمد است.

تصور کنید ابزاری دارید که برای حل سخت‌ترین معادلات جهان طراحی شده، اما وقتی از آن می‌پرسید «چگونه یک کد را به زبان رستم (Rust) تبدیل کنم»، پاسخ می‌دهد: «متأسفم، این درخواست خطرناک است». این دقیقاً وضعیتی است که پژوهشگران ارشد در آزمایشگاه COMBINE-lab با مدل جدید آنتروپیک (Anthropic) تجربه می‌کنند.

به نقل از این پژوهشگر، مدل Fable — که نسخه‌ای متمرکز بر ایمنی از مدل Mythos است — در عمل برای پژوهش‌های سطح بالای علوم کامپیوتر و بیوانفورماتیک بلااستفاده است. این مدل در حالی معرفی شد که پیش از این جهش‌های فنی چشمگیری در کدنویسی را به نمایش گذاشته بود، اما اکنون با محدودیت‌های شدید روبروست. حفاظ‌ها (Guardrails) — یا همان نرده‌های ایمنی که مانند نگهبان‌های سخت‌گیر ورودی یک ساختمان عمل می‌کنند و هر کسی را که مشکوک به نظر برسد بیرون می‌اندازند — در این مدل چنان تهاجمی هستند که درخواست‌های فنی و بی‌خطر را به‌جای پردازش، به‌عنوان ریسک امنیتی طبقه‌بندی می‌کنند.

همان‌طور که در پوشش‌های پیشین ما درباره‌ی امنیت مدل‌های بازمتن دیدیم، تعادل بین ایمنی و کاربرد همواره یک چالش است، اما در Fable این تعادل به‌کلی از دست رفته است. طبق گزارش‌های منتشر شده، این مدل در دوره‌ای پرتلاطم عرضه شد. در ۹ ژوئن ۲۰۲۶، آنتروپیک مدل Fable را منتشر کرد، اما تنها سه روز بعد در ۱۲ ژوئن، به‌دلیل کنترل‌های شدید صادراتی دولت آمریکا و عدم امکان تأیید ملیت تمامی کاربران، مدل را به‌طور کامل از دسترس خارج کرد.

پس از هفته‌ها مذاکره، دسترسی به این مدل در ۱ ژوئیه ۲۰۲۶ دوباره برقرار شد. با این حال، بازگشت Fable با یک هشدار همراه بود: آنتروپیک اعلام کرد که حفاظ‌های حتی سخت‌گیرانه‌تری را پیاده کرده است. این سخت‌گیری‌ها در حالی رخ می‌دهد که آنتروپیک پیش‌تر برای دستیابی به دقت بالاتر در تحلیل‌ها، حتی حریم خصوصی داده‌های شرکتی را به چالش کشیده بود. برای متخصصان حوزه‌های حساس، این حفاظ‌ها اکنون به دیوارهایی غیرقابل عبور تبدیل شده‌اند.

شکست در تبدیل کد نرم‌افزاری

اولین مورد شکست در مواجهه با ابزاری به نام salmon رخ داد؛ ابزاری رایج برای اندازه‌گیری توالی‌های RNA-seq. هدف پژوهشگر این بود که کد فعلی را که با ++C نوشته شده بود، به زبان Rust بازنویسی کند تا نسخه‌ای سریع‌تر و بهینه‌تر به نام «salmon 2» خلق کند.

بر اساس مستندات این تجربه، Fable در حالت «برنامه‌ریزی» (Plan mode) بلافاصله درخواست را رد کرد. به نظر می‌رسد لایه‌ی ایمنی مدل، اصطلاحات بیولوژیکی مربوط به داده‌های RNA-seq را با مواد خطرناک یا ممنوعه اشتباه گرفته است. نکات کلیدی این تعامل عبارتند از:

  • Fable دلیل رد درخواست را توضیح نداد و راهنمایی نکرد که کاربر چگونه پرامپت خود را تغییر دهد.
  • مدل کاربر را به Opus 4.8 ارجاع داد که به‌راحتی و بدون هیچ هشدار امنیتی، بازنویسی کد را با کیفیت بالا انجام داد.
  • تلاش‌های مکرر کاربر طی ۳۰ دقیقه برای توضیح اینکه این یک پروژه متن‌باز و عمومی است، کاملاً نادیده گرفته شد.

گزارش‌های شبکه‌های اجتماعی نشان می‌دهد این یک مشکل سیستمی است. زیست‌شناسان گزارش داده‌اند که Fable حتی به سوالات ساده‌ای مثل «میتوکندری چیست؟» پاسخ نمی‌دهد.

بن‌بست در ریاضیات انتزاعی

پژوهشگر برای تست دقیق‌تر، یک مسئله نظری گراف را بر اساس مقاله‌ای درباره «بازسازی اقتصادی تکامل شبکه» مطرح کرد. هدف این بود که تاریخچه تغییرات در یک شبکه (مثلاً شبکه تعامل پروتئین‌ها) بازسازی شود.

در این مسئله، مدل باید با مفهوم «حلقه‌های مسدودکننده» (Blocking Loops) دست‌وپنجه نرم می‌کرد؛ وضعیتی که در آن برخی راهکارهای محاسباتی از نظر فیزیکی غیرممکن هستند. این یک معمای کلاسیک علوم کامپیوتر است: مسئله‌ای که الگوریتم بهینه تضمین‌شده‌ای ندارد و هنوز ثابت نشده که در دسته مسائل NP-complete باشد.

پژوهشگر در سه مرحله تلاش کرد تا مدل را به چالش بکشد:

۱. درخواست ساده: مدل به‌دلیل کلمات «پروتئین» و «شبکه بیولوژیکی» بلافاصله پاسخ را رد کرد.
۲. حذف بستر: پژوهشگر تمام کلمات بیولوژیکی را حذف کرد و مسئله را به یک مسئله تصمیم‌گیری ریاضی تبدیل کرد؛ اما Fable باز هم پاسخ نداد.
۳. فرموله‌سازی ریاضی محض: با کمک ChatGPT، حتی کلماتی مثل «مسدودکننده» (Blocking) که ممکن است با امنیت سایبری اشتباه گرفته شوند، حذف شد و یک عبارت کاملاً انتزاعی ارائه شد. با این حال، Fable باز هم از همکاری امتناع کرد.

تضاد در عملکرد: از ریاضیات تا بستنی

در حالی که مدل در تمامی تکالیف سطح پژوهشی شکست خورد، در کارهای پیش‌پاافتاده بی‌نقص بود. وقتی از Fable خواستند بین بستنی‌های وانیل، شکلاتی و خمیره کلوچه یکی را انتخاب کند، پاسخی بسیار دقیق و تحلیل‌گرانه داد. مدل خمیره کلوچه را به‌دلیل «تضاد بافتی» و «طعم غنی شکر قهوه‌ای»، ارتقایی نسبت به وانیل دانست.

این تضاد نشان می‌دهد که هوش مصنوعی زاینده (Generative AI) — شبیه به یک نابغه در زنجیر است که تمام دانش را دارد اما یک نگهبان سخت‌گیر جلوی در است که اجازه نمی‌دهد او درباره هر موضوع تخصصی صحبت کند — در اینجا دچار مشکل است. به نظر می‌رسد لایه‌ی ایمنی به‌جای درک بستر (Context)، صرفاً یک لیست سیاه از کلمات و کاربران است که هرkes مرتبط با بیولوژی یا امنیت سایبری را مسدود می‌کند.

گام بعدی شما

  • اگر پژوهشگر هستید، برای تکالیف حساس فعلاً از مدل‌های با حفاظ کمتر یا نسخه‌های قدیمی‌تر استفاده کنید.
  • بررسی کنید آیا آنتروپیک قابلیت «حالت پژوهشی» (Research Mode) را برای کاهش حساسیت کالیبراسیون معرفی می‌کند یا خیر.
  • برای تبدیل کد، ترکیب مدل‌های مختلف استنتاجی را امتحان کنید تا گلوگاه‌های ایمنی هر مدل را شناسایی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این مورد نشان می‌دهد که کالیبراسیون نادرست حفاظ‌ها می‌تواند ابزارهای AI را در محیط‌های تخصصی بی‌فایده کند. برای اعتبار علمی مدل‌ها، عبور از فیلترهای کلمات کلیدی به سمت درک عمیق بستر (Context) ضروری است.

تأثیر برای ایران

به دلیل محدودیت‌های API و تحریم‌های آنتروپیک، دسترسی پژوهشگران ایرانی به Fable دشوار است و این گزارش تأیید می‌کند که حتی در صورت دسترسی، این مدل برای کارهای تخصصی بیوانفورماتیک در ایران کاربردی ندارد.

·نگاه ما
تحریریه دات‌هوش

این تجربه نشان می‌دهد که «ایمنی بیش‌ازحد» (Over-alignment) می‌تواند به یک نوع سانسور تکنولوژیک تبدیل شود که پیشرفت‌های علمی را متوقف می‌کند. وقتی یک مدل زبانی نتواند تفاوت بین یک پروتکل بیولوژیکی و یک سلاح شیمیایی را تشخیص دهد، در واقع کارایی خود را برای جامعه متخصص فدا کرده است. به باور ما، این رویکرد «لیست سیاه کلمات» به‌جای «درک معنایی»، نشان‌دهنده ضعف در معماری لایه‌های نظارتی آنتروپیک است.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.