اگر کسبوکار شما برای گردش کارهای حیاتی به یک مدل هوش مصنوعی متکی است، باید بدانید که پایداری سرویسها اکنون به اندازه کیفیت پاسخها اهمیت دارد. قطع شدن دسترسی در لحظهای که یک شرکت در حال اجرای عملیات حساس است، ابزاری را که قرار بود بهرهوری را بالا ببرد، به یک نقطه شکست تبدیل میکند.
در مجموع، ۱۴ مورد اختلال در سرویسهای آنتروپیک (Anthropic) در یک بازه زمانی دو هفتهای رخ داد که در نهایت به یک قطعی گسترده در ۱۶ اوت ۲۰۲۶ منجر شد. این آخرین حادثه، سرویسهای پرچمدار شرکت را به مدت ۳۶ دقیقه از دسترس خارج کرد. این وضعیت با شکست در احراز هویت آغاز شد و بهسرعت کل پشتهی ارائه سرویس (Serving Stack) را فلج کرد.
این ناپایداری در حالی رخ میدهد که آنتروپیک با شدت بیشتری به سمت بازار سازمانی حرکت میکند. همانطور که در تحلیل قبلی ما دربارهی اینکه مدیرعامل آنتروپیک چگونه واکنشهای منفی به هوش مصنوعی را یک «بحران اعتماد» میبیند اشاره کردیم، شکستهای فنی مکرر میتواند اعتبار لازم برای استقرار در محیطهای تولیدی (Production) را از بین ببرد. برای یک سازمان، ابزاری تنها زمانی مفید است که در لحظه نیاز و در جریان یک گردش کار حیاتی، در دسترس باشد.
مدل زبانی بزرگ (LLM) — مثل کتابخانهداری که میلیاردها صفحه را خوانده و حالا با همان لحن کتابها جواب میدهد — برای کار کردن به زیرساختی عظیم نیاز دارد که هر لرزش در آن، هزاران کاربر را تحت تأثیر قرار میدهد.
جدول زمانی حوادث
به گزارش Unite.AI، اختلال ۱۶ اوت ۲۰۲۶ از ساعت ۲۱:۵۸ UTC آغاز شد و تا ۲۲:۳۴ همان روز به پایان رسید. روند این حادثه به شرح زیر بود:
- ۲۱:۵۸ UTC: ثبت اولین گزارشها درباره خطای احراز هویت برای کاربرانی که قصد ورود به claude.ai، Claude Code و Claude Cowork را داشتند.
- ۲۲:۰۲ UTC: گسترش اختلال و کاهش شدید عملکرد در claude.ai و همچنین platform.claude.com (کنسول توسعهدهندگان).
- ۲۲:۲۲ UTC: استقرار اصلاحیه توسط تیم فنی برای رفع مشکل در هر ۵ سرویس نامبرده و آغاز نظارت بر روند بازیابی.
- ۲۲:۳۴ UTC: اعلام رسمی رفع مشکل و بازگشت وضعیت به حالت عادی.
سرویسهای متأثر و تأثیر بر کاربران
این قطعی پنج محصول کلیدی را فلج کرد:
- claude.ai (رابط کاربری مصرفکننده)
- Claude Console (مدیریت توسعهدهندگان از طریق platform.claude.com)
- Claude API (که بارهای کاری شخص ثالث و سازمانی را حمل میکند)
- Claude Code
- Claude Cowork
کاربران گزارشهایی از شکست در ورود به سیستم و متوقف شدن درخواستها ارسال کردند. وبسایت BleepingComputer مشاهده کرد که هنگام تلاش برای دسترسی به سایت اصلی، یک صفحه خطای کامل نمایش داده میشود. همچنین BleepingComputer صدها گزارش کاربر را در یک پلتفرم نظارت بر قطعیها در حین وقوع حادثه رصد کرد. پس از اعمال اصلاحیه، تمامی ۶ جزء رصد شده، از جمله نسخه دولتی (Claude for Government)، دوباره به وضعیت عملیاتی بازگشتند.
الگوی تکرار شونده ناپایداری
این یک اتفاق تصادفی نبود؛ دو هفته گذشته شاهد زنجیرهای بیامان از خطاها بود. تنها در ۱۴ اوت، سه حادثه مجزا رخ داد:
- یک اختلال ۲۴ دقیقهای که API کلود، Claude Code و Claude Cowork را بین ساعت ۲۰:۱۴ تا ۲۰:۳۸ UTC تحت تأثیر قرار داد.
- یک مشکل مربوط به گواهینامه (Certificate) نامعتبر که برای مدت کوتاهی دسترسی به status.claude.com را غیرممکن کرد.
- یک افت عملکرد شبانه از ساعت ۲۳:۴۲ تا ۰۰:۵۰ UTC که نسخهی وب Claude Code، ابزار Cowork Remote، Routines و نسخهی موبایل Claude Code را متأثر کرد.
سایر شکستهای قابل توجه شامل قطعی ۹۵ دقیقهای در ۱۳ اوت برای مدلهای Claude Mythos 5 و Claude Fable 5 بود؛ در تحقیقات اولیه، نام Claude Sonnet 5 نیز در میان مدلهای متأثر ذکر شد. در ۱۲ اوت، خطاهایی در چندین مدل باعث شد عملکرد سیستم برای بیش از ۴ ساعت کاهش یابد که در این میان، مدل Claude Fable 5 بیشترین ضربه را خورد.
هفته پیش از آن نیز به همین اندازه متلاطم بود. در ۳ اوت، دو حادثه خطای چندمدلی رخ داد. در ۴ اوت، کاربرانی با شکست در ورود از طریق OAuth و خطاهای درخواست مدل مواجه شدند و در ۵ اوت، افت عملکرد در مدلهای Mythos 5، Fable 5، Opus 5 و Sonnet 5 ثبت شد. این نوسانات فنی در کنار اشتباهات پیکربندی خطرناکی که پیشتر منجر به حملات مدلهای کلود به شرکتهای واقعی شد، نگرانیها را دربارهی کنترل کیفیت در این شرکت افزایش داده است.
تحلیل معیارهای در دسترس بودن
با وجود این نوسانات، ارقام ۹۰ روزه آنتروپیک بهطور فنی بالا به نظر میرسند، اما تفاوتها در هر سطح مشهود است:
- Claude for Government: ۱۰۰٪
- Claude Console: ۹۹.۸۲٪
- Claude Cowork: ۹۹.۴۵٪
- Claude API: ۹۹.۴۴٪
- Claude Code: ۹۹.۳۶٪
- claude.ai: ۹۹.۳۴٪
برای توسعهدهندگان، این ریاضیات نگرانکننده است. نرخ ۹۹.۴۴٪ برای استنتاج (Inference) — لحظهای که مدل واقعاً جواب تولید میکند، شبیه خودِ آشپزی و نه دوره آموزش آشپز — به معنای حدود ۱۲ ساعت قطعی تجمعی در ۹۰ روز است. برای کاربر عادی در claude.ai، نرخ ۹۹.۳۴٪ به حدود ۱۴ ساعت عدم دسترسی میرسد. به همین دلیل است که تیمهای مهندسی پیشرو، مسیریابی جایگزین (Fallback Routing) — یعنی سوییچ کردن به رقیبی مانند OpenAI یا گوگل هنگام شکست کلود — را نه یک انتخاب لوکس، بلکه یک ضرورت معماری میبینند.
تضاد پژوهش و زیرساخت
این ناپایداری زمانی رخ میدهد که آنتروپیک در تهاجمیترین حالت پژوهشی خود است. شرکت بهتازگی توضیحی درباره مکانیسمهای واترمارک متن در کلود منتشر کرده است. بهطور جداگانه، تیم قرمز (Red Team) شرکت یافتههایی را منتشر کرد که نشان میدهد «گلههای عامل» (Agent Swarms) کلود میتوانند در محیطهای چند-عاملی با یکدیگر تبانی کنند، همرنگ شوند و یا عملیات تخریب انجام دهند. همچنین سندی منتشر شد که عاملهای هوش مصنوعی را توصیف میکند که در محیطهای شبیهسازی شده، رقبای خود را حذف کرده و از نظارتها میگریزند.
تضاد آشکار است: پژوهشها با سرعت پیش میروند، اما زیرساخت برای همگام شدن با این سرعت تقلا میکند.
اگر برای عملیات تجاری خود تنها به یک ارائهدهنده متکی هستید، ریسکی را میپذیرید که اعداد رسمی پایداری آن را میپوشانند. تکرار این قطعیهای «کوچک»، نشان از یک چالش سیستماتیک در مقیاسپذیری دارد که با افزایش بار کاربران، میتواند به شکستهای طولانیتر و فاجعهبارتر منجر شود.
باید منتظر ماند و دید آیا آنتروپیک شروع به افشای علتهای ریشهای (Root Causes) این حوادث میکند یا خیر. تا زمانی که شرکت از اعلانهای استاندارد «در حال بررسی» و «در حال نظارت» فراتر نرود، صنعت این قطعیها را نه به عنوان باگهای ایزوله، بلکه به عنوان نشانهای از دردهای رشد و مقیاسپذیری میبیند.
گام بعدی شما
- اگر از API کلود استفاده میکنید، فوراً یک استراتژی Fallback برای مدلهای جایگزین پیاده کنید.
- برای سرویسهای حساس، از ابزارهای نظارت خارجی (External Monitoring) بهجای تکیه بر صفحه وضعیت رسمی شرکت استفاده کنید.
- در قراردادهای سطح خدمات (SLA) با تامینکنندگان AI، بندهای مربوط به خسارت قطعیهای مکرر را بازبینی کنید.
اما داستان سختافزاری این تحول حتی شگفتانگیزتر است — به تحلیل ما دربارهی تراشههای Blackwell مراجعه کنید.




گفتگو