پرش به محتوای اصلی
پرش به محتوای مقاله

بحران پایداری در Anthropic؛ هشت روز اختلال متوالی در سرویس‌های Claude

·۳۰ مرداد ۱۴۰۵۴ دقیقه مطالعه۲ بازدید
قطع شدن کلود: کلود.آی‌آی، API و سرویس‌های وابسته از دسترس خارج شدند
قطع شدن کلود: کلود.آی‌آی، API و سرویس‌های وابسته از دسترس خارج شدند
اشتراک‌گذاری
واقعاً چه چیز جدید است؟

ثبت هشت روز اختلال متوالی در یک بازه زمانی کوتاه؛ این موضوع نشان می‌دهد که مشکل یک حادثه تصادفی نیست، بلکه یک نقص ساختاری در لایه‌ی سرویس‌دهی مدل‌های نسل جدید Anthropic است.

اگر کل منطق کسب‌وکار شما بر پایه یک API استوار است، در واقع ناپایداری‌های عملیاتی آن شرکت را به ارث برده‌اید. اختلال گسترده‌ای که در ۲۰ اوت ۲۰۲۶ رخ داد، قلب اکوسیستم Anthropic را فلج کرد و توسعه‌دهندگان و سازمان‌ها را در وضعیتی قرار داد که دیگر نتوانند به پشته‌های تولیدی هوش مصنوعی خود اعتماد کنند. این قطعی، Claude API، اپلیکیشن کاربر نهایی claude.ai و ابزارهای پیشرو و عامل‌محور (Agentic) — یعنی ابزارهایی که مثل دستیارهای هوشمند، می‌توانند به‌طور مستقل مراحل مختلف یک پروژه را پیش ببرند — شامل Claude Code و Claude Cowork را تحت تأثیر قرار داد.

این بی‌ثباتی در حالی رخ می‌دهد که شرکت‌های بیشتر در حال گذار از رابط‌های ساده‌ی چت به گردش‌های کاری پیچیده و چندمرحله‌ای هستند. همان‌طور که در تحلیل قبلی ما درباره‌ی اینکه ابزارهایی مانند Vomit چگونه خروجی توکن‌های Claude 5 را پاک‌سازی می‌کنند اشاره کردیم، واضح است که صنعت در حال سوق دادن این مدل‌ها به نقش‌های عمیق‌تر در محیط‌های عملیاتی است. اما وقتی لایه‌ی سرویس‌دهی مدل (Model Serving) — که شبیه به آشپزخانه‌ی صنعتی است و وظیفه دارد دستور پخت را به غذای آماده تبدیل کند — دچار نقص شود، تمام این خط لوله‌های یکپارچه به‌طور کامل فرو می‌پاشند.

به گزارش Unite.AI، حادثه ۲۰ اوت از ساعت ۱۹:۱۶ UTC آغاز شد. در حالی که Claude Console (platform.claude.com) و نسخه‌ی دولتی (Claude for Government) فعال بودند، از کار افتادن API (api.anthropic.com) و ابزارهای عامل‌محور نشان می‌دهد که نقص سیستمی دقیقاً در مسیر سرویس‌دهی مدل رخ داده است.

زمینه‌ی این شکست

از آنجا که اپلیکیشن کاربر، API توسعه‌دهنده و هر دو محصول عامل‌محور از یک بک‌اند مدل مشترک استفاده می‌کنند، همگی به‌طور هم‌زمان دچار افت کیفیت شدند. این تفکیک نشان می‌دهد که مشکل در مسیر سرویس‌دهی بوده است، نه در زیرساخت‌های مدیریتی یا حساب‌های کاربری.

اطلاعیه‌ی اولیه Anthropic کوتاه بود. این شرکت اعلام کرد که در حال بررسی خطاهای بالا در درخواست‌های برخی مدل‌های Claude است و وعده داد به‌زودی به‌روزرسانی‌هایی ارائه کند. در لحظه‌ی شروع بحران, Anthropic نام مدل‌های متأثر را ذکر نکرد، هیچ علتی را برای این اتفاق بیان نکرد و زمان تخمینی برای بازیابی سیستم‌ها ارائه نداد.

هفته‌ای از بی‌ثباتی

این اتفاق یک حادثه تک‌گیر نبود، بلکه سومین اختلال در یک بازه ۲۴ ساعته بود. بررسی تاریخچه نشان‌دهنده‌ی یک الگوی مزمن از ناپایداری است؛ موضوعی که در گزارشات قبلی ما درباره‌ی ۱۴ اختلال در دو هفته به طور مفصل به آن پرداخته شد و نشان داد که اکوسیستم کلود با بحران پایداری جدی روبروست:

  • ۲۰ اوت: دو حادثه مجزا رخ داد. اولی در ساعت ۱۸:۳۲ UTC آغاز شد و اتصال‌های گوگل برای Sheets، Docs، Slides و ادغام‌های Chat در claude.ai را تحت تأثیر قرار داد؛ این مشکل در ساعت ۱۹:۰۱ UTC برطرف شد. بلافاصله پس از آن، قطعی چندمدلی در ساعت ۱۹:۱۶ UTC رخ داد.
  • ۱۹ اوت: خطاهای شدید در Claude Opus 5 و Claude Haiku 4.5 مشاهده شد. علت در ساعت ۰۹:۴۲ UTC شناسایی شد، اصلاحیه در ساعت ۱۰:۳۳ UTC اعمال گشت و حادثه در نهایت در ساعت ۱۱:۰۲ UTC به پایان رسید.
  • ۱۸ اوت: خطاهای گسترده‌ای مدل‌های Claude Mythos 5، Fable 5، Opus 5، Sonnet 5، Haiku 4.5 و سایر مدل‌ها را دربرگرفت. سپس تأثیر این اختلال محدود به Opus 5 شد و قطعی‌های ثبت شده از ساعت ۱۶:۱۱ تا ۱۸:۲۳ UTC ادامه داشت.
  • ۱۷ اوت: مدل‌های Opus 5 و Sonnet 5 به‌صورت متوالی دچار افت کیفیت شدند.
  • ۱۶ اوت: یک مشکل در سیستم احراز هویت (Authentication) باعث اختلال در claude.ai، کنسول کلود، API، Claude Code و Cowork شد.
  • ۱۴ و ۱۵ اوت: اختلالات مجزایی API، Claude Code، Cowork و مدل Fable 5 را تحت تأثیر قرار داد. تأثیر بر Fable 5 از ساعت ۲۰:۰۰ UTC در ۱۴ اوت آغاز شد و تا ساعت ۰۰:۱۱ UTC در ۱۵ اوت ادامه یافت.

در مجموع، Anthropic از ۱۳ تا ۲۰ اوت، هشت روز متوالی ثبت حادثه در صفحه وضعیت خود داشت. با وجود این حجم از اختلالات، شرکت هنوز هیچ پیوندی عمومی بین این اتفاقات و یک علت ریشه‌ای واحد برقرار نکرده است.

هزینه‌ی وابستگی

بیشترین ضربه به تیم‌هایی وارد شد که از Claude Code و Claude Cowork استفاده می‌کنند. برخلاف یک پیام چت که در صورت خطا فقط ارسال نمی‌شود، خطای API در میانه یک تسک عامل‌محور، جلسات طولانی‌مدت را قطع کرده و احتمالاً باعث تخریب خط لوله‌های CI (یکپارچه‌سازی مداوم) یا ابزارهای پشتیبانی داخلی می‌شود.

این شکنندگی، ریسک بزرگی را برای سازمان‌ها آشکار می‌کند. به نقل از Bloomberg و Reuters، با درآمد سالانه ۶۵ میلیارد دلاری، حجم عظیمی از ترافیک تولیدی جهانی اکنون بر روی این پشته‌ی سرویس‌دهی خاص سوار است.

معیارهای عملیاتی

صفحه وضعیت، نگاهی به پایداری این سیستم‌ها در بازه ۹۰ روزه می‌اندازد:

  • Claude for Government: ۱۰۰٪
  • Claude Console: ۹۹.۸۶٪
  • Claude API: ۹۹.۴۸٪
  • Claude Cowork: ۹۹.۴۹٪
  • claude.ai: ۹۹.۳۸٪
  • Claude Code: ۹۹.۴٪

برای کاربران تجاری، این یک زنگ خطر درباره‌ی «قفل‌شدگی توسط فروشنده» (Vendor Lock-in) است. بحران فعلی، توجیهی برای رشد درگاه‌های مسیریابی چندمدلی (Multi-model routing gateways) مانند Router.com متعلق به شرکت Ramp است که به شرکت‌ها اجازه می‌دهد در صورت «هفته‌های بدِ» یک ارائه‌دهنده، فوراً به مدل دیگری سوییچ کنند.

اگر تمام منطق کسب‌وکار شما به یک API واحد وابسته است، شما فقط یک سرویس نمی‌خریدید، بلکه ناپایداری‌های عملیاتی آن فروشنده را به ارث برده‌اید. گذار به سمت معماری‌های مستقل از مدل (Model-agnostic) دیگر یک کالای لوکس نیست، بلکه پیش‌نیازی برای تضمین زمان فعال بودن (Uptime) است.

باید منتظر گزارش رسمی پس از حادثه (Post-mortem) شرکت Anthropic باشیم تا ببینیم آیا این شکست‌ها ناشی از مقیاس‌بندی معماری جدید Opus 5 بوده است یا یک نقص عمیق‌تر در زیرساخت‌ها.

گام بعدی شما

  • اگر از APIهای هوش مصنوعی در محیط تولید استفاده می‌کنید، استراتژی Multi-model را پیاده کنید تا در صورت قطعی یک شرکت، سرویس شما متوقف نشود.
  • برای ابزارهای عامل‌محور، مکانیزم‌های Checkpointing (ذخیره وضعیت) ایجاد کنید تا در صورت قطع API، کل فرآیند از ابتدا شروع نشود.
  • وضعیت پایداری مدل‌های جایگزین (مانند GPT-4o یا Llama 3) را برای سناریوهای اضطراری بررسی کنید.

اما داستان سخت‌افزاری این تحول حتی شگفت‌انگیزتر است — به تحلیل ما درباره‌ی تراشه‌های Blackwell مراجعه کنید.

چرا این موضوع مهم است؟

این بحران اعتبار Anthropic را به عنوان یک ارائه‌دهنده سطح سازمانی (Enterprise-grade) خدشه‌دار می‌کند. وابستگی شدید شرکت‌ها به یک API واحد، ریسک عملیاتی غیرقابل‌قبولی ایجاد کرده که منجر به تسریع پذیرش معماری‌های مستقل از مدل می‌شود.

تأثیر برای ایران

به‌دلیل محدودیت‌های دسترسی و تحریم‌های API، اکثر توسعه‌دهندگان ایرانی از واسطه‌ها استفاده می‌کنند؛ این اختلالات نشان می‌دهد که حتی با وجود واسط، پایداری نهایی به زیرساخت شرکت مادر وابسته است.

·نگاه ما
تحریریه دات‌هوش

تکرار اختلالات در مدل‌های سطح بالای Opus 5 نشان می‌دهد که Anthropic احتمالاً در مدیریت فشار عملیاتی (Operational Load) مدل‌های جدید با پارامترهای بیشتر شکست خورده است. این وضعیت ثابت می‌کند که در عصر عامل‌های هوشمند، پایداری زیرساخت (Uptime) حالا ارزشمندتر از افزایش اندک در دقت مدل است، زیرا یک قطعی کوتاه در یک عامل، می‌تواند ساعت‌ها محاسبات را نابود کند.

منابع

این گزارش با خط‌لولهٔ خودکار دات‌هوش از منابع معتبر جهانی تدوین و زیر نظر تحریریه منتشر شده است. روش کار ما

گفتگو

پنج‌شنبه‌های هوش‌محور

بسته‌ی هفتگی دات‌هوش

۵ خبر، ۲ ابزار، ۱ پرامپت در هر شماره. به‌زودی راه‌اندازی می‌شود — هر پنج‌شنبه صبح.

خبر کلیدی
ابزار کاربردی
پرامپت حرفه‌ای
تحلیل پژوهش
به‌زودی
زاویه‌ی ایرانی
به‌زودی
تمرین این هفته
به‌زودی

راهنماهای دات‌هوش

راهنماهای کاربردیِ دات‌هوش برای کار با هوش مصنوعی — از همین‌جا شروع کنید:

دات‌هوش

راهنمای فارسی هوش مصنوعی — با نگاه به ایران

اخبار روزانه، معرفی ابزارها و مدل‌ها، و آموزشِ کار با هوش مصنوعی؛ همیشه با این پرسش که از ایران چه چیزی کار می‌کند و چه چیزی نه.