پشت پرده اختلالهای کلودفلر؛ چرا یکی از ستونهای اینترنت از دسترس خارج میشود؟
اختلالهای متعدد کلودفلر بار دیگر تابآوری زیرساخت یکی از بزرگترین بازیگران اینترنت جهان را زیر سؤال برده است. بررسی گزارشهای فنی این شرکت نشان میدهد پیچیدگی زیرساخت، وابستگی سرویسها، خطاهای نرمافزاری و تغییرات پیکربندی از عوامل بروز یا گسترش برخی از این اختلالها بودهاند.
به گزارش سیتنا، کلودفلر روز جمعه ۱۴ اوت ۲۰۲۶ افزایش خطاهای HTTP 5xx را در چهار نقطه از شبکه خود شامل کویت، بانکوک، جاکارتا و دمام گزارش کرد. این رخداد در سطح «جزئی» طبقهبندی شد و پس از بررسی، کلودفلر از رفع مشکل خبر داد.
تنها یک روز پیش از آن نیز چند مشکل دیگر در صفحه وضعیت کلودفلر ثبت شده بود؛ از جمله افزایش خطاها در Workers KV و بروز مشکل در برخی خدمات Workers AI. البته ثبت چند رخداد در فاصله زمانی کوتاه الزاماً به معنای وقوع چند قطعی گسترده در شبکه جهانی کلودفلر نیست و دامنه و شدت هر یک از این اتفاقها متفاوت بوده است.
با این حال، تکرار چنین رخدادهایی این پرسش را مطرح میکند که چرا زیرساخت شرکتی در ابعاد کلودفلر همچنان در معرض اختلال قرار دارد؟
وقتی اختلال یک سرویس به سرویسهای دیگر سرایت میکند
یکی از پاسخها را میتوان در میزان وابستگی سرویسهای کلودفلر به یکدیگر پیدا کرد.
به گزارش سیتنا، در ۱۲ جون ۲۰۲۵، اختلال در زیرساخت ذخیرهسازی مورد استفاده Workers KV به مدت دو ساعت و ۲۸ دقیقه ادامه یافت و مجموعهای از خدمات کلودفلر از جمله WARP، Access، Gateway، Images، Stream، Workers AI و Turnstile را تحت تأثیر قرار داد.
Workers KV برای عملکرد بخشهایی از محصولات مختلف کلودفلر، از جمله ذخیره و دسترسی به اطلاعات پیکربندی و برخی فرایندهای احراز هویت، اهمیت داشت. در نتیجه، اختلال در این زیرساخت توانست اثر خود را به چند سرویس دیگر منتقل کند.
کلودفلر پس از این رخداد نیز در گزارش فنی خود به وابستگی محصولات مختلف به این زیرساخت و ضرورت کاهش چنین وابستگیهایی پرداخت.
وقتی یک تغییر فنی به اختلال بزرگ تبدیل میشود
یکی از مهمترین نمونههای این مسئله در ۱۸ نوامبر ۲۰۲۵ رخ داد؛ زمانی که بخش قابل توجهی از خدمات کلودفلر با مشکل مواجه شدند.
براساس بررسی های گزارش فنی کلودفلر تپیط سیتنا، این اتفاق ناشی از حمله سایبری نبود. تغییری در مجوزهای یکی از سیستمهای پایگاه داده باعث شد دادههای تکراری در فایلی ایجاد شود که سامانه مدیریت رباتهای کلودفلر از آن استفاده میکرد.
حجم این فایل در نتیجه مشکل ایجادشده تقریباً دو برابر شد. فایل سپس در شبکه کلودفلر توزیع شد، اما نرمافزاری که باید آن را پردازش میکرد برای چنین حجمی طراحی نشده بود و در نتیجه بخشهایی از سیستم با خطا مواجه شدند.
این نمونه نشان داد که در زیرساختی با مقیاس جهانی، حتی تغییری که در ابتدا محدود به یک بخش به نظر میرسد، در صورت انتشار در سراسر شبکه میتواند پیامدهای بسیار گستردهتری داشته باشد.
کمتر از سه هفته بعد، در پنجم دسامبر ۲۰۲۵، کلودفلر بار دیگر با اختلال قابل توجهی مواجه شد. این رخداد حدود ۲۵ دقیقه ادامه داشت و براساس گزارش خود شرکت، مشتریانی که در مجموع حدود ۲۸ درصد از ترافیک HTTP کلودفلر را تشکیل میدادند، در معرض تأثیر آن قرار گرفتند.
پیکربندی اشتباه هم میتواند اینترنت را مختل کند
نمونه دیگری در فوریه ۲۰۲۶ رخ داد و این بار پای سیستم مسیریابی اینترنت در میان بود.
به گزارش سیتنا، کلودفلر تغییری در نحوه مدیریت آدرسهای IP متعلق به مشتریان خود اعمال کرد که بهطور ناخواسته باعث شد مسیرهای اینترنتی برخی از این آدرسها از طریق پروتکل BGP حذف شوند.
نتیجه این بود که سرویسهای برخی مشتریان دیگر از طریق اینترنت قابل دسترسی نبودند.
کلودفلر در گزارش فنی این رخداد تأکید کرد که حادثه ناشی از حمله سایبری نبوده و از تغییری سرچشمه گرفته بود که خود شرکت در شبکه اعمال کرده بود. این رخداد بیش از شش ساعت ادامه داشت.
پیچیدگی؛ قدرت و در عین حال نقطه آسیبپذیری کلودفلر
برای درک علت اهمیت این اختلالها باید توجه داشت که کلودفلر دیگر صرفاً یک شبکه توزیع محتوا نیست.
این شرکت مجموعه گستردهای از خدمات شامل DNS، شبکه توزیع محتوا، مقابله با حملات محرومسازی از سرویس، امنیت وب، Zero Trust، پردازش بدون سرور، ذخیرهسازی داده و خدمات مرتبط با هوش مصنوعی را ارائه میکند.
گسترش این خدمات به کلودفلر امکان داده است به یکی از بازیگران اصلی زیرساخت اینترنت تبدیل شود؛ اما همزمان تعداد ارتباطها و وابستگیهای میان اجزای مختلف زیرساخت آن نیز افزایش یافته است.
اگر یک سرویس مرکزی برای پیکربندی، احراز هویت یا توزیع اطلاعات مورد استفاده چند محصول قرار گیرد، مشکل در همان بخش میتواند به محصولات دیگری که در ظاهر مستقل هستند نیز سرایت کند.
نمونهای از این وضعیت در سپتامبر ۲۰۲۵ مشاهده شد؛ زمانی که یک اشکال در داشبورد کلودفلر باعث ایجاد تعداد زیادی درخواست غیرضروری به یک API داخلی شد. افزایش درخواستها سرویس مربوطه را تحت فشار قرار داد و به دلیل نقش آن در بررسی مجوز درخواستهای API، مشکل به بخشهای دیگری نیز گسترش پیدا کرد.
کلودفلر برای جلوگیری از تکرار اختلالها چه کرد؟
تعداد و گستردگی برخی رخدادهای سال ۲۰۲۵ در نهایت کلودفلر را به اجرای یک برنامه مهندسی ویژه برای افزایش تابآوری شبکه واداشت.
این شرکت پس از اختلالهای بزرگ نوامبر و دسامبر ۲۰۲۵ برنامهای با عنوان «Code Orange: Fail Small» را آغاز کرد.
فلسفه اصلی این برنامه این بود که اگر بخشی از شبکه دچار مشکل شد، خرابی تا حد امکان در همان بخش باقی بماند و به سایر قسمتهای زیرساخت سرایت نکند.
کلودفلر در قالب این برنامه روی موضوعاتی مانند ایمنتر کردن انتشار تغییرات پیکربندی، کاهش دامنه تأثیر خرابیها، ایجاد سازوکارهای بهتر برای بازگشت سریع تغییرات و کاهش وابستگیهای مشترک میان سرویسها کار کرد.
این شرکت در مه ۲۰۲۶ اعلام کرد بخش اصلی این برنامه مهندسی تکمیل شده و تغییرات متعددی برای افزایش مقاومت شبکه در برابر خرابیهای مشابه اعمال شده است.
آیا کلودفلر واقعاً زیاد دچار قطعی میشود؟
پاسخ به این سؤال نیازمند یک تفکیک مهم است.
به گزارش سیتنا، هر رخدادی که در صفحه وضعیت کلودفلر ثبت میشود به معنای از دسترس خارج شدن شبکه جهانی این شرکت نیست. برخی مشکلات تنها یک محصول، مرکز داده یا منطقه جغرافیایی محدود را تحت تأثیر قرار میدهند.
برای نمونه، رخداد ۱۴ اوت ۲۰۲۶ تنها مربوط به افزایش خطاهای ۵xx در کویت، دمام، بانکوک و جاکارتا بود و کلودفلر آن را در سطح «جزئی» طبقهبندی کرد. این اتفاق را نمیتوان با اختلال گسترده نوامبر ۲۰۲۵ در یک سطح قرار داد.
با این حال، گزارشهای فنی منتشرشده توسط خود کلودفلر نشان میدهد که یک چالش مهم برای این شرکت، جلوگیری از تبدیل مشکلات محدود به اختلالهای گستردهتر است.
وابستگی سرویسها به زیرساختهای مشترک، انتشار تغییرات در شبکهای جهانی، خطاهای نرمافزاری و اشتباهات پیکربندی همگی در رخدادهای مختلف نقش داشتهاند.
در واقع، بزرگی شبکه کلودفلر دو روی یک سکه دارد؛ همان معماری گستردهای که امکان ارائه سریع و امن خدمات اینترنتی در نقاط مختلف جهان را فراهم میکند، مدیریت تغییرات و وابستگیهای داخلی را نیز پیچیدهتر میکند.
به همین دلیل، مسئله اصلی برای کلودفلر تنها جلوگیری کامل از وقوع خطا نیست؛ بلکه توانایی محدود کردن دامنه یک خرابی اهمیت بیشتری پیدا کرده است. راهبرد جدید این شرکت نیز دقیقاً بر همین اصل بنا شده است: اگر بخشی از شبکه دچار مشکل شد، خرابی باید تا حد ممکن کوچک بماند و به سایر بخشهای اینترنت تحت پوشش کلودفلر سرایت نکند.
انتهای پیام
افزودن دیدگاه جدید