پشت پرده اختلال‌های کلودفلر؛ چرا یکی از ستون‌های اینترنت از دسترس خارج می‌شود؟

کلودفلر
اختلال‌های متعدد کلودفلر بار دیگر تاب‌آوری زیرساخت یکی از بزرگ‌ترین بازیگران اینترنت جهان را زیر سؤال برده است. بررسی گزارش‌های فنی این شرکت نشان می‌دهد پیچیدگی زیرساخت، وابستگی سرویس‌ها، خطاهای نرم‌افزاری و تغییرات پیکربندی از عوامل بروز یا گسترش برخی از این اختلال‌ها بوده‌اند.

به گزارش سیتنا، کلودفلر روز جمعه ۱۴ اوت ۲۰۲۶ افزایش خطاهای HTTP 5xx را در چهار نقطه از شبکه خود شامل کویت، بانکوک، جاکارتا و دمام گزارش کرد. این رخداد در سطح «جزئی» طبقه‌بندی شد و پس از بررسی، کلودفلر از رفع مشکل خبر داد.

تنها یک روز پیش از آن نیز چند مشکل دیگر در صفحه وضعیت کلودفلر ثبت شده بود؛ از جمله افزایش خطاها در Workers KV و بروز مشکل در برخی خدمات Workers AI. البته ثبت چند رخداد در فاصله زمانی کوتاه الزاماً به معنای وقوع چند قطعی گسترده در شبکه جهانی کلودفلر نیست و دامنه و شدت هر یک از این اتفاق‌ها متفاوت بوده است.

با این حال، تکرار چنین رخدادهایی این پرسش را مطرح می‌کند که چرا زیرساخت شرکتی در ابعاد کلودفلر همچنان در معرض اختلال قرار دارد؟

وقتی اختلال یک سرویس به سرویس‌های دیگر سرایت می‌کند

یکی از پاسخ‌ها را می‌توان در میزان وابستگی سرویس‌های کلودفلر به یکدیگر پیدا کرد.

به گزارش سیتنا، در ۱۲ جون ۲۰۲۵، اختلال در زیرساخت ذخیره‌سازی مورد استفاده Workers KV به مدت دو ساعت و ۲۸ دقیقه ادامه یافت و مجموعه‌ای از خدمات کلودفلر از جمله WARP، Access، Gateway، Images، Stream، Workers AI و Turnstile را تحت تأثیر قرار داد.

Workers KV برای عملکرد بخش‌هایی از محصولات مختلف کلودفلر، از جمله ذخیره و دسترسی به اطلاعات پیکربندی و برخی فرایندهای احراز هویت، اهمیت داشت. در نتیجه، اختلال در این زیرساخت توانست اثر خود را به چند سرویس دیگر منتقل کند.

کلودفلر پس از این رخداد نیز در گزارش فنی خود به وابستگی محصولات مختلف به این زیرساخت و ضرورت کاهش چنین وابستگی‌هایی پرداخت.

وقتی یک تغییر فنی به اختلال بزرگ تبدیل می‌شود

یکی از مهم‌ترین نمونه‌های این مسئله در ۱۸ نوامبر ۲۰۲۵ رخ داد؛ زمانی که بخش قابل توجهی از خدمات کلودفلر با مشکل مواجه شدند.

براساس بررسی های گزارش فنی کلودفلر تپیط سیتنا، این اتفاق ناشی از حمله سایبری نبود. تغییری در مجوزهای یکی از سیستم‌های پایگاه داده باعث شد داده‌های تکراری در فایلی ایجاد شود که سامانه مدیریت ربات‌های کلودفلر از آن استفاده می‌کرد.

حجم این فایل در نتیجه مشکل ایجادشده تقریباً دو برابر شد. فایل سپس در شبکه کلودفلر توزیع شد، اما نرم‌افزاری که باید آن را پردازش می‌کرد برای چنین حجمی طراحی نشده بود و در نتیجه بخش‌هایی از سیستم با خطا مواجه شدند.

این نمونه نشان داد که در زیرساختی با مقیاس جهانی، حتی تغییری که در ابتدا محدود به یک بخش به نظر می‌رسد، در صورت انتشار در سراسر شبکه می‌تواند پیامدهای بسیار گسترده‌تری داشته باشد.

کمتر از سه هفته بعد، در پنجم دسامبر ۲۰۲۵، کلودفلر بار دیگر با اختلال قابل توجهی مواجه شد. این رخداد حدود ۲۵ دقیقه ادامه داشت و براساس گزارش خود شرکت، مشتریانی که در مجموع حدود ۲۸ درصد از ترافیک HTTP کلودفلر را تشکیل می‌دادند، در معرض تأثیر آن قرار گرفتند.

پیکربندی اشتباه هم می‌تواند اینترنت را مختل کند

نمونه دیگری در فوریه ۲۰۲۶ رخ داد و این بار پای سیستم مسیریابی اینترنت در میان بود.

به گزارش سیتنا، کلودفلر تغییری در نحوه مدیریت آدرس‌های IP متعلق به مشتریان خود اعمال کرد که به‌طور ناخواسته باعث شد مسیرهای اینترنتی برخی از این آدرس‌ها از طریق پروتکل BGP حذف شوند.

نتیجه این بود که سرویس‌های برخی مشتریان دیگر از طریق اینترنت قابل دسترسی نبودند.

کلودفلر در گزارش فنی این رخداد تأکید کرد که حادثه ناشی از حمله سایبری نبوده و از تغییری سرچشمه گرفته بود که خود شرکت در شبکه اعمال کرده بود. این رخداد بیش از شش ساعت ادامه داشت.

پیچیدگی؛ قدرت و در عین حال نقطه آسیب‌پذیری کلودفلر

برای درک علت اهمیت این اختلال‌ها باید توجه داشت که کلودفلر دیگر صرفاً یک شبکه توزیع محتوا نیست.

این شرکت مجموعه گسترده‌ای از خدمات شامل DNS، شبکه توزیع محتوا، مقابله با حملات محروم‌سازی از سرویس، امنیت وب، Zero Trust، پردازش بدون سرور، ذخیره‌سازی داده و خدمات مرتبط با هوش مصنوعی را ارائه می‌کند.

گسترش این خدمات به کلودفلر امکان داده است به یکی از بازیگران اصلی زیرساخت اینترنت تبدیل شود؛ اما همزمان تعداد ارتباط‌ها و وابستگی‌های میان اجزای مختلف زیرساخت آن نیز افزایش یافته است.

اگر یک سرویس مرکزی برای پیکربندی، احراز هویت یا توزیع اطلاعات مورد استفاده چند محصول قرار گیرد، مشکل در همان بخش می‌تواند به محصولات دیگری که در ظاهر مستقل هستند نیز سرایت کند.

نمونه‌ای از این وضعیت در سپتامبر ۲۰۲۵ مشاهده شد؛ زمانی که یک اشکال در داشبورد کلودفلر باعث ایجاد تعداد زیادی درخواست غیرضروری به یک API داخلی شد. افزایش درخواست‌ها سرویس مربوطه را تحت فشار قرار داد و به دلیل نقش آن در بررسی مجوز درخواست‌های API، مشکل به بخش‌های دیگری نیز گسترش پیدا کرد.

کلودفلر برای جلوگیری از تکرار اختلال‌ها چه کرد؟

تعداد و گستردگی برخی رخدادهای سال ۲۰۲۵ در نهایت کلودفلر را به اجرای یک برنامه مهندسی ویژه برای افزایش تاب‌آوری شبکه واداشت.

این شرکت پس از اختلال‌های بزرگ نوامبر و دسامبر ۲۰۲۵ برنامه‌ای با عنوان «Code Orange: Fail Small» را آغاز کرد.

فلسفه اصلی این برنامه این بود که اگر بخشی از شبکه دچار مشکل شد، خرابی تا حد امکان در همان بخش باقی بماند و به سایر قسمت‌های زیرساخت سرایت نکند.

کلودفلر در قالب این برنامه روی موضوعاتی مانند ایمن‌تر کردن انتشار تغییرات پیکربندی، کاهش دامنه تأثیر خرابی‌ها، ایجاد سازوکارهای بهتر برای بازگشت سریع تغییرات و کاهش وابستگی‌های مشترک میان سرویس‌ها کار کرد.

این شرکت در مه ۲۰۲۶ اعلام کرد بخش اصلی این برنامه مهندسی تکمیل شده و تغییرات متعددی برای افزایش مقاومت شبکه در برابر خرابی‌های مشابه اعمال شده است.

آیا کلودفلر واقعاً زیاد دچار قطعی می‌شود؟

پاسخ به این سؤال نیازمند یک تفکیک مهم است.

به گزارش سیتنا، هر رخدادی که در صفحه وضعیت کلودفلر ثبت می‌شود به معنای از دسترس خارج شدن شبکه جهانی این شرکت نیست. برخی مشکلات تنها یک محصول، مرکز داده یا منطقه جغرافیایی محدود را تحت تأثیر قرار می‌دهند.

برای نمونه، رخداد ۱۴ اوت ۲۰۲۶ تنها مربوط به افزایش خطاهای ۵xx در کویت، دمام، بانکوک و جاکارتا بود و کلودفلر آن را در سطح «جزئی» طبقه‌بندی کرد. این اتفاق را نمی‌توان با اختلال گسترده نوامبر ۲۰۲۵ در یک سطح قرار داد.

با این حال، گزارش‌های فنی منتشرشده توسط خود کلودفلر نشان می‌دهد که یک چالش مهم برای این شرکت، جلوگیری از تبدیل مشکلات محدود به اختلال‌های گسترده‌تر است.

وابستگی سرویس‌ها به زیرساخت‌های مشترک، انتشار تغییرات در شبکه‌ای جهانی، خطاهای نرم‌افزاری و اشتباهات پیکربندی همگی در رخدادهای مختلف نقش داشته‌اند.

در واقع، بزرگی شبکه کلودفلر دو روی یک سکه دارد؛ همان معماری گسترده‌ای که امکان ارائه سریع و امن خدمات اینترنتی در نقاط مختلف جهان را فراهم می‌کند، مدیریت تغییرات و وابستگی‌های داخلی را نیز پیچیده‌تر می‌کند.

به همین دلیل، مسئله اصلی برای کلودفلر تنها جلوگیری کامل از وقوع خطا نیست؛ بلکه توانایی محدود کردن دامنه یک خرابی اهمیت بیشتری پیدا کرده است. راهبرد جدید این شرکت نیز دقیقاً بر همین اصل بنا شده است: اگر بخشی از شبکه دچار مشکل شد، خرابی باید تا حد ممکن کوچک بماند و به سایر بخش‌های اینترنت تحت پوشش کلودفلر سرایت نکند.

انتهای پیام


Source URL: https://www.citna.ir/news/340531/پشت-پرده-اختلال-های-کلودفلر-چرا-یکی-ستون-های-اینترنت-دسترس-خارج