اینترنت مثل هر زیرساختی شکننده است — تا وقتی کار می‌کند، کمتر به پیچیدگی‌هایش توجه می‌کنیم، اما وقتی قطع می‌شود، همهٔ لایه‌ها و وابستگی‌ها نمایان می‌شوند. Cloudflare در موقعیتی منحصربه‌فرد قرار دارد تا لحظاتی را که یکی از سیستم‌های بهم‌پیچیدهٔ Internet از کار می‌افتد شناسایی و مستندسازی کند و در نتیجه می‌توانیم قطعی‌ها را بهتر دنبال کنیم. ⚠️

در Q2 2026 چند رویداد برجسته داشتیم: Super Typhoon Sinlaku در شمال Guam باعث طولانی‌ترین قطعی شد، خاموشی‌های اجباریِ دولت‌ها در دورهٔ امتحانات در Sudan پرتکرارترین نوع قطع ارتباط بودند، Iran پس از 88 روز قطع سراسری دوباره به شبکهٔ جهانی متصل شد، حملات پهپادی به نواحی‌ای باعث اختلال در زیرساخت‌های AWS در منطقه شد، و قطع کابل در Saint Lucia همراه با توزیع امضاهای معیوب DNSSEC در آلمان، یادآور حساسیت ساختارهای فیزیکی و منطقی اینترنت بود — در عین حال نشان داد چقدر این سیستم‌ها وقتی درست کار می‌کنند مقاوم‌اند. 🌪️🛰️

در ادامه، با اتکا به ترافیک و داده‌های Cloudflare Radar نگاهی فنی و کاربردی به مهم‌ترین اختلالات Q2 2026 می‌اندازیم، نحوهٔ وقوع هر رویداد و تأثیر آن بر کاربران محلی و عملیات سرویس‌ها را توضیح می‌دهیم. این گزارش خلاصه‌ای از اختلالات تأییدشده است، نه یک فهرست جامع — برای دید وسیع‌تر می‌توانید به Cloudflare Radar Outage Center مراجعه کنید. 🔍

بلایای طبیعی و قطع برق: در Guam، Super Typhoon Sinlaku باعث ترکیبی از قطع برق گسترده و آسیب به فیبرهای میکرومارین شد که منجر به افت طولانی‌مدت link-level و لایهٔ انتقالی شد. در کشورهایی مثل Venezuela و Tanzania نیز خاموشی‌های برق یا مشکلات توزیع انرژی باعث ناپایداری در CDN و origin reachability شد. درس فنی برای SREها: داشتن multi-region deployment، replication از داده‌های حیاتی و طراحی برای graceful degradation (مثلاً cache-first یا read-only modes) می‌تواند مدت‌زمان تأثیر را کاهش دهد. همچنین باید روی مانیتورینگ لایه‌های فیزیکی (BGP sessions, interface counters) و synthetic checks سرمایه‌گذاری کنید تا بفهمید مشکل از power، transport یا application است. 🔌🌐

خاموشی‌های دولتی (Government-mandated shutdowns): در Sudan ناپایداری به‌صورت دوره‌ای و پیش‌بینی‌شده رخ داد، خصوصاً زمانِ امتحانات که shutdownها تکرار می‌شوند. این نوع قطعی‌ها اغلب regional blackholes یا route withdrawals را ایجاد می‌کنند. برای آماده‌سازی بهتر: طراحی traffic steering با awareness از geopolitical regions، استفاده از caches توزیع‌شده، و داشتن runbooks برای کاهش مشکلات در زمان قطع شبکه ضروری است. همچنین آنالیز تاریخی ترافیک کمک می‌کند الگوی تکرار را پیش‌بینی کنید. 🧭

بازگردانی کامل شبکه — مورد Iran: بازگشت Iran بعد از 88 روز قطع نمونهٔ خوبی است از اینکه بازسازی شبکه معمولاً تدریجی و به‌صورت مرحله‌ای انجام می‌شود: BGP re-announcements، بازگشت DNS records، و بازشدن مسیرهای بین‌المللی. برای SREها اهمیت دارد که هنگام ریکاوری، انتظار spikes در ترافیک و تغییرات ناگهانی در latency یا error rates را داشته باشند؛ throttling تدریجی، health checks و staged rollouts کمک‌کننده است. در کنار آن، اختلالات ناشی از حملات پهپادی به زیرساخت‌های AWS نشان داد که حتی سرویس‌های cloud می‌توانند نقطهٔ شکست منطقه‌ای شوند — طراحی cross-cloud و cross-region failover اهمیت بالایی دارد. ⚡🛠️

مشکلات زیرساختی و DNS: قطع کابل در Saint Lucia نمونهٔ کلاسیک single-point-of-failure در لایهٔ فیزیکی است؛ در حالی که توزیع امضاهای معیوب DNSSEC در آلمان نشان می‌دهد که خطاهای درون‌زنجیرهٔ تولید و انتشار کلیدها/سگنچرها می‌توانند باعث widespread name resolution failures شوند. برای کاهش ریسک‌ها: pipelineهای CI/CD برای zone signing را با گاردریل‌های validation اتوماتیک تجهیز کنید، TTLهای معقول تنظیم کنید، و مانیتورینگ validation failures را جدی بگیرید. همچنین داشتن fallback resolution paths و رویکردهای phased key rollover حیاتی است. 🧩

خلاصهٔ عملیاتی برای SREها: 1) معماری multi-region و multi-provider را تمرین و تست کنید؛ 2) مانیتورینگ باید شامل BGP, DNS, زیرساخت فیزیکی و synthetic transactions باشد؛ 3) آمادهٔ runbooks برای انواع قطعی (natural disasters, state-mandated, infrastructure faults) باشید و آنها را در بازی‌های میدانی (chaos drills) تمرین کنید؛ 4) پاسخ‌دهی تدریجی و staged rollouts را اولویت بدهید تا از موج خطا جلوگیری شود؛ و 5) از داده‌های واقع‌زمانی مثل Cloudflare Radar برای تشخیص سریع الگوها و گرفتن تصمیم‌های مبتنی بر حقیقت بهره ببرید. اگر مورد مشخصی نیاز به توضیح فنی بیشتری دارد، خوشحال می‌شوم جزئیات عملیاتی یا playbook پیشنهادی را همراه با نمونه‌های مانیتورینگ و alerting ارائه کنم. 🚑