Microsoft съобщи, че грешка в автоматизираната й система за заявки за мрежова поддръжка е причинила мащабния срив в четвъртък, като по погрешка е премахнала IP маршрути от повече устройства от предвиденото, нарушавайки услугите на Azure и Microsoft 365.
Сривът е започнал в 10:44 ч. източно време (ET) в четвъртък, 23 юли, и е засегнал най-вече клиенти, достъпващи услугите на Microsoft 365 чрез мрежова инфраструктура, свързана с региона Azure West US на Microsoft.
Към 11:11 ч. източно време Downdetector е регистрирал 2403 сигнала за срив, което е рязко над нормалното базово ниво от 29. SharePoint съставлява 78% от оплакванията, следван от Excel с 11% и Административния център на Microsoft 365 с 6%.
Microsoft проследи срива на Microsoft 365 под идентификатор на инцидент MO1437424 и потвърди, че са засегнати множество услуги на Microsoft 365:
- Microsoft OneDrive – достъпът до OneDrive е бил прекъсващ.
- SharePoint Online – потребителите са получавали грешки „Нещо се обърка“.
- Microsoft Teams – функционалността на чата е била влошена, включително не са се зареждали изображения.
- Административен център на Microsoft 365 – Административният център се е зареждал бавно или изобщо не се е зареждал.
- Power Automate – потоците на автоматизация не са се зареждали.
- Copilot Chat – потребителите са изпитвали периодични забавяния или неуспехи при извършване на действия и заявки.
- Microsoft Loop – потребителите не са можели да отварят или зареждат страници на Loop.
Други засегнати услуги включват Fabric и Power BI, Power Apps, Copilot Studio, Windows 365 и Microsoft Defender.
Някои клиенти на Defender са изпитали забавяне при получаване на отговори от експертите на Microsoft Defender, докато разследвания, работни процеси и действия за отстраняване, задействани чрез Threat Explorer и Advanced Hunting, е можело да се провалят.
Първоначално Microsoft се е опитала да смекчи срива чрез пренасочване на трафика по алтернативни мрежови пътища, което е помогнало на клиентите, но много услуги са останали засегнати.
Преди да установи причината за срива, Microsoft е предупредила клиентите, че може да се наложи да преразгледат своите планове за непрекъснатост на бизнеса и възстановяване след бедствие и да предприемат подходящи действия за своите среди.
По-късно компанията е идентифицирала скорошна мрежова промяна като причина и е започнала да я отменя.
Microsoft завърши отмяната в 14:26 ч. източно време и потвърди чрез служебна телеметрия и клиентски доклади, че инцидентът с Microsoft 365 е разрешен.
В предварителен преглед след инцидента за Azure, Microsoft заяви, че сривът е бил предизвикан по време на рутинна поддръжка на устройства в нейния регион Azure West US, където са били изолирани специфични мрежови пътища.
Microsoft обяснява, че нейният процес на поддръжка преобразува тези видове заявки в инструкции, четими от системата, и проверява дали поне един от два излишни пътя остава работещ преди началото на работата.
Въпреки това, грешка в системата за преобразуване на заявки неправилно е маркирала допълнителни мрежови устройства като част от събитието по поддръжка.
В резултат на това са били премахнати IP маршрути от повече устройства от предвиденото между центъра за данни West US на Microsoft и неговата глобална мрежа (WAN).
Премахнатите маршрути са прекъснали мрежовия трафик, влизащ или излизащ от региона West US. Въпреки това от Microsoft заявиха, че трафикът, оставащ изцяло в рамките на региона, не е бил засегнат.
Инцидентът с Azure причини проблеми със свързаността, увеличено забавяне и проблеми с достъпа до множество облачни услуги, включително Azure App Service, Application Gateway, Azure AD B2C, Azure AI Search, Azure API Management, Azure Cosmos DB, Azure Databricks, Azure Firewall, Azure Kubernetes Service, Azure Monitor, Azure Virtual Desktop, ExpressRoute, Log Analytics, Microsoft Graph, Microsoft Sentinel, Power BI Embedded, Virtual WAN и VPN Gateway.
От Microsoft заявиха, че нейните инженери са започнали да разследват проблемите веднага след началото на срива в 10:44 ч. източно време.
Проблемът първоначално се е проявил като мащабно колебание на маршрутите (route churn) в WAN мрежата на Microsoft. Инженерите по-късно са проследили премахването на маршрути до център за данни в региона West US и са ги свързали с неотдавнашната дейност по поддръжка.
Microsoft инициира отмяна на промяната от поддръжката в 13:45 ч. източно време, което приключи в 14:26 ч. източно време.
Отмяната възстанови засегнатата мрежова инфраструктура и позволи на услугите на Microsoft 365 да се възстановят. Някои услуги на Azure продължиха да се възстановяват след прилагането на корекцията, като Microsoft съобщи, че всички засегнати услуги са се възстановили напълно до 15:41 ч. източно време.
Сега Microsoft провежда пълен вътрешен преглед, фокусиран върху проверките за безопасност и автоматизираните процеси, използвани за изпълнение на заявки за поддръжка.
„Ще извършим пълен анализ, фокусиран върху проверките за безопасност, процеса на промяна на автоматизираните заявки за поддръжка и други, докато напредваме с нашата вътрешна ретроспекция след смекчаване на последиците“, обясниха от Microsoft.
Компанията заяви, че ще публикува окончателен преглед след приключване на разследването си, което обикновено става в рамките на 14 дни.