Когато гигантите заливат: Защо големите IT сривове не са само хакерска работа
Когато гигантите се препънат: Защо престоите на GitHub, Salesforce и SharePoint нямат нищо общо с хакерите
Цялата ни индустрия за киберсигурност ни е научила да се страхуваме от хакерите. Филмите ни показват драматични пробиви, новините крещят за изтекли данни, а всеки ИТ отдел е обсебен от системите за откриване на прониквания. Но ето една неприятна истина, която последната вълна от големи престои на платформи направи много видима: понякога най-опасните заплахи идват отвътре.
Една седмица на проблеми
Само за четири дни три от най-използваните платформи в технологичната екосистема изпитаха сериозни смущения. GitHub - основата за контрол на версиите за милиони разработчици по света - претърпя прекъсвания. Salesforce, който обработва милиарди бизнес транзакции всеки ден, имаше проблеми с достъпността. SharePoint - гръбнакът за сътрудничество на безброй предприятия - излезе офлайн.
Общата нишка? Нито един от тези инциденти не беше свързан с злонамерени актьори, сложни атаки или кампании на киберпрестъпници. Вместо това, виновниците бяха доста по-обикновени - и затова много по-коварни.
Старите познати: Наследени системи и промени в конфигурацията
Това, което се разбра за тези инциденти, показа познати модели. Услуги за вход, изградени върху натрупани технически дългове години наред, най-накрая стигнаха точката на пречупване. Конфигурационни промени, направени в една среда, се преляха в неочаквано поведение в production. Операции по почистване, целящи подобряване на системите, вместо това въведоха нови нестабилности.
Това е реалността, която много разработчици и DevOps инженери познават отблизо, но рядко обсъждат публично: най-опасният момент за всяка система е когато се опитваш да я поправиш.
Конфигурационната катастрофа
Configuration drift - постепенното разминаване между това как системите са конфигурирани и както трябва да бъдат - си остава един от най-подценяваните рискове в технологичните операции. Малка промяна, направена прибързано. Временно решение, което никога не е било върнато. Променлива на средата, зададена неправилно в staging, която по някакъв начин стига до production. Тези невидими проблеми се натрупват, докато не създадат перфектната буря.
Наследството: Спящият великан
Legacy системите носят невидима тежест. Те са били изградени за други епохи, други мащаби и други модели на заплахи. С течение на времето хората, които ги разбират, се пенсионират или продължават нататък. Документацията остарява. Зависимостите остават без поддръжка. И един ден нещо, което е работило петнайсет години, изведнъж спира да работи.
Какво означава това за твоя бизнес
Ако изграждаш върху платформи като тези - и нека бъдем честни, повечето бизнеси го правят - трябва да приемеш една неприятна реалност: твоят uptime е толкова силен, колкото оперативната дисциплина на твоите доставчици и собствените ти практики.
Оперативната устойчивост не е опция
Събитията от изминалата седмица трябва да бъдат събуждане за организациите, които са фокусирали усилията си за управление на риска основно върху външни заплахи. Докато сигурността си остава критично важна, оперативната устойчивост - способността ти да поддържаш непрекъснатост на услугата независимо от режима на отказ - заслужава същото внимание.
Това означава:
- Диверсификация на критичните зависимости: Може ли бизнесът ти да оцелее при 6-часов престой на GitHub? А на Salesforce? Ако отговорът е не, имаш нужда от планове за излишък.
- Разбиране на оперативните практики на твоя доставчик: Имат ли стабилно управление на промените? Какви са процедурите им за реагиране при инциденти? Тези въпроси имат значение.
- Изграждане за неуспех: Внедри circuit breakers, слоеве за кеширане и резервни механизми. Приеми, че всяка third-party услуга в крайна сметка ще се провали.
Човешкият фактор
зад всяка конфигурационна промяна, зад всяка наследена услуга и всяка операция по почистване стои човешко същество (или екип от тях). Натискът да се действа бързо, умората от ротациите на дежурства, институционалните знания, които си тръгват заедно с пенсиониращите се инженери - тези човешки фактори са мястото, където много престои всъщност започват.
Компаниите, които инвестират в устойчиви инженерни практики, адекватно персонално осигуряване и предаване на знания, всъщност инвестират в надеждност. Това не е glamourizно, но е основателно.
Поглед напред: Уроците, които трябва да запомним
Инцидентите, засегнали GitHub, Salesforce и SharePoint, служат като колективно напомняне: надеждността на инфраструктурата е занаят, не второстепенна мисъл. Като разработчици и технически лидери, трябва да се застъпваме за времето, ресурсите и културата, които правят оперативното превъзходство възможно.
За бизнесите това означава да признаят, че оперативното здраве на техните технологични партньори пряко удари тяхното собствено. Проверката на доставчици не трябва да е само за тяхната сигурност - задавай трудни въпроси за техните deployment практики, тяхната история на инциденти и техните инженерни инвестиции.
Атакуващите могат да чакат. Конфигурационният файл няма да чака.
В NameOcean разбираме, че uptime-ът има значение. Нашата инфраструктура е изградена с устойчивост в основата си, защото знаем, че най-добрата защита е солидната отбрана - както срещу външни заплахи, така и срещу вътрешни оперативни рискове.