Wenn selbst die Großen fallen: Ausfälle bei GitHub, Salesforce und SharePoint – und was wirklich dahintersteckt

Wenn selbst die Großen fallen: Ausfälle bei GitHub, Salesforce und SharePoint – und was wirklich dahintersteckt

Sep 23, 2026 infrastructure devops cloud hosting incident response operational resilience change management reliability engineering platform stability

Wenn Giganten ins Stolpern geraten: Warum Ausfälle bei GitHub, Salesforce und SharePoint nichts mit Hackern zu tun haben

Die Cybersecurity-Branche hat uns beigebracht, Hacker zu fürchten. Filme dramatisieren Angriffe, Nachrichten schreien von Datenlecks, und jede IT-Abteilung besessen von Einbruchsdetektion. Aber hier ist eine unbequeme Wahrheit, die uns die jüngsten Großausfälle schonungslos vor Augen führen: Manchmal kommen die gefährlichsten Bedrohungen von innen.

Eine Woche voller Wackler

Innerhalb von nur vier Tagen erlebten drei der wichtigsten Plattformen im Tech-Ökosystem massive Störungen. GitHub, das Fundament der Versionskontrolle für Millionen Entwickler weltweit, hatte Ausfälle. Salesforce, das täglich Milliarden an Geschäftstransaktionen abwickelt, stand still. SharePoint, das Rückgrat der Zusammenarbeit für unzählige Unternehmen, ging vom Netz.

Was hatten diese Vorfälle gemeinsam? Keiner ging auf böswillige Akteure, raffinierte Angriffe oder kriminelle Kampagnen zurück. Stattdessen waren die Übeltäter weitaus alltäglicher – und deshalb umso heimtückischer.

Die üblichen Verdächtigen: Legacy-Systeme und Config-Änderungen

Was nach und nach ans Licht kam, folgte einem bekannten Muster. Veraltete Login-Dienste, die jahrelang technische Altlasten mit sich geschleppt hatten, erreichten endlich ihren Kipppunkt. Konfigurationsänderungen in einer Umgebung führten zu unerwarteten Verhaltensweisen in der Produktion. Aufräumarbeiten, die Systeme verbessern sollten, brachten stattdessen neue Instabilitäten.

Das ist die Realität, die viele Entwickler und DevOps-Ingenieure aus dem Effeff kennen, aber selten offen ansprechen: Der gefährlichste Moment für jedes System ist der, in dem man versucht, es zu reparieren.

Das Konfigurations-Chaos

Configuration Drift – die schleichende Abweichung zwischen Ist- und Soll-Zustand der Systemkonfiguration – bleibt eines der am meisten unterschätzten Risiken im Technologiebetrieb. Eine kleine Änderung, die in Hektik vorgenommen wurde. Ein temporärer Fix, der nie zurückgesetzt wurde. Eine Umgebungsvariable, die in der Staging-Umgebung falsch gesetzt wurde und es irgendwie in die Produktion schaffte: Diese unsichtbaren Probleme türmen sich auf, bis sie den perfekten Sturm erzeugen.

Legacy: Der schlafende Riese

Veraltete Systeme tragen ein unsichtbares Gewicht. Sie wurden für andere Zeiten, andere Maßstäbe und andere Bedrohungsmodelle gebaut. Mit der Zeit gehen die Menschen in Rente, die sie verstehen. Dokumentation veraltet. Abhängigkeiten werden nicht mehr gepflegt. Und dann, eines Tages, funktioniert etwas nicht mehr, das fünfzehn Jahre lang tadellos lief.

Was das für dein Unternehmen bedeutet

Wenn du auf Plattformen wie diesen aufbaust – und seien wir ehrlich, die meisten Unternehmen tun das – dann musst du eine unbequeme Wahrheit akzeptieren: Deine Verfügbarkeit ist nur so stark wie die operative Disziplin deiner Anbieter und deiner eigenen internen Praktiken.

Operative Resilienz ist kein Luxus

Die Ereignisse der letzten Woche sollten ein Weckruf sein für Organisationen, die ihr Risikomanagement vor allem auf externe Bedrohungen ausgerichtet haben. Während Sicherheit nach wie vor absolut kritisch ist, verdient operative Resilienz – deine Fähigkeit, Dienstkontinuität unabhängig von der Art des Ausfalls aufrechtzuerhalten – ebenso viel Aufmerksamkeit.

Das bedeutet konkret:

  • Kritische Abhängigkeiten streuen: Kann dein Unternehmen einen sechsstündigen GitHub-Ausfall überleben? Und was ist mit Salesforce? Wenn die Antwort Nein lautet, brauchst du Redundanzpläne.
  • Die Betriebspraktiken deiner Anbieter kennen: Haben sie fundiertes Change Management? Wie sehen ihre Incident-Response-Verfahren aus? Diese Fragen sind wichtig.
  • Auf Ausfälle vorbereiten: Implementiere Circuit Breaker, Caching-Schichten und Fallback-Mechanismen. Geh davon aus, dass jeder Drittanbieter-Service irgendwann ausfällt.

Der Faktor Mensch

Hinter jeder Konfigurationsänderung, jedem Legacy-Service und jeder Aufräumaktion steht ein Mensch – oder ein Team davon. Der Druck, schnell voranzukommen. Die Erschöpfung aus Bereitschaftsdiensten. Das Erfahrungswissen, das mit ausscheidenden Ingenieuren die Tür verlässt. In diesen menschlichen Faktoren liegen die wahren Ursachen vieler Ausfälle.

Unternehmen, die in nachhaltige Engineering-Praktiken, angemessene Besetzung und Wissenstransfer investieren, investieren gleichzeitig in Zuverlässigkeit. Das ist nicht glamourös, aber es ist grundlegend.

Blick nach vorn: Was wir mitnehmen sollten

Die Vorfälle bei GitHub, Salesforce und SharePoint sind eine gemeinsame Erinnerung: Infrastruktur-Zuverlässigkeit ist ein Handwerk, kein Hintergedanke. Als Entwickler und technische Führungskräfte müssen wir uns für die Zeit, Ressourcen und Kultur einsetzen, die operative Exzellenz ermöglichen.

Für Unternehmen heißt das: Erkenntnisse, dass die operative Gesundheit deiner Technologiepartner dein eigenes Geschäft direkt beeinflusst. Die Prüfung von Anbietern sollte sich nicht nur auf deren Sicherheitslage konzentrieren – stellt unbequeme Fragen zu ihren Deployment-Praktiken, ihrer Incident-Historie und ihren Engineering-Investitionen.

Die Angreifer können warten. Die Config-Datei nicht.


Bei NameOcean wissen wir, dass Verfügbarkeit zählt. Unsere Infrastruktur ist von Grund auf auf Resilienz ausgelegt, denn wir wissen: Der beste Angriff ist eine solide Verteidigung – gegen externe Bedrohungen ebenso wie gegen interne operative Risiken.

Read in other languages:

RO EL RU DA BG CS UZ TR SV PT FI IT NB PL ES ZH-HANS NL FR HU EN