GitHub è andato in tilt: un mercoledì pomeriggio (non) da deploy tranquillo

GitHub è andato in tilt: un mercoledì pomeriggio (non) da deploy tranquillo

Speriamo che nessuno di voi avesse in programma un merge critico o un deploy d’emergenza proprio in queste ore, perché il destino — o forse un bug nel sistema di routing — ha deciso diversamente.

Se siete stati cercando di pushare codice, scaricare un repository o semplicemente capire perché la vostra dashboard sembra un sito web degli anni ’90 che non carica le immagini, non siete soli. GitHub ha deciso di alzare bandiera bianca con un incidente che sta facendo saltare i nervi a metà della comunità dev globale.

Il report ufficiale ci dice che stiamo assistendo a un tasso di errore del 20% sulle esperienze web e sulle API. Ma il vero dramma è per chi ha bisogno di recuperare i dati: i download di archivi e contenuti raw stanno toccando picchi del 50% di errore. Praticamente, metà delle volte che clicchi, il server ti risponde con un silenzio tombale o un errore criptico. E se pensavate che il problema fosse solo visivo, preparate il caffè: l’autenticazione SAML e OIDC è andata in vacca. Se la vostra azienda usa l’integrazione Single Sign-On per gestire i team, preparatevi a un pomeriggio passato a fissare lo schermo aspettando che il login funzioni.

Per chi non mastica il gergo enterprise, parliamo di un malfunzionamento che colpisce proprio i pilastri della gestione identità e sincronizzazione dei team. È quel classico scenario in cui tutto il muchachia tecnologico che abbiamo costruito attorno a un unico grande provider decide di collassare in modo coordinato.

Non è una notizia che riguarda solo la Silicon Valley; qui in Italia, dove spesso lavoriamo su progetti critici con workflow che dipendono totalmente da questi servizi, un downtime del genere significa ore di produttività bruciate e deadline che iniziano a ballare pericolosamente.

Al momento le indagini sono in corso. Non sappiamo ancora se sia un problema di infrastruttura, un aggiornamento andato male o se qualcuno abbia accidentalmente premuto il tasto ‘delete’ sul database centrale. L’unica cosa certa è che, finché non tornano i parametri normali, la nostra unica opzione è aspettare, sperando che il loro team DevOps sia più sveglio del nostro in questo momento. Nel frattempo, se avete un clone locale aggiornato, pregate che sia l’unica cosa che funziona ancora.

Source: Incident with Github.com

Lascia un commento