Yandex Cloud gioca a ‘Rubik’ con i suoi Data Center (e stavolta ha perso)

Yandex Cloud gioca a 'Rubik' con i suoi Data Center (e stavolta ha perso)

Guardate che la storia si ripete, e non è la parte divertente di un film di Christopher Nolan.

Se pensate che i grandi provider cloud siano delle fortezze digitali inespugnabili, lasciate che vi riporti alla realtà con un piccolo aggiornamento dal fronte russo. Il terzo data center di Yandex Cloud ha deciso di prendersi una pausa non programmata, unendosi alla lista dei servizi che, per un po’, hanno smesso di rispondere ai ping. Non è stata una singola ondata di malocchio, ma un vero e proprio effetto domino che ha colpito un terzo nodo della loro infrastruttura.

Per chi non mastica quotidianamente i report di status, la cosa non è solo un ‘momento di downtime’. Quando parliamo di cloud, la parola d’ordine dovrebbe essere ‘resilienza’. L’idea è che se un pezzo della macchina si rompe, gli altri devono saper gestire il carico senza che l’utente finale si accorga di nulla. Ma qui sembra che la configurazione di failover sia rimasta ferma ai tempi del modem 56k. Quando scatta un incidente su un singolo nodo, è normale. Quando il terzo data center cade, significa che c’è qualcosa di strutturale che non va nel modo in cui i dati vengono replicati o orchestrati.

Certo, noi qui in Italia viviamo in una bolla geografica e, onestamente, se un server a Mosca o San Pietroburgo va in tilt, le nostre pipeline di CI/CD o i nostri piccoli server casalinghi non ne risentono direttamente. Però, il principio è universale per chiunque faccia computing: la dipendenza da un unico ecosistema proprietario è una trappola mortale. È lo stesso discorso di quando ti ritrovi incastrato in un ecosistema dove, se il vendor decide di cambiare le regole o, peggio, ha un problema hardware massivo, tu sei lì a guardare il monitor che non risponde, sperando che la magia della ridondanza faccia il suo dovere.

Non stiamo parlando di una ‘feature’ per testare la pazienza degli amministratori di sistema, ma di un segnale d’allarme. Vedere cadere pezzi di infrastruttura in sequenza fa capire quanto sia fragile l’illusione della ‘cloud immutabile’. Se non hai un piano di disaster recovery che preveda scenari da film katastrofico, stai solo pregando. E come sappiamo bene, il codice non risponde mai alle preghiere, solo ai commit ben fatti e a una buona documentazione.

Insomma, un altro promemoria per tutti noi: non fidatevi mai ciecamente dell’hype sulla disponibilità al 99.99%. Sotto la superficie di quei dashboard colorati, ci sono sempre cavi che possono bruciare e switch che possono impazzire. Restate critici, restate offline (quando serve) e, soprattutto, tenete sempre un backup altrove.

Source: 3rd Yandex Cloud Data Center Was Hit

Lascia un commento