Tornar al Blog

Van caure sis serveis de Microsoft 365 alhora. Per al teu pla de continuïtat són un de sol

Quadre elèctric general obert en una cambra d'instal·lacions, amb fileres de magnetotèrmics idèntics penjant tots d'un mateix interruptor principal

L'incident de dilluns es va acabar emportant sis serveis que tu tens anotats per separat: Exchange Online, SharePoint Online, OneDrive, Teams, Purview i Microsoft Defender XDR. Comparteixen una peça d'autenticació per sota, i aquesta llista de sis noms és allò més útil que ha sortit de la nit de dilluns. Te l'han donada gratis i diu quines files del teu pla de continuïtat no són independents entre elles. Una d'elles, la que menys gent mirarà, és la consola amb què vigiles.

Les hores, incloses les que no quadren

Microsoft va començar a investigar «un augment de reports d'usuaris sobre problemes d'Exchange Online» a les 11:55 UTC de dilluns 31 d'agost, les 13:55 hora peninsular. Quan el problema va deixar de ser només d'Exchange, el cas es va seguir amb un altre identificador, MO1465074, al qual Microsoft va posar com a hora oficial d'inici les 15:08 UTC.

Aquí cal aturar-se, perquè les fonts no quadren i una cronologia neta seria més còmoda que honesta. BleepingComputer dóna les 17:30 UTC com el moment en què Microsoft va reconèixer l'incident EX1464935 sobre Exchange Online; Computerworld situa el primer missatge d'investigació cinc hores i mitja abans. Les dues coses poden ser certes —una és quan comença a comptar el rellotge del proveïdor, l'altra quan se'n va assabentar la majoria de la gent— però no són la mateixa hora, i triar la que quedi millor per al relat seria fer trampa. Si necessites l'hora exacta per a un informe intern, agafa-la del centre d'administració del teu inquilí i no de la premsa, aquesta pàgina inclosa.

El que sí que és consistent és la seqüència de diagnòstics. Primer, que havien aïllat «un patró de fallada comú a les peticions afectades d'Exchange Online, associat a l'autenticació i a la connectivitat de protocol». Després, més precís: «problemes relacionats amb una configuració d'autenticació de nucli feta servir per múltiples serveis interns dins de la infraestructura d'Exchange Online». I la mitigació, a mà i servidor per servidor: «estem fent una prova manual a nivell de servidor individual per restablir configuracions i validar si això resol el problema». Aleshores la llista ja incloïa OneDrive per a l'Empresa, SharePoint Online, Teams, Purview i Defender XDR.

La tornada del flux de correu té el mateix problema de rellotges: Computerworld la situa «a última hora de dilluns» i el darrer missatge de restauració que recull BleepingComputer és de les 03:43 hora de l'est dels EUA, ja dimarts. El que no discuteix ningú és que la cerca continuava trencada dimarts.

Hi ha un detall en aquestes hores que convé retenir per motius pràctics: l'hora oficial d'inici que Microsoft va posar a l'incident ampliat, les 15:08, és anterior a l'hora en què la majoria de cobertures diuen que el va reconèixer. El rellotge que compta per al proveïdor és el seu, i el lloc on està escrit és el teu centre d'administració. Si en algun moment has de reclamar, justificar un retard davant d'un client o simplement explicar a la teva direcció què va passar dilluns, exporta l'historial de l'incident mentre encara hi sigui. És una captura de pantalla i cinc minuts, i és l'única versió que després ningú no et discuteix.

Ningú no ha confirmat que fos un certificat caducat

El titular d'aquella nit va ser que a Microsoft se li havia oblidat renovar un certificat. La cadena real és aquesta: durant la caiguda, alguns usuaris es van trobar un missatge d'error de client que citava una empremta concreta —19F04B8A233DD9CE916F118056D224A1751729EA— i deia que estava caducada; un blog alemany ho va publicar aquella mateixa nit, i d'aquí va sortir tota la resta. Microsoft no ha dit això en cap moment. Ha dit «configuració d'autenticació». Pot acabar sent el mateix, o el certificat pot haver estat un símptoma.

No ho afirmarem, perquè no està afirmat. I tant se val per al que ve després: un certificat que venç i una configuració d'autenticació mal aplicada pertanyen a la mateixa família, la de la peça compartida que decideix si les altres poden parlar entre elles. Quan surti l'anàlisi definitiva canviarà el comunicat tècnic, i no canviarà res del que tu hauries de mirar demà.

Sis files del teu pla, una sola peça

Obre el teu pla de continuïtat, si el tens escrit. És molt probable que el correu, la intranet documental, la missatgeria i la consola de seguretat ocupin files diferents, cadascuna amb la seva criticitat i el seu temps de recuperació. Estan en files diferents perquè per a qui treballa són quatre coses distintes: quatre logins i quatre maneres de treballar. Per sota eren una de sola, i dilluns es va veure.

Això té una conseqüència aritmètica. Multiplicar disponibilitats per concloure que «és impossible que caiguin totes dues alhora» només funciona si totes dues són independents. Un compromís de servei se signa per servei i no diu res sobre la correlació entre ells. Dilluns la fallada era per sota del nivell al qual s'escriuen aquests compromisos, així que cap dels sis no et protegia dels altres cinc.

Que consti que consolidar l'autenticació no és un error de disseny de Microsoft. És el que recomanem gairebé sempre: menys superfície, un sol lloc on aplicar política, una sola cosa a auditar. Qui et digui que ell ho té tot separat probablement tingui el problema repartit en comptes de resolt. El preu d'aquesta decisió és exactament el que es va veure dilluns, i es paga sencer de cop.

Abans que algú tregui la conclusió fàcil: això tampoc no és un argument contra el cloud. La versió local de la mateixa fallada existeix i és pitjor. Un certificat de la federació d'identitat que venç un diumenge a la nit deixa fora el correu, la intranet, les aplicacions internes i —el més divertit— el panell des del qual l'anaves a arreglar, perquè també autentica contra el mateix. La diferència no és a l'arquitectura, que és idèntica; és que allà no hi ha pàgina d'estat, no hi ha ningú a qui trucar i el rellotge el comptes tu a les tres de la matinada. El que canvia en pujar a un proveïdor gran és qui paga la guàrdia, no si existeix la peça compartida.

El panell al qual acudeixes quan alguna cosa va malament era dins d'allò que anava malament

Torna a la llista de sis. Quatre d'aquests noms són eines de treball i es troben a faltar de seguida. Els altres dos, Microsoft Defender XDR i Microsoft Purview, no els fa servir ningú per escriure un correu: són la consola de seguretat i la capa de compliment i auditoria. Van estar degradats durant la mateixa finestra en què desenes de milers de clients reintentaven autenticar-se en bucle.

Convé ser exacte amb el poc que se sap. «Degradat» no és «apagat», i Microsoft no va detallar quina part de cada producte ho estava: pot ser la consola, pot ser una integració, pot ser només la cerca dins del portal. Els sensors que recullen telemetria als equips no depenen que tu puguis obrir el panell, així que el raonable és assumir que es va continuar recollint. El que s'atura quan el panell va a batzegades és la part humana: mirar la cua d'incidents, llançar una consulta i decidir.

Que quedi clar el que no estem dient: no hi ha ni un indici públic que ningú aprofités aquella finestra, i no ho insinuarem per donar emoció al paràgraf. El que assenyalem és més avorrit i més útil. Un pic de fallades d'autenticació és exactament el que produeix una caiguda com aquesta, i també exactament el que produeix un atac d'ompliment de credencials. L'eina amb què es distingeixen les dues coses —i la que després et deixa reconstruir què va passar de veritat— era a la mateixa llista que l'avaria.

La versió domèstica d'això es comprova en deu minuts i és la que ens trobem més vegades: el sistema que t'avisa sol viure dins del sistema que vigila. Si el teu monitoratge envia les alertes pel correu del proveïdor que acaba de caure, aquell dia no t'assabentes de res més, i és just el dia en què l'alerta importava. El mateix amb el centre d'administració: és on es publica l'incident i viu dins del mateix inquilí. El criteri que en traiem, i que apliquem quan es munta vigilància gestionada, és que ni el canal d'avís ni el destí de la telemetria haurien de dependre d'allò que estan vigilant.

Sobre el pla B per al correu, en curt

És la proposta que apareix sempre a les quaranta-vuit hores, i ja vam dedicar un post sencer a per què muntar una segona suite «per si de cas» rarament surt a compte; no ho repetirem aquí. El que dilluns hi afegeix és una pregunta que aquell post no feia, i que decideix tota sola si el pla B serveix d'alguna cosa: contra quina identitat s'autentica? Si és contra el mateix directori, cau amb tu i tant se val el que costi. N'hi ha que porten credencials pròpies precisament per a aquest escenari; comprova quin t'estan venent abans de mirar el preu.

El segon dia és el que surt car

Recuperar el flux de correu és el visible. El que es va emportar les hores de feina va ser dimarts: la cerca continuava degradada a Exchange Online, SharePoint Online, OneDrive i Teams —quatre productes— i fallaven a més els prompts de Microsoft 365 Copilot que necessiten dades de Microsoft 365. La gent no podia trobar l'adjunt de fa tres setmanes ni l'històric d'una conversa, i algunes organitzacions continuaven drenant cues de correu endarrerit. Fa unes setmanes vam escriure sobre un cercador trencat que per al compromís de servei no era una caiguda, i aquí torna a passar: la degradació llarga i parcial no compta al comptador i sí que compta a la nòmina.

Quan això no va amb tu

Si sou vint persones i el correu pot estar tres hores aturat sense que caigui cap compromís amb un client, no facis res d'això. Anota la data, apunta què va deixar de funcionar i continua amb el teu. La conversa canvia quan el correu és on entren les comandes, quan hi ha una obligació contractual de respondre en un termini o quan el sector t'exigeix demostrar que tens un pla de continuïtat. I canvia també, encara que sigueu vint, si resulta que la vostra consola de seguretat depèn del mateix lloc que el vostre correu: això convé saber-ho un dimarts qualsevol i no el dia que faci falta. Nosaltres no podem arreglar un certificat de Microsoft, i qui insinuï el contrari ven fum; el que fa un servei de suport 24x7 a dos quarts de vuit del vespre d'un dilluns d'agost és notar-ho abans que els teus usuaris i decidir ràpid si el problema és teu. Muntar arquitectura per a un esdeveniment de dues hores l'any és una manera cara de sentir-se tranquil.

Fonts (verificades l'1 de setembre de 2026): identificadors EX1464935 i MO1465074, hora de reconeixement (17:30 UTC), llista dels sis serveis afectats i les tres cites literals de Microsoft — BleepingComputer, 31-ag.-2026; hores d'11:55 i 15:08 UTC, recuperació del correu «a última hora de dilluns» i degradació de la cerca al segon dia a Exchange Online, SharePoint Online, OneDrive i Teams més els prompts de Copilot que requereixen dades de M365 — Computerworld, 1-set.-2026; missatge d'error de client amb l'empremta del certificat — Born's Tech and Windows World, 31-ag.-2026. Les hores de les dues primeres fonts no coincideixen i el post ho diu en comptes de triar-ne una. Criteri propi, no fet reportat: la lectura de la llista de serveis com a mapa de dependències compartides, l'observació sobre Defender XDR i Purview, i la regla que el canal d'avís i el destí de la telemetria no depenguin d'allò vigilat. Microsoft no ha confirmat la causa arrel com un certificat caducat.

Sabries dir quines parts del teu pla depenen de la mateixa peça?

A everyWAN dissenyem, desplegem i mantenim infraestructura per a empreses, amb serveis gestionats 24/7, i apliquem el principi que el canal d'avís no depengui d'allò vigilat. Si vols que algú repassi el teu mapa de dependències amb aquesta llista de sis noms al davant, en parlem.

Parlar amb everyWAN

Etiquetes:

Compartir:

Subscriu-te al nostre butlletí

Per rebre històries del món IT, novetats d'everyWAN i ofertes exclusives per a subscriptors, dona't d'alta a la nostra llista de correu

everyWAN
everyWAN