Un disc es mor un dimarts a la tarda. El clúster ni s'immuta: continua servint, ningú a l'oficina no se n'assabenta, salta un avís al panell. Això és exactament el que vas pagar quan vas pagar per redundància. Però el que vas comprar no és immunitat: és temps. Un marge per posar un disc nou abans no es mori el següent. I aquest marge es va calcular suposant que el recanvi arriba demà.
El 2026 ja no arriba demà. I no hem canviat res del disseny: els mateixos discos, la mateixa rèplica, la mateixa cabina. L'únic que s'ha mogut és el calendari d'una compra. Resulta que aquell calendari era un paràmetre de disseny i feia vint anys que el tractàvem com una nota al peu.
La redundància no compra immunitat: compra una finestra
L'eix de sempre: la fallada és inevitable, l'avaria és una decisió de disseny. Amb les dades en un sol disc totes dues coses són la mateixa; amb les dades replicades en tres màquines, el mateix disc mort no arriba a la planta de baix.
La lletra petita, que expliquem menys, és que aquella decisió de disseny té data de caducitat. Mentre estàs amb una rèplica menys, el sistema ha gastat una de les seves vides. Si la següent fallada cau dins d'aquesta finestra i toca el lloc equivocat, tornes a tenir una avaria. Tot el càlcul de redundància —RAID, rèplica 3, erasure coding, el node de més al clúster— és en realitat una aposta sobre quant trigues a reposar. El nom tècnic és temps mitjà de reparació, i qualsevol disseny raonable de l'última dècada ha donat per fet que són hores o, com a molt, un parell de dies.
Els discos d'aquest any ja estan venuts
No cal creure's cap analista: ho diuen els mateixos fabricants a les seves presentacions de resultats. Western Digital va declarar el 29 de gener, a la del seu segon trimestre fiscal, que estava «pràcticament venut per a l'any natural 2026», amb comandes en ferm dels seus set clients més grans per a tot l'any; en aquella mateixa presentació va afegir que ja tenia acords a llarg termini tancats amb dos d'aquells set clients per al 2027 i amb un per al 2028. Seagate va dir a la seva que la seva capacitat nearline —la dels discos d'alta capacitat que acaben en cabines i clústers— estava «completament assignada per a l'any natural 2026» i que començaria a acceptar comandes del primer semestre del 2027 els mesos següents.
Qui ha comprat aquesta producció no és la pime industrial del costat: són els grans operadors de núvol omplint centres de dades d'IA. Al comerç alemany, els preus de disc dur van pujar entre un 20 % i un 50 % respecte a mitjans del 2025, i els SSD de fins a 2 TB al voltant d'un 50 % des de l'estiu del 2025. En contractes, TrendForce preveia per al tercer trimestre del 2026 pujades del 13 % al 18 % trimestre contra trimestre en DRAM convencional i del 10 % al 15 % en NAND. És el mateix fenomen que ja et vam explicar amb el preu de la memòria de servidor, només que ara li ha tocat a l'emmagatzematge.
El matís honest: aquests percentatges són observacions de mercat, no el teu pressupost. El teu preu i el teu termini depenen del teu canal, del teu volum i de si el teu model concret és a la llista d'algú. El que importa aquí no és el tant per cent exacte, sinó que el termini de lliurament ha deixat de ser constant.
Del costat de la finestreta hi ha una foto bastant clara. En una enquesta d'Omdia a 186 partners feta el març del 2026, més del 90 % va declarar retards en els lliuraments dels seus fabricants, més del 70 % pujades de preu ja aplicades en PC, servidor i emmagatzematge, i més del 80 % que les ofertes els caduquen en menys de 30 dies. Aquest últim número és el que més cou en una compra d'urgència: el preu que et passen avui no et serveix el mes vinent.
La mateixa cabina, 66 vegades més risc
Posem-hi números, que és l'únic que convenç un comitè. Agafem un grup de 24 discos del qual un acaba de morir: en queden 23 girant. Per a la taxa de fallada fem servir la que publica Backblaze, que és de les poques xifres de camp obertes i auditables del sector: al seu informe del primer trimestre del 2026, amb 341.263 discos analitzats, la taxa anualitzada de fallada trimestral va ser de l'1,24 % i l'acumulada de per vida es manté en l'1,39 %. Fem servir l'1,39 %, que és la més conservadora de les dues.
Un avís abans de continuar, perquè si no el càlcul s'aplica on no toca: això val per a un grup RAID sense disc de reserva, o per a un clúster que ja no té espai lliure on recol·locar la còpia que falta. Si el teu Ceph té capacitat lliure, el disc mort es recupera sol en hores sobre un altre OSD del mateix host i el termini del distribuïdor no et toca la finestra —ho vam explicar fa uns dies, i la capacitat lliure real la marca el disc més ple, no la mitjana—. El termini de lliurament mana en dos casos: quan no queda espai on reconstruir i quan el que es mor és el node sencer.
- →Recanvi en 48 hores: la probabilitat que un altre dels 23 discos falli abans de la reparació és del 0,18 %. Un de cada 571 incidents. Paperassa, com dèiem.
- →Recanvi en 20 setmanes: la mateixa probabilitat puja a l'11,5 %. Un de cada 8,7. Amb el mateix disseny, els mateixos discos i els mateixos diners gastats.
- →Són 66 vegades més risc per una variable que no surt en cap diagrama d'arquitectura. Ni tan sols amb els discos de més de 20 TB, que Backblaze situa en un 0,85 % anualitzat sobre més de 86.000 unitats encara joves, baixa del 7,2 %: un de cada catorze.
Convé veure per què surt 66 i no una altra cosa, perquè el número té menys màgia de la que sembla: a probabilitats tan baixes el risc és gairebé lineal en el temps, així que multiplicar l'espera per 70 multiplica el risc per 66. L'interessant no és el factor, és que una variable que donaves per constant s'ha mogut dos ordres de magnitud. (I si divideixes els percentatges arrodonits et sortirà 64: el 66 està calculat sense arrodonir.)
L'aritmètica és deliberadament simple i convé dir on coixeja. Suposa que les fallades són independents i que la taxa és constant, i això és optimista: l'estudi clàssic de Schroeder i Gibson sobre uns 100.000 discos en producció va trobar que les fallades no s'ajusten a una distribució exponencial, que hi ha autocorrelació significativa en finestres de fins a 30 setmanes i que les taxes de substitució reals anaven del 2 % al 4 % anual —fins al 13 % en algun sistema— davant del 0,58-0,88 % que prometien les fitxes tècniques. Traduït: els discos del mateix lot, amb la mateixa edat i la mateixa temperatura, tendeixen a morir-se a prop els uns dels altres. La xifra real d'un armari concret és pitjor que la nostra, no millor. I les xifres de Backblaze són d'una flota enorme en un centre de dades ben governat; el teu rack pot tenir una altra temperatura, una altra qualitat elèctrica i una altra vibració. Nosaltres no publiquem una taxa pròpia, així que no la inventem.
On fa mal de debò no és el disc: és el node
Un disc encara el pots tenir a l'armari. Un servidor sencer, no. I aquí és on l'escassetat mossega amb més força, perquè un node caigut no es reposa amb una peça: es reposa amb una compra, un muntatge i una posada en marxa. En un clúster Ceph de tres nodes amb size=3 i min_size=2, perdre un node deixa el clúster servint, sí, però sense cap lloc on recrear la tercera rèplica. Ja ho vam explicar fa uns dies: amb tres nodes el clúster no es cura, aguanta. Aguantar 48 hores és un pla perfectament raonable. Aguantar un trimestre és una altra conversa, i és una conversa que ara cal tenir abans de dibuixar el disseny, no després.
Dit en una frase: N+1 només és N+1 mentre el «+1» es pugui comprar. Si no es pot, el que tens és N i una promesa.
La retallada que no signa ningú: la retenció
Hi ha un segon efecte, més silenciós i més difícil de veure que el primer. La capacitat que no arriba no deixa un forat visible al rack: deixa una decisió petita presa per la persona que aquesta nit ha de fer que les còpies hi càpiguen. S'escurça la retenció de 90 a 30 dies. Es treu una còpia setmanal. Es deixa de copiar un repositori «que gairebé ningú fa servir». Ningú no ho porta a un comitè perquè no sembla un canvi de política, sembla manteniment.
I sí que ho és. La retenció és la teva finestra de recuperació: és el nombre de dies que pots retrocedir quan descobreixes que alguna cosa fa setmanes que està corrompuda o xifrada. Escurçar-la per falta de disc és una decisió de risc presa per motius de magatzem. No diem que no es pugui prendre —de vegades és l'única sortida sensata—; diem que s'escrigui, amb data, amb qui la va prendre i què s'hi perd. Si l'escassetat t'ha de retallar el pla de recuperació davant de desastres, que sigui a la vista.
El que preguntem ara abans de signar un disseny
- El termini real de LA TEVA referència, per escrit i amb data. No el del catàleg ni el del «sol trigar». El del model exacte que necessitaries demà, demanat al teu distribuïdor i desat en un correu.
- El contracte de suport inclou la peça o només la mà d'obra? Un «següent dia laborable» és tan bo com el magatzem que hi ha al darrere. Pregunta explícitament què passa si la peça no és en estoc i demana la resposta per escrit.
- Compta recanvis per domini de fallada, no en total. Quatre discos de recanvi serveixen de poc si són del model que no munta la cabina que més t'importa.
- Redueix el nombre de models diferents. Un recanvi que val per a vuit màquines cobreix més risc per euro que vuit recanvis diferents. L'homogeneïtat, que en altres coses és avorrida, aquí es tradueix en diners.
- Escriu la política de mode degradat. Què s'apaga, què es mou i què s'accepta mentre esperes. Decidir-ho el dia de la fallada, amb el telèfon sonant, és decidir-ho malament.
- Recalcula la finestra completa: temps de compra més temps de reconstrucció. Aquesta suma és la que va al pla de continuïtat. La que tens escrita avui, gairebé segur, només duu la segona meitat.
Quan això no va amb tu
Si sou deu persones, un servidor i les còpies van a un lloc que no administres tu, no compris un armari de recanvis: no té sentit immobilitzar diners en peces per a una màquina. La teva pregunta és una altra, i és més curta: quant triga el teu proveïdor a donar-te una màquina equivalent, i si això està signat en algun lloc o és un costum. Si el maquinari el posa ell —en colocation o en un servei gestionat—, el recanvi és el seu problema, però el termini continua sent teu: demana-l'hi.
I tampoc no és un argument per sortir corrents cap al núvol públic. Els qui han comprat els discos del 2026 i el 2027 són precisament els grans operadors de núvol: el cost de l'escassetat és dins de la seva tarifa, només que no el veus com una factura de maquinari sinó com un preu per gigabyte que no baixa. És una decisió legítima, però és una decisió de cost i de control, no una sortida màgica d'aquesta situació; els comptes a cinc anys ja els vam fer aquí i no guanya sempre el mateix costat.
Diem tot això sabent de quin costat cobrem: dissenyem i operem infraestructura per a altres empreses, així que un post que acaba en «revisa el teu disseny» ens afavoreix. Per això el contrapès: si ja tens escrit el termini de la teva referència crítica i tens els recanvis que aquell termini exigeix, ja has fet la part difícil i no necessites ningú. El problema el té qui descobreix el termini el dia que truca al distribuïdor amb un disc mort a la mà.
El que no afirmem
- ✗No diem que el teu termini siguin 20 setmanes. Fem servir 20 setmanes com a cas intermedi i deliberadament prudent: s'ha arribat a informar de comandes de disc empresarial amb dos anys d'espera, i més del 90 % dels partners enquestats per Omdia declara retards. El teu termini exacte el té el teu distribuïdor, no nosaltres.
- ✗No diem que els fabricants estiguin racionant. Diuen als seus resultats que la capacitat està compromesa amb contractes signats. És un fet comercial, no una conspiració.
- ✗L'11,5 % no és una predicció sobre la teva cabina. És el resultat d'un model simple amb supòsits declarats i una taxa de fallada aliena. Serveix per comparar dos escenaris entre si, no per prometre res.
Fonts (verificades el 29 de setembre de 2026): declaracions de Western Digital («pràcticament venut per a l'any natural 2026», comandes en ferm amb els seus set clients més grans) i de Seagate (capacitat nearline «completament assignada per a l'any natural 2026» i obertura de comandes per al primer semestre del 2027), juntament amb les pujades de preu al comerç alemany (20-50 % en disc dur respecte a mitjans del 2025; ~50 % en SSD de fins a 2 TB des de l'estiu del 2025) — heise online, «WD and Seagate confirm: Hard drives for 2026 sold out» (16-02-2026), que recull les presentacions de resultats de tots dos fabricants; la de Western Digital es va celebrar el 29-01-2026 (segon trimestre fiscal, agenda publicada a investor.wdc.com) i és on es van anunciar els acords a llarg termini amb dos dels seus set clients més grans per al 2027 i amb un per al 2028 — Tom's Hardware; terminis de lliurament de disc empresarial de fins a dos anys — Tom's Hardware, «Hard drives on backorder for two years»; previsió de preus de contracte per al 3T26 (DRAM convencional +13-18 % intertrimestral, NAND +10-15 %) — TrendForce (03-07-2026); enquesta d'Omdia a 186 partners feta el març del 2026 (més del 90 % amb retards de lliurament, més del 70 % amb pujades de preu ja aplicades, més del 80 % amb ofertes que caduquen en menys de 30 dies) — Channel Dive, «Hardware price hikes accelerate amid supply chain disruptions» (24-03-2026); taxes de fallada de camp (341.263 discos analitzats, 1,24 % anualitzat trimestral, 1,39 % de per vida, i 0,85 % als discos de més de 20 TB, que el mateix Backblaze descriu com «encara joves») — Backblaze Drive Stats Q1 2026, amb el recompte de més de 86.000 unitats a la nota de premsa del 09-07-2026; absència d'ajust exponencial, autocorrelació de fallades fins a 30 setmanes i taxes de substitució del 2-4 % anual (13 % en un sistema) davant del 0,58-0,88 % de les fitxes tècniques, sobre uns 100.000 discos — Schroeder i Gibson, «Disk failures in the real world», USENIX FAST 2007. Els percentatges de probabilitat són càlcul propi amb la fórmula de supervivència exponencial sobre 23 discos i la taxa de l'1,39 % (i del 0,85 % a la variant); els supòsits estan declarats al text.
Quants recanvis hi ha ara mateix al teu armari?
Revisem el teu disseny de redundància amb el termini de lliurament real al davant, revisem els recanvis que hi ha per domini de fallada i posem per escrit la política de mode degradat abans que calgui.
Parlar amb everyWAN