Un disco se muere un martes por la tarde. El cluster ni se despeina: sigue sirviendo, nadie en la oficina se entera, salta un aviso en el panel. Eso es exactamente lo que pagaste cuando pagaste por redundancia. Pero lo que compraste no es inmunidad: es tiempo. Un margen para poner un disco nuevo antes de que se muera el siguiente. Y ese margen se calculó suponiendo que el repuesto llega mañana.
En 2026 ya no llega mañana. Y no hemos cambiado nada del diseño: los mismos discos, la misma réplica, la misma cabina. Lo único que se ha movido es el calendario de una compra. Resulta que ese calendario era un parámetro de diseño y llevábamos veinte años tratándolo como una nota al pie.
La redundancia no compra inmunidad: compra una ventana
El eje de siempre: el fallo es inevitable, la avería es una decisión de diseño. Con los datos en un solo disco las dos cosas son la misma; con los datos replicados en tres máquinas, el mismo disco muerto no llega a la planta de abajo.
La letra pequeña, que contamos menos, es que esa decisión de diseño tiene fecha de caducidad. Mientras estás con una réplica menos, el sistema ha gastado una de sus vidas. Si el siguiente fallo cae dentro de esa ventana y toca el sitio equivocado, vuelves a tener una avería. Todo el cálculo de redundancia —RAID, réplica 3, erasure coding, el nodo de más en el cluster— es en realidad una apuesta sobre cuánto tardas en reponer. El nombre técnico es tiempo medio de reparación, y cualquier diseño razonable de la última década ha dado por hecho que son horas o, como mucho, un par de días.
Los discos de este año ya están vendidos
No hace falta creerse a ningún analista: lo dicen los propios fabricantes en sus conferencias de resultados. Western Digital declaró el 29 de enero, en la de su segundo trimestre fiscal, que estaba «prácticamente vendido para el año natural 2026», con pedidos en firme de sus siete mayores clientes para todo el año; en esa misma llamada añadió que ya tenía acuerdos a largo plazo cerrados con dos de esos siete clientes para 2027 y con uno para 2028. Seagate dijo en la suya que su capacidad nearline —la de los discos de alta capacidad que acaban en cabinas y clusters— estaba «completamente asignada para el año natural 2026» y que empezaría a aceptar pedidos del primer semestre de 2027 en los meses siguientes.
Quien ha comprado esa producción no es la pyme industrial de al lado: son los grandes operadores de nube llenando centros de datos de IA. En el comercio alemán, los precios de disco duro subieron entre un 20 % y un 50 % respecto a mediados de 2025, y los SSD de hasta 2 TB alrededor de un 50 % desde el verano de 2025. En contratos, TrendForce preveía para el tercer trimestre de 2026 subidas del 13 % al 18 % trimestre contra trimestre en DRAM convencional y del 10 % al 15 % en NAND. Es el mismo fenómeno que ya te contamos con el precio de la memoria de servidor, solo que ahora le ha tocado al almacenamiento.
El matiz honesto: esos porcentajes son observaciones de mercado, no tu presupuesto. Tu precio y tu plazo dependen de tu canal, de tu volumen y de si tu modelo concreto está en la lista de alguien. Lo que importa aquí no es el tanto por ciento exacto, sino que el plazo de entrega ha dejado de ser constante.
Del lado de la ventanilla hay una foto bastante clara. En una encuesta de Omdia a 186 partners hecha en marzo de 2026, más del 90 % declaró retrasos en las entregas de sus fabricantes, más del 70 % subidas de precio ya aplicadas en PC, servidor y almacenamiento, y más del 80 % que las ofertas les caducan en menos de 30 días. Ese último número es el que más escuece en una compra de urgencia: el precio que te pasan hoy no te sirve el mes que viene.
La misma cabina, 66 veces más riesgo
Pongamos números, que es lo único que convence a un comité. Tomamos un grupo de 24 discos del que uno acaba de morir: quedan 23 girando. Para la tasa de fallo usamos la que publica Backblaze, que es de las pocas cifras de campo abiertas y auditables del sector: en su informe del primer trimestre de 2026, con 341.263 discos analizados, la tasa anualizada de fallo trimestral fue del 1,24 % y la acumulada de por vida se mantiene en el 1,39 %. Usamos el 1,39 %, que es la más conservadora de las dos.
Un aviso antes de seguir, porque si no el cálculo se aplica donde no toca: esto vale para un grupo RAID sin disco de reserva, o para un cluster que ya no tiene hueco libre donde recolocar la copia que falta. Si tu Ceph tiene capacidad libre, el disco muerto se recupera solo en horas sobre otro OSD del mismo host y el plazo del distribuidor no te toca la ventana —lo contamos hace unos días, y la capacidad libre real la marca el disco más lleno, no la media—. El plazo de entrega manda en dos casos: cuando no queda hueco donde reconstruir y cuando lo que se muere es el nodo entero.
- →Repuesto en 48 horas: la probabilidad de que otro de los 23 discos falle antes de la reparación es del 0,18 %. Uno de cada 571 incidentes. Papeleo, como decíamos.
- →Repuesto en 20 semanas: la misma probabilidad sube al 11,5 %. Uno de cada 8,7. Con el mismo diseño, los mismos discos y el mismo dinero gastado.
- →Son 66 veces más riesgo por una variable que no aparece en ningún diagrama de arquitectura. Ni siquiera con los discos de más de 20 TB, que Backblaze sitúa en un 0,85 % anualizado sobre más de 86.000 unidades todavía jóvenes, baja del 7,2 %: uno de cada catorce.
Conviene ver por qué sale 66 y no otra cosa, porque el número tiene menos magia de la que parece: a probabilidades tan bajas el riesgo es casi lineal en el tiempo, así que multiplicar la espera por 70 multiplica el riesgo por 66. Lo interesante no es el factor, es que una variable que dabas por constante se ha movido dos órdenes de magnitud. (Y si divides los porcentajes redondeados te saldrá 64: el 66 está calculado sin redondear.)
La aritmética es deliberadamente simple y conviene decir dónde cojea. Supone que los fallos son independientes y que la tasa es constante, y eso es optimista: el estudio clásico de Schroeder y Gibson sobre unos 100.000 discos en producción encontró que los fallos no se ajustan a una distribución exponencial, que hay autocorrelación significativa en ventanas de hasta 30 semanas y que las tasas de sustitución reales iban del 2 % al 4 % anual —hasta el 13 % en algún sistema— frente al 0,58-0,88 % que prometían las fichas técnicas. Traducido: los discos del mismo lote, con la misma edad y la misma temperatura, tienden a morirse cerca unos de otros. El número real de un armario concreto es peor que el nuestro, no mejor. Y las cifras de Backblaze son de una flota enorme en un centro de datos bien gobernado; tu rack puede tener otra temperatura, otra calidad eléctrica y otra vibración. Nosotros no publicamos una tasa propia, así que no la inventamos.
Donde duele de verdad no es el disco: es el nodo
Un disco todavía puedes tenerlo en el armario. Un servidor entero, no. Y ahí es donde la escasez muerde con más fuerza, porque un nodo caído no se repone con una pieza: se repone con una compra, un montaje y una puesta en marcha. En un cluster Ceph de tres nodos con size=3 y min_size=2, perder un nodo deja el cluster sirviendo, sí, pero sin ningún sitio donde recrear la tercera réplica. Ya lo contamos hace unos días: con tres nodos el cluster no se cura, aguanta. Aguantar 48 horas es un plan perfectamente razonable. Aguantar un trimestre es otra conversación, y es una conversación que ahora hay que tener antes de dibujar el diseño, no después.
Dicho en una frase: N+1 solo es N+1 mientras el «+1» se pueda comprar. Si no se puede, lo que tienes es N y una promesa.
El recorte que no firma nadie: la retención
Hay un segundo efecto, más silencioso y más difícil de ver que el primero. La capacidad que no llega no deja un hueco visible en el rack: deja una decisión pequeña tomada por la persona que esta noche tiene que hacer que las copias quepan. Se acorta la retención de 90 a 30 días. Se quita una copia semanal. Se deja de copiar un repositorio «que casi nadie usa». Nadie lo lleva a un comité porque no parece un cambio de política, parece mantenimiento.
Y sí lo es. La retención es tu ventana de recuperación: es el número de días que puedes retroceder cuando descubres que algo lleva semanas corrompido o cifrado. Acortarla por falta de disco es una decisión de riesgo tomada por motivos de almacén. No decimos que no se pueda tomar —a veces es la única salida sensata—; decimos que se escriba, con fecha, con quién la tomó y con qué se pierde. Si la escasez te va a recortar el plan de recuperación ante desastres, que sea a la vista.
Lo que preguntamos ahora antes de firmar un diseño
- El plazo real de TU referencia, por escrito y con fecha. No el del catálogo ni el de «suele tardar». El del modelo exacto que necesitarías mañana, pedido a tu distribuidor y guardado en un correo.
- ¿El contrato de soporte incluye la pieza o solo la mano de obra? Un «siguiente día laborable» es tan bueno como el almacén que hay detrás. Pregunta explícitamente qué pasa si la pieza no está en stock y pide la respuesta por escrito.
- Cuenta repuestos por dominio de fallo, no en total. Cuatro discos de repuesto sirven de poco si son del modelo que no monta la cabina que más te importa.
- Reduce el número de modelos distintos. Un repuesto que vale para ocho máquinas cubre más riesgo por euro que ocho repuestos distintos. La homogeneidad, que en otras cosas es aburrida, aquí es dinero.
- Escribe la política de modo degradado. Qué se apaga, qué se mueve y qué se acepta mientras esperas. Decidirlo el día del fallo, con el teléfono sonando, es decidirlo mal.
- Recalcula la ventana completa: tiempo de compra más tiempo de reconstrucción. Esa suma es la que va al plan de continuidad. La que tienes escrita hoy, casi seguro, solo lleva la segunda mitad.
Cuándo esto no va contigo
Si sois diez personas, un servidor y las copias van a un sitio que no administras tú, no compres un armario de repuestos: no tiene sentido inmovilizar dinero en piezas para una máquina. Tu pregunta es otra, y es más corta: cuánto tarda tu proveedor en darte una máquina equivalente, y si eso está firmado en algún sitio o es una costumbre. Si el hardware lo pone él —en colocation o en un servicio gestionado—, el repuesto es su problema, pero el plazo sigue siendo tuyo: pídeselo.
Y tampoco es un argumento para salir corriendo hacia la nube pública. Los que han comprado los discos de 2026 y 2027 son precisamente los grandes operadores de nube: el coste de la escasez está dentro de su tarifa, solo que no lo ves como una factura de hardware sino como un precio por gigabyte que no baja. Es una decisión legítima, pero es una decisión de coste y de control, no una salida mágica de esta situación; la cuenta a cinco años ya la hicimos aquí y no gana siempre el mismo lado.
Decimos todo esto sabiendo de qué lado cobramos: diseñamos y operamos infraestructura para otras empresas, así que un post que acaba en «revisa tu diseño» nos favorece. Por eso el contrapeso: si ya tienes escrito el plazo de tu referencia crítica y tienes los repuestos que ese plazo exige, ya has hecho la parte difícil y no necesitas a nadie. El problema lo tiene quien descubre el plazo el día que llama al distribuidor con un disco muerto en la mano.
Lo que no afirmamos
- ✗No decimos que tu plazo sean 20 semanas. Usamos 20 semanas como caso intermedio y deliberadamente prudente: se ha llegado a informar de pedidos de disco empresarial con dos años de espera, y más del 90 % de los partners encuestados por Omdia declara retrasos. Tu plazo exacto lo tiene tu distribuidor, no nosotros.
- ✗No decimos que los fabricantes estén racionando. Dicen en sus resultados que la capacidad está comprometida con contratos firmados. Es un hecho comercial, no una conspiración.
- ✗El 11,5 % no es una predicción sobre tu cabina. Es el resultado de un modelo simple con supuestos declarados y una tasa de fallo ajena. Sirve para comparar dos escenarios entre sí, no para prometer nada.
Fuentes (verificadas el 29 de septiembre de 2026): declaraciones de Western Digital («prácticamente vendido para el año natural 2026», pedidos en firme con sus siete mayores clientes) y de Seagate (capacidad nearline «completamente asignada para el año natural 2026» y apertura de pedidos para el primer semestre de 2027), junto con las subidas de precio en el comercio alemán (20-50 % en disco duro respecto a mediados de 2025; ~50 % en SSD de hasta 2 TB desde el verano de 2025) — heise online, «WD and Seagate confirm: Hard drives for 2026 sold out» (16-02-2026), que recoge las conferencias de resultados de ambos fabricantes; la de Western Digital se celebró el 29-01-2026 (segundo trimestre fiscal, agenda publicada en investor.wdc.com) y en ella se anunciaron los acuerdos a largo plazo con dos de sus siete mayores clientes para 2027 y con uno para 2028 — Tom's Hardware; plazos de entrega de disco empresarial de hasta dos años — Tom's Hardware, «Hard drives on backorder for two years»; previsión de precios de contrato para 3T26 (DRAM convencional +13-18 % intertrimestral, NAND +10-15 %) — TrendForce (03-07-2026); encuesta de Omdia a 186 partners realizada en marzo de 2026 (más del 90 % con retrasos de entrega, más del 70 % con subidas de precio ya aplicadas, más del 80 % con ofertas que caducan en menos de 30 días) — Channel Dive, «Hardware price hikes accelerate amid supply chain disruptions» (24-03-2026); tasas de fallo de campo (341.263 discos analizados, 1,24 % anualizado trimestral, 1,39 % de por vida, y 0,85 % en los discos de más de 20 TB, que el propio Backblaze describe como «todavía jóvenes») — Backblaze Drive Stats Q1 2026, con el recuento de más de 86.000 unidades en la nota de prensa del 09-07-2026; ausencia de ajuste exponencial, autocorrelación de fallos hasta 30 semanas y tasas de sustitución del 2-4 % anual (13 % en un sistema) frente al 0,58-0,88 % de las fichas técnicas, sobre unos 100.000 discos — Schroeder y Gibson, «Disk failures in the real world», USENIX FAST 2007. Los porcentajes de probabilidad son cálculo propio con la fórmula de supervivencia exponencial sobre 23 discos y la tasa del 1,39 % (y del 0,85 % en la variante); los supuestos están declarados en el texto.
¿Cuántos repuestos hay ahora mismo en tu armario?
Revisamos tu diseño de redundancia con el plazo de entrega real delante, revisamos los repuestos que hay por dominio de fallo y ponemos por escrito la política de modo degradado antes de que haga falta.
Hablar con everyWAN