Tornar al Blog

Els dos cables del teu servidor van a la mateixa regleta

Els dos cables del teu servidor van a la mateixa regleta

El que compres quan contractes alimentació A+B no és que no se'n vagi la llum. És que puguin retirar mitja instal·lació elèctrica per mantenir-la un dimarts al matí sense que tu te n'assabentis. Aquesta promesa està escrita suposant una cosa del teu equipament que gairebé ningú comprova: que cada aparell té dos cables i que cada cable va per un camí diferent. A l'informe anual de caigudes del 2026 de l'Uptime Institute l'energia continua sent la primera causa de caigudes amb impacte, i dins d'ella manen els SAI, els commutadors de transferència i els generadors: el moment del canvi de camí. Justament el moment que el teu rack ha de travessar sense immutar-se.

Què compra exactament qui contracta A+B

La propietat que es ven es diu mantenibilitat concurrent, i és més modesta i més útil del que sembla: qualsevol component de capacitat i qualsevol element del camí de distribució es pot treure de servei de manera planificada sense que l'equipament informàtic ho noti. No parla de catàstrofes, sinó del calendari de manteniment, que és el que passa de debò diverses vegades l'any.

La lletra petita està publicada i és explícita. A la mateixa revista de l'Uptime Institute, l'article de referència sobre doble cable, del 2014, ho diu així: els dissenys de nivell III i IV «continue to be based upon the use of dual-corded architecture and require an active-active, dual-path distribution». I l'estàndard va preveure el cas dels aparells amb un nombre senar de cables amb una concessió concreta: un commutador de transferència muntat al mateix rack, col·locat tan a prop com sigui possible de l'equip. La concessió hi és perquè el problema és vell.

La redundància elèctrica és un contracte de dues signatures. El proveïdor posa dos camins independents fins a les dues regletes del teu rack. Tu poses els dos cables, un a cada regleta. Si falta la teva signatura, el contracte no es compleix i ningú t'avisa, perquè des del passadís el teu rack es veu exactament igual que el del veí que sí que ho va fer.

La fallada no apareix fins a la nit del manteniment

Un servidor amb les dues fonts endollades a la mateixa regleta funciona perfectament 364 dies l'any. S'encén, aguanta que se li mori una font, no dona cap alarma i passa qualsevol auditoria de paper: té dues fonts, els dos pilots estan verds, la fitxa diu «redundant». L'error només es manifesta el dia en què algú obre l'interruptor de la branca A. I aquell dia no és un dia de mala sort: és al correu que et van enviar amb quinze dies d'antelació.

Quanta gent ho té malament? L'única xifra publicada que hem trobat és antiga i el mateix autor la marca com a anecdòtica, així que la donem pel que és. A l'article citat, del 2014, l'Uptime Institute escriu: «Anecdotal evidence has shown 1-10% of servers in a data center may be improperly corded, i.e., both cords are plugged into the A distribution». Al mateix text, un operador de colocation estimava que «greater than 50% of our clients continue to deploy at least one or more single-corded devices». Dotze anys després no tenim cap número millor, i si algú el té ens interessa. El que sí que podem dir és que quan obrim una porta del darrere aquest ordre de magnitud no ens sembla exagerat. És una impressió, no una mesura, i així la donem.

El mateix article del 2014 explica que més de la meitat dels més de 5.000 incidents recollits a la base de dades d'incidències anòmales (AIRs) de la Uptime Institute Network tenen a veure amb el sistema de distribució crítica: la part que va del SAI cap avall, que és exactament on acaben els teus dos cables. No el generador èpic; la regleta.

La llista dels que només tenen un cable

Els servidors acostumen a estar bé. El que gairebé mai no és a cap llista és la resta del rack, que és on viu el cable únic: el tallafoc petit de la seu, el switch d'accés barat que es va comprar «mentrestant», la consola sèrie o el KVM, l'aparell que va deixar el proveïdor de veu, el NAS de les còpies ràpides, i la caixa d'1U provisional que fa quatre anys que hi és. Cap d'ells no té dues fonts. Uns quants d'ells són, a la pràctica, el punt pel qual passa tota la resta.

Per a cadascun d'aquests aparells hi ha tres sortides honestes, i totes tres són defensables:

  • Un commutador de transferència al rack. És el que el mateix estàndard preveu. Té dues pegues que cal dir en veu alta: costa diners i afegeix un aparell que es pot espatllar entre el teu equip i el corrent. Es compra bo o no es compra.
  • Duplicar l'aparell en comptes del cable. Dos tallafocs petits en alta disponibilitat, un a cada branca, surten de vegades més barats que un commutador decent, i a més et cobreixen el cas que l'aparell es mori tot sol, que és més freqüent que el tall de branca.
  • Acceptar-ho per escrit. «Aquest aparell cau quan el proveïdor mantingui la branca A; ens sembla bé perquè només afecta X i l'aixequem en Y minuts.» Aquesta resposta és tan vàlida com les altres dues. El que no val és no haver triat, que és el que ens hem trobat més d'una vegada.

Si ho fas bé, el teu rack té la meitat d'ampers dels que creus

Si cada branca ha de poder sostenir tota la càrrega quan l'altra és en manteniment, llavors cap de les dues pot anar plena. El disseny assumeix a més que el repartiment en condicions normals està equilibrat: el mateix article ho quantifica així, la càrrega normal de cada font es reparteix «within 10% of the average». Això deixa de ser una conversa de cables i passa a ser-ne una de diners.

L'aritmètica és nostra i és de tovalló, però és la que decideix la factura. Dues branques monofàsiques de 16 A a 230 V donen 16 × 230 = 3.680 VA per branca, que amb el factor de potència d'una font amb PFC són uns 3,6 kW reals. No són 7,36 kW de rack: són 3,68 kVA útils, perquè el dia del manteniment una sola branca ho ha de portar tot. I mira't el contracte abans de donar-los per bons: en els que hem llegit és habitual que la càrrega contínua es limiti a un percentatge del nominal, amb el 80 % com a xifra freqüent, i llavors la xifra real baixa a uns 2,9 kVA. Un rack venut com a «2 × 16 A» que algú va interpretar com a 32 A es queda sense lloc a mig camí, i el descobriment arriba amb el servidor ja comprat.

D'això ja en vam escriure quan el mercat va deixar de vendre espai i va passar a vendre potència: el colocation ja no es negocia en U, es negocia en kW. El que hi afegeix aquest post és que el número que importa és el que queda quan una de les dues branques no hi és.

La prova no és el plànol: és obrir l'interruptor

Hi ha una segona dada que ve a tomb. A la cobertura de l'informe que va publicar Network World, el 92 % dels operadors diu que l'error humà va contribuir almenys mínimament a les seves caigudes significatives dels últims tres anys, i dins d'aquesta categoria la causa que encapçala la llista continua sent la mateixa: no seguir els procediments establerts. Gent que té el procediment escrit i aquell dia no el va seguir. Per això la verificació que proposem no és documental.

L'única prova que val és: en finestra acordada, obrir l'interruptor de la branca A del teu rack i mirar què s'apaga. El que continua encès estava bé. El que s'apaga estava malament, i ara ho saps tu i no ho sap el manteniment del proveïdor d'aquí a tres mesos. Abans de fer-ho, una comprovació prèvia que estalvia ensurts: assegura't que avui les dues fonts de cada servidor estan vives. Una font morta fa vuit mesos no encén cap llum vermella a cap plafó si ningú va configurar l'alerta, i el dia del tall descobreixes que feia gairebé un any que no tenies redundància i no ho sabies.

Aquesta alerta és una línia. El controlador de gestió de qualsevol servidor de marca —IPMI, iDRAC, iLO— publica l'estat de cada font i si té entrada de corrent. Nosaltres monitoritzem amb Zabbix i la regla és la mateixa que apliquem a tota la resta: alertes que importen, no soroll. «Font 2 sense alimentació» és de les que importen, perquè és exactament l'avís que la teva redundància va deixar d'existir mentre tot continuava funcionant.

Això és un argument a favor del colocation, no en contra

Seria fàcil tancar això amb un «et venen redundància i no la tens». No és veritat i no ho escriurem. La diferència entre un datacenter i el cambró del fons de l'oficina és que al datacenter la segona branca existeix i l'única cosa que cal és que la facis servir. Al cambró de l'oficina no existeix, i no hi ha cap cable que la inventi: hi ha un quadre, un diferencial i una moqueta. La fallada de què parla aquest post és una fallada d'aprofitament, que és un problema infinitament millor que el de no tenir l'opció.

I convé no inflar la mida del problema, perquè el mateix informe porta la dada que ho relativitza: la taxa de caigudes per emplaçament baixa per cinquè any consecutiu. El sector ho està fent millor, no pas pitjor, i ningú no hauria de contractar res per por. Això no demana cap inversió. Demana una visita al datacenter, una estona amb una llanterna i, com a molt, dos cables.

Què faríem en la teva propera visita

  • Comptar cables, aparell per aparell, seguint cadascun amb la mà fins a la seva regleta. Els plànols de rack envelleixen pitjor que els servidors.
  • Llegir el consum de cada regleta i comparar-les. Si una va molt per sobre de l'altra, hi ha cablejat creuat o un repartiment mal fet, i al tall ho pagues en forma de magnetotèrmic que salta.
  • Sumar el consum total i contrastar-lo amb el que pot portar una sola branca segons el teu contracte, no amb la suma de totes dues.
  • Anotar els aparells d'un sol cable i posar al costat de cadascun quina de les tres sortides s'ha triat, amb data i nom.
  • Deixar configurada l'alerta de font sense alimentació abans de sortir del datacenter, no «quan tornem a l'oficina».

Tres coses que no faríem. Donar el rack per bo perquè el proveïdor estigui certificat: el seu certificat descriu el que arriba fins a la teva regleta, i d'aquí a la font del servidor el dissenyador ets tu. Fer la prova del tall sense finestra i sense avisar, perquè l'objectiu és trobar la fallada, no demostrar-la en horari d'oficina. I comprar un commutador de transferència barat per a un aparell crític: si poses un punt de fallada nou davant del teu tallafoc, que almenys estigui més ben fet que el tallafoc.

La fallada i l'avaria

Fa anys que diem el mateix: la fallada és inevitable, l'avaria és una decisió de disseny. El que crida l'atenció d'aquest cas és que aquí ni tan sols hi ha una fallada. Hi ha un dimarts. Un manteniment planificat, anunciat, executat correctament i cobrat dins de la quota. El proveïdor fa exactament el que va prometre i el teu servidor s'apaga igualment, perquè els dos cables sortien del mateix lloc. Fa unes setmanes explicàvem que la redundància no compra immunitat, compra una finestra de temps; això és l'esglaó anterior: comprovar que la finestra existeix abans de calcular quant dura.

Fonts i mètode (verificat el 9 d'octubre del 2026): que l'energia continua sent la primera causa de caigudes amb impacte i que dins d'ella dominen les fallades de SAI, commutadors de transferència i generadors; que és el cinquè any consecutiu de descens de la taxa de caigudes per emplaçament; que al voltant d'una de cada deu últimes caigudes va tenir impacte greu o sever; que el 57 % dels enquestats va situar la seva última caiguda important per sobre dels 100.000 dòlars i que un de cada cinc la va situar per sobre del milió per segon any consecutiu; i que «no seguir els procediments establerts» continua encapçalant les causes d'error humà, provenen de l'Annual Outage Analysis 2026 de l'Uptime Institute (vuitena edició, publicat el 13 de maig del 2026) i de la seva nota de premsa del mateix dia. El 92 % d'operadors que assenyalen l'error humà com a contribuent almenys menor prové de la cobertura d'aquest mateix informe a Network World (14 de maig del 2026). Les cites literals sobre arquitectura de doble cable als nivells III i IV, la concessió del commutador de transferència al rack per a equips amb nombre senar de cables, l'«1-10% of servers… may be improperly corded», el «greater than 50% of our clients continue to deploy at least one or more single-corded devices», el repartiment de càrrega «within 10% of the average» i que més de la meitat dels més de 5.000 incidents de la base de dades AIRs es refereixen al sistema de distribució crítica provenen de «Dual-Corded Power and Fault Tolerance: Past, Present, and Future», de Kevin Heslin, Uptime Institute Journal, 18 d'agost del 2014. El que no sabem i el que és nostre: les xifres de cablejat incorrecte són del 2014 i el text mateix les qualifica d'anecdòtiques; no hem trobat cap mesura recent i equivalent, així que no les presentem com l'estat actual del sector sinó com l'únic ordre de magnitud publicat. El càlcul de 3.680 VA per branca de 16 A a 230 V, la seva conversió aproximada a kW i el descompte al 80 % de càrrega contínua són aritmètica nostra: el límit de càrrega contínua depèn del teu contracte i de la teva instal·lació, i cal llegir-lo, no suposar-lo. La llista d'aparells d'un sol cable i les tres sortides per a cadascun són criteri propi, no una recomanació de cap organisme. Tampoc no afirmem quin percentatge de racks dels nostres clients està mal cablejat: no publiquem dades de clients. Fotografia de portada: UPS Power Management Module, iDataPlex racks with network cabling in NERSC data center, de D. Coetzee, domini públic (CC0 1.0) via Wikimedia Commons; retallada per nosaltres, sense altres alteracions.

Algú ha seguit els teus cables amb la mà alguna vegada?

A everyWAN tenim maquinari propi al datacenter i fem manteniment informàtic amb la part avorrida inclosa: comptar cables, llegir consums per branca i deixar escrit quin aparell cau quan el proveïdor mantingui la branca A. No som resellers de cap plataforma ni cobrem comissió pel que recomanem, així que de vegades la conclusió és «això està bé, no toquis res». Si et mudes de rack o fa anys que ningú obre la porta del darrere, escriu-nos i ho mirem amb tu.

Parlar amb everyWAN

Etiquetes:

Compartir:

Subscriu-te al nostre butlletí

Per rebre històries del món IT, novetats d'everyWAN i ofertes exclusives per a subscriptors, dona't d'alta a la nostra llista de correu

everyWAN
everyWAN