Pusiste noout para actualizar Ceph y apagaste la reposición de copias
El procedimiento de actualización de Ceph en Proxmox te recomienda, en su paso cuatro, ejecutar «ceph osd set noout»: «optional, but recommended», dice el wiki. La documentación de Ceph, en su página de resolución de problemas de OSD, dice que eso es «más un ejercicio mental» que una sugerencia de que alguien «en el mundo post-Luminous» lo ejecute. Las dos frases están publicadas hoy y las dos son defendibles. Lo que esa bandera apaga no es el rebalanceo: es que un OSD «down» llegue a «out», que es justo el paso que hace que CRUSH recalcule y se cree la copia que falta. Y la bandera no distingue entre el disco que reiniciaste tú y el que se ha muerto de verdad. Dentro: por qué mon_osd_down_out_subtree_limit ya te frena el escenario que de verdad asusta, la cadena que casi nadie cuenta (los PG degradados no se marcan como clean, y lo que no está clean no se scrubea: deja de verificarse el checksum justo de los datos a los que les falta una copia), la aritmética de los dos avisos que llegan a los 10,5 y a los 12,25 días a un panel que lleva amarillo desde el minuto uno, la tabla de lo que cada bandera apaga de verdad, y los cuatro comandos que hacen el mismo trabajo sobre un disco o sobre un host sin tocar el resto del cluster.