Disponibilidad del servicio completo
Un proceso respondiendo no demuestra capacidad de ejecutar tareas. Banco, colas, red, identidad, adaptadores y equipos participan. Especifique fallos cubiertos y funciones que deben sobrevivir. Alta disponibilidad no elimina paradas mecánicas ni todo fallo común.
Mida detección, transferencia de autoridad, recuperación de estado y liberación operativa. El arranque del proceso omite parte de la interrupción.
Una autoridad de comando
Solo la instancia autorizada comanda el recurso. Una partición puede dejar dos instancias creyéndose líderes. El diseño debe invalidar la autoridad antigua tras asumir la nueva.
El fencing debe alcanzar la frontera real del comando. Elegir líder en la base no basta si el anterior todavía escribe al PLC. El mecanismo depende de infraestructura y protocolo.
Estado antes de continuar
La nueva instancia distingue tareas no enviadas, aceptadas, ejecutando y completadas sin confirmación. Replicar la lista no basta si el equipo avanzó durante el fallo. Consulte o concilie ejecución.
Replicación síncrona y asíncrona intercambian latencia y posible pérdida reciente. Declare pérdida tolerable y conciliación física. No prometa pérdida cero sin evidencia de la arquitectura.
Ejemplo de failover
A envía 88 y pierde conexión. B asume tras invalidar A. Antes de repetir, compara secuencia reconocida y posición de carga. La evidencia ambigua permanece en conciliación.
Pruebe apagado, aislamiento y fallo de dependencia por separado. Registre tiempo hasta servicio coherente, duplicados y pendientes. Los requisitos ABNET WCS deben demostrarse en la arquitectura contratada.
Criterios de verificación del proyecto
- Medir recuperación hasta ejecución coherente.
- Aislar al líder y comprobar pérdida de autoridad.
- Conciliar comandos en tránsito antes de continuar.
Los ejemplos describen decisiones de ingeniería y escenarios de prueba. Interfaces, límites y funciones implantadas se definen en el alcance de cada proyecto.