Page MenuHomePhabricator

Add failure rate triggered rollback to scap
Open, Needs TriagePublic

Description

scap currently only stops if a canary hosts fail deployment.

I suggest that, further, when a certain percentage of failure to restart or repool is being reported by scap for a cluster after canaries pass, it should:

  • either stop or rollback
  • instruct on contact information for checking failure cause

Percentage of failure tbd.

Details

Related Changes in GitLab:
TitleReferenceAuthorSource BranchDest Branch
Add production error rate checksrepos/releng/scap!1159dancymaster-I2773f10b349f3f41de0cb2724ab070bb099556fdmaster
logstash_checker.py: Make "scap analyze-logstash production" work betterrepos/releng/scap!1157dancymaster-I7d4afb1fbe9d37b14feb97f4723bc3997c0aba5dmaster
logstash_checker.py: Support arbitrary stage error rate checkingrepos/releng/scap!1154dancymaster-I35720c20c3c6f818bd5824924bcfdd1e717d809dmaster
Customize query in GitLab

Event Timeline

Joe subscribed.

Re-tagging to the team responsible for scap.

dancy updated https://gitlab.wikimedia.org/repos/releng/scap/-/merge_requests/1154

logstash_checker.py: Support arbitrary stage error rate checking

dancy merged https://gitlab.wikimedia.org/repos/releng/scap/-/merge_requests/1154

logstash_checker.py: Support arbitrary stage error rate checking

dancy merged https://gitlab.wikimedia.org/repos/releng/scap/-/merge_requests/1157

logstash_checker.py: Make "scap analyze-logstash production" work better

Mentioned in SAL (#wikimedia-operations) [2026-05-01T19:37:28Z] <dancy@deploy1003> Started scap sync-world: testing T317405

Mentioned in SAL (#wikimedia-operations) [2026-05-01T19:40:51Z] <dancy@deploy1003> Finished scap sync-world: testing T317405 (duration: 03m 23s)