Page MenuHomePhabricator

Migrate WDQS hosts to Bookworm or later
Closed, ResolvedPublic

Description

Per parent ticket, we need to have WDQS on a newer version of Debian by September of 2026. We'll start on WDQS once the WCQS upgrade in T430879 is finished.

Creating this ticket to:
Reimage/redeploy the following hosts (documented for WDQS here )

Hosts

36of 36 hosts complete

wdqs-test

  • wdqs2025

wdqs-internal_scholarly

  • wdqs1027
  • wdqs2017
  • wdqs2026
  • wdqs2027

wdqs-internal_main

  • wdqs1025
  • wdqs1026
  • wdqs2018 pybal issues after VLAN move
  • wdqs2019 pybal issues after VLAN move
  • wdqs2020

wdqs-scholarly

  • wdqs1023
  • wdqs1024 failed multiple NIC firmware updates; eventually got it to reimage with --use-http-for-dhcp flag.
  • wdqs2016
  • wdqs2023
  • wdqs2024

wdqs-main

  • wdqs1011
  • wdqs1012
  • wdqs1013 reimage, deploy, transfer, and postflight complete; required PyBal restart because the pre-reimage depool set pooled=no, which retained the cached address across the VLAN move
  • wdqs1014 reimage, deploy, transfer, and postflight complete; locally healthy but not serving due to the same pooled=no stale-address issue, pending a Traffic-coordinated rolling PyBal restart
  • wdqs1016
  • wdqs1017
  • wdqs1018
  • wdqs1019
  • wdqs1020
  • wdqs1021
  • wdqs1022
  • wdqs2007
  • wdqs2008
  • wdqs2010
  • wdqs2011
  • wdqs2012
  • wdqs2013
  • wdqs2014
  • wdqs2015
  • wdqs2021
  • wdqs2022
  • Make config management changes if necessary
  • Verify operation

Event Timeline

There are a very large number of changes, so older changes are hidden. Show Older Changes

Mentioned in SAL (#wikimedia-operations) [2026-07-25T19:57:32Z] <ryankemper@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880 deploy to fresh wdqs host

Mentioned in SAL (#wikimedia-operations) [2026-07-25T19:57:38Z] <ryankemper@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 deploy to fresh wdqs host (duration: 00m 05s)

Change #1317127 had a related patch set uploaded (by Ryan Kemper; author: Ryan Kemper):

[operations/cookbooks@master] sre.wdqs.data-transfer: abort on failed transfer

https://gerrit.wikimedia.org/r/1317127

Change #1317128 had a related patch set uploaded (by Ryan Kemper; author: Ryan Kemper):

[operations/cookbooks@master] sre.wdqs: stop transferpy burying cookbook output

https://gerrit.wikimedia.org/r/1317128

Mentioned in SAL (#wikimedia-operations) [2026-07-25T20:18:21Z] <ryankemper@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer scholarly_articles from wdqs1024.eqiad.wmnet -> wdqs2024.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-25T20:18:32Z] <ryankemper@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs1017.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-25T21:06:50Z] <ryankemper@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer scholarly_articles from wdqs1024.eqiad.wmnet -> wdqs2024.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-25T21:26:45Z] <ryankemper@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs1017.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-25T22:06:17Z] <ryankemper> T430880 [WDQS] Repooled wdqs1017 and wdqs2024 after reimaging to bookworm, scap deploying, and data xfering

Cookbook cookbooks.sre.hosts.reimage was started by ryankemper@cumin2003 for host wdqs1018.eqiad.wmnet with OS bookworm

Cookbook cookbooks.sre.hosts.reimage was started by ryankemper@cumin2003 for host wdqs1019.eqiad.wmnet with OS bookworm

Cookbook cookbooks.sre.hosts.reimage started by ryankemper@cumin2003 for host wdqs1018.eqiad.wmnet with OS bookworm completed:

  • wdqs1018 (WARN)
    • Downtimed on Icinga/Alertmanager
    • Set pooled=inactive for the following services on confctl:

{"wdqs1018.eqiad.wmnet": {"weight": 10, "pooled": "yes"}, "tags": "dc=eqiad,cluster=wdqs-main,service=wdqs-main"}

  • Disabled Puppet
  • Host successfully migrated to the new VLAN
  • Removed from Puppet and PuppetDB if present and deleted any certificates
  • Removed from Debmonitor if present
  • Forced PXE for next reboot
  • Host rebooted via IPMI
  • Host up (Debian installer)
  • Checked BIOS boot parameters are back to normal
  • Host up (new fresh bookworm OS)
  • Generated Puppet certificate
  • Signed new Puppet certificate
  • Run Puppet in NOOP mode to populate exported resources in PuppetDB
  • Found Nagios_host resource for this host in PuppetDB
  • Downtimed the new host on Icinga/Alertmanager
  • Removed previous downtime on Alertmanager (old OS)
  • First Puppet run completed and logged in /var/log/spicerack/sre/hosts/reimage/202607260038_ryankemper_430255_wdqs1018.out
  • configmaster.wikimedia.org updated with the host new SSH public key for wmf-update-known-hosts-production
  • Rebooted
  • Automatic Puppet run was successful
  • Forced a re-check of all Icinga services for the host
  • Icinga status is not optimal, downtime not removed
  • Services in confctl are not automatically pooled, to restore the previous state you have to run the following commands:

sudo confctl select 'name=wdqs1018\.eqiad\.wmnet,dc=eqiad,cluster=wdqs\-main,service=wdqs\-main' set/pooled=yes

  • Updated Netbox data from PuppetDB

Cookbook cookbooks.sre.hosts.reimage started by ryankemper@cumin2003 for host wdqs1019.eqiad.wmnet with OS bookworm completed:

  • wdqs1019 (WARN)
    • Downtimed on Icinga/Alertmanager
    • Set pooled=inactive for the following services on confctl:

{"wdqs1019.eqiad.wmnet": {"weight": 10, "pooled": "yes"}, "tags": "dc=eqiad,cluster=wdqs-main,service=wdqs-main"}

  • Disabled Puppet
  • Host successfully migrated to the new VLAN
  • Removed from Puppet and PuppetDB if present and deleted any certificates
  • Removed from Debmonitor if present
  • Forced PXE for next reboot
  • Host rebooted via IPMI
  • Host up (Debian installer)
  • Checked BIOS boot parameters are back to normal
  • Host up (new fresh bookworm OS)
  • Generated Puppet certificate
  • Signed new Puppet certificate
  • Run Puppet in NOOP mode to populate exported resources in PuppetDB
  • Found Nagios_host resource for this host in PuppetDB
  • Downtimed the new host on Icinga/Alertmanager
  • Removed previous downtime on Alertmanager (old OS)
  • First Puppet run completed and logged in /var/log/spicerack/sre/hosts/reimage/202607260043_ryankemper_430341_wdqs1019.out
  • configmaster.wikimedia.org updated with the host new SSH public key for wmf-update-known-hosts-production
  • Rebooted
  • Automatic Puppet run was successful
  • Forced a re-check of all Icinga services for the host
  • Icinga status is not optimal, downtime not removed
  • Services in confctl are not automatically pooled, to restore the previous state you have to run the following commands:

sudo confctl select 'name=wdqs1019\.eqiad\.wmnet,dc=eqiad,cluster=wdqs\-main,service=wdqs\-main' set/pooled=yes

  • Updated Netbox data from PuppetDB

Mentioned in SAL (#wikimedia-operations) [2026-07-27T04:48:11Z] <ryankemper@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880 deploy to fresh wdqs host

Mentioned in SAL (#wikimedia-operations) [2026-07-27T04:48:17Z] <ryankemper@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 deploy to fresh wdqs host (duration: 00m 05s)

Mentioned in SAL (#wikimedia-operations) [2026-07-27T04:48:21Z] <ryankemper@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880 deploy to fresh wdqs host

Mentioned in SAL (#wikimedia-operations) [2026-07-27T04:48:26Z] <ryankemper@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 deploy to fresh wdqs host (duration: 00m 05s)

Mentioned in SAL (#wikimedia-operations) [2026-07-27T04:51:42Z] <ryankemper@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2007.codfw.wmnet -> wdqs1018.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T04:51:52Z] <ryankemper@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs1019.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T06:00:30Z] <ryankemper@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2007.codfw.wmnet -> wdqs1018.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T06:00:34Z] <ryankemper@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs1019.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T07:16:47Z] <ryankemper> T430880 [WDQS] Reimaged wdqs1018 and wdqs1019 to Bookworm, restored data using test-cookbook change 1317128, and repooled both; 25/36 hosts complete

Change #1315664 merged by Bking:

[operations/puppet@production] prometheus: start exporter with Blazegraph

https://gerrit.wikimedia.org/r/1315664

Change #1315665 merged by Bking:

[operations/cookbooks@master] wdqs: restore Blazegraph exporters

https://gerrit.wikimedia.org/r/1315665

Change #1315666 merged by jenkins-bot:

[operations/cookbooks@master] wdqs: bound missing updater metrics

https://gerrit.wikimedia.org/r/1315666

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:15:24Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:15:29Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 06s)

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:15:43Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:15:51Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 12s)

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:21:16Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2007.codfw.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Change #1317127 merged by jenkins-bot:

[operations/cookbooks@master] sre.wdqs.data-transfer: abort on failed transfer

https://gerrit.wikimedia.org/r/1317127

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:26:06Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs2010.codfw.wmnet, repooling source-only afterwards

Change #1317128 merged by jenkins-bot:

[operations/cookbooks@master] sre.wdqs: stop transferpy burying cookbook output

https://gerrit.wikimedia.org/r/1317128

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:29:04Z] <bking@cumin2003> END (ERROR) - Cookbook sre.wdqs.data-transfer (exit_code=97) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2007.codfw.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:31:37Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:32:05Z] <bking@cumin2003> END (ERROR) - Cookbook sre.wdqs.data-transfer (exit_code=97) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs2010.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:32:35Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs2010.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:34:30Z] <bking@cumin2003> END (FAIL) - Cookbook sre.wdqs.data-transfer (exit_code=99) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:38:35Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:41:12Z] <bking@cumin2003> END (FAIL) - Cookbook sre.wdqs.data-transfer (exit_code=99) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T15:43:19Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs1026.eqiad.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T16:52:13Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs1026.eqiad.wmnet -> wdqs1020.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T17:13:19Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2008.codfw.wmnet -> wdqs2010.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T19:47:41Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-27T19:47:50Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 46s)

Mentioned in SAL (#wikimedia-operations) [2026-07-27T20:53:52Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs1026.eqiad.wmnet -> wdqs1021.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-27T21:10:34Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2007.codfw.wmnet -> wdqs2011.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T13:11:36Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-28T13:11:42Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 20s)

Mentioned in SAL (#wikimedia-operations) [2026-07-28T13:27:53Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs1026.eqiad.wmnet -> wdqs1022.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T14:23:36Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-28T14:23:45Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 19s)

Mentioned in SAL (#wikimedia-operations) [2026-07-28T14:36:47Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs1026.eqiad.wmnet -> wdqs1022.eqiad.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T15:07:53Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs2012.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T16:28:29Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs2012.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T20:52:58Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-28T20:53:06Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 30s)

Mentioned in SAL (#wikimedia-operations) [2026-07-28T20:54:03Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-28T20:54:11Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 14s)

Mentioned in SAL (#wikimedia-operations) [2026-07-28T20:55:18Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs2013.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T20:55:47Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2020.codfw.wmnet -> wdqs2014.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T22:08:06Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2022.codfw.wmnet -> wdqs2013.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-28T22:11:19Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2020.codfw.wmnet -> wdqs2014.codfw.wmnet, repooling source-only afterwards

Change #1318972 had a related patch set uploaded (by Ryan Kemper; author: Ryan Kemper):

[operations/software/transferpy@master] Transferer: log the reason a copy failed

https://gerrit.wikimedia.org/r/1318972

Mentioned in SAL (#wikimedia-operations) [2026-07-29T15:41:24Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-29T15:41:32Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 18s)

Mentioned in SAL (#wikimedia-operations) [2026-07-29T15:42:23Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2020.codfw.wmnet -> wdqs2015.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-29T16:54:32Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2020.codfw.wmnet -> wdqs2015.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-29T17:47:25Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-29T17:47:36Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 14s)

Mentioned in SAL (#wikimedia-operations) [2026-07-29T17:47:50Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2015.codfw.wmnet -> wdqs2021.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-29T19:01:04Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2015.codfw.wmnet -> wdqs2021.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-29T21:12:39Z] <bking@cumin2003> START - Cookbook sre.wdqs.data-transfer (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2015.codfw.wmnet -> wdqs2022.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-29T22:25:39Z] <bking@cumin2003> END (PASS) - Cookbook sre.wdqs.data-transfer (exit_code=0) (T430880, restore data on newly-reimaged host) xfer wdqs-all from wdqs2015.codfw.wmnet -> wdqs2022.codfw.wmnet, repooling source-only afterwards

Mentioned in SAL (#wikimedia-operations) [2026-07-30T15:43:49Z] <bking@deploy1003> Started deploy [wdqs/wdqs@e8fb00c]: T430880

Mentioned in SAL (#wikimedia-operations) [2026-07-30T15:43:59Z] <bking@deploy1003> Finished deploy [wdqs/wdqs@e8fb00c]: T430880 (duration: 00m 24s)

bking updated the task description. (Show Details)
bking updated the task description. (Show Details)

All hosts have migrated off Debian Bullseye:

[bking@cumin2003] ~$ sudo cumin A:wdqs-all 'cat /etc/debian_version'
36 hosts will be targeted:
wdqs[2007-2008,2010-2027].codfw.wmnet,wdqs[1011-1014,1016-1027].eqiad.wmnet
OK to proceed on 36 hosts? Enter the number of affected hosts to confirm or "q" to quit: 36
===== NODE GROUP =====
(36) wdqs[2007-2008,2010-2027].codfw.wmnet,wdqs[1011-1014,1016-1027].eqiad.wmnet
----- OUTPUT for command #1: 'cat /etc/debian_version' -----
12.15
================
PASS |██████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████████| 100% (36/36) [00:01<00:00, 26.37hosts/s]
FAIL |                                                                                                                                                                           |   0% (0/36) [00:01<?, ?hosts/s]
100.0% (36/36) success ratio (>= 100.0% threshold) for command #1: 'cat /etc/debian_version'.
100.0% (36/36) success ratio (>= 100.0% threshold) of nodes successfully executed all commands.

As such, I'm closing out this ticket.