[Feature] Fleet update runs continue on failure based on setting of acceptable #/% cluster failures
Open
feature-request
fleet-manager
upgrade
- Dominant language
- TypeScript
- Stars
- 2.1k
- Forks
- 395
- Avg merge
- 2d 22h
- Merged PRs (30d)
- 13
Description
As a fleet administrator I want define the number of cluster failures an update run can encounter before it stops so that my update run will still continue even when I have some problematic clusters.
Criteria:
- The default behavior is to accept no failures (current behavior).
- I can set a threshold for acceptable number of cluster upgrade failures as either an absolute number or percentage.
- I can set a threshold for the entire run, or for more granular scopes (stages, groups)
- On reaching threshold update run should halt with explicit error message.
Contributor guide
Assessment
This issue has not been assessed yet.