Senior DevOps Engineer (PagerDuty) [M/F]
150 - 180 PLN/ godz.B2B
SeniorFull-time·B2B
#451814·Dodano 4 dni temu·4
Źródło: nofluffjobs.comTech Stack / Keywords
PythonPagerDutyTerraform
Firma i stanowisko
Celem projektu jest zaprojektowanie, wdrożenie i automatyzacja centralnego rozwiązania do zarządzania alertami i obsługi incydentów, opartego na PagerDuty i zintegrowanego z istniejącym ekosystemem monitoringu, observability, chmury oraz narzędzi ITSM. Projekt ma na celu zapewnienie, aby właściwe alerty trafiały do odpowiednich osób we właściwym czasie, przy jednoczesnym ograniczeniu liczby fałszywych i powtarzających się powiadomień oraz skróceniu czasu reakcji i rozwiązania incydentów.
Wymagania
- Minimum 7 lat doświadczenia w obszarze DevOps, SRE, Cloud Engineering lub automatyzacji infrastruktury.
- Bardzo dobra znajomość PagerDuty.
- Praktyczne doświadczenie w pracy z AWS, Azure lub GCP oraz gotowość do pracy w środowiskach multi-cloud.
- Bardzo dobra znajomość Terraform / Infrastructure as Code.
- Doświadczenie w automatyzacji i skryptowaniu z wykorzystaniem Python, Bash i JavaScript.
- Znajomość REST API, webhooków, event-driven architecture oraz pracy z payloadami i transformacją danych.
- Doświadczenie z narzędziami monitoringu i observability oraz umiejętność projektowania wartościowych, odpowiednio skonfigurowanych alertów.
- Znajomość koncepcji SLO/SLI, incident management, on-call oraz zasad SRE.
- Znajomość narzędzi CI/CD oraz pracy z Git.
- Dobra znajomość koncepcji AIOps i automatyzacji reakcji na zdarzenia.
- Zaawansowana znajomość języka angielskiego.
Obowiązki
- Projektowanie, wdrażanie i utrzymywanie integracji PagerDuty z narzędziami monitoringu i observability, m.in. CloudWatch, Datadog, Prometheus/Alertmanager, Grafana, New Relic, Splunk, Dynatrace, Nagios/Zabbix.
- Automatyzacja konfiguracji i onboardingu usług w PagerDuty oraz procesów związanych z obsługą i reagowaniem na incydenty.
- Tworzenie i rozwój automatyzacji z wykorzystaniem Terraform, PagerDuty API, REST API, webhooków oraz Rundeck.
- Konfiguracja usług PagerDuty, polityk eskalacji, harmonogramów on-call, routingu zdarzeń, event orchestration oraz mechanizmów grupowania i ograniczania liczby alertów.
- Budowanie mechanizmów auto-remediation i automatycznego wzbogacania informacji o incydentach w środowiskach AWS/Azure/GCP.
- Integracja PagerDuty z systemami ITSM i narzędziami wspierającymi współpracę, m.in. ServiceNow, Jira, Slack i Microsoft Teams.
- Tworzenie i utrzymywanie procesów CI/CD dla konfiguracji monitoringu i alertowania jako kodu.
- Rozwój rozwiązań automatyzujących obsługę incydentów oraz wspierających podejście AIOps / event intelligence.
Arche Solutions
27 aktywnych ofert