Senior SRE
Brak informacji o wynagrodzeniu
SeniorFull-time
#401234·Dodano 23 dni temu·1
Źródło: LinkGroupTech Stack / Keywords
AILLMPythonJavaShellScriptingPrometheusGrafana
Firma i stanowisko
Dołączysz do nowo tworzonego, międzynarodowego zespołu SRE odpowiedzialnego za niezawodność i stabilność platform technologicznych wspierających rynki finansowe (Markets Technology) w skali globalnej. Zespół współpracuje ściśle z centralnym zespołem platformowym odpowiedzialnym za observability, łącząc klasyczne SRE z rozwojem rozwiązań opartych na AI.
Wymagania
- Silne fundamenty SRE: incident management, production support, capacity planning.
- Doświadczenie w diagnozowaniu i naprawie problemów produkcyjnych w środowiskach o wysokiej dostępności.
- Znajomość Python (preferowany) + znajomość Java lub shell scripting.
- Praktyczna znajomość: Prometheus, Grafana, Elasticsearch.
- Doświadczenie w środowiskach on-premises (chmura publiczna – w ograniczonym zakresie).
- Bardzo dobra znajomość języka angielskiego.
- Wysoka samodzielność i zdolność do pracy autonomicznej.
Nice to have:
- Znajomość Azure DevOps (ADO).
- Doświadczenie w budowie lub korzystaniu z agentów AI / prompt engineering.
- Doświadczenie w sektorze bankowym lub innym środowisku o podobnej złożoności i krytyczności (fintech, telco, e-commerce o dużej skali).
Obowiązki
Site Reliability Engineering (główny zakres):
- Monitoring, obsługa incydentów produkcyjnych i root cause analysis dla platform tradingowych i rynkowych.
- Diagnozowanie problemów produkcyjnych i wdrażanie trwałych poprawek zapobiegających ich nawrotom.
- Zarządzanie pojemnością (capacity management) i wsparcie stabilności platform on-premises.
- Praca w środowisku o wysokiej krytyczności, w dużej mierze autonomicznie (bez lokalnego lidera zespołu na miejscu).
AI & automatyzacja (element rozwojowy roli):
- Budowa agentów AI automatyzujących monitoring i kontrole stanu systemów, np.:
- health-checki na start dnia / start tygodnia,
- monitoring pre-trade, post-trade i rozliczeń (settlement),
- monitoring przepływu zleceń (order flow).
- Praca na centralnej platformie observability z dedykowanym wsparciem szkoleniowym w zakresie budowy agentów AI.
- Wykorzystanie narzędzi typu Copilot / LLM do wsparcia troubleshootingu i podejmowania decyzji operacyjnych.
Inne informacje
Lokalizacja: Warszawa (hybrydowo, min. 1 dzień w biurze/tydzień)
linkgroup
434 aktywne oferty