Senior Linux / Hpc Infrastructure Engineer SRE
200 - 250 PLN/ godz.B2B
SeniorFull-time·B2B
#453624·Dodano 2 dni temu·0
Źródło: nofluffjobs.comTech Stack / Keywords
LinuxSREGPUAIAnsiblePythonBashDevOpsTCPDNSVLANGitPrometheusGrafanaGitLab CICDCephChmacOSScrumK
Firma i stanowisko
Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI. Pracujemy na fizycznych serwerach z Linuxem, sieciami Data Center i technologiami NVIDIA. Korzystamy z automatyzacji przy użyciu Ansible, Python, Bash oraz Git.
Wymagania
- Bardzo dobra znajomość Linuxa Debian-like i doświadczenie z systemami produkcyjnymi.
- Doświadczenie z bare-metal i infrastrukturą Data Center.
- Dobra znajomość sieci (TCP/IP, DNS, VLAN, routing).
- Umiejętność samodzielnego diagnozowania problemów systemowych, sieciowych i wydajnościowych.
- Znajomość Ansible, Git oraz umiejętność pisania skryptów w Bash i Python.
- Doświadczenie z monitoringiem i narzędziami diagnostycznymi.
- Znajomość języka angielskiego pozwalająca na swobodną codzienną komunikację.
Nice to have:
- Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
- Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
- Znajomość InfiniBand, RDMA, SLURM.
- Doświadczenie z Prometheus, Grafana, GitLab CI/CD.
- Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).
Obowiązki
- Utrzymanie i rozwój infrastruktury Linux oraz klastrów HPC/GPU.
- Diagnozowanie i rozwiązywanie problemów produkcyjnych, systemowych, sprzętowych i sieciowych.
- Automatyzacja konfiguracji i zarządzania infrastrukturą.
- Rozwijanie monitoringu i poprawianie stabilności środowiska.
- Współpraca przy wdrożeniach i rozwiązywaniu incydentów.
- Dokumentowanie rozwiązań i usprawnianie codziennej pracy.
Benefity
- Praca z dużymi klastrami GPU i infrastrukturą AI/HPC.
- Duża samodzielność i realny wpływ na działanie infrastruktury.
- Bezpośrednia współpraca z doświadczonymi inżynierami i Tech Leadem.
- Możliwość rozwoju w technologiach HPC/AI GPU.
- Krótka ścieżka decyzyjna, bez zbędnych formalności.
Margo
36 aktywnych ofert