Margo
Margo
New

Senior Linux / Hpc Infrastructure Engineer SRE

200 - 250 PLN/ godz.B2B
SeniorFull-time·B2B
#453624·Dodano 2 dni temu·0
Źródło: nofluffjobs.com
Aplikuj teraz

Tech Stack / Keywords

LinuxSREGPUAIAnsiblePythonBashDevOpsTCPDNSVLANGitPrometheusGrafanaGitLab CICDCephChmacOSScrumK

Firma i stanowisko

Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI. Pracujemy na fizycznych serwerach z Linuxem, sieciami Data Center i technologiami NVIDIA. Korzystamy z automatyzacji przy użyciu Ansible, Python, Bash oraz Git.

Wymagania

  • Bardzo dobra znajomość Linuxa Debian-like i doświadczenie z systemami produkcyjnymi.
  • Doświadczenie z bare-metal i infrastrukturą Data Center.
  • Dobra znajomość sieci (TCP/IP, DNS, VLAN, routing).
  • Umiejętność samodzielnego diagnozowania problemów systemowych, sieciowych i wydajnościowych.
  • Znajomość Ansible, Git oraz umiejętność pisania skryptów w Bash i Python.
  • Doświadczenie z monitoringiem i narzędziami diagnostycznymi.
  • Znajomość języka angielskiego pozwalająca na swobodną codzienną komunikację.

Nice to have:

  • Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
  • Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
  • Znajomość InfiniBand, RDMA, SLURM.
  • Doświadczenie z Prometheus, Grafana, GitLab CI/CD.
  • Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).

Obowiązki

  • Utrzymanie i rozwój infrastruktury Linux oraz klastrów HPC/GPU.
  • Diagnozowanie i rozwiązywanie problemów produkcyjnych, systemowych, sprzętowych i sieciowych.
  • Automatyzacja konfiguracji i zarządzania infrastrukturą.
  • Rozwijanie monitoringu i poprawianie stabilności środowiska.
  • Współpraca przy wdrożeniach i rozwiązywaniu incydentów.
  • Dokumentowanie rozwiązań i usprawnianie codziennej pracy.

Benefity

  • Praca z dużymi klastrami GPU i infrastrukturą AI/HPC.
  • Duża samodzielność i realny wpływ na działanie infrastruktury.
  • Bezpośrednia współpraca z doświadczonymi inżynierami i Tech Leadem.
  • Możliwość rozwoju w technologiach HPC/AI GPU.
  • Krótka ścieżka decyzyjna, bez zbędnych formalności.
Margo

Margo

36 aktywnych ofert

Zobacz wszystkie oferty
Aplikuj teraz