Senior Linux / Hpc Infrastructure Engineer SRE

location_onWarsaw, Polandschedule7 godzin temu
homeStyl pracy:Zdalny
trending_upPoziom doświadczenia:Senior

Opis stanowiska

Senior Linux / HPC Infrastructure Engineer (SRE)

Tagi: #Linux #HPC #AI #GPU #BareMetal #Automation

O nas / O zespole

Szukamy doświadczonego inżyniera Linux/SRE do zespołu

zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU

wykorzystywanych do AI.

Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data

Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible,

Pythona, Basha i Gita.

To nie jest typowa praca DevOps skupiona na chmurze i

wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z

infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.

Kim jesteś (Soft Skills)?

  • Potrafisz
  • samodzielnie podejść do problemu i nie boisz się szukać rozwiązań.
  • Lubisz
  • współpracować z innymi i potrafisz jasno komunikować, co robisz.
  • Bierzesz
  • odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji.
  • Chętnie
  • automatyzujesz powtarzalne zadania.
  • Nie
  • masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą.

Organizacja pracy

  • Około
  • 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową.
  • Godziny
  • pracy 8:00–18:00, z dwugodzinną przerwą.
  • Praca
  • na Linuxie lub macOS.
  • Scrum,
  • regularne spotkania i dużo bezpośredniej komunikacji w zespole.
  • Obecnie
  • bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest
  • wprowadzenie rotacyjnego on-call.

Co oferujemy?

  • Pracę
  • z dużymi klastrami GPU i infrastrukturą AI/HPC.
  • Sporo
  • samodzielności i realny wpływ na to, jak działa infrastruktura.
  • Bezpośrednią
  • współpracę z doświadczonymi inżynierami i Tech Leadem.
  • Możliwość
  • poznania i rozwijania się w technologiach HPC/AI GPU.
  • Krótką
  • ścieżkę decyzyjną, bez zbędnych formalności.

Czego oczekujemy (Hard Skills)?

  • Bardzo
  • dobrej znajomości Linuxa Debian-like i doświadczenia z systemami
  • produkcyjnymi.
  • Doświadczenia
  • z bare-metal i infrastrukturą Data Center.
  • Dobrej
  • znajomości sieci (TCP/IP, DNS, VLAN, routing).
  • Umiejętności
  • samodzielnego diagnozowania problemów systemowych, sieciowych i
  • wydajnościowych.
  • Znajomości
  • Ansible, Git oraz umiejętności pisania skryptów w Bashu i Pythonie.
  • Doświadczenia
  • z monitoringiem i narzędziami diagnostycznymi.
  • Angielskiego
  • pozwalającego na swobodną codzienną komunikację.

Mile widziane

  • Doświadczenie
  • z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
  • Znajomość
  • technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
  • Znajomość
  • InfiniBand, RDMA, SLURM.
  • Doświadczenie
  • z Prometheus, Grafana, GitLab CI/CD.
  • Doświadczenie
  • z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).

Wspomniane umiejętności

Aplikuj na tę pracę

Use the application link supplied with this listing to apply to Margo. Check the destination before entering personal information.

Aplikuj terazopen_in_new