Senior Linux / Hpc Infrastructure Engineer SRE
Opis stanowiska
Senior Linux / HPC Infrastructure Engineer (SRE)
Tagi: #Linux #HPC #AI #GPU #BareMetal #Automation
O nas / O zespole
Szukamy doświadczonego inżyniera Linux/SRE do zespołu
zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU
wykorzystywanych do AI.
Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data
Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible,
Pythona, Basha i Gita.
To nie jest typowa praca DevOps skupiona na chmurze i
wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z
infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.
Kim jesteś (Soft Skills)?
- Potrafisz
- samodzielnie podejść do problemu i nie boisz się szukać rozwiązań.
- Lubisz
- współpracować z innymi i potrafisz jasno komunikować, co robisz.
- Bierzesz
- odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji.
- Chętnie
- automatyzujesz powtarzalne zadania.
- Nie
- masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą.
Organizacja pracy
- Około
- 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową.
- Godziny
- pracy 8:00–18:00, z dwugodzinną przerwą.
- Praca
- na Linuxie lub macOS.
- Scrum,
- regularne spotkania i dużo bezpośredniej komunikacji w zespole.
- Obecnie
- bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest
- wprowadzenie rotacyjnego on-call.
Co oferujemy?
- Pracę
- z dużymi klastrami GPU i infrastrukturą AI/HPC.
- Sporo
- samodzielności i realny wpływ na to, jak działa infrastruktura.
- Bezpośrednią
- współpracę z doświadczonymi inżynierami i Tech Leadem.
- Możliwość
- poznania i rozwijania się w technologiach HPC/AI GPU.
- Krótką
- ścieżkę decyzyjną, bez zbędnych formalności.
Czego oczekujemy (Hard Skills)?
- Bardzo
- dobrej znajomości Linuxa Debian-like i doświadczenia z systemami
- produkcyjnymi.
- Doświadczenia
- z bare-metal i infrastrukturą Data Center.
- Dobrej
- znajomości sieci (TCP/IP, DNS, VLAN, routing).
- Umiejętności
- samodzielnego diagnozowania problemów systemowych, sieciowych i
- wydajnościowych.
- Znajomości
- Ansible, Git oraz umiejętności pisania skryptów w Bashu i Pythonie.
- Doświadczenia
- z monitoringiem i narzędziami diagnostycznymi.
- Angielskiego
- pozwalającego na swobodną codzienną komunikację.
Mile widziane
- Doświadczenie
- z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
- Znajomość
- technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
- Znajomość
- InfiniBand, RDMA, SLURM.
- Doświadczenie
- z Prometheus, Grafana, GitLab CI/CD.
- Doświadczenie
- z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).
Wspomniane umiejętności
Aplikuj na tę pracę
Use the application link supplied with this listing to apply to Margo. Check the destination before entering personal information.

