Senior Linux / HPC Infrastructure Engineer (SRE)
MARGO Paris, Ile-de-France, France · PLN 416K–PLN 520K/yr
Financial Services · 11-50 employees
Applying here? Try the free cover letter tool — paste this posting and your résumé, no account needed.
About the role
You will be responsible for maintaining and developing Linux-based HPC and GPU infrastructure used for AI workloads. This includes automating configurations, diagnosing system and hardware issues, and ensuring the stability of the production environment.
What they look for
Requirements
The role requires strong expertise in Linux systems, bare-metal infrastructure, and data center networking. Candidates must be proficient in Ansible, Python, Bash, and Git, with a focus on troubleshooting and infrastructure automation.
Benefits
Full description
Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI.
Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible, Pythona, Basha i Gita.
To nie jest typowa praca DevOps skupiona na chmurze i wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.
\n
\n200 zł - 250 zł an hour
Czym będziesz się zajmować?
- Utrzymaniem i rozwojem infrastruktury Linux oraz klastrów HPC/GPU.
- Diagnozowaniem i rozwiązywaniem problemów produkcyjnych, zarówno systemowych, jak i sprzętowych czy sieciowych.
- Automatyzacją konfiguracji i zarządzania infrastrukturą.
- Rozwijaniem monitoringu i poprawianiem stabilności środowiska.
- Współpracą przy wdrożeniach i rozwiązywaniu incydentów.
- Dokumentowaniem rozwiązań i usprawnianiem codziennej pracy.
Czego oczekujemy (Hard Skills)?
- Bardzo dobrej znajomości Linuxa Debian-like i doświadczenia z systemami produkcyjnymi.
- Doświadczenia z bare-metal i infrastrukturą Data Center.
- Dobrej znajomości sieci (TCP/IP, DNS, VLAN, routing).
- Umiejętności samodzielnego diagnozowania problemów systemowych, sieciowych i wydajnościowych.
- Znajomości Ansible, Git oraz umiejętności pisania skryptów w Bashu i Pythonie.
- Doświadczenia z monitoringiem i narzędziami diagnostycznymi.
- Angielskiego pozwalającego na swobodną codzienną komunikację.
\n
Mile widziane
- Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
- Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
- Znajomość InfiniBand, RDMA, SLURM.
- Doświadczenie z Prometheus, Grafana, GitLab CI/CD.
- Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).
Kim jesteś (Soft Skills)?
- Potrafisz samodzielnie podejść do problemu i nie boisz się szukać rozwiązań.
- Lubisz współpracować z innymi i potrafisz jasno komunikować, co robisz.
- Bierzesz odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji.
- Chętnie automatyzujesz powtarzalne zadania.
- Nie masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą.
Organizacja pracy
- Około 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową.
- Godziny pracy 8:00–18:00, z dwugodzinną przerwą.
- Praca na Linuxie lub macOS.
- Scrum, regularne spotkania i dużo bezpośredniej komunikacji w zespole.
- Obecnie bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest wprowadzenie rotacyjnego on-call.
Co oferujemy?
- Pracę z dużymi klastrami GPU i infrastrukturą AI/HPC.
- Sporo samodzielności i realny wpływ na to, jak działa infrastruktura.
- Bezpośrednią współpracę z doświadczonymi inżynierami i Tech Leadem.
- Możliwość poznania i rozwijania się w technologiach HPC/AI GPU.
- Krótką ścieżkę decyzyjną, bez zbędnych formalności.
Similar roles
-
Site Reliability Engineer, Data Center Infrastructure
SpaceX Bastrop, Texas, United States
-
Sr. Site Reliability Engineer, Platform Infrastructure
SpaceX Bastrop, Texas, United States
-
Principal Site Reliability Engineer
UKG Seattle, Washington, United States · $184K–$265K/yr
-
Software Engineer, SRE and Production Engineering - DGX Cloud
NVIDIA Santa Clara, California, United States · $184K–$288K/yr
-
Production Site Reliability Engineer
Charles Schwab Inc. Omaha, Nebraska, United States · $120K–$155K/yr
-
Site Reliability Engineer (Associate, Experienced, or Senior)
Boeing Berkeley, Missouri, United States · $99K–$217K/yr