MARGO

Senior Linux / HPC Infrastructure Engineer (SRE)

MARGO Paris, Ile-de-France, France · PLN 416K–PLN 520K/yr

Financial Services · 11-50 employees

2 d ago
Remote sre Senior (5-10 yrs) Full-time Contractor France
Create a free account to apply — email only, no card. You can also save this posting or score it against your profile with AI.

About the role

You will be responsible for maintaining and developing Linux-based HPC and GPU infrastructure used for AI workloads. This includes automating configurations, diagnosing system and hardware issues, and ensuring the stability of the production environment.

What they look for

Linux HPC GPU Infrastructure Ansible Python Bash Git Data Center Networking TCP/IP DNS VLAN Routing Monitoring NVIDIA Technologies InfiniBand SLURM

Requirements

The role requires strong expertise in Linux systems, bare-metal infrastructure, and data center networking. Candidates must be proficient in Ansible, Python, Bash, and Git, with a focus on troubleshooting and infrastructure automation.

Benefits

Real impact on infrastructure Direct collaboration with experienced engineers Professional development in HPC and AI GPU technologies Short decision-making path

Full description

Szukamy doświadczonego inżyniera Linux/SRE do zespołu zajmującego się utrzymaniem i rozwojem infrastruktury HPC oraz klastrów GPU wykorzystywanych do AI.

Pracujemy na fizycznych serwerach, z Linuxem, sieciami Data Center i technologiami NVIDIA. Dużo automatyzujemy, korzystamy z Ansible, Pythona, Basha i Gita.

To nie jest typowa praca DevOps skupiona na chmurze i wdrażaniu aplikacji. Tutaj zdecydowanie więcej czasu spędza się na pracy z infrastrukturą, diagnozowaniu problemów i dbaniu o stabilność środowiska.

\n

\n200 zł - 250 zł an hour

Czym będziesz się zajmować?

  • Utrzymaniem i rozwojem infrastruktury Linux oraz klastrów HPC/GPU.
  • Diagnozowaniem i rozwiązywaniem problemów produkcyjnych, zarówno systemowych, jak i sprzętowych czy sieciowych.
  • Automatyzacją konfiguracji i zarządzania infrastrukturą.
  • Rozwijaniem monitoringu i poprawianiem stabilności środowiska.
  • Współpracą przy wdrożeniach i rozwiązywaniu incydentów.
  • Dokumentowaniem rozwiązań i usprawnianiem codziennej pracy.

Czego oczekujemy (Hard Skills)?

  • Bardzo dobrej znajomości Linuxa Debian-like i doświadczenia z systemami produkcyjnymi.
  • Doświadczenia z bare-metal i infrastrukturą Data Center.
  • Dobrej znajomości sieci (TCP/IP, DNS, VLAN, routing).
  • Umiejętności samodzielnego diagnozowania problemów systemowych, sieciowych i wydajnościowych.
  • Znajomości Ansible, Git oraz umiejętności pisania skryptów w Bashu i Pythonie.
  • Doświadczenia z monitoringiem i narzędziami diagnostycznymi.
  • Angielskiego pozwalającego na swobodną codzienną komunikację.

\n

Mile widziane

  • Doświadczenie z HPC, klastrami obliczeniowymi lub infrastrukturą GPU.
  • Znajomość technologii NVIDIA (Cumulus, DCGM, NCCL, NHC, NVIDIA Container Toolkit).
  • Znajomość InfiniBand, RDMA, SLURM.
  • Doświadczenie z Prometheus, Grafana, GitLab CI/CD.
  • Doświadczenie z rozproszonymi i klastrowymi systemami plików (Lustre, Ceph).

Kim jesteś (Soft Skills)?

  • Potrafisz samodzielnie podejść do problemu i nie boisz się szukać rozwiązań.
  • Lubisz współpracować z innymi i potrafisz jasno komunikować, co robisz.
  • Bierzesz odpowiedzialność za swoją pracę i zmiany wprowadzane na produkcji.
  • Chętnie automatyzujesz powtarzalne zadania.
  • Nie masz problemu z pytaniem o pomoc ani dzieleniem się własną wiedzą.

Organizacja pracy

  • Około 10-osobowy zespół podzielony na część operacyjną (SRE) i projektową.
  • Godziny pracy 8:00–18:00, z dwugodzinną przerwą.
  • Praca na Linuxie lub macOS.
  • Scrum, regularne spotkania i dużo bezpośredniej komunikacji w zespole.
  • Obecnie bez dyżurów nocnych i weekendowych, ale w przyszłości planowane jest wprowadzenie rotacyjnego on-call.

Co oferujemy?

  • Pracę z dużymi klastrami GPU i infrastrukturą AI/HPC.
  • Sporo samodzielności i realny wpływ na to, jak działa infrastruktura.
  • Bezpośrednią współpracę z doświadczonymi inżynierami i Tech Leadem.
  • Możliwość poznania i rozwijania się w technologiach HPC/AI GPU.
  • Krótką ścieżkę decyzyjną, bez zbędnych formalności.

Similar roles