D

Sr SRE Engineer

Dresden Partners Guadalajara, Sonora, Mexico

Human Resources Services · 51-200 employees

19 h ago
sre Senior (5-10 yrs) Full-time Mexico
Create a free account to apply — email only, no card. You can also save this posting or score it against your profile with AI.

About the role

Lead critical incident response, troubleshooting, and postmortems while designing reliable AWS architectures and observability frameworks. Implement reliability controls in CI/CD pipelines and leverage AI-driven operations for anomaly detection and predictive analytics.

What they look for

AWS Kubernetes Docker Terraform Datadog Python Bash CI/CD Linux Networking Incident Management Chaos Engineering Disaster Recovery AIOps Observability Capacity Planning

Requirements

Requires over 6 years of experience in SRE, DevOps, or Cloud Infrastructure with advanced proficiency in AWS, Kubernetes, and Terraform. Candidates must possess strong scripting skills in Python and Bash, along with advanced conversational English proficiency.

Full description

En Dresden Partners conectamos el talento con empresas globales de primer nivel. Somos un puente de oportunidad laboral especialistas en identificar, y vincular profesionales con empresas internacionales en México, LATAM y USA.

Estamos en búsqueda de talento para la posición: Sr SRE Engineer

Experiencia: +6 años de experiencia en SRE, DevOps, Cloud Infrastructure o Platform Engineering.

  • AWS avanzado y experiencia con sistemas productivos a escala.
  • Kubernetes / Docker / ECS.
  • Terraform avanzado.
  • Datadog / Observability: métricas, logs, traces, APM y monitoring.
  • SLI/SLO, Error Budgets y Gestión de Incidentes.
  • Python + Bash.
  • CI/CD: GitHub Actions, Jenkins, GitLab CI, ArgoCD o similares.
  • Linux y networking.
  • PagerDuty/Opsgenie.
  • Disaster Recovery, Chaos Engineering y resiliencia.
  • Experiencia práctica con asistentes basados en LLM o agentes de IA aplicados a operaciones.

Responsabilidades:

  • Liderar incidentes críticos, troubleshooting, RCA y postmortems.
  • Diseñar y administrar observabilidad, monitoreo, SLI/SLO y error budgets, principalmente con Datadog.
  • Diseñar arquitecturas confiables en AWS: ECS/Fargate, EKS, Lambda, RDS/Aurora, ALB, SQS/SNS y Step Functions.
  • Trabajar en capacity planning, performance, FinOps, disaster recovery y chaos engineering.
  • Implementar controles de confiabilidad en CI/CD, incluyendo canary, blue/green deployments y automated rollback.
  • Desarrollar automatizaciones y herramientas con Python y Bash.
  • Crear y mantener módulos de Terraform.
  • Utilizar AI SRE/AIOps para incident triage, anomaly detection, alert-noise reduction y predictive analytics.
  • Diseñar guardrails para AI Agents y evaluar riesgos de sus acciones en producción.
  • Mentorear a ingenieros junior y liderar iniciativas de confiabilidad.

Idioma: inglés avanzado conversacional (interactúa de manera efectiva con equipos internacionales)

Zona de trabajo: Guadalajara

Si cumples con el perfil, envía tu CV al correo señalado, mencionando expectativas económicas y en asunto el nombre de la vacante

Para mayor información en: mari.rodriguez@dresdenpartners.com

Similar roles