El portal de empleo de España

Ingeniero de Fiabilidad de Sitios Sénior (MAAS)

En remoto, Madrid·Jornada completa·Añadida hace 4 días

Pragmatike

16 ofertas abiertas

Resumen

Detalles del puesto

  • Jornada completa

    Según la oferta.

  • Totalmente en remoto

    Solo desde ciertos lugares, según la oferta: «Fully remote, EU timezone (CET ±2h)»

Requisitos

  • Trabajar en inglés

    Se requiere inglés, según la oferta.

  • Tener 5+ años de experiencia

    Puesto de nivel Senior.

Esta oferta se ha traducido automáticamente al español.

Salario y beneficios

Qué ofrecen

  • 100% remoto con horario de trabajo flexible

  • Rol de alto impacto con una significativa responsabilidad técnica y autonomía

  • Trabajo directo con bare-metal, Kubernetes, redes e infraestructura de GPU

  • Equipo internacional orientado a la ingeniería

  • Gran enfoque en la automatización, la fiabilidad y la infraestructura a escala

  • Oportunidad de dar forma a la arquitectura y los fundamentos operativos de una plataforma cloud en crecimiento

Requisitos

Qué buscan

  • Más de 5 años de experiencia práctica en SRE, Infraestructura, Sistemas o Ingeniería de Plataformas.

  • Nivel experto en administración de Linux, particularmente Debian/Ubuntu.

  • Sólida experiencia en producción con MAAS y aprovisionamiento bare-metal.

  • Experiencia práctica de nivel experto operando Kubernetes en producción, incluyendo el ciclo de vida del clúster, redes, almacenamiento, actualizaciones y resolución de problemas.

  • Sólidas habilidades de ingeniería de redes en VLANs, enrutamiento L2/L3, bonding, VPNs, firewalls y DNS.

  • Sólidas habilidades de automatización con Ansible, Bash y/o Python.

  • Experiencia con Terraform/OpenTofu y flujos de trabajo de infraestructura basados en Git.

  • Experiencia en producción con Prometheus/Grafana o plataformas de observabilidad comparables.

  • Experiencia con respuesta a incidentes, operaciones de guardia, monitorización, alertas y prácticas de fiabilidad.

  • Experiencia con Proxmox, KVM/libvirt, OpenStack, VMware o tecnologías de virtualización comparables.

  • Experiencia con hardware bare-metal, BMCs, IPMI/Redfish, almacenamiento y resolución de problemas de hardware.

  • Sólido conocimiento de sistemas distribuidos, orquestación de contenedores y fiabilidad de la infraestructura.

  • Experiencia con la seguridad de la infraestructura, incluyendo RBAC, firewalls, políticas de red, gestión de secretos y endurecimiento de la seguridad.

  • Capacidad para crear SOPs, runbooks y procesos operativos desde cero.

  • Comodidad trabajando de forma autónoma en un entorno dinámico orientado a la ingeniería.

Se valorará

  • Experiencia operando infraestructura de GPU o entornos Kubernetes/bare-metal con gran carga de GPU.

  • Proxmox VE con ZFS/Ceph y GPU passthrough.

  • VictoriaMetrics / VictoriaLogs o plataformas de observabilidad a gran escala similares.

  • NetBox u otras plataformas de IPAM / inventario de infraestructura.

  • Vault, SOPS, Atlantis o herramientas similares de automatización y seguridad de infraestructura.

  • Experiencia con APIs de Cloudflare, automatización de DNS o túneles.

  • Experiencia con UniFi o plataformas de redes de sitio comparables.

  • Experiencia con service mesh o implementaciones avanzadas de CNI.

  • Experiencia con Go, particularmente para herramientas de infraestructura o exporters personalizados.

  • Experiencia con Ceph o bases de datos distribuidas ejecutándose en bare metal.

  • Experiencia operando infraestructura en múltiples sitios y zonas horarias.

  • Experiencia estableciendo marcos de trabajo de SRE y prácticas de fiabilidad en organizaciones en crecimiento.

El puesto

Pragmatike está contratando un Senior SRE / Infrastructure Engineer para ayudar a operar y escalar una plataforma de infraestructura distribuida que abarca nodos GPU bare-metal, Kubernetes, virtualización, redes y entornos multi-sitio.

Trabajarás cerca de la propia infraestructura, desde BMCs, hardware y aprovisionamiento con MAAS hasta Kubernetes, redes, observabilidad, automatización y operaciones de sitio.

Este es un rol práctico para alguien que disfrute asumiendo la responsabilidad de la infraestructura de extremo a extremo, construyendo sistemas fiables y automatizando todo lo que pueda automatizarse. La experiencia en startups o entornos de hipercrecimiento es un gran plus: aquí la autonomía, la responsabilidad y la velocidad son fundamentales.

Qué harás

  • Operar y mantener una infraestructura Linux a gran escala en entornos bare-metal y virtualizados basados en Debian/Ubuntu.

  • Responsabilizarse del aprovisionamiento bare-metal basado en MAAS, incluyendo controladores de región/rack, PXE, puesta en marcha (commissioning), cloud-init, ciclo de vida de los nodos y automatización mediante API/CLI.

  • Operar y mantener clústeres de Kubernetes en producción, incluyendo actualizaciones, pools de nodos, redes, almacenamiento, endurecimiento de la seguridad (security hardening) y resolución de problemas.

  • Diseñar y mantener redes multi-sitio a través de VLANs, enrutamiento L2/L3, interfaces bonded, VPNs, firewalls y DNS.

  • Automatizar el aprovisionamiento y las operaciones de infraestructura utilizando Ansible, Bash/Python, OpenTofu/Terraform y flujos de trabajo basados en Git.

  • Construir y mantener flujos de trabajo de despliegue automatizados, incluyendo PXE, Preseed y cloud-init.

  • Operar plataformas de observabilidad utilizando Prometheus, Grafana, Alertmanager, VictoriaMetrics/VictoriaLogs o herramientas comparables.

  • Definir y mejorar los SLIs, SLOs, la alerta y las prácticas de fiabilidad en todos los servicios de infraestructura y plataforma.

  • Liderar la respuesta a incidentes, la resolución de problemas, la escalada y las mejoras post-incidente de la infraestructura.

  • Mantener los procesos de guardia (on-call) y la cobertura operativa en entornos distribuidos.

  • Trabajar cerca de la capa de hardware, incluyendo IPMI/Redfish, BMCs, RAID, almacenamiento, diagnóstico de hardware e infraestructura de GPU.

  • Gestionar plataformas de virtualización incluyendo Proxmox, KVM/libvirt, OpenStack o VMware, incluyendo el paso de GPU (GPU passthrough) cuando sea necesario.

  • Construir y mantener herramientas de infraestructura interna para el descubrimiento de hosts, configuración, IPAM, salud del hardware y automatización operativa.

  • Responsabilizarse de las actividades del ciclo de vida de la infraestructura, incluyendo la incorporación de sitios, mantenimiento, desmantelamiento, detección de desviaciones (drift detection) y manuales operativos (runbooks).

  • Trabajar estrechamente con los equipos de ingeniería y equipos multidisciplinares para mejorar la fiabilidad, la utilización de recursos y la eficiencia operativa.

Cómo trabajarás

Ubicación: Totalmente remoto, zona horaria de la UE (CET ±2h)
Fecha de inicio: Lo antes posible
Idiomas: Se requiere inglés fluido
Sector: Cloud Computing / Infraestructura de GPU

Sobre Pragmatike

Pragmatike es una empresa de servicios y consultoría de TI especializada en computación en la nube, ingeniería de datos y operaciones de aprendizaje automático (MLOps). La empresa ayuda a las empresas a construir y escalar su infraestructura de datos e IA, con un fuerte enfoque en Kubernetes, arquitecturas nativas de la nube y cargas de trabajo de IA basadas en GPU. Pragmatike opera como una organización remota-first, sirviendo a clientes principalmente en la región EMEA.

Pragmatike tiene una presencia significativa en España, con su sede en Madrid y un equipo de ingenieros trabajando de forma remota en todo el país. La empresa es muy relevante para profesionales internacionales dado su modelo de contratación totalmente remoto, que permite a los ingenieros trabajar desde cualquier lugar de España o de la región EMEA en general. Sus puestos abiertos en España, como Principal ML Ops Engineer y AI Infrastructure Engineer, son muy adecuados para talento internacional que busque unirse a una consultoría de nube e IA especializada y de rápido crecimiento.

Sector
IT Services
Fundación
2021
Plantilla
50–200
Sede
Madrid, Spain
En España
Madrid

Datos prácticos

  • Roles 100% remotos en EMEA: no se requiere reubicación a una oficina específica
  • El proceso de contratación se realiza en inglés, lo que lo hace accesible para candidatos internacionales
  • Enfoque en el stack moderno de nube e IA (Kubernetes, GPU, MLOps): muy relevante para ingenieros provenientes de grandes tecnológicas o startups
  • Nómina y contrato en España a través de un EOR (Employer of Record) local para contrataciones internacionales
  • Equipo pequeño y ágil (alrededor de 50 personas): los ingenieros tienen exposición directa a clientes y decisiones de arquitectura

En sus propias palabras

Información adicional

Pragmatike se compromete con un proceso de selección justo, transparente e inclusivo. No discriminamos por edad, discapacidad, género, identidad o expresión de género, estado civil o de pareja de hecho, embarazo o maternidad, raza, religión o creencias, sexo u orientación sexual.

De acuerdo con el RGPD, sus datos personales serán tratados de forma lícita, leal y segura, y se utilizarán únicamente con fines de selección, lo que incluye compartirlos con nuestro/s cliente/s para la consideración de empleo.

Todas las vacantes de Pragmatike
WhatsApp