El portal de empleo de España
Ingeniero de Fiabilidad de Sitios Sénior (MAAS)
En remoto, Madrid·Jornada completa·Añadida hace 4 días
16 ofertas abiertas
Resumen
Detalles del puesto
Jornada completa
Según la oferta.
Totalmente en remoto
Solo desde ciertos lugares, según la oferta: «Fully remote, EU timezone (CET ±2h)»
Requisitos
Trabajar en inglés
Se requiere inglés, según la oferta.
Tener 5+ años de experiencia
Puesto de nivel Senior.
Esta oferta se ha traducido automáticamente al español.
Salario y beneficios
Qué ofrecen
100% remoto con horario de trabajo flexible
Rol de alto impacto con una significativa responsabilidad técnica y autonomía
Trabajo directo con bare-metal, Kubernetes, redes e infraestructura de GPU
Equipo internacional orientado a la ingeniería
Gran enfoque en la automatización, la fiabilidad y la infraestructura a escala
Oportunidad de dar forma a la arquitectura y los fundamentos operativos de una plataforma cloud en crecimiento
Requisitos
Qué buscan
Más de 5 años de experiencia práctica en SRE, Infraestructura, Sistemas o Ingeniería de Plataformas.
Nivel experto en administración de Linux, particularmente Debian/Ubuntu.
Sólida experiencia en producción con MAAS y aprovisionamiento bare-metal.
Experiencia práctica de nivel experto operando Kubernetes en producción, incluyendo el ciclo de vida del clúster, redes, almacenamiento, actualizaciones y resolución de problemas.
Sólidas habilidades de ingeniería de redes en VLANs, enrutamiento L2/L3, bonding, VPNs, firewalls y DNS.
Sólidas habilidades de automatización con Ansible, Bash y/o Python.
Experiencia con Terraform/OpenTofu y flujos de trabajo de infraestructura basados en Git.
Experiencia en producción con Prometheus/Grafana o plataformas de observabilidad comparables.
Experiencia con respuesta a incidentes, operaciones de guardia, monitorización, alertas y prácticas de fiabilidad.
Experiencia con Proxmox, KVM/libvirt, OpenStack, VMware o tecnologías de virtualización comparables.
Experiencia con hardware bare-metal, BMCs, IPMI/Redfish, almacenamiento y resolución de problemas de hardware.
Sólido conocimiento de sistemas distribuidos, orquestación de contenedores y fiabilidad de la infraestructura.
Experiencia con la seguridad de la infraestructura, incluyendo RBAC, firewalls, políticas de red, gestión de secretos y endurecimiento de la seguridad.
Capacidad para crear SOPs, runbooks y procesos operativos desde cero.
Comodidad trabajando de forma autónoma en un entorno dinámico orientado a la ingeniería.
Se valorará
Experiencia operando infraestructura de GPU o entornos Kubernetes/bare-metal con gran carga de GPU.
Proxmox VE con ZFS/Ceph y GPU passthrough.
VictoriaMetrics / VictoriaLogs o plataformas de observabilidad a gran escala similares.
NetBox u otras plataformas de IPAM / inventario de infraestructura.
Vault, SOPS, Atlantis o herramientas similares de automatización y seguridad de infraestructura.
Experiencia con APIs de Cloudflare, automatización de DNS o túneles.
Experiencia con UniFi o plataformas de redes de sitio comparables.
Experiencia con service mesh o implementaciones avanzadas de CNI.
Experiencia con Go, particularmente para herramientas de infraestructura o exporters personalizados.
Experiencia con Ceph o bases de datos distribuidas ejecutándose en bare metal.
Experiencia operando infraestructura en múltiples sitios y zonas horarias.
Experiencia estableciendo marcos de trabajo de SRE y prácticas de fiabilidad en organizaciones en crecimiento.
El puesto
Pragmatike está contratando un Senior SRE / Infrastructure Engineer para ayudar a operar y escalar una plataforma de infraestructura distribuida que abarca nodos GPU bare-metal, Kubernetes, virtualización, redes y entornos multi-sitio.
Trabajarás cerca de la propia infraestructura, desde BMCs, hardware y aprovisionamiento con MAAS hasta Kubernetes, redes, observabilidad, automatización y operaciones de sitio.
Este es un rol práctico para alguien que disfrute asumiendo la responsabilidad de la infraestructura de extremo a extremo, construyendo sistemas fiables y automatizando todo lo que pueda automatizarse. La experiencia en startups o entornos de hipercrecimiento es un gran plus: aquí la autonomía, la responsabilidad y la velocidad son fundamentales.
Qué harás
Operar y mantener una infraestructura Linux a gran escala en entornos bare-metal y virtualizados basados en Debian/Ubuntu.
Responsabilizarse del aprovisionamiento bare-metal basado en MAAS, incluyendo controladores de región/rack, PXE, puesta en marcha (commissioning), cloud-init, ciclo de vida de los nodos y automatización mediante API/CLI.
Operar y mantener clústeres de Kubernetes en producción, incluyendo actualizaciones, pools de nodos, redes, almacenamiento, endurecimiento de la seguridad (security hardening) y resolución de problemas.
Diseñar y mantener redes multi-sitio a través de VLANs, enrutamiento L2/L3, interfaces bonded, VPNs, firewalls y DNS.
Automatizar el aprovisionamiento y las operaciones de infraestructura utilizando Ansible, Bash/Python, OpenTofu/Terraform y flujos de trabajo basados en Git.
Construir y mantener flujos de trabajo de despliegue automatizados, incluyendo PXE, Preseed y cloud-init.
Operar plataformas de observabilidad utilizando Prometheus, Grafana, Alertmanager, VictoriaMetrics/VictoriaLogs o herramientas comparables.
Definir y mejorar los SLIs, SLOs, la alerta y las prácticas de fiabilidad en todos los servicios de infraestructura y plataforma.
Liderar la respuesta a incidentes, la resolución de problemas, la escalada y las mejoras post-incidente de la infraestructura.
Mantener los procesos de guardia (on-call) y la cobertura operativa en entornos distribuidos.
Trabajar cerca de la capa de hardware, incluyendo IPMI/Redfish, BMCs, RAID, almacenamiento, diagnóstico de hardware e infraestructura de GPU.
Gestionar plataformas de virtualización incluyendo Proxmox, KVM/libvirt, OpenStack o VMware, incluyendo el paso de GPU (GPU passthrough) cuando sea necesario.
Construir y mantener herramientas de infraestructura interna para el descubrimiento de hosts, configuración, IPAM, salud del hardware y automatización operativa.
Responsabilizarse de las actividades del ciclo de vida de la infraestructura, incluyendo la incorporación de sitios, mantenimiento, desmantelamiento, detección de desviaciones (drift detection) y manuales operativos (runbooks).
Trabajar estrechamente con los equipos de ingeniería y equipos multidisciplinares para mejorar la fiabilidad, la utilización de recursos y la eficiencia operativa.
Cómo trabajarás
Ubicación: Totalmente remoto, zona horaria de la UE (CET ±2h)
Fecha de inicio: Lo antes posible
Idiomas: Se requiere inglés fluido
Sector: Cloud Computing / Infraestructura de GPU
Sobre Pragmatike
Pragmatike es una empresa de servicios y consultoría de TI especializada en computación en la nube, ingeniería de datos y operaciones de aprendizaje automático (MLOps). La empresa ayuda a las empresas a construir y escalar su infraestructura de datos e IA, con un fuerte enfoque en Kubernetes, arquitecturas nativas de la nube y cargas de trabajo de IA basadas en GPU. Pragmatike opera como una organización remota-first, sirviendo a clientes principalmente en la región EMEA.
Pragmatike tiene una presencia significativa en España, con su sede en Madrid y un equipo de ingenieros trabajando de forma remota en todo el país. La empresa es muy relevante para profesionales internacionales dado su modelo de contratación totalmente remoto, que permite a los ingenieros trabajar desde cualquier lugar de España o de la región EMEA en general. Sus puestos abiertos en España, como Principal ML Ops Engineer y AI Infrastructure Engineer, son muy adecuados para talento internacional que busque unirse a una consultoría de nube e IA especializada y de rápido crecimiento.
- Sector
- IT Services
- Fundación
- 2021
- Plantilla
- 50–200
- Sede
- Madrid, Spain
- En España
- Madrid
Datos prácticos
- Roles 100% remotos en EMEA: no se requiere reubicación a una oficina específica
- El proceso de contratación se realiza en inglés, lo que lo hace accesible para candidatos internacionales
- Enfoque en el stack moderno de nube e IA (Kubernetes, GPU, MLOps): muy relevante para ingenieros provenientes de grandes tecnológicas o startups
- Nómina y contrato en España a través de un EOR (Employer of Record) local para contrataciones internacionales
- Equipo pequeño y ágil (alrededor de 50 personas): los ingenieros tienen exposición directa a clientes y decisiones de arquitectura
En sus propias palabras
Información adicional
Pragmatike se compromete con un proceso de selección justo, transparente e inclusivo. No discriminamos por edad, discapacidad, género, identidad o expresión de género, estado civil o de pareja de hecho, embarazo o maternidad, raza, religión o creencias, sexo u orientación sexual.
De acuerdo con el RGPD, sus datos personales serán tratados de forma lícita, leal y segura, y se utilizarán únicamente con fines de selección, lo que incluye compartirlos con nuestro/s cliente/s para la consideración de empleo.




