El portal de empleo de España

Ingeniero de Confiabilidad de Sitio

Presencial en España·Jornada completa·Añadida hace 9 meses

Esta oferta se publicó hace 9 meses

Plenit

8 ofertas abiertas

Resumen

Detalles del puesto

  • Contrato indefinido

    Jornada completa.

Requisitos

  • Trabajar en inglés

    Se requiere inglés, según la oferta.

  • Trabajar presencialmente en España

    No se menciona ninguna ayuda para la mudanza.

  • Tener experiencia de nivel sénior

    Puesto de nivel Senior.

Esta oferta se ha traducido automáticamente al español.

Requisitos

Qué buscan

Buscamos un Site Reliability Engineer senior con sólida experiencia operando entornos de producción críticos y una capacidad demostrada para identificar riesgos, solucionar problemas complejos e impulsar mejoras de fiabilidad a largo plazo.

  • Sólida capacidad de resolución de problemas y capacidad para analizar métricas, logs, trazas, eventos y el comportamiento del sistema.
  • Amplio conocimiento técnico en infraestructura, aplicaciones, redes, almacenamiento y bases de datos.
  • Fuerte pensamiento basado en el riesgo, con capacidad para distinguir el trabajo urgente del trabajo preventivo importante.
  • Capacidad para convertir las preocupaciones operativas en acciones concretas, responsables, plazos y resultados medibles.
  • Capacidad para mantener la calma bajo presión actuando de forma decisiva y proactiva.
  • Gran sentido de la responsabilidad sobre la estabilidad de la plataforma y la recuperación del servicio.
  • Fuertes habilidades de coordinación durante incidentes, migraciones, cambios y escaladas técnicas.
  • Comunicación clara con equipos técnicos, partes interesadas y afectados.
  • Capacidad para cuestionar de forma constructiva los cambios inseguros o la preparación operativa insuficiente.
  • Sólidos hábitos de documentación y compromiso con el conocimiento operativo compartido.
  • Mentalidad de mejora continua centrada en reducir incidentes, el tiempo de recuperación, el esfuerzo operativo y la intervención manual.
  • Motivación para actuar como referente técnico clave durante escenarios complejos y de alto impacto.

Se valorará

  • La familiaridad con Kubernetes y plataformas de contenedores es muy valiosa.
  • La experiencia con infraestructura en la nube es muy valiosa.

El puesto

Como Site Reliability Engineer, desempeñarás un papel fundamental para garantizar la estabilidad, disponibilidad, resiliencia y rendimiento de nuestra plataforma en la nube en producción.

Tu misión cubrirá dos áreas complementarias. En primer lugar, trabajarás de forma proactiva para prevenir incidentes mediante la identificación de riesgos operativos, la anticipación de limitaciones de capacidad, la mejora de los cambios en producción, la resolución de problemas recurrentes y el impulso de mejoras de fiabilidad, migraciones e iniciativas correctivas. En segundo lugar, cuando se produzcan incidentes, ayudarás a restaurar el servicio rápidamente coordinando el diagnóstico técnico, controlando la situación, comunicando el impacto y liderando los esfuerzos de recuperación.

Este es un puesto senior y práctico para alguien con una fuerte mentalidad operativa que se sienta cómodo trabajando en entornos de producción complejos, investigando problemas técnicos, tomando decisiones bajo presión y asumiendo la responsabilidad de la fiabilidad de la plataforma.

Formarás parte del equipo de Site Reliability Engineering, trabajando en un entorno práctico centrado en mantener la plataforma estable mientras se reduce continuamente el riesgo operativo y el esfuerzo manual.

Una parte clave del rol será identificar qué podría afectar a la plataforma antes de que se convierta en un incidente. Evaluarás los riesgos, los harás visibles, definirás planes de mitigación o corrección, asignarás responsables y harás un seguimiento de las acciones hasta su finalización. También contribuirás a la planificación de la capacidad, el escalado de producción, las mejoras de infraestructura, las migraciones, la observabilidad, la automatización y la preparación operativa.

Cuando ocurran incidentes, actuarás como referente técnico y punto de coordinación. Ayudarás a establecer el control, evaluar el impacto, acelerar el diagnóstico, involucrar a los equipos adecuados, comunicarte con claridad y restaurar el servicio de la forma más rápida y segura posible.

Trabajarás estrechamente con los equipos de ingeniería, sistemas, redes, almacenamiento, bases de datos, seguridad y producto. Tu perspectiva operativa ayudará a garantizar que la fiabilidad, la escalabilidad, la capacidad de recuperación y la operatividad se tengan en cuenta en los cambios y la evolución de la plataforma.

El éxito en este puesto significa que los riesgos operativos se identifican pronto, los problemas de capacidad se anticipan, los cambios en producción son más seguros, los problemas recurrentes se abordan de forma permanente y la plataforma se vuelve progresivamente más observable, resiliente, escalable y fácil de operar.

Cuando ocurren incidentes, se controlan rápidamente, se comunican con claridad y se resuelven con un tiempo de recuperación reducido. El objetivo no es solo responder mejor, sino reducir el número, la frecuencia y el impacto de los incidentes con el tiempo.

Qué harás

  • Operar infraestructuras de producción críticas garantizando la disponibilidad, estabilidad, rendimiento y capacidad de recuperación.
  • Identificar riesgos técnicos y operativos e impulsar planes de mitigación, corrección o contingencia.
  • Mantener un backlog priorizado de riesgos, problemas recurrentes, limitaciones de capacidad y mejoras de fiabilidad.
  • Liderar los procesos de respuesta ante incidentes, incluyendo la evaluación del impacto, el diagnóstico técnico, la coordinación, la comunicación y la restauración del servicio.
  • Realizar análisis de causa raíz e implementar acciones correctivas y preventivas.
  • Gestionar problemas recurrentes y asegurar que sigan siendo visibles, tengan un responsable, estén priorizados y se les dé seguimiento hasta su resolución.
  • Monitorizar la demanda, los límites del sistema, las tendencias de crecimiento, los cuellos de botella y los puntos de saturación.
  • Contribuir a la planificación de la capacidad y ejecutar el escalado de la infraestructura en entornos de producción.
  • Revisar los cambios de infraestructura, despliegues, actividades de mantenimiento y migraciones desde una perspectiva de fiabilidad.
  • Definir planes de implementación, validación, rollback y contingencia para los cambios en producción.
  • Mejorar la observabilidad mediante métricas, logs, trazas, alertas, dashboards e indicadores de salud del servicio.
  • Mejorar los runbooks, los playbooks de diagnóstico, los procedimientos de recuperación y la documentación operativa.
  • Identificar tareas repetitivas, escaladas innecesarias y procesos manuales que deban automatizarse o simplificarse.
  • Trabajar con sistemas que soportan aplicaciones web, incluyendo un sólido conocimiento de HTTP, DNS, TCP/IP y equilibrado de carga (load balancing).
  • Administrar tecnologías como NGINX, Apache, equilibradores de carga, bases de datos e infraestructura web relacionada.
  • Sólida experiencia con sistemas Linux y conocimientos operativos de entornos Windows.
  • Buen conocimiento de redes, virtualización, almacenamiento, bases de datos y dependencias de infraestructura.

Cómo trabajarás

La participación en una rotación de guardia (on-call) y la respuesta a incidentes críticos fuera del horario laboral habitual forman parte del puesto.

Herramientas

  • Herramientas de observabilidad para métricas, logs, trazas, alertas y dashboards.
  • Herramientas de infraestructura y administración de sistemas en entornos Linux y Windows.
  • Tecnologías de redes, virtualización, almacenamiento y bases de datos.
  • Herramientas de infraestructura web como equilibradores de carga, NGINX, Apache y proxies.
  • Infraestructura en la nube y plataformas de gestión de configuración.
  • Tecnologías de Kubernetes y orquestación de contenedores.
  • Herramientas de gestión de incidentes y de guardia (on-call).
  • Herramientas de documentación operativa, runbooks, playbooks y procedimientos de incidentes.
  • Herramientas de planificación de capacidad, análisis de rendimiento y escalado de infraestructura.
  • Herramientas de automatización y scripting.

Sobre Plenit

Plenit es la empresa detrás de 'The Operating Platform trusted by the IT Channel', una plataforma todo en uno diseñada para empresas de TI que reúne servicios en la nube (servidores, escritorio remoto, almacenamiento de objetos y archivos, recuperación ante desastres), gestión de TI (monitorización de endpoints, parcheado y soporte remoto), un marketplace de software y herramientas de Go-To-Market.

Sector
Healthcare
Plantilla
100+

Datos prácticos

  • Plenit está presente en España, Portugal, Francia y México, y se describe a sí misma como un punto de referencia único para el sector de las TI en Europa y América.
  • La empresa informa de un equipo de más de 100 profesionales.
  • Los productos y servicios de Plenit son utilizados por más de 80.000 clientes finales en cuatro mercados diferentes.
  • La empresa ha recibido reconocimientos en España, incluyendo 'Las pymes españolas que están cambiando el mundo en 2025' y 'Fast 50 Spain 2025'.
  • Los puestos abiertos actualmente en España incluyen Virtualization Engineer, Site Reliability Engineer, Product Lead for Cloud Services, Product Lead for ITM, Account Executive, Country Manager Iberia, Senior Partner Development Manager, Technical Customer Success Engineer y People Operations Intern.
Todas las vacantes de Plenit
WhatsApp