Arquitecto de Soluciones Sénior de Operaciones de Red e Infraestructura Cloud
En remoto desde España
El portal de empleo de España
En remoto desde España·Añadida hace 15 días
20 ofertas abiertas
Totalmente en remoto
Según la oferta.
Tener 8+ años de experiencia
Puesto de nivel Senior.
Titulación universitaria
«BS/MS/PhD in Computer Science, Electrical/Computer Engineering, Physics, Mathematics, or related fields, or equivalent experience.» — según la oferta.
Esta oferta se ha traducido automáticamente al español.
Más de 8 años en la gestión de entornos de nube escalables y en roles de ingeniería de automatización.
Experiencia en Cloud, HPC y GPU: Comprensión demostrada de los fundamentos de redes y arquitecturas de centros de datos, con experiencia práctica en la gestión de clústeres de HPC/IA e infraestructura acelerada por GPU de NVIDIA: despliegue, gestión de controladores y del "CUDA toolkit", optimización, perfilado de cargas de trabajo y resolución de problemas en CPUs, GPUs e interconexiones de alta velocidad.
Cargas de trabajo de Kubernetes y AI/ML: Amplia trayectoria con Kubernetes para la orquestación de contenedores, planificación de recursos y escalado en entornos de HPC y acelerados por GPU, incluyendo el funcionamiento interno de los planificadores, planificadores de lotes como Slurm y entornos multiinquilino mixtos de bare-metal/virtualizados (por ejemplo, KubeVirt).
Linux y sistemas de almacenamiento: Conocimiento profundo de Linux (RedHat, Ubuntu), seguridad a nivel de SO y protocolos. Experiencia con soluciones de almacenamiento como Lustre, GPFS, ZFS, XFS y tecnologías emergentes de almacenamiento para Kubernetes.
Automatización, GitOps y observabilidad: Dominio de scripting en Python y Bash, gestión de la configuración y herramientas de "Infrastructure-as-Code" (por ejemplo, Ansible, Terraform), gestión del ciclo de vida y actualización de clústeres basada en GitOps para grandes flotas, y pilas de observabilidad (Grafana, Loki, Prometheus) para la monitorización, el registro y la creación de sistemas tolerantes a fallos.
Fiabilidad de la flota y compromiso con el cliente: Capacidad demostrada para medir y mejorar el MTBI y el "job goodput" en grandes clústeres de GPU (detección de fallos, flujos de trabajo de drenaje y remediación, definición de SLO/presupuesto de errores y revisión post-incidente), combinada con una sólida trayectoria consultiva liderando revisiones arquitectónicas y presentaciones ante partes interesadas ejecutivas.
Conocimiento de pipelines de CI/CD y arquitecturas de microservicios basadas en contenedores para el despliegue de software y la automatización.
Experiencia con los "NVIDIA GPU and Network Operators" para la gestión automatizada del ciclo de vida de los recursos de red y GPU en Kubernetes, y con "NVIDIA Base Command Manager" (BCM) para el aprovisionamiento, la gestión y la monitorización de clústeres de GPU a escala.
Familiaridad con las herramientas de telemetría de la flota y la salud de las GPU: diagnósticos DCGM y XID, agentes de salud a nivel de nodo e inteligencia de fiabilidad de toda la flota.
Experiencia en frameworks de inferencia y planificación nativos de IA en Kubernetes (por ejemplo, KAI, Grove, Dynamo, NVIDIA Cloud Functions).
Experiencia con tejidos basados en RDMA (InfiniBand o RoCE) en entornos de HPC o IA. Es un gran plus tener experiencia con tejidos Cumulus Linux, SONiC o Spectrum-X, servicios de infraestructura DPU/DOCA y operaciones de partición NVLink/NVSwitch (NMX-C / NMX-M) en sistemas de clase NVL72.
Grado/Máster/Doctorado en Ciencias de la Computación, Ingeniería Eléctrica/Informática, Física, Matemáticas o campos relacionados, o experiencia equivalente.
NVIDIA busca un "Senior Cloud Infrastructure and DevOps Solutions Architect" para unirse a su "NVIDIA Infrastructure Specialist Team". Organizaciones académicas y comerciales de todo el mundo utilizan productos NVIDIA para redefinir el aprendizaje profundo y el análisis de datos, y para potenciar los centros de datos de próxima generación. ¡Únete al equipo que construye y asesora en muchos de los sistemas de IA/HPC más grandes y rápidos del mundo!
Buscamos a alguien que combine una profunda experiencia técnica con sólidas habilidades de consultoría y comunicación. Este puesto interactuará directamente con clientes, socios y equipos multidisciplinares para evaluar, diseñar y guiar la implementación de proyectos de infraestructura a gran escala. El alcance abarca la arquitectura de sistemas, plataformas basadas en Kubernetes y la automatización, actuando tanto como asesor de confianza como líder técnico práctico. Te situarás en el centro del modelo operativo de "NVIDIA's Cloud Partner" (NCP), cubriendo todo el ciclo de vida desde el "Day 1" hasta el "Day 2": desde la entrega del hardware de un clúster de GPU, pasando por la validación de la solución completa, hasta una plataforma estable en producción que funcione con el máximo "goodput". Los entornos de NCP priorizan el código abierto y son heterogéneos (Kubernetes upstream, KubeVirt, Slurm, Prometheus/Grafana, Cumulus/SONiC y una larga lista de software ISV), por lo que este rol es deliberadamente agnóstico a las herramientas: conocerás a cada socio en la pila tecnológica que realmente utiliza, en lugar de centrarte en un único producto propietario.
Responsabilizarse de la validación de la solución completa en la pila de software del socio (la capa por encima de la validación del hardware), incluyendo pruebas de estabilidad en todo el clúster, aceptación de cargas de trabajo de entrenamiento reales y pruebas de rodaje ("burn-in") de varios días y múltiples racks frente a los objetivos acordados de MTBI y "goodput".
Minimizar el tiempo desde la entrega del clúster hasta la primera carga de trabajo de producción, trabajando en la puesta en marcha del hardware, la recepción de servicios gestionados y con los propios equipos de operaciones del socio para eliminar la duplicación de validaciones y las fricciones en la entrega.
Responsabilizarse de la estabilidad de producción en el "Day 2" a escala de flota: monitorización, registro y orquestación de cargas de trabajo, detección y remediación de fallos, mantenimiento preventivo y campañas proactivas de despliegue de firmware y avisos de campo.
Evaluar los entornos de los clientes y operar plataformas abiertas heterogéneas (Kubernetes upstream, KubeVirt, Slurm y planificadores con conocimiento de GPU) integradas con redes y almacenamiento de nivel empresarial, y habilitar cargas de trabajo de ISV de terceros sobre ellas.
Proporcionar orientación consultiva y resolución de problemas práctica en toda la pila (bare metal, sistema operativo, pila de software, plataforma de contenedores, redes y almacenamiento) y apoyar en I+D, POC y POV para validar nuevas funciones, arquitecturas y enfoques de actualización.
Actuar como líder técnico para las cuentas asignadas: realizar transferencias de conocimiento y capacitación estructuradas, y producir manuales de ejecución ("runbooks"), materiales de incorporación y guías de mejores prácticas para que los equipos de los socios puedan operar configuraciones avanzadas de forma independiente.
NVIDIA es una empresa tecnológica global que diseña y fabrica unidades de procesamiento gráfico (GPU) y unidades de sistema en chip para juegos, visualización profesional, centros de datos e inteligencia artificial. Fundada en 1993, NVIDIA se ha convertido en una corporación multinacional con un valor de mercado que supera el billón de dólares, empleando a más de 26,000 personas en todo el mundo. La empresa es un nombre conocido en la industria tecnológica, impulsando desde consolas de juegos hasta los supercomputadores de IA más avanzados del mundo.
En España, NVIDIA tiene una presencia significativa con oficinas en Madrid y Barcelona, centradas en ventas, relaciones con desarrolladores y arquitectura de soluciones para las regiones de Europa del Sur y EMEA. La empresa es conocida por una cultura de alto rendimiento e innovación que atrae a los mejores talentos de ingeniería a nivel global. Para los profesionales internacionales, NVIDIA ofrece una compensación competitiva, una marca fuerte y la oportunidad de trabajar en tecnologías de IA y HPC de vanguardia, lo que la convierte en un empleador muy atractivo para aquellos que buscan reubicarse en España.
o explora DevOps y SRE·Senior·Remoto