El portal de empleo de España
Arquitecto de Soluciones Sénior de Operaciones de Red e Infraestructura Cloud
En remoto desde España·Añadida hace 2 días
20 ofertas abiertas
Resumen
Detalles del puesto
Totalmente en remoto
Según la oferta.
Requisitos
Trabajar en inglés
Se requiere inglés, según la oferta.
Tener 5+ años de experiencia
Puesto de nivel Senior.
Titulación universitaria
«BS/MS/PhD in Computer Science, Electrical/Computer Engineering, Physics, Mathematics, or related fields, or equivalent experience.» — según la oferta.
Esta oferta se ha traducido automáticamente al español.
Requisitos
Qué buscan
Grado/Máster/Doctorado en Ciencias de la Computación, Ingeniería Eléctrica/Informática, Física, Matemáticas o campos relacionados, o experiencia equivalente.
Más de 5 años de experiencia profesional en redes de centros de datos, ingeniería de arquitecturas ("fabric engineering") o roles de operaciones de red a gran escala.
Redes de "Fabric" y Centros de Datos: Comprensión profunda de las arquitecturas de red de centros de datos y arquitecturas RDMA (InfiniBand y RoCE/Ethernet), incluyendo el diseño de topología y enrutamiento (fat-tree, optimizado para "rail"), control de congestión, configuración de pérdida cero/QoS y resolución de problemas en NICs, conmutadores e interconexiones de alta velocidad.
Tecnologías de Fabric de NVIDIA: Experiencia práctica con InfiniBand y UFM, Spectrum-X Ethernet, Cumulus Linux y/o SONiC, NICs/DPUs ConnectX y BlueField, y sistemas NVLink/NVSwitch; idealmente incluyendo operaciones de partición NMX-C / NMX-M en plataformas de clase NVL72.
Plataformas Linux y de Conmutación: Conocimiento profundo de Linux (RedHat, Ubuntu) y sistemas operativos de conmutación, funcionamiento interno de sistemas operativos de red, redes de host y seguridad a nivel de SO, junto con la comprensión de los patrones de tráfico de almacenamiento y cómputo de clústeres de HPC/IA.
Automatización, GitOps y Observabilidad: Competencia en scripting con Python y Bash, gestión de configuración y herramientas de Infraestructura como Código (por ejemplo, Ansible, Terraform), configuración de red basada en GitOps y gestión de firmware/actualizaciones para grandes flotas, y pilas de observabilidad (Grafana, Loki, Prometheus) aplicadas a la telemetría de la arquitectura.
Fiabilidad de la flota y compromiso con el cliente: Capacidad demostrada para medir y mejorar el MTBI y el "job goodput" en grandes clústeres de GPU (detección de fallos, flujos de trabajo de drenaje y remediación, definición de SLO/presupuesto de errores y revisión post-incidente), combinada con una sólida trayectoria consultiva liderando revisiones arquitectónicas y presentaciones ante partes interesadas ejecutivas.
Se valorará
Experiencia operando redes Kubernetes en clústeres de GPU: complementos CNI, conexión de múltiples redes, SR-IOV y complementos de dispositivos RDMA, así como con los NVIDIA Network y GPU Operators para la gestión automatizada del ciclo de vida de los recursos.
Experiencia con servicios de infraestructura DOCA y DPU (por ejemplo, DOCA DPF) para servicios de red, seguridad y almacenamiento descargados ("offloaded").
Familiaridad con la telemetría de salud de la arquitectura y de la GPU: diagnósticos DCGM y XID, contadores a nivel de enlace y de conmutador, agentes de salud a nivel de nodo e inteligencia de fiabilidad para toda la flota.
Conocimiento del comportamiento del tráfico de entrenamiento a gran escala: ajuste de comunicación colectiva (NCCL), alineación de "rail" y diagnóstico de regresiones de rendimiento limitadas por la red en tareas de entrenamiento distribuido.
Experiencia proporcionando aislamiento de red multiinquilino para entornos de GPU como servicio: segmentación VRF/VLAN/EVPN, particionamiento de inquilinos y entrega segura de la arquitectura entre inquilinos.
El puesto
NVIDIA busca un "Senior Network and Fabric Operations Solutions Architect" para unirse a su "NVIDIA Infrastructure Specialist Team". Organizaciones académicas y comerciales de todo el mundo utilizan productos NVIDIA para redefinir el aprendizaje profundo y el análisis de datos, y para potenciar los centros de datos de próxima generación. ¡Únete al equipo que construye y asesora sobre las redes que sustentan muchos de los sistemas de IA/HPC más grandes y rápidos del mundo!
Buscamos a alguien que combine una profunda experiencia en redes con sólidas habilidades de consultoría y comunicación. Este puesto interactuará directamente con clientes, socios y equipos multifuncionales para evaluar, diseñar y operar las arquitecturas de cómputo, almacenamiento y "fabrics" de escalado que sustentan los grandes entornos de GPU, actuando tanto como un asesor de confianza como un líder técnico práctico. Serás el responsable de la parte de "fabric" del modelo operativo de "NVIDIA's Cloud Partner" (NCP) a lo largo de todo el ciclo de vida, desde el "Day 1" hasta el "Day 2": desde la validación de InfiniBand/UFM y Ethernet en la entrega, pasando por las operaciones de partición de NVLink, hasta una arquitectura de producción estable que funcione con el máximo "goodput". Los entornos de NCP priorizan el código abierto y son heterogéneos (Cumulus Linux, SONiC, Spectrum-X, servicios DOCA/DPU, Kubernetes upstream y Prometheus/Grafana), por lo que este rol es deliberadamente agnóstico en cuanto a herramientas: trabajarás con cada socio en la arquitectura que realmente utilicen en lugar de limitarte a un único producto propietario.
Qué harás
Responsable de las operaciones de "fabric" de "Day 2" en flotas de NCP: gestión de particiones NVLink/NVSwitch (NMX-C / NMX-M) en sistemas de clase GB200/GB300 NVL72, aislamiento de particiones de mantenimiento y flujos de trabajo seguros de cambio de partición para entornos multiinquilino.
Responsable del ciclo de vida del software y firmware de los conmutadores: actualizaciones de Cumulus Linux, SONiC y sistemas operativos de conmutación, campañas de despliegue de CPLD y avisos de campo, con planes de actualización escalonados y probados que eviten que las arquitecturas de los socios utilicen versiones obsoletas sin interrumpir las cargas de trabajo de producción.
Soporte en la validación y aceptación de la arquitectura en el "Day 1": puesta en marcha de InfiniBand y UFM, configuración de Spectrum-X/RoCE Ethernet, verificación de cableado y estado de los enlaces, validación de enrutamiento y control de congestión, y pruebas de rodaje ("burn-in") de varios días y múltiples racks frente a los objetivos acordados de MTBI y "goodput".
Minimizar el tiempo desde la entrega del clúster hasta la primera carga de trabajo de producción, eliminando la validación duplicada de la arquitectura entre la puesta en marcha del hardware, la incorporación de servicios gestionados y los propios equipos de operaciones de red del socio.
Impulsar la fiabilidad de la arquitectura a escala de flota: telemetría para fluctuaciones de enlace ("link flaps"), retransmisiones y congestión, detección de fallos hasta su subsanación, análisis de causa raíz de fallos de tareas inducidos por la red, y mejora medible del MTBI y del "goodput" de las tareas.
Proporcionar orientación consultiva y resolución de problemas práctica en toda la pila de la arquitectura: NICs y DPUs, sistema operativo del conmutador, enrutamiento y control de congestión, redes de host e integración de redes Kubernetes; y actuar como líder técnico para las cuentas asignadas, realizando transferencias de conocimiento estructuradas y produciendo manuales de ejecución ("runbooks") para que los equipos de los socios puedan operar configuraciones avanzadas de forma independiente.
Sobre NVIDIA
NVIDIA es una empresa tecnológica global que diseña y fabrica unidades de procesamiento gráfico (GPU) y unidades de sistema en chip para juegos, visualización profesional, centros de datos e inteligencia artificial. Fundada en 1993, NVIDIA se ha convertido en una corporación multinacional con un valor de mercado que supera el billón de dólares, empleando a más de 26,000 personas en todo el mundo. La empresa es un nombre conocido en la industria tecnológica, impulsando desde consolas de juegos hasta los supercomputadores de IA más avanzados del mundo.
En España, NVIDIA tiene una presencia significativa con oficinas en Madrid y Barcelona, centradas en ventas, relaciones con desarrolladores y arquitectura de soluciones para las regiones de Europa del Sur y EMEA. La empresa es conocida por una cultura de alto rendimiento e innovación que atrae a los mejores talentos de ingeniería a nivel global. Para los profesionales internacionales, NVIDIA ofrece una compensación competitiva, una marca fuerte y la oportunidad de trabajar en tecnologías de IA y HPC de vanguardia, lo que la convierte en un empleador muy atractivo para aquellos que buscan reubicarse en España.
- Sector
- Technology
- Fundación
- 1993
- Plantilla
- 26,000–30,000
- Sede
- Santa Clara, USA
- En España
- Madrid, Barcelona
- Web
- nvidia.com
Datos prácticos
- NVIDIA tiene oficinas en Madrid y Barcelona, con un fuerte enfoque en los mercados de Europa del Sur y EMEA.
- La empresa es líder mundial en computación de IA, ofreciendo a los ingenieros la oportunidad de trabajar en tecnologías de vanguardia como CUDA, cuDNN y la plataforma NVIDIA AI Enterprise.
- La cultura laboral de NVIDIA es conocida por ser rápida, innovadora y orientada al rendimiento, con un fuerte énfasis en la excelencia técnica.
- La empresa ofrece paquetes de compensación y beneficios competitivos, y está constantemente clasificada como uno de los mejores lugares para trabajar en la industria tecnológica.
- Para las contrataciones internacionales, NVIDIA proporciona patrocinio de visados y apoyo para la reubicación, lo que la convierte en una opción viable para los profesionales que buscan mudarse a España.



