Ingeniero de Machine Learning Sénior, Optimización de Inferencia de LLM

En remoto, Europe·Añadida hoy

Nebius

32 ofertas abiertas

Resumen

Detalles del puesto

  • Totalmente en remoto

    Solo desde ciertos lugares, según la oferta: «Remote - Europe»

Requisitos

  • Trabajar en inglés

    Se requiere inglés, según la oferta.

  • Tener experiencia de nivel sénior

    Puesto de nivel Senior.

Esta oferta se ha traducido automáticamente al español.

Salario y beneficios

Qué ofrecen

  • Compensación competitiva
  • Oportunidades de crecimiento profesional y aprendizaje
  • Flexibilidad y autonomía
  • Cultura colaborativa e innovadora
  • Oportunidad de trabajar en proyectos de IA de gran impacto
  • Entorno internacional y equipos con talento

Requisitos

Qué buscan

  • Sólidas habilidades de ingeniería en Python y PyTorch.

  • Experiencia práctica desplegando u optimizando sistemas de inferencia de LLM, VLM o transformers de alto rendimiento.

  • Conocimiento práctico de al menos un stack de inferencia moderno como vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo, Ray Serve, KServe o sistemas internos equivalentes.

  • Comprensión profunda de los cuellos de botella de la inferencia de transformers, incluyendo KV cache, atención, ancho de banda de memoria, batching, paralelismo y servicio de contexto largo.

  • Capacidad para razonar cuantitativamente sobre las compensaciones (tradeoffs) entre latencia, rendimiento, calidad, utilización y coste.

  • Excelentes habilidades de comunicación y capacidad para colaborar con equipos de investigación, kernel, infraestructura, producto y clientes.

Se valorará

  • Experiencia con entrenamiento consciente de la cuantización, cuantización post-entrenamiento, FP8, INT8, INT4, NVFP4, MXFP4, AWQ, GPTQ, SmoothQuant o técnicas relacionadas.

  • Experiencia con destilación, decodificación especulativa, EAGLE, Medusa, predicción de múltiples tokens u otros métodos de aceleración de inferencia.

  • Experiencia con cargas de trabajo agénticas, incluyendo llamada a herramientas (tool calling), salidas estructuradas, APIs de streaming, alta concurrencia y orquestación de múltiples pasos.

  • Familiaridad con CUDA o Triton, incluso si el rol no es principalmente de ingeniería de kernels.

  • Contribuciones de código abierto a vLLM, SGLang, TensorRT-LLM, FlashInfer, LMCache, PyTorch, Triton, Ray, KServe o proyectos relacionados.

El puesto

Nebius Token Factory está construyendo servicios de inferencia rápidos, fiables y rentables para modelos de vanguardia. Como Senior Machine Learning Engineer en nuestro equipo de Applied AI, te encargarás de la optimización de modelos y endpoints, desde los artefactos del modelo hasta el despliegue en producción. Tu trabajo abarcará el funcionamiento interno de los modelos, motores de inferencia, arquitectura de servicio y benchmarking, con el objetivo de mejorar la latencia, el rendimiento (throughput), la eficiencia de memoria, la utilización de la GPU y el coste por token, manteniendo al mismo tiempo la calidad y la fiabilidad del modelo.

Este es un rol práctico en el que trabajarás en proyectos de optimización complejos, diagnosticarás problemas de servicio difíciles y ofrecerás mejoras mensurables en producción. Trabajando estrechamente con ingenieros de kernels y de plataforma, evaluarás configuraciones de servicio, resolverás regresiones de rendimiento y calidad, y optimizarás la inferencia para cargas de trabajo del mundo real, con el apoyo de benchmarks reproducibles y despliegues de producción seguros.

Qué harás

  • Liderar el trabajo de optimización para familias de modelos específicas, endpoints de clientes o backends de servicio.

  • Realizar comparaciones de motores y recomendar configuraciones de servicio prácticas para cargas de trabajo específicas.

  • Depurar regresiones de calidad o rendimiento del modelo durante los despliegues en producción.

  • Optimizar los endpoints de LLM y VLM en cuanto a latencia, rendimiento, eficiencia de memoria, utilización de la GPU, calidad y coste por token.

  • Desplegar, configurar, realizar benchmarks y ampliar motores de inferencia como vLLM, SGLang, TensorRT-LLM, Triton Inference Server, NVIDIA Dynamo o sistemas similares.

  • Construir y poner en producción flujos de trabajo de compresión de modelos, incluyendo cuantización, entrenamiento consciente de la cuantización (quantization-aware training), destilación, servicio de pocos bits (low-bit serving) y recuperación de precisión.

  • Implementar o integrar decodificación especulativa (speculative decoding), enfoques de modelos de borrador (draft-model), optimización de KV-cache, caché de prefijos, chunked prefill, continuous batching y servicio de prefill/decode desagregado.

  • Crear entornos de benchmark reproducibles para TTFT, TPOT, tokens por segundo por GPU, latencia p95/p99, memoria de GPU, fiabilidad y coste por token.

  • Colaborar con ingenieros de kernels de GPU e ingenieros de plataforma para diagnosticar cuellos de botella en las capas de código del modelo, kernels, runtime, scheduler, gateway y clúster.

  • Redactar documentos de diseño claros, informes de rendimiento, planes de despliegue y explicaciones técnicas orientadas al cliente.

Cómo es trabajar en Nebius

Ritmo rápido - Pensamiento audaz - Crecimiento constante - Impacto significativo - Confianza y responsabilidad real - Oportunidad de dar forma al futuro de la IA

Sobre Nebius

Nebius es una empresa de infraestructura de IA que proporciona plataformas cloud basadas en GPU, centros de datos y herramientas para desarrolladores para entrenar y desplegar modelos de aprendizaje automático. Fundada en 2024 como una escisión de Yandex, la empresa tiene su sede en Ámsterdam y opera a nivel global, con un fuerte enfoque en servir a startups y empresas de IA. Nebius es conocida por sus clústeres de GPU a gran escala y por su papel en la construcción de la columna vertebral de cómputo de IA para Europa y más allá.

En España, Nebius está expandiendo su presencia con una oficina dedicada en Madrid, contratando para roles en arquitectura de soluciones, ingeniería de centros de datos, seguridad y gestión de productos. La empresa ofrece un entorno de trabajo internacional y de ritmo rápido, con un fuerte énfasis en la excelencia técnica y la innovación en IA. Para profesionales internacionales, Nebius ofrece oportunidades para trabajar en proyectos de infraestructura de IA de vanguardia, con un equipo multicultural y un apoyo de reubicación competitivo.

Fundación
2024
Plantilla
500–1,000
Sede
Amsterdam, Netherlands
En España
Madrid

Datos prácticos

  • Nebius es una escisión de Yandex, una de las mayores empresas tecnológicas de Europa, y cuenta con una inversión significativa para infraestructura de IA.
  • La empresa tiene su sede en Ámsterdam, ofreciendo un entorno de trabajo multicultural y de habla inglesa.
  • Nebius está expandiendo rápidamente su huella de centros de datos en Europa, incluida España, creando oportunidades en ingeniería y operaciones.
  • La empresa se centra en servicios cloud nativos de IA, proporcionando exposición a clústeres de GPU de vanguardia y plataformas de aprendizaje automático.
  • Nebius ofrece compensación y beneficios competitivos, con roles en España basados en Madrid.

En sus propias palabras

Sobre la empresa y el equipo

Nebius está liderando una nueva era en la infraestructura de la nube para la economía global de la IA. Estamos construyendo una plataforma de nube de IA de stack completo que da soporte a desarrolladores y empresas, desde el entrenamiento de datos y modelos hasta el despliegue en producción, sin el coste y la complejidad de construir una gran infraestructura de IA/ML propia.

Creado por ingenieros, para ingenieros. Desde la orquestación de GPU a gran escala hasta la optimización de la inferencia, nos encargamos de los problemas difíciles en computación, almacenamiento, redes e IA aplicada.

Cotizamos en Nasdaq (NBIS) y tenemos nuestra sede en Ámsterdam; contamos con una presencia global con centros de I+D en Europa, el Reino Unido, Norteamérica e Israel. Nuestro equipo de más de 1.500 personas incluye a cientos de ingenieros con profunda experiencia en hardware, software e I+D de IA.

Información adicional

Nebius es un empleador que ofrece igualdad de oportunidades. Estamos comprometidos con el fomento de un lugar de trabajo inclusivo y diverso y con la prestación de igualdad de oportunidades de empleo en todos los aspectos del empleo. No discriminamos por motivos de raza, color, religión, sexo (incluido el embarazo), origen nacional, ascendencia, edad, discapacidad, información genética, estado civil, condición de veterano, orientación sexual, identidad o expresión de género, o cualquier otra característica protegida por la legislación aplicable.

Los candidatos deben estar autorizados para trabajar en el país en el que solicitan el puesto y se les requerirá que proporcionen un comprobante de elegibilidad de empleo como condición para la contratación.

Si necesitas adaptaciones durante el proceso de solicitud, por favor háznoslo saber.

Todas las vacantes de Nebius
WhatsApp