El portal de empleo de España

Ingeniero de ML Sénior | Kimchi (Optimización de Inferencia de LLM)

En remoto desde España·Añadida hace 9 días

Cast AI

10 ofertas abiertas

Resumen

Detalles del puesto

  • Totalmente en remoto

    Según la oferta.

Requisitos

  • Trabajar en inglés

    Se requiere inglés, según la oferta.

  • Tener 5+ años de experiencia

    Puesto de nivel Senior.

Esta oferta se ha traducido automáticamente al español.

Salario y beneficios

Qué ofrecen

  • Salario competitivo (dependiendo del nivel de experiencia).
  • Disfruta de un entorno global flexible y "remote-first".
  • Colaborar con un equipo global de expertos e innovadores en la nube, apasionados por ampliar los límites de la tecnología Kubernetes
  • Opciones de acciones (equity).
  • Recibe feedback rápido con un flujo de trabajo ágil. La mayoría de los proyectos de funcionalidades se completan en un plazo de 1 a 4 semanas.
  • Dedica el 10% de tu tiempo de trabajo a proyectos personales o a la superación personal.
  • Presupuesto de aprendizaje para el desarrollo profesional y personal, incluyendo el acceso a conferencias internacionales y cursos que eleven tus habilidades.
  • Hackathon anual para generar nuevas ideas y fortalecer los vínculos del equipo.
  • Presupuesto para team-building y eventos de empresa para conectar con tus compañeros.
  • Presupuesto para equipamiento para asegurar que tienes todo lo que necesitas.
  • Días libres adicionales para ayudar a mantener un equilibrio saludable entre la vida laboral y personal.

Requisitos

Qué buscan

  • Más de 5 años construyendo sistemas de ML reales, con un portfolio que demuestre profundidad en infraestructura de inferencia o entrenamiento (no solo notebooks de entrenamiento de modelos).
  • Python sólido: servicios de producción, no scripts.
  • Experiencia práctica con al menos uno de estos: vLLM, SGLang o TensorRT-LLM, y un modelo mental funcional de por qué un motor de inferencia se comporta de la manera en que lo hace en una GPU determinada.
  • Fluidez con las compensaciones (trade-offs) de la cuantización: has medido regresiones de calidad, no solo ratios de compresión.
  • Comodidad con sistemas distribuidos: comunicación colectiva, estrategias de sharding y los modos de fallo prácticos de configuraciones multi-GPU y multi-nodo.
  • Orientación hacia la medición. Instrumentas antes de optimizar, y sabes distinguir entre una victoria real y un artefacto de un benchmark.
  • Autodirección. Este puesto conlleva un mandato amplio; deberías sentirte entusiasmado por ello, no inquieto.

El puesto

Throughput. Latencia. Utilización de la caché KV.

Mueve esos tres números en la dirección correcta y ocurrirán dos cosas: los clientes obtendrán una inferencia más rápida y económica, y nuestros márgenes mejorarán. Esa es la tesis completa de este puesto. Cada kernel que ajustes, cada esquema de cuantización que implementes y cada ajuste de scheduler que logres se reflejará directamente en el p99 de un cliente y en nuestra P&L.
Este es un puesto de alto impacto. También es un puesto de gran autonomía, ya que se te dará libertad para liderar la dirección técnica de la optimización de la inferencia en Kimchi, no para ejecutar la hoja de ruta de otra persona.

El problema: ejecutar LLMs en producción es un objetivo móvil. El modelo "correcto" y la configuración de servicio para una carga de trabajo dependen de la forma del tráfico, la distribución de la longitud de la secuencia, la dinámica de los batches, el SKU de la GPU, el ancho de banda de la memoria, la tolerancia a la cuantización y una docena de otras variables que cambian semana tras semana. La mayoría de los equipos eligen un modelo una vez, sobredimensionan las GPUs y absorben el coste. Kimchi es el sistema que toma esa decisión automáticamente, haciendo coincidir continuamente las cargas de trabajo con el LLM y la configuración de servicio más eficientes en costes y con mejor rendimiento en la infraestructura del cliente. Estamos construyendo la capa de optimización entre el modelo y el hardware, y necesitamos ingenieros que comprendan profundamente ambos lados.

Qué harás

  • Impulsar el throughput. Continuous batching, speculative decoding, chunked prefill, ajuste a nivel de kernel en vLLM, SGLang y TensorRT-LLM. Encuentra el límite de cada SKU de GPU y luego elévalo.
  • Reducir la latencia. Ataca el TTFT y el TPOT por separado. Realiza perfiles, identifica el cuello de botella real (cómputo, ancho de banda de memoria, programación, red) y soluciónalo, no el cuello de botella que suponías que existía.
  • Sacar más provecho de la caché KV. Paged attention, prefix caching, políticas de expulsión, reutilización de caché entre peticiones, KV cuantizado. Aquí es donde reside gran parte del throughput no aprovechado, y es un área de la que te harás responsable.
  • Cuantizar sin perder calidad. INT8, INT4, FP8 en pesos, activaciones y KV. Trabajo empírico: medir la calidad en cargas de trabajo reales, no solo en benchmarks de perplejidad.
  • Reducir los arranques en frío (cold starts) y la huella de memoria. Inicialización más rápida, carga de pesos más inteligente, gestión de memoria más ajustada: la diferencia entre un modelo que escala y uno que no lo hace.
  • Escalar entre nodos. Topologías de inferencia distribuida, ubicación consciente de la red, estrategias de checkpointing que no generen cuellos de botella en el almacenamiento o la interconexión.
  • Establecer la dirección técnica. Decidir qué evaluamos con benchmarks, qué adoptamos y qué construimos nosotros mismos. Liderar al equipo mediante informes sólidos y experimentos reproducibles.

Stack

Python; vLLM; SGLang; TensorRT-LLM; PyTorch; herramientas adyacentes a CUDA; Kubernetes; gRPC; ClickHouse; PostgreSQL; GCP Pub/Sub; AWS / GCP / Azure; GitLab CI; ArgoCD; Prometheus; Grafana; Loki; Tempo.

Proceso de selección

  • Llamada de cribado con el Recruiter
  • Entrevista con el Hiring Manager
  • Entrevista técnica (diseño de sistemas)
  • Live coding
  • Entrevista de cultura con un ejecutivo

Como parte de nuestro proceso de contratación estándar, nos gustaría informarle de que se podrá realizar una verificación de antecedentes en la etapa final del proceso de selección a través de nuestro proveedor externo, Checkr.
Tenga en cuenta que Cast AI no ofrece ningún tipo de patrocinio de visado o permiso de trabajo.

Sobre Cast AI

Cast AI es una empresa de infraestructura en la nube que ofrece una plataforma de optimización de Kubernetes y de Automatización del Rendimiento de Aplicaciones (APA®). Convierte las señales de carga de trabajo de Kubernetes, infraestructura, costes y SLO en acciones automatizadas, tales como el ajuste de tamaño de pods (rightsizing), el escalado de nodos y la optimización de GPUs e instancias Spot, e integra con AWS, Azure y Google Cloud. La empresa informa de que más de 2100 empresas en todo el mundo confían en ella y fue fundada por Leon, Laurent y Yuri después de que su anterior startup, Zenedge, fuera adquirida por Oracle en 2018.

Sector
Cloud Infrastructure

Datos prácticos

  • Cast AI informa de que más de 2100 empresas en todo el mundo confían en ella, lo que indica una base de clientes internacional.
  • Su plataforma se integra con AWS, Azure y Google Cloud, los principales proveedores de nube pública.
  • Las vacantes actuales incluyen puestos con alcance en Europa y EMEA, como "Senior Software Engineer | Kubernetes Automation | EU" y "Senior Product Marketing Manager | Kimchi | EMEA".
  • La empresa fue cofundada por Leon, Laurent y Yuri, quienes anteriormente crearon Zenedge, adquirida por Oracle en 2018.

En sus propias palabras

Sobre la empresa y el equipo

Cast AI es una plataforma de automatización que opera infraestructura cloud-native e IA a escala. Al integrar la toma de decisiones autónoma directamente en Kubernetes y entornos de nube, Cast AI optimiza continuamente el rendimiento, la fiabilidad y la eficiencia en producción.
La forma antigua no funciona. A medida que los entornos de Kubernetes e IA crecen, las decisiones manuales no pueden seguir el ritmo. Cast AI sustituye los tickets, las alertas y el ajuste manual por una automatización continua que adapta la infraestructura a medida que cambian las condiciones. La eficiencia y el ahorro de costes derivan naturalmente de esa automatización.
Más de 2.100 empresas ya confían en Cast AI, incluyendo Akamai, BMW, Cisco, FICO, HuggingFace, NielsenIQ, Swisscom y TGS.

Equipo global, perspectivas diversas

Nuestra sede está en Miami, pero nuestro impacto es internacional. Adoptamos un enfoque global e intencionado hacia la diversidad. Hoy en día, Cast AI opera en 34 países que abarcan Europa, América del Norte, América Latina y APAC, aportando una amplia gama de perspectivas a nuestra forma de construir y liderar.

Impulso de unicornio

En enero de 2026, alcanzamos el estatus de unicornio gracias a una inversión estratégica de Pacific Alliance Ventures, el brazo de venture capital corporativo de Shinsegae Group (un conglomerado coreano de más de 50.000 millones de dólares). Nuestra valoración supera ahora los 1.000 millones de dólares, y esto es solo el principio.

Únete a nosotros mientras construimos el futuro de la infraestructura autónoma.

Todas las vacantes de Cast AI
WhatsApp