Resumen
Detalles del puesto
Ayuda completa con la mudanza
Ayuda con la mudanza, según la oferta.
Requisitos
Trabajar en inglés
Se requiere inglés, según la oferta.
Trabajar presencialmente en Bilbao
Ofrecen ayuda completa con la mudanza.
Tener 5+ años de experiencia
Puesto de nivel Senior.
Esta oferta se ha traducido automáticamente al español.
Salario y beneficios
Qué ofrecen
- Horario flexible: tú eliges cuándo empezar tu día;
- Relocalización a Bilbao, España, para ti y tu familia, con apoyo total en cada etapa (documentos, vivienda, adaptación, incluso mascotas);
- Vacaciones ilimitadas: tómate tiempo libre cuando realmente lo necesites;
- Una cultura de confianza y respeto por los profesionales, sin micromanagement;
- Una oficina moderna en un barrio acogedor, eventos de equipo regulares y off-sites;
- Crecimiento y participación en decisiones arquitectónicas, tareas desafiantes y un equipo sólido del que puedes aprender.
Requisitos
Qué buscan
- No te asustan los problemas ambiguos, donde no hay una solución preparada y debes definir qué medir, cómo probar y qué significa el éxito.
- Puedes equilibrar velocidad y calidad: experimentar rápidamente manteniendo en mente la fiabilidad, la observabilidad y la reproducibilidad.
- Puedes escribir código apto para producción (y hacer "vibe-code"): del tipo que no hace que los ingenieros de producto busquen su revólver.
- Más de 5 años de experiencia general en ingeniería de software;
- Más de 2 años de experiencia construyendo productos basados en LLMs / agentes;
- Has construido al menos:
- Un sistema RAG / de búsqueda con un pipeline completo: retrieval → rerank → generation;
- Un agente (uso de herramientas / multi-paso / workflows);
- Estos sistemas tienen usuarios reales;
- Te sientes cómodo con:
- Python asíncrono: asyncio, threads;
- Prompting de LLM: system/user prompts, few-shot, templates, contexto, instrucciones;
- Internals de LLM modernos: transformers, entrenamiento, inferencia, serving;
- Modelos recientes y sus diferencias (calidad / velocidad / longitud de contexto / coste / multimodalidad, etc.);
- MCP (Model Context Protocol);
- Metodología de ML: train/val/test, métricas, principios básicos de evaluación;
- Control de calidad para respuestas de agentes:
- Monitorización, métricas, guardrails, regresiones, alertas, etiquetado humano / bucles de feedback;
- Frameworks y enfoques para agentes:
- fastmcp, mcp-use, OpenAI Agents SDK y equivalentes;
- Tokenización:
- Cómo funciona la tokenización;
- Tokenizadores modernos, su impacto en la longitud de contexto / coste / límites;
- Pipelines de RAG:
- Componentes (ingest / chunking / embeddings / vector store / retrieval / rerank / composición de contexto / generación);
- Problemas y soluciones típicas (alucinaciones, recuperación deficiente, degradación, cold start, data drift, duplicados, latencia);
- Cursor y herramientas similares (Claude Code, Codex, Aider, etc.):
- Cómo utilizar agentes de código de forma eficaz en el desarrollo.
Se valorará
- Experiencia diseñando APIs: REST / gRPC / GraphQL;
- Comprensión del protocolo HTTP;
- Experiencia con bases de datos relacionales: PostgreSQL y similares;
- Conocimiento de almacenes distribuidos y vectoriales: Weaviate, Cassandra, etc.;
- Experiencia con frameworks de API en Python: FastAPI, Flask y equivalentes;
- Familiaridad con sistemas de tareas en segundo plano: Celery, Taskiq, Airflow, etc.;
- Habilidades de contenerización: Docker, Kubernetes o Nomad;
- Experiencia trabajando con colas y brokers: Kafka, RabbitMQ, Redis, etc.
El puesto
Un Senior ML Engineer que ya haya construido agentes LLM y sistemas RAG en producción y que no solo sepa "ensamblar un pipeline", sino que también sea capaz de mejorar la calidad mediante hipótesis y experimentación. Necesitamos a alguien con una mentalidad de ingeniería orientada a la investigación: probar ideas rápidamente, convertirlas en prototipos funcionales, medir los resultados y luego impulsarlas hacia soluciones de producción estables. La independencia y la responsabilidad sobre los resultados son cruciales: "encontrar una palanca → demostrarla con métricas → desplegar → monitorizar."
Qué harás
- Diseñar la evaluación de calidad para agentes: definir métricas (éxito de la tarea, éxito de la herramienta, latencia/coste, tasa de alucinación), construir datasets, ejecutar evaluaciones offline/online y configurar regresiones y alertas;
- Determinar si un agente de código puede superar al agente basado en herramientas actual: comparar enfoques (basado en herramientas vs. ejecución de código/codegen), definir qué es "mejor", realizar tests A/B o despliegues controlados, y evaluar calidad/coste/riesgo;
- Mejorar la calidad de RAG en un 30%: optimizar la recuperación (chunking, reescritura de consultas, búsqueda híbrida), reranking, composición de contexto, deduplicación/anti-leak, grounding, y luego demostrar las mejoras en benchmarks y métricas de producción.



