Senior Site Reliability Engineer — Token Factory (Inference Platform)
Nebius · Berlinsenior
En corto
- ▸Ingeniero de confiabilidad de sitios que garantiza la fiabilidad y rendimiento de una plataforma de inferencia de IA a gran escala con miles de GPUs.
- ▸Día a día: diseño de pipelines de telemetría, optimización de Kubernetes, gestión de infraestructura como código y respuesta a incidentes con automatización.
- ▸Destacado: Trabajas en una de las mayores nubes de GPUs del mundo, impactando directamente en el despliegue de modelos de IA multimodal.
Fluent English required for collaboration across global teams.
En ~1 minuto te damos: quién te entrevista, las preguntas probables con respuestas desde tu CV, y tu CV adaptado a esta vacante. Gratis, sin tarjeta.
🎧¿Llegás a la entrevista? Llevá el copiloto. Nuestra extensión escucha la entrevista en vivo y te muestra anclas de 3-4 palabras desde tu CV y tu preparación — mirás, conectás, hablás. Gratis. Ver la extensión →¿Qué piden?
- ✓Experiencia sólida con Kubernetes y su operación en entornos de producción.
- ✓Conocimiento profundo de Prometheus, Grafana y la creación de dashboards y alertas efectivas.
- ✓Habilidades avanzadas en Terraform para infraestructura como código (IaC).
- ✓Experiencia con stacks de inferencia de IA como vLLM, Triton o Ray en entornos GPU.
- ✓Capacidad para diseñar y mantener SLOs y políticas de alerta para APIs de alto rendimiento.
- ✓Experiencia en MLOps o plataformas de hospedaje de modelos.
¿No cumplís todo? Es lo normal — tu dossier gratis te dice qué gaps tenés y cómo cubrirlos en la entrevista.
¿A quién escribirle en Nebius?
Tu dossier gratis identifica a las personas que te entrevistarían — con su background, qué valoran y cómo escribirles para destacar antes de aplicar.
Más empleos como este
No apliques sin prepararte
Investigamos quién te entrevista, adaptamos tu CV y te ensayamos en vivo — gratis la primera.