Senior Machine Learning Engineer, LLM Inference Optimization
En corto
- →Optimizas inferencia de LLMs/VLMs para reducir latencia y costo por token.
- →Trabajas en equipo con ingenieros de plataforma y kernel en sistemas de inferencia de producción.
- →Destaca por aplicar técnicas avanzadas como speculative decoding y optimización de caché en entornos reales.
Professional proficiency in English required.
En ~1 minuto te damos: quién te entrevista, las preguntas probables con respuestas desde tu CV, y tu CV adaptado a esta vacante. Gratis, sin tarjeta.
🎧¿Llegás a la entrevista? Llevá el copiloto. Nuestra extensión escucha la entrevista en vivo y te muestra anclas de 3-4 palabras desde tu CV y tu preparación — mirás, conectás, hablás. Gratis. Ver la extensión →¿Qué piden?
- ✓Experiencia comprobada en optimización de inferencia de LLMs/VLMs.
- ✓Dominio de frameworks de inferencia como vLLM, SGLang, TensorRT-LLM, Triton.
- ✓Habilidades en model compression: cuantización, distillación, entrenamiento consciente de cuantización.
- ✓Capacidad para diagnosticar y resolver regresiones en producción.
- ✓Experiencia con técnicas de aceleración como speculative decoding, kv-cache, continuous batching.
- ✓Conocimiento práctico de frameworks de benchmarking y evaluación reproducible.
¿No cumplís todo? Es lo normal — tu dossier gratis te dice qué gaps tenés y cómo cubrirlos en la entrevista.
¿A quién escribirle en Nebius?
Tu dossier gratis identifica a las personas que te entrevistarían — con su background, qué valoran y cómo escribirles para destacar antes de aplicar.
Más empleos como este
¿Buscando algo parecido?
Dejá tu email y te avisamos cuando salgan vacantes que coincidan con tu perfil.
No apliques sin prepararte
Investigamos quién te entrevista, adaptamos tu CV y te ensayamos en vivo — gratis la primera.