Zum Hauptinhalt gehen
Erstellt am 20. Juli 2026

GPU Cluster Engineer (Mensch)

Neura Robotics
Riederich, Baden-Wurttemberg, Germany Vollzeit
Reference: 490_778970_689ed8e5-c487-487d-963e-a9fc13483834

Deine Mission & Herausforderungen

  • Du bist die zentrale Ansprechperson fur NEURAs GPUCluster-Infrastruktur - ein groskaliges AWSHyperPodSetup mit topmodernen GPUInstanzen fur FoundationModelTraining und kundenspezifische FineTuningWorkloads.

  • Du entwickelst das Betriebsframework, baust SelfServiceTools fur die MLTeams und arbeitest direkt mit AWS zusammen, um die Plattform auf HyperscalerEbene mitzugestalten.

  • Dein Fokus liegt voll auf Cluster Engineering & Operations - nicht auf MLForschung selbst, sondern darauf, dass die Leute, die forschen, eine extrem stabile, effiziente und leicht zugangliche Infrastruktur haben.

  • Aufsetzen, Konfigurieren und kontinuierliches Weiterentwickeln der HyperPodCluster von NEURA, inkl. HyperPod/Slurm und HyperPod/EKSOrchestrierungsmodellen.

  • Design und Umsetzung von Strategien fur Cluster-Stabilitat: NodeFailureDetection, automatische JobRecovery, CheckpointKoordination und fehlertolerante MultiNodeTrainingWorkflows.

  • Aufbau eines WorkloadPriorityFrameworks, das mehreren Teams und Use Cases - Pretraining, FineTuning, Kundenjobs - erlaubt, Clusterkapazitat fair und effizient zu teilen.

  • Optimierung der EndtoEndGPUAuslastung: Erkennen und Losen von Bottlenecks in Compute, GPUSpeicher, EFANetzwerk und StorageDurchsatz.

  • Enge Zusammenarbeit mit den AWS HyperPodProdukt und EngineeringTeams: Issues eskalieren, Learnings aus einer der groten Deployments teilen und Anforderungen fur die Roadmap platzieren.

  • Bereitstellung von SelfServiceTools, damit MLResearchers und Engineers Trainingsjobs eigenstandig starten, monitoren und managen konnen - ohne standige Infrastrukturunterstutzung.

  • Erstellung von OnboardingDokus, Trainingsmaterial und internen Workshops, damit User effizient arbeiten, Best Practices einhalten und Kosten ihrer Workloads verstehen.

  • Infrastructure as Code ist fur dich Standard. Jede ClusterKonfiguration, jede Anderung, jede Umgebung ist Codefirst.

  • Verantwortung fur Kosten- und Kapazitatsstrategie: SpotManagement, ReservedInstancePlanung, Savings Plans und laufende AWSCommitmentVerhandlungen.

Auf was konnen wir uns freuen

  • 5+ Jahre Erfahrung im Infrastructure oder SystemsEngineering, idealerweise mit Fokus auf GPUCluster oder HPCUmgebungen.

  • Tiefe praktische Erfahrung mit AWS HyperPod und AWSInstanzen; direkte Erfahrung mit HyperPod ist ein starker Vorteil.

  • Solides Verstandnis von Slurm und Kubernetes als Orchestrierungsschichten - und die Fahigkeit, ihre Tradeoffs fur groe GPUWorkloads zu bewerten.

  • Praktisches Wissen uber Distributed Training - du weit, was Durchsatz beeinflusst und wie man Probleme debuggt.

  • Erfahrung in der Entwicklung von SelfServiceTools und technischer Dokumentation fur anspruchsvolle Endnutzer: Du machst komplexe Infrastruktur zuganglich, nicht nur funktionsfahig.

  • Starkes Verstandnis fur CloudKostenmanagement im groen Mastab: SpotInterruptions, Kapazitatsreservierungen, Kostenverteilung uber Teams und Workloads.

  • Wohlfuhlen in der Zusammenarbeit uber Teamgrenzen hinweg - deine Hauptpartner sind MLForschende, aber auch Product, Finance und CloudVendors.

  • Sehr gute Englischkenntnisse; Deutsch ist ein Plus.

Jobbenachrichtigungen per Newsletter erhalten