GPU Cluster Engineer (Mensch)
Deine Mission & Herausforderungen
Du bist die zentrale Ansprechperson fur NEURAs GPUCluster-Infrastruktur - ein groskaliges AWSHyperPodSetup mit topmodernen GPUInstanzen fur FoundationModelTraining und kundenspezifische FineTuningWorkloads.
Du entwickelst das Betriebsframework, baust SelfServiceTools fur die MLTeams und arbeitest direkt mit AWS zusammen, um die Plattform auf HyperscalerEbene mitzugestalten.
Dein Fokus liegt voll auf Cluster Engineering & Operations - nicht auf MLForschung selbst, sondern darauf, dass die Leute, die forschen, eine extrem stabile, effiziente und leicht zugangliche Infrastruktur haben.
Aufsetzen, Konfigurieren und kontinuierliches Weiterentwickeln der HyperPodCluster von NEURA, inkl. HyperPod/Slurm und HyperPod/EKSOrchestrierungsmodellen.
Design und Umsetzung von Strategien fur Cluster-Stabilitat: NodeFailureDetection, automatische JobRecovery, CheckpointKoordination und fehlertolerante MultiNodeTrainingWorkflows.
Aufbau eines WorkloadPriorityFrameworks, das mehreren Teams und Use Cases - Pretraining, FineTuning, Kundenjobs - erlaubt, Clusterkapazitat fair und effizient zu teilen.
Optimierung der EndtoEndGPUAuslastung: Erkennen und Losen von Bottlenecks in Compute, GPUSpeicher, EFANetzwerk und StorageDurchsatz.
Enge Zusammenarbeit mit den AWS HyperPodProdukt und EngineeringTeams: Issues eskalieren, Learnings aus einer der groten Deployments teilen und Anforderungen fur die Roadmap platzieren.
Bereitstellung von SelfServiceTools, damit MLResearchers und Engineers Trainingsjobs eigenstandig starten, monitoren und managen konnen - ohne standige Infrastrukturunterstutzung.
Erstellung von OnboardingDokus, Trainingsmaterial und internen Workshops, damit User effizient arbeiten, Best Practices einhalten und Kosten ihrer Workloads verstehen.
Infrastructure as Code ist fur dich Standard. Jede ClusterKonfiguration, jede Anderung, jede Umgebung ist Codefirst.
Verantwortung fur Kosten- und Kapazitatsstrategie: SpotManagement, ReservedInstancePlanung, Savings Plans und laufende AWSCommitmentVerhandlungen.
Auf was konnen wir uns freuen
5+ Jahre Erfahrung im Infrastructure oder SystemsEngineering, idealerweise mit Fokus auf GPUCluster oder HPCUmgebungen.
Tiefe praktische Erfahrung mit AWS HyperPod und AWSInstanzen; direkte Erfahrung mit HyperPod ist ein starker Vorteil.
Solides Verstandnis von Slurm und Kubernetes als Orchestrierungsschichten - und die Fahigkeit, ihre Tradeoffs fur groe GPUWorkloads zu bewerten.
Praktisches Wissen uber Distributed Training - du weit, was Durchsatz beeinflusst und wie man Probleme debuggt.
Erfahrung in der Entwicklung von SelfServiceTools und technischer Dokumentation fur anspruchsvolle Endnutzer: Du machst komplexe Infrastruktur zuganglich, nicht nur funktionsfahig.
Starkes Verstandnis fur CloudKostenmanagement im groen Mastab: SpotInterruptions, Kapazitatsreservierungen, Kostenverteilung uber Teams und Workloads.
Wohlfuhlen in der Zusammenarbeit uber Teamgrenzen hinweg - deine Hauptpartner sind MLForschende, aber auch Product, Finance und CloudVendors.
Sehr gute Englischkenntnisse; Deutsch ist ein Plus.