Offres d'emploi Suisse
← Alle Stellen

Staff Backline Engineer – ML/AI

Databricks

Anstellung
Vollzeit
Ort
Bellevue
Lohn
USD 170.4–255.6
Erstmals ausgeschrieben
Jetzt bewerben

P - 1381

Bei Databricks sind wir leidenschaftlich daran interessiert, Data & AI Teams zu befähigen, die schwierigsten Probleme der Welt zu lösen – von der Realisierung der nächsten Fortbewegungsart bis hin zur Beschleunigung medizinischer Durchbrüche. Wir erreichen dies, indem wir die weltweit beste Daten- und KI-Infrastrukturplattform aufbauen und betreiben, damit unsere Kunden tiefe Dateneinblicke nutzen können, um ihr Geschäft zu verbessern.

Gegründet von Ingenieuren, ergreifen wir jede Gelegenheit, um technische Herausforderungen anzugehen, vom Design der nächsten Generation von UI/UX für die Dateninteraktion bis hin zur Skalierung unserer Dienste und Infrastruktur über Millionen von virtuellen Maschinen hinweg. Und wir stehen erst am Anfang.

Über das Team

Das Backline Engineering Team dient als kritische Brücke zwischen dem Frontline Support und dem Engineering. Wir bearbeiten komplexe technische Probleme und Eskalationen im gesamten Data- und AI-Ökosystem.

Mit einem starken Fokus auf den Kundenerfolg setzen wir uns dafür ein, eine außergewöhnliche Kundenzufriedenheit durch tiefgreifendes technisches Fachwissen, proaktive Problemlösung und kontinuierliche Plattformverbesserungen zu gewährleisten. Wir legen Wert auf Automatisierung und Tooling, um die Effizienz der Fehlerbehebung zu steigern, manuelle Aufwände zu reduzieren und die allgemeine Supportfähigkeit der Plattform sowie die Gesundheit unserer Produkte zu verbessern.

Durch die Entwicklung smarter Lösungen und die Optimierung von Workflows treiben wir operative Exzellenz voran und sorgen für eine hervorragende Erfahrung sowohl für Kunden als auch für interne Teams.

Als Staff Backline Engineer werden Sie ein technischer Experte und Eskalationspunkt für einige der komplexesten ML/AI-Probleme sein. Sie werden mit Support, Engineering, Product und Kunden zusammenarbeiten, um schwierige Probleme zu beheben, Probleme zu reproduzieren, Ursachen zu identifizieren und deren Lösung voranzutreiben.

Was Sie tun werden

  • Dienen als Senior-Eskalationspunkt für komplexe ML/AI-Probleme, die Modelltraining, Inferenz, Model Serving, MLflow und Feature Engineering betreffen, mit Kenntnissen in Spark, Delta Lake und verteilten Workloads.
  • Durchführung tiefgehender technischer Untersuchungen unter Verwendung von Logs, Traces, Metriken, Profiling, Konfiguration, Quellcode und Kunden-Workloads, um die Ursache zu identifizieren.
  • Reproduktion von Kundenproblemen durch praktisches Experimentieren, Python/Spark-Entwicklung, Workload-Konstruktion, Konfigurationsänderungen und Leistungsanalyse.
  • Fehlerbehebung bei Ausfällen des Modelltrainings und der Inferenz, Leistungsverschlechterungen, Ressourcenauslastung, Memory/CPU/GPU-Problemen, Problemen bei der verteilten Ausführung sowie Deployment/Runtime-Fehlern.
  • Enge Zusammenarbeit mit den Engineering- und Product-Teams, um schwierige Probleme zur Lösung zu führen und Produktverbesserungen zu beeinflussen.
  • Identifizierung wiederkehrender Fehlermuster und deren Umwandlung in bessere Diagnosen, Dokumentationen, Tooling, Automatisierung und Claude skill capabilities.
  • Mentoring von Ingenieuren und Steigerung der technischen Troubleshooting-Fähigkeiten der breiteren Support-Organisation.
  • Agieren als technischer SME für ML/AI Plattformbereiche und Beitragen zu funktionsübergreifenden Initiativen mit globaler Wirkung.

Was wir suchen

  • Tiefgehende Troubleshooting-Erfahrung mit verteilten ML/AI-Systemen und die Fähigkeit, Probleme über Anwendungscode, Frameworks, Infrastruktur und die Databricks-Plattform hinweg zu debuggen.
  • Starke praktische Python-Erfahrung und die Fähigkeit, ML-Workloads unter Verwendung von Frameworks wie PyTorch, TensorFlow oder Scikit-Learn aufzubauen, zu modifizieren und zu debuggen.
  • Tiefes Verständnis der Databricks ML/AI Technologien, einschließlich MLflow, Model Serving, Feature Engineering, Spark MLlib und Model Lifecycle Management.
  • Starke Apache Spark Kenntnisse, einschließlich DataFrames, Query Execution, Distributed Computing, Memory Management, Shuffles und Leistungsoptimierung.
  • Erfahrung in der Fehlerbehebung von Trainings- und Inferenz-Performance, einschließlich CPU/GPU-Auslastung, Memory-Problemen, Datenengpässen, Nebenläufigkeit (Concurrency), Latenz und verteilter Ausführung.
  • Erfahrung mit ML-Deployment und Infrastruktur wie Kubernetes, Cloud ML Plattformen, CI/CD, Model Monitoring und Produktions-ML-Systemen.
  • Fähigkeit, Code, Logs, Stack Traces, Metriken, Traces, Ausführungspläne und Systemverhalten zu lesen und zu analysieren, anstatt sich ausschließlich auf Dokumentationen oder Konferierungsempfehlungen zu verlassen.
  • Nachgewiesene Fähigkeit, unabhängig Verantwortung für mehrdeutige, hochwirksame technische Probleme zu übernehmen und diese von Symptom → Untersuchung → Ursache → Lösung voranzutreiben.
  • Starke technische Kommunikationsfähigkeiten und die Fähigkeit, Engineering, Product, Support und Kunden zu beeinflussen.

Transparenz der Gehaltsspanne

Databricks setzt sich für faire und gerechte Vergütungspraktiken ein. Die Gehaltsspanne(n) für diese Rolle ist unten aufgeführt und stellt die erwartete Gehaltsspanne für nicht provisionsbasierte Rollen oder das Zielgehalt (on-target earnings) für provisionsbasierte Rollen dar. Die tatsächlichen Vergütungspakete basieren auf mehreren Faktoren, die für jeden Kandidaten einzigartig sind, einschließlich, aber nicht beschränkt auf jobbezogene Fähigkeiten, Erfahrungstiefe, relevante Zertifizierungen und Schulungen sowie den spezifischen Arbeitsort. Basierend auf den oben genannten Faktoren geht Databricks davon aus, die gesamte Breite der Spanne zu nutzen. Das gesamte Vergütungspaket für diese Position kann auch die Berechtigung für einen jährlichen Leistungsbonus, Eigenkapital (Equity) und die oben aufgeführten Leistungen umfassen. Für weitere Informationen darüber, in welcher Spanne sich Ihr Standort befindet, besuchen Sie unsere Seite hier (https://www.databricks.com/sites/default/files/2024-08

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 2 Tagen

Ort

Auf Google Maps ansehen