Senior GPU Networking Architect

Senior GPU Networking Architect

Zürich Homeoffice (teilweise)
N

Auf einen Blick

  • Aufgaben: Entwickle und optimiere GPU-Kommunikationskerne für großangelegte KI-Systeme.
  • Unternehmen: NVIDIA, ein führendes Unternehmen in Grafik- und KI-Technologie.
  • Vorteile: Wettbewerbsfähiges Gehalt, umfassende Sozialleistungen und flexible Arbeitsmöglichkeiten.
  • Weitere Informationen: Dynamisches Umfeld mit hervorragenden Karrierechancen und internationalem Team.
  • Warum dieser Job: Gestalte die Zukunft der KI mit innovativer Technologie und einem talentierten Team.
  • Qualifikationen: Mindestens 5 Jahre Erfahrung in CUDA-Programmierung und tiefes Verständnis der GPU-Architektur.

NVIDIA hat die Computergraphik, PC-Gaming und beschleunigtes Rechnen seit über 25 Jahren transformiert. Heute nutzen wir das unbegrenzte Potenzial von KI, um die nächste Ära des Rechnens zu definieren. Diese Ära, in der unsere GPU als Gehirn von Computern, Robotern und selbstfahrenden Autos fungiert, erfordert Vision, Innovation und die besten Talente der Welt. Als NVIDIAN sind Sie in einer vielfältigen, unterstützenden Umgebung eingebettet, in der jeder inspiriert wird, sein Bestes zu geben.

Wir suchen einen Senior GPU Networking Architect, der unserem Netzwerk-Softwareteam beitritt und starke GPU-Architektur- und Programmierkenntnisse mitbringt, um GPU-Kommunikationskerne zu entwickeln und zu verbessern. Diese Rolle verbindet GPU-Computing mit Netzwerken, indem sichergestellt wird, dass Kommunikationsprimitive sorgfältig in Übereinstimmung mit den Hardwarefähigkeiten der GPU entwickelt werden.

Was Sie tun werden:

  • GPU-Kommunikationskerne erstellen, implementieren und optimieren, die kollektive und Punkt-zu-Punkt-Operationen in großangelegten KI-Systemen unterstützen.
  • Tiefes Wissen über GPU-Architektur nutzen, um die Effizienz der Kerne zu verbessern, Latenz zu minimieren und Berechnungen mit Kommunikation zu überlappen.
  • GPU-residente Kommunikationsprimitive und geräteseitige APIs entwickeln, die eine feingranulare, kernelinitiierte Datenbewegung über Knoten und Beschleuniger ermöglichen.
  • GPU-Kerne end-to-end profilieren und abstimmen, Engpässe an der Schnittstelle von Berechnung, Speicher und Netzwerk identifizieren und gezielte Optimierungen vorantreiben.
  • Mit Netzwerksoftware-, Hardware- und KI-Framework-Teams zusammenarbeiten, um Kommunikationsstrategien zu co-designen, die mit GPU-Ausführungsmustern und aufkommenden Modellarchitekturen übereinstimmen.
  • Proofs-of-Concept erstellen, Experimente durchführen und quantitative Modellierung durchführen, um neue Kommunikationsstrategien zu bewerten und zu validieren, bevor sie in die Produktion gehen.
  • Zur Evolution von Programmiermodellen beitragen, die GPU-bewusste Netzwerkfähigkeiten für Anwendungsentwickler offenlegen.

Was wir sehen möchten:

  • 5+ Jahre praktische CUDA-Programmierung, einschließlich Schreiben und Optimieren nicht-trivialer GPU-Kerne.
  • M.Sc. oder gleichwertige Erfahrung in Informatik, Computertechnik oder einem eng verwandten Bereich.
  • Starkes Verständnis der Grundlagen der GPU-Architektur: Warp-Scheduling, Shared Memory, L2-Cache, Speicherkoaleszenz, Belegungsoptimierung und asynchrone Ausführung.
  • Erfahrung mit systemnaher C/C++-Entwicklung in leistungs-kritischen Umgebungen.
  • Vertrautheit mit GPU-Datenbewegungsmechanismen wie GPUDirect RDMA und GPU-initiierten Kommunikationen.
  • Fähigkeit, GPU-Leistungsprofile zu lesen und zu interpretieren (z.B. Nsight Compute, Nsight Systems) und Beobachtungen in umsetzbare Optimierungen zu übersetzen.
  • Starke Zusammenarbeit in einer multinationalen, interdisziplinären Umgebung.

Wie Sie sich von der Masse abheben können:

  • Erfahrung in der Entwicklung oder Optimierung von Kommunikationskernen in Bibliotheken wie NCCL, NVSHMEM oder ähnlichen GPU-bewussten Kommunikationsframeworks.
  • Verständnis von Techniken des verteilten Deep Learning, einschließlich Datenparallelismus, Tensorparallelismus, Pipeline-Parallelismus, Expertenparallelismus und Mischexperten-Parallelismus sowie der Kommunikationsmuster, die sie auf GPU-Kerne auferlegen.
  • Hintergrund in RDMA, InfiniBand, Hochgeschwindigkeitsnetzwerken und GPU-Systemtopologie, einschließlich NVLink, NVSwitch, PCIe und Netzwerkfabriken, und deren Einfluss auf das Design von Kommunikationskernen.
  • Erfahrung mit Überlappungstechniken wie Kernel-Pipelining, persistente Kerne oder kooperative Gruppen, um Kommunikationslatenz hinter Berechnungen zu verbergen.
  • Nachgewiesene Erfahrung in der Bewertung und Optimierung von großangelegten LLM-Trainings- oder Inferenzlasten, einschließlich praktischer Arbeit mit Frameworks wie PyTorch, TensorRT-LLM oder vLLM und Vertrautheit mit aufkommenden Servierungsarchitekturen wie disaggregierter Servierung.

Bei NVIDIA arbeiten Sie mit Kollegen zusammen, die tiefes Fachwissen und innovatives Denken in der Branche demonstrieren und die Grenzen dessen, was in KI und Hochleistungsrechnen möglich ist, erweitern. Wenn Sie leidenschaftlich an GPU-Architektur, Low-Level-Kernel-Optimierung und dem Aufbau des Kommunikationsgewebes für die nächste Generation von KI interessiert sind, möchten wir von Ihnen hören!

NVIDIA gilt weithin als einer der begehrtesten Arbeitgeber der Technologiebranche und bietet hoch wettbewerbsfähige Gehälter sowie ein umfassendes Leistungspaket.

Senior GPU Networking Architect Arbeitgeber: NVIDIA

NVIDIA ist ein herausragender Arbeitgeber, der eine dynamische und unterstützende Arbeitsumgebung bietet, in der Innovation und Zusammenarbeit gefördert werden. Mit einem starken Fokus auf Mitarbeiterentwicklung und einer Kultur, die Vielfalt schätzt, haben Sie die Möglichkeit, an bahnbrechenden Projekten im Bereich KI und Hochleistungsrechnen zu arbeiten. Zudem profitieren Sie von wettbewerbsfähigen Gehältern und einem umfassenden Leistungspaket, das Ihre berufliche und persönliche Zukunft unterstützt.

N

Kontaktdaten:

NVIDIA Recruiting-Team

Wir glauben, dass du diese Fähigkeiten brauchst, um Senior GPU Networking Architect mit Bravour zu bestehen

CUDA Programmierung
GPU Architektur
Thread Scheduling
Speicherhierarchie
Ausführungs-Pipelines
C/C++ Entwicklung
GPU-Datenbewegungsmechanismen