Auf einen Blick
- Aufgaben: Entwickle und skaliere ML-Trainingsinfrastruktur für Apples Foundation-Modelle.
- Unternehmen: Apple, ein innovatives Unternehmen mit Fokus auf Technologie und Zugänglichkeit.
- Vorteile: Wettbewerbsfähiges Gehalt, Gesundheitsleistungen und flexible Arbeitsmöglichkeiten.
- Weitere Informationen: Dynamisches Team mit hervorragenden Wachstumschancen.
- Warum dieser Job: Gestalte die Zukunft der Technologie und arbeite an bahnbrechenden Projekten.
- Qualifikationen: PhD oder MSc in Informatik und Erfahrung mit ML-Infrastruktur.
Das prognostizierte Gehalt liegt zwischen 90000 - 110000 CHF pro Jahr.
Bereit, wie Milliarden von Menschen mit Technologie zu interagieren? Das Core Foundation Models Team von Apple treibt die Intelligenz voran, die Erfahrungen auf Milliarden von Geräten weltweit ermöglicht – und wir suchen außergewöhnliche Talente, die sich uns anschließen! Schließe dich unserem in Europa ansässigen angewandten ML-Team an, das die nächste Generation von großangelegter ML- und RL-Trainingsinfrastruktur für Apples Foundation-Modelle aufbaut. Wir entwickeln leistungsstarke, verteilte Systeme, die bahnbrechende Forschung zu Foundation-Modellen in großem Maßstab unterstützen.
Wir suchen einen Ingenieur, der leidenschaftlich daran interessiert ist, die Infrastruktur zu entwerfen, zu optimieren und zu skalieren, die modernste maschinelles Lernen und Verstärkungslernen ermöglicht. Als erfahrenes Mitglied des Teams wirst du eng mit Forschern und Systemingenieuren zusammenarbeiten, um robuste Trainingsframeworks zu erstellen, Experimente zu beschleunigen und die Grenzen von Leistung und Effizienz zu erweitern. Du wirst mit Teams in Apples Ingenieureinheiten – einschließlich New York, Seattle und Cupertino – zusammenarbeiten, um die Werkzeuge und Systeme voranzutreiben, die großangelegtes Modelltraining ermöglichen.
In dieser Rolle wirst du als Kernmitglied unseres ML-Infrastrukturteams die Systeme entwerfen, aufbauen und skalieren, die großangelegtes Verstärkungslernen für Apples Foundation-Modelle ermöglichen. Du wirst dich auf TPU-basiertes Training mit JAX konzentrieren und robuste, leistungsstarke RL-Pipelines entwickeln, die verteilte Actor/Learner-Architekturen, effizientes Erfahrung-Replay und großangelegte Umgebungsdurchführungen unterstützen.
Deine Arbeit wird direkt die Skalierbarkeit, den Durchsatz und die Stabilität von RL-Experimenten beeinflussen und dazu beitragen, neue Fähigkeiten im agentischen Denken, in der Entscheidungsfindung und im Policy-Lernen für Apples Foundation-Modelle freizuschalten.
Mindestens erforderliche Qualifikationen:
- PhD oder MSc in Informatik, Computertechnik oder einem verwandten Bereich.
- Praktische Erfahrung im Entwerfen, Bauen oder Warten von großangelegter ML-Trainingsinfrastruktur.
- Starke Kenntnisse in PyTorch oder JAX und Erfahrung im Ausführen von Trainingslasten auf GPUs/TPUs.
- Solides Verständnis der Konzepte verteilter Systeme (Parallelitätsstrategien, Fehlertoleranz, Synchronisation).
Bevorzugte Qualifikationen:
- Praktische Erfahrung in der Entwicklung oder Optimierung von Trainingsschleifen, RL-Pipelines oder großangelegten Modell-Trainingsframeworks.
- Starke Software-Engineering-Fähigkeiten in Python, mit Schwerpunkt auf Zuverlässigkeit, Debugging und hochleistungsfähiger Ausführung.
- Tiefe Erfahrung mit PyTorch/JAX-Interna, XLA, Debugging und Leistungsprofilierung auf GPU/TPU-Architekturen.
- Expertise in Mustern des verteilten RL-Trainings, einschließlich Actor/Learner-Architekturen, Erfahrung-Replay und paralleler Umgebungsdurchführung.
- Erfahrung im Aufbau von Trainingsdiensten, Orchestrierungswerkzeugen oder automatisierten Pipelines für großangelegte Experimente.
- Nachweislicher Erfolg bei der Diagnose von Engpässen in großangelegten ML-Jobs (I/O, Eingabepipelines, Kernel-Leistung, Speicher, Kompilierung).
- Vertrautheit mit den spezifischen Infrastrukturanforderungen für RL (z.B. Actor/Learner-Architekturen, Erfahrung-Replay-Systeme, großangelegte Umgebungsdurchführung).
- Starke Praktiken im Software-Engineering: Codequalität, Design-Reviews, Tests, Beobachtbarkeit, CI/CD.
- Erfahrung mit Cloud-Skalierungsclustern oder spezialisierten Beschleunigern (TPU v5/v6, GPU, benutzerdefinierte Hardware).
- Beiträge zu ML-Frameworks, Bibliotheken für verteiltes Training oder Systeme für hochleistungsfähiges Rechnen.
- Ausgezeichnete Kommunikations- und Kollaborationsfähigkeiten zur Zusammenarbeit mit Forschungs- und Engineering-Partnern.
Bei Apple glauben wir, dass Zugänglichkeit ein fundamentales Menschenrecht ist. Du wirst diese Idee in allem hier finden – in unserer Kultur, unseren Vorteilen und unseren digitalen Werkzeugen. Indem wir so viele Perspektiven wie möglich willkommen heißen, helfen wir dir, eine Karriere aufzubauen, in der du dich zugehörig fühlst. Apple verpflichtet sich, alle Bewerber fair und gleich zu behandeln. Wir werden mit Bewerbern zusammenarbeiten, um angemessene Anpassungen vorzunehmen.
AIML - Senior ML/RL Training Infrastructure Engineer, AFM Arbeitgeber: Apple
Apple ist ein hervorragender Arbeitgeber, der Kreativität und Innovation fördert. In einer dynamischen und vielfältigen Arbeitsumgebung haben Mitarbeitende die Möglichkeit, an bedeutenden Projekten zu arbeiten und ihre Fähigkeiten kontinuierlich weiterzuentwickeln. Die Unternehmenskultur legt Wert auf Zusammenarbeit und Inklusion, was es jedem ermöglicht, seine Ideen einzubringen und einen echten Einfluss auf die Produkte zu haben, die Millionen von Menschen weltweit begeistern.