Sr Manager, AI Systems Quality & Reliability , Annapurna AI Servers and Systems
Amazon Web Services (AWS) · Cupertino, CA · 3 wk ago
EngineeringFull-time
About the role
Annapurna Labs is a wholly owned subsidiary of AWS, focusing on custom silicon and servers including the Nitro, Graviton, and Trainium families of processors. The Sr Manager of Quality & Reliability Engineering will lead the QnR function within the Trainium Manufacturing, Quality and Reliability organization.
Key job responsibilities
- Lead and grow a QnR engineering team, hiring, developing, and retaining top reliability and quality engineering talent.
- Set technical direction for component qualification, reliability testing (HALT, HTOL, thermal cycling, QRV), DFMEA, and vendor quality standards across all Trainium programs.
- Own quality and reliability outcomes end-to-end — from DFM input during design through fleet reliability performance.
- Drive component specific manufacturing process quality improvements in partnership with Manufacturing Engineering, establishing incoming quality requirements and process controls at all supplier sites.
- Build and maintain the reliability prediction and monitoring infrastructure — ensuring fleet performance is tracked against predictions, degradation trends are identified early, and corrective actions are data-driven.
- Establish systematic failure analysis processes that connect field failures back to manufacturing history, supplier data, and component-level root cause for rapid containment.
- Scale qualification processes to keep pace with multi-supplier, multi-generation production — including automation of qualification workflows and standardization of test methodologies across vendors.
About the team
Annapurna Labs is a vertically integrated team including software, firmware, hardware, and silicon design in a single organization. The Sr Manager of Quality & Reliability Engineering leads the Quality and Reliability Engineering function within the Manufacturing, Quality and Reliability team.
Basic Qualifications
- Experience in root cause analysis and error correction, identifying changes to procedures and systems to implement long-term fixes and avoid repeating issues
- Bachelor's degree in Reliability Engineering, Electrical Engineering, Mechanical Engineering, Materials Science, Physics, or related field
- 10+ years of reliability or quality engineering experience with server compute platforms, semiconductor packaging, or high-volume electronics manufacturing
- 5+ years of people management experience leading reliability, quality, or hardware engineering teams
- Experience establishing quality management systems and reliability programs across multiple manufacturing vendors or sites
Preferred Qualifications
- Experience leading teams across multiple locations in complex manufacturing/production environments
- Experience working in a fast-paced, rapidly changing operations environment
- Master's Degree or PhD in Reliability Engineering, Materials Science, or related field
- Experience with liquid cooling reliability (cold plate, TIM, coolant loop failure modes)
- Experience with advanced semiconductor packaging reliability (large-die BGA, warpage, solder joint fatigue)
- Experience with reliability prediction methodologies (Weibull analysis, acceleration models, DFMEA)
- Working knowledge of manufacturing quality tools (SPC, FMEA, 8D, DOE)
- Strong executive communication skills — ability to translate technical reliability risk into business impact for senior leadership