Site Reliability Engineering Architect
Oracle · United States · 1 mo ago
RemoteRemoteArt & Creative$146k–$306k/yrInternship
About the role
Oracle Cloud Infrastructure is designing, standardizing, and operating mission-critical data center electrical infrastructure at extraordinary scale. We are hiring a Reliability & Quality Engineering leader to strengthen the design quality, system reliability, and availability of large-scale data center electrical distribution architectures.
Responsibilities
- Evaluate end-to-end data center electrical distribution architectures, including utility or behind-the-meter interfaces, substations, medium-voltage distribution, switchgear, UPS systems, generators, BESS where applicable, protection systems, controls, and downstream power delivery.
- Identify design-level failure points, single points of failure, common-mode risks, hidden dependencies, protection coordination concerns, and failure modes that could materially impact availability.
- Assess how electrical systems perform under credible failure scenarios, including equipment faults, transfer events, protection operations, control-system failures, degraded-mode operation, maintenance conditions, and abnormal grid or generation events.
- Develop system-level resiliency concepts and design recommendations that improve fault isolation, recoverability, maintainability, failure containment, and blast radius reduction.
- Partner with electrical design engineering, commissioning, operations, construction, supply chain, and equipment vendors to translate reliability findings into design standards, product requirements, test expectations, acceptance criteria, and corrective action plans.
- Apply quality and reliability engineering methods such as FMEA, fault-tree analysis, reliability block diagrams, root-cause analysis, design-for-reliability reviews, lessons-learned integration, and field-performance trend analysis.
- Evaluate product quality and reliability across power infrastructure, electrical equipment, standardized electrical products, and repeatable data center design platforms.
- Recommend improvements to specifications, supplier qualification, equipment testing, design validation, manufacturing quality controls, inspection processes, and supplier feedback loops.
- Create executive-ready reliability risk assessments that clearly communicate availability impact, technical trade-offs, mitigation options, residual risk, and prioritization across large-scale infrastructure programs.
- Establish reliability KPIs, defect taxonomies, quality gates, issue review cadence, and design-readiness criteria that improve reliability before construction, commissioning, and operational handoff.
- Champion safety, compliance, disciplined change management, and operational excellence while improving reliability at the architecture, product, and system levels.
Qualifications
- 10+ years of experience in reliability engineering, quality engineering, electrical design assurance, product quality, mission-critical power systems, data center infrastructure, industrial power, utilities, generation, transmission and distribution, or equivalent high-availability environments.
- Strong systems-thinking capability, with demonstrated ability to evaluate electrical architectures under failure scenarios rather than only assessing individual components or equipment ratings.
- Deep understanding of data center electrical distribution concepts, including medium-voltage and low-voltage distribution, substations, switchgear, UPS systems, generators, protection schemes, controls, grounding, power quality, redundancy, maintainability, and operational recovery.
- Experience identifying failure modes, common-mode vulnerabilities, cascading risks, hidden dependencies, and blast-radius concerns across complex electrical systems.
- Proven ability to assess availability impact and reliability tradeoffs using structured engineering methods such as FMEA, fault-tree analysis, reliability block diagrams, event analysis, root-cause analysis, or similar methodologies.
- Relevant product quality and reliability experience across power infrastructure, electrical equipment, standardized electrical products, or repeatable data center design platforms.
- Ability to influence design standards, supplier requirements, equipment qualification expectations, commissioning acceptance criteria, and operational readiness deliverables.
- Strong cross-functional leadership skills, with experience partnering across design engineering, construction, commissioning, operations, vendors, and executive stakeholders.
- Excellent communication and executive reporting skills, with the ability to translate complex technical reliability risk into clear decisions, priorities, and implementation plans.
- Commitment to safety, compliance, disciplined engineering governance, and operational excellence in high-uptime environments.
Pay
Hiring Range in USD from: $146,300 - $306,400 per year. May be eligible for bonus, equity, and compensation deferral.
Schedule
Not specified.