Jobs · Information Technology · Florida

Engineer, Site Reliability

Royal Caribbean Group · Miami, FL · Yesterday
Information TechnologyFull-time

About the role

The Royal Caribbean Group's Information Technology Team has an exciting career opportunity for a full-time Engineer, Site Reliability reporting to the Senior Manager, Site Reliability. The position is onsite and based in Miramar, Florida. The position is also not eligible for work authorization sponsorship.

Position Summary

The Observability Engineer will operate and continually enhance the enterprise observability platform within one of the most complex hospitality and maritime technology ecosystems. This role ensures reliable system visibility across hundreds of applications and mission-critical services by delivering instrumentation, telemetry, robust monitoring practices, and operational insights to enable proactive performance management across cloud and hybrid environments.

Essential Duties and Responsibilities

  • Configure, maintain, and optimize observability platforms such as Cisco AppDynamics, Splunk, ThousandEyes, and PagerDuty AIOps across AWS and Azure environments.
  • Partner with application, cloud, and platform teams to implement standards for metrics, logs, traces, and event handling, ensuring full-stack visibility.
  • Design and maintain dashboards, health indicators, and alert policies to improve detection accuracy and reduce noise.
  • Implement OpenTelemetry instrumentation and telemetry pipelines for data quality, enrichment, and multi-backend exporting.
  • Collaborate with Site Reliability Engineering teams to define and manage SLIs, SLOs, and actionable alerting thresholds for critical services.
  • Support AI-driven incident detection, event correlation, and workflow automation across ITSM systems such as ServiceNow.
  • Enable observability for Kubernetes workloads (EKS, AKS) and cloud infrastructure with AWS CloudWatch and Azure Monitor integrations.
  • Contribute to observability standards, onboarding playbooks, automation scripts, and continuous improvement initiatives.
  • Assist in troubleshooting performance issues across application tiers, cloud-native workloads, and distributed systems environments.
  • Participate in platform upgrades, telemetry hygiene activities, and cost-optimization strategies for large-scale observability systems.

Qualifications, Knowledge and Skills

  • Bachelor's degree in Computer Science, Information Technology, or related field; equivalent experience considered.
  • 3–5 years of hands-on experience in Observability, Site Reliability Engineering, or similar technical disciplines.
  • Demonstrated experience with observability platforms such as AppDynamics, Splunk, or equivalent APM and log analysis tools.
  • Skilled in Kubernetes, preferably EKS/AKS, and cloud observability across AWS and Azure.
  • Proficiency in configuring, troubleshooting, and optimizing complex monitoring systems.
  • Strong understanding of OpenTelemetry, distributed tracing, and related telemetry standards.
  • Familiarity with AIOps, incident response workflows, and ITSM integration (ServiceNow).
  • Scripting and automation experience in Python, Bash, PowerShell, and infrastructure tools (Terraform, Ansible).
  • Strong problem-solving, analytical, and collaboration skills.
  • Ability to translate operational insights into actionable improvements.
  • Excellent communication skills to support cross-functional teams in a dynamic environment.

Similar jobs