Jobs · Engineering · Texas

Senior Observability Engineer

Apex Systems · Coppell, TX · 1 wk ago
EngineeringContract

About the Role

We are seeking a highly skilled Senior Observability Engineer to join our Observability Engineering team. This role is responsible for designing, implementing, administering, and automating enterprise observability solutions with a primary focus on Grafana, OpenTelemetry, monitoring, alerting, and telemetry management. The ideal candidate has experience building and operating observability platforms at scale, automating infrastructure through Terraform, and enabling teams to adopt standardized observability practices. This role will be integral in modernizing observability capabilities and driving migration from legacy monitoring tools to Grafana-based solutions.

Responsibilities

  • Administer and support Grafana Cloud and on-premises Grafana deployments.
  • Design and implement enterprise observability solutions for metrics, logs, traces, synthetic monitoring, and alerting.
  • Establish and maintain observability standards, best practices, and governance processes.
  • Develop and maintain Terraform modules for Grafana infrastructure and configuration management.
  • Automate onboarding of applications, infrastructure, dashboards, alerts, and data sources.
  • Design monitoring and alerting strategies based on service health and business-critical workflows.
  • Implement and support OpenTelemetry instrumentation across applications and infrastructure.
  • Support migration initiatives from legacy observability platforms to Grafana.
  • Work closely with application development, infrastructure, cloud, and SRE teams.
  • Provide technical leadership and mentoring to engineers across the organization.

Requirements

  • Bachelor's degree in Computer Science, Engineering, Information Systems, or related field.
  • 5+ years of experience in observability, monitoring, operations, or platform engineering.
  • Hands-on experience administering Grafana in large-scale enterprise environments.
  • Strong experience with Terraform and Infrastructure as Code practices.
  • Experience implementing monitoring, alerting, logging, and distributed tracing solutions.
  • Experience with OpenTelemetry concepts, instrumentation, and telemetry pipelines.
  • Strong Linux and cloud platform administration skills.
  • Experience with scripting and automation using Python, PowerShell, Bash, or similar languages.
  • Knowledge of operational excellence, reliability engineering, and incident management practices.

Preferred Qualifications

  • Experience migrating from tools such as Splunk, Dynatrace, AppDynamics, New Relic, OpenText OBM, or similar platforms.
  • Experience with Grafana Alloy, Tempo, Loki, Mimir, or Prometheus.
  • Experience operating observability platforms in AWS environments.
  • Knowledge of Kubernetes, containers, and cloud-native observability.
  • Experience designing enterprise observability strategies and governance models.
  • Familiarity with CI/CD platforms and DevOps practices.

Benefits

  • Medical, dental, vision, life, and disability insurance plans.
  • Employee Stock Purchase Program (ESPP).
  • 401K program with company match after 12 months of tenure.
  • Health Savings Account (HSA) on the HDHP plan.
  • SupportLinc Employee Assistance Program (EAP) with up to 8 free counseling sessions.
  • Corporate discount savings program and other discounts.
  • On-demand training program and access to certification prep, technical and leadership courses/books/seminars after 6+ months of tenure.
  • Certification discounts and perks for associations including CompTIA and IIBA.
  • Dedicated customer service team for benefits and resources, plus a certified Career Coach.

Locations: Dallas, TX | Tampa, FL | Jersey City, NJ

Similar jobs