Site Reliability Engineer III, Machine Learning

JPMorgan Chase

Confirmed live 2 days ago Trusted

Quick summary

Work type
On-site
Location
Wilmington, DE
Posted
26 days ago
Freshness
Confirmed live 2 days ago

Market check

Salary context

How this pay compares to similar roles

Similar $187k
$140k most similar roles pay here $243k

This listing doesn't post a salary. Most similar roles pay $152,971–$220,087.

Based on 238 similar postings.

Employer

About JPMorgan Chase

JPMorgan Chase & Co. is a global financial services firm and one of the largest banks in the world, offering investment banking, commercial banking, asset management, and consumer financial services.

JPMorgan Chase currently has 1117 open roles on FindRole.

Listed pay typically runs $186,160–$215,000 across 7 roles with salary data.

Most-posted roles

View all roles at JPMorgan Chase

At a glance

TL;DR · Site Reliability Engineer III, Machine Learning

As a Site Reliability Engineer III - Machine Learning within the Corporate Technology, Consumer & Community Banking Risk team, you will design and implement technical solutions to ensure the resilience and performance of critical applications. You will decompose existing systems, manage infrastructure as code, and develop automated continuous integration and delivery pipelines. Your daily work involves monitoring service level objectives, troubleshooting networking issues, and managing container orchestration. You will utilize enterprise-authorized AI capabilities to accelerate incident triage, identify patterns in operational signals, and address recurring toil while adhering to strict data sensitivity requirements. The role requires proficiency in Python, Java/Spring Boot, or .Net, along with experience in observability, telemetry collection, and tools like Terraform, Airflow, Databricks, and OpenTelemetry. You will focus on improving scalability and reliability for complex machine learning and cloud-based platforms.

What does a Site Reliability Engineer earn?

Median $186200 from 131 postings across 36 companies.

See salary data

What you'll do

  • Design and implement infrastructure, configuration, and network as code for applications and platforms.
  • Develop and test deployment and reliability approaches using automated CI/CD pipelines.
  • Use enterprise-authorized AI tools to accelerate incident triage, troubleshooting, and post-incident analysis.
  • Utilize AI capabilities to identify patterns in operational signals and prioritize improvements based on SLO outcomes.
  • Monitor and optimize application performance by proactively addressing issues identified through service level indicators.
  • Decompose existing systems and iteratively enhance them to improve availability, reliability, and scalability.
  • Implement observability solutions including telemetry collection, white/black box monitoring, and SLO alerting.

What we're looking for

  • Formal training or certification on site reliability engineering concepts and 3+ years of applied experience.
  • Proficiency in site reliability culture, principles, and implementation within applications or platforms.
  • Proficiency in at least one programming language such as Python, Java/Spring Boot, or .Net.
  • Working knowledge of using enterprise-authorized AI capabilities for SRE workflows with strong validation habits and data sensitivity awareness.
  • Ability to validate AI-assisted operational recommendations before applying changes while following security requirements.
  • Experience in observability, including white/black box monitoring, SLO alerting, and telemetry collection.
  • Experience with CI/CD tooling, container orchestration, and troubleshooting common networking technologies.
  • Experience with infrastructure-as-code (Terraform), data workflows (Airflow), or AWS certification (preferred).

More like this

Similar roles

Site Reliability Engineer III

JPMorgan Chase

Houston, TX 8 days ago
Site Reliability Engineering Python Java Spring Boot .Net AI Cloud Terraform Kubernetes Docker Prometheus Grafana Dynatrace Datadog Splunk Jenkins GitLab Observability
3+ yrs exp

Site Reliability Engineer III

JPMorgan Chase

Chicago, IL 45 days ago
Site Reliability Engineering Python Java Spring Boot .NET Cloud Infrastructure Network as Code Observability Telemetry AI SRE Monitoring
3+ yrs exp

Site Reliability Engineer III

JPMorgan Chase

Irvine, CA 37 days ago
Site Reliability Engineering Python Java Spring Boot .Net EKS EC2 Terraform Kubernetes CloudWatch Route 53 Load Balancing DNS mTLS Monitoring Telemetry
3+ yrs exp

Site Reliability Engineer III

JPMorgan Chase

Jersey City, NJ 76 days ago
Site Reliability Engineering Python PySpark AWS Databricks Snowflake Kubernetes AI/ML Grafana Prometheus Dynatrace Datadog Splunk Java Spring Boot .Net System Design
3+ yrs exp

Site Reliability Engineer III

JPMorgan Chase

Houston, TX 52 days ago
Site Reliability Engineering Python Java Spring Boot .NET Network as Code Cloud AI Observability Monitoring
3+ yrs exp

Site Reliability Engineer III

JPMorgan Chase

Chicago, IL 8 days ago
SRE Python Ansible Terraform Kubernetes Docker AWS Prometheus Grafana Dynatrace Datadog Splunk Linux Windows Jenkins GitLab Network as Code
3+ yrs exp