Maximum of 25 job preferences reached.
Top Site Reliability Engineer Jobs
Information Technology • Software • Financial Services • Big Data Analytics
SREs at Citadel focus on optimizing and maintaining system reliability, performance, and automation for investment applications, collaborating closely with teams.
Top Skills:
Ci/CdCSSJavaScriptPythonReactSQL
Fintech • Machine Learning • Payments • Software • Financial Services
Lead resilience engineering for large-scale cloud infrastructure. Responsibilities include defining architectural vision, automating platform operations, managing incidents and root-cause analysis, governing multi-cloud IaC, establishing SLOs, mentoring SRE teams, and optimizing capacity, costs, and FinOps strategy. The role also drives observability, security governance, distributed systems reliability, and production platform scalability across engineering organizations.
Top Skills:
AWSCi/CdGCPGenerative AiInfrastructure As Code (Iac)KubernetesAzureSecrets ManagementServerlessZero Trust
Artificial Intelligence • Big Data • Healthtech • Information Technology • Machine Learning • Software • Analytics
Leads enterprise-wide site reliability engineering strategy across digital consumer platforms. Establishes reliability, security, observability, automation, SLO, resilience, and operational excellence standards; influences architecture and infrastructure decisions; drives AI-enabled reliability capabilities, self-healing systems, threat detection, resilience testing, and secure development practices. Partners with engineering, security, operations, and platform leaders to improve scalability, availability, risk management, and operational maturity across multiple teams.
Top Skills:
Ai/MlAutomationCloud InfrastructureDistributed SystemsInfrastructure-As-CodeObservabilitySlo FrameworksThreat Modeling
Digital Media • Information Technology • News + Entertainment
Own cloud infrastructure, reliability, observability, and incident response for large-scale FreeWheel platforms running across AWS and Kubernetes. Design scalable infrastructure and tooling, write IaC and automation scripts, support monitoring and alerting, participate in on-call rotations, troubleshoot distributed systems, and create technical documentation and playbooks.
Top Skills:
AWSC++Infrastructure-As-CodeJavaKubernetesLinuxPython
Artificial Intelligence • Cloud • Information Technology • Consulting
Supports Sales Engineers and customers by provisioning and maintaining networking, infrastructure, virtualization, cloud, and data center lab environments. Assists with demonstrations, proof-of-concepts, technical validations, troubleshooting, upgrades, hardware installations, and incident resolution. Develops basic automation scripts, improves lab provisioning, documents solutions, and collaborates with Sales, Product, Engineering, and Support teams.
Top Skills:
BashCloud PlatformsLinuxNetworkingOperating SystemsPowershellPythonVirtualizationVMwareWindows
Digital Media • Information Technology • News + Entertainment
The Site Reliability Engineer will ensure the reliability, scalability, and performance of large-scale data platforms. Responsibilities include monitoring and alerting, automation, deployment, backup and disaster recovery, performance optimization, incident response, capacity planning, documentation, security compliance, and cross-functional collaboration. The role requires experience with cloud platforms, distributed data systems, databases, infrastructure automation, Kubernetes, Terraform, CI/CD, programming, and observability tools.
Top Skills:
AerospikeAmazon S3AnsibleAWSAzureCassandraCi/CdDockerElk StackGCPGoGrafanaHadoopHdfsJavaKafkaKubernetesMySQLNoSQLPostgresPrometheusPythonScalaSnowflakeSparkTerraform
Financial Services
Builds, maintains, monitors, and optimizes applications and infrastructure using site reliability engineering practices. Responsibilities include designing deployment and reliability approaches, implementing CI/CD and infrastructure as code, monitoring service-level objectives, resolving complex operational issues, improving availability and scalability, and using validated enterprise AI capabilities for incident triage and reliability analysis. The role also guides peers and promotes SRE best practices.
Top Skills:
.NetCloud InfrastructureConfiguration As CodeContainer OrchestrationContainersContinuous DeliveryContinuous IntegrationInfrastructure As CodeJavaNetwork As CodeObservabilityPythonService Level ObjectivesSpring Boot
Artificial Intelligence • Cloud • HR Tech • Information Technology • Productivity • Software • Automation
Build and operate highly available, cloud-native Voice AI systems, including deployments, observability, monitoring, disaster recovery, and continuous integration. Develop scalable software, integrate LLMs with voice and real-time communication platforms, automate testing and delivery, and collaborate with product owners. Mentor colleagues and promote knowledge sharing across telecommunications and AI engineering disciplines.
Top Skills:
AnsibleClaude CodeConfiguration ManagementCursorGitlab CiGoHelmInfrastructure As CodeJavaKubernetesLlmsPrometheusPythonReal-Time Communication SystemsSoftware-Defined NetworkingSplunkVoice AiWindsurf
Financial Services
Leads site reliability engineering practices across distributed and mainframe environments. Establishes SLI/SLO frameworks, monitoring, alerting, dashboards, runbooks, incident management, automation, self-healing, CI/CD controls, capacity planning, resilience testing, and operational governance. Partners with application, infrastructure, and operations teams to reduce toil, improve reliability, standardize controls, and strengthen service stability.
Top Skills:
Chaos TestingCi/CdCloud PlatformsContainersEvent TelemetryGoInfrastructure-As-CodeItsmLinuxLoad TestingLogsMainframe SystemsMetricsMiddlewareMonitoring And ObservabilityNetworkingPerformance TestingPythonShellTraces
Fintech • Information Technology • Payments • Sharing Economy • Financial Services • Cryptocurrency
Leads reliability, scalability, performance, and security for large-scale cloud systems. Designs AWS infrastructure with Terraform, automates CI/CD and operational workflows, establishes SLOs, manages incident response and disaster recovery, develops monitoring and observability solutions, and builds internal tools. Partners with engineering teams on architecture and reliability practices, conducts code reviews, mentors SREs, and supports compliance, vulnerability management, and security integration.
Top Skills:
Agentic ApplicationsAmazon Api GatewayAmazon AuroraAmazon CloudfrontAmazon CloudwatchAmazon DynamodbAmazon EbsAmazon Ec2Amazon EcsAmazon EfsAmazon RdsAmazon Route 53Amazon S3Amazon VpcAWSAws FargateAws LambdaAws X-RayChaos EngineeringCi/CdDastDatadogDistributed SystemsDockerEvent-Driven SystemsGitlabGitopsGrafanaIamInfrastructure As CodeJavaKubernetesLlmsMicroservicesNew RelicNode.jsOwasp Top 10PythonSastServerless ArchitecturesSplunkTerraform
6 Days AgoSaved
Easy Apply
Easy Apply
Cloud • Information Technology • Security • Software • Cybersecurity
Manage deployments, operations, incident response, and on-call support for products in classified U.S. government environments. Oversee AWS, private cloud, container, and virtual machine infrastructure. Develop Python scripts, containerized services, and monitoring automation while improving reliability, scalability, and DevOps practices. Maintain security and compliance through vulnerability scanning, patch management, documentation, and escalation management. The role is fully onsite and requires an active U.S. Government Secret clearance.
Top Skills:
Ai/MlAiopsAnsibleAWSAws EcsContainersFedrampKubernetesLinuxMonitoringPatch ManagementPythonTerraformVirtual MachinesVulnerability Scanning
Financial Services
Lead cloud and SRE engineering practices for business-critical AWS production services. Responsibilities include production readiness, incident response, observability, SLI/SLO and error-budget management, resiliency and disaster recovery, infrastructure automation, cloud cost optimization, architecture strategy, and responsible adoption of AI-assisted engineering tools. The role also drives root-cause analysis, operational risk reduction, service health measurement, and technical standards across multiple engineering teams.
Top Skills:
Ai-Assisted Software DevelopmentAWSCloud ComputingDistributed TracingInfrastructure As CodeObservabilitySite Reliability Engineering (Sre)
New
Track Smarter, Apply Better.
Ditch the spreadsheets. Organize your job search with our freeApplication Tracker.
Use For Free
Financial Services
Leads AWS cloud production management and Site Reliability Engineering practices for business-critical banking services. Defines SLOs, SLIs, error budgets, observability, capacity planning, resiliency, and disaster recovery strategies. Directs major incident response, root-cause analysis, and corrective actions; advances infrastructure automation, cloud cost optimization, and multi-region architecture. Establishes production readiness and operational standards while guiding responsible AI-assisted engineering adoption and communicating technical strategy to leadership.
Top Skills:
Active-Active SystemsAi-Assisted Software Development ToolsAlertingAnomaly DetectionAutomationAWSCloud ArchitectureCloud InfrastructureDashboardsDisaster RecoveryDistributed TracingInfrastructure As CodeLoggingMetricsMulti-Region ArchitectureObservabilitySre
Financial Services
Leads AWS cloud architecture and site reliability engineering for business-critical production services. Responsibilities include production readiness, incident response, observability, SLI/SLO and error-budget management, capacity planning, resiliency, disaster recovery, infrastructure automation, cloud cost optimization, and major incident remediation. The role also establishes operational standards, advances responsible AI-assisted engineering practices, and communicates complex technical strategies to leadership in a regulated financial-services environment.
Top Skills:
Artificial IntelligenceAWSDistributed TracingInfrastructure As CodeObservabilitySite Reliability Engineering (Sre)
Financial Services
Build and operate resilient, scalable distributed services through software engineering, automation, observability, incident management, self-healing, capacity planning, and secure delivery practices. Lead high-priority incident response and blameless reviews, partner with development and product teams on reliable releases, and reduce operational toil. The role includes on-call participation, production troubleshooting across application and infrastructure layers, and responsible use of AI-assisted development tools.
Top Skills:
APIsAWSCloud ComputingContainersContinuous DeliveryContinuous IntegrationDynatraceGitGrafanaJavaKubernetesLinux/UnixMySQLNginxOraclePythonShell ScriptingSplunkTomcatVirtualization
Information Technology • Insurance • Software
The Principal Site Reliability Engineer sets enterprise-wide strategy for reliability, scalability, performance, observability, and service ownership. Responsibilities include establishing SLOs, SLIs, error budgets, architectural standards, incident command practices, and blameless postmortems across AWS, hybrid data centers, and customer-hosted environments. The role leads cross-functional reliability initiatives, influences system architecture, supports proactive production operations, and participates in executive on-call rotations.
Top Skills:
.NetAWSC#Ci/CdInfrastructure-As-CodeJavaKubernetesLinuxPythonReactRelational DatabasesWindows
Financial Services
Develops, deploys, troubleshoots, and maintains secure, stable software for high-volume payments systems. Responsibilities include production support, root-cause analysis, lifecycle and service-request management, deployment execution, application development, testing, and collaboration with operations teams. The role also applies AI-assisted development tools responsibly and works with distributed systems, messaging technologies, databases, cloud-native platforms, and agile SDLC practices.
Top Skills:
Ai-Assisted Software Development ToolsCi/CdCloud-Native TechnologiesDistributed SystemsIn-Memory Data GridsKafkaMqRelational DatabasesRest Apis
Artificial Intelligence • Big Data • Healthtech • Mobile • Wearables • Analytics
Build and operate reliability systems for a cardiovascular data platform, including monitoring, SLIs, SLOs, incident response, automation, and observability. Investigate end-to-end failures across devices, connectivity, mobile applications, firmware, and cloud services. Analyze fleet-level reliability using Python, SQL, and BigQuery; automate manual checks; conduct postmortems; and improve telemetry to ensure complete, trustworthy clinical data delivery.
Top Skills:
AndroidAWSAzureBigQueryBluetooth Low EnergyCellular ConnectivityDatadogEmbedded FirmwareFmeaFracasGCPGrafanaIec 60812Iso 13485PythonSQLWi-Fi
Financial Services
Leads software engineering and site reliability efforts, delivering secure, scalable production systems. Responsibilities include system design, coding, testing, troubleshooting, automation of recurring remediation, operational stability, vendor architecture evaluations, and adoption of AI-assisted engineering practices with strong validation, security, and responsible-use standards.
Top Skills:
Ai-Assisted Software Development ToolsApplication Resiliency ToolsAutomated TestingCi/CdCloud-Native Technologies
Financial Services
Leads reliability engineering for mission-critical network services, including resiliency reviews, incident response, root-cause analysis, automation, observability, and durable remediation. Architects self-healing and guarded remediation workflows using Python, Shell, and Ansible. Provides technical leadership across SD-WAN, SDN, routing, switching, security, and traffic services while embedding SRE practices, resilience testing, AI-assisted workflows, and security controls. Mentors engineers and drives service-level objectives, error budgets, and operational readiness.
Top Skills:
.NetAnsibleCi/CdContainer OrchestrationContainersFirewallsJavaLoad BalancersObservabilityProxiesPythonRoutingSd-WanSdaSdnShellSpring BootSwitching
Financial Services
Builds, maintains, monitors, and optimizes applications and cloud infrastructure for availability, reliability, and scalability. Designs automated CI/CD and infrastructure-as-code solutions, implements observability and SLOs, troubleshoots incidents and networking issues, and reduces operational toil. The role also guides teammates in SRE best practices, uses authorized AI tools for incident analysis, and collaborates across teams to proactively resolve complex platform and business problems.
Top Skills:
Amazon EcsAnsibleAWSDatadogDockerDynatraceGitlabGrafanaJenkinsKubernetesLinuxPrometheusPythonSplunkTerraformWindows
Financial Services
Designs, develops, troubleshoots, and maintains secure enterprise software and production systems. Champions SRE practices by defining and operationalizing SLOs, SLIs, and error budgets; improving reliability, scalability, performance, and reducing toil. Supports infrastructure planning, migrations, monitoring, incident response, change management, audits, and cross-team operations. Uses Linux, Bash, Python, cloud, containers, CI/CD, and authorized AI tools to improve delivery and operational outcomes.
Top Skills:
Ai-Assisted Development ToolsAmazon EcsBackup SystemsBashCi/CdDockerGitlabJenkinsJob SchedulingKubernetesLinuxLoad BalancersMonitoringNetwork TroubleshootingPythonSipSQLSslTerraformVoip
Financial Services
Designs, deploys, monitors, and optimizes applications and infrastructure using site reliability engineering practices. Builds infrastructure and configuration as code, develops CI/CD and deployment approaches, improves availability and scalability through SLOs and observability, and resolves complex incidents. The role also applies authorized AI tools for triage and operational analysis, validates recommendations, supports containerized cloud environments, and helps teammates adopt reliability best practices.
Top Skills:
.NetAmazon EcsAnsibleContinuous DeliveryContinuous IntegrationDatadogDockerDynatraceGrafanaJavaKubernetesLinuxPrometheusPythonSplunkSpring BootTerraformWindows
Financial Services
Designs, maintains, monitors, and optimizes applications and cloud infrastructure using SRE practices. Builds CI/CD pipelines, infrastructure as code, observability, SLO-based alerting, and automated remediation. Participates in incident response, on-call operations, post-incident reviews, and reliability improvements. Uses authorized AI tools for troubleshooting while validating recommendations and protecting sensitive operational data. Supports containerized platforms, cloud resiliency, scalability, and adoption of SRE best practices.
Top Skills:
AlbAnsibleAWSAzureBashCi/CdCloudwatchDatadogDockerDynatraceGitlab CiGrafanaJenkinsKubernetesNlbPrometheusPythonRoute 53Service MeshSplunkTerraform
Financial Services
Lead SRE responsible for driving reliability culture, conducting resiliency design reviews, leading incident response, improving service levels with data-driven analytics, adopting AI-assisted SRE workflows, mentoring engineers, and documenting knowledge across the organization.
Top Skills:
.NetAi-Assisted ToolsCi/CdDatadogDockerDynatraceEcsGitlabGrafanaJava Spring BootJenkinsKubernetesObservabilityPrometheusPythonSplunkTelemetryTerraform
Let Your Resume Do The Work
Upload your resume to be matched with jobs you're a great fit for.
Success! We'll use this to further personalize your experience.
Top Companies Hiring Site Reliability Engineers
See AllPopular Job Searches
All Software Engineer Jobs
.NET Developer Jobs
Aerospace Thermal Engineering Jobs
AI Engineer Jobs
Android Developer Jobs
Automation Engineer Jobs
Backend Developer Jobs
Blockchain Developer Jobs
C# Jobs
C++ Jobs
Cloud Architect Jobs
Cloud Engineer Jobs
Design Engineer Jobs
DevOps Engineer Jobs
Director Of Engineering Jobs
Electrical Engineering Jobs
Embedded Software Engineer Jobs
Engineering Jobs
Engineering Manager Jobs
Environmental Engineering Jobs
Field Engineer Jobs
Front End Developer Jobs
Full Stack Developer Jobs
Game Developer Jobs
Golang Jobs
Hardware Engineer Jobs
Industrial Engineering Jobs
iOS Developer Jobs
Java Developer Jobs
Javascript Developer Jobs
Linux Jobs
Manufacturing Engineer Jobs
Mechanical Engineering Jobs
Network Engineer Jobs
PHP Developer Jobs
Process Engineer Jobs
Project Engineer Jobs
Prompt Engineering Jobs
Python Jobs
QA Jobs
Robotics Engineer Jobs
Ruby on Rails Jobs
Salesforce Administrator Jobs
Salesforce Developer Jobs
Scala Jobs
Sharepoint Developer Jobs
Site Reliability Engineer Jobs
Software Engineering Manager Jobs
Solutions Architect Jobs
SQL Developer Jobs
Structural Engineer Jobs
System Engineer Jobs
Test Engineer Jobs
Web Developer Jobs
All Filters
Total selected ()
No Results
No Results















.jpg)






