Job Description
A Site Reliability Engineering (SRE) Guild Lead is responsible for defining and driving the organization’s Site Reliability Engineering practices, standards, and operational excellence across multiple engineering teams. The role establishes reliability strategies, governs observability, incident management, automation, and cloud infrastructure best practices while mentoring SRE and DevOps engineers. Working closely with Architecture, DevOps, and Delivery teams, the SRE Guild Lead ensures scalable, resilient, secure, and highly available production systems across all projects.
Responsibilities
SRE Leadership
- Define and govern the organization’s Site Reliability Engineering (SRE) standards.
- Establish reliability best practices across engineering teams.
- Lead the SRE guild and drive cross-team collaboration.
- Mentor SRE and DevOps engineers.
- Promote reliability engineering culture and operational excellence.
Reliability Engineering
- Define and manage Service Level Indicators (SLIs).
- Establish Service Level Objectives (SLOs).
- Manage Error Budgets and reliability metrics.
- Ensure production reliability and service availability.
- Drive continuous reliability improvements.
Observability
- Design and implement monitoring strategies.
- Develop dashboards and alerting systems.
- Build centralized logging and tracing solutions.
- Monitor Golden Signals (Latency, Traffic, Errors, Saturation).
- Improve system visibility and diagnostics.
Incident Management
- Lead incident response during production outages.
- Define on-call rotations and escalation processes.
- Conduct blameless postmortems.
- Perform root cause analysis (RCA).
- Reduce Mean Time to Recovery (MTTR).
Cloud & Infrastructure
- Design and manage cloud-native infrastructure.
- Support AWS, Azure, or Google Cloud environments.
- Manage Kubernetes clusters.
- Improve infrastructure scalability and resilience.
- Ensure disaster recovery readiness.
Infrastructure Automation
- Implement Infrastructure as Code (IaC).
- Build automation workflows.
- Reduce operational toil.
- Develop self-healing infrastructure.
- Automate operational processes.
DevOps & CI/CD
- Collaborate with DevOps teams.
- Improve deployment reliability.
- Enhance CI/CD pipelines.
- Support release engineering.
- Improve deployment automation.
Performance & Capacity
- Monitor system performance.
- Conduct capacity planning.
- Optimize infrastructure costs.
- Improve application scalability.
- Tune production environments.
Non-Functional Requirements
- Ensure scalability and fault tolerance.
- Support disaster recovery planning.
- Improve security and resilience.
- Validate architecture against reliability requirements.
Documentation & Governance
- Maintain runbooks and playbooks.
- Create operational documentation.
- Standardize SRE processes.
- Track reliability KPIs.
- Report engineering metrics to leadership.
Knowledge Sharing
- Conduct guild meetings and technical sessions.
- Mentor engineers across teams.
- Share best practices.
- Support hiring and onboarding initiatives.
Required Skills
Site Reliability Engineering
- Site Reliability Engineering (SRE)
- Production Engineering
- Reliability Engineering
- Operational Excellence
- High Availability
Reliability Metrics
- Service Level Indicators (SLI)
- Service Level Objectives (SLO)
- Error Budgets
- MTTR
- SLA Management
Observability
- Prometheus
- Grafana
- ELK Stack
- OpenSearch
- Datadog
- Monitoring
- Logging
- Alerting
- Distributed Tracing
- Golden Signals
Cloud Platforms
- AWS
- Microsoft Azure
- Google Cloud Platform (GCP)
- Cloud-native Infrastructure
Containerization
- Kubernetes
- Docker
- Container Orchestration
- Helm
Infrastructure as Code
- Terraform
- Ansible
- Infrastructure as Code (IaC)
- Automation
Programming & Automation
- Python
- Go
- Shell Scripting
- Bash
- Automation Tools
DevOps
- CI/CD
- Jenkins
- GitLab CI
- ArgoCD
- Release Engineering
- Git
Incident & Operations
- Incident Management
- Root Cause Analysis (RCA)
- On-call Management
- Escalation Management
- Disaster Recovery
- Chaos Engineering
- Performance Tuning
- Capacity Planning
- Cost Optimization
Architecture
- Scalability
- Fault Tolerance
- Microservices
- Distributed Systems
- System Reliability
Soft Skills
- Technical Leadership
- Mentoring
- Communication
- Cross-functional Collaboration
- Stakeholder Management
- Problem Solving
- Analytical Thinking
- Decision Making
- Strategic Planning
- Documentation
- Coaching
- Continuous Improvement
- Conflict Resolution
- Influencing Without Authority
Keywords
Site Reliability Engineering, SRE, SRE Guild Lead, Reliability Engineering, Production Engineering, Observability, Prometheus, Grafana, ELK, OpenSearch, Datadog, Monitoring, Logging, Alerting, SLI, SLO, Error Budget, Incident Management, Root Cause Analysis, MTTR, On-call, Kubernetes, Docker, AWS, Azure, GCP, Terraform, Ansible, Helm, Infrastructure as Code, Automation, Python, Go, Shell Scripting, CI/CD, Jenkins, GitLab CI, ArgoCD, Release Engineering, Capacity Planning, Performance Tuning, Cost Optimization, Disaster Recovery, Chaos Engineering, Scalability, Fault Tolerance, Distributed Systems, DevOps, Cloud Infrastructure, Operational Excellence.