SRE
Analista SRE Sênior | Plataforma Kubernetes
Удалённо
Откликнуться на сайте работодателяОписание вакансии
Sobre a Vaga
Code Kloud é o time responsável pela plataforma EKS (Kubernetes) do PicPay. Nossa missão é ser a infraestrutura mais escalável, segura e fácil de usar para toda a engenharia — permitindo que devs foquem em entregar valor, não em gerenciar clusters.
Responsabilidades e Atribuições
Operar, manter e evoluir os clusters kubernetes da plataforma, assegurando disponibilidade, performance, escalabilidade e aderência às versões suportadas;
Conduzir upgrades de Kubernetes (EKS), addons e componentes de infraestrutura com planejamento, validação e rollback;
Gerenciar capacidade e autoscaling do parque, incluindo Karpenter, requests/limits, HPA, afinidades e otimização de custos;
Atuar na prevenção, investigação e resolução de incidentes de plataforma, participando do on-call, análise de causa raiz e postmortems;
Definir e acompanhar indicadores de confiabilidade, tais como: SLIs, SLOs, error budgets, disponibilidade, latência e saturação;
Evoluir a observabilidade dos clusters com métricas, logs, traces, dashboards e alertas usando ferramentas como Prometheus e Grafana;
Implementar e sustentar práticas de segurança de containers: RBAC, políticas de segurança, gestão de secrets, análise de imagens, controles de admission e segmentação de rede;
Desenvolver e manter infraestrutura como código e automações com Terraform, Helm, ArgoCD e scripts/ferramentas em Go;
Apoiar os times de desenvolvimento na adoção de boas práticas de Kubernetes: deploys, health checks, recursos, escalabilidade, observabilidade e segurança;
Documentar padrões, runbooks, procedimentos operacionais e decisões técnicas da plataforma;
Atuar na evolução da camada de rede e entrada do cluster, incluindo Ingress, Gateway API, HTTPRoute, DNS e certificados;
Contribuir, quando aplicável, com a evolução do Service Mesh, apoiando iniciativas de mTLS, observabilidade leste-oeste, circuit breaker e gerenciamento de tráfego.
Requisitos e Qualificações
Experiência prática com Kubernetes, atuando em ambientes críticos e de alta disponibilidade;
Conhecimento Sólido Em AWS EKS, Incluindo
- Criação, operação e upgrade de clusters;
- Managed node groups, addons e troubleshooting;
- IAM, VPC, Security Groups, ALB/NLB e CloudWatch;
- Gestão de custos, capacidade e disponibilidade.Domínio de workloads Kubernetes: Deployments, StatefulSets, DaemonSets, Jobs, CronJobs, HPA, requests/limits, affinity, taints e tolerations;
Experiência com Karpenter;
Conhecimento prático de observabilidade: Prometheus, Grafana, logs, alertas, métricas de plataforma e investigação de incidentes;
Vivência Forte Em Práticas De SRE
- SLOs, SLIs e error budgets;
- on-call, gestão de incidentes e postmortems;
- capacity planning e melhoria contínua de confiabilidade;
Experiência com Infraestrutura como Código e GitOps: Terraform, Helm e ArgoCD;
Conhecimento de redes em Kubernetes: Services, Ingress/Gateway API, DNS, TLS, Network Policies e CNI.
Requisitos De Segurança De Contêineres
Conhecimento sólido em segurança de imagens e workloads:
- scanning de imagens e vulnerabilidades;
- boas práticas de Dockerfile, imagens mínimas e controle de dependências;
- gestão de secrets com AWS Secrets Manager, Vault ou External Secrets;
- RBAC, Pod Security Standards e segregação por namespaces;
- admission policies com ferramentas como Kyverno ou OPA/Gatekeeper;
- noções de runtime security e supply chain de software.
#VemserPicpayLover #Picpay
Это сохранённая копия объявления, опубликованного в другом месте. Вакансии снимают без предупреждения — перед откликом проверьте сайт работодателя. mentors.coach не является нанимающей стороной.