Skip to content
SRE

SRE

Analista SRE Sênior | Plataforma Kubernetes

PicPay

Remote

Apply on the employer's site

Role description

Sobre a Vaga
Code Kloud é o time responsável pela plataforma EKS (Kubernetes) do PicPay. Nossa missão é ser a infraestrutura mais escalável, segura e fácil de usar para toda a engenharia — permitindo que devs foquem em entregar valor, não em gerenciar clusters.

Responsabilidades e Atribuições
Operar, manter e evoluir os clusters kubernetes da plataforma, assegurando disponibilidade, performance, escalabilidade e aderência às versões suportadas;

Conduzir upgrades de Kubernetes (EKS), addons e componentes de infraestrutura com planejamento, validação e rollback;

Gerenciar capacidade e autoscaling do parque, incluindo Karpenter, requests/limits, HPA, afinidades e otimização de custos;

Atuar na prevenção, investigação e resolução de incidentes de plataforma, participando do on-call, análise de causa raiz e postmortems;

Definir e acompanhar indicadores de confiabilidade, tais como: SLIs, SLOs, error budgets, disponibilidade, latência e saturação;

Evoluir a observabilidade dos clusters com métricas, logs, traces, dashboards e alertas usando ferramentas como Prometheus e Grafana;

Implementar e sustentar práticas de segurança de containers: RBAC, políticas de segurança, gestão de secrets, análise de imagens, controles de admission e segmentação de rede;

Desenvolver e manter infraestrutura como código e automações com Terraform, Helm, ArgoCD e scripts/ferramentas em Go;

Apoiar os times de desenvolvimento na adoção de boas práticas de Kubernetes: deploys, health checks, recursos, escalabilidade, observabilidade e segurança;

Documentar padrões, runbooks, procedimentos operacionais e decisões técnicas da plataforma;

Atuar na evolução da camada de rede e entrada do cluster, incluindo Ingress, Gateway API, HTTPRoute, DNS e certificados;

Contribuir, quando aplicável, com a evolução do Service Mesh, apoiando iniciativas de mTLS, observabilidade leste-oeste, circuit breaker e gerenciamento de tráfego.

Requisitos e Qualificações
Experiência prática com Kubernetes, atuando em ambientes críticos e de alta disponibilidade;

Conhecimento Sólido Em AWS EKS, Incluindo

  • Criação, operação e upgrade de clusters;
  • Managed node groups, addons e troubleshooting;
  • IAM, VPC, Security Groups, ALB/NLB e CloudWatch;
  • Gestão de custos, capacidade e disponibilidade.Domínio de workloads Kubernetes: Deployments, StatefulSets, DaemonSets, Jobs, CronJobs, HPA, requests/limits, affinity, taints e tolerations;

Experiência com Karpenter;

Conhecimento prático de observabilidade: Prometheus, Grafana, logs, alertas, métricas de plataforma e investigação de incidentes;

Vivência Forte Em Práticas De SRE

  • SLOs, SLIs e error budgets;
  • on-call, gestão de incidentes e postmortems;
  • capacity planning e melhoria contínua de confiabilidade;

Experiência com Infraestrutura como Código e GitOps: Terraform, Helm e ArgoCD;

Conhecimento de redes em Kubernetes: Services, Ingress/Gateway API, DNS, TLS, Network Policies e CNI.

Requisitos De Segurança De Contêineres
Conhecimento sólido em segurança de imagens e workloads:

  • scanning de imagens e vulnerabilidades;
  • boas práticas de Dockerfile, imagens mínimas e controle de dependências;
  • gestão de secrets com AWS Secrets Manager, Vault ou External Secrets;
  • RBAC, Pod Security Standards e segregação por namespaces;
  • admission policies com ferramentas como Kyverno ou OPA/Gatekeeper;
  • noções de runtime security e supply chain de software.

#VemserPicpayLover #Picpay

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

Similar roles

See all →