Skip to content
Site Reliability Engineer

Site Reliability Engineer

[Tech] Especialista SRE | IA | REMOTO

TOTVS

Sao Paulo

Apply on the employer's site

Role description

Descrição
Você fará parte do time de Site Reliability Engineering (SRE), sendo responsável por estabelecer padrões de qualidade dos serviços de infraestrutura, acompanhando as inovações do mercado e garantindo a excelência do ecossistema tecnológico dos ambientes Cloud TOTVS.

Será responsável por assegurar a confiabilidade, disponibilidade, desempenho, segurança e evolução contínua dos serviços sob sua responsabilidade, atuando como referência técnica na implementação de soluções, automação de processos, observabilidade, governança e melhoria contínua, contribuindo diretamente para os objetivos estratégicos da companhia.

Responsabilidades e atribuições

  • Que Você Vai Fazer
  • Monitorar continuamente a saúde dos sistemas, criar alertas eficazes e garantir cobertura proativa de incidentes.
  • Responder rapidamente a incidentes críticos, coordenando mitigação, comunicação e resolução.
  • Gerir mudanças, atualizações e implantações com foco em segurança, estabilidade e disponibilidade.
  • Construir e manter pipelines, bibliotecas e automações para provisionamento, deploy e operação em ambientes Cloud de alta disponibilidade.
  • Estabelecer e garantir padrões de security by design em infraestrutura, código e dados.
  • Projetar e evoluir soluções de observabilidade ponta a ponta, integrando logs, métricas, traces e eventos.
  • Criar, gerenciar e melhorar indicadores de confiabilidade (SLIs, SLOs, MTTR, MTTA).
  • Conduzir post-mortems blameless e implementar ações corretivas e preventivas.
  • Influenciar decisões arquiteturais e operacionais visando resiliência, escalabilidade e custo eficiente.
  • Documentar padrões técnicos, playbooks e comunicar impactos técnicos em linguagem de negócio.
  • Definir prioridades estratégicas do backlog de SRE, equilibrando confiabilidade, velocidade de entrega, segurança e custos.
  • Apoiar auditorias, conformidade e governança de segurança em alinhamento com times de risco e compliance.
  • Capacidade de mentorar e influenciar tecnicamente outros times, promovendo cultura de automação, segurança e confiabilidade e fomentando a cultura de ownership sobre sistemas em produção.
  • Disseminar conhecimento técnico por meio de mentorias, treinamentos, workshops, documentações e apresentações internas e externas, contribuindo para o desenvolvimento da equipe.
  • Buscar continuamente novas tecnologias, soluções e referências de mercado junto a fabricantes e fornecedores, avaliando sua viabilidade técnica e de negócio.

Requisitos e qualificações

  • Que Esperamos De Você
  • Domínio de conceitos avançados de SRE, DevSecOps e gestão de incidentes.
  • Automação de infraestrutura e pipelines em alto nível, utilizando Shell, Python, Go, Node.js ou Groovy.
  • Experiência com monitoramento e observabilidade distribuída (Prometheus, Grafana, Loki, ELK/Elastic Stack, Datadog, New Relic, OpenTelemetry).
  • Atuação sólida com Cloud pública (GCP, AWS ou equivalente), incluindo provisionamento, automação e otimização de custos.
  • Experiência em CI/CD e DevSecOps avançado, com ferramentas como Git/GitOps, Jenkins, ArgoCD, Maven, SonarQube/Cloud.
  • Proficiência em contêineres e orquestração (Docker, Kubernetes) e Infraestrutura como Código (Terraform, Ansible, CloudFormation, Chef).
  • Vivência com serviços de mensageria e data streaming como Kafka, Redis Streams, Google Pub/Sub, Dataflow.
  • Experiência com bancos de dados SQL e NoSQL, incluindo PostgreSQL, AloyDB, MySQL, MongoDB, Elasticsearch, BigQuery.
  • Experiência em gestão de incidentes e troubleshooting em sistemas complexos, utilizando PagerDuty, Opsgenie, StatusPage, Splunk ou equivalentes.
  • Conhecimento em segurança da informação, compliance e governança de ambientes cloud (LGPD, Privacy by Design, SAST/DAST, IAM, Secret Management).
  • Familiaridade com ambientes de alto volume de dados, tráfego e experiência com design resiliente.
  • Experiência ou interesse em DataOps/MLOps, atuando com pipelines de dados e IA em larga escala (desejável).
  • Background em arquitetura e desenvolvimento de software, com domínio de versionamento, APIs, microserviços e padrões REST/gRPC.
  • Vivência em metodologias ágeis (Scrum, Kanban ou similares).
  • Uso de IA assistiva e ferramentas de produtividade como GitHub Copilot, ChatGPT ou similares (diferencial).
  • Conhecimento de redes TCP/IP, DNS, HTTP/HTTPS, TLS, Load Balancers, CDN, VPN, proxies e troubleshooting de conectividade.
  • Administração avançada Linux, análise de performance, gerenciamento de processos, memória, disco, rede e troubleshooting em ambientes produtivos.

Benefícios

  • Universidade em Rede TOTVS, uma universidade Corporativa com conteúdos e certificações gratuitos para cada pessoa colaboradora;
  • Programa +Saudáveis, que cuida de cada TOTVER com assessoria e ações voltadas para o bem estar em corpo, mente e finanças pessoais;
  • Programa +Vantagens, a maior rede de descontos da América Latina, exclusivos para nossas pessoas colaboradoras;
  • Programa + Cuidado, programa de apoio pessoal para pessoas colaboradoras e familiares, com orientações em diversas especialidades como: psicologia, serviço social, pet consultoria...
  • Einstein Conecta, benefício de orientação médica online pelos médicos do Hospital Israelita Albert Einstein, totalmente gratuito;
  • Plano de saúde e odontológico;
  • Vale refeição e / ou alimentação;
  • Vale transporte e fretados em algumas estações do metrô;
  • Licença maternidade e paternidade estendida;
  • Espaço de lactário;
  • Bicicletário;
  • Vestiário;
  • Seguro de vida;
  • Auxílio creche;
  • Previdência privada;
  • Escritório que estimula a criatividade e produtividade com ambientes para lanches, salas de jogos, mesas de bilhar e poltronas para relaxar;
  • Gympass.

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

Similar roles

See all →