Skip to content
DevOps Engineer

DevOps Engineer

Platform Engineer

Zalion

Munich

Откликнуться на сайте работодателя

Описание вакансии

Zalion is on a mission to eliminate repetitive procurement work through agentic AI. We’re building autonomous agents that operate deep within enterprise procurement — navigating messy data, legacy systems, and complex workflows to deliver real impact.

Join us early and help define how enterprise AI is done right.

Tasks

You will:

  • Own our platform foundations end-to-end
    — from AWS architecture and IaC to CI/CD, observability, and incident readiness.

  • Build and evolve
    secure, scalable AWS infrastructure
    (networking, compute, storage, IAM) optimized for reliability and cost.

  • Design and maintain
    CI/CD pipelines on GitHub
    that are fast, repeatable, and developer-friendly (clear feedback loops, safe deploys, strong defaults).

  • Define and operate infrastructure using
    Terraform
    — with clean modules, sensible standards, and automated validation.

  • Improve
    developer experience
    through golden paths: templates, self-service environments, paved roads for deployments, and internal tooling that removes friction.

  • Drive
    availability, scalability, and resilience
    : deployment strategies, rollbacks, capacity planning, DR thinking, and performance tuning.

  • Implement pragmatic
    security-by-default
    : least privilege IAM, secrets management, secure supply chain, and guardrails that enable speed without compromising safety.

  • Establish and refine
    observability and reliability practices
    (SLOs/SLIs, monitoring, alerting, postmortems, runbooks) that scale with the team.

  • Partner closely with product engineering to reduce operational load and keep delivery velocity high as Zalion grows.

Requirements

  • Strong experience as a
    Platform / DevOps / Site Reliability Engineer
    in product teams shipping to production.

  • Deep practical knowledge of
    AWS
    : networking, IAM, security controls, and designing for failure.

  • Hands-on expertise with
    Terraform
    : modules, state strategy, DRY patterns, environment separation, and automated reviews.

  • Solid CI/CD engineering experience with
    GitHub
    : pipeline design, artifact/versioning, deployment safety, and fast feedback loops.

  • A strong mindset for
    reliability and operability
    : you think in failure modes, automation, and measurable outcomes (SLOs).

  • Security awareness and discipline: you build
    guardrails
    that make the secure path the easy path.

  • A
    builder mindset
    : you ship improvements, measure impact (lead time, deploy frequency, MTTR), and iterate.

  • Comfort with
    ambiguity and ownership
    : you proactively identify platform bottlenecks and fix them without waiting for perfect specs.

  • 4+ years
    experience in relevant roles (startup/scale-up experience is a plus).

Benefits

  • Build the platform behind agentic AI systems that run in real enterprise environments

  • Massive autonomy, zero bureaucracy

  • Immediate impact — your work accelerates every engineer and every release

  • Modern stack, no legacy constraints

  • Competitive salary + meaningful equity

  • High-end equipment

🛠️ Tech Stack You’ll Work With

  • AWS
    (core services; compute, networking, IAM, logging/monitoring, managed data services)

  • Terraform
    (modules, workspaces, validation, state management)

  • GitHub
    (Actions, CI/CD workflows, checks, release automation)

  • Containers orchestration (e.g.,
    ECS/Fargate
    and/or Kubernetes depending on evolution)

  • Observability tooling (metrics, logs, tracing; e.g., Grafana/Prometheus/OpenTelemetry and friends)

  • Security tooling (SAST/DAST, dependency scanning, secrets scanning, policy as code

Это сохранённая копия объявления, опубликованного в другом месте. Вакансии снимают без предупреждения — перед откликом проверьте сайт работодателя. mentors.coach не является нанимающей стороной.

Скоро на этой странице

Резюме под эту вакансию — и билет в розыгрыш

Мы разбираем объявление до настоящих требований и переписываем ваше резюме под него — вопросами, а не выдумкой: ни одна строка не появится без вашего подтверждения. Войдите, чтобы получить это первым, — и попасть в розыгрыш.

  • Резюме под конкретную вакансию, а не «универсальное»
  • Ответы хранятся: правится любой, а не весь разговор заново
  • Всё в аккаунте — открывается с любого устройства

Разыгрываем

Скидка на сопровождение

Победителей выбираем случайно среди заявок с подтверждённой почтой. Дата розыгрыша и полные правила — на странице розыгрыша.

Правила розыгрыша

DevOps Engineer

Senior HPC Cluster Administrator - Deep Learning Frameworks Infrastructure

NVIDIA

Berlinfulltimesenior

Откликнуться на сайте работодателя

Описание вакансии

NVIDIA's Deep Learning Frameworks (DLFW) Infrastructure team is looking for a deeply technical Senior HPC Cluster Administrator to lead the design, deployment, and reliability of our large-scale GPU compute clusters. These systems run the most demanding deep learning training, inference, and high-performance computing workloads in the industry — from DGX/HGX platforms to ground-breaking Grace Blackwell systems. You will drive architectural decisions across compute, networking, and storage, and partner closely with software, research, and product teams to keep our infrastructure ahead of the workloads it supports.

What You'll Be Doing

  • Own the full lifecycle of GPU compute clusters — procurement, provisioning, configuration management, monitoring, and deprecation — across heterogeneous Linux environments (DGX, HGX, embedded systems)
  • Design and scale storage solutions (NFS, Lustre, WekaFS, or equivalent) with a clear roadmap for capacity and performance growth
  • Lead automation of infrastructure using modern IaC tools (Ansible, Terraform) and CI/CD pipelines (GitLab)
  • Manage and optimize job scheduling via Slurm, including fair-share policies, reservation management, and MIG/GPU partitioning strategies
  • Maintain and improve observability stacks (Prometheus, Grafana, DCGM) and drive proactive resolution of hardware and software incidents
  • Collaborate with ML engineers and software teams to tune cluster configuration for large-scale distributed training workloads
  • Evaluate and introduce new technologies — networking fabrics (InfiniBand, NVLink, EFA/RDMA), storage tiers, container runtimes — to improve performance and reliability
  • Mentor junior engineers and contribute to team-wide engineering standards

What We Need To See

  • BS/MS in CS, EE, CE, or equivalent hands-on experience
  • 5+ years of experience deploying and administering large-scale HPC or ML training clusters
  • Deep expertise in Linux systems administration at scale
  • Strong scripting and automation skills in Python and/or bash
  • Hands-on experience with Slurm (scheduling, accounting, cgroup configuration)
  • Proficiency with configuration management and IaC (Ansible required; Terraform a plus)
  • Experience with container technologies (Docker, Apptainer/Singularity, Kubernetes)
  • Solid understanding of high-speed networking (InfiniBand, RoCE, RDMA, EFA)
  • Experience with distributed/parallel filesystems and storage architecture
  • Ability to own problems end-to-end and communicate clearly with engineering and management stakeholders

Ways To Stand Out From The Crowd

  • Experience with NVIDIA GPU infrastructure tools (DCGM, nvidia-smi, MIG, NVSwitch diagnostics)
  • Familiarity with cluster management platforms (Colossus, Bright Cluster Manager, xCAT, or similar)
  • Experience supporting large-scale distributed deep learning workloads (PyTorch, JAX, Megatron)
  • Knowledge of BMC/IPMI/Redfish for out-of-band management and hardware lifecycle
  • Background in MLOps tooling or ML platform engineering

Join our team of world-class engineers and be part of the groundbreaking work we do at NVIDIA. We are committed to encouraging a collaborative and inclusive environment, where every team member has the opportunity to thrive and make a significant impact!

Your base salary will be determined based on your location, experience, and the pay of employees in similar positions. For Poland: The base salary range is 221,250 PLN - 383,500 PLN for Level 3, and 292,500 PLN - 507,000 PLN for Level 4. , , JR2015529

Это сохранённая копия объявления, опубликованного в другом месте. Вакансии снимают без предупреждения — перед откликом проверьте сайт работодателя. mentors.coach не является нанимающей стороной.

DevOps Engineer

DevOps Engineer *German required (GCP) (m/w/d)

ventx - we make IT!

Munichfulltime

Откликнуться на сайте работодателя

Описание вакансии

Zur Verstärkung unseres Teams im Großraum München suchen wir, zum nächstmöglichen Termin, engagierte Leute die Lust haben, deine bisher erworbenen IT-Kenntnisse zu erweitern und sich firmenintern zu einem DevOps Cloud Engineer (m/w/d) mit Schwerpunkt AWS Cloud ausbilden zu lassen.

Aufgaben

  • Lust sich in neue Themengebiete einzuarbeiten

  • Mut sich zum Spezialisten ausbilden zu lassen

  • CI/CD Implementationen

  • Erstellung von Infrastrucure as Code

  • Consulting von Projekten im Bereich IT-Infrastruktur

  • Gute Deutsch- und Englischkenntnisse

Qualifikation

Dein Profil

eine erfolgreich abgeschlossene IT-Ausbildung bzw. ein abgeschlossenes Studium der Informatik oder entsprechende Berufserfahrung

  • sicherer Umgang mit Linux

  • beherrschen mindestens einer Script-Sprache wie Bash oder Python

  • Kenntnisse in der Administration von Netzwerken

  • gute Infrastrukturkenntnisse und Coding-Skills

Wünschenswert, aber nicht zwingend erforderlich

Erfahrungen in dem Bereich von Cloud Providern – insbesondere GCP

  • Know-How über Infrastruktur als Code – Cloudformation, Terraform

  • Kenntnisse der Tools CI/CD, GIT, Ansible, Chef, Puppet, Jenkins

  • Kenntnisse in der Administration von Netzwerken

  • praktische Erfahrung mit Monitoring-Tools wie Grafana, Graphite, Prometheus sowie Logging-Tools wie ElasticSearch, lostack, Kibana

Benefits

  • neben attraktiver Vergütung und abwechslungsreicher Tätigkeit, Spaß bei der Arbeit

  • flache Hierarchien mit kurzen Entscheidungswegen

  • ein Team dass sich gerne bei Problemen und Fragen gegenseitig unterstützt

  • moderne Büroräume mit aktuellster Hard- und Software

  • Team-Events

  • Kostenlose Getränke im Office

BEWIRB DICH JETZT! Wir antworten in kürzester Zeit.

Это сохранённая копия объявления, опубликованного в другом месте. Вакансии снимают без предупреждения — перед откликом проверьте сайт работодателя. mentors.coach не является нанимающей стороной.

DevOps Engineer

Senior Systems Engineer – Business Applications (m/w/d)

BWI GmbH

Strausbergfulltimesenior

Откликнуться на сайте работодателя

Описание вакансии

Sorge gemeinsam mit uns für die digitale Zukunftsfähigkeit der Bundeswehr.

Deine Aufgaben:

  • 2nd Level Support für die LAMP (Linux/Apache/MySQL/PHP) - Plattformen und Applikationen in unserer eigenen Cloud
  • Mitwirkung bei der automatisierten Bereitstellung von Plattformkomponenten durch CI/CD
  • Erstellung, Test und Implementierung von Containerbuilds
  • Bearbeitung von Störungen gemäß Spezifikation der BWI (Störungsannahme, Fehleranalyse, Fehlerbehebung)
  • Identifikation von Risiken, sowie Absicherung und Behebung von Security Risiken
  • Mitwirkung bei der Entwicklung von Schulungskonzepten
  • Pflege und Weiterentwicklung der technischen Dokumentation

Dein Profil:

  • Erfahrungen mit einem oder mehreren der folgenden Technologien: Webservern (Apache, NGINX), Linux Betriebssysteme (z.B. CentOS, SuSE, RHEL, Debian), Datenbanken (z.B.: MySQL, MariaDB, PostgreSQL), LAMP basierte Anwendungen
  • Gute Kenntnisse in Kubernetes und Cloud-nativen Konzepten
  • Kenntnisse von Anwendungsdeployments as Code via Helm-Charts, kustomize, k8s-Operators
  • Erfahrungen mit Automatisierungswerkzeugen (z.B. GitLab-CI, Terraform, Crossplane, Ansible, ArgoCD und FluxCD)
  • Erfahrungen mit Container-Builds (z.B. Docker, Buildah) und Artefaktverwaltung (Nexus, Harbor)
  • Vertrautheit mit Monitoring- , Logging- und Alerting-Stacks (z.B. Prometheus, Grafana, Instana)
  • Erfahrungen mit Skalierung und Ressourcenoptimierung in Container basierten Umgebungen sowie Git/Git-Ops
  • Grundverständnis TCP Netze wie Firewalling, Netzstruktur, Sicherheit
  • Erfahrungen mit CMDB/Asset-Managementsystemen
  • ITIL Grundkenntnisse (Change/Incident/Problem-Management)
  • Fließende Deutsch- und gute Englischkenntnisse

Wir bieten:

  • Durch abwechslungsreiche und gesellschaftlich relevante Aufgaben gewährleisten wir den reibungslosen IT-Betrieb und die Digitalisierung der Bundeswehr
  • Das Ziel eint uns. Dabei sind für uns ein wertschätzender Umgang miteinander sowie ein großer Teamgeist elementar
  • Die Vergütung liegt zwischen 57.800 € und 84.680 €. Die tatsächliche Höhe wird basierend auf deinem Verantwortungsbereich sowie Erfahrungen und Kompetenzen festgelegt
  • Wir bieten 30 Tage Jahresurlaub, 1 Brauchtumstag plus Optionen auf individuelle Anpassungen
  • Über unsere Benefit-App erhält man ein monatliches Guthaben und kann sich zusätzlich Steuervergünstigungen auf Tickets für den ÖPNV sichern
  • Wir ermöglichen Flexibilität, um Beruf und Privatleben in Einklang zu bringen, etwa durch mobiles Arbeiten oder Vertrauensarbeitszeit
  • Wir unterstützen die berufliche und persönliche Weiterbildung durch individuelle Maßnahmen sowie einen kostenfreien Zugriff auf LinkedIn Learning
  • Unser Jobradangebot ermöglicht das Leasing von bis zu 2 Fahrrädern

Это сохранённая копия объявления, опубликованного в другом месте. Вакансии снимают без предупреждения — перед откликом проверьте сайт работодателя. mentors.coach не является нанимающей стороной.

DevOps Engineer

IT Expert DevOps / Platform Engineering (m/w/d)

BWI GmbH

Berlinfulltime

Откликнуться на сайте работодателя

Описание вакансии

Sorge gemeinsam mit uns für die digitale Zukunftsfähigkeit der Bundeswehr.

Ihre Aufgaben:

  • Betreuung und (Weiter-)Entwicklung einer Cloud-Native-Plattform für Data Analytics und KI Tools für unseren Kunden Bundeswehr
  • Realisierung und Sicherstellung der Betreibbarkeit eines PaaS/SaaS auf Basis von Kubernetes mit hohem Automatisierungsgrad in der Provisionierung und Deployment in einem agil aufgestellten Team
  • Automatisierte Bereitstellung von containerisierten Plattformkomponenten durch CI/CD sowie Überwachung und Optimierung der Plattform durch den gezielten Einsatz von Logging, Monitoring und Tracing
  • Kontinuierliche und systematische Härtung durch die Realisierung von Anforderungen der IT-Sicherheit
  • Mitwirkung an der Erstellung von code-naher technischen Dokumentationen

Ihr Profil:

  • Abgeschlossenes fachbezogenes Hochschulstudium oder eine vergleichbare Ausbildung
  • Etwa 2 Jahre Berufserfahrung in einem oder mehreren der folgenden Themenfelder Cloud-native Plattformen, Deployment von Microservices und/oder Automatisierung containerisierter Anwendungen
  • Gute Kenntnisse in Kubernetes und den Cloud-native Konzepten, API-Gateways, Service-Mesh (z.B. Istio), Authentifizierung und Observability
  • Erfahrungen im Umgang mit Automatisierungswerkzeugen und Infrastructure as Code und GitOps, z.B. mit GitLab-CI, Terraform, Crossplane oder ArgoCD
  • Erfahrung im Deployment von Machine Learning Systemen (MLOps) wünschenswert
  • Gute Kommunikations- und Teamfähigkeiten, ein analytisches Denkvermögen Lernbereitschaft sowie eine sorgfältige und gewissenhafte Arbeitsweise
  • Verhandlungssichere Deutschkenntnisse und ein sicheres Verständnis der englischen Sprache

Wir bieten:

  • Durch abwechslungsreiche und gesellschaftlich relevante Aufgaben gewährleisten wir den reibungslosen IT-Betrieb und die Digitalisierung der Bundeswehr
  • Das Ziel eint uns. Dabei sind für uns ein wertschätzender Umgang miteinander sowie ein großer Teamgeist elementar
  • Die Vergütung liegt zwischen 57.800 € und 84.680 €. Die tatsächliche Höhe wird basierend auf deinem Verantwortungsbereich sowie Erfahrungen und Kompetenzen festgelegt
  • Wir bieten 30 Tage Jahresurlaub, 1 Brauchtumstag plus Optionen auf individuelle Anpassungen
  • Über unsere Benefit-App erhält man ein monatliches Guthaben und kann sich zusätzlich Steuervergünstigungen auf Tickets für den ÖPNV sichern
  • Wir ermöglichen Flexibilität, um Beruf und Privatleben in Einklang zu bringen, etwa durch mobiles Arbeiten oder Vertrauensarbeitszeit
  • Wir unterstützen die berufliche und persönliche Weiterbildung durch individuelle Maßnahmen sowie einen kostenfreien Zugriff auf LinkedIn Learning
  • Unser Jobradangebot ermöglicht das Leasing von bis zu 2 Fahrrädern

Это сохранённая копия объявления, опубликованного в другом месте. Вакансии снимают без предупреждения — перед откликом проверьте сайт работодателя. mentors.coach не является нанимающей стороной.

Ещё 206 вакансий по этой категории в этой стране

Platform EngineerZalion · Germany

Откликнуться на сайте работодателя
Platform Engineer — Zalion | mentors.coach