Skip to content
Site Reliability Engineer

Site Reliability Engineer

MLOps & Platform Engineer

TXT GROUP

Cologno Monzesefulltime

Apply on the employer's site

Role description

TXT Group
, a company within the
TXT Group
, is seeking an
MLOps & Platform Engineer
to join its Industrial Business Unit.

The ideal candidate will be responsible to design, build and operate the company’s application and AI platform, ensuring secure, scalable and highly available environments for both enterprise applications and AI/ML workloads.

At least three years’ relevant experience in platform and infrastructure engineering is required, with production ownership of: Kubernetes, CI/CD pipelines and cloud infrastructure.

Main responsibilities:

  • Design and manage cloud-native platforms, Kubernetes clusters and containerised applications;
  • Build and maintain CI/CD pipelines, and automate infrastructure provisioning and application deployment;
  • Design, deploy and manage infrastructure for AI systems: LLM and embedding model serving, vector databases, application databases and caching systems;
  • Define and maintain CI/CD pipelines for AI applications and data pipelines, with reproducible environments and secure release strategies;
  • Manage versioning of models, prompts and configurations, and support fine-tuning and retraining pipelines where required;
  • Collaborate with software developers and AI engineers to streamline delivery and operations;
  • Implement monitoring, logging, tracing and alerting for LLM applications and data pipelines, covering latency, error rate, cost per call, drift and production quality metrics;
  • Ensure scalability, high availability and operational continuity of AI services, including knowledge base ingestion and update pipelines;
  • Optimise inference and embedding costs through resource sizing, quantisation, batching and infrastructure-level caching;
  • Ensure overall platform security, observability, performance and operational reliability;
  • Manage secrets, API keys, access control and environment isolation for AI services;
  • Support offline evaluation and A/B testing activities by providing the necessary infrastructure and telemetry data.

Indispensable technical skills
:

  • Solid experience with containerisation and orchestration technologies such as Docker, Kubernetes, Helm and Docker Compose;
  • Proficiency with CI/CD and DevOps tooling, including Git, GitLab and GitLab CI/CD (or equivalents such as GitHub Actions), GitOps workflows, container registries and release management practices, with automation skills in Python and Bash;
  • Strong background in infrastructure automation on Linux, using Terraform and Ansible to implement Infrastructure as Code and manage virtualised environments;
  • Solid understanding of networking and security fundamentals (TCP/IP, HTTP/HTTPS, DNS), reverse proxies and ingress controllers (Nginx, Traefik), TLS/SSL, identity and access management (Keycloak, OAuth2/OpenID Connect), secrets management and IAM;
  • Experience with observability stacks such as Prometheus, Grafana, Loki, OpenTelemetry, OpenSearch and Alertmanager (or an equivalent ELK-based stack), applied to production ML and LLM systems;
  • Hands-on experience with AI/MLOps tooling, including MLflow and experiment tracking platforms such as Weights & Biases, model registries, and model serving frameworks such as vLLM, Ollama, Triton Inference Server, SageMaker or Vertex AI, applied to GPU-based inference workloads;
  • Experience deploying and operating vector databases (Qdrant, pgvector), embedding models and RAG pipelines as part of production AI inference services;
  • Proficiency in backend and data technologies, including Python, FastAPI and REST APIs, together with operational experience running PostgreSQL, Microsoft SQL Server and Redis in production;
  • Practical experience operating production databases across SQL/NoSQL and vector stores, covering provisioning, backup and scaling;
  • Familiarity with LLMOps practices, including prompt and experiment tracking, inference cost monitoring and model version management;
  • Understanding of inference optimisation techniques such as quantisation, batching, caching and GPU-level optimisation (e.g. TensorRT);
  • Experience managing the ML/LLM model lifecycle, including fine-tuning and retraining pipelines, offline evaluation and A/B testing;
  • Working knowledge of at least one major cloud platform (Microsoft Azure, AWS or Google Cloud Platform) and its services for ML/AI workloads.

Familiarity with HashiCorp Nomad is a PLUS.

Education:
Bachelor’s or Master’s degree in Computer Science, Computer Engineering or a similar field.

The perfect candidate will also possess problem-solving skills, curiosity, the ability to work independently, a proactive approach, a sense of responsibility, a collaborative spirit, the ability to draft technical documentation, and the ability to work effectively within cross-functional teams.

Why choose TXT Group:

  • Hybrid working mode;
  • Career opportunities in a fast-growing, international and dynamic environment;
  • Continuous training on technical and project-related topics;
  • Corporate benefits including health insurance, welfare services, meal vouchers, and employee discounts;
  • The contract offered for this position is a permanent one, and the salary range for this position is between EUR 35.000 € and EUR 40.000 € gross per year.
  • The grading/level will be defined during the selection process based on the candidate's profile and in accordance with the National Collective Labor Agreement (Metalworking Industry).

*Position open to candidates without distinction of gender, pursuant to Legislative Decree 198/2006.

The company promotes equal opportunities and values diversity in all its forms.*

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

Site Reliability Engineer

Senior Technical Operations Engineer

Generali Italia

Milanfulltime

Apply on the employer's site

Role description

Siamo leader di mercato e abbiamo l’obiettivo di essere partner di vita delle persone, offrendo ai nostri clienti e agenti la migliore esperienza assicurativa, che metta la persona al centro e veda nella tecnologia e nell’innovazione i fattori abilitanti. Esiste un cuore pulsante del processo di semplificazione, innovazione e digitalizzazione di Generali Country Italia, dove abbiamo iniziato a sviluppare idee, progetti e tecnologie digitali, introdurre nuovi modi di lavorare, essere aperti all’esterno e coinvolgere le nostre persone. Intelligenza artificiale, realtà virtuale, canali di interazione innovativi, device evoluti di connettività, digitalizzazione dei processi, big data sono solo un assaggio di ciò che stiamo sperimentando e ora siamo pronti ad accelerare il processo di trasformazione.

In tale contesto nasce l’esigenza di incrementare l’attuale organico nella struttura
Digital Operation & Technology Services
, all’interno del dipartimento
Technical Operations
, con responsabilità sulla gestione della
piattaforma container on premises
.

La risorsa entrerà a far parte del team che presidia l’infrastruttura Kubernetes aziendale, con un focus specifico sulla
gestione operativa dei cluster Kubernetes
, contribuendo a garantirne affidabilità, sicurezza, continuità operativa e scalabilità.

In collaborazione con i colleghi del team, la persona selezionata si occuperà di:

  • Configurazione, amministrazione e manutenzione di cluster Kubernetes on premises
  • Gestione del lifecycle del cluster, incluse attività di provisioning, upgrade, patching, troubleshooting e capacity planning
  • Monitoraggio e ottimizzazione delle performance della piattaforma e dei servizi in esecuzione
  • Implementazione di pratiche e strumenti di automazione per garantire alta disponibilità, sicurezza ed efficienza operativa
  • Supporto all’integrazione tra applicazioni e servizi di piattaforma in ambiente containerizzato
  • Produzione e aggiornamento della documentazione tecnica, oltre al supporto specialistico verso i team coinvolti

Requirements

  • Solida conoscenza di Kubernetes (K8S) e comprovata esperienza nella gestione di cluster Mirantis MKE e VMware vSphere Kubernetes Service (VKS) on premises.
  • Comprovata esperienza nella gestione dei principali componenti dell’ecosistema Kubernetes, in particolare: networking, ingress, storage, security, RBAC, monitoring e logging
  • Conoscenza ed esperienza nell’utilizzo di ArgoCD per il deployment e la sincronizzazione applicativa in ambienti Kubernetes
  • Esperienza pluriennale nella gestione operativa di piattaforme Kubernetes in ambienti VMware
  • Almeno 5-7 anni di esperienza in ruoli quali SRE, Platform Engineer o affini, con forte focus su ambienti Linux
  • Ottima padronanza di strumenti di scripting e automazione, quali Bash, Python e Ansible
  • Spiccate capacità analitiche, orientamento al problem solving e autonomia nella gestione delle attività

Requisiti preferenziali:

  • Certificazioni CKA / CKS / CKAD, VMware Tanzu / VKS o equivalenti
  • Conoscenza dell’ecosistema VMware vSphere e dei meccanismi di integrazione con networking e storage di piattaforma
  • Familiarità con metodologie Agile / DevOps
  • Conoscenza della lingua inglese B2

Soft skills

  • Attitudine al lavoro in team e buone capacità relazionali
  • Capacità di interazione con interlocutori tecnici e management
  • Proattività, autonomia e senso di responsabilità
  • Capacità di sintesi, unita a precisione e attenzione al dettaglio

È offerto inserimento nel VI Livello di inquadramento e retributivo, con applicazione del CCNL ANIA per il personale dipendente non dirigente e del Contratto Integrativo Aziendale del Gruppo Generali.

Retribuzione annua lorda iniziale compresa tra
45K€ e 55K€.
L’offerta finale sarà formulata in coerenza con l’esperienza professionale, le competenze tecniche e trasversali possedute dalla risorsa funzionali per il ruolo e potrà prevedere una componente variabile individuale.

Company Profile

Il nostro purpose: “Empowering Lives and Dreams – Diamo forza alla vita e ai sogni delle persone”.

Essere Partner di Vita è ciò che in Generali facciamo ogni giorno, con la volontà di essere al fianco delle persone nei momenti rilevanti della loro vita. Non è solo ciò che facciamo, è ciò che siamo. Per questo per noi è Più di un Lavoro.

  • Siamo parte di un importante Gruppo internazionale con oltre 82 mila persone in tutto il mondo e più di 70 milioni di clienti
  • Siamo tra i principali player globali del settore assicurativo: l’innovazione e la sostenibilità sono nel nostro DNA
  • Generali Italia è l’assicuratore più conosciuto in Italia con circa Є31 miliardi di premi totali, 14 mila dipendenti e una rete capillare di 40 mila distributori, oltre ai canali online e di bancassurance. A Generali Italia fanno capo Alleanza Assicurazioni, Das, Genertel, Generali Welion, Generali Jeniot e Leone Alato, oltre alle attività marchio commerciale Cattolica.

Il Gruppo Generali offre delle interessanti opportunità di arricchimento professionale in un contesto lavorativo caratterizzato da:

  • Cultura aziendale solida e aperta, modi di lavorare innovativi, formazione e affiancamento a supporto di un inserimento efficace
  • Ambiente di lavoro inclusivo in cui ci si sente accolti, liberi di esprimere al meglio la propria identità, le proprie idee e le proprie capacità: perché siamo Più che diverse, Persone Uniche
  • Qualità dei processi e iniziative per le nostre persone, che ci distinguono come Top Employer

Luogo di lavoro: Milano o Mogliano Veneto.

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

Site Reliability Engineer

AI Agent System Engineer

Generali Italia

Milanfulltime

Apply on the employer's site

Role description

Siamo alla ricerca di un/una
AI Agent System Engineer
che guidi la progettazione, lo sviluppo e il deployment di sistemi multi-agenti. Avrai un ruolo chiave nell’utilizzo e messa a terra di soluzioni AI per risolvere sfide complesse e generare un impatto significativo in tutta l'organizzazione. Si tratta un’opportunità per lavorare con delle tecnologie all’avanguardia nel campo dell’AI e contribuire alla creazione di sistemi intelligenti e autonomi per migliorare le pipeline di lavoro IT.

Responsabilità:

  • Progettare e definire architetture robuste e scalabili per sistemi multi-agent utilizzando framework come Copilot Studio, Strands o LangGraph
  • Sviluppare, implementare e testare skill e soluzioni per facilitare lo sviluppo e la manutenzione del codice mediante AI coding assistant come Claude Code e Github Copilot
  • Sviluppare, implementare e testare agenti AI e le loro interazioni tramite Python
  • Integrare ed effettuare il deployment di sistemi multi-agent su piattaforme cloud (AWS), garantendo scalabilità, affidabilità e sicurezza
  • Utilizzo di framework e principi fondamentali di AI per addestrare agenti
  • Utilizzo di tecnologie di knowledge graph, in particolare Cheshire Cat, per potenziare il ragionamento degli agenti e il reperimento delle informazioni
  • Eseguire il deployment e gestire applicazioni containerizzate utilizzando Kubernetes
  • Collaborare a stretto contatto con team cross-funzionali, inclusi data scientist, machine learning engineer e product manager per definire requisiti e realizzare soluzioni
  • Contribuire alla ricerca e alla valutazione di nuove tecnologie e metodologie per agenti AI
  • Documentare architetture, processi di sviluppo e procedure SDLC
  • Analizzare e risolvere problemi relativi ai sistemi multi-agent negli ambienti di sviluppo e produzione
  • Mantenersi aggiornati sugli ultimi progressi nel campo degli agenti AI, nei sistemi multi-agent e nelle tecnologie cloud

Requirements

  • Laurea triennale o magistrale in Computer Science, Artificial Intelligence, Engineering o ambito correlato
  • Esperienza comprovata nella progettazione e nello sviluppo di applicazioni e sistemi AI
  • Ottima padronanza della programmazione in Python
  • Conoscenza di Javascript, Typescript o Java
  • Esperienza pratica con framework di programmazione multi-agent come Crew AI o Microsoft Copilot Studio (o simili)
  • Solida comprensione dei concetti e dei framework fondamentali di AI/ML (ad es. Langchain, Transformers)
  • Esperienza pratica con piattaforme cloud (AWS, GCP o Azure), incluso il deployment e la gestione delle applicazioni
  • Familiarità con tecnologie di knowledge graph es. Cheshire Cat
  • Esperienza con tecnologie di containerizzazione e orchestrazione tramite Kubernetes
  • Eccellenti capacità di problem solving, analisi e comunicazione
  • Capacità di lavorare in autonomia e in team all’interno di un ambiente dinamico
  • Forte passione per l'AI e per lo sviluppo software

Qualifiche preferenziali:

  • Conoscenza di diversi protocolli di comunicazione e architetture per agenti
  • Esperienza con pipeline CI/CD per deployment di soluzioni AI/ML
  • Contributi a progetti AI open-source

Cosa offriamo
:

  • Un ambiente di lavoro stimolante e innovativo, all'avanguardia nella tecnologia AI applicata all'IT
  • La possibilità di generare impatto positivo sul lavoro del personale IT in un'organizzazione strutturata
  • Opportunità di crescita e sviluppo professionale
  • L'opportunità di generare un impatto significativo costruendo soluzioni AI all'avanguardia

È offerto l'inserimento nel V° Livello di inquadramento, con applicazione del CCNL ANIA per il personale dipendente non dirigente e del Contratto Integrativo Aziendale del Gruppo Generali.

Retribuzione annua lorda iniziale compresa tra
39K€ e 47K€.
L’offerta finale sarà formulata in coerenza con l’esperienza professionale, le competenze tecniche e trasversali possedute dalla risorsa funzionali per il ruolo e potrà prevedere una componente variabile individuale.

Company Profile

Il nostro purpose: “Empowering Lives and Dreams – Diamo forza alla vita e ai sogni delle persone”.

Essere Partner di Vita è ciò che in Generali facciamo ogni giorno, con la volontà di essere al fianco delle persone nei momenti rilevanti della loro vita. Non è solo ciò che facciamo, è ciò che siamo. Per questo per noi è Più di un Lavoro.

  • Siamo parte di un importante Gruppo internazionale con oltre 82 mila persone in tutto il mondo e più di 70 milioni di clienti
  • Siamo tra i principali player globali del settore assicurativo: l’innovazione e la sostenibilità sono nel nostro DNA
  • Generali Italia è l’assicuratore più conosciuto in Italia con circa Є31 miliardi di premi totali, 14 mila dipendenti e una rete capillare di 40 mila distributori, oltre ai canali online e di bancassurance. A Generali Italia fanno capo Alleanza Assicurazioni, Das, Genertel, Generali Welion, Generali Jeniot e Leone Alato, oltre alle attività marchio commerciale Cattolica.

Il Gruppo Generali offre delle interessanti opportunità di arricchimento professionale in un contesto lavorativo caratterizzato da:

  • Cultura aziendale solida e aperta, modi di lavorare innovativi, formazione e affiancamento a supporto di un inserimento efficace
  • Ambiente di lavoro inclusivo in cui ci si sente accolti, liberi di esprimere al meglio la propria identità, le proprie idee e le proprie capacità: perché siamo Più che diverse, Persone Uniche
  • Qualità dei processi e iniziative per le nostre persone, che ci distinguono come Top Employer

Luogo di lavoro: Milano, Torino o Mogliano Veneto.

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

Site Reliability Engineer

System Engineer

Nine Twenty Recruitment

Milanfulltime

Apply on the employer's site

Role description

OT Systems Engineer
Milan, Italy | Permanent | Hybrid

Our client is a leading hyperscale data centre operator with a growing presence across Europe. They are looking for an experienced OT Systems Engineer to join their team on a permanent, hybrid basis in Milan.

The Role

A hands-on position supporting the design, implementation, and operation of secure, resilient systems infrastructure across critical data centre sites. You will work closely with internal engineering and operations teams and third-party vendors, maintaining performance, reliability, and security across a high-availability OT environment.

Key Responsibilities

  • Deploy, configure, maintain, and optimise OT systems infrastructure across critical data centre environments
  • Support Windows, Linux, and VMware virtualised platforms to maintain performance and service continuity
  • Monitor system performance, identify bottlenecks, and implement improvements
  • Troubleshoot complex incidents and drive root cause resolution with internal teams and vendors
  • Manage patching, backup, maintenance, and documentation across OT systems
  • Apply security and operational best practices within a high-availability environment
  • Provide out-of-hours and emergency support when required

What They Are Looking For

  • Solid experience as a Systems Engineer in an enterprise, critical infrastructure, or data centre environment
  • Strong hands-on knowledge of Windows, Linux, and VMware-based virtualisation
  • Familiarity with OT systems such as BMS, EPMS, SCADA, PLCs, or HMIs is a strong advantage
  • Experience with scripting or automation tools such as PowerShell or Ansible is beneficial
  • Knowledge of SAN, backup solutions, Azure, or relevant Microsoft/VMware certifications is a plus
  • Italian and English at B2/C1 level required

To be considered, please apply today and Leon will be in touch.

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

Site Reliability Engineer

Senior DevOps Engineer

Cerved

Milanfulltime

Apply on the employer's site

Role description

Cerved è la tech company italiana che, grazie a segnali predittivi unici e a un patrimonio esclusivo di dati e analytics, supporta la crescita sostenibile, la gestione del rischio e la trasformazione digitale di imprese e istituzioni.

Con Cerved Rating Agency, elaboriamo valutazioni sul merito di credito, rating ESG e analisi sulle emissioni di debito.

Dal 2021 Cerved è parte di ION Group, uno dei più grandi operatori FinTech internazionali.

Per rafforzare la nostra struttura
Data, Architectures & Technologies
, siamo alla ricerca di un
Senior DevOps Engineer
che entrerà in un contesto dinamico e in forte crescita. La risorsa avrà un ruolo strategico nella progettazione e nell’evoluzione delle piattaforme cloud aziendali, garantendo scalabilità, sicurezza, affidabilità e allineamento ai più elevati standard di compliance normativa a supporto di servizi digitali critici.

Principali responsabilità

  • Definire e guidare l’evoluzione della Cloud Platform aziendale, progettando architetture enterprise condivise, resilienti, sicure e altamente scalabili a supporto dei servizi core business-critical;
  • Assicurare la governance tecnologica della piattaforma cloud, traducendo strategie di business e requisiti IT in capability infrastrutturali standardizzate, automatizzate e riutilizzabili;
  • Definire standard architetturali, framework operativi, best practice e linee guida per l’adozione efficace e sostenibile delle piattaforme cloud all’interno dell’organizzazione;
  • Disegnare e mantenere baseline infrastrutturali enterprise tramite Infrastructure as Code e automazione avanzata, garantendo consistenza, compliance e scalability by design;
  • Governare piattaforme Kubernetes mission-critical in ambienti enterprise, assicurando continuità operativa, sicurezza, aggiornamenti, observability, capacity management e integrazione end-to-end con l’ecosistema cloud;
  • Integrare principi di security-by-design, governance e compliance all’interno della piattaforma, collaborando con funzioni Security, Risk e Architecture;
  • Guidare iniziative di ottimizzazione di costi, performance, affidabilità e resilienza secondo pratiche FinOps, Site Reliability Engineering (SRE) e operational excellence;
  • Valutare, selezionare e indirizzare l’adozione di nuove tecnologie e servizi cloud, garantendo coerenza architetturale, sostenibilità operativa e allineamento strategico;
  • Supportare la definizione della roadmap evolutiva della piattaforma cloud, contribuendo alle decisioni architetturali di medio-lungo periodo;
  • Promuovere cultura engineering, automazione e standardizzazione, fungendo da riferimento tecnico per team infrastrutturali, DevOps e applicativi;
  • Produrre e mantenere documentazione tecnica, architetturale e operativa a supporto della governance, dell’auditabilità e della continuità operativa.

Requisiti

  • Laurea in Informatica, Ingegneria Informatica o discipline STEM equivalenti;
  • Esperienza pluriennale in ruoli senior di Cloud Platform Engineering, Cloud Infrastructure Engineering, SRE o System Engineering in contesti enterprise complessi e strutturati;
  • Conoscenza approfondita della piattaforma AWS e comprovata esperienza nella progettazione e gestione di architetture cloud enterprise multi-account;
  • Solida expertise nell’amministrazione avanzata di sistemi Linux enterprise e nella gestione di infrastrutture mission-critical;
  • Esperienza consolidata nella gestione di cluster Kubernetes in produzione, incluse tematiche di networking, security, observability, scaling e lifecycle management;
  • Competenze avanzate in Infrastructure as Code e automazione infrastrutturale tramite Terraform, Ansible e strumenti affini;
  • Familiarità con principi e pratiche DevOps, CI/CD, GitOps, observability e reliability engineering;
  • Esperienza nell’implementazione di modelli di governance cloud, security baseline e processi di compliance;
  • Forte capacità di visione sistemica, leadership tecnica, problem solving strutturato e gestione della complessità;
  • Ottime capacità relazionali e di collaborazione cross-funzionale con stakeholder tecnici, architetturali e di business;
  • Buona conoscenza della lingua inglese, scritta e parlata, in contesti professionali internazionali.

Sede di lavoro Milano, Torino, Roma, Mangone (CS)

Modalità di lavoro Ibrida

La posizione è inquadrata al 1 Livello, secondo il CCNL Terziario, Distribuzione e Servizi (Commercio) e il range retributivo iniziale previsto è compreso tra Euro 45.000 ed Euro 60.000. L'esatta attribuzione all'interno della fascia retributiva sarà determinata sulla base di criteri oggettivi, trasparenti e neutrali sotto il profilo del genere (nel rispetto della normativa vigente).

Cerved Group garantisce (ai sensi del D.Lgs 198/2006, D.Lgs.215/2003 e D.Lgs.216/2003) pari opportunità di accesso al lavoro a tutt* i/le candidat* e si impegna a favorire il rispetto delle diversità e l’inclusione sul posto di lavoro.

This is a saved copy of a posting published elsewhere. Postings get taken down without notice — check the employer's site before applying. mentors.coach is not the hiring party.

23 more openings in this category and country

MLOps & Platform EngineerTXT GROUP · Italy

Apply on the employer's site