Site Reliability Engineer
Agap2 Italia
Siamo alla ricerca di un Site Reliability Engineer motivato a contribuire alla scalabilità e all'ottimizzazione di una complessa infrastruttura Cloud in produzione su Azure.
Si tratta di un sistema distribuito progettato per raccogliere, gestire e distribuire grosse moli di dati in tempo reale. Include componenti connessi "at the edge" che devono essere in grado di operare in scenari "offline" e garantire "eventual consistency" dei dati. La lingua di lavoro principale è l'inglese, dato che il sistema è utilizzato da clienti internazionali.
Il ruolo richiede un forte focus sull'affidabilità, la scalabilità, la sicurezza e la resilienza dell'infrastruttura, con un utilizzo intensivo di Azure Kubernetes Service (AKS), Azure Database for PostgreSQL, MongoDB Atlas ed Apache Kafka.
Il candidato deve inoltre essere disponibile a partecipare alla turnazione on-call, ovviamente remunerata e concordata per essere distribuita equamente nel mese, per la gestione di emergenze e incidenti fuori orario lavorativo standard.
Non è necessario avere esperienza approfondita su tutti i tool utilizzati: siamo pronti a offrire formazione tramite corsi e "training on the job" per colmare eventuali lacune e supportare la crescita professionale.
Responsabilità principali
- Migliorare la resilienza ed ottimizzare il cluster Kubernetes (AKS su Azure), assicurando performance, scalabilità, sicurezza ed alta affidabilità dei servizi deployati
- Configurare ed ottimizzare i database relazionali (PostgreSQL su Azure) e non relazionali (MongoDB Atlas) per garantire performance, affidabilità e sicurezza dei dati
- Gestire e ottimizzare Apache Kafka (su AKS) per la raccolta e distribuzione di dati in tempo reale
- Automatizzare processi operativi per ridurre il "toil" e migliorare l'efficacia dei team (Platform team e Product team)
- Partecipare alla turnazione on-call per garantire una rapida risposta agli incidenti e alle emergenze
- Sviluppare pipeline di monitoraggio e alerting per identificare e debuggare rapidamente problemi operativi
- Identificare prontamente la "root cause" di problemi bloccanti, sviluppando documentazione tecnica dettagliata ed automazioni per evitare che problemi noti si verifichino nuovamente
- Collaborare con il team di sviluppo per il miglioramento continuo del ciclo di vita dello sviluppo software (SDLC), garantendo pratiche solide e coerenti
- Laurea in Informatica, Ingegneria o esperienza equivalente
- 3+ anni di esperienza con infrastrutture Cloud, preferibilmente Azure
- Esperienza con sistemi distribuiti e principi di alta scalabilità e resilienza per applicazioni cloud-native
- Esperienza consolidata in ambienti Linux, inclusa la gestione e il debugging di problemi di networking (DNS, Load Balancer, firewall e VPN)
- Esperienza con tool di monitoraggio e logging (Prometheus, Grafana, Azure Monitor, etc.)
- Esperienza nella creazione di automazioni (Python, Bash, Terraform) per migliorare i processi operativi, secondo il paradigma Infrastructure-as-Code (IaC)
- Familiarità con i principi di Site Reliability Engineering, inclusi SLO, SLA ed "error budgets"
- Disponibilità a partecipare alla turnazione on-call in reperibilità
- Buona conoscenza della lingua inglese, scritta e parlata, obbligatoria per l'interazione con clienti internazionali
- Esperienza nell'implementazione delle best practices di sicurezza su sistemi distribuiti, dalla configurazione di rete alla gestione dei segreti, fino alla scansione automatica per l'identificazione di vulnerabilità note
- Esperienza con database relazionali (PostgreSQL) e non relazionali (MongoDB)
- Esperienza con Apache Kafka e conoscenza dei concetti base di stream processing distribuito
- Esperienza con CI/CD (Jenkins, Gitlab, etc.)
- Familiarità con architetture di microservizi e metodologie DevOps/GitOps
- Esperienza di progettazione e sviluppo di sistemi distribuiti real-time e fault-tolerant
- Opportunità di lavorare su infrastrutture cloud-native moderne, resilienti e scalabili, in un contesto di stream processing ed edge computing
- Forte attenzione alla cura delle persone, guidata dai nostri valori aziendali di intraprendenza, curiosità, cura e onestà
- Ambiente collaborativo e stimolante, "remote friendly", orientato alla crescita professionale e personale
- ppSiamo alla ricerca di un Site Reliability Engineer motivato a contribuire alla scalabilità e all'ottimizzazione di una complessa infrastruttura Cloud in produzione su Azure. /ppSi tratta di un sistema distribuito progettato per raccogliere, gestire e distribuire grosse...ConsigliatoRemotoTurni
- ...You'll create handover docs and transfer knowledge to support ongoing rollout of complex systems, while feeding insights back to engineering and operations. This is a customer-facing, impact-driven position at a leader in AI compute, offering opportunities to shape how...Consigliato
- ...Overview: /h3pWe are hiring for one of our clients, seeking a DevOps Engineer to work on a Full-time basis. The role involves designing,... ..., and implement improvements to ensure high availability and reliability. /liliCollaborate with development, security, and operations...ConsigliatoTempo pieno
- ...Overview: We are hiring for one of our clients, seeking a DevOps Engineer to work on a Full-time basis. The role involves designing,... ..., and implement improvements to ensure high availability and reliability. Collaborate with development, security, and operations...ConsigliatoTempo pieno
- pAdentis Italia cerca un Performance Test Engineer per gestire l’intero ciclo di testing, dal setup delle infrastrutture Linux/Windows alla definizione dei KPI e all’analisi avanzata delle prestazioni. Responsabile del flusso completo, incluso log, osservabilità e reportistica...Consigliato
30.000 € - 38.000 €
...tutto in una realtà in continua evoluzione, nella quale le relazioni umane sono sempre al primo posto. Ruolo: Performance Test Engineer Luogo: Roma IL TUO RUOLO Siamo alla ricerca di un/una Performance Test Engineer con solide basi sistemistiche, capace...Impiego permanenteContratto con partita IVA30.000 € - 38.000 €
...tutto in una realtà in continua evoluzione, nella quale le relazioni umane sono sempre al primo posto. /p pRuolo: bPerformance Test Engineer /b /p pLuogo: bRoma /b /p h3IL TUO RUOLO /h3 pSiamo alla ricerca di un/una bPerformance Test Engineer /b con solide basi...Impiego permanenteContratto con partita IVA- ...real-world network transformation projects and collaborate with cross-functional teams to drive scalable, reliable platforms. This opportunity appeals to engineers who shape cloud-native solutions and digital workspaces within a forward-thinking company. Responsabilità...Remoto
- ...Overview As a TCMS System Engineer at Teoresi Group, you will drive the definition and design of train control system software and... ...lifecycle, contributing to innovative rail solutions with a focus on reliability and safety. Responsabilità Define TCMS system...
- ...Nokia in Teramo, Abruzzo is seeking an Analog HW Engineer to contribute to X-Haul microwave hardware designs within the MW/CSN unit. You will translate high-level requirements into robust hardware, own legacy designs, implement new features, and push optimizations to...Lavoro ibridoOrario flessibile
- ...Overview In this role you help Deel bridge development and IT operations to enable fast, reliable delivery of the platform. You'll work with cross-functional teams to improve deployment processes, automate tasks, and ensure scalable, secure, high-performing systems...Orario flessibile
- pHire Feed is seeking a DevOps Engineer for a full-time role in Teramo, Abruzzo. You will design, implement, and maintain CI/CD pipelines to streamline software delivery and collaborate with cross-functional teams to optimize infrastructure and deployment workflows. /ppYou...Tempo pieno
- pAgap2 Italia è alla ricerca di un Site Reliability Engineer per potenziare un’infrastruttura cloud in produzione su Azure. Il ruolo copre AKS, PostgreSQL e MongoDB Atlas, Kafka e monitoraggio in tempo reale, con focus su resilienza, sicurezza e scalabilità. /ppSi lavora...
- ...customers as a senior technical resource, partnering with development engineers to manage escalations and track bugs. You will create... ...field issues and document feature requests, helping to shape reliability for cloud security products. You join a collaborative team focused...
- ...Apprendimento continuo /pp Determinazione nel risolvere oggi i problemi di domani /ppbr/ppSiamo alla ricerca di un bSystems Application Engineer, /bsarà responsabile dell'installazione, configurazione, amministrazione, rilascio e troubleshooting di applicazioni enterprise in...Remoto
- ...authentication and authorization rely on across Sysdig. You will contribute to a scalable, highly available platform used by multiple engineering teams and own onboarding experiences for connecting cloud provider accounts. You will collaborate with product, frontend, design,...Remoto
- ...and conditions Requisiti fondamentali ~ Bachelor's degree in STEM or business ~12+ years in Sales, Commercial Operations, Engineering or Field Service ~ Willingness and ability to travel domestically ~ Experience with industrial power delivery and/or power distribution...Remoto
- ...role, you will design, deploy, and run the internal Linux-based platform that powers engineering and business teams, spanning on‐premise and cloud. You'll own deployment, reliability, and automation for core IT services with a security‐first mindset, building a scalable...Lavoro ibridoRemotoLavoro da casaOrario flessibile