Data engineer

1 mese fa

Lazio, LAZ, Italia Soft Strategy Tempo pieno 24.000 € - 33.600 € Contratto

Italia, Lazio, Bari, Informatica, Informatica/Tecnologia

Luogo di lavoro:
Italia, Lazio, Bari

Settore:
Informatica

Ruolo:
Informatica/Tecnologia

Filiale:
Soft Strategy

Data ultimo aggiornamento:
30/07/2026

Verifica la tua compatibilità con questo annuncio


Le tue sfide

Cerchiamo un Data Engineer da inserire nel team che sta realizzando TIDE (Trasferimento Infrastrutturale Dati ed Eventi): una piattaforma infrastrutturale di raccolta e propagazione, in tempo reale e "certificabile", degli eventi di variazione dati provenienti dai database operazionali aziendali.

La soluzione si basa su un paradigma di Change Data Capture (CDC) e su un'architettura Lakehouse Medallion (Bronze / Silver / Gold) costruita su tecnologie enterprise: Confluent Kafka, Cloudera Data Platform, Apache Iceberg, Apache Spark, Apache NiFi. È un progetto in forte crescita, con roadmap pluriennale, che alimenta servizi di business come la Centrale Eventi e casi d'uso di analytics avanzato.

Entrerai in un team strutturato, dove i profili senior definiscono architettura e standard: il tuo compito sarà implementare, far evolvere e mantenere robusti i flussi dati, con reale possibilità di crescere sui temi di streaming, governance e data quality.

Cosa farai

  • Sviluppare e mantenere pipeline di ingestion CDC dai database sorgente verso il layer Bronze, tramite connettori Debezium / Confluent, garantendo zero data loss ed extract-once.
  • Realizzare ed evolvere i flussi di elaborazione tra i layer Bronze → Silver → Gold con Apache Spark / Spark Streaming in Python (PySpark) e con Apache NiFi (processori e script Groovy).
  • Gestire le tabelle in formato Apache Iceberg su storage Ozone, incluse evoluzioni di schema (DDL) e ottimizzazioni.
  • Configurare e gestire topic Kafka, offset e code di dead-letter (DLQ): analisi, reprocessing e alerting sui messaggi in errore.
  • Implementare monitoraggio, alerting e tuning delle pipeline (salute dei flussi, latenza, volumi, soglie).
  • Applicare gli standard di progetto: naming convention, tracciabilità, data lineage, accessi e visibilità sui data tier.
  • Contribuire alle attività di testing, versionamento e pipeline CI, oltre alla documentazione tecnica.
  • Supportare le fasi di migrazione dei flussi attraverso gli ambienti (Test → Collaudo → Produzione).


Perché dovremmo sceglierti

Riteniamo fondamentali per la tua candidatura:

  • Laurea (triennale o magistrale) in Informatica, Ingegneria Informatica, ICT o discipline affini, oppure esperienza equivalente maturata sul campo.
  • 4–6 anni di esperienza come Data Engineer o in ruoli equivalenti su pipeline dati.
  • Solida conoscenza di SQL e dei principali database relazionali (almeno uno tra Oracle, PostgreSQL, MySQL, SQL Server).
  • Buona padronanza di Python per lo sviluppo di job dati, con esperienza pratica di Apache Spark / PySpark (ambito streaming e/o batch su dati strutturati).
  • Conoscenza di Apache Kafka e dei concetti di event streaming (topic, partizioni, offset, consumer group).
  • Familiarità con ecosistemi big data / Hadoop / Cloudera e con formati di file colonnari (Parquet).
  • Comprensione dei concetti di pipeline dati, ETL/ELT e architetture a layer (es. Medallion).
  • Dimestichezza con Git e con logiche di versionamento e CI.



Requisiti che costituiscono un plus:

  • Esperienza con CDC e con connettori Debezium / Confluent.
  • Conoscenza di Apache NiFi e capacità di scripting in Groovy (processori custom, filtri).
  • Esperienza con Open Table Format (Apache Iceberg, Delta, Hudi) e concetti di time travel / data versioning.
  • Conoscenza di strumenti di data lineage / data