AI Infrastructure Engineer

20 ore fa

bardi, emilia romagna, Italia GIELLE INFORMATICA S.R.L. Tempo pieno

Gielle Informatica Srl, società di consulenza informatica da oltre 40 anni, che vanta una lunga esperienza nella ricerca e nella selezione di personale ICT, ricerca per proprio cliente un/una AI Infrastructure Engineer Full remote

La risorsa sarà responsabile dell’ installazione, configurazione e gestione dell’infrastruttura Azure e on-premises per l’esecuzione di modelli Mistral e altri LLM , occupandosi di GPU server, Linux, Docker, Kubernetes, networking, security, Azure AI Foundry, model serving, vector database, monitoring, backup e automazione tramite Infrastructure as Code.

Competenze richieste

  • Infrastructure Administration
  • Azure Infrastructure: subscriptions, resource groups, networking, subnets, NSGs, private endpoints, managed identities, RBAC e Azure Monitor;
  • Azure AI Foundry: configurazione di environments, endpoints, model connections, accessi, logging e monitoring;
  • GPU machines: selezione e configurazione di VM/server, gestione VRAM, NVIDIA drivers, CUDA, cuDNN e utilizzo GPU;
  • Linux: amministrazione avanzata, networking, storage, processi, permissions, systemd, troubleshooting e hardening;
  • Docker: creazione e gestione di container per modelli, API, vector database e monitoring tools;
  • Kubernetes: preferibilmente AKS e Kubernetes on-premises; deployment, Helm, ingress, secrets, autoscaling, persistent volumes e GPU scheduling;
  • Serving LLMs: installazione e gestione di strumenti quali vLLM, Hugging Face TGI, Ollama o framework equivalenti;
  • Mistral on-premises: download e gestione dei modelli, quantisation, inference configuration, updates, rollbacks e resource management;
  • Vector storage e database: Azure AI Search, pgvector, Qdrant, Milvus o tecnologie simili;
  • Infrastructure as Code: Terraform, Bicep o Ansible;
  • CI/CD: Azure DevOps per il deployment di infrastruttura, repository e configurazioni;
  • Monitoring e logging: metriche GPU e CPU, memory, latency, throughput, errors, queues, token usage e service availability;
  • Backup e Disaster Recovery: recovery procedures, redundancy, data management e regular testing.

Security

È richiesta esperienza nella gestione di:

  • Secrets tramite Azure Key Vault o sistemi equivalenti;
  • TLS certificates e key management;
  • Identities, roles e principio del least privilege ;
  • Network segmentation;
  • Private access ai servizi Azure;
  • Hardening dei server Linux;
  • Scanning delle Docker images;
  • Patching e aggiornamento dei componenti;
  • Auditing e access logging;
  • Protezione di documenti e prompt contenenti dati confidenziali.

Attività

Il candidato dovrà essere in grado di:

  • Configurare da zero un GPU server on-premises ;
  • Configurare NVIDIA drivers, CUDA e container runtimes;
  • Eseguire Mistral tramite un inference server ;
  • Esporre il modello tramite API sicure;
  • Installare e configurare un vector database;
  • Configurare ambienti separati di development, testing e production;
  • Monitorare performance e availability;
  • Effettuare troubleshooting e supportare gli utenti;
  • Diagnosticare problematiche relative a GPU memory, latency, networking e storage;
  • Automatizzare il provisioning tramite Terraform, Bicep o Ansible;
  • Definire procedure di updates, rollbacks e disaster recovery.

Certificazioni

Costituiscono titolo preferenziale:

  • AZ-104 – Azure Administrator
  • AI-300 – Machine Learning Operations Engineering Associate

Tipologia di collaborazione: Partita IVA

Tariffa: sarà concordata in base all esperienza e competenze del candidato.

Ai sensi del D.Lgs. 196/03 e dell art. 13 del GDPR (Regolamento UE 2016/679), i candidati sono invitati a prendere visione dell informativa sul trattamento dei dati personali.

La ricerca è rivolta a candidati di entrambi i sessi (L.903/77 e L.125/91), nonché a persone di tutte le età e nazionalità, ai sensi dei D.Lgs. 215/03 e 216/03.

#J-18808-Ljbffr