AI Infrastructure Engineer

2 giorni fa

Torino, Piemonte, Italia GIELLE INFORMATICA S.R.L. Tempo pieno

Gielle Informatica Srl, società di consulenza informatica da oltre 40 anni, che vanta una lunga esperienza nella ricerca e nella selezione di personale ICT, ricerca per proprio cliente un/una AI Infrastructure Engineer Full remote

La risorsa sarà responsabile dell’ installazione, configurazione e gestione dell’infrastruttura Azure e on-premises per l’esecuzione di modelli Mistral e altri LLM , occupandosi di GPU server, Linux, Docker, Kubernetes, networking, security, Azure AI Foundry, model serving, vector database, monitoring, backup e automazione tramite Infrastructure as Code.

Competenze richieste

  • Infrastructure Administration
  • Azure Infrastructure: subscriptions, resource groups, networking, subnets, NSGs, private endpoints, managed identities, RBAC e Azure Monitor;
  • Azure AI Foundry: configurazione di environments, endpoints, model connections, accessi, logging e monitoring;
  • GPU machines: selezione e configurazione di VM/server, gestione VRAM, NVIDIA drivers, CUDA, cuDNN e utilizzo GPU;
  • Linux: amministrazione avanzata, networking, storage, processi, permissions, systemd, troubleshooting e hardening;
  • Docker: creazione e gestione di container per modelli, API, vector database e monitoring tools;
  • Kubernetes: preferibilmente AKS e Kubernetes on-premises; deployment, Helm, ingress, secrets, autoscaling, persistent volumes e GPU scheduling;
  • Serving LLMs: installazione e gestione di strumenti quali vLLM, Hugging Face TGI, Ollama o framework equivalenti;
  • Mistral on-premises: download e gestione dei modelli, quantisation, inference configuration, updates, rollbacks e resource management;
  • Vector storage e database: Azure AI Search, pgvector, Qdrant, Milvus o tecnologie simili;
  • Infrastructure as Code: Terraform, Bicep o Ansible;
  • CI/CD: Azure DevOps per il deployment di infrastruttura, repository e configurazioni;
  • Monitoring e logging: metriche GPU e CPU, memory, latency, throughput, errors, queues, token usage e service availability;
  • Backup e Disaster Recovery: recovery procedures, redundancy, data management e regular testing.

Security

È richiesta esperienza nella gestione di:

  • Secrets tramite Azure Key Vault o sistemi equivalenti;
  • TLS certificates e key management;
  • Identities, roles e principio del least privilege ;
  • Network segmentation;
  • Private access ai servizi Azure;
  • Hardening dei server Linux;
  • Scanning delle Docker images;
  • Patching e aggiornamento dei componenti;
  • Auditing e access logging;
  • Protezione di documenti e prompt contenenti dati confidenziali.

Attività

Il candidato dovrà essere in grado di:

  • Configurare da zero un GPU server on-premises ;
  • Configurare NVIDIA drivers, CUDA e container runtimes;
  • Eseguire Mistral tramite un inference server ;
  • Esporre il modello tramite API sicure;
  • Installare e configurare un vector database;
  • Configurare ambienti separati di development, testing e production;
  • Monitorare performance e availability;
  • Effettuare troubleshooting e supportare gli utenti;
  • Diagnosticare problematiche relative a GPU memory, latency, networking e storage;
  • Automatizzare il provisioning tramite Terraform, Bicep o Ansible;
  • Definire procedure di updates, rollbacks e disaster recovery.

Certificazioni

Costituiscono titolo preferenziale:

  • AZ-104 – Azure Administrator
  • AI-300 – Machine Learning Operations Engineering Associate

Tipologia di collaborazione: Partita IVA

Tariffa: sarà concordata in base all esperienza e competenze del candidato.

Ai sensi del D.Lgs. 196/03 e dell art. 13 del GDPR (Regolamento UE 2016/679), i candidati sono invitati a prendere visione dell informativa sul trattamento dei dati personali.

La ricerca è rivolta a candidati di entrambi i sessi (L.903/77 e L.125/91), nonché a persone di tutte le età e nazionalità, ai sensi dei D.Lgs. 215/03 e 216/03.