LLM Systems Engineer

3 settimane fa

firenze, Italia Iumob Tempo pieno

Stiamo sviluppando una piattaforma di Intelligenza Artificiale generativa basata su modelli LLM open-weight eseguiti su infrastruttura proprietaria.

Cerchiamo un LLM Systems Engineer che progetti e realizzi l’infrastruttura AI alla base della piattaforma.

Responsabilità
  • Deploy e gestione di modelli LLM open-weight
  • Progettazione dell’architettura di inferenza
  • Sviluppo dell’infrastruttura di serving ad alte prestazioni
  • Implementazione di sistemi di memoria e orchestrazione
  • Ottimizzazione di latenza, throughput e utilizzo delle GPU
  • Sviluppo di pipeline di valutazione e monitoraggio
Requisiti

Esperienza concreta con la maggior parte delle seguenti tecnologie:

  • Python
  • FastAPI
  • Docker
  • Kubernetes
  • PostgreSQL
  • Redis
  • vLLM, SGLang o TensorRT-LLM
  • llama.cpp
  • Hugging Face Transformers
  • CUDA
  • Quantizzazione e ottimizzazione dell’inferenza su GPU

È richiesta esperienza nella messa in produzione di sistemi basati su LLM.

Costituiscono titolo preferenziale
  • Inferenza multi-GPU
  • Architetture ad agenti
  • Sistemi di memoria persistente
  • Contributi a progetti open source
Candidatura

Inviare:

  • CV
  • Profilo GitHub
  • Profilo LinkedIn
  • Eventuali contributi open source rilevanti

Sede: remoto (full remote)