Apri Cloud Console, carichi un modello salvato da XGBoost e in poche ore hai un endpoint pronto per le predizioni? Sulla carta sì. Nella pratica, se gestisci il deployment su una VM da solo, dopo due settimanni ti ritrovi a fare ssh per riavviare il container, a monitorare la RAM e a chiederti perché il modello risponde con latenza variabile. No, di Meteora Web, lo vediamo spesso nei progetti di clienti che provano a fare machine learning su GCP senza una piattaforma strutturata. Vertex AI risolve esattamente questo: non è un semplice tool, è l'infrastruttura MLOps di Google pensata per aziende che non vogliono un team di DevOps dedicato al ML.
Perché Vertex AI e non una VM con TensorFlow Serving?
Se sei una PMI e devi mettere in produzione un modello, la tentazione di prendere una VM con GPU e installare tutto a mano è forte. È economica all'inizio, ma subentrano i costi nascosti: aggiornamenti di sicurezza, scaling manuale, monitoring delle latenze, rollback in caso di modello degradato. Noi, di Meteora Web, abbiamo gestito sistemi ERP e sappiamo che il costo di un downtime non è solo il server fermo: è il fatturato perso. Vertex AI offre un managed service che include:
- Endpoint automaticamente scalabili (da zero a centinaia di richieste al secondo)
- Model registry per versioning e rollback con un click
- Monitoring integrato di predizioni, latenza e drift dei dati
- Integrazione con Cloud Storage, BigQuery e Dataflow per pipeline end-to-end
Differenza chiave: con una VM, il deployment è un'operazione manuale ogni volta. Con Vertex AI, carichi il modello, definisci un endpoint e il servizio si occupa di provisioning, health check e scaling. Non devi preoccuparti del container runtime — supporta TensorFlow, PyTorch, scikit-learn, XGBoost e modelli custom.
Sponsored Protocol
Come si carica e deploya un modello su Vertex AI?
Il flusso è lineare: esporti il modello in formato salvato (SavedModel per TF, joblib per sklearn, .pt per PyTorch), lo carichi in un bucket Cloud Storage, e poi usi gcloud o la console per creare una risorsa 'Model' e un 'Endpoint'. Ecco un esempio concreto per un modello XGBoost già addestrato.
Passo 1: caricare il modello su Cloud Storage
gsutil cp model.joblib gs://my-ml-models/xgboost/v1/model.joblib
Assicurati che il bucket sia nella stessa regione di Vertex AI (es. europe-west1).
Passo 2: creare la risorsa 'Model' con gcloud
gcloud ai models upload \
--region=europe-west1 \
--display-name=xgboost-v1 \
--container-image-uri=europe-docker.pkg.dev/vertex-ai/prediction/xgboost-cpu.1-7:latest \
--artifact-uri=gs://my-ml-models/xgboost/v1/
L'immagine container è fornita da Google per ogni framework. Non devi costruirla tu.
Passo 3: creare un endpoint e deployare il modello
gcloud ai endpoints create \
--region=europe-west1 \
--display-name=xgboost-endpoint
gcloud ai endpoints deploy-model $ENDPOINT_ID \
--region=europe-west1 \
--model=$MODEL_ID \
--display-name=xgboost-v1-deployment \
--machine-type=n1-standard-2 \
--min-replica-count=1 \
--max-replica-count=5 \
--traffic-split=0=100
Con --traffic-split puoi indirizzare gradualmente il traffico verso nuove versioni (canary deployment).
Sponsored Protocol
Passo 4: fare una predizione di test
from google.cloud import aiplatform
aiplatform.init(project='my-project', location='europe-west1')
endpoint = aiplatform.Endpoint(endpoint_name='projects/.../locations/.../endpoints/...')
response = endpoint.predict(instances=[[5.1, 3.5, 1.4, 0.2]])
print(response.predictions)
Attenzione: gli instances devono rispettare il formato atteso dal tuo modello (es. list di features numeriche).
Quali costi aspettarsi per il deployment su Vertex AI?
Vertex AI non è gratuito, ma il suo modello di pricing è trasparente: paghi per il tempo di compute dei nodi di predizione e per lo storage del modello. Non ci sono canoni fissi a vita — è un principio che noi sosteniamo sempre. Ecco una stima per un caso tipico di PMI italiana:
- Machine type: n1-standard-2 (2 vCPU, 7.5 GB RAM) ~ $0.095/ora per nodo
- Con 1 replica minima (sempre attiva) → $68/mese circa
- Con scaling automatico fino a 5 repliche durante i picchi → costo medio mensile tra $100 e $200
- Storage modello (pochi MB) → trascurabile
Paragonato a una VM equivalente (es. n1-standard-2 con GPU? qui non serve per XGBoost), il costo è simile, ma elimini le ore di manutenzione del DevOps. Se la tua azienda fattura qualche migliaio di euro al mese con un modello predittivo, $200 per un endpoint gestito è un investimento che si ripaga con la riduzione dei downtime.
Sponsored Protocol
Attenzione ai costi nascosti: Vertex AI ha anche servizi aggiuntivi come Vertex AI Workbench (notebook), AutoML (addestramento), e pipeline orchestrate (Kubeflow su GCP). Se usi solo prediction, il costo si limita ai nodi endpoint. Noi consigliamo di attivare gli alert di budget su GCP subito dopo il primo deploy.
Come automatizzare il retraining e il rollback dei modelli su Vertex AI?
Il deployment non è mai un evento singolo. I dati cambiano, il modello degrada. Vertex AI offre due strumenti fondamentali per la MLOps aziendale: Model Registry e Continuous Monitoring.
Model Registry
Ogni modello caricato diventa una versione in un registro centralizzato. Puoi assegnare alias (es. "production", "staging") e cambiare il target dell'endpoint con una sola instruction gcloud.
# Assegna alias 'production' all'ultima versione
gcloud ai models add-iam-policy-binding $MODEL_ID_2 \
--member='serviceAccount:...' --role='roles/aiplatform.modelUser'
# Deploya la nuova versione con traffic split
gcloud ai endpoints deploy-model $ENDPOINT_ID \
--model=$MODEL_ID_2 \
--traffic-split=0=0,1=100
In caso di problemi, basta riportare il traffic split al 100% sulla vecchia versione: rollback in 30 secondi.
Sponsored Protocol
Continuous Monitoring
Vertex AI può monitorare le distribuzioni delle features in ingresso e confrontarle con quelle di training. Se il drift supera una soglia, invia una notifica (PagerDuty, email, Cloud Logging). Noi lo abbiamo integrato in una pipeline automatizzata che scatena un retraining su Vertex AI Training e poi un nuovo deploy.
# Esempio di configurazione monitoring via Python SDK
from google.cloud import aiplatform_v1
monitor = aiplatform_v1.ModelDeploymentMonitoringJob(
display_name="xgboost-monitor",
endpoint=$ENDPOINT_ID,
model_deployment_monitoring_objective_configs=[
{"objective_type": "raw_features", "feature_thresholds": [0.3]}
],
logging_sampling_strategy={"random_sample_config": {"sample_rate": 0.8}},
schedule_state="ACTIVE"
)
client.create_model_deployment_monitoring_job(parent=f"projects/{project}/locations/{location}", model_deployment_monitoring_job=monitor)
Vertex AI è adatto a una PMI italiana senza un team MLOps dedicato?
La risposta è sì, a patto di partire con un caso d'uso semplice e di non voler configurare pipeline Kubeflow fin dal giorno uno. Vertex AI Prediction è pensato per chi ha già un modello addestrato e vuole esporlo come API senza scrivere codice di infrastruttura. Noi, di Meteora Web, lo abbiamo usato per un cliente nel settore assicurativo che doveva calcolare premi in tempo reale: il team (due sviluppatori) ha imparato i comandi base di gcloud in un pomeriggio.
Sponsored Protocol
I limiti: se il tuo modello richiede GPU custom (es. LLM, Vision con PyTorch) il costo sale e la configurazione delle immagini container può diventare più complessa. In quel caso, considera anche Cloud Run con GPU (se disponibile) o GKE con GPU, ma la gestione diventa più articolata. Per modelli tabellari o NLP standard, Vertex AI Prediction è la scelta più bilanciata tra costo e facilità.
Cosa fare adesso
- Esporta il tuo modello addestrato in un formato supportato (SavedModel, joblib, .pt, ONNX).
- Carica il file su un bucket Cloud Storage nella regione più vicina ai tuoi utenti (per utenti italiani, europe-west1 o europe-west4).
- Crea un endpoint di test con una replica minima e verifica le latenze con il client Python.
- Imposta un budget alert su GCP (es. $300/mese) per evitare sorprese.
- Attiva il monitoring del drift dopo una settimana di produzione.
- Se vuoi approfondire l'intero ecosistema GCP per lo sviluppo, leggi la nostra guida pillar su Google Cloud Platform per Sviluppatori.
Per documentazione ufficiale, consulta Vertex AI Prediction docs.