LangChain, Conviva e CoreWeave: valutare gli AI agent per conversazioni singole non basta, serve il confronto tra coorti
> cd .. / HUB_EDITORIALE > Visualizza in Inglese
News

LangChain, Conviva e CoreWeave: valutare gli AI agent per conversazioni singole non basta, serve il confronto tra coorti

[2026-07-21] Author: Meteora Web Redazione
> condividi
Zenithby Meteora Web Il sistema operativo della tua attività. Social, clienti, prenotazioni e fatture in un'unica piattaforma. Palestre, barber, professionisti. Scopri Zenith Demo gratis · senza carta

Un singolo scambio con un AI agent può apparire impeccabile se valutato isolatamente, eppure segnalare un prodotto difettoso. Questo divario sta spingendo le aziende a cambiare il modo di valutare gli agenti: non più punteggi su singole tracce, ma confronto tra gruppi di utenti rispetto a una baseline. Al VB Transform 2026, Harrison Chase CEO di LangChain, Hui Zhang CTO di Conviva ed Emmanuel Turlay director of engineering di CoreWeave hanno descritto questo cambiamento, insieme a una parallela adozione di modelli giudice più economici e specializzati.

L'agente come giudice non ha sostituito il LLM come giudice

Secondo Chase, l'approccio agent-as-judge non ha soppiantato llm-as-judge, che resta il default. La tensione più grande, ha osservato Zhang, è tra la valutazione automatica (tramite LLM o agente) e la revisione umana. “Hai ciò che è scalabile ma non ancorato”, ha detto Zhang, riferendosi alla difficoltà di rendere oggettiva la valutazione automatica. L'industria deve scegliere tra due veleni: automazione scalabile ma non verificabile, o revisione umana non scalabile.

Sponsored Protocol

I criteri di valutazione come specifica di prodotto

Chase ha paragonato i criteri di valutazione a un documento di requisiti di prodotto: “Le eval sono il nuovo PRD”. Ha messo in guardia dalla “paralisi da eval”, per cui i team non lanciano perché l'insieme di test non è perfetto. I team migliori, ha detto, lanciano e iterano. Turlay ha confermato: cercare una copertura del 100% non impedisce i bug in produzione. Meglio un monitoraggio ampio e continuo per identificare classi di fallimento reali, poi costruire un set di valutazione off-line mirato.

Perché valutare tracce una per una è un errore

Zhang ha criticato il metodo comune di campionare tracce e valutarle singolarmente. Questo approccio perde segnali che emergono solo confrontando coorti di utenti contro una baseline, metodo che chiama analisi contrastiva. Ha fatto l'esempio di un negozio online: una singola interazione per l'acquisto di scarpe da running sembrava ok, ma il rapporto di chiarimento (quante domande l'agente faceva prima di completare) era tre volte superiore alla baseline, e la frequenza di acquisti fuori dalla conversazione era cinque volte superiore. Nessuno di questi dati è visibile da una singola traccia.

Sponsored Protocol

Dimensionare il giudice al compito

Turlay ha suggerito di iniziare con il modello più capace per dimostrare che un compito è risolvibile, poi scendere. Una volta provato, si può campionare una frazione del traffico e spostare compiti semplici come la classificazione binaria su modelli open source più piccoli. LangChain ha fatto un passo avanti, ottimizzando un modello Qwen per rilevare quando l'utente percepisce un errore, ottenendo prestazioni simili a Claude Sonnet con una riduzione dei costi da 10 a 100 volte.

LLM come giudice non elimina l'umano nel loop

Sia Turlay che Zhang hanno concordato che un umano deve rimanere responsabile per i casi limite e per la responsabilità legale. Chase ha aggiunto che il controllo umano è cruciale per costruire fiducia e per l'apprendimento del sistema: “Devono esserci interazioni perché il sistema impari”. Meno costosi modelli giudice e analisi contrastiva stanno ridisegnando il modo in cui le aziende validano i propri AI agent, ma il fattore umano resta insostituibile.

Sponsored Protocol

Il tema della valutazione affidabile è sempre più urgente, come dimostrano le recenti perdite da 3,7 miliardi di dollari causate da truffe deepfake e la scoperta di worm che si nascondono nelle pipeline di sviluppo AI. Per approfondimenti, si consulti la pagina di Wikipedia sull'intelligenza artificiale.

Fonte: https://venturebeat.com/data/a-single-ai-agent-conversation-can-look-perfect-and-still-be-broken-leaders-from-langchain-conviva-and-coreweave-said-at-vb-transform-2026

> condividi
Meteora Web Redazione

> AUTHOR_EXTRACTED

Meteora Web Redazione

La redazione di Meteora Web Agency: ingegneri informatici e professionisti del digitale che pubblicano ogni giorno news e approfondimenti su tecnologia, software, marketing e innovazione.
[ Read Full Dossier ]

> METEORA_WEB // WEB AGENCY

Costruiamo la presenza digitale che la tua azienda merita.

Siti web, social, pubblicità online, e-commerce e hosting performante: ingegnerizzati con metodo da ingegneri informatici a Sciacca, per tutta Italia.

> MW_JOURNAL

> READ_ALL()