Un ingegnoso appassionato di intelligenza artificiale ha trasformato un vecchio PC gaming in una potente macchina per l'inferenza di modelli linguistici di grandi dimensioni (LLM) spendendo solo 266 dollari. Il cuore del progetto è una scheda Nvidia Tesla V100 SXM2, un acceleratore enterprise ormai datato e notoriamente rumoroso, affiancato a una RTX 4080. Il risultato è un sistema con 32 GB di VRAM totali, in grado di eseguire un modello da 27 miliardi di parametri a 32 token al secondo, una velocità definita "sufficiente per un uso interattivo" e superiore a molte API cloud.
Una Tesla V100 SXM2 da 16 GB recuperata su eBay per meno di 140 dollari
Oscar Molnar, l'autore del progetto, ha raccontato su un forum di appassionati di aver acquistato una Tesla V100 SXM2 con 16 GB di memoria HBM2 su eBay a un prezzo irrisorio. Queste GPU, progettate per data center e supercomputer, stanno diventando economiche con l'avvento di nuove architetture. Tuttavia, non sono plug-and-play: Molnar ha dovuto acquistare un adattatore SXM2-PCIe per circa 66 dollari per collegare la scheda a un PC standard.
Sponsored Protocol
Il "ventilatore dell'inferno" domato con un mod al PWM della scheda madre
Il vero ostacolo è stato il rumore. Il dissipatore originale della Tesla V100 produceva 82 dB, descritto come "tra un tritarifiuti e un tosaerba". Molnar ha risolto riallacciando i cavi della ventola al connettore PWM della scheda madre. Basta un cavo jumper da 2,54 mm maschio a PH2.0 femmina. Con una velocità del 10%, la GPU rimane sotto i 50°C a pieno carico, silenziosa e fredda.
Sponsored Protocol
32 GB di VRAM totali fatti funzionare con NixOS e driver Nvidia legacy
Per far coesistere la Volta della Tesla e l'Ada della RTX 4080, Molnar ha usato NixOS con un driver Nvidia legacy che supporta entrambe le architetture. Il sistema ha così a disposizione 32 GB di VRAM, sufficienti per caricare modelli che altrimenti richiederebbero costosi server cloud. Un test con un LLM da 27 miliardi di parametri ha prodotto 32 token al secondo, dimostrando che l'hardware "vecchio" può ancora essere competitivo per l'IA locale.
Questa soluzione fai-da-te mostra come sia possibile ottenere prestazioni elevate per l'inferenza di LLM senza spendere una fortuna. Per chi è preoccupato per la sicurezza dell'IA, vale la pena ricordare che strumenti come gli hacker autonomi sviluppati da OpenAI rendono ancora più importante avere il controllo dei propri modelli. Inoltre, progetti come il programma V2G in Massachusetts dimostrano come la tecnologia stia evolvendo rapidamente, ma per l'IA locale un PC con una Tesla V100 rimane una scelta valida.
Sponsored Protocol
Per approfondire, si può consultare la pagina Wikipedia su Nvidia Tesla o l'articolo originale su Tom's Hardware.