Latest in AI

Impara

Inferenza

Spiegazione in linguaggio semplice di Inferenza, con pagine correlate del catalogo.

Definizione

L'inferenza è l'esecuzione di un modello addestrato per produrre output — risposte chat, embedding, immagini o chiamate a strumenti.

Come funziona

Latenza, costo, batching, hardware e quantizzazione stanno tutti nello stack di inferenza. L'addestramento avviene una volta; l'inferenza è il costo continuo.