Amazon SageMaker Inference ora offre routing con riconoscimento del prefisso, una strategia di routing che invia richieste che condividono lo stesso prefisso di prompt alla stessa istanza in modo che la cache KV rimanga attiva. Nei benchmark su Llama 3.1 70B, riduce...
L’offerta di elaborazione, l’energia e la capacità dei data center determinano quanto a buon mercato può funzionare l’intelligenza artificiale. I cambiamenti infrastrutturali si manifestano nei costi di inferenza settimane dopo.
Aziende e modelli menzionati in questa storia: apri le loro pagine e scopri i prezzi
I riepiloghi sono aggregati solo a scopo informativo: segui il collegamento alla fonte per la storia completa. Le voci demo sono illustrative.