Amazon SageMaker Inference kini menawarkan perutean sadar awalan, sebuah strategi perutean yang mengirimkan permintaan yang berbagi awalan cepat yang sama ke instans yang sama sehingga cache KV tetap hangat. Dalam benchmark pada Llama 3.1 70B, ini mengurangi…
Menghitung pasokan, energi, dan kapasitas pusat data menentukan seberapa murah AI dapat dijalankan. Pergeseran infrastruktur muncul dalam biaya inferensi beberapa minggu kemudian.
Perusahaan dan model yang disebutkan dalam cerita ini — buka halaman mereka dan harga langsung
Ringkasan dikumpulkan untuk informasi saja — ikuti tautan sumber untuk cerita selengkapnya. Entri demo bersifat ilustratif.