NVIDIA telah merilis Nemotron 3 Ultra, Mamba-Transformer hibrida terbuka Mixture-of-Experts total 550B (55B aktif) untuk agen yang sudah berjalan lama. Ini memasangkan konteks token 1 juta dengan throughput inferensi hingga ~6x lebih tinggi dibandingkan…
Menghitung pasokan, energi, dan kapasitas pusat data menentukan seberapa murah AI dapat dijalankan. Pergeseran infrastruktur muncul dalam biaya inferensi beberapa minggu kemudian.
Perusahaan dan model yang disebutkan dalam cerita ini — buka halaman mereka dan harga langsung
Ringkasan dikumpulkan untuk informasi saja — ikuti tautan sumber untuk cerita selengkapnya. Entri demo bersifat ilustratif.