Nvidia is moving its Groq 3 LPX inference chip into full production and reports 3,400 tokens per second on Gemma 4 31B, four times faster than Cerebras. But the numbers don't tell the whole story. Nvidia needs at least…
تحدد إمدادات الحوسبة والطاقة وقدرة مراكز البيانات مدى تكلفة تشغيل الذكاء الاصطناعي. تظهر تحولات البنية التحتية في تكاليف الاستدلال بعد أسابيع.
الشركات والنماذج المذكورة في هذه القصة – افتح صفحاتها وأسعارها الحية
يتم تجميع الملخصات للحصول على معلومات فقط - اتبع رابط المصدر للحصول على القصة الكاملة. الإدخالات التجريبية توضيحية.