Bahkan model AI terbaik gagal dalam kerja pengetahuan nyata, hanya menyelesaikan 3 persen saja dari tugas. Artikel 'Benchark Baru Merekaakan Bagaimana AI Berusaha Buruk dengan Kerja Pengetahuan Nyata' pertama kali muncul di The Decoder.
Model-model baru mengatur ulang batas kemampuan dan harga-kinerja. Tim mengevaluasi kembali apa yang harus dikembangkan setiap kali peluncuran mengubah apa yang mungkin dilakukan per dolar.
Ringkasan dikumpulkan untuk informasi saja — ikuti tautan sumber untuk cerita selengkapnya. Entri demo bersifat ilustratif.