OpenAI は、AI モデルのプログラミング スキルを測定するために広く使用されているテストである SWE-Bench Pro をレビューしたところ、そのタスクの約 30% が機能していないことが判明しました。同社はベンチマークに対する以前の承認を撤回する。ザ・…
新しいモデルは、機能と価格パフォーマンスの最前線をリセットします。チームは、ローンチによって 1 ドルあたりの可能性が変わるたびに、何を構築するかを再評価します。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。