主要なベンチマークは、AI が何ができるかを測定します。 AI が意図したとおりに実行するかどうか、つまり、AI に実行してほしいことと、AI にどのように実行してほしいかについての暗黙の前提との間の距離を測定するものはありません。新しい指標を提案します…
新しいモデルは、機能と価格パフォーマンスの最前線をリセットします。チームは、ローンチによって 1 ドルあたりの可能性が変わるたびに、何を構築するかを再評価します。
概要は情報提供のみを目的としてまとめられています。全文についてはソース リンクを参照してください。デモのエントリは一例です。