Forscher des britischen AI Security Institute verwendeten psychometrische Methoden, um zu zeigen, dass gängige Sicherheitsbenchmarks für Sprachmodelle nicht ein einheitliches Merkmal messen. Das pauschale Blockieren von Anfragen kann die Situation künstlich aufblähen …
Neue Modelle setzen die Leistungs- und Preis-Leistungs-Grenze neu. Die Teams bewerten neu, worauf sie aufbauen können, wenn eine Markteinführung das Mögliche pro Dollar verändert.
Zusammenfassungen werden nur zu Informationszwecken aggregiert – folgen Sie dem Quelllink für die vollständige Geschichte. Demo-Einträge dienen der Veranschaulichung.