Los LLM agentes siguen fallando de la misma manera porque carecen de capacidades específicas y reutilizables. TRACE de Stanford diagnostica esas brechas a partir de las propias trayectorias de un agente, sintetiza un entorno de entrenamiento verificable por capacidad...
Los nuevos modelos restablecen la frontera entre capacidad y precio-rendimiento. Los equipos reevalúan sobre qué construir cada vez que un lanzamiento cambia lo que es posible por dólar.
Los resúmenes se agregan únicamente con fines informativos; siga el enlace fuente para ver la historia completa. Las entradas de demostración son ilustrativas.