Inteligencia Artificial·1 sept 2026¿Qué miden realmente los benchmarks de LLMs?Un análisis de Allen Institute revela que los benchmarks estándar de modelos de lenguaje no capturan capacidades reales de inferencia. BenchMIRT propone una evaluación más rigurosa basada en tareas industriales concretas.Fuente: Hugging Face Blog
Inteligencia Artificial·18 may 2026Hugging Face lanza ranking abierto para evaluación de agentes de IAIBM Research e Hugging Face presentan un tablero público para comparar el desempeño de agentes de inteligencia artificial autónomos. La iniciativa busca estandarizar métricas de evaluación y acelerar el desarrollo de sistemas de IA más confiables y transparentes.Fuente: Hugging Face Blog