← Volver Gráfico de barras ilustrativo comparando modelos investigacion

Un nuevo benchmark independiente sitúa a tres modelos abiertos al nivel de los cerrados

· Fuente: EvalNet Consortium (ejemplo)
#benchmarks#open-source#razonamiento

El consorcio independiente EvalNet publicó los resultados de su ronda trimestral de evaluación, que incluyó pruebas de razonamiento matemático, comprensión de código y seguimiento de instrucciones largas.

Resultados destacados

  • Tres modelos de pesos abiertos quedaron dentro del margen de error estadístico de los modelos propietarios líderes.
  • Las diferencias más grandes se observaron en tareas de razonamiento de múltiples pasos, donde los modelos cerrados aún mantienen ventaja.
  • El costo por token de inferencia de los modelos abiertos evaluados es, en promedio, un 60% menor.

Comparativa ilustrativa de puntuaciones entre modelos abiertos y cerrados

Los autores del estudio destacan que la metodología completa, incluidos los prompts de evaluación, está disponible públicamente para su réplica.

Este artículo es contenido de ejemplo generado para una demo de Astro Content Collections, no una noticia real.

Proyecto de ejemplo con Astro Content Collections. Las noticias son ficticias, con fines demostrativos.