top of page

LLM comparación de benchmarks

Comparación de modelos de IA de vanguardia en los principales benchmarks de evaluación de LLM:

MMLU

Testing general knowledge

GPQA

Evaluación de conocimientos especializados en un dominio

Arena de chatbots

Clasificaciones basadas en votos humanos

MATEMÁTICAS

Testing mathematical ability

HumanEval

Testing coding proficiency

MMMU benchmark

Probando el razonamiento con imágenes

bottom of page