top of page

LLM sammenligning av referansetester

Sammenligning av banebrytende KI-modeller på tvers av de viktigste evalueringsreferansene for LLM-er:

MMLU

Testing general knowledge

GPQA

Testing domain-specific expertise

Chatbot-arena

Rangeringer basert på menneskelige stemmer

MATH

Testing mathematical ability

HumanEval

Testing programmeringsferdigheter

MMMU-referanseverdi

Tester resonnement med bilder

bottom of page