top of page

LLM sammenligning av referanseverdier

Sammenligning av banebrytende KI-modeller på tvers av de viktigste evalueringsbenchmarkene for store språkmodeller:

MMLU

Testing general knowledge

GPQA

Testing domain-specific expertise

Chatbot arena

Rangeringer basert på menneskelige stemmer

MATH

Testing mathematical ability

HumanEval

Testing av programmeringsferdigheter

MMMU-referansepunkt

Tester resonnement med bilder

bottom of page