Edit

Academic and scientific knowledge evaluations.

mmlu_5shot vs. estimated ISO FLOPs

9 matching runs · 6ND; missing tokens estimated at 20× parameters
All 10 filtered runs
Run Scale (B) ISO FLOPs Training datammlu_5shot gpqa_5shot mmlu_pro_5shot theorem_qa_5shot
literature/qwen2_72b
(unverified)
~72.000~6.2e2384.2037.9055.6043.10
literature/qwen1.5_110b
(unverified)
~110.000~1.5e2480.4035.9049.4034.90
literature/llama_3_70b
(unverified)
~70.000~5.9e2379.5036.3052.8032.30
literature/mixtral_8x22b
(unverified)
Unknown77.8034.3049.5035.90
literature/qwen1.5_72b
(unverified)
~72.000~6.2e2377.5036.3045.8029.30
literature/qwen2_7b
(unverified)
~7.000~5.9e2170.3031.8040.0031.10
literature/llama_3_8b
(unverified)
~8.000~7.7e2166.6025.8035.4022.10
literature/gemma_7b
(unverified)
~7.000~5.9e2164.6025.7033.7021.50
literature/mistral_7b_v0.2
(unverified)
~7.000~5.9e2164.2024.7030.9019.20
literature/qwen1.5_7b
(unverified)
~7.000~5.9e2161.0026.7029.9014.20
10 models