Edit

Commonsense completion and disambiguation evaluations.

hellaswag_10shot vs. estimated ISO FLOPs

9 matching runs · 6ND; missing tokens estimated at 20× parameters
All 10 filtered runs
Run Scale (B) ISO FLOPs Training datahellaswag_10shot winogrande_5shot
literature/mixtral_8x22b
(unverified)
Unknown88.7085.00
literature/llama_3_70b
(unverified)
~70.000~5.9e2388.0085.30
literature/qwen2_72b
(unverified)
~72.000~6.2e2387.6085.10
literature/qwen1.5_110b
(unverified)
~110.000~1.5e2487.5083.50
literature/qwen1.5_72b
(unverified)
~72.000~6.2e2386.0083.00
literature/mistral_7b_v0.2
(unverified)
~7.000~5.9e2183.2078.40
literature/gemma_7b
(unverified)
~7.000~5.9e2182.2079.00
literature/llama_3_8b
(unverified)
~8.000~7.7e2182.1077.40
literature/qwen2_7b
(unverified)
~7.000~5.9e2180.7077.00
literature/qwen1.5_7b
(unverified)
~7.000~5.9e2178.5071.30
10 models