Edit

Code generation evaluations.

humaneval_0shot vs. estimated ISO FLOPs

9 matching runs · 6ND; missing tokens estimated at 20× parameters
All 10 filtered runs
Run Scale (B) ISO FLOPs Training datahumaneval_0shot evalplus_0shot mbpp_0shot multipl_e_0shot
literature/mistral_7b_v0.2
(unverified)
~7.000~5.9e2129.3036.4051.1029.40
literature/llama_3_8b
(unverified)
~8.000~7.7e2133.5040.3053.9022.60
literature/qwen1.5_7b
(unverified)
~7.000~5.9e2136.0040.0051.6028.10
literature/gemma_7b
(unverified)
~7.000~5.9e2137.2039.6050.6029.70
literature/mixtral_8x22b
(unverified)
Unknown46.3054.1071.7046.70
literature/qwen1.5_72b
(unverified)
~72.000~6.2e2346.3052.9066.9041.80
literature/llama_3_70b
(unverified)
~70.000~5.9e2348.2054.8070.4046.30
literature/qwen2_7b
(unverified)
~7.000~5.9e2151.2054.2065.9046.30
literature/qwen1.5_110b
(unverified)
~110.000~1.5e2454.3057.7070.9052.70
literature/qwen2_72b
(unverified)
~72.000~6.2e2364.6065.4076.9059.60
10 models