Edit

Multi-step and scientific reasoning evaluations.

bbh_3shot vs. estimated ISO FLOPs

9 matching runs · 6ND; missing tokens estimated at 20× parameters
All 10 filtered runs
Run Scale (B) ISO FLOPs Training databbh_3shot arc_challenge_25shot
literature/qwen2_72b
(unverified)
~72.000~6.2e2382.4068.90
literature/llama_3_70b
(unverified)
~70.000~5.9e2381.0068.80
literature/mixtral_8x22b
(unverified)
Unknown78.9070.70
literature/qwen1.5_110b
(unverified)
~110.000~1.5e2474.8069.60
literature/qwen1.5_72b
(unverified)
~72.000~6.2e2365.5065.90
literature/qwen2_7b
(unverified)
~7.000~5.9e2162.6060.60
literature/llama_3_8b
(unverified)
~8.000~7.7e2157.7059.30
literature/mistral_7b_v0.2
(unverified)
~7.000~5.9e2156.1060.00
literature/gemma_7b
(unverified)
~7.000~5.9e2155.1061.10
literature/qwen1.5_7b
(unverified)
~7.000~5.9e2140.2054.20
10 models