Edit

Truthful response evaluation.

truthfulqa_0shot vs. estimated ISO FLOPs

9 matching runs · 6ND; missing tokens estimated at 20× parameters
All 10 filtered runs
Run Scale (B) ISO FLOPs Training datatruthfulqa_0shot
literature/qwen1.5_72b
(unverified)
~72.000~6.2e2359.60
literature/qwen2_72b
(unverified)
~72.000~6.2e2354.80
literature/qwen2_7b
(unverified)
~7.000~5.9e2154.20
literature/qwen1.5_7b
(unverified)
~7.000~5.9e2151.10
literature/mixtral_8x22b
(unverified)
Unknown51.00
literature/qwen1.5_110b
(unverified)
~110.000~1.5e2449.60
literature/llama_3_70b
(unverified)
~70.000~5.9e2345.60
literature/gemma_7b
(unverified)
~7.000~5.9e2144.80
literature/llama_3_8b
(unverified)
~8.000~7.7e2144.00
literature/mistral_7b_v0.2
(unverified)
~7.000~5.9e2142.20
10 models