DVBench / Measures

  Add a measure

arc_challenge_25shot

ARC-Challenge, 25-shot score (%).

10 runs 60.60 latest

bbh_3shot

BIG-Bench Hard, 3-shot score (%).

10 runs 62.60 latest

evalplus_0shot

EvalPlus, 0-shot score (%).

10 runs 54.20 latest

gpqa_5shot

GPQA, 5-shot score (%).

10 runs 31.80 latest

gsm8k_5shot

GSM8K, 5-shot score (%).

10 runs 79.90 latest

hellaswag_10shot

HellaSwag, 10-shot score (%).

10 runs 80.70 latest

humaneval_0shot

HumanEval, 0-shot score (%).

10 runs 51.20 latest

math_4shot

MATH, 4-shot score (%).

10 runs 44.20 latest

mbpp_0shot

MBPP, 0-shot score (%).

10 runs 65.90 latest

mean_confidence

Mean maximum class probability over the evaluation set.

2 runs 0.63 latest

mean_logit

Mean checkpoint logit over the evaluation set.

2 runs -11.26 latest

mmlu_5shot

MMLU, 5-shot score (%).

10 runs 70.30 latest

mmlu_pro_5shot

MMLU-Pro, 5-shot score (%).

10 runs 40.00 latest

multilingual_exam

Multilingual exam aggregate score.

10 runs 59.20 latest

multilingual_mathematics

Multilingual MGSM aggregate score.

10 runs 57.50 latest

multilingual_translation

Multilingual Flores-101 translation score.

10 runs 31.50 latest

multilingual_understanding

Multilingual understanding aggregate score.

10 runs 72.00 latest

multipl_e_0shot

MultiPL-E, 0-shot score (%).

10 runs 46.30 latest

perplexity

Evaluation perplexity; lower is better.

0 runs

smoke_accuracy

Smoke test: fraction of parity labels predicted correctly.

6 runs 0.35 latest

tape_validation/20260905_201353/next_token_mse

Tiny next-token regression MSE.

2 runs 0.04 latest

tape_validation/jax_20260906_005256/next_token_mse

Tiny next-token regression MSE.

2 runs 0.03 latest

tape_validation/torch_20260906_004839/next_token_mse

Tiny next-token regression MSE.

0 runs

tape_validation/torch_20260906_004900/next_token_mse

Tiny next-token regression MSE.

0 runs

tape_validation/torch_20260906_004936/next_token_mse

Tiny next-token regression MSE.

0 runs

tape_validation/torch_20260906_005049/next_token_mse

Tiny next-token regression MSE.

2 runs 0.04 latest

tape_validation/torch_20260906_005141/next_token_mse

Tiny next-token regression MSE.

2 runs 0.02 latest

tape_validation/torch_20260906_171053/next_token_mse

Tiny next-token regression MSE.

0 runs

tape_validation/torch_20260906_171228/next_token_mse

Tiny next-token regression MSE.

0 runs

tape_validation/torch_20260906_171316/next_token_mse

Tiny next-token regression MSE.

2 runs 0.02 latest

theorem_qa_5shot

TheoremQA, 5-shot score (%).

10 runs 31.10 latest

truthfulqa_0shot

TruthfulQA, 0-shot score (%).

10 runs 54.20 latest

winogrande_5shot

WinoGrande, 5-shot score (%).

10 runs 77.00 latest