Ferramenta de ops real. /admin/planner-eval já existe e funciona (Tailwind simples, atrás de PLANNER_EVAL_DASHBOARD_ENABLED + allowlist de admin) — corre o gerador headless contra um cenário fixo (repetido repeat vezes para testar consistência), não uma bateria de cenários distintos. Este mock só re-skinha essa página na linguagem visual fechada. Adaptação: a tabela "cenário/resultado/pontuação/notas" pedida mostra aqui cada corrida (results[]) do cenário selecionado, com as notas a resumir os 9 gates determinísticos reais (workflow-completed, plan-hard-pass, grocery-hard-pass, grocery-coverage, prompt-adherence, useful-protein, creativity-fit, full-meal-repeat-cap, blocked-ingredients). NOVO — simplificado/omitido aqui vs. a página real: stdout/stderr do processo em direto, secção llmJudge (hoje sempre desativado), tempos por etapa do workflow e a lista detalhada de falhas de aderência ao prompt. reportDir · reports[] · selectedReport · configPath · defaultScenarioPath