Monitoramento não é avaliação
São funções distintas e frequentemente confundidas. Monitoramento acompanha execução: insumos aplicados, atividades realizadas, produtos entregues. Responde se a política foi implementada como previsto.
Avaliação de impacto responde a outra pergunta: o resultado observado foi causado pela política? Um programa pode ter execução impecável — cem por cento das metas de produto cumpridas — e impacto nulo sobre o resultado que pretendia alterar.
A cadeia lógica que organiza ambos vai de insumos a atividades, produtos, resultados e impacto. Monitoramento cobre os três primeiros elos; avaliação, os dois últimos.
O problema do contrafactual
Impacto é a diferença entre o que ocorreu e o que teria ocorrido na ausência da política. O segundo termo é, por definição, não observável — e é a razão pela qual a comparação "antes e depois" falha.
Se o emprego formal do município cresceu 6% após um programa de qualificação, não se sabe quanto teria crescido sem ele. Se a economia regional estava em expansão, parte ou todo o crescimento seria realizado de todo modo. A estimativa correta exige um grupo de comparação que aproxime o contrafactual.
Este é o ponto que separa avaliação de relatório de resultados. Números de execução e séries pré-pós são informativos, mas não sustentam afirmação causal — e afirmações causais são o que decisões de continuidade, expansão ou encerramento de programa exigem.
Os desenhos disponíveis
| Desenho | Como constrói o contrafactual | Requisito |
|---|---|---|
| Experimento aleatorizado | Sorteio de acesso ao programa | Viável e eticamente admissível na implantação |
| Diferenças em diferenças | Compara a variação do grupo tratado com a do não tratado | Tendências paralelas antes da intervenção |
| Regressão descontínua | Compara quem ficou pouco acima e pouco abaixo de um corte de elegibilidade | Regra de corte nítida e não manipulável |
| Pareamento por escore de propensão | Emparelha tratados e não tratados por características observáveis | Ausência de seleção por fator não observado |
| Variáveis instrumentais | Explora fonte de variação exógena na exposição | Instrumento relevante e válido |
| Controle sintético | Constrói comparação ponderada a partir de várias unidades | Série pré-intervenção longa |
A regressão descontínua é particularmente aplicável a políticas municipais, porque programas sociais frequentemente adotam corte de elegibilidade por renda ou escore — e o corte, se não manipulável, gera comparação quase experimental sem necessidade de sorteio.
Desenhar a avaliação antes de executar o programa
A decisão mais consequente é temporal. Avaliação planejada antes da implantação permite:
- coletar linha de base para tratados e comparação;
- definir a regra de atribuição de forma que viabilize identificação causal;
- registrar a priori os indicadores de resultado, evitando escolha posterior conveniente;
- dimensionar a amostra para detectar o efeito mínimo relevante.
Avaliação encomendada após o encerramento do programa opera com o que existe — e frequentemente não existe linha de base comparável. É a razão pela qual boa parte das avaliações retrospectivas conclui com "não foi possível identificar efeito", resultado que informa sobre o desenho da avaliação, não sobre a política.
Validade interna e externa
Duas perguntas distintas sobre a confiança no resultado:
- Validade interna — a estimativa mede o efeito causal naquele contexto? É onde o desenho atua;
- Validade externa — o resultado se transfere para outro município, escala ou população?
A segunda é a mais negligenciada na transposição de políticas. Programa avaliado com efeito positivo em município de 300 mil habitantes com rede de serviços consolidada não garante o mesmo efeito em município de 20 mil com capacidade administrativa distinta — porque o mecanismo causal pode depender de condições ausentes.
Daí a exigência metodológica de explicitar a teoria de mudança: por qual mecanismo se espera que a intervenção produza o resultado. Sem mecanismo declarado, um resultado nulo não distingue entre política mal concebida e política bem concebida mal implementada — e a decisão de gestão nos dois casos é oposta.
Referências
- ABADIE, A.; DIAMOND, A.; HAINMUELLER, J. Synthetic control methods for comparative case studies. Journal of the American Statistical Association, v. 105, n. 490, p. 493-505, 2010.
- ANGRIST, J.; PISCHKE, J.-S. Mostly harmless econometrics: an empiricist’s companion. Princeton: Princeton University Press, 2009.
- BANERJEE, A.; DUFLO, E. Poor economics: a radical rethinking of the way to fight global poverty. New York: PublicAffairs, 2011.
- CARD, D.; KRUEGER, A. Minimum wages and employment: a case study of the fast-food industry in New Jersey and Pennsylvania. American Economic Review, v. 84, n. 4, p. 772-793, 1994.
- GERTLER, P.; MARTINEZ, S.; PREMAND, P.; RAWLINGS, L.; VERMEERSCH, C. Impact evaluation in practice. 2. ed. Washington: World Bank, 2016.
- SHADISH, W.; COOK, T.; CAMPBELL, D. Experimental and quasi-experimental designs for generalized causal inference. Boston: Houghton Mifflin, 2002.