Monitoramento não é avaliação

São funções distintas e frequentemente confundidas. Monitoramento acompanha execução: insumos aplicados, atividades realizadas, produtos entregues. Responde se a política foi implementada como previsto.

Avaliação de impacto responde a outra pergunta: o resultado observado foi causado pela política? Um programa pode ter execução impecável — cem por cento das metas de produto cumpridas — e impacto nulo sobre o resultado que pretendia alterar.

A cadeia lógica que organiza ambos vai de insumos a atividades, produtos, resultados e impacto. Monitoramento cobre os três primeiros elos; avaliação, os dois últimos.

O problema do contrafactual

Impacto é a diferença entre o que ocorreu e o que teria ocorrido na ausência da política. O segundo termo é, por definição, não observável — e é a razão pela qual a comparação "antes e depois" falha.

Figura 1 · Identificação causal
Diferenças em diferenças: o contrafactual construído
03570105140t−3t−2t−1t+1t+2t+3
Grupo tratado (observado)Contrafactual estimadoGrupo de comparação
Esquema do desenho. A hipótese de identificação é a de tendências paralelas antes da intervenção. O impacto estimado é a distância entre o grupo tratado observado e a trajetória contrafactual — não a variação do próprio grupo entre antes e depois.

Se o emprego formal do município cresceu 6% após um programa de qualificação, não se sabe quanto teria crescido sem ele. Se a economia regional estava em expansão, parte ou todo o crescimento seria realizado de todo modo. A estimativa correta exige um grupo de comparação que aproxime o contrafactual.

Este é o ponto que separa avaliação de relatório de resultados. Números de execução e séries pré-pós são informativos, mas não sustentam afirmação causal — e afirmações causais são o que decisões de continuidade, expansão ou encerramento de programa exigem.

Os desenhos disponíveis

DesenhoComo constrói o contrafactualRequisito
Experimento aleatorizadoSorteio de acesso ao programaViável e eticamente admissível na implantação
Diferenças em diferençasCompara a variação do grupo tratado com a do não tratadoTendências paralelas antes da intervenção
Regressão descontínuaCompara quem ficou pouco acima e pouco abaixo de um corte de elegibilidadeRegra de corte nítida e não manipulável
Pareamento por escore de propensãoEmparelha tratados e não tratados por características observáveisAusência de seleção por fator não observado
Variáveis instrumentaisExplora fonte de variação exógena na exposiçãoInstrumento relevante e válido
Controle sintéticoConstrói comparação ponderada a partir de várias unidadesSérie pré-intervenção longa

A regressão descontínua é particularmente aplicável a políticas municipais, porque programas sociais frequentemente adotam corte de elegibilidade por renda ou escore — e o corte, se não manipulável, gera comparação quase experimental sem necessidade de sorteio.

Desenhar a avaliação antes de executar o programa

A decisão mais consequente é temporal. Avaliação planejada antes da implantação permite:

  • coletar linha de base para tratados e comparação;
  • definir a regra de atribuição de forma que viabilize identificação causal;
  • registrar a priori os indicadores de resultado, evitando escolha posterior conveniente;
  • dimensionar a amostra para detectar o efeito mínimo relevante.

Avaliação encomendada após o encerramento do programa opera com o que existe — e frequentemente não existe linha de base comparável. É a razão pela qual boa parte das avaliações retrospectivas conclui com "não foi possível identificar efeito", resultado que informa sobre o desenho da avaliação, não sobre a política.

Validade interna e externa

Duas perguntas distintas sobre a confiança no resultado:

  • Validade interna — a estimativa mede o efeito causal naquele contexto? É onde o desenho atua;
  • Validade externa — o resultado se transfere para outro município, escala ou população?

A segunda é a mais negligenciada na transposição de políticas. Programa avaliado com efeito positivo em município de 300 mil habitantes com rede de serviços consolidada não garante o mesmo efeito em município de 20 mil com capacidade administrativa distinta — porque o mecanismo causal pode depender de condições ausentes.

Daí a exigência metodológica de explicitar a teoria de mudança: por qual mecanismo se espera que a intervenção produza o resultado. Sem mecanismo declarado, um resultado nulo não distingue entre política mal concebida e política bem concebida mal implementada — e a decisão de gestão nos dois casos é oposta.

Referências

  1. ABADIE, A.; DIAMOND, A.; HAINMUELLER, J. Synthetic control methods for comparative case studies. Journal of the American Statistical Association, v. 105, n. 490, p. 493-505, 2010.
  2. ANGRIST, J.; PISCHKE, J.-S. Mostly harmless econometrics: an empiricist’s companion. Princeton: Princeton University Press, 2009.
  3. BANERJEE, A.; DUFLO, E. Poor economics: a radical rethinking of the way to fight global poverty. New York: PublicAffairs, 2011.
  4. CARD, D.; KRUEGER, A. Minimum wages and employment: a case study of the fast-food industry in New Jersey and Pennsylvania. American Economic Review, v. 84, n. 4, p. 772-793, 1994.
  5. GERTLER, P.; MARTINEZ, S.; PREMAND, P.; RAWLINGS, L.; VERMEERSCH, C. Impact evaluation in practice. 2. ed. Washington: World Bank, 2016.
  6. SHADISH, W.; COOK, T.; CAMPBELL, D. Experimental and quasi-experimental designs for generalized causal inference. Boston: Houghton Mifflin, 2002.