← Início/Metodologia
Documentação Técnica

Metodologia V1V4+ Pesquisa

Como coletamos, validamos, agregamos e apresentamos pesquisas eleitorais.

1. Coleta de dados

O V1V4+ coleta pesquisas registradas no PesqEle (sistema do TSE de divulgação de pesquisas eleitorais) via Portal de Dados Abertos do TSE, que disponibiliza os dados em formato CSV pela API CKAN.

URL base da API: https://dadosabertos.tse.jus.br/api/3/action/package_show?id=pesquisas-eleitorais-2026

Os CSVs são compactados em ZIP e codificados em ISO-8859-1. O sistema os decodifica para UTF-8 antes do processamento. Cada execução de importação é registrada em data_imports com status, contadores e relatório de erros.

ATENÇÃO: O V1V4+ não inventa dados. Quando os dados do TSE não estão disponíveis, o sistema exibe "Dados insuficientes para estimativa" e registra o erro de importação.

2. Validação e qualidade

Cada pesquisa recebe dois scores complementares:

data_quality_score

Avalia a completude dos dados: amostra (+0,15), margem de erro (+0,15), metodologia (+0,15), datas de coleta (+0,15), registro TSE (+0,20), nível de confiança (+0,10), e completeness_score (+0,10).

statistical_status

VALID (≥ 0,70), VALID_WITH_WARNINGS (0,40–0,70), NEEDS_REVIEW (< 0,40), INSUFFICIENT_DATA, NOT_ELIGIBLE.

Somente pesquisas com status VALID ou VALID_WITH_WARNINGS entram no cálculo do agregado. As excluídas permanecem visíveis no sistema com o motivo da exclusão.

3. Agregação estatística

O V1V4+ implementa três modelos de agregação, sempre calculados simultaneamente:

NAIVE_MODELControle

Média aritmética simples. Nunca é o resultado apresentado; serve de baseline de controle estatístico.

V1V4_AGGREGATION_V1Baseline

Média ponderada por √n × recência exponencial × qualidade. Modelo base, sempre ativo para comparação com V2.

V1V4_AGGREGATION_V2Padrão

Agregação completa com pesos estatisticamente fundamentados, análise de sensibilidade, leave-one-out, detecção de outliers, Monte Carlo e backtest.

Promoção do V2 para padrão: O V2 só se torna o modelo padrão apresentado no site depois que backtests comparativos com dados históricos (eleições de 2022 e 2018) demonstrarem MAE e RMSE inferiores ao V1. O resultado do backtest é público e acessível no painel administrativo.

4. Sistema de pesos (V2)

Cada pesquisa recebe um peso final:

w_final = w_precisão × w_recência × w_qualidade

Peso por Precisão

Baseado na variância amostral. Winsorizado entre [{precision_weight_min}, precision_weight_max}] para evitar que uma única pesquisa domine o agregado.

w_precisão = clip(1 / σ², min=0.1, max=5.0)

Onde σ² é estimado pela margem de erro declarada, variância amostral p(1-p)/n, ou combinação de ambos.

Peso por Recência

Decaimento exponencial com λ = 0,015 (half-life ≈ 46 dias).

w_recência = exp(-λ × idade_em_dias)

Peso por Qualidade

Score objetivo baseado exclusivamente em completude dos dados. Nunca reflete opinião sobre o instituto.

Tamanho amostral efetivo

Calculado pela fórmula de Kish (1965) para evitar superstimação da precisão quando pesos são heterogêneos:

n_eff = (Σwᵢ)² / Σ(wᵢ²)

5. Incerteza e intervalos

O intervalo de estimativa combina erro amostral e heterogeneidade entre as pesquisas:

σ²_total = σ²_amostral + σ²_modelo
IC_95% = estimativa ± 1,96 × √σ²_total

σ²_amostral: Variância amostral ponderada de cada pesquisa.
σ²_modelo: Penalidade proporcional à heterogeneidade entre pesquisas (dispersão real).

AVISO obrigatório: A faixa estimada não é uma "previsão certa". É o intervalo de incerteza calculado pelo modelo a 95% de confiança. Resultados reais podem estar fora dessa faixa.

9. Princípios éticos e de neutralidade

Nenhum candidato, partido ou instituto recebe tratamento preferencial.
Candidatos são exibidos em ordem alfabética por padrão.
O modelo não é ajustado para produzir resultados esperados por qualquer pessoa.
Pesquisas de ambiente "test" jamais entram em cálculos de produção.
Dados raw (percentuais publicados) são preservados imutavelmente no banco.
Toda exclusão de pesquisa é documentada e pública.
Termos proibidos: "resultado real", "voto real", "resultado garantido", "previsão certa".
Quando dados são insuficientes, o sistema exibe "Dados insuficientes para estimativa".
O código do motor estatístico e os parâmetros são documentados e versionados publicamente.

10. Limitações

!As estimativas refletem apenas as pesquisas disponíveis no TSE/PesqEle e suas limitações metodológicas.
!Pesquisas com dados incompletos (sem amostra ou margem de erro) recebem menor peso mas podem entrar no agregado se elegíveis.
!O modelo não corrige para efeitos de instituto (house effects) por falta de histórico comparável suficiente.
!Pesquisas sem registro TSE obrigatório (registradas antes de 2026 ou em períodos sem obrigatoriedade) podem não estar disponíveis.
!A janela de dados (365 dias) pode ser ajustada, impactando os resultados para cargos com poucas pesquisas.
!Monte Carlo e análise de sensibilidade requerem mínimo de 2 pesquisas elegíveis.