Como coletamos, validamos, agregamos e apresentamos pesquisas eleitorais.
O V1V4+ coleta pesquisas registradas no PesqEle (sistema do TSE de divulgação de pesquisas eleitorais) via Portal de Dados Abertos do TSE, que disponibiliza os dados em formato CSV pela API CKAN.
URL base da API: https://dadosabertos.tse.jus.br/api/3/action/package_show?id=pesquisas-eleitorais-2026
Os CSVs são compactados em ZIP e codificados em ISO-8859-1. O sistema os decodifica para UTF-8 antes do processamento. Cada execução de importação é registrada em data_imports com status, contadores e relatório de erros.
ATENÇÃO: O V1V4+ não inventa dados. Quando os dados do TSE não estão disponíveis, o sistema exibe "Dados insuficientes para estimativa" e registra o erro de importação.
Cada pesquisa recebe dois scores complementares:
Avalia a completude dos dados: amostra (+0,15), margem de erro (+0,15), metodologia (+0,15), datas de coleta (+0,15), registro TSE (+0,20), nível de confiança (+0,10), e completeness_score (+0,10).
VALID (≥ 0,70), VALID_WITH_WARNINGS (0,40–0,70), NEEDS_REVIEW (< 0,40), INSUFFICIENT_DATA, NOT_ELIGIBLE.
Somente pesquisas com status VALID ou VALID_WITH_WARNINGS entram no cálculo do agregado. As excluídas permanecem visíveis no sistema com o motivo da exclusão.
O V1V4+ implementa três modelos de agregação, sempre calculados simultaneamente:
NAIVE_MODELControleMédia aritmética simples. Nunca é o resultado apresentado; serve de baseline de controle estatístico.
V1V4_AGGREGATION_V1BaselineMédia ponderada por √n × recência exponencial × qualidade. Modelo base, sempre ativo para comparação com V2.
V1V4_AGGREGATION_V2PadrãoAgregação completa com pesos estatisticamente fundamentados, análise de sensibilidade, leave-one-out, detecção de outliers, Monte Carlo e backtest.
Promoção do V2 para padrão: O V2 só se torna o modelo padrão apresentado no site depois que backtests comparativos com dados históricos (eleições de 2022 e 2018) demonstrarem MAE e RMSE inferiores ao V1. O resultado do backtest é público e acessível no painel administrativo.
Cada pesquisa recebe um peso final:
Baseado na variância amostral. Winsorizado entre [{precision_weight_min}, precision_weight_max}] para evitar que uma única pesquisa domine o agregado.
Onde σ² é estimado pela margem de erro declarada, variância amostral p(1-p)/n, ou combinação de ambos.
Decaimento exponencial com λ = 0,015 (half-life ≈ 46 dias).
Score objetivo baseado exclusivamente em completude dos dados. Nunca reflete opinião sobre o instituto.
Calculado pela fórmula de Kish (1965) para evitar superstimação da precisão quando pesos são heterogêneos:
O intervalo de estimativa combina erro amostral e heterogeneidade entre as pesquisas:
σ²_amostral: Variância amostral ponderada de cada pesquisa.
σ²_modelo: Penalidade proporcional à heterogeneidade entre pesquisas (dispersão real).
AVISO obrigatório: A faixa estimada não é uma "previsão certa". É o intervalo de incerteza calculado pelo modelo a 95% de confiança. Resultados reais podem estar fora dessa faixa.