top of page

Parte 3 Validação Matemática em Machine Learning: O Diagnóstico e a Correção

michel3540
30 de jul.
2 min de leitura

Atualizado: 5 de ago.

A parte 1 nos deixou com uma suspeita forte: a variância do erro do modelo Zestimate não é constante; ela é maior em Nova York do que na média nacional. Quantificamos essa diferença: o desvio-padrão do erro em Nova York é 2,3 vezes maior, o que se traduz em uma chance 67 vezes maior de um erro de precificação superior a 15%.

Mas, como eu disse no final do último artigo, suspeitar não é o mesmo que provar.

Agora, vamos responder às duas perguntas que ficaram no ar:

  1. Essa diferença é estatisticamente significativa? Ou seja, será que ela não poderia ter surgido por puro acaso na amostra de dados que a Zillow usou? Para isso, vamos usar testes de hipótese formais.

  2. Como ajustar o modelo para que ele não seja tão influenciado por essa variabilidade? Se a variância do erro é maior em Nova York, por que não dar um "peso" menor para essas observações no momento de treinar o modelo, de forma que ele não tente se ajustar desesperadamente a uma região intrinsecamente mais ruidosa? A solução é o Mínimos Quadrados Ponderados (WLS).


O que concluir

Uma métrica agregada única, RMSE, R², acurácia, nunca garante que o modelo funciona igualmente bem para todos os subgrupos dos dados. Um número bom no relatório nacional pode esconder um problema grave em algum grupo específico, principalmente aqueles com menos dados históricos, mais ruído, ou características atípicas.

Suspeitar disso, olhando dois números separados, é só o primeiro passo. Não é prova, é hipótese.

O que fazer, na prática, passo a passo

Primeiro, sempre que treinar um modelo de regressão, verificar heterocedasticidade formalmente, com o teste de Breusch-Pagan, em vez de confiar só no RMSE agregado. Isso deveria ser rotina, não exceção, especialmente quando os dados vêm de fontes ou regiões diferentes.

Segundo, se o teste confirmar heterocedasticidade, identificar a causa, olhando os coeficientes da própria regressão auxiliar, não só o resultado geral do teste. Saber que existe o problema não é o mesmo que saber onde ele mora.

Terceiro, corrigir o modelo com Mínimos Quadrados Ponderados, usando a variância estimada pela regressão auxiliar como base para os pesos. Isso não é opcional quando a heterocedasticidade é confirmada, é a forma correta de ajustar o modelo à realidade dos dados.

Quarto, reportar intervalos de confiança separados por grupo, não um único intervalo nacional. Um cliente, um gestor, ou qualquer pessoa usando a previsão do modelo, precisa saber se está lidando com uma estimativa confiável ou uma estimativa arriscada, dependendo de onde aquele caso específico se encaixa.

Quinto, se a diferença entre os grupos for grande demais, e não só uma questão de variância, considerar treinar um modelo separado para o grupo problemático, em vez de forçar um único modelo a servir bem para todo mundo. Ponderar ajuda quando o mecanismo é o mesmo, só mais incerto num grupo. Separar ajuda quando o próprio mecanismo é diferente.

A mudança de postura, resumida em uma frase

Parar de perguntar só "meu modelo está bom", e passar a perguntar "meu modelo é igualmente bom para todo mundo que vai usar essa previsão". A primeira pergunta se responde com um número só. A segunda exige olhar para dentro dos dados, não só para o resultado.

 
 
 

Comentários


Matemática para o Século XXI · Michel Janos

​LinkedIn - YouTube

​© 2025 Michel Janos · Todos os direitos reservados

bottom of page