top of page

Parte 1 - Validação Matemática em Machine Learning

michel3540
30 de jul.
5 min de leitura

Atualizado: 5 de ago.

O caso Zestimate da Zillow — como um RMSE nacional de 5% esconde um erro 67 vezes maior em Nova York

Você já viu um relatório dizendo 'o modelo acertou 98% das vezes'? É tentador confiar nesse número. Mas o que acontece quando esse '98%' é uma média nacional que esconde um erro 67 vezes maior num bairro específico? Este artigo não é sobre acurácia — é sobre como qualquer métrica agregada (seja 98% ou RMSE 5%) pode mentir. Vamos ver isso com o caso Zillow.

Este é o primeiro artigo de uma série sobre por que validação matemática que  é o que separa quem confia cegamente numa IA de quem sabe se o resultado dela presta.

O raciocínio que vamos desenvolver nesta serie,  decompor um erro agregado e quantificar com rigor onde ele se concentra, se aplica a qualquer modelo preditivo que reporte uma métrica de desempenho agregada única (seja RMSE/R² numa regressão, seja AUC/acurácia numa classificação) sobre uma população que não é homogênea.

Por que a métrica errada é um problema universal

Modelos de crédito, fraude, e diagnóstico de doenças raras. Sempre que a classe positiva é rara (poucos inadimplentes/fraudes num mar de bons pagadores, ou uma doença que afeta 1% da população), duas métricas populares se tornam matematicamente enganosas. Acurácia é dominada pela classe majoritária por construção: um modelo de diagnóstico que sempre prevê "saudável" já acerta 99% quando a doença afeta 1% da população — acurácia altíssima, recall zero, é o clássico "paradoxo da acurácia". AUC-ROC tem um problema mais sutil: sua taxa de falso positivo é calculada sobre a classe negativa, que é enorme, então mesmo um número absoluto grande de erros vira uma fração minúscula da base — um modelo de crédito pode reportar AUC de 0,95 e ainda assim errar sistematicamente a maioria dos casos de fraude reais. A métrica correta para desbalanceamento severo é a curva Precision-Recall, que mede diretamente a proporção de acertos dentro do que o modelo sinalizou como positivo, e costuma "desmascarar" um modelo que parecia ótimo tanto em acurácia quanto em ROC.

Previsão de preços em ativos de baixo valor ou baixa liquidez. Usar MAPE (erro percentual médio) como métrica de precificação parece razoável, mas ela explode matematicamente quando o valor real se aproxima de zero


MAPE = (1/n) Σ |(ŷᵢ - yᵢ) / yᵢ|

 

o erro percentual tem o preço real   yᵢ no denominador, então um ativo de $2 com erro de $1 gera "50% de erro", inflando artificialmente a métrica agregada para toda a categoria de ativos baratos/ilíquidos, mesmo que o erro absoluto seja pequeno. A correção é usar erro absoluto (MAE) ou uma versão simétrica (SMAPE) nesses casos.

Manutenção preditiva ("dias até falhar"). Esse é um problema de dados censurados — parte dos equipamentos ainda não falhou no momento em que você mede o erro do modelo. Rodar regressão comum (RMSE/MAE) tratando "ainda não falhou" como se fosse um dado ausente, ou pior, imputando um valor arbitrário, viesa sistematicamente a métrica para baixo (parece que o modelo erra pouco, porque os casos mais incertos — os que não falharam ainda — foram descartados ou mal tratados). A ferramenta matematicamente correta é análise de sobrevivência (ex: modelo de Cox), que lida com censura explicitamente na verossimilhança, não como dado faltante comum.

Estimativas numéricas de IA a partir de processos multiplicativos (demanda, receita, prazo de entrega). Quando o fenômeno subjacente é multiplicativo (erros proporcionais ao tamanho, não fixos), usar MSE penaliza quadraticamente os poucos casos de valor alto, fazendo a métrica agregada ser dominada por eles — mesmo que o modelo acerte bem a maioria dos casos típicos. A correção matemática é trabalhar em escala logarítmica (RMSLE, ou erro em log) antes de calcular a métrica, o que estabiliza a variância antes de agregar.

 

O caso Zillow: como a mediana e o RMSE nacional escondem o erro local.


 

 

 Vamos começar com um caso concreto. O Zestimate, da Zillow. Vale deixar claro desde já que esse não é um caso especial ou isolado. É só o exemplo mais fácil de tornar tangível, porque a Zillow, com transparência incomum, publica os próprios números de erro do seu modelo.

A Zillow é a maior plataforma de imóveis dos Estados Unidos — algo como um ZAP Imóveis ou OLX gigantesco, onde qualquer pessoa pode ver casas à venda, fotos, histórico de vendas, etc.

Você digita um endereço, mesmo de uma casa que não está à venda, e o site devolve uma estimativa de valor, tipo "esta casa vale aproximadamente $450.000". Esse número não vem de um corretor visitando o imóvel. Vem de um modelo de machine learning, treinado com milhões de transações imobiliárias, características de cada casa (metragem, quartos, banheiros), impostos pagos, e vendas recentes na região.

É o tipo de aplicação que qualquer pessoa hoje poderia pedir para uma IA construir: "estime o valor desse imóvel a partir desses dados". E é aqui que a diferença entre pedir uma estimativa e validar matematicamente essa estimativa aparece com muita clareza.

A distinção "no mercado" vs. "fora do mercado"

A Zillow publica, honestamente, dois números de erro diferentes para o Zestimate, dependendo de uma condição específica do imóvel:

  • Imóvel "no mercado" (on-market) — está ativamente à venda agora. Existe um anúncio publicado, com um corretor humano que já definiu um preço pedido, fotos, descrição.

  • Imóvel "fora do mercado" (off-market) — não está à venda. É uma casa comum, onde mora alguém sem nenhuma intenção de vender — mas a Zillow calcula um Zestimate mesmo assim, só que sem ter um preço pedido recente para se basear.


A diferença importa porque quando a casa está à venda, o modelo tem uma informação valiosíssima  que é o preço que um proprietário ou corretor profissional, com conhecimento local, já estimou. O modelo usa isso como âncora e refina a partir dali. Quando a casa está fora do mercado, não existe essa âncora e o modelo estima só a partir de dados indiretos (vendas antigas na região, características físicas), sem nenhuma "ajuda" humana recente sobre aquele imóvel específico.

Os números publicados, então, fazem todo sentido:

Situação do imóvel

Erro mediano

No mercado (com âncora do corretor)

1,9% a 2,4%

Fora do mercado (sem âncora)

7% a 7,5%

 

Mais de 3 vezes pior nos fora de mercado, onde falta a informação humana de referência.

Já de cara, a matemática entra pela escolha da métrica. A Zillow reporta erro mediano, não erro médio. Essa escolha não é neutra. A mediana ignora valores extremos, então ela descreve bem o caso típico, mas esconde a existência de erros catastróficos que a média capturaria.

Ou seja, mesmo antes de chegarmos à variacão por região, já existe uma decisão estatística embutida no próprio número publicado. Alguém que não sabe a diferença entre média e mediana pode ler "erro de 2,4%" e assumir que é uma média bem comportada, quando na verdade é um número que, por definição, deixa a cauda pesada fora do retrato.


Isso já é o suficiente para desconfiar. Mas desconfiar não é o mesmo que quantificar.

Na Parte 2, vamos além da mediana nacional, e mostramos o problema que ela esconde, o caso de Nova York, onde o modelo acerta dentro de 5% do preço real em apenas 1 em cada 3 vezes, bem abaixo da maioria nacional. Vamos formalizar isso com o nome técnico certo, heterocedasticidade, e responder à pergunta que qualquer gestor faria em seguida. Nova York é pior, mas quanto pior.

A resposta chega a um número que muda completamente a conversa, sessenta e sete vezes mais chance de um erro caro, não duas ou três, como a intuição sugeriria.

 
 
 

Comentários


Matemática para o Século XXI · Michel Janos

​LinkedIn - YouTube

​© 2025 Michel Janos · Todos os direitos reservados

bottom of page