top of page


LLMs Não Calculam, Elas Preveem: Por Que o Humano Continua no Loop
Os Modelos de Linguagem Arquitetados como Transformers (LLMs) não possuem uma "calculadora" interna por padrão. Eles são, na sua essência, motores estatísticos de previsão de próximo token, seja ele uma palavra, um número ou um símbolo. Entender essa diferença muda a forma como se deve confiar (ou desconfiar) de um resultado numérico saído de um chat, e como vamos ver no final deste artigo, ela também explica por que o avanço mais espetacular da IA em matemática até hoje aind
michel3540


10 - Grafos e Machine Learning: Attention é um grafo: a matemática que une Transformers e redes
No artigo anterior, o GAT (Graph Attention Network) apareceu como a arquitetura que não trata todos os vizinhos igualmente, aprendendo um peso diferente para cada conexão. Deixei uma promessa em aberto ali: esse mecanismo de atenção é, estruturalmente, o mesmo usado em Transformers, a arquitetura por trás dos modelos de linguagem mais usados hoje. Esse é o fechamento desta série. Não é uma analogia solta, é uma equivalência matemática direta, e vamos construí-la do zero. O qu
michel3540


9 - Grafos e Machine Learning: Message passing - a matemática por trás das Graph Neural Networks
Agrupamento espectral e Girvan-Newman, os dois métodos que vimos no artigo anterior, resolvem "como agrupar nós" de forma fixa e analítica. A fórmula não muda, não importa a rede, você calcula autovetores do Laplaciano, ou remove links por intermediação, sempre da mesma maneira, sem nenhum ajuste guiado por dado. Isso levanta a pergunta natural que fecha essa parte da série: e se, em vez de uma fórmula fixa, a forma de combinar informação dos vizinhos pudesse ser aprendida, a
michel3540


8 - Grafos e Machine Learning: Comunidades em redes - a matemática de dividir sem perder informação
Recapitulando: onde o Laplaciano já nos levou No artigo anterior desta série, vimos que o Laplaciano, aplicado a um vetor de estado f, revela dois sinais diferentes, e igualmente úteis, sobre uma rede. Numa câmara de eco, se todos os nós tivessem a mesma opinião, o cálculo de Lf daria zero para todo mundo. Ninguém destoa, a rede está em consenso completo, e é exatamente esse zero generalizado que serve de assinatura matemática de uma bolha, todo mundo repete o mesmo discurs
michel3540


7 - Grafos e Machine Learning: O Laplaciano do grafo: a peça que conecta redes dinâmicas
O que é o Laplaciano? Imagine uma rede de pessoas, cada uma com uma opinião (um número, digamos de 0 a 10). O Laplaciano responde, para cada pessoa, uma pergunta simples: "você pensa muito diferente dos seus amigos, ou parecido com eles?" Se você pensa igual a todo mundo ao seu redor, o Laplaciano te dá zero, você está "em paz" com a vizinhança. Se você pensa bem diferente dos seus amigos (mais radical, ou mais moderado), o Laplaciano (Lf) te dá um número maior, positivo ou n
michel3540


6 - Grafos e Machine Learning: Passeios aleatórios e embeddings
Continue essa jornada matemática No próximo artigo desta série, "O Laplaciano do grafo: a peça que conecta redes e dinâmica", vamos conhecer outra matriz derivada da matriz de adjacência, o Laplaciano, e ver como seus autovalores revelam propriedades globais da rede, como facilmente a informação se espalha por ela, e como dividi-la em comunidades, uma ponte direta com o Volume V desta coleção, sobre Sistemas Dinâmicos. No Volume III, Teoria das Redes, desenvolvo passeios alea
michel3540


5 - Grafos e Machine Learning: PageRank Personalizado em um Sistema de Recomendação de Livros
Imagine uma pequena livraria online com 4 clientes e 5 livros. Cada link (não direcionado, por simplicidade) significa "cliente comprou o livro". Cliente Livros comprados Ana (U1) Livro A, Livro B Bruno (U2) Livro B, Livro C Carla (U3) Livro C, Livro D Diego (U4) Livro A, Livro D, Livro E Visualize essa rede como um grafo bipartido: de um lado as pessoas, do outro os livros. A intuição central é que um livro é uma boa recomendação para a Ana se ele estiver próximo dela na est
michel3540


4 - Grafos e Machine Learning: Como funciona o PageRank
O PageRank (PR) é, essencialmente, centralidade de autovetor com um ajuste inteligente para lidar com direção (um link de A para B não é o mesmo que de B para A) e com nós sem saída (páginas sem nenhum link, que "vazariam" toda a pontuação da rede se não fossem tratadas à parte). A fórmula: N é o número total de nós da rede. A fórmula tem duas partes: representa o "piso" que todo nó recebe automaticamente, não importa quantos links tenha. Representa a chance de o "surfista al
michel3540


3 - Grafos e Machine Learning: Centralidades e Autovetores
Existe uma pergunta que parece ingênua, mas esconde toda a matemática por trás do Google: quem são minhas conexões? Não "quantas conexões eu tenho", isso é fácil de responder, e é exatamente o que a centralidade de grau mede. A pergunta mais rica, e mais difícil, está escondida numa armadilha lógica: para saber o quão importante você é, preciso saber o quão importantes são suas conexões. Mas para saber o quão importantes são suas conexões, preciso saber o quão importantes são
michel3540


2 - Grafos e Machine Learning: a Álgebra Linear escondida em toda rede
O cenário Imagine um modelo de Gradient Boosting treinado para prever preço de imóveis, usando três variáveis: "Area_construida", "Numero_quartos" e um "ID_do_corretor" (um identificador categórico com muitas categorias diferentes, um por corretor). Três formas diferentes de medir importância, no mesmo modelo Variável Importância por impureza (Gini) Importância por permutação SHAP (média absoluta) Area_construida 0,35 0,52 0,48 Numero_quartos 0,15 0,18 0,22 ID_do_corretor 0,5
michel3540


1 - Grafos e Machine Learning: Quando a estrutura dos dados é a informação
Toda vez que alguém desenha uma rede social, uma rede de transporte ou uma molécula como um conjunto de bolinhas conectadas por linhas, está fazendo mais do que uma ilustração. Está descrevendo um objeto matemático preciso, chamado grafo, e esse objeto pode ser representado inteiramente por uma matriz. Essa é a ideia central deste artigo: um grafo não é só um desenho, é uma matriz, e tudo que você já sabe sobre multiplicação de matrizes e autovalores se aplica diretamente a e
michel3540


Cinco Algoritmos, um Único Dataset: Por que o "Melhor" Modelo Depende do que Você Não Está Medindo
Em ciência de dados aplicada, a pergunta "qual é o melhor algoritmo?" costuma ser respondida com uma tabela de RMSE e uma escolha — quase sempre o modelo com a menor taxa de erro no conjunto de teste. Mas essa resposta, por si só, esconde uma camada mais profunda de perguntas. O que acontece quando comparamos cinco algoritmos — Regressão Linear, Árvore de Decisão, Random Forest, Gradient Boosting e XGBoost — sobre o mesmo dataset, com as mesmas variáveis, a mesma divisão de t
michel3540


Inteligência Artificial prevê. Programação Linear decide (parte 2)
A Análise de Sensibilidade responde a uma pergunta que todo gestor deveria fazer. Você é um incorporador imobiliário. Seu modelo de Machine Learning, treinado com o histórico de vendas da empresa, estima que uma casa poderá ser vendida por R$ 2,475 milhões. Excelente. Agora vem a segunda etapa. Você precisa decidir quanto investir na reforma antes de colocar o imóvel à venda. O orçamento disponível é de R$ 275 mil. Existem duas possibilidades principais: reforma da cozinha; p
michel3540


Inteligência Artificial prevê. Programação Linear decide.(Parte 1)
Nos últimos anos, a Inteligência Artificial passou a fazer parte do cotidiano das empresas. Modelos de Machine Learning estimam vendas, previsão de demanda, preço de imóveis, risco de crédito, inadimplência, consumo de energia e inúmeras outras variáveis. Mas existe uma pergunta que a IA, sozinha, não responde. Qual é a melhor decisão a tomar? São problemas completamente diferentes. Imagine que um modelo de Machine Learning preveja que a demanda para o próximo mês será de 12.
michel3540


"FAMP", Framework de Auditoria Matemática de Modelos Preditivos
FAMP (Framework de Auditoria Matemática de Modelos Preditivos) é a metodologia que desenvolvi para avaliar a confiabilidade matemática e estatística de modelos preditivos, sem necessidade de analisar uma única linha de código. O foco da auditoria não é verificar como o modelo foi programado, mas se os resultados que ele produz podem ser considerados confiáveis para apoiar decisões de negócio. O framework pode ser aplicado a modelos utilizados em diferentes áreas, como precifi
michel3540


A Matemática das Árvores de Decisão: Como a Entropia de Shannon escolhe o melhor atributo?
Imagine que você precise identificar se um paciente está doente. Você pode fazer dezenas de perguntas: Mas qual pergunta deve ser feita primeiro? Essa é a questão que uma árvore de decisão precisa responder. Ao contrário do que muitos imaginam, ela não escolhe uma variável porque ela apresenta maior correlação com o resultado, nem porque possui maior coeficiente de regressão. Ela escolhe a variável que mais reduz a incerteza. E a matemática dessa incerteza foi desenvolvida po
michel3540


Quanto de IA uso nos meus artigos, e o que isso realmente significa
Antes de entrar no tema deste artigo, um contexto rápido. Os artigos que escrevo, no site e aqui no LinkedIn, fazem parte de uma coleção chamada Matemática para o Século XXI, que percorre a matemática desde suas raízes históricas até aprendizado de máquina e inteligência artificial. É nesse contexto, de alguém que escreve sobre matemática aplicada e IA, que a pergunta deste artigo faz sentido. A pergunta errada Toda vez que alguém descobre que uso IA para escrever, cedo ou ta
michel3540


Parte 3 Validação Matemática em Machine Learning: O Diagnóstico e a Correção
A parte 1 nos deixou com uma suspeita forte: a variância do erro do modelo Zestimate não é constante; ela é maior em Nova York do que na média nacional. Quantificamos essa diferença: o desvio-padrão do erro em Nova York é 2,3 vezes maior, o que se traduz em uma chance 67 vezes maior de um erro de precificação superior a 15%. Mas, como eu disse no final do último artigo, suspeitar não é o mesmo que provar. Agora, vamos responder às duas perguntas que ficaram no ar: Essa difere
michel3540


Parte 2 - Validação Matemática em Machine Learning
Mesmo dentro da categoria "no mercado", com um erro nacional que parece bom, 2,4%, a própria Zillow reconhece que em cidades de alta densidade como Nova York, o modelo acerta dentro de 5% do preço real em apenas 1 em cada 3 casos. Bem abaixo da nacional. Isso não é um detalhe menor. É a demonstração de um fenômeno estatístico com nome técnico preciso. Heterocedasticidade. Quando a variância do erro de um modelo não é constante, mas varia sistematicamente de acordo com alguma
michel3540


Parte 1 - Validação Matemática em Machine Learning
O caso Zestimate da Zillow — como um RMSE nacional de 5% esconde um erro 67 vezes maior em Nova York Você já viu um relatório dizendo 'o modelo acertou 98% das vezes'? É tentador confiar nesse número. Mas o que acontece quando esse '98%' é uma média nacional que esconde um erro 67 vezes maior num bairro específico? Este artigo não é sobre acurácia — é sobre como qualquer métrica agregada (seja 98% ou RMSE 5%) pode mentir. Vamos ver isso com o caso Zillow. Este é o primeiro ar
michel3540
bottom of page
