Ir para o conteúdo principal

Python

TabFM contra CatBoost, XGBoost e LightGBM em 10 datasets tabulares

O Google liberou o TabFM em 30 de junho de 2026, um modelo fundacional para dados tabulares que promete classificação e regressão sem treino. A primeira coisa que fiz foi desconfiar. Modelo fundacional em dados tabulares é a promessa que a área persegue desde sempre: substituir o gradient boosting, que domina competição e produção há mais de uma década. Em vez de aceitar os números do anúncio, montei um benchmark próprio em 10 datasets contra CatBoost, XGBoost e LightGBM, com validação estatística em cada etapa.

LLM local com Qwen e LangChain: agente sem APIs externas

Série: LangChain — Agentes com Python — ver índice Análise de Sentimentos com Llama2 Detecção de Linguagem Tóxica com Gemma Equipe Multiagente para Bitcoin Agente para Ligações de Telemarketing → LLM Local com Qwen sem APIs Por que rodar LLMs localmente? Nos últimos anos, o mundo dos modelos de linguagem de grande porte (LLMs) deixou de ser um território exclusivo das gigantes americanas. Uma leva de modelos open-weight de origem chinesa como o Qwen (Alibaba), o DeepSeek e o Yi chegaram com qualidade surpreendente e, mais importante, com pesos disponíveis publicamente. Li sobre alguns deles em um post que apareceu no meu LinkedIn e fiquei curioso para testar: será que dá para rodar um desses modelos localmente no meu Mac e ainda plugar ele num agente LangChain funcional?

Análise de ligações de telemarketing com Whisper e LangChain

Série: LangChain — Agentes com Python — ver índice Análise de Sentimentos com Llama2 Detecção de Linguagem Tóxica com Gemma Equipe Multiagente para Bitcoin → Agente para Ligações de Telemarketing LLM Local com Qwen sem APIs Por que analisar ligações de telemarketing com IA? Quem nunca recebeu aquela ligação de telemarketing no momento mais inoportuno? Seja oferecendo um cartão de crédito, cobrando uma dívida ou tentando vender internet, essas ligações fazem parte do nosso cotidiano. Mas você já parou para pensar na quantidade de informações valiosas que existem nessas conversas?

Série LangChain — Agentes com Python

Posts desta série, do mais básico ao mais avançado: Análise de Sentimentos com Llama2 de Código Aberto — fundamentos: LLM open source + análise de texto Detecção de Linguagem Tóxica com Gemma e LangChain — classificação com prompt engineering Equipe Multiagente de IA para Análise do Bitcoin — LangGraph: múltiplos agentes orquestrados Agente para Análise de Ligações de Telemarketing — produção: Whisper + Pyannote + LangChain Agente com LLM Local sem APIs Externas — local: Qwen + llama.cpp + GGUF

Análise de Sentimentos com um "ChatGPT" de Código Aberto

TL;DR O modelo Llama2-7b-chat-hf foi executado localmente via Hugging Face Transformers para classificar textos como positivos, negativos ou neutros, sem custo de API. A abordagem foi avaliada contra o VADER (léxico clássico de análise de sentimentos) em um conjunto de avaliações de filmes em inglês, usando acurácia como métrica. O Llama2 superou o VADER na captura de ironia e contexto, mas com latência significativamente maior — evidenciando o trade-off entre profundidade semântica e velocidade de inferência. Série: LangChain — Agentes com Python — ver índice

Gerando arte com Inteligência Artificial

Introdução DALL·E 2 Instruções de Uso Parâmetros Exemplos DALL·E Mini e Stable Diffusion Exemplos Opções Alternativas VQGAN+CLIP Mais Parâmetros Mais Exemplos Discussão Filosófica Conclusão Referências Introdução Você já deve ter ouvido falar sobre uma inteligência artificial que gera artes super-realistas a partir de textos e imagens. Hoje em dia já existem algumas opções como DALL·E 2 (da OpenAI/Google) e a Make-A-Scene (da Meta), e essas ferramentas são capazes de gerar versões e estilos diferentes de uma dada imagem ou ainda criar uma imagem com apenas uma breve descrição do resultado desejado. As imagens podem ser tão aleatórias quanto um “gato de óculos e uma coroa” (em homenagem ao dia dos gatos):

Solução Final - Porto Seguro Data Challenge [3º lugar]

Introdução Definição do problema de negócio Análise Exploratória (em R) Machine Learning (em Python) Importar dependências Stage 0: Feature Extraction com KNN Stage 1: Tuning XGBoost com Optuna Stage 2: Calcular Out-Of-Fold SHAP values Stage 3: Modelo Final com AutoGluon Conclusão Referências Introdução Em Agosto e 2021 a Porto Seguro lançou um desafio no Kaggle que consistia em estimar a propensão de aquisição de novos produtos. Tratava-se de um problema de classificação e foi bem desafiador principalmente por 2 motivos: