Ir para o conteúdo principal

Machine-Learning

TabFM contra CatBoost, XGBoost e LightGBM em 10 datasets tabulares

O Google liberou o TabFM em 30 de junho de 2026, um modelo fundacional para dados tabulares que promete classificação e regressão sem treino. A primeira coisa que fiz foi desconfiar. Modelo fundacional em dados tabulares é a promessa que a área persegue desde sempre: substituir o gradient boosting, que domina competição e produção há mais de uma década. Em vez de aceitar os números do anúncio, montei um benchmark próprio em 10 datasets contra CatBoost, XGBoost e LightGBM, com validação estatística em cada etapa.

Canais do YouTube para Cientistas de Dados

YouTube tem muito conteúdo bom de ciência de dados, mas também muito ruído. Aqui trouxe alguns canais que costumam valer a pena a inscrição, desde os clássicos que explicam do zero até os que acompanham as novidades mais recentes do campo. Fundamentos e Matemática Para começar do zero, esses são os canais que mais ajudam a fazer a matemática fazer sentido.

Detecção de Linguagem Tóxica com o LLM Gemma e LangChain

Série: LangChain — Agentes com Python — ver índice Análise de Sentimentos com Llama2 → Detecção de Linguagem Tóxica com Gemma Equipe Multiagente para Bitcoin Agente para Ligações de Telemarketing LLM Local com Qwen sem APIs Caso de Uso de IA Generativa: Detecção de Linguagem Tóxica em Mídias Sociais Neste post, realizaremos a tarefa de detecção de linguagem tóxica em mídias sociais usando o modelo Gemma de IA generativa do Google com o framework LangChain. Vamos explorar como o texto de entrada afeta a saída do modelo e faremos alguma engenharia de prompts para direcioná-lo à tarefa necessária.

Solução Final - ML Olympiad [1º lugar]

Introdução Definição do problema de negócio Soluções Estratégia analítica Decisões sobre a target Processamento dos Dados Dados Externos Feature Engineering Modelos Ensemble Post Processing Considerações Finais Introdução O TFUG - TensorFlow Users Group de São Paulo lançou uma nova competição no Kaggle onde o objetivo era desenvolver modelos para previsão de diagnóstico de síndromes respiratórias, que é um tema relacionado com um dos 17 tópicos de Desenvolvimento Sustentável das Nações Unidas - Boa saúde e bem-estar.

Solução Final - ML Olympiad [2º lugar]

Introdução Definição do problema de negócio Análise Exploratória (em R) Estrutura da base Ano da base de dados Target Machine Learning (em Python) Importar dependencias Carregar dados Modelagem Submissão Considerações Finais Introdução No final de Janeiro desde ano (2022) o TFUG - TensorFlow Users Group de São Paulo lançou uma competição no Kaggle para prever as notas do enem que tem relação com um dos 17 tópicos de Desenvolvimento Sustentável das Nações Unidas - Educação de Qualidade.

Solução Final - Porto Seguro Data Challenge [3º lugar]

Introdução Definição do problema de negócio Análise Exploratória (em R) Machine Learning (em Python) Importar dependências Stage 0: Feature Extraction com KNN Stage 1: Tuning XGBoost com Optuna Stage 2: Calcular Out-Of-Fold SHAP values Stage 3: Modelo Final com AutoGluon Conclusão Referências Introdução Em Agosto e 2021 a Porto Seguro lançou um desafio no Kaggle que consistia em estimar a propensão de aquisição de novos produtos. Tratava-se de um problema de classificação e foi bem desafiador principalmente por 2 motivos:

Otimizando pipelines que envolvem dados desbalanceados

O problema envolvendo dados desbalanceados Objetivo Dependências Preparar dados Breve análise exploratória Modelagem Baselines Preparar Pipeline de dados com workflowsets Benchmark Conclusão Referências O problema envolvendo dados desbalanceados A tarefa de classificação com dados desbalanceados é muito comum na vida real podendo variar desde um leve viés até um enorme desequilíbrio na distribuição da classe de interesse. Problemas mais comuns envolvem:

Ciência de Dados: Uma Visão Geral Para Quem Quer Começar

Ciência de dados é a área que combina programação, matemática, estatística e conhecimento de contexto para extrair soluções escondidas em grandes massas de dados desorganizados. Com a quantidade de dados produzida a cada instante e o poder computacional cada vez mais barato, ela ganhou um espaço enorme no mercado. Para ter ideia da escala, projeta-se que, até 2025, o mundo gere cerca de 175 zettabytes de dados por ano (IDC, Data Age 2025).

Um ano de blog! Retrospectiva de 2018 em Data Science

Até que um dia.. Agora em dezembro encerro um desafio pessoal de fazer pelo menos um post por mês durante o ano de 2018 e estou muito animado com o término deste ciclo! Espero ter contribuído um pouquinho com a comunidade de Estatística e Ciência de Dados que está maior a cada dia e cada vez mais importante.

Bancos de dados públicos

·5 minutos
Encontrar dados confiáveis pode consumir muitas horas de trabalho em qualquer projeto de análise, visualização ou aprendizado de máquina. A melhor forma de ganhar tempo é começar com fontes bem documentadas, com contexto claro e com exemplos práticos de uso. Key Takeaways Comece por fontes brasileiras e internacionais com boa documentação e metadados claros. Prefira datasets com descrição do schema, licenciamento e contexto de coleta. Para projetos reais, vale separar as bases por tema, facilidade de uso e tipo de análise. Onde começar # Quando preciso escolher um dataset para estudar ou enriquecer bases de dados que estou trabalhando, eu costumo iniciar por três tipos de fonte: repositórios governamentais, plataformas especializadas em datasets e bases voltadas para áreas específicas como saúde, economia ou visão computacional.