O Google liberou o TabFM em 30 de junho de 2026, um modelo fundacional para dados tabulares que promete classificação e regressão sem treino. A primeira coisa que fiz foi desconfiar. Modelo fundacional em dados tabulares é a promessa que a área persegue desde sempre: substituir o gradient boosting, que domina competição e produção há mais de uma década. Em vez de aceitar os números do anúncio, montei um benchmark próprio em 10 datasets contra CatBoost, XGBoost e LightGBM, com validação estatística em cada etapa.
Comece por aqui 3 cursos Se você está começando do zero e quer uma trilha só, esses cursos podem ajudar. Os três cobrem uma boa introdução: visão geral, sintaxe, estatística aplicada e um primeiro modelo rodando.
YouTube tem muito conteúdo bom de ciência de dados, mas também muito ruído. Aqui trouxe alguns canais que costumam valer a pena a inscrição, desde os clássicos que explicam do zero até os que acompanham as novidades mais recentes do campo.
Fundamentos e Matemática Para começar do zero, esses são os canais que mais ajudam a fazer a matemática fazer sentido.
Série: LangChain — Agentes com Python — ver índice
Análise de Sentimentos com Llama2 → Detecção de Linguagem Tóxica com Gemma Equipe Multiagente para Bitcoin Agente para Ligações de Telemarketing LLM Local com Qwen sem APIs Caso de Uso de IA Generativa: Detecção de Linguagem Tóxica em Mídias Sociais Neste post, realizaremos a tarefa de detecção de linguagem tóxica em mídias sociais usando o modelo Gemma de IA generativa do Google com o framework LangChain. Vamos explorar como o texto de entrada afeta a saída do modelo e faremos alguma engenharia de prompts para direcioná-lo à tarefa necessária.
Introdução Definição do problema de negócio Soluções Estratégia analítica Decisões sobre a target Processamento dos Dados Dados Externos Feature Engineering Modelos Ensemble Post Processing Considerações Finais Introdução O TFUG - TensorFlow Users Group de São Paulo lançou uma nova competição no Kaggle onde o objetivo era desenvolver modelos para previsão de diagnóstico de síndromes respiratórias, que é um tema relacionado com um dos 17 tópicos de Desenvolvimento Sustentável das Nações Unidas - Boa saúde e bem-estar.
Introdução Definição do problema de negócio Análise Exploratória (em R) Estrutura da base Ano da base de dados Target Machine Learning (em Python) Importar dependencias Carregar dados Modelagem Submissão Considerações Finais Introdução No final de Janeiro desde ano (2022) o TFUG - TensorFlow Users Group de São Paulo lançou uma competição no Kaggle para prever as notas do enem que tem relação com um dos 17 tópicos de Desenvolvimento Sustentável das Nações Unidas - Educação de Qualidade.
Introdução Definição do problema de negócio Análise Exploratória (em R) Machine Learning (em Python) Importar dependências Stage 0: Feature Extraction com KNN Stage 1: Tuning XGBoost com Optuna Stage 2: Calcular Out-Of-Fold SHAP values Stage 3: Modelo Final com AutoGluon Conclusão Referências Introdução Em Agosto e 2021 a Porto Seguro lançou um desafio no Kaggle que consistia em estimar a propensão de aquisição de novos produtos. Tratava-se de um problema de classificação e foi bem desafiador principalmente por 2 motivos:
O problema envolvendo dados desbalanceados Objetivo Dependências Preparar dados Breve análise exploratória Modelagem Baselines Preparar Pipeline de dados com workflowsets Benchmark Conclusão Referências O problema envolvendo dados desbalanceados A tarefa de classificação com dados desbalanceados é muito comum na vida real podendo variar desde um leve viés até um enorme desequilíbrio na distribuição da classe de interesse. Problemas mais comuns envolvem:
Ciência de dados é a área que combina programação, matemática, estatística e conhecimento de contexto para extrair soluções escondidas em grandes massas de dados desorganizados. Com a quantidade de dados produzida a cada instante e o poder computacional cada vez mais barato, ela ganhou um espaço enorme no mercado. Para ter ideia da escala, projeta-se que, até 2025, o mundo gere cerca de 175 zettabytes de dados por ano (IDC, Data Age 2025).
Por que investir? Como esta sua situação financeira? Caso tenha alguma reserva pode ser interessante pensar em investimentos pois a poupança já não é mais garantia de lucro no longo prazo, não acredita?
Até que um dia.. Agora em dezembro encerro um desafio pessoal de fazer pelo menos um post por mês durante o ano de 2018 e estou muito animado com o término deste ciclo! Espero ter contribuído um pouquinho com a comunidade de Estatística e Ciência de Dados que está maior a cada dia e cada vez mais importante.
Encontrar dados confiáveis pode consumir muitas horas de trabalho em qualquer projeto de análise, visualização ou aprendizado de máquina. A melhor forma de ganhar tempo é começar com fontes bem documentadas, com contexto claro e com exemplos práticos de uso.
Key Takeaways
Comece por fontes brasileiras e internacionais com boa documentação e metadados claros. Prefira datasets com descrição do schema, licenciamento e contexto de coleta. Para projetos reais, vale separar as bases por tema, facilidade de uso e tipo de análise. Onde começar # Quando preciso escolher um dataset para estudar ou enriquecer bases de dados que estou trabalhando, eu costumo iniciar por três tipos de fonte: repositórios governamentais, plataformas especializadas em datasets e bases voltadas para áreas específicas como saúde, economia ou visão computacional.