<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Pratica on Fellipe Gomes</title><link>https://gomesfellipe.github.io/tags/pratica/</link><description>Recent content in Pratica on Fellipe Gomes</description><generator>Hugo -- gohugo.io</generator><language>pt-BR</language><copyright>© 2026 Fellipe Gomes</copyright><lastBuildDate>Tue, 07 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://gomesfellipe.github.io/tags/pratica/index.xml" rel="self" type="application/rss+xml"/><item><title>Solução Final - ML Olympiad [1º lugar]</title><link>https://gomesfellipe.github.io/post/2023-05-30-solucao-final-ensure-healthy-lives-kaggle-competition/</link><pubDate>Tue, 30 May 2023 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2023-05-30-solucao-final-ensure-healthy-lives-kaggle-competition/</guid><description>&lt;link href="index_files/vembedr/css/vembedr.css" rel="stylesheet" /&gt;

&lt;div id="TOC"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#introdu%C3%A7%C3%A3o" id="toc-introdução"&gt;Introdução&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#defini%C3%A7%C3%A3o-do-problema-de-neg%C3%B3cio" id="toc-definição-do-problema-de-negócio"&gt;Definição do problema de negócio&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#solu%C3%A7%C3%B5es" id="toc-soluções"&gt;Soluções&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#estrat%C3%A9gia-anal%C3%ADtica" id="toc-estratégia-analítica"&gt;Estratégia analítica&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#decis%C3%B5es-sobre-a-target" id="toc-decisões-sobre-a-target"&gt;Decisões sobre a target&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#processamento-dos-dados" id="toc-processamento-dos-dados"&gt;Processamento dos Dados&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#dados-externos" id="toc-dados-externos"&gt;Dados Externos&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#feature-engineering" id="toc-feature-engineering"&gt;Feature Engineering&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#modelos" id="toc-modelos"&gt;Modelos&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#ensemble" id="toc-ensemble"&gt;Ensemble&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#post-processing" id="toc-post-processing"&gt;Post Processing&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#considera%C3%A7%C3%B5es-finais" id="toc-considerações-finais"&gt;Considerações Finais&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/div&gt;

&lt;div id="introdução" class="section level1"&gt;
&lt;h1&gt;Introdução&lt;/h1&gt;
&lt;p&gt;O &lt;a href="https://www.meetup.com/TensorFlowSP/events/284607061/"&gt;TFUG - TensorFlow Users Group de São Paulo&lt;/a&gt; lançou uma nova &lt;a href="https://www.kaggle.com/competitions/ml-olympiad-ensure-healthy-lives"&gt;competição no Kaggle&lt;/a&gt; onde o objetivo era desenvolver modelos para previsão de diagnóstico de síndromes respiratórias, que é um tema relacionado com um dos 17 tópicos de Desenvolvimento Sustentável das Nações Unidas - &lt;em&gt;Boa saúde e bem-estar&lt;/em&gt;.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2023-05-30-solucao-final-ensure-healthy-lives-kaggle-competition/feature.png"/></item><item><title>Solução Final - ML Olympiad [2º lugar]</title><link>https://gomesfellipe.github.io/post/2022-04-20-solucao-final-education-quality-kaggle-competition/</link><pubDate>Tue, 19 Apr 2022 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2022-04-20-solucao-final-education-quality-kaggle-competition/</guid><description>&lt;div id="TOC"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#introdu%C3%A7%C3%A3o" id="toc-introdução"&gt;Introdução&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#defini%C3%A7%C3%A3o-do-problema-de-neg%C3%B3cio" id="toc-definição-do-problema-de-negócio"&gt;Definição do problema de negócio&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#an%C3%A1lise-explorat%C3%B3ria-em-r" id="toc-análise-exploratória-em-r"&gt;Análise Exploratória (em R)&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#estrutura-da-base" id="toc-estrutura-da-base"&gt;Estrutura da base&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#ano-da-base-de-dados" id="toc-ano-da-base-de-dados"&gt;Ano da base de dados&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#target" id="toc-target"&gt;Target&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#machine-learning-em-python" id="toc-machine-learning-em-python"&gt;Machine Learning (em Python)&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#importar-dependencias" id="toc-importar-dependencias"&gt;Importar dependencias&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#carregar-dados" id="toc-carregar-dados"&gt;Carregar dados&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#modelagem" id="toc-modelagem"&gt;Modelagem&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#submiss%C3%A3o" id="toc-submissão"&gt;Submissão&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#considera%C3%A7%C3%B5es-finais" id="toc-considerações-finais"&gt;Considerações Finais&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/div&gt;

&lt;div id="introdução" class="section level2"&gt;
&lt;h1&gt;Introdução&lt;/h1&gt;
&lt;p&gt;No final de Janeiro desde ano (2022) o &lt;a href="https://www.meetup.com/TensorFlowSP/events/284607061/"&gt;TFUG - TensorFlow Users Group de São Paulo&lt;/a&gt; lançou uma competição no Kaggle para prever as notas do enem que tem relação com um dos 17 tópicos de Desenvolvimento Sustentável das Nações Unidas - &lt;em&gt;Educação de Qualidade&lt;/em&gt;.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2022-04-20-solucao-final-education-quality-kaggle-competition/feature.png"/></item><item><title>Solução Final - Porto Seguro Data Challenge [3º lugar]</title><link>https://gomesfellipe.github.io/post/2021-11-01-solucao-final-porto-seguro-data-challenge/</link><pubDate>Mon, 01 Nov 2021 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2021-11-01-solucao-final-porto-seguro-data-challenge/</guid><description>&lt;div id="TOC"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#introdu%C3%A7%C3%A3o" id="toc-introdução"&gt;Introdução&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#defini%C3%A7%C3%A3o-do-problema-de-neg%C3%B3cio" id="toc-definição-do-problema-de-negócio"&gt;Definição do problema de negócio&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#an%C3%A1lise-explorat%C3%B3ria-em-r" id="toc-análise-exploratória-em-r"&gt;Análise Exploratória (em R)&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#machine-learning-em-python" id="toc-machine-learning-em-python"&gt;Machine Learning (em Python)&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#importar-depend%C3%AAncias" id="toc-importar-dependências"&gt;Importar dependências&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#stage-0-feature-extraction-com-knn" id="toc-stage-0-feature-extraction-com-knn"&gt;Stage 0: Feature Extraction com KNN&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#stage-1-tuning-xgboost-com-optuna" id="toc-stage-1-tuning-xgboost-com-optuna"&gt;Stage 1: Tuning XGBoost com Optuna&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#stage-2-calcular-out-of-fold-shap-values" id="toc-stage-2-calcular-out-of-fold-shap-values"&gt;Stage 2: Calcular Out-Of-Fold SHAP values&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#stage-3-modelo-final-com-autogluon" id="toc-stage-3-modelo-final-com-autogluon"&gt;Stage 3: Modelo Final com AutoGluon&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#conclus%C3%A3o" id="toc-conclusão"&gt;Conclusão&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#refer%C3%AAncias" id="toc-referências"&gt;Referências&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/div&gt;

&lt;style&gt;
.column {
float: left;
width: 50%;
padding: 10px;
}

.column4 {
float: left;
width: 20%;
padding: 10px;
}

.column8 {
float: left;
width: 80%;
padding: 10px;
}

.row:after {
content: "";
display: table;
clear: both;
}

.center {
display: flex;
justify-content: center;
align-items: center;
height: 200px;
}
&lt;/style&gt;
&lt;hr /&gt;
&lt;div id="introdução" class="section level2"&gt;
&lt;h1&gt;Introdução&lt;/h1&gt;
&lt;div class="row"&gt;
&lt;div class="column8"&gt;
&lt;p&gt;Em Agosto e 2021 a Porto Seguro lançou um desafio no Kaggle que consistia em estimar a propensão de aquisição de novos produtos. Tratava-se de um problema de classificação e foi bem desafiador principalmente por 2 motivos:&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2021-11-01-solucao-final-porto-seguro-data-challenge/feature.png"/></item><item><title>Otimizando pipelines que envolvem dados desbalanceados</title><link>https://gomesfellipe.github.io/post/2021-06-28-imbalanced-workflowsets/</link><pubDate>Mon, 28 Jun 2021 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2021-06-28-imbalanced-workflowsets/</guid><description>&lt;div id="TOC"&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#o-problema-envolvendo-dados-desbalanceados" id="toc-o-problema-envolvendo-dados-desbalanceados"&gt;O problema envolvendo dados desbalanceados&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#objetivo" id="toc-objetivo"&gt;Objetivo&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#depend%C3%AAncias" id="toc-dependências"&gt;Dependências&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#preparar-dados" id="toc-preparar-dados"&gt;Preparar dados&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#breve-an%C3%A1lise-explorat%C3%B3ria" id="toc-breve-análise-exploratória"&gt;Breve análise exploratória&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#modelagem" id="toc-modelagem"&gt;Modelagem&lt;/a&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href="#baselines" id="toc-baselines"&gt;Baselines&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#preparar-pipeline-de-dados-com-workflowsets" id="toc-preparar-pipeline-de-dados-com-workflowsets"&gt;Preparar Pipeline de dados com &lt;code&gt;workflowsets&lt;/code&gt;&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#benchmark" id="toc-benchmark"&gt;Benchmark&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#conclus%C3%A3o" id="toc-conclusão"&gt;Conclusão&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href="#refer%C3%AAncias" id="toc-referências"&gt;Referências&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/div&gt;

&lt;style&gt;
.column {
float: left;
width: 50%;
padding: 10px;
}

.column4 {
float: left;
width: 33%;
padding: 10px;
}

.column8 {
float: left;
width: 66%;
padding: 10px;
}

.row:after {
content: "";
display: table;
clear: both;
}

.center {
display: flex;
justify-content: center;
align-items: center;
height: 200px;
}
&lt;/style&gt;
&lt;div id="o-problema-envolvendo-dados-desbalanceados" class="section level1"&gt;
&lt;h1&gt;O problema envolvendo dados desbalanceados&lt;/h1&gt;
&lt;p&gt;A tarefa de classificação com dados desbalanceados é muito comum na vida real podendo variar desde um leve viés até um enorme desequilíbrio na distribuição da classe de interesse. Problemas mais comuns envolvem:&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2021-06-28-imbalanced-workflowsets/feature.png"/></item><item><title>Como automatizar relatórios longos e repetitivos com RMarkdown</title><link>https://gomesfellipe.github.io/post/2019-09-13-relatorios-automaticos-com-rmarkdown/</link><pubDate>Fri, 13 Sep 2019 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2019-09-13-relatorios-automaticos-com-rmarkdown/</guid><description>&lt;div id="problema-de-negócio" class="section level1"&gt;
&lt;h1&gt;Problema de negócio&lt;/h1&gt;
&lt;p&gt;Uma tarefa comum no dia a dia de um estatístico (ou cientista de dados) é a elaboração de relatórios para passar ao restante da equipe e/ou tomadores de decisão os resultados encontrados e muitas vezes essa tarefa pode parecer desgastante quando os relatórios são muitos extensos e repetitivos.&lt;/p&gt;
&lt;p&gt;Com a linguagem R, escrever relatórios estatísticos utilizando &lt;a href="https://rmarkdown.rstudio.com/"&gt;RMarkdown&lt;/a&gt; acaba sendo a escolha padrão por ser tão simples transformar as análises em documentos, apresentações e dashboards de alta qualidade com poucas linhas de código.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2019-09-13-relatorios-automaticos-com-rmarkdown/feature.png"/></item><item><title>Hackeando o R: estratégia split-apply-combine</title><link>https://gomesfellipe.github.io/post/2019-04-05-split-apply-combine/</link><pubDate>Fri, 05 Apr 2019 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2019-04-05-split-apply-combine/</guid><description>&lt;div id="o-método-split-apply-combine" class="section level1"&gt;
&lt;h1&gt;O método split-apply-combine&lt;/h1&gt;
&lt;p&gt;Geralmente em uma análise de dados precisamos compreender, além do comportamento geral dos dados, o seu comportamento de acordo com alguns segmentos.&lt;/p&gt;
&lt;p&gt;No famoso paper &lt;a href="https://vita.had.co.nz/papers/plyr.pdf"&gt;The Split-Apply-Combine Strategy for Data Analysis&lt;/a&gt;, &lt;a href="http://hadley.nz/"&gt;Hadley Wickham&lt;/a&gt; descreve a abordagem “split-apply-combine” (dividir-aplicar-combinar) como uma das mais comuns em uma análise de dados. Em R essa tarefa pode ser feita por diversos caminhos, veja alguns dos modos de se fazer utilizando funções base do R e abordagens mais antigas:&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2019-04-05-split-apply-combine/feature.png"/></item><item><title>Seu app, RStudio e Shiny Server na nuvem do Google</title><link>https://gomesfellipe.github.io/post/2018-10-27-server-cloud/</link><pubDate>Sat, 27 Oct 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-10-27-server-cloud/</guid><description>&lt;div class="w3-panel w3-pale-yellow w3-border"&gt;
&lt;p&gt;&lt;strong&gt;⚠️ Nota de atualização (2026):&lt;/strong&gt; Este post usa Ubuntu 16.04 LTS (EOL desde 2021), RStudio Server (renomeado para &lt;strong&gt;Posit Workbench&lt;/strong&gt;) e Shiny Server na instância &lt;code&gt;f1-micro&lt;/code&gt; do Google Cloud. Os passos gerais ainda funcionam, mas o Ubuntu mínimo recomendado hoje é o 22.04 LTS e os pacotes de instalação do RStudio/Posit mudaram de URL. Para instâncias novas, consulte a &lt;a href="https://posit.co/download/rstudio-server/" rel="nofollow"&gt;documentação atual do Posit Workbench&lt;/a&gt;.&lt;/p&gt;
&lt;/div&gt;

&lt;div id="objetivo-do-post" class="section level2"&gt;
&lt;h1&gt;Objetivo do post &lt;i class="fa fa-rocket"&gt;&lt;/i&gt;&lt;/h1&gt;
&lt;p&gt;Uma das várias maneiras de se implementar o &lt;a href="https://www.rstudio.com/products/rstudio/download-server/"&gt;RStudio Server&lt;/a&gt; e o &lt;a href="https://www.rstudio.com/products/shiny/download-server/"&gt;Shiny Server&lt;/a&gt; é através de serviços de nuvem que fornecem máquinas virtuais. Empresas gigantes no mercado como Amazon Web Services (AWS), Microsoft, Google, IBM, Oracle etc têm investido pesado nestes serviços e a escolha de qual cloud utilizar deve ser feita de acordo com a necessidade do usuário pois cada uma delas oferecem diferentes preços com diferentes custos/benefícios.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-10-27-server-cloud/feature.png"/></item><item><title>Com que frequência ocorrem acidentes na ponte Rio-Niterói?</title><link>https://gomesfellipe.github.io/post/2018-09-29-freq-acidente-ponte-rio-niteroi/</link><pubDate>Sat, 29 Sep 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-09-29-freq-acidente-ponte-rio-niteroi/</guid><description>&lt;link rel="stylesheet" href="https://gomesfellipe.github.io/lib/leaflet/leaflet.css" /&gt;
&lt;script src="https://gomesfellipe.github.io/lib/leaflet/leaflet.js"&gt;&lt;/script&gt;
&lt;link rel="stylesheet" href="https://gomesfellipe.github.io/lib/leaflet/MarkerCluster.css" /&gt;
&lt;link rel="stylesheet" href="https://gomesfellipe.github.io/lib/leaflet/MarkerCluster.Default.css" /&gt;
&lt;script src="https://gomesfellipe.github.io/lib/leaflet/leaflet.markercluster.js"&gt;&lt;/script&gt;


&lt;div id="perguntas" class="section level2"&gt;
&lt;h1&gt;Perguntas&lt;/h1&gt;
&lt;p&gt;Estudar em outra cidade têm suas vantagens e desvantagens, durante toda a graduação atravessei Baía de Guanabara pela Ponte Presidente Costa e Silva, (popularmente conhecida como Ponte Rio–Niterói) assim como todas as pessoas que fazem esse trajeto diariamente e diante de tanta beleza natural com a vista panorâmica da Baía como os espetáculos proporcionados pelo pôr do sol, os pássaros ou a beleza inegável do Pão de Açúcar também é notável a beleza fruto da maior habilidade humana: a &lt;strong&gt;criatividade&lt;/strong&gt;. Temos o cristo, todos aqueles grandes barcos, o Porto do Rio de Janeiro com todas aquelas obras de Engenharia, ou até mesmo a própria Ponte, que por si só já é intrigante.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-09-29-freq-acidente-ponte-rio-niteroi/feature.jpg"/></item><item><title>Modelos baseados em árvore no R: desafio Ames Housing do Kaggle</title><link>https://gomesfellipe.github.io/post/2018-08-31-modelos-em-arvore/</link><pubDate>Fri, 31 Aug 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-08-31-modelos-em-arvore/</guid><description>&lt;div id="kaggle" class="section level2"&gt;
&lt;h1&gt;Kaggle&lt;/h1&gt;
&lt;p&gt;Segundo o &lt;a href="https://en.wikipedia.org/wiki/Kaggle"&gt;Wikipédia&lt;/a&gt;: “Kaggle é a maior comunidade mundial de cientistas de dados e machine learning.” Aprendo muito estudando as resoluções de alguns competidores pois lá é possível conferir tanto as metodologias utilizadas pelos competidores quando os códigos e é notável o cuidado dos participantes para que seja possível a reprodutibilidade dos resultados, o que pode impulsionar o aprendizado.&lt;/p&gt;
&lt;p&gt;O Kaggle trabalha com a ideia de &lt;a href="https://en.wikipedia.org/wiki/Gamification"&gt;gamificação&lt;/a&gt;, que é um assunto do qual já escrevi em um post sobre &lt;a href="https://gomesfellipe.github.io/post/2018-02-17-cheatsheet-gamificacao-r/cheatsheet-gamificacao-r/"&gt;gamificação e porque aprender R é tão divertido&lt;/a&gt; e gosto deste conceito de se criar jogos para motivar e engajar as pessoas em atividades profissionais e a ideia de se estar em um jogo possibilita doses de motivação especialmente a quem gosta de competir.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-08-31-modelos-em-arvore/feature.png"/></item><item><title>Brasil x Argentina, tidytext e Machine Learning</title><link>https://gomesfellipe.github.io/post/2018-06-24-brasil-argentina-tidytext-ml/</link><pubDate>Sun, 24 Jun 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-06-24-brasil-argentina-tidytext-ml/</guid><description>&lt;div id="brasil-vs-argentina-e-text-mining" class="section level2"&gt;
&lt;h1&gt;Brasil vs Argentina e Text Mining&lt;/h1&gt;
&lt;p&gt;A copa do mundo esta ai novamente e como não poderia ser diferente, com ela surgem novos &lt;a href="http://cio.com.br/noticias/2015/10/27/tome-nota-2-5-quintilhoes-de-bytes-sao-criados-todos-os-dias/"&gt;quintilhões de bytes todos os dias&lt;/a&gt;, saber analisar esses dados é um grande desafio pois a maioria dessa informação se encontra de forma não estruturada e além do desafio de captar esses dados ainda existem mais desafios que podem ser ainda maiores, como o de processá-los e obter respostas deles.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-06-24-brasil-argentina-tidytext-ml/feature.jpeg"/></item><item><title>Séries temporais com Google Trends e R</title><link>https://gomesfellipe.github.io/post/2018-04-12-google-trends-e-r/</link><pubDate>Thu, 12 Apr 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-04-12-google-trends-e-r/</guid><description>&lt;div id="google-trends" class="section level2"&gt;
&lt;h1&gt;Google Trends&lt;/h1&gt;
&lt;p&gt;O &lt;a href="https://trends.google.com.br/"&gt;Google Trends&lt;/a&gt; é uma ferramenta gratuita, muito poderosa e que pode ser implementada para ajudar em nossas estratégias de análises.&lt;/p&gt;
&lt;p&gt;Através dele temos acesso a uma gigantesca base de dados que reúne os temas mais pesquisados na plataforma da Google possibilitando acessar dados de busca desde o ano de 2004.&lt;/p&gt;
&lt;p&gt;Através de suas séries temporais podemos avaliar a presença de pedrões, obter noções de tendência, sazonalidade e até mesmo arriscar algumas previsões.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-04-12-google-trends-e-r/feature.png"/></item><item><title>Produzindo e formatando um documento Word direto em R</title><link>https://gomesfellipe.github.io/post/2018-03-07-word-e-r-2/</link><pubDate>Wed, 07 Mar 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-03-07-word-e-r-2/</guid><description>&lt;div id="relatórios-de-alta-qualidade-só-com-latex" class="section level1"&gt;
&lt;h1&gt;Relatórios de alta qualidade só com &lt;span class="math inline"&gt;\(\LaTeX\)&lt;/span&gt;?&lt;/h1&gt;
&lt;p&gt;Como já mencionei no &lt;a href="https://gomesfellipe.github.io/post/2018-01-12-tabelas-incriveis-com-r/"&gt;post sobre tabelas incríveis com R&lt;/a&gt;, a tarefa de um estatístico (ou Data Scientist, em sua versão diluída e mais comercial) vai muito além do planejamento, análises, inferência, sumarização e interpretação de observações para fornecer a melhor informação possível a partir do dados disponíveis. A produção final dos relatórios é fundamental e na grande maioria das vezes utiliza-se a linguagem &lt;span class="math inline"&gt;\(\LaTeX\)&lt;/span&gt;, mas será que ela é realmente a única opção?&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-03-07-word-e-r-2/feature.png"/></item><item><title>CheatSheets e gamificação: aprender R de forma divertida</title><link>https://gomesfellipe.github.io/post/2018-02-17-cheatsheet-gamificacao-r/</link><pubDate>Sat, 17 Feb 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-02-17-cheatsheet-gamificacao-r/</guid><description>&lt;div id="você-costuma-ler-o-manual" class="section level1"&gt;
&lt;h1&gt;Você costuma ler o manual?&lt;/h1&gt;
&lt;p&gt;Quando éramos crianças, geralmente não tínhamos o costume de ler o manual das coisas, não é mesmo? Particularmente eu sempre gostei de aprender como as coisas funcionavam diretamente com a prática para poder usá-las depois. Adorava buscar entender como as coisas se encaixavam ao montar os brinquedinhos do kinder-ovo sem ler as instruções ou criar diferentes combinações com lego customizados, por exemplo. Acredito que isso seja da natureza de toda criança!&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-02-17-cheatsheet-gamificacao-r/feature.png"/></item><item><title>Carnaval e mapas interativos com R</title><link>https://gomesfellipe.github.io/post/2018-02-01-leaflet-carnaval/</link><pubDate>Thu, 01 Feb 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-02-01-leaflet-carnaval/</guid><description>&lt;link rel="stylesheet" href="https://gomesfellipe.github.io/lib/leaflet/leaflet.css" /&gt;
&lt;script src="https://gomesfellipe.github.io/lib/leaflet/leaflet.js"&gt;&lt;/script&gt;
&lt;link rel="stylesheet" href="https://gomesfellipe.github.io/lib/leaflet/MarkerCluster.css" /&gt;
&lt;link rel="stylesheet" href="https://gomesfellipe.github.io/lib/leaflet/MarkerCluster.Default.css" /&gt;
&lt;script src="https://gomesfellipe.github.io/lib/leaflet/leaflet.markercluster.js"&gt;&lt;/script&gt;


&lt;div id="onde-estão-os-blocos" class="section level1"&gt;
&lt;h1&gt;Onde estão os blocos?&lt;/h1&gt;
&lt;p&gt;Fevereiro começando e o carnaval já está ai, especialmente se você mora no Rio de Janeiro já deve ter passado por algum bloco e a pergunta que todo mundo faz no carnaval pelo menos uma vez é: “Onde tem bloco?”.&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;TL;DR&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Usamos &lt;code&gt;ggmap&lt;/code&gt; para geocodificar (transformar endereço em latitude/longitude) os blocos de carnaval.&lt;/li&gt;
&lt;li&gt;O pacote &lt;code&gt;leaflet&lt;/code&gt; (com &lt;code&gt;leaflet.extras&lt;/code&gt;) plota tudo num mapa interativo.&lt;/li&gt;
&lt;li&gt;A limpeza de texto usa a função &lt;code&gt;ajustar_nomes()&lt;/code&gt; do post sobre manipulação de strings.&lt;/li&gt;
&lt;/ul&gt;
&lt;/blockquote&gt;
&lt;p&gt;Baseado nessa pergunta resolvi fazer esse post especial, vamos utilizar os pacotes &lt;a href="https://cran.r-project.org/package=ggmap"&gt;&lt;code&gt;ggmap&lt;/code&gt;&lt;/a&gt; e &lt;a href="https://cran.r-project.org/package=leaflet"&gt;&lt;code&gt;leaflet&lt;/code&gt;&lt;/a&gt; para buscar as coordenadas geográficas do endereço dos blocos e representa-los num mapa agradável de navegar&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-02-01-leaflet-carnaval/feature.png"/></item><item><title>Tabelas Incríveis com R</title><link>https://gomesfellipe.github.io/post/2018-01-12-tabelas-incriveis-com-r/</link><pubDate>Fri, 12 Jan 2018 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2018-01-12-tabelas-incriveis-com-r/</guid><description>&lt;div id="importâcia-da-apresentação-dos-dados" class="section level1"&gt;
&lt;h1&gt;Importância da apresentação dos dados&lt;/h1&gt;
&lt;p&gt;O trabalho de quem analisa dados vai muito além de planejar, resumir e interpretar observações: apresentar bem os resultados é parte essencial de qualquer projeto ou pesquisa. Não é à toa que já existe até uma área dentro da ciência de dados focada nisso, com o título de "Data Artist".&lt;/p&gt;
&lt;p&gt;Além dos pacotes que ajudam a apresentar as figuras geradas nas análises (como mostrei nos posts sobre &lt;a href="https://gomesfellipe.github.io/post/2017-12-24-diagnostico-de-modelo/"&gt;a qualidade do ajuste de modelos&lt;/a&gt; e sobre &lt;a href="https://gomesfellipe.github.io/post/2017-12-18-bayesiana-jags-mcmcplot/"&gt;avaliar o ajuste pela abordagem bayesiana&lt;/a&gt;), contamos com pacotes que apresentam tabelas de forma elegante e até interativa.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2018-01-12-tabelas-incriveis-com-r/feature.jpg"/></item><item><title>Criando Relatórios com o Template Tufte no R (RMarkdown)</title><link>https://gomesfellipe.github.io/post/2017-12-14-criando-relatorios-com-template-tufte/</link><pubDate>Thu, 14 Dec 2017 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2017-12-14-criando-relatorios-com-template-tufte/</guid><description>&lt;p&gt;Além da limpeza da base de dados, das análises e da aplicação de metodologias estatísticas, escrever relatórios é uma tarefa indispensável e que ocupa boa parte do tempo de quem trabalha com dados. Como disse Khalil Gibran, é preciso &lt;em&gt;transformar em palavras aquilo que já conhecemos em pensamentos&lt;/em&gt;. O problema é que ninguém quer gastar tempo precioso de análise brigando com a formatação do documento.&lt;/p&gt;

&lt;p&gt;É aí que entram os templates. O pacote &lt;code&gt;tufte&lt;/code&gt;, disponível no &lt;a href="https://cran.r-project.org" rel="noopener" target="_blank"&gt;CRAN&lt;/a&gt;, resolve isso para quem escreve em RMarkdown: ele traz um layout pronto, elegante e focado no conteúdo, para você formatar menos e analisar mais. Este post mostra o que é esse estilo, como instalar e como usar os recursos que o tornam diferente.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2017-12-14-criando-relatorios-com-template-tufte/feature.png"/></item><item><title>Manipulando dados com dplyr</title><link>https://gomesfellipe.github.io/post/2017-12-07-manipulando-dados-com-dplyr/</link><pubDate>Thu, 07 Dec 2017 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2017-12-07-manipulando-dados-com-dplyr/</guid><description>&lt;div id="o-pacote-dplyr" class="section level1"&gt;
&lt;h1&gt;O pacote dplyr&lt;/h1&gt;
&lt;p&gt;A análise exploratória dos dados é uma tarefa de bastante relevância para entendermos a natureza dos dados e o tempo de análise é sempre muito precioso. É necessária bastante curiosidade e criatividade para fazer uma boa análise exploratória dos dados pois é difícil receber aqueles dados bonitinhos igual aos nativos do banco de dados do &lt;strong&gt;R&lt;/strong&gt;.&lt;/p&gt;
&lt;p&gt;A manipulação de dados é uma das etapas que mais consomem tempo em qualquer projeto, como comento no &lt;a href="https://gomesfellipe.github.io/post/2021-05-24-ciencia-de-dados-uma-visao-geral/"&gt;panorama da ciência de dados&lt;/a&gt; que escrevi para quem está começando. Aqui o foco é numa das ferramentas centrais para essa tarefa.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2017-12-07-manipulando-dados-com-dplyr/feature.png"/></item><item><title>Gerenciando arquivos do Dropbox com R e httr2: a abordagem moderna</title><link>https://gomesfellipe.github.io/post/2017-12-04-gerenciando-arquivos-do-dropbox-com-r/</link><pubDate>Mon, 04 Dec 2017 00:00:00 +0000</pubDate><guid>https://gomesfellipe.github.io/post/2017-12-04-gerenciando-arquivos-do-dropbox-com-r/</guid><description>&lt;div class="w3-panel w3-pale-yellow w3-border"&gt;
&lt;p&gt;&lt;strong&gt;⚠️ Nota (2026):&lt;/strong&gt; Este post foi reescrito. A versão original usava o pacote &lt;code&gt;rdrop2&lt;/code&gt;, que dependia da API v1 do Dropbox — descontinuada desde setembro de 2023. O conteúdo abaixo mostra a abordagem atual com &lt;code&gt;httr2&lt;/code&gt; + API v2. A versão original foi preservada em &lt;code&gt;index-old.html&lt;/code&gt; neste mesmo bundle para consulta.&lt;/p&gt;
&lt;/div&gt;

&lt;p&gt;Armazenar arquivos na nuvem é prática comum, e o Dropbox é um dos serviços mais usados para isso. Saber interagir com esses arquivos por código é uma habilidade valiosa para quem trabalha com dados: automatizar o vai e vem de arquivos economiza tempo, elimina erro manual e permite integrar fontes de dados externas em pipelines reprodutíveis.&lt;/p&gt;</description><media:content xmlns:media="http://search.yahoo.com/mrss/" url="https://gomesfellipe.github.io/post/2017-12-04-gerenciando-arquivos-do-dropbox-com-r/feature.png"/></item></channel></rss>