<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <title>Ciencia-De-Dados on Crimideias do caioau</title>
    <link>https://caioau.net/tags/ciencia-de-dados/</link>
    <description>Recent content in Ciencia-De-Dados on Crimideias do caioau</description>
    <generator>Hugo -- gohugo.io</generator>
    <language>pt-br</language>
    <copyright>🄯 Copyleft: licensed under a CC BY-NC-SA 4.0 licence</copyright>
    <lastBuildDate>Mon, 30 Nov 2020 13:00:00 -0300</lastBuildDate><atom:link href="https://caioau.net/tags/ciencia-de-dados/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>Primeiros passos com o pandas</title>
      <link>https://caioau.net/blog/pandas/</link><category>computando-arte</category>
		  <category>texto</category>
		  <category>python</category>
		  <category>ciencia-de-dados</category>
		  
      <pubDate>Mon, 30 Nov 2020 13:00:00 -0300</pubDate>
      
      <guid>https://caioau.net/blog/pandas/</guid><description>&lt;p&gt;Obs.: Originalmente publicado no &lt;a href=&#34;https://caioau.net/blog/computando-arte/&#34;&gt;computando-arte&lt;/a&gt; dia 30Nov2020&lt;/p&gt;
&lt;h2 id=&#34;o-que-é-o-pandas&#34;&gt;O que é o pandas&lt;/h2&gt;
&lt;p&gt;Pandas é uma biblioteca Python para trabalhar com dados tabulares, que como o nome sugere são os dados estruturados na forma de uma tabela: ou seja os elementos são arranjados em colunas verticais e linhas (ou registros) horizontais, dessa forma cada elemento é formado pela intersecção de uma coluna e uma linha.&lt;/p&gt;
&lt;p&gt;É uma das biblioteca mais importantes para Ciência de Dados. As principais bibliotecas são:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Aprendizado de máquina: scikit-learn&lt;/li&gt;
&lt;li&gt;Vetores e matrizes: numpy&lt;/li&gt;
&lt;li&gt;Scipy: várias coisas científicas(computação científica) 😜&lt;/li&gt;
&lt;li&gt;Gráficos: matplotlib, seaborn, plotly&lt;/li&gt;
&lt;li&gt;Redes neurais: pytorch e tensorflow&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;sobre-a-linguagem-python&#34;&gt;Sobre a linguagem Python&lt;/h2&gt;
&lt;p&gt;Python é umas das principais linguagens de programação usada em Ciência de Dados, é uma linguagem fácil de aprender e existem muitas bibliotecas excelentes disponíveis. Além de Python, a linguagem R também é muito utilizada.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Quer aprender Python? Recomendo o livro do Luciano Ramalho: Python Fluente. Quer uma palinha? Ele fez uma live: &lt;a href=&#34;https://www.youtube.com/watch?v=2TLU3d3qgCw&#34;&gt;Luciano Ramalho &amp;ndash; A Beleza de Python&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;Não curte livro? O Fernando Masanori fez uma série de vídeos: &lt;a href=&#34;https://www.youtube.com/c/PythonparaZumbis/playlists&#34;&gt;python para zumbis&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;Canais do youtube: &lt;a href=&#34;https://www.youtube.com/c/Dunossauro&#34;&gt;Dunossauro (Eduardo Mendes)&lt;/a&gt; e o canal &lt;a href=&#34;https://www.youtube.com/c/Programa%C3%A7%C3%A3oDin%C3%A2mica&#34;&gt;Programação dinâmica&lt;/a&gt; tem vários vídeos excelentes.&lt;/li&gt;
&lt;li&gt;Já manja de programar e quer só aprender como faço determinada tarefa em Python: &lt;a href=&#34;https://www.pythoncheatsheet.org/&#34;&gt;pythoncheatsheet.org&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Praticar: tem um “jogo” que são dados alguns problemas para serem resolvidos em Python: &lt;a href=&#34;https://py.checkio.org/&#34;&gt;py.checkio.org&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;Curte minecraft? Na Raspberry Pi é possível interagir em Python com o jogo: &lt;a href=&#34;https://projects.raspberrypi.org/en/projects/getting-started-with-minecraft-pi&#34;&gt;projects.raspberrypi.org/en/projects/getting-started-with-minecraft-pi&lt;/a&gt;.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;jupyter-notebooks-e-como-preparar-seu-ambiente&#34;&gt;Jupyter notebooks e como preparar seu ambiente&lt;/h2&gt;
&lt;p&gt;Quando estiver programando em Python ou outras linguagens interpretadas, uma opção popular é a utilização de Jupyter Notebooks. O Jupyter Notebook é uma espécie de “caderno com células” com código ou texto, que pode ser formatado com Markdown (inclusive com formulas LaTeX). Dessa forma, é possível escrever uma vez só o código que gera os gráficos, resultados, texto para um artigo, slides, e etc. Além de que as células são executadas de forma interativa, tornando-se mais fácil de programar dessa forma.&lt;/p&gt;
&lt;h2 id=&#34;dicas-para-os-jupyter-notebooks&#34;&gt;Dicas para os Jupyter notebooks:&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;Para usar o jupyter é simples, crie a célula e use shift+enter para executar aquela célula.&lt;/li&gt;
&lt;li&gt;Precisa instalar um pacote? coloque um ! antes do comando que quer instalar, por exemplo: &lt;code&gt;!pip install numpy&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;Coloque ? antes do que você quer procurar o manual, por exemplo a função split em strings: &lt;code&gt;?str.split&lt;/code&gt;. Então, será aberto um painel com o manual dessa função.&lt;/li&gt;
&lt;li&gt;Como instalar tudo? O jeito mais simples é usar o &lt;a href=&#34;https://www.anaconda.com/&#34;&gt;anaconda.com&lt;/a&gt; que instala todo ambiente Python em sua máquina de maneira simples.&lt;/li&gt;
&lt;li&gt;Outra opção é programar direto do navegador sem precisar instalar nada: o &lt;a href=&#34;https://colab.research.google.com/&#34;&gt;colab.research.google.com&lt;/a&gt; é uma opção popular, e ainda usufrui de GPUs para treinar redes neurais rapidamente e gratuito.&lt;/li&gt;
&lt;li&gt;Pra quem curte software livre e não quer usar a plataforma do google o &lt;a href=&#34;https://cocalc.com/&#34;&gt;cocalc.com&lt;/a&gt; é uma ótima opção.&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id=&#34;começando-pelo-começo-séries-de-valores-no-pandas&#34;&gt;Começando pelo começo: séries de valores no pandas&lt;/h2&gt;
&lt;p&gt;Antes de tudo, vamos importar o pandas:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#d75f00&#34;&gt;import&lt;/span&gt; pandas &lt;span style=&#34;color:#5f8700&#34;&gt;as&lt;/span&gt; pd&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Vamos escrever uma série de valores. Podemos definir os índices da serie de valores, tornando a mais completa e fácil de entender e acessar.&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana = pd.Series([&lt;span style=&#34;color:#00afaf&#34;&gt;20&lt;/span&gt;,&lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;,&lt;span style=&#34;color:#00afaf&#34;&gt;50&lt;/span&gt;,&lt;span style=&#34;color:#00afaf&#34;&gt;30&lt;/span&gt;,&lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;,&lt;span style=&#34;color:#00afaf&#34;&gt;80&lt;/span&gt;,&lt;span style=&#34;color:#00afaf&#34;&gt;15&lt;/span&gt;])
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana.index = [“domingo”, “segunda”, “terca”, “quarta”, “quinta”, “sexta”, “sabado”]
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;domingo    &lt;span style=&#34;color:#00afaf&#34;&gt;20&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;segunda    &lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;terca      &lt;span style=&#34;color:#00afaf&#34;&gt;50&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quarta     &lt;span style=&#34;color:#00afaf&#34;&gt;30&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quinta     &lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sexta      &lt;span style=&#34;color:#00afaf&#34;&gt;80&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sabado     &lt;span style=&#34;color:#00afaf&#34;&gt;15&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: int64&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Para acessar os valores procedemos da mesma forma que com listas: gasto_semana[“segunda”]. Dessa forma, o valor a ser retornado será o valor da segunda-feira.&lt;/p&gt;
&lt;p&gt;Também temos a flexibilidade de realizar cálculos, por exemplo elevar ao quadrado os gastos da semana ao quadrado:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana**&lt;span style=&#34;color:#00afaf&#34;&gt;2&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;domingo     &lt;span style=&#34;color:#00afaf&#34;&gt;400&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;segunda    &lt;span style=&#34;color:#00afaf&#34;&gt;1600&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;terca      &lt;span style=&#34;color:#00afaf&#34;&gt;2500&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quarta      &lt;span style=&#34;color:#00afaf&#34;&gt;900&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quinta     &lt;span style=&#34;color:#00afaf&#34;&gt;1600&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sexta      &lt;span style=&#34;color:#00afaf&#34;&gt;6400&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sabado      &lt;span style=&#34;color:#00afaf&#34;&gt;225&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: int64&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Uma vez que a série foi criada, podemos, por exemplo, calcular a mediana, as estatísticas descritivas (média, desvio padrão, quartis, e etc.) e contar os valores únicos da série:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana.median()
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;40.0&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana.describe(percentiles = [&lt;span style=&#34;color:#00afaf&#34;&gt;.25&lt;/span&gt;, &lt;span style=&#34;color:#00afaf&#34;&gt;.5&lt;/span&gt;, &lt;span style=&#34;color:#00afaf&#34;&gt;.75&lt;/span&gt;])
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;count     &lt;span style=&#34;color:#00afaf&#34;&gt;7.000000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;mean     &lt;span style=&#34;color:#00afaf&#34;&gt;39.285714&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;std      &lt;span style=&#34;color:#00afaf&#34;&gt;21.684974&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#0087ff&#34;&gt;min&lt;/span&gt;      &lt;span style=&#34;color:#00afaf&#34;&gt;15.000000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;25&lt;/span&gt;%      &lt;span style=&#34;color:#00afaf&#34;&gt;25.000000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;50&lt;/span&gt;%      &lt;span style=&#34;color:#00afaf&#34;&gt;40.000000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;75&lt;/span&gt;%      &lt;span style=&#34;color:#00afaf&#34;&gt;45.000000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#0087ff&#34;&gt;max&lt;/span&gt;      &lt;span style=&#34;color:#00afaf&#34;&gt;80.000000&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: float64&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana.value_counts(normalize=&lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;    &lt;span style=&#34;color:#00afaf&#34;&gt;2&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;15&lt;/span&gt;    &lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;30&lt;/span&gt;    &lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;20&lt;/span&gt;    &lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;80&lt;/span&gt;    &lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#00afaf&#34;&gt;50&lt;/span&gt;    &lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: int64&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Podemos procurar por valores que satisfazem uma determinada condição:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana &amp;gt; &lt;span style=&#34;color:#00afaf&#34;&gt;30&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;domingo    &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;segunda     &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;terca       &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quarta     &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quinta      &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sexta       &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sabado     &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: &lt;span style=&#34;color:#0087ff&#34;&gt;bool&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Repare que a saída é uma série com os mesmos índices da serie original e com valores True ou False para os valores que satisfazem ou não a condição.&lt;/p&gt;
&lt;p&gt;Um detalhe é que se quisermos procurar por valores que satisfazem diversas condições, temos que os usar operadores bitwise, por exemplo E (and) é representado por &amp;amp;, OU (or) por | e negação (NOT) por ~&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;(gasto_semana &amp;gt; &lt;span style=&#34;color:#00afaf&#34;&gt;30&lt;/span&gt;) &amp;amp; (gasto_semana &amp;lt; &lt;span style=&#34;color:#00afaf&#34;&gt;80&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;domingo    &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;segunda     &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;terca       &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quarta     &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quinta      &lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sexta      &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sabado     &lt;span style=&#34;color:#d75f00&#34;&gt;False&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: &lt;span style=&#34;color:#0087ff&#34;&gt;bool&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Por fim, se usarmos isso dentro da série original, vamos gerar uma serie com os valores que satisfazem as condições:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;gasto_semana[(gasto_semana &amp;gt; &lt;span style=&#34;color:#00afaf&#34;&gt;30&lt;/span&gt;) &amp;amp; (gasto_semana &amp;lt; &lt;span style=&#34;color:#00afaf&#34;&gt;80&lt;/span&gt;)]
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;segunda    &lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;terca      &lt;span style=&#34;color:#00afaf&#34;&gt;50&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;quinta     &lt;span style=&#34;color:#00afaf&#34;&gt;40&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtype: int64&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;h2 id=&#34;dataframes&#34;&gt;Dataframes&lt;/h2&gt;
&lt;p&gt;Dataframe é um estrutura bidimensional de dados. Pense em dataframe como uma tabela ou matriz. No fundo, o dataframe tem algumas colunas onde cada coluna é uma série de dados e as colunas são “amarradas” pelos índices.&lt;/p&gt;
&lt;p&gt;Vamos importar um dataframe de gorjetas, onde foram anotadas diversas informações de gorjetas como sexo, se é fumante ou não, dia da semana, quantas pessoas na mesa, e etc.&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#d75f00&#34;&gt;import&lt;/span&gt; seaborn &lt;span style=&#34;color:#5f8700&#34;&gt;as&lt;/span&gt; sns
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df = sns.load_dataset(“tips”)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df.head(&lt;span style=&#34;color:#00afaf&#34;&gt;6&lt;/span&gt;) &lt;span style=&#34;color:#4e4e4e&#34;&gt;# exibe os 6 primeiros registros (use tail para ultimos)&lt;/span&gt;&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/df1.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;Uma das primeiras coisas que eu gosto de fazer assim que importo os dados é utilizar a função info para vermos se o type de cada coluna foi identificado corretamente.&lt;/p&gt;
&lt;p&gt;E também podemos ver quanto de memória é utilizada. Caso o conjunto de dados seja grande, é interessante tentar alguns “truques” como transformar alguma coluna como categórico para poupar memória 😜&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df.info()
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&amp;lt;&lt;span style=&#34;color:#5f8700&#34;&gt;class&lt;/span&gt; &amp;#39;&lt;span style=&#34;color:#0087ff&#34;&gt;pandas&lt;/span&gt;.core.frame.DataFrame&lt;span style=&#34;color:#00afaf&#34;&gt;&amp;#39;&amp;gt;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;RangeIndex: &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; entries, &lt;span style=&#34;color:#00afaf&#34;&gt;0&lt;/span&gt; to &lt;span style=&#34;color:#00afaf&#34;&gt;243&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;Data columns (total &lt;span style=&#34;color:#00afaf&#34;&gt;7&lt;/span&gt; columns):
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#4e4e4e&#34;&gt;#   Column      Non-Null Count  Dtype   &lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;---  ------      --------------  -----   
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;0&lt;/span&gt;   total_bill  &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    float64 
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;   tip         &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    float64 
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;2&lt;/span&gt;   sex         &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    category
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;3&lt;/span&gt;   smoker      &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    category
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;4&lt;/span&gt;   day         &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    category
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;5&lt;/span&gt;   time        &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    category
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt; &lt;span style=&#34;color:#00afaf&#34;&gt;6&lt;/span&gt;   size        &lt;span style=&#34;color:#00afaf&#34;&gt;244&lt;/span&gt; non-null    int64   
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;dtypes: category(&lt;span style=&#34;color:#00afaf&#34;&gt;4&lt;/span&gt;), float64(&lt;span style=&#34;color:#00afaf&#34;&gt;2&lt;/span&gt;), int64(&lt;span style=&#34;color:#00afaf&#34;&gt;1&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;memory usage: &lt;span style=&#34;color:#00afaf&#34;&gt;7.3&lt;/span&gt; KB&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Se quisermos saber qual o percentual de quem paga a gorjeta e é fumante, podemos utilizar o values_count conforme descrito na célula de código abaixo. Assim, saberemos que aproximadamente 60% dos pagantes de gorjeta fumam.&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df[‘smoker’].value_counts(normalize=&lt;span style=&#34;color:#d75f00&#34;&gt;True&lt;/span&gt;)
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;No     &lt;span style=&#34;color:#00afaf&#34;&gt;0.618852&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;Yes    &lt;span style=&#34;color:#00afaf&#34;&gt;0.381148&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;Name: smoker, dtype: float64&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;p&gt;Podemos criar também colunas novas. Vamos calcular o total pago (total = valor_conta + valor_tip) e a porcentagem do valor da gorjeta com o total:&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df[‘total_payed’] = tips_df[“total_bill”] + tips_df[“tip”]
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df[‘tip_percentage’] = &lt;span style=&#34;color:#00afaf&#34;&gt;100.0&lt;/span&gt;*tips_df[“tip”]/tips_df[“total_bill”]
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;tips_df.head()&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/df2.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;Qual é a distribuição de percentagem da gorjeta? E do valor total?&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/df3.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;Como podemos ver, em média as gorjetas representam 15% do valor da conta, o que corresponde a ao valor médio da gorjeta de 2.9 dólares.&lt;/p&gt;
&lt;p&gt;Referente ao valor total, a média é de 20.6 dólares e mediana de 22.8 dólares.&lt;/p&gt;
&lt;p&gt;Fumantes tendem a pagar mais gorjeta? Podemos agrupar os valores pela coluna smoker e fazer um describe&lt;/p&gt;
&lt;p&gt;&lt;code&gt;tips_df.groupby([‘smoker’]).tip_percentage.describe()&lt;/code&gt;&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/df4.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;Aparentemente não faz muita diferença se o cliente é fumante ou não para pagar um percentual maior de gorjeta (mediana ficou 15.4% para fumantes e 15.6% para não fumantes).&lt;/p&gt;
&lt;p&gt;E o dia da semana junto com o dia? Faz diferença? Podemos agrupar com mais de uma coluna&lt;/p&gt;
&lt;p&gt;&lt;code&gt;tips_df.groupby([‘day’, ‘time’]).tip_percentage.describe()&lt;/code&gt;&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/df5.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;E gráficos? Fazer gráficos com o pandas é muito simples:&lt;/p&gt;
&lt;p&gt;&lt;code&gt;tips_df.plot.scatter(x=’total_bill’,y=’tip_percentage’)&lt;/code&gt;&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/sns1.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;Neste gráfico queremos ver se existe uma correlação entre o valor conta e o percentual de gorjeta concedido. Vemos que pelo contrario, uma leve correlação negativa: quanto maior o valor da conta menos será pago de gorjeta, percentualmente.&lt;/p&gt;
&lt;p&gt;Outra opção é usar a biblioteca de gráficos seaborn, que além de ser fácil de usar, os gráficos ficam bem bonitos&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;pre tabindex=&#34;0&#34; style=&#34;color:#8a8a8a;background-color:#1c1c1c;-moz-tab-size:4;-o-tab-size:4;tab-size:4;&#34;&gt;&lt;code class=&#34;language-python&#34; data-lang=&#34;python&#34;&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;&lt;span style=&#34;color:#d75f00&#34;&gt;import&lt;/span&gt; seaborn &lt;span style=&#34;color:#5f8700&#34;&gt;as&lt;/span&gt; sns
&lt;/span&gt;&lt;/span&gt;&lt;span style=&#34;display:flex;&#34;&gt;&lt;span&gt;sns.scatterplot(data=tips_df, x=’total_bill’,y=’tip_percentage’, hue=’smoker’)&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/div&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/sns2.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;h2 id=&#34;ler-e-gravar-os-dados&#34;&gt;Ler e gravar os dados&lt;/h2&gt;
&lt;p&gt;Para ler dados com pandas é super simples. Por exemplo, para ler um csv basta fazer (inclusive funciona se passar o link do csv):&lt;/p&gt;
&lt;p&gt;&lt;code&gt;df = pd.read_csv(&#39;arquivo.csv&#39;)&lt;/code&gt;&lt;/p&gt;
&lt;p&gt;É possível ler de arquivos excel com pd.read_excel, HDF5, SQL, inclusive Parquet — um formato muito usado em Big Data.
Para salvar o arquivo basta fazer df.to_csv(‘arquivo.csc’), e etc.&lt;/p&gt;
&lt;h2 id=&#34;dicas-legais&#34;&gt;Dicas legais&lt;/h2&gt;
&lt;p&gt;Raspagem web: o pandas consegue extrair tabelas de páginas web. Para isso, basta usar a função &lt;code&gt;pd.read_html(&amp;lt;link_da_pagina&amp;gt;)&lt;/code&gt;, assim como mágica o pandas lê a tabela como um dataframe.&lt;/p&gt;
&lt;p&gt;Pivot tables: se você está acostumado a fazer pivot tables como no excel, o pandas faz facilmente através da função &lt;code&gt;pd.pivot_table&lt;/code&gt;, conforme o exemplo abaixo:&lt;/p&gt;
&lt;p&gt;&lt;code&gt;pd.pivot_table(tips_df, index=’size’, columns=’smoker’, values=’tip_percentage’, aggfunc=’median’)&lt;/code&gt;&lt;/p&gt;
&lt;figure&gt;&lt;img src=&#34;https://caioau.net/blog/pandas/df6.png&#34; loading=&#34;lazy&#34;/&gt;
&lt;/figure&gt;

&lt;p&gt;Fizemos uma pivot table onde as linhas são quantas pessoas tem à mesa, as colunas significam se o cliente é fumante ou não, e os valores são a porcentagem da gorjeta agregada com mediana.&lt;/p&gt;
&lt;h2 id=&#34;conclusão&#34;&gt;Conclusão&lt;/h2&gt;
&lt;p&gt;Como vimos, o pandas é uma biblioteca muito fácil de usar e que faz mágica. Para aprender mais, existe o &lt;a href=&#34;https://pandas.pydata.org/pandas-docs/stable/user_guide/index.html&#34;&gt;guia de usuário&lt;/a&gt; com o passo-a-passo e a &lt;a href=&#34;https://pandas.pydata.org/pandas-docs/stable/reference/index.html&#34;&gt;documentação oficial&lt;/a&gt;. Outra referência legal e rapidinha são as dicas do Kevin Markham, ele montou uma lista com 100 dicas ótimas para usar pandas: &lt;a href=&#34;https://www.dataschool.io/python-pandas-tips-and-tricks/&#34;&gt;dataschool.io/python-pandas-tips-and-tricks/&lt;/a&gt;.&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Projeto novo: Divulgação cientifica no medium</title>
      <link>https://caioau.net/blog/computando-arte/</link><category>divulgacao-cientifica</category>
		  <category>medium</category>
		  <category>estatistica</category>
		  <category>computacao</category>
		  <category>matematica</category>
		  <category>ciencia-de-dados</category>
		  <category>computando-arte</category>
		  <category>rss</category>
		  
      <pubDate>Mon, 23 Nov 2020 14:00:00 -0300</pubDate>
      
      <guid>https://caioau.net/blog/computando-arte/</guid><description>&lt;h2 id=&#34;edits&#34;&gt;Edits&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;21Abr2021: Agora também estamos no &lt;a href=&#34;https://dev.to/&#34;&gt;dev.to&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;hr&gt;
&lt;p&gt;Juntei com uns amigos e formamos um grupo de divulgação cientifica de estatística, matemática, ciência de dados e computação no medium.&lt;/p&gt;
&lt;p&gt;A ideia é publicar um texto por semana.&lt;/p&gt;
&lt;p&gt;Confira aqui: &lt;a href=&#34;https://medium.com/computando-arte&#34;&gt;medium.com/computando-arte&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;e no dev.to: &lt;a href=&#34;https://dev.to/computandoarte&#34;&gt;dev.to/computandoarte&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;Assine o feed RSS: &lt;a href=&#34;https://medium.com/feed/computando-arte&#34;&gt;medium.com/feed/computando-arte&lt;/a&gt; e &lt;a href=&#34;https://dev.to/feed/computandoarte&#34;&gt;dev.to/feed/computandoarte&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;Mandem sugestões, dicas e feedback :)&lt;/p&gt;
</description>
    </item>
    
    <item>
      <title>Trabalho final: Curso aprimoramento mineração de dados complexos</title>
      <link>https://caioau.net/blog/tcc-mdc2020/</link><category>unicamp</category>
		  <category>curso</category>
		  <category>ciencia-de-dados</category>
		  
      <pubDate>Thu, 03 Sep 2020 18:52:53 -0300</pubDate>
      
      <guid>https://caioau.net/blog/tcc-mdc2020/</guid><description>&lt;p&gt;Estou disponibilizando trabalho final que fizemos no curso de mineração de dados complexos: &lt;a href=&#34;https://www.ic.unicamp.br/~mdc/&#34;&gt;pagina do curso&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;É o problema do kaggle: &lt;a href=&#34;https://www.kaggle.com/c/nyc-taxi-trip-duration&#34;&gt;New York City Taxi Trip Duration&lt;/a&gt;.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a href=&#34;https://www.youtube.com/watch?v=2PGkU5M2Mos&amp;amp;list=PLwNGlbMOyZP2d0NT_g2yyYHqXqFo7n0r6&amp;amp;index=7&amp;amp;t=0s&#34;&gt;Video da apresentação&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href=&#34;DataTroopers-RelatorioFinal-NYCtaxi.pdf&#34;&gt;Relatório final&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
</description>
    </item>
    
  </channel>
</rss>
