{"id":413,"date":"2026-09-05T21:37:12","date_gmt":"2026-09-06T00:37:12","guid":{"rendered":"https:\/\/www.linuxpro.com.br\/2026\/09\/deep-learning-para-iniciantes\/"},"modified":"2026-09-08T05:33:02","modified_gmt":"2026-09-08T08:33:02","slug":"deep-learning-para-iniciantes","status":"publish","type":"post","link":"https:\/\/www.linuxpro.com.br\/es\/2026\/09\/deep-learning-para-iniciantes\/","title":{"rendered":"Deep Learning para iniciantes"},"content":{"rendered":"<p><img loading=\"lazy\" decoding=\"async\" alt=\"Mascote do LinuxPro desenhando rede neural no quadro de deep learning\" src=\"\/wp-content\/uploads\/2026\/09\/deep-learning-v3.webp\" width=\"1052\" height=\"652\" \/><\/p>\n<p>O <a href=\"https:\/\/www.youtube.com\/watch?v=VyWAvY2CF9c\">Deep Learning Crash Course for Beginners<\/a> do <strong>Jason Dsouza<\/strong> no <strong>freeCodeCamp<\/strong> \u00e9 o mapa do territ\u00f3rio: o que \u00e9 DL, como a rede aprende, o vocabul\u00e1rio (loss, Adam, epoch) e as tr\u00eas fam\u00edlias de arquitetura. Este texto compacta o curso. A conta por baixo \u2014 MatMul, GPU \u2014 est\u00e1 no <a href=\"\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs TPU<\/a>; o neur\u00f4nio em si, no <a href=\"\/2026\/09\/o-que-e-uma-rede-neural\/\">O que \u00e9 uma rede neural?<\/a> (3Blue1Brown).<\/p>\n<p><!-- more --><\/p>\n<div style=\"position:relative;padding-bottom:56.25%;height:0;overflow:hidden;margin:1.5em 0\">\n<iframe src=\"https:\/\/www.youtube.com\/embed\/VyWAvY2CF9c\" title=\"Deep Learning Crash Course for Beginners \u2014 Jason Dsouza \/ freeCodeCamp\" allow=\"accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share\" allowfullscreen style=\"position:absolute;top:0;left:0;width:100%;height:100%;border:0\"><\/iframe>\n<\/div>\n<h2>IA, ML, Deep Learning<\/h2>\n<pre><code class=\"language-text\">IA\n \u2514\u2500 Machine Learning      (aprende com dados, n\u00e3o com if\/else)\n     \u2514\u2500 Deep Learning     (rede neural com v\u00e1rias camadas ocultas)\n<\/code><\/pre>\n<p>ML cl\u00e1ssico pede que <em>voc\u00ea<\/em> escolha as features. DL aprende a representa\u00e7\u00e3o direto do dado cru (end-to-end). \u00c9 o motor de AlphaGo, vis\u00e3o veicular, diagn\u00f3stico e LLM \u2014 o mesmo stack que voc\u00ea roda no Linux com o <a href=\"\/2026\/09\/rodando-ia-local-no-linux-com-ollama\/\">Ollama<\/a>.<\/p>\n<h2>O ciclo: frente, erro, volta<\/h2>\n<ol>\n<li><strong>Forward:<\/strong> entrada \u2192 camadas ocultas (peso <code>w<\/code>, vi\u00e9s <code>b<\/code>, ativa\u00e7\u00e3o) \u2192 palpite na sa\u00edda. No come\u00e7o os pesos s\u00e3o aleat\u00f3rios; o palpite \u00e9 lixo.<\/li>\n<li><strong>Loss:<\/strong> um n\u00famero que mede o qu\u00e3o errado foi. Quanto maior, pior.<\/li>\n<li><strong>Backprop + gradient descent:<\/strong> o erro volta. A regra da cadeia diz quanto cada peso contribuiu. O otimizador anda na dire\u00e7\u00e3o <em>oposta<\/em> ao gradiente e o erro cai na pr\u00f3xima rodada.<\/li>\n<\/ol>\n<h2>Vocabul\u00e1rio que aparece no treino<\/h2>\n<p><strong>Ativa\u00e7\u00e3o<\/strong> \u2014 sem n\u00e3o-linearidade, N camadas lineares = 1 camada. Por isso existe \u03c3.<\/p>\n<table>\n<thead>\n<tr>\n<th>Fun\u00e7\u00e3o<\/th>\n<th>Sa\u00edda<\/th>\n<th>Uso<\/th>\n<\/tr>\n<\/thead>\n<tbody>\n<tr>\n<td>Sigm\u00f3ide<\/td>\n<td>(0, 1)<\/td>\n<td>Sa\u00edda bin\u00e1ria; satura no meio da rede<\/td>\n<\/tr>\n<tr>\n<td>Tanh<\/td>\n<td>(\u22121, 1)<\/td>\n<td>Centra em zero; melhor que \u03c3 no meio, cl\u00e1ssico<\/td>\n<\/tr>\n<tr>\n<td><strong>ReLU<\/strong> <code>max(0, x)<\/code><\/td>\n<td>[0, +\u221e)<\/td>\n<td>Padr\u00e3o nas ocultas<\/td>\n<\/tr>\n<tr>\n<td>Leaky ReLU<\/td>\n<td>\u211d<\/td>\n<td>Evita neur\u00f4nio morto (gradiente pequeno em x&lt;0)<\/td>\n<\/tr>\n<tr>\n<td>Softmax<\/td>\n<td>probabilidades somam 1<\/td>\n<td>Sa\u00edda multiclasse<\/td>\n<\/tr>\n<\/tbody>\n<\/table>\n<p><strong>Loss:<\/strong> regress\u00e3o \u2192 MSE (pune erro grande) ou MAE (mais robusto a outlier). Classifica\u00e7\u00e3o \u2192 binary \/ categorical cross-entropy.<\/p>\n<p><strong>Otimizador:<\/strong> learning rate alta demais oscila; baixa demais n\u00e3o chega. SGD usa mini-lote; Momentum amortece; RMSprop\/Adagrad adaptam por par\u00e2metro; <strong>Adam<\/strong> (momentum + RMSprop) \u00e9 o default da ind\u00fastria.<\/p>\n<p><strong>Par\u00e2metro<\/strong> a rede ajusta sozinha (peso, vi\u00e9s). <strong>Hiperpar\u00e2metro<\/strong> voc\u00ea escolhe: lr, batch, \u00e9pocas, arquitetura.<\/p>\n<p>1 \u00e9poca = 1 passagem no dataset. Batch size = quantos exemplos antes de atualizar. 1.000 amostras \/ batch 100 = 10 itera\u00e7\u00f5es por \u00e9poca.<\/p>\n<h2>Tr\u00eas jeitos de aprender \u2014 e o overfitting<\/h2>\n<ul>\n<li><strong>Supervisionado:<\/strong> par (x, y). Imagem com r\u00f3tulo, pre\u00e7o com valor.<\/li>\n<li><strong>N\u00e3o-supervisionado:<\/strong> sem r\u00f3tulo. Cluster, autoencoder, PCA.<\/li>\n<li><strong>Refor\u00e7o:<\/strong> agente, ambiente, recompensa. AlphaGo, rob\u00f4.<\/li>\n<\/ul>\n<p>Underfit: modelo simples demais, erra at\u00e9 no treino. Overfit: memorizou o treino, quebra no teste.<\/p>\n<p>Regulariza\u00e7\u00e3o que funciona: <strong>Dropout<\/strong> (desliga neur\u00f4nios no treino), L1\/L2 nos pesos, data augmentation (gira, corta, espelha), early stopping (para quando a loss de valida\u00e7\u00e3o sobe).<\/p>\n<h2>Tr\u00eas arquiteturas<\/h2>\n<ul>\n<li><strong>MLP \/ densa:<\/strong> camada a camada, sem mem\u00f3ria. Tabela, regress\u00e3o cl\u00e1ssica.<\/li>\n<li><strong>RNN \/ LSTM \/ GRU:<\/strong> loop, estado interno. S\u00e9rie temporal, texto, log de servidor. LSTM\/GRU t\u00eam port\u00f5es para o gradiente n\u00e3o sumir em sequ\u00eancia longa.<\/li>\n<li><strong>CNN:<\/strong> kernel desliza na imagem, mapa de features + pooling. Vis\u00e3o. (Transformer comeu parte do texto; CNN ainda manda em vis\u00e3o cl\u00e1ssica.)<\/li>\n<\/ul>\n<h2>Os 5 passos de qualquer projeto<\/h2>\n<ol>\n<li><strong>Dados.<\/strong> Garbage in, garbage out. Classe desbalanceada engana acur\u00e1cia.<\/li>\n<li><strong>Pr\u00e9-processo.<\/strong> Nulo, escala [0,1] ou z-score, split treino \/ valida\u00e7\u00e3o \/ teste (~80 \/ 10 \/ 10).<\/li>\n<li><strong>Treino.<\/strong> Forward, loss, backprop, \u00e9pocas.<\/li>\n<li><strong>Avalia\u00e7\u00e3o.<\/strong> Al\u00e9m de acur\u00e1cia: precis\u00e3o, recall, F1, matriz de confus\u00e3o \u2014 obrigat\u00f3rio se a classe rara importa.<\/li>\n<li><strong>Ajuste.<\/strong> Grid\/random search no hiperpar\u00e2metro, dropout, lr, mais camada se precisar.<\/li>\n<\/ol>\n<h2>Refer\u00eancias<\/h2>\n<ul>\n<li>Curso: <a href=\"https:\/\/www.youtube.com\/watch?v=VyWAvY2CF9c\">Jason Dsouza \u2014 Deep Learning Crash Course for Beginners<\/a> (freeCodeCamp)<\/li>\n<li><a href=\"\/2026\/09\/o-que-e-uma-rede-neural\/\">O que \u00e9 uma rede neural?<\/a> (3Blue1Brown, MNIST)<\/li>\n<li><a href=\"\/2026\/09\/gpu-vs-tpu-como-funcionam-chips-ia\/\">GPU vs TPU<\/a><\/li>\n<li><a href=\"\/2026\/09\/rodando-ia-local-no-linux-com-ollama\/\">Ollama no Linux<\/a><\/li>\n<\/ul>\n<p>Peso, loss, Adam, ReLU, split. Com isso o crash course cabe na cabe\u00e7a \u2014 o resto \u00e9 treinar e olhar o gr\u00e1fico da valida\u00e7\u00e3o.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>O Deep Learning Crash Course for Beginners do Jason Dsouza no freeCodeCamp \u00e9 o mapa do territ\u00f3rio: o que \u00e9 DL, como a rede aprende, o vocabul\u00e1rio (loss, Adam, epoch) e as tr\u00eas fam\u00edlias de arquitetura. Este texto compacta o curso. A conta por baixo \u2014 MatMul, GPU \u2014 est\u00e1 no GPU vs TPU; o &#8230; <a title=\"Deep Learning para iniciantes\" class=\"read-more\" href=\"https:\/\/www.linuxpro.com.br\/es\/2026\/09\/deep-learning-para-iniciantes\/\" aria-label=\"Read more about Deep Learning para iniciantes\">Read more<\/a><\/p>","protected":false},"author":0,"featured_media":0,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[13,115,2],"tags":[161,166,116,160],"class_list":["post-413","post","type-post","status-publish","format-standard","hentry","category-cursos","category-ia","category-linux","tag-deep-learning","tag-freecodecamp","tag-ia","tag-redes-neurais"],"_links":{"self":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts\/413","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/types\/post"}],"replies":[{"embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/comments?post=413"}],"version-history":[{"count":2,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts\/413\/revisions"}],"predecessor-version":[{"id":1141,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/posts\/413\/revisions\/1141"}],"wp:attachment":[{"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/media?parent=413"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/categories?post=413"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.linuxpro.com.br\/es\/wp-json\/wp\/v2\/tags?post=413"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}