Sigmoidal
  • Home
  • MentoriaNOVO
  • Cursos
  • Blog
  • Sobre Mim
  • Contato
Sem Resultado
Ver Todos Resultados
  • English
  • Home
  • MentoriaNOVO
  • Cursos
  • Blog
  • Sobre Mim
  • Contato
Sem Resultado
Ver Todos Resultados
Sigmoidal
Sem Resultado
Ver Todos Resultados

Guia Básico de Pré-Processamento de Dados

Rafael Duarte por Rafael Duarte
abril 20, 2020
em Blog, Data Science, Machine Learning, Python, Teoria
0
63
COMPARTILHAMENTOS
2.1k
VIEWS
Publicar no LinkedInCompartilhar no FacebookCompartilhar no Whatsapp

Você sabe como fazer um pré-processamento de dados e tratar variáveis numéricas para melhorar a performance dos modelos de Machine Learning?

Ao estudar Ciência de Dados, aprendemos que os resultados de nossos modelos de Machine Learning são altamente influenciados pela quantidade e qualidade dos nossos dados. Isso significa que devemos cuidar muito bem dos nossos dados, tratando valores ausentes, outliers e outros passos do pré-processamento, para alimentar os modelos.

Guia Básico de Pré-Processamento de Dados em Data Science.

É por isso que neste artigo, destacaremos alguns pontos chave e ideias trazidas pelos instrutores do curso “How To Win A Data Science Competition”, disponível na plataforma Coursera .

Ao estudar este material, achei esse conteúdo muito interessante, pela forma em que foi abordado. Neste primeiro artigo, focaremos no pré-processamento de dados numéricos. Lidaremos com variáveis categóricas mais para frente.

Entenda o seu modelo

O primeiro passo de qualquer projeto de Data Science é entender e definir bem o problema, para que possamos buscar a melhor solução. Isso é extremamente importante, pois cada modelo trabalha de uma forma diferente, e é mais ou menos sensível a diferentes características dos dados.

Guia Básico de Pré-Processamento de Dados em Data Science.

Primeiro, precisamos saber se o modelo é baseado em Árvores de Decisão ou não. Árvore de Decisão não são tão sensíveis à escala dos dados e não apresentam melhoras significativas ao trabalharem com dados pré-processados.

Entretanto, quando falamos de modelos que não são baseados em Árvores de Decisão, como modelos Lineares, KNN, e Redes Neurais, fazer o pré-processamento dos dados pode trazer grandes melhorias nos resultados.

Mas que técnicas podemos aplicar? Vamos falar de algumas das mais utilizadas.

MinMaxScaler

MinMaxScaler do Sklearn é uma técnica de pré-processamento que coloca os dados na mesma escala. Em tradução livre da documentação:

Transforma as features ao deixá-las na mesma escala em um determinado range.

Este estimador escala e traduz cada feature individualmente de forma que esta estará em um determinado intervalo no conjunto de treino, por exemplo, entre zero e um.

Para visualizarmos melhor, imagine um conjunto de dados de imóveis em Los Angeles. Este conjunto teria dados de área dos imóveis, que variam de dezenas de metros quadrados para apartamentos pequenos até kilômetros quadrados nas grandes mansões.

Essa discrepância torna as coisas mais difíceis para o modelo, e colocar tudo na mesma escala (por exemplo, de 0 a 1) faz com que os modelos trabalhem com os dados de forma mais eficiente, melhorando os resultados.

É claro, transformaríamos o conjunto inteiro para rodar o algoritmo nos dados na mesma escala.

Standard Scaler

Standard Scaler, assim como MinMax, transforma os dados e os coloca na mesma escala. Entretanto, ele trabalha de forma um pouco diferente. Na documentação, eles explicam:

Padroniza as features removendo a média e escala a variância a uma unidade.

Isso significa que para cada feature, a média seria 0, e o Desvio Padrão seria 1. Desta forma, as features são padronizadas, tornando-as mais manejáveis para nossos modelos. Mais uma vez, modelos Não Baseados em Árvores de Decisão se beneficiam mais deste tipo de padronização.

Rank

O método Rank da biblioteca Scipy define espaços entre valores devidamente ordenados para que sejam iguais. Segundo a documentação:

O Rank associa categorias aos dados, lidando com nós apropriadamente.

Ranks começam em 1. O argumento method controla como os ranks serão assinalados a valores iguais.

Se você ainda não tiver lidado com outliers até o momento, Rank funciona melhor do que o MinMaxScaler , já que este coloca os outliers mais próximos aos outros objetos. Mais uma vez, essa abordagem funciona muito bem com modelos Lineares, KNN e Redes Neurais.

Melhores Práticas para Melhores Resultados

No curso, os instrutores do Higher School of Economics na Rússia também mencionam algumas boas práticas que podem ajudar nossos modelos ainda mais:

  • Treine o modelo em dataframes concatenados, produzidos por diferentes técnicas de pré-processamento. Por exemplo, use MinMaxScaler, depois Standard Scaler e então Rank para pré-processar pedaços separados do dataset. Depois, concatene os resultados e treine o seu modelo nesse dataframe.
  • Faça Ensemble de modelos treinados utilizando dados pré-processados por diferentes técnicas, para aproveitar os benefícios que cada técnica traz para os dados.

De forma geral, estas técnicas devem ajudar a melhorar a performance dos seus modelos, e render melhores resultados.

O objetivo desse artigo é apresentar uma revisão, ou um guia geral de onde começar ao fazer o pré-processamento dos dados. Para se aprofundar nesse tema, indico esse excelente artigo no Towards Data Science.

Compartilhar4Compartilhar25Enviar
Post Anterior

Método de Ensemble: vantagens da combinação de diferentes estimadores

Próximo Post

Qual o Cenário de Data Science no Brasil hoje?

Rafael Duarte

Rafael Duarte

Relacionado Artigos

Cientista de dados protegido por estudo, código, projetos e portfólio diante de uma onda de inteligência artificial.
Artigos

Como não ser substituído pela IA?

por Carlos Melo
setembro 4, 2026
Cena urbana do YOLO26 com um ônibus e quatro pedestres delimitados por caixas únicas, em transição da imagem real para a detecção end-to-end
Artigos

YOLO26: O Que Mudou na Detecção de Objetos

por Carlos Melo
agosto 25, 2026
Carlos Melo diante de dois drones em voo e da frase Ele Segue pelo Som
Aeroespacial

SonicFly: Rastreamento e Perseguição de Drones pelo Som

por Carlos Melo
agosto 21, 2026
DETR associando consultas do Transformer a pedestre, ciclista, carro, ônibus e semáforo em uma cena urbana
Deep Learning

DETR para Detecção de Objetos: Como Funciona

por Carlos Melo
agosto 20, 2026
Carlos Melo ao lado de uma representação de um segundo cérebro conectado ao Claude e ao Obsidian
IA Generativa

Segundo Cérebro com Claude Code e Obsidian

por Carlos Melo
agosto 19, 2026
Próximo Post
Qual o Cenário de Data Science no Brasil hoje?

Qual o Cenário de Data Science no Brasil hoje?

Deixe um comentário Cancelar resposta

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Últimos dias para o Curso de Inteligência Artificial para Drones Últimos dias para o Curso de Inteligência Artificial para Drones Últimos dias para o Curso de Inteligência Artificial para Drones

Mais Populares

  • Cientista de Dados: Salário em 2026 (Júnior, Pleno e Sênior)

    106 compartilhamentos
    Compartilhar 42 Tweet 27
  • Como não ser substituído pela IA?

    7 compartilhamentos
    Compartilhar 3 Tweet 2
  • Geometria da Formação de Imagens: Matrizes, Transformações e Sistemas de Coordenadas

    449 compartilhamentos
    Compartilhar 180 Tweet 112
  • O Que é Amostragem e Quantização no Processamento de Imagens

    73 compartilhamentos
    Compartilhar 29 Tweet 18
  • ORB-SLAM 3: Tutorial Completo para Mapeamento 3D e Localização em Tempo Real

    487 compartilhamentos
    Compartilhar 195 Tweet 122
  • Em Alta
  • Comentários
  • Mais Recente
Como Tratar Dados Ausentes com Pandas

Como Tratar Dados Ausentes com Pandas

agosto 13, 2019
Introdução ao MediaPipe e Pose Estimation

Introdução ao MediaPipe e Pose Estimation

julho 15, 2023
Como usar o DALL-E 2 para gerar imagens a partir de textos

Como usar o DALL-E 2 para gerar imagens a partir de textos

dezembro 25, 2022

ORB-SLAM 3: Tutorial Completo para Mapeamento 3D e Localização em Tempo Real

abril 10, 2023
Como Analisar Ações da Bolsa com Python

Como Analisar Ações da Bolsa com Python

15
Setembro Amarelo: Análise do Suicídio no Brasil, com Data Science

Setembro Amarelo: Análise do Suicídio no Brasil, com Data Science

13
Como Aprender Data Science?

Como Aprender Data Science?

9
Qual o Cenário de Data Science no Brasil hoje?

Qual o Cenário de Data Science no Brasil hoje?

8
Cientista de dados protegido por estudo, código, projetos e portfólio diante de uma onda de inteligência artificial.

Como não ser substituído pela IA?

setembro 4, 2026
Cena urbana do YOLO26 com um ônibus e quatro pedestres delimitados por caixas únicas, em transição da imagem real para a detecção end-to-end

YOLO26: O Que Mudou na Detecção de Objetos

agosto 25, 2026
Carlos Melo diante de dois drones em voo e da frase Ele Segue pelo Som

SonicFly: Rastreamento e Perseguição de Drones pelo Som

agosto 21, 2026
DETR associando consultas do Transformer a pedestre, ciclista, carro, ônibus e semáforo em uma cena urbana

DETR para Detecção de Objetos: Como Funciona

agosto 20, 2026
Instagram Youtube LinkedIn Twitter
Sigmoidal

O melhor conteúdo técnico de Data Science, com projetos práticos e exemplos do mundo real.

Seguir no Instagram

Categorias

  • Aeroespacial
  • Artigos
  • Blog
  • Carreira
  • Cursos
  • Data Science
  • Deep Learning
  • Destaques
  • Entrevistas
  • IA Generativa
  • Livros
  • Machine Learning
  • Notícias
  • Python
  • Sinais Biomédicos
  • Teoria
  • Tutoriais
  • Visão Computacional
  • Youtube

Navegar por Tags

algebra-linear camera calibration carreira chatgpt cientista de dados cnn computer vision Cursos dados desbalanceados data science data science na prática decision tree deep learning deploy detecção de objetos IA generativa inteligência artificial jupyter kaggle keras livros machine learning matplotlib object detection openai opencv pandas portfólio profissão python pytorch random forest reconstrução 3d redes neurais redes neurais convolucionais regressão linear regressão logística scikit-learn sklearn tensorflow tutorial visão computacional vídeo youtube árvore de decisão

© 2024 Sigmoidal - Aprenda Data Science, Visão Computacional e Python na prática.

Welcome Back!

Login to your account below

Forgotten Password?

Retrieve your password

Please enter your username or email address to reset your password.

Log In

Add New Playlist

Sem Resultado
Ver Todos Resultados
  • Home
  • Mentoria
  • Cursos
  • Blog
  • Sobre Mim
  • Contato
  • English

© 2024 Sigmoidal - Aprenda Data Science, Visão Computacional e Python na prática.