Sigmoidal
  • Home
  • MentoriaNOVO
  • Cursos
  • Blog
  • Sobre Mim
  • Contato
Sem Resultado
Ver Todos Resultados
  • English
  • Home
  • MentoriaNOVO
  • Cursos
  • Blog
  • Sobre Mim
  • Contato
Sem Resultado
Ver Todos Resultados
Sigmoidal
Sem Resultado
Ver Todos Resultados

Big Data: Como instalar o PySpark no Google Colab

Carlos Melo por Carlos Melo
dezembro 11, 2019
em Blog, Data Science, Machine Learning, Python, Tutoriais
3
44
COMPARTILHAMENTOS
1.5k
VIEWS
Publicar no LinkedInCompartilhar no FacebookCompartilhar no Whatsapp

Como instalar o PySpark no Google Colab é uma dúvida comum entre aqueles que estão iniciando seus projetos de Data Science para ambientes na nuvem.

O termo Big Data está cada vez mais presente, e mesmo projetos pessoais podem assumir uma grande dimensionalidade devido à quantidade de dados disponíveis.

Como Instalar o PySpark no Google Colab - Python

Para analisar grandes volumes de dados, Big Data, com velocidade, o Apache Spark é uma ferramenta muito utilizada, dada a sua capacidade de processamento de dados e computação paralela.

O Spark foi pensado para ser acessível, oferecendo diversas APIs e frameworks em Python, Scala, SQL e diversas outras linguagens.

PySpark no Google Colab

PySpark é a interface alto nível que permite você conseguir acessar e usar o Spark por meio da linguagem Python. Usando o PySpark, você consegue escrever todo o seu código usando apenas o nosso estilo Python de escrever código.

Já o Google Colab é uma ferramenta incrível, poderosa e gratuita – com suporte de GPU inclusive. Uma vez que roda 100% na nuvem, você não tem a necessidade de instalar qualquer coisa na sua própria máquina.

Como Instalar o PySpark no Google Colab - Python

No entanto, apesar da maioria das bibliotecas de Data Science estarem previamente instaladas no Colab, o mesmo não acontece com o PySpark. Para conseguir usar o PySpark é necessário alguns passos intermediários, que não são triviais para aqueles que estão começando.

Dessa maneira, preparei um tutorial simples e direto ensinando a instalar as dependências e a biblioteca.

Instalando o PySpark no Google Colab

Instalar o PySpark não é um processo direto como de praxe em Python. Não basta usar um pip install apenas. Na verdade, antes de tudo é necessário instalar dependências como o Java 8, Apache Spark 2.3.2 junto com o Hadoop 2.7.

# instalar as dependências
!apt-get install openjdk-8-jdk-headless -qq > /dev/null
!wget -q https://archive.apache.org/dist/spark/spark-2.4.4/spark-2.4.4-bin-hadoop2.7.tgz
!tar xf spark-2.4.4-bin-hadoop2.7.tgz
!pip install -q findspark

A próxima etapa é configurar as variáveis de ambiente, pois isso habilita o ambiente do Colab a identificar corretamente onde as dependências estão rodando.

Para conseguir “manipular” o terminal e interagir como ele, você pode usar a biblioteca os.

# configurar as variáveis de ambiente
import os
os.environ["JAVA_HOME"] = "/usr/lib/jvm/java-8-openjdk-amd64"
os.environ["SPARK_HOME"] = "/content/spark-2.4.4-bin-hadoop2.7"
# tornar o pyspark "importável"
import findspark
findspark.init('spark-2.4.4-bin-hadoop2.7')

Com tudo pronto, vamos rodar uma sessão local para testar se a instalação funcionou corretamente.

# iniciar uma sessão local e importar dados do Airbnb
from pyspark.sql import SparkSession
sc = SparkSession.builder.master('local[*]').getOrCreate()
# download do http para arquivo local
!wget --quiet --show-progress http://data.insideairbnb.com/brazil/rj/rio-de-janeiro/2019-07-15/visualisations/listings.csv
# carregar dados do Airbnb
df_spark = sc.read.csv("./listings.csv", inferSchema=True, header=True)
# ver algumas informações sobre os tipos de dados de cada coluna
df_spark.printSchema()

Como resultado, você deve ver algo parecido com a imagem abaixo, o que significa que os nossos dados estão rodando corretamente junto ao PySpark.

Para ver o código-fonte completo desse exemplo, clique neste link.

Big Data e Python

A biblioteca PySpark permite você criar seu servidor Apache Spark, trabalhar com grandes volumes de dados e até mesmo fazer streaming em tempo real.

Como Instalar o PySpark no Google Colab - Python

Na minha opinião, o Spark é o melhor framework para trabalhar com Big Data. Tenha certeza que o PySpark vai te ajudar muito ao criar uma interface Python que permita a comunicação entre seu projeto e o servidor.

Neste artigo, o meu objetivo foi unicamente apresentar a biblioteca, além de ensinar como você pode instalá-la em um ambiente de nuvem gratuito, o Google Colab. Aproveite e comece a usar hoje mesmo 🙂

Compartilhar3Compartilhar18Enviar
Post Anterior

5 motivos para você aprender Python

Próximo Post

NLP para analisar Rony Meisler, CEO da Reserva

Carlos Melo

Carlos Melo

Engenheiro de Visão Computacional graduado em Ciências Aeronáuticas pela Academia da Força Aérea (AFA) e Mestre em Engenharia Aeroespacial pelo Instituto Tecnológico de Aeronáutica (ITA).

Relacionado Artigos

Cientista de dados protegido por estudo, código, projetos e portfólio diante de uma onda de inteligência artificial.
Artigos

Como não ser substituído pela IA?

por Carlos Melo
setembro 4, 2026
Cena urbana do YOLO26 com um ônibus e quatro pedestres delimitados por caixas únicas, em transição da imagem real para a detecção end-to-end
Artigos

YOLO26: O Que Mudou na Detecção de Objetos

por Carlos Melo
agosto 25, 2026
Carlos Melo diante de dois drones em voo e da frase Ele Segue pelo Som
Aeroespacial

SonicFly: Rastreamento e Perseguição de Drones pelo Som

por Carlos Melo
agosto 21, 2026
DETR associando consultas do Transformer a pedestre, ciclista, carro, ônibus e semáforo em uma cena urbana
Deep Learning

DETR para Detecção de Objetos: Como Funciona

por Carlos Melo
agosto 20, 2026
Carlos Melo ao lado de uma representação de um segundo cérebro conectado ao Claude e ao Obsidian
IA Generativa

Segundo Cérebro com Claude Code e Obsidian

por Carlos Melo
agosto 19, 2026
Próximo Post
NLP para analisar Rony Meisler, CEO da Reserva

NLP para analisar Rony Meisler, CEO da Reserva

Comentários 3

  1. Daniel Santos Pereira says:
    6 anos atrás

    Carlos, muito obrigado!
    Estava apanhando de mais até achar este artigo.

    Responder
    • Carlos Melo Carlos Melo says:
      3 anos atrás

      Muito obrigado pelo comentário! Um forte abraço para você.

      Responder
  2. kassem hussein says:
    6 anos atrás

    Não consegui reproduzir o codigo, para o primeiro chunk recebo o seguinte erro:
    tar: spark-2.4.5-bin-hadoop3.2.tgz: Cannot open: No such file or directory
    tar: Error is not recoverable: exiting now

    Responder

Deixe um comentário Cancelar resposta

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Últimos dias para o Curso de Inteligência Artificial para Drones Últimos dias para o Curso de Inteligência Artificial para Drones Últimos dias para o Curso de Inteligência Artificial para Drones

Mais Populares

  • Cientista de Dados: Salário em 2026 (Júnior, Pleno e Sênior)

    106 compartilhamentos
    Compartilhar 42 Tweet 27
  • Como não ser substituído pela IA?

    6 compartilhamentos
    Compartilhar 2 Tweet 2
  • Geometria da Formação de Imagens: Matrizes, Transformações e Sistemas de Coordenadas

    449 compartilhamentos
    Compartilhar 180 Tweet 112
  • O Que é Amostragem e Quantização no Processamento de Imagens

    73 compartilhamentos
    Compartilhar 29 Tweet 18
  • ORB-SLAM 3: Tutorial Completo para Mapeamento 3D e Localização em Tempo Real

    487 compartilhamentos
    Compartilhar 195 Tweet 122
  • Em Alta
  • Comentários
  • Mais Recente
Como Tratar Dados Ausentes com Pandas

Como Tratar Dados Ausentes com Pandas

agosto 13, 2019
Introdução ao MediaPipe e Pose Estimation

Introdução ao MediaPipe e Pose Estimation

julho 15, 2023
Como usar o DALL-E 2 para gerar imagens a partir de textos

Como usar o DALL-E 2 para gerar imagens a partir de textos

dezembro 25, 2022

ORB-SLAM 3: Tutorial Completo para Mapeamento 3D e Localização em Tempo Real

abril 10, 2023
Como Analisar Ações da Bolsa com Python

Como Analisar Ações da Bolsa com Python

15
Setembro Amarelo: Análise do Suicídio no Brasil, com Data Science

Setembro Amarelo: Análise do Suicídio no Brasil, com Data Science

13
Como Aprender Data Science?

Como Aprender Data Science?

9
Qual o Cenário de Data Science no Brasil hoje?

Qual o Cenário de Data Science no Brasil hoje?

8
Cientista de dados protegido por estudo, código, projetos e portfólio diante de uma onda de inteligência artificial.

Como não ser substituído pela IA?

setembro 4, 2026
Cena urbana do YOLO26 com um ônibus e quatro pedestres delimitados por caixas únicas, em transição da imagem real para a detecção end-to-end

YOLO26: O Que Mudou na Detecção de Objetos

agosto 25, 2026
Carlos Melo diante de dois drones em voo e da frase Ele Segue pelo Som

SonicFly: Rastreamento e Perseguição de Drones pelo Som

agosto 21, 2026
DETR associando consultas do Transformer a pedestre, ciclista, carro, ônibus e semáforo em uma cena urbana

DETR para Detecção de Objetos: Como Funciona

agosto 20, 2026
Instagram Youtube LinkedIn Twitter
Sigmoidal

O melhor conteúdo técnico de Data Science, com projetos práticos e exemplos do mundo real.

Seguir no Instagram

Categorias

  • Aeroespacial
  • Artigos
  • Blog
  • Carreira
  • Cursos
  • Data Science
  • Deep Learning
  • Destaques
  • Entrevistas
  • IA Generativa
  • Livros
  • Machine Learning
  • Notícias
  • Python
  • Sinais Biomédicos
  • Teoria
  • Tutoriais
  • Visão Computacional
  • Youtube

Navegar por Tags

algebra-linear camera calibration carreira chatgpt cientista de dados cnn computer vision Cursos dados desbalanceados data science data science na prática decision tree deep learning deploy detecção de objetos IA generativa inteligência artificial jupyter kaggle keras livros machine learning matplotlib object detection openai opencv pandas portfólio profissão python pytorch random forest reconstrução 3d redes neurais redes neurais convolucionais regressão linear regressão logística scikit-learn sklearn tensorflow tutorial visão computacional vídeo youtube árvore de decisão

© 2024 Sigmoidal - Aprenda Data Science, Visão Computacional e Python na prática.

Welcome Back!

Login to your account below

Forgotten Password?

Retrieve your password

Please enter your username or email address to reset your password.

Log In

Add New Playlist

Sem Resultado
Ver Todos Resultados
  • Home
  • Mentoria
  • Cursos
  • Blog
  • Sobre Mim
  • Contato
  • English

© 2024 Sigmoidal - Aprenda Data Science, Visão Computacional e Python na prática.