#Instalando o Java no Colab !apt-get install openjdk-8-jdk-headless -qq > /dev/null #Realiza o download do Spark no Google Colab !wget -q https://dlcdn.apache.org/spark/spark-3.2.1/spark-3.2.1-bin-hadoop2.7.tgz #Descompacta o Spark que foi baixado na etapa anterior !tar -xf /content/spark-3.2.1-bin-hadoop2.7.tgz #Instala o pacote Python que acha o Spark !pip install findspark #Configura o Colab para utilizar a nossa instalação do Spark import os import findspark os.environ['JAVA_HOME'] = '/usr/lib/jvm/java-8-openjdk-amd64' os.environ['SPARK_HOME'] = '/content/spark-3.2.1-bin-hadoop2.7' findspark.init('spark-3.2.1-bin-hadoop2.7') #Cria um SparkSession from pyspark.sql import SparkSession spark = SparkSession.builder.master('local[*]').getOrCreate()