{"repo":"jmcurbelo/pyspark-ingenieria-de-datos","free":true,"listed":false,"github":"https://github.com/jmcurbelo/pyspark-ingenieria-de-datos","clone":"git clone https://github.com/jmcurbelo/pyspark-ingenieria-de-datos.git","description":"Este repositorio contiene el material del curso de Udemy Big Data y Spark: ingeniería de datos con Python y pyspark. En este curso, aprenderás a utilizar las herramientas y técnicas necesarias para trabajar con grandes conjuntos de datos utilizando la librería pyspark.","language":"Python","stars":48,"topics":["apache-spark","pyspark","python"],"license":null,"category":"databases-storage","readme_excerpt":"Big Data y Spark: Ingeniería de datos con Python y PySpark --- Sobre este repositorio Bienvenido al repositorio oficial del curso Big Data y Spark: Ingeniería de datos con Python y PySpark . Este repositorio contiene todo el material práctico, scripts ( .py ) necesarios para dominar el procesamiento de grandes volúmenes de datos. Aprenderás a utilizar las herramientas y técnicas esenciales para manipular Big Data utilizando la librería PySpark , el estándar de la industria para trabajar con Apache Spark. ¿Qué vas a lograr? Desde la configuración del entorno hasta el uso avanzado de Spark SQL, este material está diseñado para convertirte en un Ingeniero de Datos capaz de procesar información a escala. 👉 Inscríbete al curso completo aquí --- Estructura del contenido El repositorio está organizado en carpetas que corresponden fielmente a las secciones del curso en video. Dentro de cada carpeta encontrarás los archivos .py numerados por lectura (ej: Lectura 60.py , Lectura 61.py ) para que sea muy fácil seguir el hilo. 📂 Sección 2: Configuración del entorno (Spark en Google Colaboratory). 📂 Sección 3: Introducción a los RDD (Resilient Distributed Datasets). 📂 Sección 4: Transformaciones en un RDD. 📂 Sección 5: Acciones sobre un RDD. 📂 Sección 6: Aspectos avanzados sobre RDD. 📂 Sección 7: Introducción a Spark SQL (DataFrames). 📂 Sección 8: Spark SQL Avanzado. 📂 Sección 9: Funciones y operaciones complejas en Spark SQL. --- Requisitos y Entorno Este curso está diseñado par","default_branch":null,"files":null,"tree":[],"storefront":"/r/jmcurbelo","claimed":false,"request_supported":{"post":"https://gitbuyer.com/r/jmcurbelo/pyspark-ingenieria-de-datos/request-supported","requests":0},"note":"indexed from public GitHub; nothing is for sale on this page. Clone it from GitHub. Paid listings live at /search."}