Descripción del Curso

El volumen masivo de datos generados en la actualidad exige el uso de arquitecturas distribuidas (escalamiento horizontal) para realizar procesamiento analítico eficiente. Para coordinar el trabajo en múltiples clústeres de cómputo, Apache Spark se ha consolidado como el estándar de la industria, utilizable desde R a través del paquete sparklyr.

En este curso aprenderás los fundamentos de la computación distribuida aplicada al Big Data. Descubrirás cómo conectar R con Apache Spark para llevar a cabo desde la lectura, limpieza y visualización de grandes volúmenes de datos, hasta el modelamiento de Machine Learning supervisado y no supervisado en paralelo.

Contenido del Curso

  • 1. Introducción y Conexión a Spark con R
    • Ecosistema Big Data: Spark, R, Tidyverse y Sparklyr
    • Prerrequisitos, configuración y establecimiento de conexiones
    • Lectura, manipulación y escritura de datos masivos
  • 2. Procesamiento, Visualización y Feature Engineering
    • Procesamiento distribuido y visualización de datos
    • Análisis exploratorio de datos a gran escala
    • Ingeniería de variables y construcción de Pipelines
  • 3. Machine Learning Distribuido con MLlib
    • Análisis supervisado con la librería MLlib de Spark
    • Análisis no supervisado con MLlib
    • Optimización de hiperparámetros y planes de validación cruzada
    • Extensiones avanzadas de Sparklyr

Capacitador

HP

Hugo Porras, MSc.

Ingeniero en Ciencias Económicas y Financieras de la Escuela Politécnica Nacional y Máster en Inteligencia Artificial por la Universidad Internacional de la Rioja (UNIR). Científico de Datos Senior en Banco Pichincha con amplia experiencia en proyectos de investigación y analítica avanzada. Consultor independiente especializado en finanzas, economía geográfica e IA.