Curso Big Data Principiante

Apache Hadoop Avanzado

Curso avanzado y práctico para diseñar, desplegar, administrar y optimizar clústeres Hadoop, trabajando con almacenamiento distribuido, procesamiento de datos, gestión de recursos, seguridad, monitoreo y resolución de problemas en escenarios Big Data reales.

Duración
20 horas · 4 semanas
Docente
Ing. David Cantorín
Comunidad
50+ estudiantes
Fecha de inicio
Inmediato
  • Acceso aula virtual
  • Grabación
  • Material
Apache Hadoop Avanzado
S/ 700
Inversión por programa
Material del programa

Brochure del programa

Estamos preparando el brochure oficial de este programa.

Brochure pronto disponible
Resumen del programa

Sobre el programa

Este curso proporciona una formación integral y avanzada en Apache Hadoop y arquitecturas Big Data distribuidas. El participante comprenderá la arquitectura interna de Hadoop y aprenderá a implementar y operar clústeres mediante HDFS y YARN, integrar herramientas del ecosistema, optimizar almacenamiento y procesamiento, gestionar recursos, implementar controles de seguridad y diagnosticar problemas de infraestructura.

El enfoque combina fundamentos arquitectónicos con laboratorios orientados a situaciones reales de Data Engineering y administración de plataformas Big Data, preparando al participante para diseñar soluciones escalables y operar entornos Hadoop empresariales.

Duración 20 horas · 4 semanas
Nivel Principiante
Categoría Curso
Tema Big Data

Aprendizaje práctico

Proyectos reales, laboratorios y casos de uso desde las primeras sesiones.

Equipo docente

Ing. David Cantorín

Horarios flexibles

Rutas on demand y sesiones en vivo adaptadas a tu ritmo profesional.

Impulso profesional

Certificación, bolsa de trabajo y acompañamiento para tu siguiente rol.

Equipo docente

Conoce a quienes imparten este programa.

Ing. David Cantorín

Data Architect

Temario

Plan de estudios

10 módulos · Abre cada bloque para ver los temas

  1. Arquitectura Hadoop y fundamentos de sistemas distribuidos.
  2. Componentes del ecosistema: Hadoop Common, HDFS, YARN y MapReduce.
  3. Arquitectura Master/Worker y comunicación entre nodos.
  4. Diseño y dimensionamiento de arquitecturas Big Data empresariales.

  1. Preparación de servidores Linux, Java, SSH y variables de entorno.
  2. Instalación y configuración distribuida de Apache Hadoop.
  3. Configuración de HDFS, YARN y MapReduce mediante archivos XML.
  4. Despliegue, inicialización y validación de un clúster multinodo.

  1. Arquitectura HDFS: NameNode, DataNodes, bloques y replicación.
  2. Metadata, FsImage, EditLog, heartbeats y lectura/escritura distribuida.
  3. Capacidad, cuotas, ACL, snapshots y balanceo del clúster.
  4. Recuperación ante fallos y diagnóstico de bloques.

  1. Arquitectura YARN: ResourceManager, NodeManager y ApplicationMaster.
  2. Containers, memoria, vCores y ciclo de vida de aplicaciones.
  3. Schedulers, colas, prioridades y asignación de recursos.
  4. Monitoreo, diagnóstico y optimización de aplicaciones y nodos.

  1. MapReduce y ejecución de trabajos distribuidos.
  2. Integración de Apache Spark con Hadoop y ejecución sobre YARN.
  3. Apache Hive, Metastore, tablas, particiones y consultas SQL.
  4. Optimización con Parquet, Avro y compresión de datos.

  1. Arquitecturas de ingesta Batch y Streaming.
  2. Ingesta desde bases de datos, archivos y fuentes de eventos.
  3. Diseño de zonas Data Lake: Raw, Structured y Curated.
  4. Construcción de pipelines integrando Hadoop, Spark y Hive.

  1. Modelo de seguridad, usuarios, grupos, permisos y ACL.
  2. Autenticación y fundamentos de Kerberos.
  3. Autorización y políticas de acceso mediante Apache Ranger.
  4. Auditoría, protección de datos y buenas prácticas empresariales.

  1. Administración mediante CLI e interfaces web de Hadoop.
  2. Monitoreo de HDFS, YARN, CPU, memoria y almacenamiento.
  3. Diagnóstico de nodos UNHEALTHY, contenedores, discos y conectividad.
  4. Análisis de logs, recuperación de servicios y troubleshooting.

  1. Dimensionamiento de memoria, CPU, vCores y containers.
  2. Optimización de HDFS, YARN y parámetros de almacenamiento.
  3. Data locality, particionamiento, compresión y Small Files Problem.
  4. Optimización de Spark sobre YARN y análisis de cuellos de botella.

  1. HDFS High Availability y NameNode Active/Standby.
  2. JournalNodes, ZooKeeper y ResourceManager HA.
  3. Backup, Disaster Recovery y estrategias de continuidad.
  4. Mantenimiento, decommissioning y operación de clústeres en producción.
Competencias

Stack y habilidades

Habilidades

  • Arquitectura Big Data
  • Administración de clústeres Hadoop
  • Procesamiento distribuido de datos
  • Gestión avanzada de HDFS
  • Administración de recursos con YARN
  • Diseño de Data Lakes
  • Seguridad y gobierno de datos
  • Monitoreo y Troubleshooting
  • Performance Tuning
  • Alta disponibilidad y recuperación ante fallos

Herramientas

  • Apache Hadoop
  • HDFS
  • YARN
  • Apache Spark
  • Apache Hive
  • Apache Ranger
  • Apache ZooKeeper
  • MapReduce
  • Linux
  • Parquet / Avro

Prerrequisitos

  • Conocimientos básicos de Linux
  • Manejo de línea de comandos
  • Fundamentos de bases de datos
  • Conocimientos básicos de SQL
  • Fundamentos de procesamiento de datos
  • Conocimientos básicos de Python o Java
  • Conceptos básicos de redes y servidores
  • Fundamentos de Big Data recomendables

Oportunidades

  • Big Data Engineer
  • Hadoop Administrator
  • Hadoop Engineer
  • Data Engineer
  • Big Data Platform Engineer
  • Data Platform Engineer
  • Data Infrastructure Engineer
  • DataOps Engineer
  • Arquitecto Big Data
  • Consultor Big Data

¿Listo para comenzar tu transformación profesional?