Cloud
7 min

Guía de AWS para Data Engineering

Trubi

Lucas Trubiano

10 de julio de 2026

Guía de AWS para Data Engineering

Amazon Web Services (AWS) es la nube más utilizada del mundo, con más de 200 servicios. Lanzada en 2006 con Amazon S3 y EC2 (aunque el primer servicio interno, Amazon SQS, ya existía desde 2004 para comunicar aplicaciones), hoy AWS lidera el mercado cloud ofreciendo desde cómputo y almacenamiento hasta inteligencia artificial.

Para Data Engineering en particular, no hace falta conocer los 200 servicios: alcanza con entender bien un puñado de ellos, organizados en capas de un pipeline de datos típico. Esta guía repasa esas capas y los servicios clave de cada una.

Arquitectura de referencia de AWS para Data Engineering

Conceptos fundamentales antes de empezar

Antes de entrar en servicios puntuales, conviene tener claros algunos conceptos base de AWS:

  • Modelos de servicio: IaaS (infraestructura, ej. EC2, VPC), PaaS (plataforma, ej. Lambda, RDS) y SaaS (software listo para usar, ej. QuickSight). A menor gestión propia, menor control.
  • Pricing: pago por demanda (sin compromiso), Spot Instances (hasta 90% más barato pero interrumpible), instancias reservadas y Savings Plans (hasta 72% de descuento comprometiéndote a un uso constante por 1-3 años).
  • Regiones y Zonas de Disponibilidad: las regiones son ubicaciones geográficas independientes entre sí; cada una contiene varias Zonas de Disponibilidad (data centers separados con redes de baja latencia) para dar alta disponibilidad y tolerancia a fallos.

Tip: Al crear una cuenta de AWS, activá MFA, creá un usuario IAM administrador (nunca operes con el usuario root) y configurá alertas de presupuesto en CloudWatch desde el primer día.

Fuentes y capa de ingesta

Los datos llegan desde bases de datos operacionales (RDS para relacional, DynamoDB para NoSQL), aplicaciones SaaS, IoT o APIs. Para moverlos hacia el data lake existen varias herramientas según el caso:

  • AWS DMS (Database Migration Service): migración y replicación continua (CDC) desde bases de datos on-premise o de otra nube hacia AWS.
  • AWS AppFlow: integra datos de SaaS (Salesforce, HubSpot, etc.) sin código.
  • AWS Glue ETL: además de transformar, puede usarse como puerta de ingesta batch con jobs Spark serverless.
  • Amazon Kinesis Data Streams: captura de eventos en tiempo real con control granular de shards; ideal para IoT, gaming o analítica en vivo.
  • Amazon Kinesis Data Firehose: carga automática de streams hacia S3, Redshift u otros destinos, con conversión y compresión de formato incluida — la opción "sin operar nada" frente a Data Streams.

Almacenamiento: S3, Redshift y Spectrum

El corazón de cualquier arquitectura de datos en AWS son tres piezas que se combinan según el patrón lakehouse:

  • Amazon S3: almacenamiento de objetos prácticamente ilimitado y muy económico, con clases de almacenamiento (Standard, Glacier, etc.) según frecuencia de acceso. Es el data lake por excelencia: no es una base de datos, no tiene transacciones ACID, pero es la base de casi todo lo demás.
  • Amazon Redshift: data warehouse columnar con procesamiento paralelo masivo (MPP), pensado para BI empresarial, reporting y análisis OLAP con alta concurrencia. Requiere cargar los datos y tiene un costo por nodo más alto que S3.
  • Redshift Spectrum: extensión de Redshift que permite consultar datos directamente en S3 sin cargarlos, separando storage y compute. Es la pieza que conecta el data lake (S3) con el data warehouse (Redshift) en una arquitectura lakehouse.

Catálogo, gobierno y calidad de datos: la familia Glue

AWS Glue es el servicio ETL serverless de AWS y el eje de la capa de metadatos. Tiene cuatro componentes que conviene distinguir:

  • Glue Data Catalog: repositorio central de metadatos (esquemas, ubicaciones, particiones) que usan Athena, Redshift Spectrum y EMR para saber qué hay y dónde. Es, en esencia, un Hive metastore administrado.
  • Glue Crawlers: escanean fuentes de datos (S3, RDS, Redshift) e infieren automáticamente esquemas y particiones para mantener el Data Catalog actualizado. Se configuran apuntando a un bucket, se pueden programar y admiten clasificadores personalizados para tipos de archivo específicos.
  • Glue ETL: motor de transformación serverless que escala solo. Permite tres formas de desarrollo: editor visual drag-and-drop, notebooks interactivos (Jupyter/PySpark) o scripts en Python/Scala. Usa bookmarks para procesar solo los datos nuevos en cada corrida, evitando reprocesar todo el histórico.
python
# Esqueleto típico de un script de Glue ETL
import sys
from awsglue.transforms import *
from awsglue.utils import getResolvedOptions
from pyspark.context import SparkContext
from awsglue.context import GlueContext
from awsglue.job import Job

glueContext = GlueContext(SparkContext.getOrCreate())
job = Job(glueContext)
  • Glue Data Quality: evalúa reglas de calidad sobre los datos (completitud, unicidad, rangos), genera métricas y puede disparar acciones automáticas cuando detecta anomalías.
  • Glue DataBrew: preparación visual de datos sin código, con más de 250 transformaciones predefinidas — útil para perfiles rápidos y limpieza exploratoria.

En materia de gobierno, AWS IAM controla el acceso a nivel de servicios AWS (quién entra al edificio), mientras que Lake Formation controla el acceso fino a nivel de tablas y columnas dentro del data lake (quién lee qué libro de la biblioteca). Ambos trabajan juntos, no son excluyentes.

Procesamiento

Además de Glue ETL, hay otras opciones de cómputo según el volumen y la latencia requerida:

  • Amazon EMR: clusters administrados de Hadoop/Spark con control total sobre la infraestructura y soporte para Spot Instances — la opción cuando Glue se queda corto en flexibilidad o rendimiento para Big Data pesado.
  • Amazon Athena: motor de consultas SQL serverless sobre datos en S3, con pricing por TB escaneado. Perfecto para análisis ad-hoc sin levantar infraestructura.
  • Amazon Kinesis Data Analytics: SQL sobre streams en tiempo real, con ventanas temporales y funciones analíticas, para métricas o alertas que no pueden esperar a un batch.
  • AWS Lambda: cómputo serverless para transformaciones ligeras y disparadas por eventos (por ejemplo, procesar un archivo apenas llega a S3).

Orquestación y monitoreo

Un pipeline de datos rara vez es un solo job: normalmente hay dependencias entre pasos que hay que coordinar.

  • Amazon MWAA (Managed Workflows for Apache Airflow): Airflow administrado, ideal si el equipo ya conoce el ecosistema y necesita DAGs complejos con dependencias entre múltiples jobs.
  • AWS Step Functions: orquestador visual serverless para flujos que combinan varios servicios AWS (no solo datos), con manejo de errores y paralelismo nativos.
  • Amazon EventBridge: bus de eventos para arquitecturas orientadas a eventos, útil para disparar pipelines en respuesta a algo que pasó en otro sistema.
  • AWS Glue Workflows: la opción más simple cuando todo el pipeline vive dentro de Glue (crawlers + jobs ETL con dependencias entre sí).

Para observabilidad, Amazon CloudWatch centraliza métricas, logs y alarmas de todos los servicios, y AWS CloudTrail audita cada llamada a la API de AWS — imprescindible para debugging y compliance.

Consumo: SQL, BI e IA

En la punta del pipeline, los datos se consumen de tres maneras principales:

  • SQL analítico: Athena para consultas ad-hoc sobre S3, Redshift para BI empresarial con alta concurrencia, y Redshift Spectrum cuando hay que combinar ambos mundos.
  • BI: Amazon QuickSight es el servicio de BI serverless de AWS, con motor de memoria SPICE, dashboards embebibles y pricing por sesión/usuario — pensado para no mantener infraestructura de reporting propia.
  • IA y Machine Learning: SageMaker cubre el ciclo completo de ML (entrenamiento, despliegue, MLOps); Bedrock da acceso a LLMs (incluido Claude de Anthropic) vía API unificada sin gestionar infraestructura; y servicios puntuales como Comprehend (NLP), Textract (OCR de documentos) y Rekognition (imagen y video) resuelven casos específicos sin necesidad de entrenar modelos propios.

Cómo elegir entre tantas opciones

La elección de servicios depende siempre de cuatro factores: volumen y velocidad de los datos, requerimientos del proyecto, presupuesto disponible y las habilidades del equipo. No hay una arquitectura "correcta" única — un pipeline batch simple puede resolverse con S3 + Glue + Athena, mientras que uno con necesidades de streaming, gobierno estricto y BI en tiempo real va a necesitar bastantes más piezas del diagrama.

Tip: Si estás empezando, no trates de dominar los 200 servicios de AWS. Con S3, Glue (ETL + Catalog + Crawlers), Redshift/Athena, IAM y CloudWatch ya podés armar y operar un pipeline de datos productivo de punta a punta.