Definición
Un data lake (lago de datos) es un repositorio de almacenamiento que guarda grandes volúmenes de datos en su formato original, sin transformarlos ni estructurarlos previamente: registros de aplicaciones, ficheros, imágenes, documentos, datos de sensores, exportaciones de otros sistemas. La estructura se aplica después, cuando alguien quiere analizarlos. Frente al data warehouse, que es ordenado y con esquema fijo, el data lake es flexible y barato, pero exige más trabajo al consultarlo.
En una empresa, el data lake suele construirse sobre almacenamiento de objetos en la nube (Amazon S3, Google Cloud Storage, Azure Data Lake Storage), que cuesta céntimos por gigabyte al mes. Es el lugar donde se conservan los datos que todavía no se sabe cómo se usarán, y la base para entrenar modelos de machine learning que necesitan datos variados y en bruto. Los pipelines de datos toman información del lago, la limpian y la cargan en el data warehouse para el análisis de negocio.
El malentendido clásico es creer que guardar todo es lo mismo que tener una estrategia de datos. Sin catálogo, gobierno y calidad, el data lake se convierte en un pantano de datos donde nadie encuentra nada ni confía en lo que encuentra. En 2026 la arquitectura dominante es el lakehouse, que combina el coste bajo del lago con las garantías y la velocidad del warehouse en una sola plataforma, como hacen Databricks, Snowflake o BigQuery.
En la práctica
Una empresa industrial guarda en un data lake cinco años de lecturas de sus máquinas sin saber para qué; cuando decide entrenar un modelo de mantenimiento predictivo, tiene el histórico listo y ahorra dos años de recogida de datos.
Por qué importa
El data lake es un seguro barato: conservar tus datos en bruto hoy te permite entrenar modelos o responder preguntas que aún no te has hecho. La condición es gobernarlo desde el principio para que no se convierta en un vertedero.
Preguntas frecuentes
- ¿Qué diferencia hay entre un data lake y un data warehouse?
- El data lake guarda datos en bruto, de cualquier tipo, a bajo coste y sin estructura previa; sirve para conservar todo y para machine learning. El data warehouse guarda datos limpios y estructurados, listos para consultas rápidas de negocio. Lo habitual es tener ambos o una plataforma lakehouse que los combina.
- ¿Necesita mi empresa un data lake?
- Si generas datos que no caben en tus sistemas actuales (registros de uso, imágenes, documentos, sensores) o quieres entrenar modelos de IA con tu histórico, sí. Si tus datos son básicamente ventas, clientes y facturación, un data warehouse bien montado es suficiente y más simple.