Datos y lakehouse7 feb 20244 min de lecturaPor MLT Corp

Los primeros 90 días de un data lake: qué construir y qué omitir

Un proyecto de data lake puede divagar durante un año o entregar valor en un trimestre. Esta secuencia de 90 días favorece lo segundo.

Los primeros 90 días de un data lake: qué construir y qué omitir

Ideas clave

  • Entregue un dominio de negocio de punta a punta antes de sumar más fuentes.
  • Establezca responsables, nombres y reglas de acceso durante el primer mes, no después.
  • Omita herramientas exóticas, streaming en tiempo real y autoservicio amplio hasta que lo básico sea confiable.
  • Termine con algo que las personas usen cada semana, no solo con un almacenamiento cargado.

Usted tiene aprobación para un data lake, un montón de sistemas fuente y interesados que esperan cosas distintas. El fracaso más común no es técnico. Es un proyecto que ingesta todo, no publica nada y agota la paciencia del patrocinador hacia el sexto mes. Un plan ajustado de 90 días lo evita al obligar a mostrar un resultado visible desde temprano.

Días 1 a 30: decidir, conectar, proteger

Elija un dominio de negocio con un responsable claro y una pregunta real, como las ventas semanales por producto o el inventario frente a la demanda. Confirme quién usará el resultado y cómo lo evaluará. Luego establezca las bases que hoy son baratas y mañana serán dolorosas.

Días 31 a 60: modelar y probar

Convierta los archivos crudos en tablas depuradas y en un pequeño modelo curado para el dominio elegido. Acuerde con los responsables de negocio las definiciones de las cinco a diez métricas que importan y regístrelas en un solo lugar. Agregue controles básicos de calidad de datos: actualidad, duplicados, llaves faltantes y conciliación contra un total de la fuente. Cuando un control falle, alguien debe recibir el aviso por nombre.

Días 61 a 90: publicar y lograr adopción

Conecte una herramienta de reportes a la capa curada y construya el tablero o la extracción que responde la pregunta original. Guíe a los usuarios en su uso, reúna comentarios y corrija las etiquetas confusas. Documente cómo fluyen los datos de la fuente al reporte, quién es responsable de cada paso y qué hacer cuando falla una carga. Cierre con una revisión breve: ¿qué aprendimos sobre volúmenes, costos y brechas de habilidades?

Qué omitir deliberadamente

  1. Streaming en tiempo real, salvo que un proceso concreto lo necesite realmente en minutos.
  2. Ingestar todas las tablas de todos los sistemas por si acaso.
  3. Construir un catálogo de autoservicio amplio antes de que los datos centrales sean confiables.
  4. Marcos de trabajo a medida cuando los servicios administrados ya cubren la necesidad.
  5. Proyectos de aprendizaje automático sobre datos que nadie ha validado todavía.

Señales de que va por buen camino

Al día 90 debería poder nombrar al responsable de cada conjunto de datos, mostrar un reporte que finanzas u operaciones haya usado de verdad, explicar el costo mensual y describir el siguiente dominio en la fila. Si tiene petabytes cargados pero ningún reporte confiable, tómelo como una advertencia, no como un hito.

Roles que necesita, aunque sea a tiempo parcial

Un patrocinador de negocio que pueda resolver las definiciones, un ingeniero de datos que construya los pipelines, un analista que conozca el dominio y alguien responsable de la seguridad y el costo. En equipos pequeños una persona puede cumplir dos funciones, pero cada función debe tener un nombre asignado.

Juzgue los 90 días por si hay un reporte confiable y usado cada semana, no por cuántos datos se cargaron.

← Volver a todas las perspectivas

Siga leyendo

Empiece aquí

Definamos su piloto.

Una sesión de trabajo de 45 minutos, sin diapositivas.

Respondemos en un día hábil.