El crecimiento del volumen y la variedad de datos, junto con el avance de la analítica y la inteligencia artificial, está aumentando la necesidad de disponer de información accesible, fiable y preparada para diferentes casos de uso.
Este escenario plantea nuevos retos para las organizaciones, que necesitan arquitecturas capaces de gestionar un ecosistema de datos cada vez más amplio sin perder agilidad, calidad o control.
Data Mesh surge como un enfoque para evolucionar la forma en que se organizan y gestionan los datos dentro de la organización.
En este artículo veremos qué es Data Mesh, cómo funciona y cómo llevar este modelo a la práctica para construir una arquitectura de datos escalable, gobernada y preparada para la analítica avanzada y la inteligencia artificial.
¿Qué es Data Mesh o malla de datos?
Data Mesh, también denominado malla de datos, “es un enfoque para gestionar los datos de forma distribuida dentro de una organización”. En lugar de concentrar toda su gestión en un único equipo central, distribuye la responsabilidad entre las áreas de negocio que mejor conocen el contexto y significado de sus datos.
Este modelo permite acercar la responsabilidad sobre los datos a las áreas que conocen su contexto y facilitar que puedan ponerse a disposición de otros equipos dentro de la organización.
“Data Mesh no es una herramienta o plataforma tecnológica concreta, sino un enfoque que combina arquitectura, organización y gobierno para gestionar y compartir los datos de forma más eficiente.”
¿Por qué surge Data Mesh frente a las arquitecturas de datos centralizadas?
Las arquitecturas de datos centralizadas han permitido a las organizaciones concentrar la gestión, transformación y gobierno de la información en equipos especializados. Sin embargo, este modelo puede encontrar dificultades para escalar cuando aumenta el número de fuentes de datos, áreas de negocio y casos de uso que dependen de ellos.
En estos entornos, un mismo equipo puede tener que atender las necesidades de múltiples departamentos, comprender datos procedentes de contextos muy diferentes y preparar la información para cada nuevo caso de uso. A medida que crece la demanda, pueden aparecer cuellos de botella que retrasen el acceso a los datos y aumenten la dependencia de los equipos centrales.
A esta dificultad se suma la distancia entre quienes gestionan técnicamente los datos y quienes conocen su significado dentro del negocio. Un equipo central puede encargarse de su procesamiento, pero no siempre dispone del conocimiento necesario para interpretar correctamente su contexto, calidad o utilidad.
Data Mesh surge como respuesta a estas limitaciones, planteando una distribución de responsabilidades que permita aumentar la autonomía de los dominios de negocio y escalar el uso de los datos sin depender exclusivamente de un único equipo central.
¿Cómo funciona una arquitectura Data Mesh?
Una arquitectura Data Mesh funciona distribuyendo la responsabilidad sobre los datos entre las áreas que los generan y mejor conocen su contexto. Cuando un dominio produce información relevante para otros equipos, se encarga de prepararla y ponerla a disposición de la organización bajo unas condiciones definidas de uso y calidad.
Los consumidores pueden descubrir y acceder a estos datos para utilizarlos en sus propios procesos, análisis o aplicaciones, sin depender de que un equipo central prepare la información para cada nueva necesidad.
Este intercambio se apoya en capacidades tecnológicas compartidas y en unas reglas comunes que permiten que productores y consumidores trabajen dentro de un mismo ecosistema de datos.
Así, la información puede compartirse entre diferentes áreas mientras la responsabilidad sobre cada conjunto de datos permanece cerca de los equipos que mejor conocen su significado y utilidad.
Los cuatro principios de Data Mesh
Data Mesh se estructura en torno a cuatro principios que permiten distribuir la gestión de los datos sin perder coherencia entre las diferentes áreas de la organización. Estos principios combinan autonomía, orientación al producto, capacidades tecnológicas compartidas y un modelo de gobierno común.
Propiedad de los datos por dominios
En Data Mesh, la responsabilidad sobre los datos se asigna a los dominios de negocio que mejor conocen su origen, significado y contexto. Cada dominio asume su gestión y mantiene la responsabilidad sobre los datos que pone a disposición del resto de la organización.
Este enfoque acerca la gestión del dato al conocimiento de negocio y reduce la dependencia de un equipo central para resolver todas las necesidades relacionadas con la información.
Datos como producto
Los datos dejan de tratarse únicamente como un resultado de los procesos internos y pasan a gestionarse como productos destinados a otros usuarios y equipos.
Esto implica diseñarlos pensando en las necesidades de sus consumidores y asumir una responsabilidad continua sobre ellos, de forma similar a cualquier otro producto utilizado dentro de la organización.
Plataforma de datos self-service
La autonomía de los dominios requiere disponer de una plataforma que proporcione capacidades comunes para trabajar con los datos sin que cada equipo tenga que desarrollar su propia infraestructura.
Una plataforma self-service facilita tareas como publicar, descubrir, acceder y gestionar Data Products, reduciendo la complejidad técnica y permitiendo que los dominios se concentren en el conocimiento y las necesidades propias de su área.
Gobierno federado del dato
Distribuir la responsabilidad no significa renunciar a un marco común. El gobierno federado combina la autonomía de los dominios con políticas y estándares compartidos que deben respetarse en toda la organización.
De este modo, las decisiones pueden mantenerse cerca de los equipos responsables de los datos sin perder la coordinación necesaria a nivel global.
Data Products: cómo convertir los datos en productos útiles para el negocio
Uno de los cambios más relevantes que introduce Data Mesh es pasar de gestionar los datos como un recurso técnico a tratarlos como productos diseñados para responder a las necesidades de quienes van a utilizarlos.
Para conseguirlo, no basta con poner un conjunto de datos a disposición de otros equipos. “Un Data Product debe ofrecer la información con el contexto, la calidad y las condiciones necesarias para que pueda ser utilizada sin depender continuamente del equipo que la genera.”
Un producto de datos debe prestar especial atención a aspectos como:
- Responsabilidad: debe existir un equipo o propietario encargado de mantener el producto y garantizar su evolución.
- Calidad: los datos deben cumplir unos criterios definidos de precisión, integridad, actualización y consistencia.
- Descubrimiento: los usuarios deben poder localizar el Data Product y comprender qué información contiene.
- Documentación y contexto: además de los datos, es necesario proporcionar metadatos, definiciones y otra información que facilite su interpretación.
- Accesibilidad: los consumidores autorizados deben disponer de mecanismos claros para acceder y utilizar el producto.
- Fiabilidad: deben establecerse expectativas sobre aspectos como disponibilidad, frecuencia de actualización o nivel de servicio.
Esta orientación facilita que un mismo Data Product pueda reutilizarse para diferentes necesidades sin tener que localizar, interpretar y preparar nuevamente la información para cada proyecto.
Los equipos consumidores pueden trabajar así sobre productos de datos mantenidos y preparados para su uso, reduciendo dependencias y facilitando que la información pueda aprovecharse en diferentes áreas de la organización.
Cómo implantar un gobierno del dato distribuido sin perder el control
Uno de los principales retos de Data Mesh consiste en encontrar el equilibrio entre la autonomía de los dominios y la necesidad de mantener criterios comunes en toda la organización. Distribuir la responsabilidad sobre los datos no significa que cada equipo pueda gestionarlos de forma independiente y sin unas reglas compartidas.
Para conseguir este equilibrio, el gobierno debe definir qué decisiones pueden asumir los dominios y qué requisitos deben mantenerse de forma común en todo el ecosistema de datos.
Definir responsabilidades entre dominios y organización
Cada dominio debe disponer de autonomía para gestionar sus Data Products de acuerdo con el conocimiento y las necesidades de su área. Al mismo tiempo, la organización debe establecer aquellas políticas y estándares que afectan de forma transversal al uso de los datos.
Esta distribución permite acercar las decisiones a quienes mejor conocen la información sin generar modelos de gestión completamente diferentes entre departamentos.
Establecer criterios comunes de calidad
Aunque cada dominio sea responsable de sus productos de datos, la organización necesita definir criterios que permitan evaluar su calidad de manera consistente.
Aspectos como integridad, actualización, precisión o consistencia deben poder medirse y comunicarse para que los consumidores conozcan las condiciones de los datos que utilizan y puedan determinar si son adecuados para cada caso de uso.
Mantener la seguridad y el cumplimiento
La descentralización tampoco debe provocar diferencias en la aplicación de los requisitos de seguridad. Las políticas relacionadas con accesos, protección de información sensible, privacidad y cumplimiento normativo deben aplicarse de forma coherente con independencia del dominio responsable de los datos.
De esta manera, la autonomía operativa se desarrolla dentro de unos límites comunes que permiten mantener el control sobre la información.
Garantizar la trazabilidad de los datos
Un modelo distribuido necesita mantener visibilidad sobre el origen de los datos, las transformaciones que han experimentado y los productos o procesos que dependen de ellos.
Esta trazabilidad permite comprender cómo circula la información entre dominios y resulta especialmente relevante cuando un Data Product es reutilizado por diferentes equipos o alimenta procesos analíticos y modelos de inteligencia artificial.
Cómo implantar Data Mesh en una organización
La implantación de Data Mesh supone un cambio tanto tecnológico como organizativo. No consiste simplemente en distribuir los datos entre diferentes equipos, sino en trasladar progresivamente responsabilidades hacia los dominios y proporcionarles las capacidades necesarias para gestionarlas.
Por este motivo, la transición desde una arquitectura centralizada no tiene que realizarse de forma simultánea en toda la organización. Puede comenzar sobre dominios y casos de uso concretos para validar el modelo antes de extenderlo.
Identificar los dominios y sus responsabilidades
El primer paso consiste en determinar qué dominios representan las principales áreas de conocimiento del negocio y qué datos se generan o gestionan dentro de cada uno.
A partir de esta identificación pueden asignarse responsabilidades claras sobre los datos y definir qué equipos asumirán la propiedad de los futuros Data Products.
Seleccionar los primeros casos de uso
En lugar de transformar toda la arquitectura desde el inicio, resulta más práctico comenzar con casos de uso donde Data Mesh pueda aportar un valor concreto.
La selección de un conjunto limitado de Data Products permite probar el modelo de propiedad, detectar necesidades tecnológicas y organizativas y obtener experiencia antes de ampliar su adopción.
Proporcionar capacidades comunes a los dominios
La autonomía requiere que los equipos puedan trabajar con los datos sin depender constantemente de especialistas o desarrollos específicos.
Para ello, la organización debe proporcionar capacidades compartidas que faciliten tareas como crear, publicar, descubrir, acceder y monitorizar Data Products. La automatización de estas operaciones ayuda a reducir la complejidad técnica y favorece que nuevos dominios puedan incorporarse al modelo.
Escalar el modelo de forma progresiva
Una vez validados los primeros dominios y productos de datos, el modelo puede extenderse hacia otras áreas de la organización. Durante este proceso es necesario evaluar qué funciona, ajustar las capacidades de la plataforma y adaptar el gobierno a medida que aumenta el número de productores y consumidores.
La evolución hacia Data Mesh se convierte así en un proceso progresivo en el que la autonomía de los equipos aumenta a medida que se consolidan la plataforma, el gobierno y las prácticas necesarias para operar el modelo a mayor escala.
Data Mesh, cloud y Data Lakehouse: cómo se complementan
Data Mesh no implica sustituir las plataformas de datos existentes. Tecnologías como Data Lakes, Data Warehouses o arquitecturas Data Lakehouse pueden seguir formando parte de la infraestructura sobre la que se construyen y distribuyen los Data Products.
La diferencia está en el papel que desempeña cada elemento. Data Mesh establece cómo se distribuyen las responsabilidades y se organizan los datos por dominios, mientras que las plataformas tecnológicas proporcionan capacidades para almacenarlos, procesarlos, gobernarlos y ponerlos a disposición de sus consumidores.
En este contexto, las plataformas cloud facilitan el despliegue de infraestructuras capaces de crecer a medida que aumentan los dominios, los Data Products y sus consumidores. También permiten proporcionar servicios compartidos de almacenamiento, procesamiento, catálogo, seguridad u observabilidad, evitando que cada equipo tenga que desarrollar su propia infraestructura.
Una arquitectura Data Lakehouse puede formar parte de esta base tecnológica al combinar capacidades asociadas a Data Lakes y Data Warehouses. Sobre ella, los diferentes dominios pueden almacenar, transformar y preparar la información necesaria para construir sus productos de datos.
Data Mesh, cloud y Data Lakehouse pueden, por tanto, formar parte de una misma arquitectura moderna de datos: Data Mesh define el modelo de organización y responsabilidad sobre la información, mientras que cloud y Lakehouse aportan capacidades tecnológicas para gestionarla y explotarla a escala.
Data Mesh como base para la analítica avanzada y la inteligencia artificial
La analítica avanzada y la inteligencia artificial dependen de la disponibilidad de datos fiables, accesibles y suficientemente contextualizados. Cuando la información se encuentra fragmentada, resulta difícil localizarla o requiere largos procesos de preparación, desarrollar nuevos casos de uso puede consumir una parte importante del tiempo de los equipos.
Data Mesh facilita este proceso al poner a disposición de analistas, científicos de datos y equipos de negocio productos de datos preparados para ser descubiertos y reutilizados. Al contar con información sobre su origen, significado, calidad y condiciones de uso, los equipos pueden identificar con mayor rapidez qué datos son adecuados para cada necesidad.
Este enfoque resulta especialmente relevante para el desarrollo de modelos de inteligencia artificial y machine learning, que pueden requerir información procedente de diferentes áreas de la organización. La posibilidad de acceder a Data Products gobernados y mantenidos por los dominios responsables reduce la dependencia de procesos específicos de preparación para cada nuevo proyecto.
Además, la reutilización permite que un mismo producto de datos pueda alimentar diferentes casos de uso, desde cuadros de mando y modelos predictivos hasta aplicaciones basadas en inteligencia artificial, siempre que cumpla los requisitos necesarios para cada uno de ellos.
Data Mesh contribuye así a crear una base de datos más preparada para escalar la analítica y la IA, facilitando que la organización pueda transformar la información disponible en nuevos casos de uso y apoyar la toma de decisiones.
Cómo Babel ayuda a construir una arquitectura Data Mesh escalable
Adoptar Data Mesh implica transformar tanto la arquitectura de datos como la forma en que la organización gestiona y utiliza la información. Para hacerlo con éxito, es necesario adaptar el modelo a la realidad tecnológica, organizativa y de negocio de cada compañía.
En Babel ayudamos a las organizaciones a diseñar arquitecturas de datos modernas y escalables, definiendo modelos que permitan aumentar la autonomía de los equipos sin perder el gobierno, la calidad y el control sobre la información.
A través de nuestros servicios de Data & AI, acompañamos este proceso desde el diseño de la arquitectura y el modelo de gobierno hasta la creación de las capacidades necesarias para facilitar el acceso, gestión y explotación de los datos.
El objetivo es construir una arquitectura de datos escalable y gobernada que permita a la organización aprovechar sus datos de forma más ágil y responder a la evolución de sus necesidades de negocio.
Preguntas frecuentes sobre Data Mesh
¿Qué diferencia hay entre Data Mesh y Data Lake?
Data Mesh y Data Lake responden a necesidades diferentes. Data Mesh es un enfoque arquitectónico y organizativo que distribuye la responsabilidad sobre los datos entre diferentes dominios de negocio. Un Data Lake, en cambio, es una arquitectura de almacenamiento diseñada para centralizar grandes volúmenes de datos estructurados y no estructurados.
Ambos conceptos pueden complementarse: un Data Lake puede formar parte de la infraestructura tecnológica utilizada dentro de una arquitectura Data Mesh.
¿Qué diferencia existe entre Data Mesh y Data Fabric?
Data Mesh se centra en distribuir la propiedad y responsabilidad de los datos entre los dominios de negocio. Data Fabric está más orientado a crear una capa tecnológica integrada que facilite la conexión, gestión y acceso a datos distribuidos mediante capacidades como metadatos, automatización e integración.
No son necesariamente modelos excluyentes y algunas de las capacidades de Data Fabric pueden utilizarse para facilitar una arquitectura Data Mesh.
¿Qué empresas pueden beneficiarse de Data Mesh?
Data Mesh puede resultar especialmente útil para organizaciones con múltiples áreas de negocio, numerosas fuentes de información y una demanda creciente de datos para analítica, reporting, inteligencia artificial u otros casos de uso.
Su adopción tiene más sentido cuando un modelo excesivamente centralizado empieza a generar dependencias o dificultades para responder a las necesidades de diferentes equipos.
¿Data Mesh requiere utilizar una plataforma tecnológica específica?
No. Data Mesh no es una tecnología o producto concreto, por lo que puede implementarse utilizando diferentes plataformas y herramientas.
La arquitectura tecnológica debe proporcionar las capacidades necesarias para que los dominios puedan gestionar y compartir sus productos de datos, además de facilitar aspectos como descubrimiento, interoperabilidad, seguridad, observabilidad y gobierno.
¿Data Mesh sustituye a un Data Warehouse o Data Lakehouse?
No necesariamente. Data Warehouses, Data Lakes y Data Lakehouses pueden seguir formando parte de la infraestructura de datos de una organización que adopta Data Mesh.
Data Mesh determina principalmente cómo se organizan las responsabilidades y la gestión de los datos, mientras que estas arquitecturas proporcionan capacidades tecnológicas para almacenarlos, procesarlos y explotarlos.
¿Cuándo tiene sentido plantearse una arquitectura Data Mesh?
Puede ser conveniente valorar Data Mesh cuando el crecimiento de fuentes, dominios y consumidores de datos empieza a generar cuellos de botella, una elevada dependencia de equipos centrales o dificultades para escalar nuevos casos de uso.
Antes de adoptarlo, es importante valorar la madurez tecnológica y organizativa, ya que Data Mesh requiere responsabilidades claras, capacidades compartidas y un modelo de gobierno capaz de coordinar un ecosistema de datos distribuido.