Data Fabric

Aus Matts Wiki

Begriffsdefinition

Der Begriff Data Fabric bezeichnet eine systemübergreifende Datenarchitektur, die Daten und semantische Informationen aus einem oder mehreren Systemen in einer übergreifenden, integrierten Datenmodellschicht (Data Layer) zusammenführt und verwaltet.

SAP BDC ist eine Weiterentwicklung der Data Fabric, die mit SAP Datasphere begann.

Gründe für eine Data Fabric

Datenhaltung in mehreren Systemen führt zu Datensilos und zum Duplizieren von Daten und Applikationslogik mit der Gefahr von Inkonsistenzen.

Analytics, Machine Learning und KI erfordern jedoch zusammengeführte und konsistente Daten und Datenmodelle.

Eine Data Fabric hilft dabei.

Funktionsweise

Eine Data Fabric ist eine vereinheitlichte Schicht, die Daten aus verschiedenen Systemen verbindet.

Die ermöglicht konsistenten Zugriff, Data Gouvernance und Integration ohne Daten physikalisch zu zentralisieren.

Die Integration findet statt durch:

  • Nutzung Metadatenbasierter Orchestration
  • Datenvirtualisierung
  • Automation

In der Praxis passiert dies durch:

  • Anbindung von Datenquellen durch Virtualisierung ohne Duplizieren
  • Durch Anbindung werden Metadaten, wie Struktur und Beziehungen aus den Quellen ausgelesen
  • Datenzugriffssteuerung, Datenqualitätsregeln
  • Erhalten von semantischen Informationen

Data Fabric Architektur und Komponenten

Komponenten, die eine Data Fabric ermöglichen:

  • Datenkonnektoren und Integration: Datenbanken, Applikationen, Cloudplattformen und On-Premise Systeme verbinden
  • Datenkatalog und aktive Metadaten
  • Datengouvernance, Datensicherheit und Datenqualität
  • Semantische Informationen und Knowledge Graph
  • Data Lineage: Herkunftsnachweis und Darstellung von Datenflüssen und Abhängigkeiten
  • Datenprodukte und Datenmodellierung: Daten, Metadaten, Gouvernance und Modellierung helfen hohe Datenqualität zu schaffen

Data Fabric vs. Data Mesh

Data Fabric und Data Mesh sind beides moderne Ansätze, um verteilte Daten zu verwalten, gehen das Problem auf unterschiedliche Art an.

Data Fabric konzentriert sich auf einen vereinheitlichte Datenmodellschicht und konzentriert sich auf Integration, Standardisierung und Gouvernance über verschiedene verteilte Umgebungen hinweg.

Data Mesh konzentriert sich auf Organisationsstrukturen. Dabei dezentralisiert es Dateneigentümerschaft, indem es Teams Verantwortung übergibt und erlaubt, jedem Team eigene Datenprodukte zu liefern. Dieser Ansatz priorisiert Autonomie, Domänenwissen und Skalierbarkeit.

Vergleich Data Fabric mit anderen Architekturen

Data Fabric vs. Data Warehouse: Ein Data Warehouse zentralisiert Daten in einem einzigen Datenspeicher, während eine Data Fabric Daten aus über Systeme hinweg anbindet, ohne diese zu zentralisieren.

Data Fabric vs. Data Lake: Ein Data Lake speichert große Mengen von Rohdaten, während Data Fabric Daten organisiert und regulisert, und diese über Systemumgebungen hinweg liefert.

Data Fabric vs. Lakehouse: Ein Data Lakehouse kombiniert Elemente von einem Data Lake und einem Data Warehouse in einer Datenplattform, während eine Data Fabric über verschiedene Systeme hinweg operiert, um Zugriff und Data Gouvernance zu vereinheitlichen.

Quellen

Describing SAP Business Data Cloud and its Design Principles

What is data fabric? Architecture, benefits, and uses | SAP