Data Fabric
Begriffsdefinition
Der Begriff Data Fabric bezeichnet eine systemübergreifende Datenarchitektur, die Daten und semantische Informationen aus einem oder mehreren Systemen in einer übergreifenden, integrierten Datenmodellschicht (Data Layer) zusammenführt und verwaltet.
SAP BDC ist eine Weiterentwicklung der Data Fabric, die mit SAP Datasphere begann.
Gründe für eine Data Fabric
Datenhaltung in mehreren Systemen führt zu Datensilos und zum Duplizieren von Daten und Applikationslogik mit der Gefahr von Inkonsistenzen.
Analytics, Machine Learning und KI erfordern jedoch zusammengeführte und konsistente Daten und Datenmodelle.
Eine Data Fabric hilft dabei.
Funktionsweise
Eine Data Fabric ist eine vereinheitlichte Schicht, die Daten aus verschiedenen Systemen verbindet.
Die ermöglicht konsistenten Zugriff, Data Gouvernance und Integration ohne Daten physikalisch zu zentralisieren.
Die Integration findet statt durch:
- Nutzung Metadatenbasierter Orchestration
- Datenvirtualisierung
- Automation
In der Praxis passiert dies durch:
- Anbindung von Datenquellen durch Virtualisierung ohne Duplizieren
- Durch Anbindung werden Metadaten, wie Struktur und Beziehungen aus den Quellen ausgelesen
- Datenzugriffssteuerung, Datenqualitätsregeln
- Erhalten von semantischen Informationen
Architektur und Komponenten
Komponenten, die eine Data Fabric ermöglichen:
- Datenkonnektoren und Integration: Datenbanken, Applikationen, Cloudplattformen und On-Premise Systeme verbinden
- Datenkatalog und aktive Metadaten
- Datengouvernance, Datensicherheit und Datenqualität
- Semantische Informationen und Knowledge Graph
- Data Lineage: Herkunftsnachweis und Darstellung von Datenflüssen und Abhängigkeiten
- Datenprodukte und Datenmodellierung: Daten, Metadaten, Gouvernance und Modellierung helfen hohe Datenqualität zu schaffen
Data Fabric vs. Data Mesh
Data Fabric und Data Mesh sind beides moderne Ansätze, um verteilte Daten zu verwalten, gehen das Problem auf unterschiedliche Art an.
Data Fabric konzentriert sich auf einen vereinheitlichte Datenmodellschicht und konzentriert sich auf Integration, Standardisierung und Gouvernance über verschiedene verteilte Umgebungen hinweg.
Data Mesh konzentriert sich auf Organisationsstrukturen. Dabei dezentralisiert es Dateneigentümerschaft, indem es Teams Verantwortung übergibt und erlaubt, jedem Team eigene Datenprodukte zu liefern. Dieser Ansatz priorisiert Autonomie, Domänenwissen und Skalierbarkeit.
Vergleich Data Fabric mit anderen Architekturen
Data Fabric vs. Data Warehouse: Ein Data Warehouse zentralisiert Daten in einem einzigen Datenspeicher, während eine Data Fabric Daten aus über Systeme hinweg anbindet, ohne diese zu zentralisieren.
Data Fabric vs. Data Lake: Ein Data Lake speichert große Mengen von Rohdaten, während Data Fabric Daten organisiert und regulisert, und diese über Systemumgebungen hinweg liefert.
Data Fabric vs. Lakehouse: Ein Data Lakehouse kombiniert Elemente von einem Data Lake und einem Data Warehouse in einer Datenplattform, während eine Data Fabric über verschiedene Systeme hinweg operiert, um Zugriff und Data Gouvernance zu vereinheitlichen.
Vorteile einer Data Fabric für Unternehmen
Eine Data Fabric transformiert fragmentierte Daten hin zu einem konsistenten und verlässlichen Gut:
- Datensilos beseitigen und Datenzugriff erleichtern
- Bessere Handlungsfähigkeit durch genaue und abgestimmte Daten
- Self-Service Analytics
- Bessere Data Gouvernance, Compliance und Datensicherheit über Systemumgebungen hinweg
- Effizienzsteigerungen und Verringerung operativer Overheads
- Analytics, Machine Learning und KI erleichtern
Anwendungsfälle und Beispiele
- Betrugserkennund und Risikomanagement
- Compliance und regulatorisches Reporting
- Finanzplanung und Forecasting
- Analytics und KI
Quellen
Describing SAP Business Data Cloud and its Design Principles
