Zum Inhalt springen
Strategion GmbH

Datensätze in einem Datenraum auffindbar machen

Die Aufgabe

Ein Datensatz, der nicht beschrieben ist, existiert für einen Datenraum nicht. Ohne Katalog gibt es Daten, aber keinen Markt.

Kunde
Forschungs­institut
Branche
Wohnungs- und Immobilien­wirtschaft
Dauer
knapp zwei Jahre in drei Phasen, mit vier Meilensteinen
Datensätze in einem Datenraum auffindbar machen
4

Meilensteine, alle termingerecht erreicht — Konzeption, Implementierung, Evaluation und Integration in das Gesamtsystem, im vereinbarten Budget

6

eigenständig betriebene Bausteine, von der Fachlogik über Metadatenbank und Verwaltungs­oberfläche bis zum Konnektor für den föderierten Daten­austausch

3

Evaluations­dimensionen — Datenschutz und Daten­sicherheit, Vertrauens­würdigkeit sowie Nutzen, Leistung und Bedienbarkeit

Kurz zum Kunden

Außeruniversitäres Forschungs­institut mit anwendungs­naher Ausrichtung, in diesem Vorhaben Auftraggeber und Integrator der Gesamtlösung eines geförderten Daten­öko­systems. Für einen Auftragnehmer ist das eine eigene Art von Kunde: Der fachliche Anspruch ist hoch, die Anforderungen entstehen zum Teil erst während der Arbeit, und der eigene Beitrag muss sich in ein System einfügen, das mehrere Konsortial­partner gleichzeitig entwickeln.

Unsere Lösung

Ein Katalog ist nur so nützlich, wie er von Systemen gelesen werden kann, die niemand aus dem Projekt entwickelt hat.

Die Aufgabe

Ein Datenraum für intelligentes Wohnen entsteht. Gemeint ist ein Ökosystem, in dem Menschen Daten aus ihren Haushalten freiwillig und selbstbestimmt zur Verfügung stellen und Unternehmen daraus KI-Anwendungen entwickeln können, ohne dass die Daten bei einzelnen großen Anbietern liegen bleiben. Vier Kernkomponenten sollen das leisten: eine Verwaltung der Nutzerzustimmungen, eine Prüfung der Datenqualität, eine Auswertung mit Transparenz über die tatsächliche Nutzung — und ein Datenkatalog. Dessen Aufgabe klingt schlicht und ist die Voraussetzung für alles andere: Ein Datensatz, der nicht beschrieben ist, existiert für den Datenraum nicht. Ein Unternehmen, das Sensordaten aus Wohnungen sucht, muss wissen können, was es gibt, wie es strukturiert ist, unter welchen Bedingungen es zu nutzen ist und ob es zu dem passt, was es vorhat. Der Auftrag umfasste Konzeption, Implementierung und wissenschaftliche Evaluation dieses Katalogs — und die Anschluss­fähigkeit an drei parallel entstehende Komponenten anderer Teams sowie an die Standards eines europäischen Datenraums.

Unser Ansatz

Standards statt Eigenerfindung, und das war die Haupt­entscheidung. Das Datenmodell folgt dem Standardvokabular des W3C für Datenkataloge, die Selbstbeschreibung erfüllt die Katalogklasse des europäischen Vertrauens­rahmens, der Daten­austausch läuft über einen Konnektor auf Grundlage eines offenen Standards. Ein eigenes Modell wäre schneller gewesen und hätte den Zweck verfehlt: Ein Katalog ist nur so nützlich, wie er von Systemen gelesen werden kann, die niemand aus dem Projekt entwickelt hat. Semantische Anschluss­fähigkeit ist bei einem Datenraum nicht eine Eigenschaft, sondern der Gegenstand.

Erweiterbarkeit im Modell, damit das Schema die Zeit übersteht. Neben der Kernentität für den Datensatz gibt es ein flexibles Eigenschafts­modell, über das sich zusätzliche Meta­informationen aufnehmen lassen, ohne die Struktur zu ändern. Der Grund war absehbar und trat ein: Die Anforderungen des Vertrauens­rahmens an das Katalogobjekt wurden während der Laufzeit konkretisiert. Ein starres Schema hätte an dieser Stelle eine Migration erzwungen; das erweiterbare hat die Änderung aufgenommen.

Sechs getrennte Bausteine, weil Verantwortlichkeiten getrennt gehören. Fachlogik, Metadatenbank, Verwaltungs­oberfläche, Identitäts- und Berechtigungs­dienst mit eigener Datenbank und der Konnektor für den Daten­austausch laufen jeweils eigenständig, in getrennten Netzen. Bei einem System, dessen Kern die Vertrauens­würdigkeit ist, ist das keine Architektur­mode: Die Berechtigungs­prüfung liegt in einem eigenen Dienst mit eigener Datenhaltung, und die Zugriffs­entscheidung ist damit nicht Bestandteil der Anwendung, die sie umgehen könnte.

Rechte am einzelnen Datensatz, nicht nur am System. Fünf Rollen nach dem Grundsatz der geringsten Rechte, und zusätzlich eine Besitzprüfung: Wer einen Datensatz ändern oder entfernen will, muss nicht nur die passende Rolle haben, sondern auch der Bereitsteller dieses Datensatzes sein. In einem Datenraum, in dessen Zentrum die Selbst­bestimmung über eigene Daten steht, ist das der Unterschied zwischen einem Versprechen und einer Eigenschaft des Systems.

Zwei Wege wurden verworfen, und das steht auch so im Bericht. Für den Metadaten­austausch war zunächst ein Streaming-Verfahren vorgesehen; es wurde verworfen, weil eine anfragebasierte Kommunikation für Metadaten in dieser Größenordnung ausreicht und die Architektur einfacher hält. Auch der ursprünglich vorgeschlagene Technologie-Stack wurde in der Konzeptions­phase zugunsten leichterer Bausteine geändert, mit Vorteilen bei Leistung, Entwicklungs­geschwindigkeit und Barrierefreiheit. Solche Korrekturen offen zu dokumentieren, ist Teil der Arbeit — ein Abschluss­bericht, in dem alles nach Plan lief, ist kein guter Abschluss­bericht.

Neben­ergebnisse, die über das Vorhaben hinausreichen. Neben dem System entstanden ein wiederverwendbares Architektur­muster für standardkonforme Datenkataloge, ein erweiterbares Daten­bank­schema, das sich auf andere Domänen übertragen lässt, und ein Evaluations­rahmen für Datenkataloge entlang der drei genannten Dimensionen. Bei einem Entwicklungs­auftrag mit Forschungs­anteil ist das der eigentliche Zinssatz: Das System nützt einem Ökosystem, das Muster nützt jedem weiteren.

Das Ergebnis

Ein lauffähiges Katalogsystem, modular aufgebaut aus sechs eigenständig betriebenen Bausteinen.

Dazu gehören der Katalogdienst mit der eigentlichen Fachlogik, eine Datenbank für die Metadaten samt Versionierung, eine webbasierte Verwaltungs­oberfläche für Daten­bereitsteller und Administratoren, ein Identitäts- und Berechtigungs­dienst samt eigener Datenbank sowie ein Konnektor für den föderierten Daten­austausch im Ökosystem. Das zentrale Datenmodell folgt dem Standardvokabular des W3C für Datenkataloge in seiner dritten Fassung, erweitert um ein flexibles Eigenschafts­modell, mit dem sich zusätzliche Meta­informationen aufnehmen lassen, ohne das Schema zu brechen; Selbstbezüge im Modell bilden Versions­ketten zwischen Datensätzen ab.

Der Zugriff ist rollenbasiert nach dem Grundsatz der geringsten Rechte, mit fünf Rollen und einer Besitzprüfung je Datensatz. Das System stellt eine maschinen­lesbare Selbstbeschreibung bereit und erfüllt damit die Katalogklasse des europäischen Vertrauens­rahmens. Die Architektur ist vollständig nach einem etablierten Dokumentations­rahmen beschrieben, von Zielen und Randbedingungen über Bausteinsicht, Laufzeit- und Verteilungs­sicht bis zu den Querschnitts­konzepten.

Dazu die wissenschaftliche Evaluation in drei Dimensionen — Datenschutz und Daten­sicherheit, Vertrauens­würdigkeit sowie Nutzen, Leistung und Bedienbarkeit — mit technischen Messwerten und qualitativen Erhebungen. Übergeben worden sind acht Artefakte, von den Quellcodes über Betriebs- und Berechtigungs­konfigurationen bis zu Daten­bank­schema, Dokumentation und Testdaten­sätzen für die Integration. Alle vier Meilensteine sind termingerecht erreicht worden, das Budget eingehalten, die Integration in die Ziel­infra­struktur des Auftraggebers abgeschlossen.

Diese Leistungen steckten im Projekt

Weitere Projekte

Alle Referenzen ansehen

Kontakt

Sprechen Sie uns an

Schreiben Sie uns eine Zeile. Wir ordnen Ihre Frage ein und melden uns.

Gespräch vereinbaren

Schreiben Sie uns, worum es geht. Wir melden uns zeitnah.

Lieber zur Kontaktseite