Zum Inhalt springen
Strategion GmbH

Eine Branchen­statistik für Sprachmodelle zugänglich machen

Die Aufgabe

Die Statistik liefert, was vorgesehen ist. Für jede nicht vorgesehene Frage braucht es einen Menschen und einen Auswertungs­zyklus.

Kunde
Bundesverband einer Branche
Branche
Wohnungs- und Immobilien­wirtschaft
Dauer
Konzeption, Entwicklung und Inbetriebnahme einer ersten nutzbaren Ausbaustufe
Eine Branchenstatistik für Sprachmodelle zugänglich machen
250

Kennzahlen je Mitglieds­unternehmen, jährlich erhoben — jetzt in natürlicher Sprache abfragbar statt nur über vordefinierte Auswertungs­pfade

5

Architektur­ebenen von der Zentraldaten­bank über Auswertung, Kontrolle und KI-Schnittstelle bis zu den Anwendungen

69.000

Datensätze in zwölf Tabellen, rund zwanzig Gigabyte, betrieben auf der eigenen Infrastruktur des Auftraggebers

Kurz zum Kunden

Bundesverband der Wohnungs- und Immobilien­wirtschaft. Eine seiner Kern­leistungen ist die Branchen­statistik: Einmal im Jahr melden die Mitglieds­unternehmen rund zweihundertfünfzig Kennzahlen, die zentral zusammengeführt und aufbereitet werden. Die Regionalverbände dürfen dabei nur die Daten ihrer eigenen Mitglieder und aggregierte Werte auf Landesebene sehen — die Statistik ist damit nicht nur eine Datenbank, sondern ein Berechtigungs­gefüge.

Unsere Lösung

Ein Sprachmodell auf eine Datenbank zu lassen ist einfach. Ihm beizubringen, welche Auswertung die richtige ist, ist die Arbeit.

Die Aufgabe

Die bestehende Statistik­infra­struktur erfüllt ihren Zweck zuverlässig, aber sie ist auf starre, vordefinierte Auswertungs­pfade entwickelt. Daten aus einem Online-Fragebogen, zentral zusammengeführt, über mehrdimensionale Würfel und ein Auswertungs­werkzeug in festen Berichten bereitgestellt. Für die Adressaten heißt das dreierlei. Erkenntnisse sind an den Lieferzyklus der Berichte gebunden. Jede Frage, die nicht vorgesehen ist, erfordert einen manuellen Eingriff und Entwicklungs­aufwand. Und eine proaktive Nutzung — etwa der Hinweis auf eine auffällige Entwicklung in einem Verbandsgebiet — ist im Aufbau überhaupt nicht angelegt. Die Aufgabe ist, die vorhandene Datenbasis für Fragen zu öffnen, die niemand vorher formuliert hat, ohne die Berechtigungs­grenzen zwischen den Verbänden anzutasten und ohne die Daten aus dem Haus zu geben.

Unser Ansatz

In der Schnittstelle steckt Fachwissen, nicht nur Abfragen. Der naheliegende Weg wäre, dem Modell Daten­bank­zugriff zu geben und es Abfragen schreiben zu lassen. Das funktioniert in der Demonstration und scheitert im Betrieb, weil eine Kennzahl in einer Branchen­statistik eine Definition hat: Was als Wohneinheit zählt, welche Bestände einbezogen werden, wie über Jahre abgegrenzt wird. Die Werkzeug­schnittstelle enthält deshalb ausdrücklich das Verständnis der Daten und das Verständnis des Verwendungs­zwecks. Ein Modell, das die Definitionen nicht kennt, liefert Zahlen, die plausibel aussehen und falsch sind — die gefährlichste Sorte Fehler in einer Statistik.

Die vorhandenen Auswertungen weiternutzen, statt sie zu ersetzen. Unter der Werkzeug­schnittstelle liegt keine neue Auswertungs­logik, sondern die bestehende: die mehrdimensionalen Würfel, in denen die geprüften Definitionen schon stecken, ergänzt um parametrisierte Abfragen für die häufigsten Fragen. Der Grund ist nicht Sparsamkeit. Diese Auswertungen sind über Jahre gegen die Realität geprüft worden; sie zu umgehen hieße, diese Prüfung wegzuwerfen und mit den Zahlen von vorne anzufangen.

Fünf Ebenen, damit jede für sich prüfbar bleibt. Von unten: Datenquelle, Auswertung, Kontrolle, Werkzeug­schnittstelle für die KI, Anwendungen. Die Kontrollebene ist die unauffälligste und die wichtigste — sie hält Verhalten und Zugriffsrechte an einer Stelle. In einer Statistik, in der jeder Regionalverband nur seine eigenen Mitglieder sehen darf, ist eine Rechteverletzung kein Fehler im Bericht, sondern ein Vertrauens­bruch gegenüber den Mitglieds­unternehmen.

Entwickelt wird spezifikations­getrieben, und der Code entsteht KI-gestützt. Am Anfang jeder Umsetzung steht eine Spezifikation: ein versioniertes Dokument, das wie Code geprüft wird, für Technik und Fachbereich gleichermaßen lesbar, in dem Entscheidungen, Sonderfälle und Abwägungen geklärt sind, bevor eine Zeile entsteht. Die Architektur wird nach einem etablierten Rahmenwerk dokumentiert. Der Grund für diese Reihenfolge ist nicht Ordnungsliebe, sondern Prüfbarkeit: Erzeugter Code wächst schneller, als die Zeit reicht, ihn zu lesen. Wer einem Modell nur beschreibt, was er ungefähr will, bekommt schnell Code und bei jedem Durchlauf einen anderen. Die Spezifikation ist zugleich die Dokumentation, die sonst am Ende fehlt — und wo ein Modell auf eine Statistik zugreift, deren Berechtigungs­grenzen zwischen Verbänden verlaufen, wird das dort geklärt und nicht zur Laufzeit.

Betrieb im eigenen Haus, und das war eine Anforderung. Das System läuft auf der Server­infra­struktur des Auftraggebers, nicht bei einem Dienstleister. Bei Daten, die Mitglieds­unternehmen freiwillig und unter Vertraulichkeits­zusagen liefern, ist Daten­souveränität keine Vorliebe: Sobald ein Unternehmen zweifelt, wo seine Kennzahlen liegen, sinkt die Meldequote — und eine Branchen­statistik lebt von der Meldequote.

Erst der Selbstbedienungs­zugang, dann die proaktiven Agenten. Die erste Anwendung ist ein Chat, in dem die Verbände selbst fragen können. Die zweite Stufe, für die die Grundlage mitgebaut ist, dreht die Richtung: Agenten prüfen Kennzahlen auf auffällige Muster und melden von selbst. Diese Reihenfolge ist bewusst gewählt. Ein System, das ungefragt warnt, muss zuvor bewiesen haben, dass seine Zahlen stimmen — sonst ist die erste Fehlmeldung auch die letzte, die jemand liest.

Das Ergebnis

Eine Zugriffsschicht über eine offene Werkzeug­schnittstelle, mit der ein Sprachmodell die Statistik selbst abfragen kann.

Sie enthält nicht nur die Abfrage­werkzeuge, sondern auch das Wissen über die Beschaffenheit der Daten und über ihren Verwendungs­zweck, damit das Modell die richtige Auswertung wählt und nicht die naheliegende. Darunter eine Auswertungs­schicht, die die vorhandenen mehrdimensionalen Würfel weiternutzt und um parametrisierte Abfragen für die häufigsten Fragestellungen ergänzt, dazu eine Kontrollebene für Verhalten und Zugriffsrechte.

Darauf zwei Anwendungen: ein Statistikchat als Selbstbedienungs­zugang für die Verbände, abgeleitet aus einer vorhandenen Chatlösung, und die Grundlage für Agenten, die Mitglieds­kennzahlen auf auffällige Muster prüfen und von selbst melden. Fünf Arbeitspakete von der Aufnahme des Datenmodells über die Auswertungs­schicht und die Werkzeug­schnittstelle bis zu Einrichtung und Pilotbetrieb. Das System läuft auf der eigenen Server­infra­struktur des Auftraggebers; erster Anwender ist ein ausgewählter Regionalverband.

Diese Leistungen steckten im Projekt

Weitere Projekte

Alle Referenzen ansehen

Kontakt

Sprechen Sie uns an

Schreiben Sie uns eine Zeile. Wir ordnen Ihre Frage ein und melden uns.

Gespräch vereinbaren

Schreiben Sie uns, worum es geht. Wir melden uns zeitnah.

Lieber zur Kontaktseite