Eine Branchenstatistik für Sprachmodelle zugänglich machen
Die Aufgabe
Die Statistik liefert, was vorgesehen ist. Für jede nicht vorgesehene Frage braucht es einen Menschen und einen Auswertungszyklus.
Kennzahlen je Mitgliedsunternehmen, jährlich erhoben — jetzt in natürlicher Sprache abfragbar statt nur über vordefinierte Auswertungspfade
Architekturebenen von der Zentraldatenbank über Auswertung, Kontrolle und KI-Schnittstelle bis zu den Anwendungen
Datensätze in zwölf Tabellen, rund zwanzig Gigabyte, betrieben auf der eigenen Infrastruktur des Auftraggebers
Kurz zum Kunden
Bundesverband der Wohnungs- und Immobilienwirtschaft. Eine seiner Kernleistungen ist die Branchenstatistik: Einmal im Jahr melden die Mitgliedsunternehmen rund Kennzahlen, die zentral zusammengeführt und aufbereitet werden. Die Regionalverbände dürfen dabei nur die Daten ihrer eigenen Mitglieder und aggregierte Werte auf Landesebene sehen — die Statistik ist damit nicht nur eine Datenbank, sondern ein Berechtigungsgefüge.
Unsere Lösung
Ein Sprachmodell auf eine Datenbank zu lassen ist einfach. Ihm beizubringen, welche Auswertung die richtige ist, ist die Arbeit.
Die Aufgabe
Die bestehende Statistikinfrastruktur erfüllt ihren Zweck zuverlässig, aber sie ist auf starre, vordefinierte Auswertungspfade entwickelt. Daten aus einem Online-Fragebogen, zentral zusammengeführt, über mehrdimensionale Würfel und ein Auswertungswerkzeug in festen Berichten bereitgestellt. Für die Adressaten heißt das dreierlei. Erkenntnisse sind an den Lieferzyklus der Berichte gebunden. Jede Frage, die nicht vorgesehen ist, erfordert einen manuellen Eingriff und Entwicklungsaufwand. Und eine proaktive Nutzung — etwa der Hinweis auf eine auffällige Entwicklung in einem Verbandsgebiet — ist im Aufbau überhaupt nicht angelegt. Die Aufgabe ist, die vorhandene Datenbasis für Fragen zu öffnen, die niemand vorher formuliert hat, ohne die Berechtigungsgrenzen zwischen den Verbänden anzutasten und ohne die Daten aus dem Haus zu geben.
Unser Ansatz
In der Schnittstelle steckt Fachwissen, nicht nur Abfragen. Der naheliegende Weg wäre, dem Modell Datenbankzugriff zu geben und es Abfragen schreiben zu lassen. Das funktioniert in der Demonstration und scheitert im Betrieb, weil eine Kennzahl in einer Branchenstatistik eine Definition hat: Was als Wohneinheit zählt, welche Bestände einbezogen werden, wie über Jahre abgegrenzt wird. Die Werkzeugschnittstelle enthält deshalb ausdrücklich das Verständnis der Daten und das Verständnis des Verwendungszwecks. Ein Modell, das die Definitionen nicht kennt, liefert Zahlen, die plausibel aussehen und falsch sind — die gefährlichste Sorte Fehler in einer Statistik.
Die vorhandenen Auswertungen weiternutzen, statt sie zu ersetzen. Unter der Werkzeugschnittstelle liegt keine neue Auswertungslogik, sondern die bestehende: die mehrdimensionalen Würfel, in denen die geprüften Definitionen schon stecken, ergänzt um parametrisierte Abfragen für die häufigsten Fragen. Der Grund ist nicht Sparsamkeit. Diese Auswertungen sind über Jahre gegen die Realität geprüft worden; sie zu umgehen hieße, diese Prüfung wegzuwerfen und mit den Zahlen von vorne anzufangen.
Fünf Ebenen, damit jede für sich prüfbar bleibt. Von unten: Datenquelle, Auswertung, Kontrolle, Werkzeugschnittstelle für die KI, Anwendungen. Die Kontrollebene ist die unauffälligste und die wichtigste — sie hält Verhalten und Zugriffsrechte an einer Stelle. In einer Statistik, in der jeder Regionalverband nur seine eigenen Mitglieder sehen darf, ist eine Rechteverletzung kein Fehler im Bericht, sondern ein Vertrauensbruch gegenüber den Mitgliedsunternehmen.
Entwickelt wird spezifikationsgetrieben, und der Code entsteht KI-gestützt. Am Anfang jeder Umsetzung steht eine Spezifikation: ein versioniertes Dokument, das wie Code geprüft wird, für Technik und Fachbereich gleichermaßen lesbar, in dem Entscheidungen, Sonderfälle und Abwägungen geklärt sind, bevor eine Zeile entsteht. Die Architektur wird nach einem etablierten Rahmenwerk dokumentiert. Der Grund für diese Reihenfolge ist nicht Ordnungsliebe, sondern Prüfbarkeit: Erzeugter Code wächst schneller, als die Zeit reicht, ihn zu lesen. Wer einem Modell nur beschreibt, was er ungefähr will, bekommt schnell Code und bei jedem Durchlauf einen anderen. Die Spezifikation ist zugleich die Dokumentation, die sonst am Ende fehlt — und wo ein Modell auf eine Statistik zugreift, deren Berechtigungsgrenzen zwischen Verbänden verlaufen, wird das dort geklärt und nicht zur Laufzeit.
Betrieb im eigenen Haus, und das war eine Anforderung. Das System läuft auf der Serverinfrastruktur des Auftraggebers, nicht bei einem Dienstleister. Bei Daten, die Mitgliedsunternehmen freiwillig und unter Vertraulichkeitszusagen liefern, ist Datensouveränität keine Vorliebe: Sobald ein Unternehmen zweifelt, wo seine Kennzahlen liegen, sinkt die Meldequote — und eine Branchenstatistik lebt von der Meldequote.
Erst der Selbstbedienungszugang, dann die proaktiven Agenten. Die erste Anwendung ist ein Chat, in dem die Verbände selbst fragen können. Die zweite Stufe, für die die Grundlage mitgebaut ist, dreht die Richtung: Agenten prüfen Kennzahlen auf auffällige Muster und melden von selbst. Diese Reihenfolge ist bewusst gewählt. Ein System, das ungefragt warnt, muss zuvor bewiesen haben, dass seine Zahlen stimmen — sonst ist die erste Fehlmeldung auch die letzte, die jemand liest.
Das Ergebnis
Eine Zugriffsschicht über eine offene Werkzeugschnittstelle, mit der ein Sprachmodell die Statistik selbst abfragen kann.
Sie enthält nicht nur die Abfragewerkzeuge, sondern auch das Wissen über die Beschaffenheit der Daten und über ihren Verwendungszweck, damit das Modell die richtige Auswertung wählt und nicht die naheliegende. Darunter eine Auswertungsschicht, die die vorhandenen mehrdimensionalen Würfel weiternutzt und um parametrisierte Abfragen für die häufigsten Fragestellungen ergänzt, dazu eine Kontrollebene für Verhalten und Zugriffsrechte.
Darauf zwei Anwendungen: ein Statistikchat als Selbstbedienungszugang für die Verbände, abgeleitet aus einer vorhandenen Chatlösung, und die Grundlage für Agenten, die Mitgliedskennzahlen auf auffällige Muster prüfen und von selbst melden. Fünf Arbeitspakete von der Aufnahme des Datenmodells über die Auswertungsschicht und die Werkzeugschnittstelle bis zu Einrichtung und Pilotbetrieb. Das System läuft auf der eigenen Serverinfrastruktur des Auftraggebers; erster Anwender ist ein ausgewählter Regionalverband.
Diese Leistungen steckten im Projekt
Weitere Projekte
Alle Referenzen ansehen


Kontakt
Sprechen Sie uns an
Schreiben Sie uns eine Zeile. Wir ordnen Ihre Frage ein und melden uns.
