Eine Wissensplattform mit intelligenter Suche entwickeln und übergeben
Die Aufgabe
Das entscheidende Wissen liegt bei wenigen erfahrenen Menschen und in verstreuten Dateien. Beide gehen — die einen in den Ruhestand, die anderen im Ordnerbaum verloren.
Module von Architekturkonzept über den intelligenten Dokumentenupload bis zur unternehmensinternen Suche — alle beauftragt und umgesetzt
Stufen der Dublettenprüfung: exakte Erkennung, inhaltliche Ähnlichkeit, und eine dritte, deren Sinn ausdrücklich geprüft wurde
Arbeitspakete im ersten Modul, von der Bestandsanalyse bis zur organisatorischen Einbettung mit und Anwenderrichtlinien
Kurz zum Kunden
Mittelständischer Hersteller von Absaug- und Filteranlagen. In einem Haus dieser Größe liegt das entscheidende Wissen über Anlagen, Auslegungen und Sonderfälle bei wenigen erfahrenen Menschen und in Dateien, die über Netzlaufwerke und Ablagen verteilt sind. Beides ist jahrzehntelang gutgegangen — und wird zum Problem in dem Moment, in dem diese Menschen in den Ruhestand gehen.
Unsere Lösung
Die anspruchsvollste Funktion ist selten die wertvollste. Erst prüfen, was die einfache Stufe schon löst.
Die Aufgabe
Das Unternehmen hat selbst vorgearbeitet und ein Lastenheft vorgelegt: ein intelligenter Upload für Dokumente und eine interne Suchfunktion. Dahinter steht ein konkreter Anlass, der in solchen Vorhaben selten so offen benannt wird — die Gefahr, Wissen zu verlieren, weil erfahrene Mitarbeitende ausscheiden. Dazu kommen die praktischen Beschwerden: eine gewachsene Ordner- und Dokumentenstruktur, hoher manueller Pflegeaufwand, Dubletten. Ein am Markt getestetes Werkzeug hat positive Resonanz gefunden, weist aber Lücken bei den gewünschten Funktionen auf und ist in Pflegeaufwand und Lizenzkosten unattraktiv. Der Wunsch geht deshalb auf eine schlanke, integrierte Lösung, möglichst auf Grundlage der bereits vorhandenen Lizenzen. Zu klären ist, ob das reicht — und welche der gewünschten Funktionen den Aufwand wert sind.
Unser Ansatz
Die Dublettenprüfung in Stufen, und die dritte ausdrücklich zur Disposition. Stufe eins erkennt exakte Doppelungen über Prüfsummen und Metadaten — einfach, schnell, unstrittig. Stufe zwei prüft inhaltliche Ähnlichkeit über der Texte. Stufe drei wären Sprachmodellfunktionen, und für sie war eine Entscheidungsvorlage vorgesehen, ob sie sich lohnen. Diese Reihenfolge ist der Kern des Vorgehens: Ein erheblicher Teil der Dubletten in gewachsenen Ablagen sind identische Dateien mit anderem Namen. Wer mit der teuersten Stufe anfängt, bezahlt Intelligenz für ein Problem, das eine Prüfsumme löst.
Wir haben das Lastenheft des Kunden ernst genommen und ihm widersprochen. Es lag detailliert vor, mit klaren Vorstellungen von der späteren Oberfläche. Unsere Aufgabe war nicht, es umzusetzen, sondern es zu prüfen: offene Fragen zu Datenhaltung, Ablageschema und Dublettenverwaltung zu klären, und einzelne Festlegungen zu hinterfragen, wo sie sich später gegen das System gewendet hätten. Ein Lastenheft, das ein Kunde vor der Architektur schreibt, enthält immer beides: die richtige und einige Lösungen, die nicht funktionieren.
Auf den vorhandenen Lizenzen aufsetzen, wo es geht. Gewünscht war eine schlanke, integrierte Lösung auf Grundlage dessen, was das Haus schon bezahlt — auch, weil ein getestetes Marktwerkzeug an Pflegeaufwand und Lizenzkosten gescheitert war. Deshalb sieht das Architekturkonzept Schnittstellen zu den bestehenden Ablagesystemen vor, statt eine weitere Plattform daneben zu stellen. Bei einem Mittelständler ohne große IT-Abteilung ist die Zahl der zu pflegenden Systeme eine harte Grenze.
Entwickelt wird spezifikationsgetrieben, und der Code entsteht KI-gestützt. Am Anfang jeder Umsetzung steht eine Spezifikation: ein versioniertes Dokument, das wie Code geprüft wird, für Technik und Fachbereich gleichermaßen lesbar, in dem Entscheidungen, Sonderfälle und Abwägungen geklärt sind, bevor eine Zeile entsteht. Die Architektur wird nach einem etablierten Rahmenwerk dokumentiert. Der Grund für diese Reihenfolge ist nicht Ordnungsliebe, sondern Prüfbarkeit: Erzeugter Code wächst schneller, als die Zeit reicht, ihn zu lesen. Wer einem Modell nur beschreibt, was er ungefähr will, bekommt schnell Code und bei jedem Durchlauf einen anderen. Die Spezifikation ist zugleich die Dokumentation, die sonst am Ende fehlt — und in einer Kanzlei, in der Mandatsinhalte verarbeitet werden, ist sie der Nachweis, dass jede Verarbeitung vorher geklärt war.
Hybride Suche, weil beide Verfahren verschiedene Fehler machen. Die Volltextsuche findet, was wörtlich dasteht, und versagt bei anderer Wortwahl. Die semantische Suche findet Bedeutungsnähe und kann bei einer präzisen Typenbezeichnung daneben greifen. In einem Maschinenbauhaus, in dem Anlagennummern und Sonderausführungen wörtlich gesucht werden, ist die Verbindung beider Verfahren keine Verfeinerung, sondern die Voraussetzung dafür, dass die Suche benutzt wird.
Die organisatorische Einbettung ist ein eigenes Arbeitspaket. Wer pflegt die Wissenselemente, was passiert mit dem Altbestand, welche Richtlinien gelten für die Anwender, und wo bleibt die individuelle Ablage? Das sind keine Nebenfragen. Eine Plattform, neben der weiter privat abgelegt wird, verdoppelt das Problem, das sie lösen soll — und die Frage, ob ein Anwender künftig einen eigenen Ablageort vorschlagen darf, entscheidet mehr über den Erfolg als jeder Algorithmus.
Das Ergebnis
Drei Module, alle beauftragt und umgesetzt.
Das erste ist die Grundlage: Bestandsanalyse der vorhandenen Datenquellen und der Ablagestruktur, Bestimmung des Reifegrads, ein Workshop mit den Fachbereichen zur Anforderungsdefinition, darauf ein Technologie- und Architekturkonzept mit Auswahl der Bausteine und Definition der Schnittstellen zu den bestehenden Ablagesystemen, ein Oberflächen- und Bedienkonzept, ein Konzept für die mehrstufige Dublettenprüfung und die Suche, sowie die organisatorische Einbettung — für die Pflege, Umgang mit dem Altbestand, Richtlinien für die Anwender.
Das zweite Modul setzt den Dokumentenupload um: eine Oberfläche zum Hineinziehen von Dateien, Vorschläge für Dateiname und Ablageort, die Dublettenprüfung in Stufen und die Behandlung von Konflikten beim Hochladen. Das dritte die unternehmensinterne Suche: Suchoberfläche, Kategorien und Filter, ein hybrider Suchalgorithmus, der Volltextsuche und semantische Suche verbindet, die Einbindung der Wissenselemente sowie und Verfeinerung. Ein eigenes Ergebnis des ersten Moduls ist eine Entscheidungsvorlage zur Frage, ob aufwendige Sprachmodellfunktionen in der ersten Stufe überhaupt sinnvoll sind.
Diese Leistungen steckten im Projekt
Weitere Projekte
Alle Referenzen ansehen


Kontakt
Sprechen Sie uns an
Schreiben Sie uns eine Zeile. Wir ordnen Ihre Frage ein und melden uns.
