Semantische Klassifizierung von Betriebsdaten ueber die Cernion Datasource API
Technischer Ueberblick zur REST-basierten Erschliessung heterogener Dateiformate fuer Netzbetrieb und Anschlusspruefung mit Fokus auf Entitaetsklassifizierung, Feldmapping und Audit-Trail.
1. Problemstellung im Betriebskontext
Netzbetreiber und kommunale Versorgungsunternehmen verarbeiten taeglich Daten aus heterogenen Quellen. Typische Eingangsdaten umfassen tabellarische Listen in CSV- oder XLSX-Format, raeumliche Informationen in GeoJSON sowie strukturierte Dokumente in DOCX. Die inhaltliche Erschliessung dieser Dateien erfolgt in klassischen Prozessen durch manuelle Erfassung, halbautomatisierte Importroutinen oder bruchstueckhafte Skriptloesungen. Dies fuehrt zu Inkonsistenzen bei der Entitaetsidentifizierung, insbesondere wenn Begriffe wie Netzanschlusspunkt, Marktlokation, Messlokation oder MaStR-ID in unterschiedlichen Spaltenbezeichnungen, Dateinamen oder Dokumentenkontexten auftreten. Die Cernion Energy Tools stellen mit der Datasource API einen standardisierten REST-Endpunkt bereit, der Upload, semantische Klassifizierung, manuelle Pruefung und Bestaetigung in einem durchgaengigen Lifecycle abbildet.
2. Grundbegriffe der API-Architektur
Die API operiert mit einer klaren Hierarchie von Ressourcen. Jede Datenquelle wird als eigene Entitaet gefuehrt. Die Datenquelle traegt Metadaten zu Quellsystem, Erstellungszeitpunkt und Verantwortlicher Rolle. Unterhalb der Datenquelle werden Upload-Referenzen gebildet, welche eine konkrete Dateiabbildung darstellen. Jede Upload-Referenz enthaelt technische Attribute wie Dateiformat, Pruefsumme, Zeichensatz und Zeilenzahl. Die Klassifizierung bildet die dritte Ebene der Hierarchie. Sie beschreibt das Ergebnis der automatischen Analyse einer Upload-Referenz durch das interne Klassifizierungsmodell. Eine Klassifizierung ordnet die erkannten Spalten, Felder oder Dokumentensegmente den fachlichen Entitaeten des Netzbetriebs zu. Das Feldmapping dokumentiert, welche technischen Quellattribute auf welche fachlichen Zielfelder abgebildet wurden. Saemtliche Zustandsuebergaenge werden im Audit-Trail protokolliert.
3. Der Upload-Lifecycle und die Upload-Referenz
Der Lifecycle beginnt mit der Anlage einer Datenquelle. Der Anlegevorgang erzeugt eine eindeutige Kennung fuer die Datenquelle und persistiert Pflichtattribute wie Bezeichnung, Quellsystem und zustaendige Organisationseinheit. Anschliessend erfolgt der Dateiupload, der eine neue Upload-Referenz unterhalb der Datenquelle erzeugt. Die Upload-Referenz traegt zusaetzlich zum Binaercontent technische Metadaten, die fuer die weitere Verarbeitung relevant sind. Dazu gehoeren:
- Erkanntes Dateiformat und Variante, beispielsweise CSV mit Semikolon-Trennung oder XLSX mit mehreren Arbeitsblaettern
- Erkannte Kodierung und Normalisierungsstatus
- Zeilenzahl und Spaltenzahl
- Pruefsumme zur Integritaetsverifikation
Nach erfolgreicher Persistenz der Upload-Referenz wird eine Vorberechnung angestossen. Diese extrahiert Headerzeilen, probiert Trennzeichen und identifiziert potenzielle Koordinatenspalten bei GeoJSON-artigen Inhalten. Erst nach Abschluss der Vorberechnung ist die Upload-Referenz fuer die Klassifizierung freigegeben.
4. Semantische Klassifizierung und AI-Inference
Die semantische Klassifizierung wird explizit als Inferenzvorgang gestartet. Der Aufruf nimmt die Kennung der Upload-Referenz als Parameter und uebergibt optional Steuerparameter wie den gewuenschten Konfidenzschwellenwert oder die Auswahl des Klassifizierungsmodells. Der Inferenzvorgang untersucht den Inhalt der Upload-Referenz auf mehreren Ebenen gleichzeitig:
- Strukturelle Ebene: Erkennung des Dateityps, der Spaltentrennung, der Kopfzeilen und der Datentypen pro Spalte
- Inhaltliche Ebene: Vergleich der Spaltenbezeichnungen, Zelleninhalte und Kontextinformationen gegen das Entitaetslexikon des Netzbetriebs
- Kontextuelle Ebene: Einbeziehung von Dateinamen, Blattbezeichnungen bei XLSX, Abschnittsueberschriften bei DOCX oder Feature-Namen bei GeoJSON
Das Ergebnis der AI-Inference ist eine Klassifizierung, die als eigenstaendige Ressource unter der Upload-Referenz abgelegt wird. Die Klassifizierung enthaelt fuer jedes erkannte Feld mindestens die folgenden Attribute:
- Quellattribut, beispielsweise Spaltenname A oder Feldname latitude
- Vorgeschlagene fachliche Entitaet, beispielsweise Messlokation, MaStR-ID oder Netzanschlusspunkt
- Konfidenzwert als normalisierte Zahl zwischen Null und Eins
- Alternative Entitaet mit sekundaerem Konfidenzwert
- Begruendung auf Basis der erkannten Muster
5. Feldmapping und Entitaetsextraktion
Das Feldmapping ist die zentrale Ausgabe der Klassifizierung, die fuer nachgelagerte Systeme konsumierbar ist. Es stellt die Bruecke zwischen technischem Eingangsformat und fachlichem Datenmodell dar. Ein typisches Feldmapping fuer eine CSV-Datei mit Anschlussadressen kann beispielsweise folgende Zuordnungen enthalten:
- Spalte Anlagen_ID wird auf MaStR-ID gemappt
- Spalte Adresse + Spalte PLZ + Spalte Ort werden auf Netzanschlusspunkt aggregiert
- Spalte Meter_ID wird auf Messlokation gemappt
- Spalte Marktlokationsnummer wird auf Marktlokation gemappt
- Spalte lat und Spalte lon werden auf GIS-Objekt zusammengefuehrt
- Spalte Pruefstatus wird auf Pruefregel verknuepft
Das Feldmapping unterstuetzt dabei nicht nur eins-zu-eins-Zuordnungen. Auch Transformationen wie Konkatenationen, Wertemappings und Einheitenkonvertierungen werden dokumentiert. Die Entitaetsextraktion aus DOCX-Dateien erfolgt abschnittsweise. Die Klassifizierung identifiziert Paragraph-Typen, tabellarische Einbettungen und semantische Regionen innerhalb des Dokuments und ordnet diese den jeweiligen Entitaeten zu. Bei GeoJSON-Dateien werden Feature-Properties den betriebsfachlichen Attributen gegenuebergestellt. Koordinatenreferenzsysteme werden erkannt und protokolliert.
6. Netzanschlusspunkt und GIS-Objekt
Im Netzbetrieb stellt der Netzanschlusspunkt eine zentrale Verknuepfungsentitaet dar. Die Klassifizierung versucht, aus den Quelldaten eindeutige Standortinformationen zu extrahieren und dem Netzanschlusspunkt zuzuordnen. Dabei werden Adresskomponenten, Geokoordinaten und interne Standortkennungen gleichberechtigt betrachtet. Wird ein GIS-Objekt erkannt, enthaelt das Feldmapping die Zuordnung der Geometrie und der zugehoerigen Sachattribute. Die API unterscheidet zwischen reinen Geokoordinaten, die aus CSV-Spalten extrahiert wurden, und nativen Geometrien in GeoJSON-Features. Bei CSV-eigenen Koordinatenpaaren wird das Koordinatenreferenzsystem in der Regel als WGS84 angenommen, sofern keine abweichende Metainformation vorliegt. Abweichungen werden explizit im Audit-Trail vermerkt.
7. Pruefregeln und Audit-Trail
Jede Klassifizierung unterliegt internen Pruefregeln. Diese Pruefregeln sind als ausfuehrbare Checks formuliert, die nach der Inferenz automatisch angewendet werden. Typische Pruefregeln umfassen:
- Pflichtfelderpruefung: Enthaelt das Feldmapping mindestens eine Marktlokation oder eine Messlokation?
- Eindeutigkeitspruefung: Sind die gemapten Identifikatoren innerhalb der Datei eindeutig?
- Wertebereichspruefung: Sind erkannte PLZ im gueltigen deutschen Format?
- Referenzierbarkeit: Lassen sich gemapte MaStR-IDs gegen das erwartete Format validieren?
- Konfidenzschwellenwert: Liegt die Klassifizierungskonfidenz unterhalb des geforderten Minimums?
Die Ergebnisse der Pruefregeln fliessen direkt in den Status der Klassifizierung ein. Ein Verstoss gegen eine Pflichtpruefregel fuehrt zu einem Status, der eine manuelle Freigabe erzwingt. Der Audit-Trail dokumentiert jeden Uebergang mit Zeitstempel, ausloesendem System und gegebenenfalls ausloesender Verantwortlicher Rolle. Die Nachvollziehbarkeit erstreckt sich vom Anlegen der Datenquelle ueber den Upload, die Inferenz, die Pruefregelausfuehrung bis zur manuellen Bestaetigung oder Korrektur.
8. Manuelle Bestaetigung und Korrektur
Die API sieht einen expliziten Bestaetigungsschritt vor. Nach Abschluss der automatischen Klassifizierung und der Pruefregelauswertung kann eine berechtigte Verantwortliche Rolle die Klassifizierung abrufen und anzeigen lassen. Im Rahmen der manuellen Pruefung stehen mehrere Interaktionsmoeglichkeiten zur Verfuegung:
- Bestaetigung des vorgeschlagenen Feldmappings im Ganzen
- Korrektur einzelner Feldzuordnungen, bei der eine vom System vorgeschlagene Entitaet durch eine andere ersetzt wird
- Ablehnung einzelner Zuordnungen bei Uneindeutigkeit
- Hinzufuegen nicht erkannter Felder, die das System als irrelevant eingestuft hat
- Kommentierung mit fachlichem Kontext
Jede manuelle Aenderung wird als neuer Eintrag im Audit-Trail persistiert und traegt die Kennung der durchfuehrenden Person oder des Systems. Nach Bestaetigung oder Korrektur wechselt die Klassifizierung in den Status freigegeben. Freigegebene Feldmappings koennen von nachgelagerten Prozessen, beispielsweise Import in das Netzinformationssystem oder Anreicherung der Kundenverwaltung, konsumiert werden.
9. Integrationsperspektive fuer Stadtwerke und Verteilnetzbetreiber
Fuer kommunale Stadtwerke und regionale Verteilnetzbetreiber ergeben sich durch den Einsatz der Datasource API konkrete Integrationsvorteile. Die standardisierte Schnittstelle ermoeglicht den Anschluss unterschiedlichster Quellsysteme ohne Anpassung der Kernlogik. Typische Quellsysteme sind:
- Kundeninformationssysteme mit Adress- und Vertragsdaten
- Geoinformationssysteme mit Leitungs- und Anschlussgeometrien
- Dokumentenmanagementsysteme mit Pruefberichten und Anschlussprotokollen
- Messwertverwaltungen mit Zaehler- und Messlokationsdaten
- Externe Dienstleister, die Lieferantenneutralitaetsdaten im XLSX-Format bereitstellen
Die Trennung von Datenquelle, Upload-Referenz und Klassifizierung erlaubt es, wiederkehrende Importe aus dem gleichen Quellsystem zu gruppieren und ueber Zeit zu vergleichen. Ein Audit-Trail, der sich ueber mehrere Upload-Versionen einer Datenquelle erstreckt, unterstuetzt die Fehleranalyse bei Datenqualitaetsaenderungen. Die Entitaetsfokussierung stellt sicher, dass Begriffe wie Marktlokation und Messlokation nicht synonym verwendet werden, sondern technisch klar unterschieden werden. Dies reduziert die Fehlerquote in nachgelagerten bilanzkreisrelevanten Prozessen.
10. Zusammenfassung
Die Cernion Datasource API bietet einen durchgaengigen, API-gestuetzten Workflow fuer die Erschliessung heterogener Betriebsdaten. Die klare Trennung zwischen Datenquelle, Upload-Referenz und Klassifizierung ermoeglicht eine detaillierte Nachvollziehbarkeit und Verantwortlichkeitszuordnung. Die semantische Klassifizierung mittels AI-Inference reduziert den manuellen Abstimmungsaufwand zwischen technischem Quellformat und fachlichem Zieldatenmodell. Die Pruefregeln stellen sicher, dass Mindestanforderungen an Datenqualitaet und Entitaetsvollstaendigkeit vor der Freigabe geprueft werden. Der explizite Bestaetigungsschritt mit manueller Korrekturmoeglichkeit bildet die Schnittstelle zwischen Automatisierung und fachlicher Verantwortung. Stadtwerke und Verteilnetzbetreiber profitieren insbesondere von der standardisierten Anbindung verschiedener Quellformate und der konsistenten Entitaetsklassifizierung im Kontext von Netzanschlusspunkt, MaStR-ID, Marktlokation, Messlokation und GIS-Objekt.
VollstÀndige PDF-Analyse anfordern
Geben Sie Ihre E-Mail Adresse ein, um die detaillierte Koppelpunkt-Analyse und Handlungsempfehlungen kostenfrei zu erhalten.