Semantische Klassifizierung von Betriebsdaten ueber die Cernion Datasource API

Technischer Ueberblick zur REST-basierten Erschliessung heterogener Dateiformate fuer Netzbetrieb und Anschlusspruefung mit Fokus auf Entitaetsklassifizierung, Feldmapping und Audit-Trail.

1. Problemstellung im Betriebskontext

Netzbetreiber und kommunale Versorgungsunternehmen verarbeiten taeglich Daten aus heterogenen Quellen. Typische Eingangsdaten umfassen tabellarische Listen in CSV- oder XLSX-Format, raeumliche Informationen in GeoJSON sowie strukturierte Dokumente in DOCX. Die inhaltliche Erschliessung dieser Dateien erfolgt in klassischen Prozessen durch manuelle Erfassung, halbautomatisierte Importroutinen oder bruchstueckhafte Skriptloesungen. Dies fuehrt zu Inkonsistenzen bei der Entitaetsidentifizierung, insbesondere wenn Begriffe wie Netzanschlusspunkt, Marktlokation, Messlokation oder MaStR-ID in unterschiedlichen Spaltenbezeichnungen, Dateinamen oder Dokumentenkontexten auftreten. Die Cernion Energy Tools stellen mit der Datasource API einen standardisierten REST-Endpunkt bereit, der Upload, semantische Klassifizierung, manuelle Pruefung und Bestaetigung in einem durchgaengigen Lifecycle abbildet.

2. Grundbegriffe der API-Architektur

Die API operiert mit einer klaren Hierarchie von Ressourcen. Jede Datenquelle wird als eigene Entitaet gefuehrt. Die Datenquelle traegt Metadaten zu Quellsystem, Erstellungszeitpunkt und Verantwortlicher Rolle. Unterhalb der Datenquelle werden Upload-Referenzen gebildet, welche eine konkrete Dateiabbildung darstellen. Jede Upload-Referenz enthaelt technische Attribute wie Dateiformat, Pruefsumme, Zeichensatz und Zeilenzahl. Die Klassifizierung bildet die dritte Ebene der Hierarchie. Sie beschreibt das Ergebnis der automatischen Analyse einer Upload-Referenz durch das interne Klassifizierungsmodell. Eine Klassifizierung ordnet die erkannten Spalten, Felder oder Dokumentensegmente den fachlichen Entitaeten des Netzbetriebs zu. Das Feldmapping dokumentiert, welche technischen Quellattribute auf welche fachlichen Zielfelder abgebildet wurden. Saemtliche Zustandsuebergaenge werden im Audit-Trail protokolliert.

3. Der Upload-Lifecycle und die Upload-Referenz

Der Lifecycle beginnt mit der Anlage einer Datenquelle. Der Anlegevorgang erzeugt eine eindeutige Kennung fuer die Datenquelle und persistiert Pflichtattribute wie Bezeichnung, Quellsystem und zustaendige Organisationseinheit. Anschliessend erfolgt der Dateiupload, der eine neue Upload-Referenz unterhalb der Datenquelle erzeugt. Die Upload-Referenz traegt zusaetzlich zum Binaercontent technische Metadaten, die fuer die weitere Verarbeitung relevant sind. Dazu gehoeren:

Nach erfolgreicher Persistenz der Upload-Referenz wird eine Vorberechnung angestossen. Diese extrahiert Headerzeilen, probiert Trennzeichen und identifiziert potenzielle Koordinatenspalten bei GeoJSON-artigen Inhalten. Erst nach Abschluss der Vorberechnung ist die Upload-Referenz fuer die Klassifizierung freigegeben.

4. Semantische Klassifizierung und AI-Inference

Die semantische Klassifizierung wird explizit als Inferenzvorgang gestartet. Der Aufruf nimmt die Kennung der Upload-Referenz als Parameter und uebergibt optional Steuerparameter wie den gewuenschten Konfidenzschwellenwert oder die Auswahl des Klassifizierungsmodells. Der Inferenzvorgang untersucht den Inhalt der Upload-Referenz auf mehreren Ebenen gleichzeitig:

Das Ergebnis der AI-Inference ist eine Klassifizierung, die als eigenstaendige Ressource unter der Upload-Referenz abgelegt wird. Die Klassifizierung enthaelt fuer jedes erkannte Feld mindestens die folgenden Attribute:

5. Feldmapping und Entitaetsextraktion

Das Feldmapping ist die zentrale Ausgabe der Klassifizierung, die fuer nachgelagerte Systeme konsumierbar ist. Es stellt die Bruecke zwischen technischem Eingangsformat und fachlichem Datenmodell dar. Ein typisches Feldmapping fuer eine CSV-Datei mit Anschlussadressen kann beispielsweise folgende Zuordnungen enthalten:

Das Feldmapping unterstuetzt dabei nicht nur eins-zu-eins-Zuordnungen. Auch Transformationen wie Konkatenationen, Wertemappings und Einheitenkonvertierungen werden dokumentiert. Die Entitaetsextraktion aus DOCX-Dateien erfolgt abschnittsweise. Die Klassifizierung identifiziert Paragraph-Typen, tabellarische Einbettungen und semantische Regionen innerhalb des Dokuments und ordnet diese den jeweiligen Entitaeten zu. Bei GeoJSON-Dateien werden Feature-Properties den betriebsfachlichen Attributen gegenuebergestellt. Koordinatenreferenzsysteme werden erkannt und protokolliert.

6. Netzanschlusspunkt und GIS-Objekt

Im Netzbetrieb stellt der Netzanschlusspunkt eine zentrale Verknuepfungsentitaet dar. Die Klassifizierung versucht, aus den Quelldaten eindeutige Standortinformationen zu extrahieren und dem Netzanschlusspunkt zuzuordnen. Dabei werden Adresskomponenten, Geokoordinaten und interne Standortkennungen gleichberechtigt betrachtet. Wird ein GIS-Objekt erkannt, enthaelt das Feldmapping die Zuordnung der Geometrie und der zugehoerigen Sachattribute. Die API unterscheidet zwischen reinen Geokoordinaten, die aus CSV-Spalten extrahiert wurden, und nativen Geometrien in GeoJSON-Features. Bei CSV-eigenen Koordinatenpaaren wird das Koordinatenreferenzsystem in der Regel als WGS84 angenommen, sofern keine abweichende Metainformation vorliegt. Abweichungen werden explizit im Audit-Trail vermerkt.

7. Pruefregeln und Audit-Trail

Jede Klassifizierung unterliegt internen Pruefregeln. Diese Pruefregeln sind als ausfuehrbare Checks formuliert, die nach der Inferenz automatisch angewendet werden. Typische Pruefregeln umfassen:

Die Ergebnisse der Pruefregeln fliessen direkt in den Status der Klassifizierung ein. Ein Verstoss gegen eine Pflichtpruefregel fuehrt zu einem Status, der eine manuelle Freigabe erzwingt. Der Audit-Trail dokumentiert jeden Uebergang mit Zeitstempel, ausloesendem System und gegebenenfalls ausloesender Verantwortlicher Rolle. Die Nachvollziehbarkeit erstreckt sich vom Anlegen der Datenquelle ueber den Upload, die Inferenz, die Pruefregelausfuehrung bis zur manuellen Bestaetigung oder Korrektur.

8. Manuelle Bestaetigung und Korrektur

Die API sieht einen expliziten Bestaetigungsschritt vor. Nach Abschluss der automatischen Klassifizierung und der Pruefregelauswertung kann eine berechtigte Verantwortliche Rolle die Klassifizierung abrufen und anzeigen lassen. Im Rahmen der manuellen Pruefung stehen mehrere Interaktionsmoeglichkeiten zur Verfuegung:

Jede manuelle Aenderung wird als neuer Eintrag im Audit-Trail persistiert und traegt die Kennung der durchfuehrenden Person oder des Systems. Nach Bestaetigung oder Korrektur wechselt die Klassifizierung in den Status freigegeben. Freigegebene Feldmappings koennen von nachgelagerten Prozessen, beispielsweise Import in das Netzinformationssystem oder Anreicherung der Kundenverwaltung, konsumiert werden.

9. Integrationsperspektive fuer Stadtwerke und Verteilnetzbetreiber

Fuer kommunale Stadtwerke und regionale Verteilnetzbetreiber ergeben sich durch den Einsatz der Datasource API konkrete Integrationsvorteile. Die standardisierte Schnittstelle ermoeglicht den Anschluss unterschiedlichster Quellsysteme ohne Anpassung der Kernlogik. Typische Quellsysteme sind:

Die Trennung von Datenquelle, Upload-Referenz und Klassifizierung erlaubt es, wiederkehrende Importe aus dem gleichen Quellsystem zu gruppieren und ueber Zeit zu vergleichen. Ein Audit-Trail, der sich ueber mehrere Upload-Versionen einer Datenquelle erstreckt, unterstuetzt die Fehleranalyse bei Datenqualitaetsaenderungen. Die Entitaetsfokussierung stellt sicher, dass Begriffe wie Marktlokation und Messlokation nicht synonym verwendet werden, sondern technisch klar unterschieden werden. Dies reduziert die Fehlerquote in nachgelagerten bilanzkreisrelevanten Prozessen.

10. Zusammenfassung

Die Cernion Datasource API bietet einen durchgaengigen, API-gestuetzten Workflow fuer die Erschliessung heterogener Betriebsdaten. Die klare Trennung zwischen Datenquelle, Upload-Referenz und Klassifizierung ermoeglicht eine detaillierte Nachvollziehbarkeit und Verantwortlichkeitszuordnung. Die semantische Klassifizierung mittels AI-Inference reduziert den manuellen Abstimmungsaufwand zwischen technischem Quellformat und fachlichem Zieldatenmodell. Die Pruefregeln stellen sicher, dass Mindestanforderungen an Datenqualitaet und Entitaetsvollstaendigkeit vor der Freigabe geprueft werden. Der explizite Bestaetigungsschritt mit manueller Korrekturmoeglichkeit bildet die Schnittstelle zwischen Automatisierung und fachlicher Verantwortung. Stadtwerke und Verteilnetzbetreiber profitieren insbesondere von der standardisierten Anbindung verschiedener Quellformate und der konsistenten Entitaetsklassifizierung im Kontext von Netzanschlusspunkt, MaStR-ID, Marktlokation, Messlokation und GIS-Objekt.

VollstÀndige PDF-Analyse anfordern

Geben Sie Ihre E-Mail Adresse ein, um die detaillierte Koppelpunkt-Analyse und Handlungsempfehlungen kostenfrei zu erhalten.