Nutzung Multimodaler Daten
Aktualisiert: 2. Sept.

Am Beispiel der
Swiss Multiple Sclerosis Cohort (SMSC)
Datengetriebene Forschung erhält mit der rasanten Entwicklung von KI-basierten Technologien einen neuen Schub. Gleichzeitig steigen die Anforderungen an Datenqualität, Interoperabilität, Datenschutz und regulatorische Konformität. Der Weg von einer wissenschaftlichen Fragestellung zu belastbaren Resultaten wird also immer komplexer. Dennoch, die Bedeutung von Gesundheitsdaten für die Forschung ist enorm.
Gesundheitsdaten als Forschungsressource
Betrachtet man Gesundheitsdaten als Forschungsressource, so durchlaufen diese einen Lebenszyklus. Zumindest dann, wenn man ihr volles Potenzial ausschöpfen möchte. Daten werden heute noch dezentral in den unterschiedlichsten Primärsystemen erhoben und sind deshalb äusserst heterogen. Die gewinnbringende Nutzung dieser Daten geht weit über die reine Datenverwaltung hinaus und erfordert konzeptionelle Herangehensweisen.
Tatsächlich greifen beim Data-Lifecycle-Management zahlreiche Fachkompetenzen ineinander. Es braucht das Zusammenspiel von Methodenkompetenz, Fachwissen zu Erfassung, Aufbereitung und Analyse der Daten, fundierte regulatorische Kenntnisse sowie die Fähigkeit moderne Technologien zielführend einzusetzen. Ein tiefgreifendes Verständnis für die Spitalinfrastruktur und die vorhandenen Primärsysteme sind ausserdem eine Grundvoraussetzung.
Über die vergangenen 15 Jahre wurden diese Kompetenzen und Technologien am Departement Klinische Forschung (DKF) Basel in partnerschaftlicher Zusammenarbeit zwischen Forschenden und Scientific Services aufgebaut, sodass heute nicht nur klassische klinische Studien, sondern auch datengetriebene Forschungsprojekte bedarfsgerecht und von Fachpersonen durchgängig begleitet durchgeführt werden können.
Clinical Research Data Lifecycle
Jedes Forschungsprojekt erzeugt einen eigenen Datenfluss. Daten stammen heute häufig aus unterschiedlichsten Quellen: klinischen Studien, Registern, Kohorten, Biobanken, Laboren, Bildgebungsverfahren oder klinischen Informationssystemen. Damit aus diesen Daten wissenschaftliche Erkenntnisse entstehen können, müssen Daten zu analysierbaren Datensätzen zusammengeführt werden. Dafür müssen zahlreiche Schritte aufeinander abgestimmt werden.
Der «Clinical Research Data Lifecycle» beschreibt diesen Weg in zehn miteinander verbundenen Phasen.

Data Planning: Noch bevor die Datenerhebung beginnt, wird überlegt, woher diese stammen könnten und wie ihre Qualität überprüft werden kann.
Data Collection / Reception: Vorhandene Daten werden aus zahlreichen Quellen zusammengeführt und/oder gezielt in einer geeigneten Datenbank erfasst.
Data Cleaning / Centralised Monitoring: Eingehende Daten werden kontinuierlich kontrolliert, auf Probleme mit der Datenqualität kann frühzeitig reagiert werden.
Data Extraction / Data Export: Daten aus Erfassungssystemen und Datenlagern werden extrahiert und für die Verarbeitung vorbereitet.
Data Integration / Post-Processing: Daten aus verschiedenen Quellen werden zu einem auswertbaren Datensatz zusammengeführt und für die Nutzung, Weitergabe und Übertragung aufbereitet.
Data Analysis: Die Datenanalysen werden geplant, durchgeführt und ausgewertet; zunehmend kommen moderne Analysemethoden wie Machine Learning und KI zum Einsatz.
Data Anonymisation: Für eine sichere Weiterverwendung werden die Daten pseudonymisiert oder anonymisiert.
Publishing & Data Sharing: Die Ergebnisse werden für Publikationen aufbereitet, der Datenaustausch gemeinsam mit allen Beteiligten vorbereitet und durchgeführt.
Data Archiving: Die langfristige Archivierung der Daten wird in die Wege geleitet.
Model Storage Platform: Modelle für Berechnungen, Prognosen und explorative Visualisierungen werden auf einer Plattform festgehalten.
Jede dieser Phasen bringt eigene Herausforderungen mit sich. Fehler oder Qualitätsprobleme in frühen Schritten können sich durch den gesamten Prozess fortpflanzen. Nachträgliche Korrekturen und Bereinigungen verursachen erfahrungsgemäss Verzögerungen und enormen personellen Aufwand.
Für den Gesamtprozess sowie jede dieser Phasen bieten die Scientific Services am DKF Unterstützung und Begleitung.
Gute Forschung beginnt mit guter Planung
Bereits vor Studienbeginn müssen entscheidende Fragen beantwortet werden: Wie genau lautet die Forschungsfrage und welche Daten werden benötigt? Woher stammen sie und in welcher Form liegen sie vor? Wie wird ihre Qualität überprüft? Welche regulatorischen Anforderungen gelten?
Eine sorgfältige Datenplanung schafft die Grundlage für alle nachfolgenden Arbeitsschritte. Sie hilft dabei, Risiken frühzeitig zu erkennen, geeignete Datenquellen auszuwählen und Qualitätsmassnahmen festzulegen.
Datenqualität ist kein einmaliger Kontrollschritt
Viele Forschende denken bei Datenqualität zunächst an eine abschliessende Kontrolle kurz vor der Analyse. Tatsächlich beginnt Qualitätssicherung jedoch bereits bei der Datenerhebung und begleitet ein Projekt während seiner gesamten Laufzeit.
Mit Methoden des Centralised Monitorings können Auffälligkeiten, fehlende Werte oder ungewöhnliche Muster früh erkannt werden. Dadurch lassen sich Probleme beheben, bevor sie die Integrität einer Studie gefährden, und in Zukunft vermeiden. Datenqualität wird so zu einem kontinuierlichen Prozess statt zu einer nachträglichen Korrektur.
Wenn Datenquellen zusammenkommen
Moderne Forschungsprojekte kombinieren zunehmend Daten aus verschiedenen Systemen. Routinedaten aus dem Spital, Studiendaten aus elektronischen Datenerfassungssystemen wie REDCap® oder secuTrial®, Laborwerte, Registerdaten und Informationen aus Biobanken oder genetischen Analysen müssen technisch und organisatorisch zusammengeführt werden. Diese Integration erfordert nicht nur inhaltliche Expertise, sondern auch fundierte technische Kenntnisse der Schnittstellen und Datenstandards.
Am Universitätsspital Basel (USB) ist die Nutzung von gesundheitsbezogenen Personendaten für die Forschung einheitlich und gesetzeskonform geregelt. Eine geschulte Fachperson (Data Governance Coordinator) unterstützt Forschende dabei, aus verstreuten Datenquellen robuste und analysierbare Datensätze zu erhalten. Weitere Informationen [LInk]. Von der Analyse zu neuen Erkenntnissen
Der eigentliche wissenschaftliche Mehrwert entsteht, wenn Daten in robuste Erkenntnisse übersetzt werden können. Dazu gehören fundiertes statistischen Knowhow, der Einsatz moderner Methoden aus den Bereichen Statistik und Data Science, reproduzierbare Auswertungsprozesse und die kritische Interpretation der Ergebnisse.
Gleichzeitig gewinnen KI-gestützte Werkzeuge zunehmend an Bedeutung. Sie können Forschungsprozesse unterstützen, ersetzen jedoch nicht die fachliche Expertise. Deshalb investieren die Scientific Services des DKF gezielt in den Aufbau von Kompetenzen rund um künstliche Intelligenz, Automatisierung und moderne Datenwissenschaft.
Verantwortung endet nicht mit der Publikation
Nach der Analyse folgen weitere wichtige Schritte: Daten müssen in vielen Fällen datenschutzkonform anonymisiert werden, Forschungsergebnisse publiziert und Datensätze für eine spätere Nachnutzung oder internationale Kooperationen vorbereitet werden. Auch die langfristige Archivierung gewinnt zunehmend an Bedeutung, um Forschung nachvollziehbar und reproduzierbar zu machen.
Der Clinical Research Data Lifecycle endet deshalb nicht mit der Veröffentlichung einer Studie. Vielmehr schafft jede Forschungsarbeit die Grundlage für neue Fragestellungen und zukünftige Projekte.
Fazit: Die wachsende Bedeutung von Daten verändert die klinische Forschung grundlegend
Erfolgreiche Forschungsprojekte benötigen heute Fachwissen aus unterschiedlichen Bereichen sowie eine koordinierte Begleitung über den gesamten Datenprozess hinweg. Die einzelnen Fachbereiche der Scientific Services am DKF operieren vernetzt und gut aufeinander abgestimmt, um Forschenden die Unterstützung anzubieten, die sie für ihr jeweiliges Projekt benötigen. Denn konkrete Beispiele aus der Forschungspraxis zeigen, welche Herausforderungen auftreten können, welche Lösungen sich bewährt haben und wie aus Daten schliesslich wissenschaftliche Erkenntnisse entstehen.
Unter dem Label «Unlocking Data. Advancing Research.» berichten wir in den kommenden Monaten von datengetriebenen Forschungsprojekten am DKF – als Inspiration für alle, die Gesundheitsdaten ein zweites Leben geben möchten.

Kommentare