Lehnert, Justin (2026) Evaluation von Reinforcement Learning zur Inferenz von Chemischen Reaktionsnetzwerken aus Zeitreihendaten. Masters thesis, Instutute for Visual and Analytic Computing, University of Rostock.
|
Text
Masterarbeit_Justin_Lehnert.pdf - Published Version Restricted to Registered users only Download (3MB) |
Abstract
Die simultane Inferenz von Struktur und Parametern hemischer Reaktionsnetzwerke aus beobachteten Konzentrationsverläufen ist ein kombinatorisch schweres inverses Problem von praktischer Relevanz. Viele chemische und biologische Systeme lassen sich als Reaktionsnetzwerke beschreiben, deren zeitliches Verhalten sich simulieren lässt, sobald das Netzwerk bekannt ist. In der Praxis ist jedoch oft nur das beobachtete Verhalten gegeben, während das zugrunde liegende Netzwerk unbekannt ist. Ein bestehender Ansatz, Reactmine, baut das Netzwerk schrittweise auf und durchsucht dazu einen mit der Netzwerkgröße exponentiell wachsenden Baum von Reaktionskombinationen. Daraus folgt ein Zielkonflikt zwischen gründlicher Suche und praktikabler Laufzeit und die Suche hängt von manuell festgelegten Bewertungsregeln und Parametern ab. Diese Arbeit untersucht, ob sich diese Suche durch Reinforcement Learning verbessern lässt. Der vorgeschlagene Ansatz PRINCE (Planned Reaction Inference via Neural Controlled Exploration) ersetzt die vollständige Baumsuche durch eine gelernte Strategie, welche die Exploration mit einem festen Rechenbudget auf ussichtsreiche Kombinationen lenkt und kombiniert diese mit Monte Carlo Tree Search. In der Auswertung auf synthetischen Netzwerken zweier Schwierigkeitsgrade erreicht PRINCE nicht die Genauigkeit von Reactmine. Auf einfachen Netzwerken ist der Abstand deutlich, auf schwereren Netzwerken fällt er in der Rekonstruktion des Zeitverhaltens geringer aus. Anders als Reactmine schließt PRINCE jede Instanz in beschränkter, planbarer Zeit ohne Zeitüberschreitung ab, während Reactmine auf schweren Netzwerken an der Laufzeit scheitert. Der gelernte Anteil verbessert die Rekonstruktion gegenüber einer einfachen gierigen Auswahl dort nicht, wo diese die Netzwerkstruktur verfehlt. Das Verfahren erreicht damit keine höhere Inferenzqualität als der bestehende Ansatz, bietet aber eine vorhersagbare Laufzeit, was mit Blick auf die Laufzeitschwäche von Reactmine ein teilweise positives Ergebnis darstellt. Die Ursachen der begrenzten Qualität lassen sich benennen und betreffen das verwendete Lernsignal, die Übertragung auf ungesehene Netzwerkstrukturen und die vorgelagerte Erzeugung der Reaktionskandidaten, woraus sich konkrete Ansatzpunkte für zukünftige Arbeiten ergeben.
| Item Type: | Thesis (Masters) |
|---|