Βιβλιοθήκη ΟΠΑ - Ψηφιακό Αποθετήριο

ΠΥΞΙΔΑ Ιδρυματικό Αποθετήριο
και Ψηφιακή Βιβλιοθήκη

Όνομα χρήστη
Κωδικός πρόσβασης

Συλλογές :	Ιδρυματικό Αποθετήριο ΟΠΑ / AUEB Institutional Repository Σχολή Επιστημών και Τεχνολογίας της Πληροφορίας / School of Informatics Τμήμα Πληροφορικής / Department of Informatics Μεταπτυχιακές Εργασίες / Postgraduate dissertations

Τίτλος :	Reinforcement learning for semi-Markov decision processes with applications

Εναλλακτικός τίτλος :	Ενισχυτική μάθηση για ημι-Mαρκοβιανές διαδικασίες απόφασης με εφαρμογές

Δημιουργός :	Παλαιού, Κυριακή Palaiou, Kyriaki

Συντελεστής :	Trevezas, Samis (Επιβλέπων καθηγητής) Burnetas, Apostolos (Εξεταστής) Manou, Athanasia (Εξεταστής) Athens University of Economics and Business, Department of Informatics (Degree granting institution)

Τύπος :	Text

Φυσική περιγραφή :	68p.

Γλώσσα :	en

Αναγνωριστικό :	http://www.pyxida.aueb.gr/index.php?op=view_object&object_id=10676

Περίληψη :	Αυτή η διατριβή επικεντρώνεται στις ημι-Μαρκοβιανές Διαδικασίες Απόφασης και τη σχέση τους με την Ενισχυτική Μάθηση μέσω της τεχνικής Q-learning. Ξεκινάμε με τη συζήτηση ορισμένων γενικών ιδεών γύρω από τη Μηχανική Μάθηση, την Ενισχυτική Μάθηση και την Ιεραρχική Ενισχυτική Μάθηση. Συνεχίζουμε με μια ανάλυση της θεωρίας των Μαρκοβιανών Διαδικασιών από τη μαθηματική άποψη. Έπειτα, γενικεύουμε την προηγούμενη θεωρία σε συνεχές χρόνο, δηλαδή σε ημι-Μαρκοβιανές Διαδικασίες Απόφασης. Τέλος, παρουσιάζεται ένας αλγόριθμος Ενισχυτικής Μάθησης βασισμένος σε προσομοίωση για την επίλυση ημι-Μαρκοβιανών Διαδικασιών Απόφασης. Ειδικότερα, ο αλγόριθμος που αναπτύχθηκε εδώ ελέγχεται σε ένα πρόβλημα προληπτικής συντήρησης που αντιμετωπίζεται σε συστήματα παραγωγής-αποθήκευσης. This thesis focuses on semi-Markov decision processes and their connection with Reinforcement Learning via Q-learning technique. We start by discussing some general ideas around Machine Learning, Reinforcement Learning and Hierarchical Reinforcement Learning. We continue with an analysis of the theory of Markov Decision Processes from the mathematical point of view. After that, we generalize the previous theory into continuous time i.e. into the semi-Markov Decision Processes. Finally, it is presented a new simulation-based Reinforcement Learning algorithm for solving SMDPs. In particular, the algorithm developed here is tested on a preventive maintenance problem encountered in production-inventory (PI) systems.

Περίληψη :

Αυτή η διατριβή επικεντρώνεται στις ημι-Μαρκοβιανές Διαδικασίες Απόφασης και τη σχέση τους με την Ενισχυτική Μάθηση μέσω της τεχνικής Q-learning. Ξεκινάμε με τη συζήτηση ορισμένων γενικών ιδεών γύρω από τη Μηχανική Μάθηση, την Ενισχυτική Μάθηση και την Ιεραρχική Ενισχυτική Μάθηση. Συνεχίζουμε με μια ανάλυση της θεωρίας των Μαρκοβιανών Διαδικασιών από τη μαθηματική άποψη. Έπειτα, γενικεύουμε την προηγούμενη θεωρία σε συνεχές χρόνο, δηλαδή σε ημι-Μαρκοβιανές Διαδικασίες Απόφασης. Τέλος, παρουσιάζεται ένας αλγόριθμος Ενισχυτικής Μάθησης βασισμένος σε προσομοίωση για την επίλυση ημι-Μαρκοβιανών Διαδικασιών Απόφασης. Ειδικότερα, ο αλγόριθμος που αναπτύχθηκε εδώ ελέγχεται σε ένα πρόβλημα προληπτικής συντήρησης που αντιμετωπίζεται σε συστήματα παραγωγής-αποθήκευσης.
This thesis focuses on semi-Markov decision processes and their connection with Reinforcement Learning via Q-learning technique. We start by discussing some general ideas around Machine Learning, Reinforcement Learning and Hierarchical Reinforcement Learning. We continue with an analysis of the theory of Markov Decision Processes from the mathematical point of view. After that, we generalize the previous theory into continuous time i.e. into the semi-Markov Decision Processes. Finally, it is presented a new simulation-based Reinforcement Learning algorithm for solving SMDPs. In particular, the algorithm developed here is tested on a preventive maintenance problem encountered in production-inventory (PI) systems.

Λέξη κλειδί :	Ενισχυτική μάθηση Hμι-Μαρκοβιανές διαδικασίες απόφασης Συστήματα παραγωγής-αποθήκευσης Reinforcement learning Semi-Markov decision processes (SMDPs) Production-Inventory (PI) systems

Διαθέσιμο από :	2023-09-05 13:26:21

Ημερομηνία έκδοσης :	05-09-2023

Ημερομηνία κατάθεσης :	2023-09-05 13:26:21

Δικαιώματα χρήσης :	Free access

Άδεια χρήσης :

Αρχείο: Palaiou_2023.pdf

Τύπος: application/pdf

Είσοδος