Home Page

Papers

Submissions

Editorial Board

Search

Contact

Publication Agreement

RLJ Volumes 1–5 (2024)

Published as part of RLJ 2024: Volumes 1–5, DOI: 10.5281/zenodo.13899776.

Co-Learning Empirical Games & World Models
Max Olan Smith, Michael P. Wellman; 1:1−15, 2024.
[abs][pdf][][supp]
Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits
Woojin Jeong, Seungki Min; 1:16−28, 2024.
[abs][pdf][][supp]
Graph Neural Thompson Sampling
Shuang Wu, Arash A. Amini; 1:29−63, 2024.
[abs][pdf][][supp]
JoinGym: An Efficient Join Order Selection Environment
Junxiong Wang, Kaiwen Wang, Yueying Li, Nathan Kallus, Immanuel Trummer, Wen Sun; 1:64−91, 2024.
[abs][pdf][]
An Open-Loop Baseline for Reinforcement Learning Locomotion Tasks
Antonin Raffin, Olivier Sigaud, Jens Kober, Alin Albu-Schaeffer, João Silvério, Freek Stulp; 1:92−107, 2024.
[abs][pdf][][supp]
Online Planning in POMDPs with State-Requests
Raphaël Avalos, Eugenio Bargiacchi, Ann Nowe, Diederik Roijers, Frans A Oliehoek; 1:108−129, 2024.
[abs][pdf][]
A Recipe for Unbounded Data Augmentation in Visual Reinforcement Learning
Abdulaziz Almuzairee, Nicklas Hansen, Henrik I Christensen; 1:130−157, 2024.
[abs][pdf][]
BetaZero: Belief-State Planning for Long-Horizon POMDPs using Learned Approximations
Robert J. Moss, Anthony Corso, Jef Caers, Mykel Kochenderfer; 1:158−181, 2024.
[abs][pdf][][supp]
Non-adaptive Online Finetuning for Offline Reinforcement Learning
Audrey Huang, Mohammad Ghavamzadeh, Nan Jiang, Marek Petrik; 1:182−197, 2024.
[abs][pdf][][supp]
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning
Nicholas E. Corrado, Yuxiao Qu, John U. Balis, Adam Labiosa, Josiah P. Hanna; 1:198−215, 2024.
[abs][pdf][][supp]
Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs
Michael Lu, Matin Aghaei, Anant Raj, Sharan Vaswani; 1:216−282, 2024.
[abs][pdf][]
Unifying Model-Based and Model-Free Reinforcement Learning with Equivalent Policy Sets
Benjamin Freed, Thomas Wei, Roberto Calandra, Jeff Schneider, Howie Choset; 1:283−301, 2024.
[abs][pdf][]
The Role of Inherent Bellman Error in Offline Reinforcement Learning with Linear Function Approximation
Noah Golowich, Ankur Moitra; 1:302−341, 2024.
[abs][pdf][]
Learning Action-based Representations Using Invariance
Max Rudolph, Caleb Chuck, Kevin Black, Misha Lvovsky, Scott Niekum, Amy Zhang; 1:342−365, 2024.
[abs][pdf][]
Cyclicity-Regularized Coordination Graphs
Oliver Järnefelt, Mahdi Kallel, Carlo D'Eramo; 1:366−379, 2024.
[abs][pdf][][supp]
Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization
Aditya Kapoor, Benjamin Freed, Jeff Schneider, Howie Choset; 1:380−399, 2024.
[abs][pdf][]
OCAtari: Object-Centric Atari 2600 Reinforcement Learning Environments
Quentin Delfosse, Jannis Blüml, Bjarne Gregori, Sebastian Sztwiertnia, Kristian Kersting; 1:400−449, 2024.
[abs][pdf][]
SplAgger: Split Aggregation for Meta-Reinforcement Learning
Jacob Beck, Matthew Thomas Jackson, Risto Vuorio, Zheng Xiong, Shimon Whiteson; 1:450−469, 2024.
[abs][pdf][]
A Tighter Convergence Proof of Reverse Experience Replay
Nan Jiang, Jinzhao Li, Yexiang Xue; 1:470−480, 2024.
[abs][pdf][][supp]
Learning to Optimize for Reinforcement Learning
Qingfeng Lan, A. Rupam Mahmood, Shuicheng YAN, Zhongwen Xu; 2:481−497, 2024.
[abs][pdf][]
Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras
Mhairi Dunion, Stefano V Albrecht; 2:498−515, 2024.
[abs][pdf][]
Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning
Trevor McInroe, Adam Jelley, Stefano V Albrecht, Amos Storkey; 2:516−546, 2024.
[abs][pdf][]
Surprise-Adaptive Intrinsic Motivation for Unsupervised Reinforcement Learning
Adriana Hugessen, Roger Creus Castanyer, Faisal Mohamed, Glen Berseth; 2:547−562, 2024.
[abs][pdf][]
Mitigating the Curse of Horizon in Monte-Carlo Returns
Alex Ayoub, David Szepesvari, Francesco Zanini, Bryan Chan, Dhawal Gupta, Bruno Castro da Silva, Dale Schuurmans; 2:563−572, 2024.
[abs][pdf][]
A Simple Mixture Policy Parameterization for Improving Sample Efficiency of CVaR Optimization
Yudong Luo, Yangchen Pan, Han Wang, Philip Torr, Pascal Poupart; 2:573−592, 2024.
[abs][pdf][][supp]
ROIL: Robust Offline Imitation Learning without Trajectories
Gersi Doko, Guang Yang, Daniel S. Brown, Marek Petrik; 2:593−605, 2024.
[abs][pdf][][supp]
Harnessing Discrete Representations for Continual Reinforcement Learning
Edan Jacob Meyer, Adam White, Marlos C. Machado; 2:606−628, 2024.
[abs][pdf][][supp]
Three Dogmas of Reinforcement Learning
David Abel, Mark K Ho, Anna Harutyunyan; 2:629−644, 2024.
[abs][pdf][]
Policy Gradient with Active Importance Sampling
Matteo Papini, Giorgio Manganini, Alberto Maria Metelli, Marcello Restelli; 2:645−675, 2024.
[abs][pdf][]
The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough
Riccardo Zamboni, Duilio Cirino, Marcello Restelli, Mirco Mutti; 2:676−692, 2024.
[abs][pdf][]
Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning
Zakariae EL ASRI, Olivier Sigaud, Nicolas THOME; 2:693−713, 2024.
[abs][pdf][][supp]
Trust-based Consensus in Multi-Agent Reinforcement Learning Systems
Ho Long Fung, Victor-Alexandru Darvariu, Stephen Hailes, Mirco Musolesi; 2:714−732, 2024.
[abs][pdf][][supp]
Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies
Yu Luo, Fuchun Sun, Tianying Ji, Xianyuan Zhan; 2:733−762, 2024.
[abs][pdf][][supp]
Informed POMDP: Leveraging Additional Information in Model-Based RL
Gaspard Lambrechts, Adrien Bolland, Damien Ernst; 2:763−784, 2024.
[abs][pdf][]
An Optimal Tightness Bound for the Simulation Lemma
Sam Lobel, Ronald Parr; 2:785−797, 2024.
[abs][pdf][]
Best Response Shaping
Milad Aghajohari, Tim Cooijmans, Juan Agustin Duque, Shunichi Akatsuka, Aaron Courville; 2:798−818, 2024.
[abs][pdf][]
A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning
Gianluca Drappo, Alberto Maria Metelli, Marcello Restelli; 2:819−839, 2024.
[abs][pdf][][supp]
SwiftTD: A Fast and Robust Algorithm for Temporal Difference Learning
Khurram Javed, Arsalan Sharifnassab, Richard S. Sutton; 2:840−863, 2024.
[abs][pdf][]
The Cliff of Overcommitment with Policy Gradient Step Sizes
Scott M. Jordan, Samuel Neumann, James E. Kostas, Adam White, Philip S. Thomas; 2:864−883, 2024.
[abs][pdf][]
Multistep Inverse Is Not All You Need
Alexander Levine, Peter Stone, Amy Zhang; 2:884−925, 2024.
[abs][pdf][]
Contextualized Hybrid Ensemble Q-learning: Learning Fast with Control Priors
Emma Cramer, Bernd Frauenknecht, Ramil Sabirov, Sebastian Trimpe; 2:926−945, 2024.
[abs][pdf][][supp]
Sequential Decision-Making for Inline Text Autocomplete
Rohan Chitnis, Shentao Yang, Alborz Geramifard; 2:946−960, 2024.
[abs][pdf][]
Exploring Uncertainty in Distributional Reinforcement Learning
Georgy Antonov, Peter Dayan; 2:961−978, 2024.
[abs][pdf][]
Robotic Manipulation Datasets for Offline Compositional Reinforcement Learning
Marcel Hussing, Jorge Mendez-Mendez, Anisha Singrodia, Cassandra Kent, Eric Eaton; 2:979−994, 2024.
[abs][pdf][]
Dissecting Deep RL with High Update Ratios: Combatting Value Divergence
Marcel Hussing, Claas A Voelcker, Igor Gilitschenski, Amir-massoud Farahmand, Eric Eaton; 2:995−1018, 2024.
[abs][pdf][]
Demystifying the Recency Heuristic in Temporal-Difference Learning
Brett Daley, Marlos C. Machado, Martha White; 3:1019−1036, 2024.
[abs][pdf][]
On the consistency of hyper-parameter selection in value-based deep reinforcement learning
Johan Samir Obando Ceron, João Guilherme Madeira Araújo, Aaron Courville, Pablo Samuel Castro; 3:1037−1059, 2024.
[abs][pdf][][supp]
Value Internalization: Learning and Generalizing from Social Reward
Frieda Rong, Max Kleiman-Weiner; 3:1060−1071, 2024.
[abs][pdf][]
Mixture of Experts in a Mixture of RL settings
Timon Willi, Johan Samir Obando Ceron, Jakob Nicolaus Foerster, Gintare Karolina Dziugaite, Pablo Samuel Castro; 3:1072−1105, 2024.
[abs][pdf][]
Aquatic Navigation: A Challenging Benchmark for Deep Reinforcement Learning
Davide Corsi, Davide Camponogara, Alessandro Farinelli; 3:1106−1123, 2024.
[abs][pdf][][supp]
On Welfare-Centric Fair Reinforcement Learning
Cyrus Cousins, Kavosh Asadi, Elita Lobo, Michael Littman; 3:1124−1137, 2024.
[abs][pdf][][supp]
Inverse Reinforcement Learning with Multiple Planning Horizons
Jiayu Yao, Weiwei Pan, Finale Doshi-Velez, Barbara E Engelhardt; 3:1138−1167, 2024.
[abs][pdf][]
Constant Stepsize Q-learning: Distributional Convergence, Bias and Extrapolation
Yixuan Zhang, Qiaomin Xie; 3:1168−1210, 2024.
[abs][pdf][]
More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling
Haque Ishfaq, Yixin Tan, Yu Yang, Qingfeng Lan, Jianfeng Lu, A. Rupam Mahmood, Doina Precup, Pan Xu; 3:1211−1235, 2024.
[abs][pdf][]
Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis
Qining Zhang, Honghao Wei, Lei Ying; 3:1236−1251, 2024.
[abs][pdf][][supp]
A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage
Kevin Tan, Ziping Xu; 3:1252−1264, 2024.
[abs][pdf][][supp]
Tiered Reward: Designing Rewards for Specification and Fast Learning of Desired Behavior
Zhiyuan Zhou, Shreyas Sundara Raman, Henry Sowerby, Michael Littman; 3:1265−1288, 2024.
[abs][pdf][][supp]
Enabling Intelligent Interactions between an Agent and an LLM: A Reinforcement Learning Approach
Bin Hu, Chenyang Zhao, Pu Zhang, Zihao Zhou, Yuanhang Yang, Zenglin Xu, Bin Liu; 3:1289−1305, 2024.
[abs][pdf][]
An Idiosyncrasy of Time-discretization in Reinforcement Learning
Kris De Asis, Richard S. Sutton; 3:1306−1316, 2024.
[abs][pdf][]
Dreaming of Many Worlds: Learning Contextual World Models aids Zero-Shot Generalization
Sai Prasanna, Karim Farid, Raghu Rajan, André Biedenkapp; 3:1317−1350, 2024.
[abs][pdf][]
Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes
Tetsuro Morimura, Kazuhiro Ota, Kenshi Abe, Peinan Zhang; 3:1351−1376, 2024.
[abs][pdf][][supp]
Offline Diversity Maximization under Imitation Constraints
Marin Vlastelica, Jin Cheng, Georg Martius, Pavel Kolev; 3:1377−1409, 2024.
[abs][pdf][]
Zero-shot cross-modal transfer of Reinforcement Learning policies through a Global Workspace
Léopold Maytié, Benjamin Devillers, Alexandre Arnold, Rufin VanRullen; 3:1410−1426, 2024.
[abs][pdf][]
Stabilizing Extreme Q-learning by Maclaurin Expansion
Motoki Omura, Takayuki Osa, YUSUKE Mukuta, Tatsuya Harada; 3:1427−1440, 2024.
[abs][pdf][]
Combining Automated Optimisation of Hyperparameters and Reward Shape
Julian Dierkes, Emma Cramer, Holger Hoos, Sebastian Trimpe; 3:1441−1466, 2024.
[abs][pdf][]
Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes
He Wang, Laixi Shi, Yuejie Chi; 3:1467−1510, 2024.
[abs][pdf][]
PASTA: Pretrained Action-State Transformer Agents
Raphael Boige, Yannis Flet-Berliac, Lars C.P.M. Quaedvlieg, Arthur Flajolet, Guillaume Richard, Thomas PIERROT; 3:1511−1532, 2024.
[abs][pdf][]
Cost Aware Best Arm Identification
Kellen Kanarios, Qining Zhang, Lei Ying; 4:1533−1545, 2024.
[abs][pdf][][supp]
ICU-Sepsis: A Benchmark MDP Built from Real Medical Data
Kartik Choudhary, Dhawal Gupta, Philip S. Thomas; 4:1546−1566, 2024.
[abs][pdf][][supp]
When does Self-Prediction help? Understanding Auxiliary Tasks in Reinforcement Learning
Claas A Voelcker, Tyler Kastner, Igor Gilitschenski, Amir-massoud Farahmand; 4:1567−1597, 2024.
[abs][pdf][]
ROER: Regularized Optimal Experience Replay
Changling Li, Zhang-Wei Hong, Pulkit Agrawal, Divyansh Garg, Joni Pajarinen; 4:1598−1618, 2024.
[abs][pdf][][supp]
Combining Reconstruction and Contrastive Methods for Multimodal Representations in RL
Philipp Becker, Sebastian Mossburger, Fabian Otto, Gerhard Neumann; 4:1619−1655, 2024.
[abs][pdf][][supp]
RL for Consistency Models: Reward Guided Text-to-Image Generation with Fast Inference
Owen Oertell, Jonathan Daniel Chang, Yiyi Zhang, Kianté Brantley, Wen Sun; 4:1656−1673, 2024.
[abs][pdf][][supp]
A Super-human Vision-based Reinforcement Learning Agent for Autonomous Racing in Gran Turismo
Miguel Vasco, Takuma Seno, Kenta Kawamoto, Kaushik Subramanian, Peter R. Wurman, Peter Stone; 4:1674−1710, 2024.
[abs][pdf][]
Bad Habits: Policy Confounding and Out-of-Trajectory Generalization in RL
Miguel Suau, Matthijs T. J. Spaan, Frans A Oliehoek; 4:1711−1732, 2024.
[abs][pdf][]
Learning Abstract World Models for Value-preserving Planning with Options
Rafael Rodriguez-Sanchez, George Konidaris; 4:1733−1758, 2024.
[abs][pdf][]
Verification-Guided Shielding for Deep Reinforcement Learning
Davide Corsi, Guy Amir, Andoni Rodríguez, Guy Katz, César Sánchez, Roy Fox; 4:1759−1780, 2024.
[abs][pdf][]
Learning Discrete World Models for Heuristic Search
Forest Agostinelli, Misagh Soltani; 4:1781−1792, 2024.
[abs][pdf][]
Distributionally Robust Constrained Reinforcement Learning under Strong Duality
Zhengfei Zhang, Kishan Panaganti, Laixi Shi, Yanan Sui, Adam Wierman, Yisong Yue; 4:1793−1821, 2024.
[abs][pdf][][supp]
Representation Alignment from Human Feedback for Cross-Embodiment Reward Learning from Mixed-Quality Demonstrations
Connor Mattson, Anurag Sidharth Aribandi, Daniel S. Brown; 4:1822−1840, 2024.
[abs][pdf][]
Revisiting Sparse Rewards for Goal-Reaching Reinforcement Learning
Gautham Vasan, Yan Wang, Fahim Shahriar, James Bergstra, Martin Jägersand, A. Rupam Mahmood; 4:1841−1854, 2024.
[abs][pdf][][supp]
Policy-Guided Diffusion
Matthew Thomas Jackson, Michael Matthews, Cong Lu, Benjamin Ellis, Shimon Whiteson, Jakob Nicolaus Foerster; 4:1855−1872, 2024.
[abs][pdf][]
Agent-Centric Human Demonstrations Train World Models
James Staley, Elaine Short, Shivam Goel, Yash Shukla; 4:1873−1886, 2024.
[abs][pdf][][supp]
Can Differentiable Decision Trees Enable Interpretable Reward Learning from Human Feedback?
Akansha Kalra, Daniel S. Brown; 4:1887−1910, 2024.
[abs][pdf][][supp]
Imitation Learning from Observation through Optimal Transport
Wei-Di Chang, Scott Fujimoto, David Meger, Gregory Dudek; 4:1911−1923, 2024.
[abs][pdf][][supp]
Light-weight Probing of Unsupervised Representations for Reinforcement Learning
Wancong Zhang, Anthony GX-Chen, Vlad Sobal, Yann LeCun, Nicolas Carion; 4:1924−1949, 2024.
[abs][pdf][]
Quantifying Interaction Level Between Agents Helps Cost-efficient Generalization in Multi-agent Reinforcement Learning
Yuxin Chen, Chen Tang, Thomas Tian, Chenran Li, Jinning Li, Masayoshi Tomizuka, Wei Zhan; 4:1950−1964, 2024.
[abs][pdf][][supp]
Shield Decomposition for Safe Reinforcement Learning in General Partially Observable Multi-Agent Environments
Daniel Melcer, Christopher Amato, Stavros Tripakis; 4:1965−1994, 2024.
[abs][pdf][][supp]
Reward Centering
Abhishek Naik, Yi Wan, Manan Tomar, Richard S. Sutton; 4:1995−2016, 2024.
[abs][pdf][]
MultiHyRL: Robust Hybrid RL for Obstacle Avoidance against Adversarial Attacks on the Observation Space
Jan de Priester, Zachary Bell, Prashant Ganesh, Ricardo Sanfelice; 4:2017−2040, 2024.
[abs][pdf][]
Investigating the Interplay of Prioritized Replay and Generalization
Parham Mohammad Panahi, Andrew Patterson, Martha White, Adam White; 5:2041−2058, 2024.
[abs][pdf][]
Towards General Negotiation Strategies with End-to-End Reinforcement Learning
Bram M. Renting, Thomas M. Moerland, Holger Hoos, Catholijn M Jonker; 5:2059−2070, 2024.
[abs][pdf][]
PID Accelerated Temporal Difference Algorithms
Mark Bedaywi, Amin Rakhsha, Amir-massoud Farahmand; 5:2071−2095, 2024.
[abs][pdf][]
States as goal-directed concepts: an epistemic approach to state-representation learning
Nadav Amir, Yael Niv, Angela J Langdon; 5:2096−2106, 2024.
[abs][pdf][]
Posterior Sampling for Continuing Environments
Wanqiao Xu, Shi Dong, Benjamin Van Roy; 5:2107−2122, 2024.
[abs][pdf][]
Reinforcement Learning from Delayed Observations via World Models
Armin Karamzade, Kyungmin Kim, Montek Kalsi, Roy Fox; 5:2123−2139, 2024.
[abs][pdf][]
Offline Reinforcement Learning from Datasets with Structured Non-Stationarity
Johannes Ackermann, Takayuki Osa, Masashi Sugiyama; 5:2140−2161, 2024.
[abs][pdf][]
Resource Usage Evaluation of Discrete Model-Free Deep Reinforcement Learning Algorithms
Olivia P. Dizon-Paradis, Stephen E. Wormald, Daniel E. Capecci, Avanti Bhandarkar, Damon L. Woodard; 5:2162−2177, 2024.
[abs][pdf][]
D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning
Rafael Rafailov, Kyle Beltran Hatch, Anikait Singh, Aviral Kumar, Laura Smith, Ilya Kostrikov, Philippe Hansen-Estruch, Victor Kolev, Philip J. Ball, Jiajun Wu, Sergey Levine, Chelsea Finn; 5:2178−2197, 2024.
[abs][pdf][]
Weight Clipping for Deep Continual and Reinforcement Learning
Mohamed Elsayed, Qingfeng Lan, Clare Lyle, A. Rupam Mahmood; 5:2198−2217, 2024.
[abs][pdf][]
A Batch Sequential Halving Algorithm without Performance Degradation
Sotetsu Koyamada, Soichiro Nishimori, Shin Ishii; 5:2218−2232, 2024.
[abs][pdf][]
Causal Contextual Bandits with Adaptive Context
Rahul Madhavan, Aurghya Maiti, Gaurav Sinha, Siddharth Barman; 5:2233−2263, 2024.
[abs][pdf][][supp]
Policy Architectures for Compositional Generalization in Control
Allan Zhou, Vikash Kumar, Chelsea Finn, Aravind Rajeswaran; 5:2264−2283, 2024.
[abs][pdf][]
Semi-Supervised One Shot Imitation Learning
Philipp Wu, Kourosh Hakhamaneshi, Yuqing Du, Igor Mordatch, Aravind Rajeswaran, Pieter Abbeel; 5:2284−2297, 2024.
[abs][pdf][]
Cross-environment Hyperparameter Tuning for Reinforcement Learning
Andrew Patterson, Samuel Neumann, Raksha Kumaraswamy, Martha White, Adam White; 5:2298−2319, 2024.
[abs][pdf][]
Human-compatible driving agents through data-regularized self-play reinforcement learning
Daphne Cornelisse, Eugene Vinitsky; 5:2320−2344, 2024.
[abs][pdf][]
Inception: Efficiently Computable Misinformation Attacks on Markov Games
Jeremy McMahan, Young Wu, Yudong Chen, Jerry Zhu, Qiaomin Xie; 5:2345−2358, 2024.
[abs][pdf][]
Learning to Navigate in Mazes with Novel Layouts using Abstract Top-down Maps
Linfeng Zhao, Lawson L.S. Wong; 5:2359−2372, 2024.
[abs][pdf][]
Boosting Soft Q-Learning by Bounding
Jacob Adamczyk, Volodymyr Makarenko, Stas Tiomkin, Rahul V Kulkarni; 5:2373−2399, 2024.
[abs][pdf][]
Bandits with Multimodal Structure
Hassan SABER, Odalric-Ambrym Maillard; 5:2400−2439, 2024.
[abs][pdf][]
Bounding-Box Inference for Error-Aware Model-Based Reinforcement Learning
Erin J Talvitie, Zilei Shao, Huiying Li, Jinghan Hu, Jacob Boerma, Rory Zhao, Xintong Wang; 5:2440−2460, 2024.
[abs][pdf][]
Non-stationary Bandits and Meta-Learning with a Small Set of Optimal Arms
Javad Azizi, Thang Duong, Yasin Abbasi-Yadkori, András György, Claire Vernade, Mohammad Ghavamzadeh; 5:2461−2491, 2024.
[abs][pdf][]
Optimizing Rewards while meeting $\omega$-regular Constraints
Christopher Zeitler, Kristina Miller, Sayan Mitra, John Schierman, Mahesh Viswanathan; 5:2492−2514, 2024.
[abs][pdf][]