RLJ Volumes 1–5 (2024) Published as part of RLJ 2024: Volumes 1–5, DOI: 10.5281/zenodo.13899776 .
Co-Learning Empirical Games & World Models Max Olan Smith, Michael P. Wellman ; 1:1−15, 2024. [abs ][pdf ][bib ][supp ]Improving Thompson Sampling via Information Relaxation for Budgeted Multi-armed Bandits Woojin Jeong, Seungki Min ; 1:16−28, 2024. [abs ][pdf ][bib ][supp ]Graph Neural Thompson Sampling Shuang Wu, Arash A. Amini ; 1:29−63, 2024. [abs ][pdf ][bib ][supp ]JoinGym: An Efficient Join Order Selection Environment Junxiong Wang, Kaiwen Wang, Yueying Li, Nathan Kallus, Immanuel Trummer, Wen Sun ; 1:64−91, 2024. [abs ][pdf ][bib ]An Open-Loop Baseline for Reinforcement Learning Locomotion Tasks Antonin Raffin, Olivier Sigaud, Jens Kober, Alin Albu-Schaeffer, João Silvério, Freek Stulp ; 1:92−107, 2024. [abs ][pdf ][bib ][supp ]Online Planning in POMDPs with State-Requests Raphaël Avalos, Eugenio Bargiacchi, Ann Nowe, Diederik Roijers, Frans A Oliehoek ; 1:108−129, 2024. [abs ][pdf ][bib ]A Recipe for Unbounded Data Augmentation in Visual Reinforcement Learning Abdulaziz Almuzairee, Nicklas Hansen, Henrik I Christensen ; 1:130−157, 2024. [abs ][pdf ][bib ]BetaZero: Belief-State Planning for Long-Horizon POMDPs using Learned Approximations Robert J. Moss, Anthony Corso, Jef Caers, Mykel Kochenderfer ; 1:158−181, 2024. [abs ][pdf ][bib ][supp ]Non-adaptive Online Finetuning for Offline Reinforcement Learning Audrey Huang, Mohammad Ghavamzadeh, Nan Jiang, Marek Petrik ; 1:182−197, 2024. [abs ][pdf ][bib ][supp ]Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning Nicholas E. Corrado, Yuxiao Qu, John U. Balis, Adam Labiosa, Josiah P. Hanna ; 1:198−215, 2024. [abs ][pdf ][bib ][supp ]Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs Michael Lu, Matin Aghaei, Anant Raj, Sharan Vaswani ; 1:216−282, 2024. [abs ][pdf ][bib ]Unifying Model-Based and Model-Free Reinforcement Learning with Equivalent Policy Sets Benjamin Freed, Thomas Wei, Roberto Calandra, Jeff Schneider, Howie Choset ; 1:283−301, 2024. [abs ][pdf ][bib ]The Role of Inherent Bellman Error in Offline Reinforcement Learning with Linear Function Approximation Noah Golowich, Ankur Moitra ; 1:302−341, 2024. [abs ][pdf ][bib ]Learning Action-based Representations Using Invariance Max Rudolph, Caleb Chuck, Kevin Black, Misha Lvovsky, Scott Niekum, Amy Zhang ; 1:342−365, 2024. [abs ][pdf ][bib ]Cyclicity-Regularized Coordination Graphs Oliver Järnefelt, Mahdi Kallel, Carlo D'Eramo ; 1:366−379, 2024. [abs ][pdf ][bib ][supp ]Assigning Credit with Partial Reward Decoupling in Multi-Agent Proximal Policy Optimization Aditya Kapoor, Benjamin Freed, Jeff Schneider, Howie Choset ; 1:380−399, 2024. [abs ][pdf ][bib ]OCAtari: Object-Centric Atari 2600 Reinforcement Learning Environments Quentin Delfosse, Jannis Blüml, Bjarne Gregori, Sebastian Sztwiertnia, Kristian Kersting ; 1:400−449, 2024. [abs ][pdf ][bib ]SplAgger: Split Aggregation for Meta-Reinforcement Learning Jacob Beck, Matthew Thomas Jackson, Risto Vuorio, Zheng Xiong, Shimon Whiteson ; 1:450−469, 2024. [abs ][pdf ][bib ]A Tighter Convergence Proof of Reverse Experience Replay Nan Jiang, Jinzhao Li, Yexiang Xue ; 1:470−480, 2024. [abs ][pdf ][bib ][supp ]Learning to Optimize for Reinforcement Learning Qingfeng Lan, A. Rupam Mahmood, Shuicheng YAN, Zhongwen Xu ; 2:481−497, 2024. [abs ][pdf ][bib ]Multi-view Disentanglement for Reinforcement Learning with Multiple Cameras Mhairi Dunion, Stefano V Albrecht ; 2:498−515, 2024. [abs ][pdf ][bib ]Planning to Go Out-of-Distribution in Offline-to-Online Reinforcement Learning Trevor McInroe, Adam Jelley, Stefano V Albrecht, Amos Storkey ; 2:516−546, 2024. [abs ][pdf ][bib ]Surprise-Adaptive Intrinsic Motivation for Unsupervised Reinforcement Learning Adriana Hugessen, Roger Creus Castanyer, Faisal Mohamed, Glen Berseth ; 2:547−562, 2024. [abs ][pdf ][bib ]Mitigating the Curse of Horizon in Monte-Carlo Returns Alex Ayoub, David Szepesvari, Francesco Zanini, Bryan Chan, Dhawal Gupta, Bruno Castro da Silva, Dale Schuurmans ; 2:563−572, 2024. [abs ][pdf ][bib ]A Simple Mixture Policy Parameterization for Improving Sample Efficiency of CVaR Optimization Yudong Luo, Yangchen Pan, Han Wang, Philip Torr, Pascal Poupart ; 2:573−592, 2024. [abs ][pdf ][bib ][supp ]ROIL: Robust Offline Imitation Learning without Trajectories Gersi Doko, Guang Yang, Daniel S. Brown, Marek Petrik ; 2:593−605, 2024. [abs ][pdf ][bib ][supp ]Harnessing Discrete Representations for Continual Reinforcement Learning Edan Jacob Meyer, Adam White, Marlos C. Machado ; 2:606−628, 2024. [abs ][pdf ][bib ][supp ]Three Dogmas of Reinforcement Learning David Abel, Mark K Ho, Anna Harutyunyan ; 2:629−644, 2024. [abs ][pdf ][bib ]Policy Gradient with Active Importance Sampling Matteo Papini, Giorgio Manganini, Alberto Maria Metelli, Marcello Restelli ; 2:645−675, 2024. [abs ][pdf ][bib ]The Limits of Pure Exploration in POMDPs: When the Observation Entropy is Enough Riccardo Zamboni, Duilio Cirino, Marcello Restelli, Mirco Mutti ; 2:676−692, 2024. [abs ][pdf ][bib ]Physics-Informed Model and Hybrid Planning for Efficient Dyna-Style Reinforcement Learning Zakariae EL ASRI, Olivier Sigaud, Nicolas THOME ; 2:693−713, 2024. [abs ][pdf ][bib ][supp ]Trust-based Consensus in Multi-Agent Reinforcement Learning Systems Ho Long Fung, Victor-Alexandru Darvariu, Stephen Hailes, Mirco Musolesi ; 2:714−732, 2024. [abs ][pdf ][bib ][supp ]Bidirectional-Reachable Hierarchical Reinforcement Learning with Mutually Responsive Policies Yu Luo, Fuchun Sun, Tianying Ji, Xianyuan Zhan ; 2:733−762, 2024. [abs ][pdf ][bib ][supp ]Informed POMDP: Leveraging Additional Information in Model-Based RL Gaspard Lambrechts, Adrien Bolland, Damien Ernst ; 2:763−784, 2024. [abs ][pdf ][bib ]An Optimal Tightness Bound for the Simulation Lemma Sam Lobel, Ronald Parr ; 2:785−797, 2024. [abs ][pdf ][bib ]Best Response Shaping Milad Aghajohari, Tim Cooijmans, Juan Agustin Duque, Shunichi Akatsuka, Aaron Courville ; 2:798−818, 2024. [abs ][pdf ][bib ]A Provably Efficient Option-Based Algorithm for both High-Level and Low-Level Learning Gianluca Drappo, Alberto Maria Metelli, Marcello Restelli ; 2:819−839, 2024. [abs ][pdf ][bib ][supp ]SwiftTD: A Fast and Robust Algorithm for Temporal Difference Learning Khurram Javed, Arsalan Sharifnassab, Richard S. Sutton ; 2:840−863, 2024. [abs ][pdf ][bib ]The Cliff of Overcommitment with Policy Gradient Step Sizes Scott M. Jordan, Samuel Neumann, James E. Kostas, Adam White, Philip S. Thomas ; 2:864−883, 2024. [abs ][pdf ][bib ]Multistep Inverse Is Not All You Need Alexander Levine, Peter Stone, Amy Zhang ; 2:884−925, 2024. [abs ][pdf ][bib ]Contextualized Hybrid Ensemble Q-learning: Learning Fast with Control Priors Emma Cramer, Bernd Frauenknecht, Ramil Sabirov, Sebastian Trimpe ; 2:926−945, 2024. [abs ][pdf ][bib ][supp ]Sequential Decision-Making for Inline Text Autocomplete Rohan Chitnis, Shentao Yang, Alborz Geramifard ; 2:946−960, 2024. [abs ][pdf ][bib ]Exploring Uncertainty in Distributional Reinforcement Learning Georgy Antonov, Peter Dayan ; 2:961−978, 2024. [abs ][pdf ][bib ]Robotic Manipulation Datasets for Offline Compositional Reinforcement Learning Marcel Hussing, Jorge Mendez-Mendez, Anisha Singrodia, Cassandra Kent, Eric Eaton ; 2:979−994, 2024. [abs ][pdf ][bib ]Dissecting Deep RL with High Update Ratios: Combatting Value Divergence Marcel Hussing, Claas A Voelcker, Igor Gilitschenski, Amir-massoud Farahmand, Eric Eaton ; 2:995−1018, 2024. [abs ][pdf ][bib ]Demystifying the Recency Heuristic in Temporal-Difference Learning Brett Daley, Marlos C. Machado, Martha White ; 3:1019−1036, 2024. [abs ][pdf ][bib ]On the consistency of hyper-parameter selection in value-based deep reinforcement learning Johan Samir Obando Ceron, João Guilherme Madeira Araújo, Aaron Courville, Pablo Samuel Castro ; 3:1037−1059, 2024. [abs ][pdf ][bib ][supp ]Value Internalization: Learning and Generalizing from Social Reward Frieda Rong, Max Kleiman-Weiner ; 3:1060−1071, 2024. [abs ][pdf ][bib ]Mixture of Experts in a Mixture of RL settings Timon Willi, Johan Samir Obando Ceron, Jakob Nicolaus Foerster, Gintare Karolina Dziugaite, Pablo Samuel Castro ; 3:1072−1105, 2024. [abs ][pdf ][bib ]Aquatic Navigation: A Challenging Benchmark for Deep Reinforcement Learning Davide Corsi, Davide Camponogara, Alessandro Farinelli ; 3:1106−1123, 2024. [abs ][pdf ][bib ][supp ]On Welfare-Centric Fair Reinforcement Learning Cyrus Cousins, Kavosh Asadi, Elita Lobo, Michael Littman ; 3:1124−1137, 2024. [abs ][pdf ][bib ][supp ]Inverse Reinforcement Learning with Multiple Planning Horizons Jiayu Yao, Weiwei Pan, Finale Doshi-Velez, Barbara E Engelhardt ; 3:1138−1167, 2024. [abs ][pdf ][bib ]Constant Stepsize Q-learning: Distributional Convergence, Bias and Extrapolation Yixuan Zhang, Qiaomin Xie ; 3:1168−1210, 2024. [abs ][pdf ][bib ]More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling Haque Ishfaq, Yixin Tan, Yu Yang, Qingfeng Lan, Jianfeng Lu, A. Rupam Mahmood, Doina Precup, Pan Xu ; 3:1211−1235, 2024. [abs ][pdf ][bib ]Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis Qining Zhang, Honghao Wei, Lei Ying ; 3:1236−1251, 2024. [abs ][pdf ][bib ][supp ]A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage Kevin Tan, Ziping Xu ; 3:1252−1264, 2024. [abs ][pdf ][bib ][supp ]Tiered Reward: Designing Rewards for Specification and Fast Learning of Desired Behavior Zhiyuan Zhou, Shreyas Sundara Raman, Henry Sowerby, Michael Littman ; 3:1265−1288, 2024. [abs ][pdf ][bib ][supp ]Enabling Intelligent Interactions between an Agent and an LLM: A Reinforcement Learning Approach Bin Hu, Chenyang Zhao, Pu Zhang, Zihao Zhou, Yuanhang Yang, Zenglin Xu, Bin Liu ; 3:1289−1305, 2024. [abs ][pdf ][bib ]An Idiosyncrasy of Time-discretization in Reinforcement Learning Kris De Asis, Richard S. Sutton ; 3:1306−1316, 2024. [abs ][pdf ][bib ]Dreaming of Many Worlds: Learning Contextual World Models aids Zero-Shot Generalization Sai Prasanna, Karim Farid, Raghu Rajan, André Biedenkapp ; 3:1317−1350, 2024. [abs ][pdf ][bib ]Policy Gradient Algorithms with Monte Carlo Tree Learning for Non-Markov Decision Processes Tetsuro Morimura, Kazuhiro Ota, Kenshi Abe, Peinan Zhang ; 3:1351−1376, 2024. [abs ][pdf ][bib ][supp ]Offline Diversity Maximization under Imitation Constraints Marin Vlastelica, Jin Cheng, Georg Martius, Pavel Kolev ; 3:1377−1409, 2024. [abs ][pdf ][bib ]Zero-shot cross-modal transfer of Reinforcement Learning policies through a Global Workspace Léopold Maytié, Benjamin Devillers, Alexandre Arnold, Rufin VanRullen ; 3:1410−1426, 2024. [abs ][pdf ][bib ]Stabilizing Extreme Q-learning by Maclaurin Expansion Motoki Omura, Takayuki Osa, YUSUKE Mukuta, Tatsuya Harada ; 3:1427−1440, 2024. [abs ][pdf ][bib ]Combining Automated Optimisation of Hyperparameters and Reward Shape Julian Dierkes, Emma Cramer, Holger Hoos, Sebastian Trimpe ; 3:1441−1466, 2024. [abs ][pdf ][bib ]Sample Complexity of Offline Distributionally Robust Linear Markov Decision Processes He Wang, Laixi Shi, Yuejie Chi ; 3:1467−1510, 2024. [abs ][pdf ][bib ]PASTA: Pretrained Action-State Transformer Agents Raphael Boige, Yannis Flet-Berliac, Lars C.P.M. Quaedvlieg, Arthur Flajolet, Guillaume Richard, Thomas PIERROT ; 3:1511−1532, 2024. [abs ][pdf ][bib ]Cost Aware Best Arm Identification Kellen Kanarios, Qining Zhang, Lei Ying ; 4:1533−1545, 2024. [abs ][pdf ][bib ][supp ]ICU-Sepsis: A Benchmark MDP Built from Real Medical Data Kartik Choudhary, Dhawal Gupta, Philip S. Thomas ; 4:1546−1566, 2024. [abs ][pdf ][bib ][supp ]When does Self-Prediction help? Understanding Auxiliary Tasks in Reinforcement Learning Claas A Voelcker, Tyler Kastner, Igor Gilitschenski, Amir-massoud Farahmand ; 4:1567−1597, 2024. [abs ][pdf ][bib ]ROER: Regularized Optimal Experience Replay Changling Li, Zhang-Wei Hong, Pulkit Agrawal, Divyansh Garg, Joni Pajarinen ; 4:1598−1618, 2024. [abs ][pdf ][bib ][supp ]Combining Reconstruction and Contrastive Methods for Multimodal Representations in RL Philipp Becker, Sebastian Mossburger, Fabian Otto, Gerhard Neumann ; 4:1619−1655, 2024. [abs ][pdf ][bib ][supp ]RL for Consistency Models: Reward Guided Text-to-Image Generation with Fast Inference Owen Oertell, Jonathan Daniel Chang, Yiyi Zhang, Kianté Brantley, Wen Sun ; 4:1656−1673, 2024. [abs ][pdf ][bib ][supp ]A Super-human Vision-based Reinforcement Learning Agent for Autonomous Racing in Gran Turismo Miguel Vasco, Takuma Seno, Kenta Kawamoto, Kaushik Subramanian, Peter R. Wurman, Peter Stone ; 4:1674−1710, 2024. [abs ][pdf ][bib ]Bad Habits: Policy Confounding and Out-of-Trajectory Generalization in RL Miguel Suau, Matthijs T. J. Spaan, Frans A Oliehoek ; 4:1711−1732, 2024. [abs ][pdf ][bib ]Learning Abstract World Models for Value-preserving Planning with Options Rafael Rodriguez-Sanchez, George Konidaris ; 4:1733−1758, 2024. [abs ][pdf ][bib ]Verification-Guided Shielding for Deep Reinforcement Learning Davide Corsi, Guy Amir, Andoni Rodríguez, Guy Katz, César Sánchez, Roy Fox ; 4:1759−1780, 2024. [abs ][pdf ][bib ]Learning Discrete World Models for Heuristic Search Forest Agostinelli, Misagh Soltani ; 4:1781−1792, 2024. [abs ][pdf ][bib ]Distributionally Robust Constrained Reinforcement Learning under Strong Duality Zhengfei Zhang, Kishan Panaganti, Laixi Shi, Yanan Sui, Adam Wierman, Yisong Yue ; 4:1793−1821, 2024. [abs ][pdf ][bib ][supp ]Representation Alignment from Human Feedback for Cross-Embodiment Reward Learning from Mixed-Quality Demonstrations Connor Mattson, Anurag Sidharth Aribandi, Daniel S. Brown ; 4:1822−1840, 2024. [abs ][pdf ][bib ]Revisiting Sparse Rewards for Goal-Reaching Reinforcement Learning Gautham Vasan, Yan Wang, Fahim Shahriar, James Bergstra, Martin Jägersand, A. Rupam Mahmood ; 4:1841−1854, 2024. [abs ][pdf ][bib ][supp ]Policy-Guided Diffusion Matthew Thomas Jackson, Michael Matthews, Cong Lu, Benjamin Ellis, Shimon Whiteson, Jakob Nicolaus Foerster ; 4:1855−1872, 2024. [abs ][pdf ][bib ]Agent-Centric Human Demonstrations Train World Models James Staley, Elaine Short, Shivam Goel, Yash Shukla ; 4:1873−1886, 2024. [abs ][pdf ][bib ][supp ]Can Differentiable Decision Trees Enable Interpretable Reward Learning from Human Feedback? Akansha Kalra, Daniel S. Brown ; 4:1887−1910, 2024. [abs ][pdf ][bib ][supp ]Imitation Learning from Observation through Optimal Transport Wei-Di Chang, Scott Fujimoto, David Meger, Gregory Dudek ; 4:1911−1923, 2024. [abs ][pdf ][bib ][supp ]Light-weight Probing of Unsupervised Representations for Reinforcement Learning Wancong Zhang, Anthony GX-Chen, Vlad Sobal, Yann LeCun, Nicolas Carion ; 4:1924−1949, 2024. [abs ][pdf ][bib ]Quantifying Interaction Level Between Agents Helps Cost-efficient Generalization in Multi-agent Reinforcement Learning Yuxin Chen, Chen Tang, Thomas Tian, Chenran Li, Jinning Li, Masayoshi Tomizuka, Wei Zhan ; 4:1950−1964, 2024. [abs ][pdf ][bib ][supp ]Shield Decomposition for Safe Reinforcement Learning in General Partially Observable Multi-Agent Environments Daniel Melcer, Christopher Amato, Stavros Tripakis ; 4:1965−1994, 2024. [abs ][pdf ][bib ][supp ]Reward Centering Abhishek Naik, Yi Wan, Manan Tomar, Richard S. Sutton ; 4:1995−2016, 2024. [abs ][pdf ][bib ]MultiHyRL: Robust Hybrid RL for Obstacle Avoidance against Adversarial Attacks on the Observation Space Jan de Priester, Zachary Bell, Prashant Ganesh, Ricardo Sanfelice ; 4:2017−2040, 2024. [abs ][pdf ][bib ]Investigating the Interplay of Prioritized Replay and Generalization Parham Mohammad Panahi, Andrew Patterson, Martha White, Adam White ; 5:2041−2058, 2024. [abs ][pdf ][bib ]Towards General Negotiation Strategies with End-to-End Reinforcement Learning Bram M. Renting, Thomas M. Moerland, Holger Hoos, Catholijn M Jonker ; 5:2059−2070, 2024. [abs ][pdf ][bib ]PID Accelerated Temporal Difference Algorithms Mark Bedaywi, Amin Rakhsha, Amir-massoud Farahmand ; 5:2071−2095, 2024. [abs ][pdf ][bib ]States as goal-directed concepts: an epistemic approach to state-representation learning Nadav Amir, Yael Niv, Angela J Langdon ; 5:2096−2106, 2024. [abs ][pdf ][bib ]Posterior Sampling for Continuing Environments Wanqiao Xu, Shi Dong, Benjamin Van Roy ; 5:2107−2122, 2024. [abs ][pdf ][bib ]Reinforcement Learning from Delayed Observations via World Models Armin Karamzade, Kyungmin Kim, Montek Kalsi, Roy Fox ; 5:2123−2139, 2024. [abs ][pdf ][bib ]Offline Reinforcement Learning from Datasets with Structured Non-Stationarity Johannes Ackermann, Takayuki Osa, Masashi Sugiyama ; 5:2140−2161, 2024. [abs ][pdf ][bib ]Resource Usage Evaluation of Discrete Model-Free Deep Reinforcement Learning Algorithms Olivia P. Dizon-Paradis, Stephen E. Wormald, Daniel E. Capecci, Avanti Bhandarkar, Damon L. Woodard ; 5:2162−2177, 2024. [abs ][pdf ][bib ]D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning Rafael Rafailov, Kyle Beltran Hatch, Anikait Singh, Aviral Kumar, Laura Smith, Ilya Kostrikov, Philippe Hansen-Estruch, Victor Kolev, Philip J. Ball, Jiajun Wu, Sergey Levine, Chelsea Finn ; 5:2178−2197, 2024. [abs ][pdf ][bib ]Weight Clipping for Deep Continual and Reinforcement Learning Mohamed Elsayed, Qingfeng Lan, Clare Lyle, A. Rupam Mahmood ; 5:2198−2217, 2024. [abs ][pdf ][bib ]A Batch Sequential Halving Algorithm without Performance Degradation Sotetsu Koyamada, Soichiro Nishimori, Shin Ishii ; 5:2218−2232, 2024. [abs ][pdf ][bib ]Causal Contextual Bandits with Adaptive Context Rahul Madhavan, Aurghya Maiti, Gaurav Sinha, Siddharth Barman ; 5:2233−2263, 2024. [abs ][pdf ][bib ][supp ]Policy Architectures for Compositional Generalization in Control Allan Zhou, Vikash Kumar, Chelsea Finn, Aravind Rajeswaran ; 5:2264−2283, 2024. [abs ][pdf ][bib ]Semi-Supervised One Shot Imitation Learning Philipp Wu, Kourosh Hakhamaneshi, Yuqing Du, Igor Mordatch, Aravind Rajeswaran, Pieter Abbeel ; 5:2284−2297, 2024. [abs ][pdf ][bib ]Cross-environment Hyperparameter Tuning for Reinforcement Learning Andrew Patterson, Samuel Neumann, Raksha Kumaraswamy, Martha White, Adam White ; 5:2298−2319, 2024. [abs ][pdf ][bib ]Human-compatible driving agents through data-regularized self-play reinforcement learning Daphne Cornelisse, Eugene Vinitsky ; 5:2320−2344, 2024. [abs ][pdf ][bib ]Inception: Efficiently Computable Misinformation Attacks on Markov Games Jeremy McMahan, Young Wu, Yudong Chen, Jerry Zhu, Qiaomin Xie ; 5:2345−2358, 2024. [abs ][pdf ][bib ]Learning to Navigate in Mazes with Novel Layouts using Abstract Top-down Maps Linfeng Zhao, Lawson L.S. Wong ; 5:2359−2372, 2024. [abs ][pdf ][bib ]Boosting Soft Q-Learning by Bounding Jacob Adamczyk, Volodymyr Makarenko, Stas Tiomkin, Rahul V Kulkarni ; 5:2373−2399, 2024. [abs ][pdf ][bib ]Bandits with Multimodal Structure Hassan SABER, Odalric-Ambrym Maillard ; 5:2400−2439, 2024. [abs ][pdf ][bib ]Bounding-Box Inference for Error-Aware Model-Based Reinforcement Learning Erin J Talvitie, Zilei Shao, Huiying Li, Jinghan Hu, Jacob Boerma, Rory Zhao, Xintong Wang ; 5:2440−2460, 2024. [abs ][pdf ][bib ]Non-stationary Bandits and Meta-Learning with a Small Set of Optimal Arms Javad Azizi, Thang Duong, Yasin Abbasi-Yadkori, András György, Claire Vernade, Mohammad Ghavamzadeh ; 5:2461−2491, 2024. [abs ][pdf ][bib ]Optimizing Rewards while meeting $\omega$-regular Constraints Christopher Zeitler, Kristina Miller, Sayan Mitra, John Schierman, Mahesh Viswanathan ; 5:2492−2514, 2024. [abs ][pdf ][bib ]