Sinan Ibrahim, Grégoire Ouerdane, Hadi Salloum, Henni Ouerdane, Stefan Streif, Pavel Osinenko. Benchmarking Reinforcement Learning via Stochastic Converse Optimality: Generating Systems With Known Optimal Policies. IEEE Control Systems Letters, 10:1321-1326, 2026. [doi]
Abstract is missing.