Derek Shi, Ruben Glatt, Christine Klymko, Hongjun Choi, Shashank Kushwaha, Wesam A. Sakla, Felipe Leno da Silva. Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranked Feedback. Trans. Mach. Learn. Res., 2026, 2026. [doi]
Abstract is missing.