SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published 1 day ago • 10
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing Paper • 2601.17814 • Published Jan 25
Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs Paper • 2404.10160 • Published Apr 15, 2024
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment Paper • 2503.18991 • Published Mar 23, 2025
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent Paper • 2608.03979 • Published 1 day ago • 43
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation Paper • 2608.03092 • Published 1 day ago • 10
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System Paper • 2607.27380 • Published 8 days ago • 70
CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition Paper • 2607.25294 • Published 9 days ago • 49