Video Diffusion Alignment via Reward Gradients. We improve a variety of video diffusion models such as VideoCrafter, OpenSora, ModelScope and StableVideoDiffusion by finetuning them using various reward models such as HPS, PickScore, VideoMAE, VJEPA, YOLO, Aesthetics etc.
reinforcement-learning alignment rl diffusion vader rlhf video-diffusion video-diffusion-alignment reinforcement-learning-human-feedback
-
Updated
Mar 12, 2025 - Python