VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Mengtian, Lu, Yuwei, Li, Feifei, Gan, Chenqi, Xie, Zhifeng, Wang, Xi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024)
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024)
ViPO: Visual Preference Optimization at Scale
von: Li, Ming, et al.
Veröffentlicht: (2026)
von: Li, Ming, et al.
Veröffentlicht: (2026)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
von: Yang, Songlin, et al.
Veröffentlicht: (2026)
von: Yang, Songlin, et al.
Veröffentlicht: (2026)
Visual Preference Optimization with Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026)
Multi-Sourced Compositional Generalization in Visual Question Answering
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)
SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control
von: Zhang, Zhida, et al.
Veröffentlicht: (2026)
von: Zhang, Zhida, et al.
Veröffentlicht: (2026)
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
von: Liang, Feng, et al.
Veröffentlicht: (2025)
von: Liang, Feng, et al.
Veröffentlicht: (2025)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
von: Li, Yuanshuai, et al.
Veröffentlicht: (2025)
von: Li, Yuanshuai, et al.
Veröffentlicht: (2025)
StageDesigner: Artistic Stage Generation for Scenography via Theater Scripts
von: Gan, Zhaoxing, et al.
Veröffentlicht: (2025)
von: Gan, Zhaoxing, et al.
Veröffentlicht: (2025)
Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approach For Long-Tailed Recognition
von: Zhang, Shuo, et al.
Veröffentlicht: (2026)
von: Zhang, Shuo, et al.
Veröffentlicht: (2026)
On the Adversarial Robustness of Camera-based 3D Object Detection
von: Xie, Shaoyuan, et al.
Veröffentlicht: (2023)
von: Xie, Shaoyuan, et al.
Veröffentlicht: (2023)
Interpretable Interaction Modeling for Trajectory Prediction via Agent Selection and Physical Coefficient
von: Huang, Shiji, et al.
Veröffentlicht: (2024)
von: Huang, Shiji, et al.
Veröffentlicht: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2025)
von: Yang, Xiaomeng, et al.
Veröffentlicht: (2025)
ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
von: Wang, Haonan, et al.
Veröffentlicht: (2025)
Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather
von: He, Zhijian, et al.
Veröffentlicht: (2025)
von: He, Zhijian, et al.
Veröffentlicht: (2025)
Can Vision-Language Models Replace Human Annotators: A Case Study with CelebA Dataset
von: Lu, Haoming, et al.
Veröffentlicht: (2024)
von: Lu, Haoming, et al.
Veröffentlicht: (2024)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
von: Xie, Yuxi, et al.
Veröffentlicht: (2024)
von: Xie, Yuxi, et al.
Veröffentlicht: (2024)
Hydra: Accurate Multi-Modal Leaf Wetness Sensing with mm-Wave and Camera Fusion
von: Liu, Yimeng, et al.
Veröffentlicht: (2025)
von: Liu, Yimeng, et al.
Veröffentlicht: (2025)
OmniCam: Unified Multimodal Video Generation via Camera Control
von: Yang, Xiaoda, et al.
Veröffentlicht: (2025)
von: Yang, Xiaoda, et al.
Veröffentlicht: (2025)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
von: Liu, Jiaxuan, et al.
Veröffentlicht: (2026)
von: Liu, Jiaxuan, et al.
Veröffentlicht: (2026)
Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation
von: Huang, Feizhen, et al.
Veröffentlicht: (2025)
von: Huang, Feizhen, et al.
Veröffentlicht: (2025)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
von: Du, Jie, et al.
Veröffentlicht: (2025)
von: Du, Jie, et al.
Veröffentlicht: (2025)
TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models
von: YU, Mark, et al.
Veröffentlicht: (2025)
von: YU, Mark, et al.
Veröffentlicht: (2025)
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
von: Liu, Xinxin, et al.
Veröffentlicht: (2026)
von: Liu, Xinxin, et al.
Veröffentlicht: (2026)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
von: Gao, Xinhang, et al.
Veröffentlicht: (2026)
von: Gao, Xinhang, et al.
Veröffentlicht: (2026)
Visual Space Optimization for Zero-shot Learning
von: Wang, Xinsheng, et al.
Veröffentlicht: (2019)
von: Wang, Xinsheng, et al.
Veröffentlicht: (2019)
Learning Active Perception via Self-Evolving Preference Optimization for GUI Grounding
von: Wang, Wanfu, et al.
Veröffentlicht: (2025)
von: Wang, Wanfu, et al.
Veröffentlicht: (2025)
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
von: Kim, Yeonju, et al.
Veröffentlicht: (2024)
von: Kim, Yeonju, et al.
Veröffentlicht: (2024)
CPO: Condition Preference Optimization for Controllable Image Generation
von: Lyu, Zonglin, et al.
Veröffentlicht: (2025)
von: Lyu, Zonglin, et al.
Veröffentlicht: (2025)
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
von: Li, Ziying, et al.
Veröffentlicht: (2025)
von: Li, Ziying, et al.
Veröffentlicht: (2025)
Red Teaming Visual Language Models
von: Li, Mukai, et al.
Veröffentlicht: (2024)
von: Li, Mukai, et al.
Veröffentlicht: (2024)
CheXPO: Preference Optimization for Chest X-ray VLMs with Counterfactual Rationale
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
von: Liang, Xiao, et al.
Veröffentlicht: (2025)
SHAPE : Self-Improved Visual Preference Alignment by Iteratively Generating Holistic Winner
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
von: Chen, Kejia, et al.
Veröffentlicht: (2025)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
von: Lei, Youbo, et al.
Veröffentlicht: (2023)
von: Lei, Youbo, et al.
Veröffentlicht: (2023)
LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization
von: Tang, Jiaqi, et al.
Veröffentlicht: (2025)
von: Tang, Jiaqi, et al.
Veröffentlicht: (2025)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
von: Li, Siyuan, et al.
Veröffentlicht: (2025)
von: Li, Siyuan, et al.
Veröffentlicht: (2025)
GaussianBody: Clothed Human Reconstruction via 3d Gaussian Splatting
von: Li, Mengtian, et al.
Veröffentlicht: (2024)
von: Li, Mengtian, et al.
Veröffentlicht: (2024)
Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space
von: Sun, Yuwei, et al.
Veröffentlicht: (2023)
von: Sun, Yuwei, et al.
Veröffentlicht: (2023)
CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference
von: Dong, Zhitong, et al.
Veröffentlicht: (2026)
von: Dong, Zhitong, et al.
Veröffentlicht: (2026)
SplaTraj: Camera Trajectory Generation with Semantic Gaussian Splatting
von: Liu, Xinyi, et al.
Veröffentlicht: (2024)
von: Liu, Xinyi, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
von: Xie, Zhifeng, et al.
Veröffentlicht: (2024) -
ViPO: Visual Preference Optimization at Scale
von: Li, Ming, et al.
Veröffentlicht: (2026) -
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
von: Yang, Songlin, et al.
Veröffentlicht: (2026) -
Visual Preference Optimization with Rubric Rewards
von: Yu, Ya-Qi, et al.
Veröffentlicht: (2026) -
Multi-Sourced Compositional Generalization in Visual Question Answering
von: Li, Chuanhao, et al.
Veröffentlicht: (2025)