Salvato in:
| Autori principali: | Li, Mengtian, Lu, Yuwei, Li, Feifei, Gan, Chenqi, Xie, Zhifeng, Wang, Xi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2604.02467 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
di: Xie, Zhifeng, et al.
Pubblicazione: (2024)
di: Xie, Zhifeng, et al.
Pubblicazione: (2024)
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
di: Yang, Songlin, et al.
Pubblicazione: (2026)
di: Yang, Songlin, et al.
Pubblicazione: (2026)
ViPO: Visual Preference Optimization at Scale
di: Li, Ming, et al.
Pubblicazione: (2026)
di: Li, Ming, et al.
Pubblicazione: (2026)
Visual Preference Optimization with Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026)
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
di: Liang, Feng, et al.
Pubblicazione: (2025)
di: Liang, Feng, et al.
Pubblicazione: (2025)
StageDesigner: Artistic Stage Generation for Scenography via Theater Scripts
di: Gan, Zhaoxing, et al.
Pubblicazione: (2025)
di: Gan, Zhaoxing, et al.
Pubblicazione: (2025)
Multi-Sourced Compositional Generalization in Visual Question Answering
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
di: Li, Chuanhao, et al.
Pubblicazione: (2025)
SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control
di: Zhang, Zhida, et al.
Pubblicazione: (2026)
di: Zhang, Zhida, et al.
Pubblicazione: (2026)
Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approach For Long-Tailed Recognition
di: Zhang, Shuo, et al.
Pubblicazione: (2026)
di: Zhang, Shuo, et al.
Pubblicazione: (2026)
Mitigating Visual Hallucinations via Semantic Curriculum Preference Optimization in MLLMs
di: Li, Yuanshuai, et al.
Pubblicazione: (2025)
di: Li, Yuanshuai, et al.
Pubblicazione: (2025)
Interpretable Interaction Modeling for Trajectory Prediction via Agent Selection and Physical Coefficient
di: Huang, Shiji, et al.
Pubblicazione: (2024)
di: Huang, Shiji, et al.
Pubblicazione: (2024)
On the Adversarial Robustness of Camera-based 3D Object Detection
di: Xie, Shaoyuan, et al.
Pubblicazione: (2023)
di: Xie, Shaoyuan, et al.
Pubblicazione: (2023)
Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather
di: He, Zhijian, et al.
Pubblicazione: (2025)
di: He, Zhijian, et al.
Pubblicazione: (2025)
Can Vision-Language Models Replace Human Annotators: A Case Study with CelebA Dataset
di: Lu, Haoming, et al.
Pubblicazione: (2024)
di: Lu, Haoming, et al.
Pubblicazione: (2024)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
di: Yang, Xiaomeng, et al.
Pubblicazione: (2025)
Hydra: Accurate Multi-Modal Leaf Wetness Sensing with mm-Wave and Camera Fusion
di: Liu, Yimeng, et al.
Pubblicazione: (2025)
di: Liu, Yimeng, et al.
Pubblicazione: (2025)
Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation
di: Huang, Feizhen, et al.
Pubblicazione: (2025)
di: Huang, Feizhen, et al.
Pubblicazione: (2025)
ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding
di: Wang, Haonan, et al.
Pubblicazione: (2025)
di: Wang, Haonan, et al.
Pubblicazione: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
di: Xie, Yuxi, et al.
Pubblicazione: (2024)
OmniCam: Unified Multimodal Video Generation via Camera Control
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes
di: Liu, Jiaxuan, et al.
Pubblicazione: (2026)
di: Liu, Jiaxuan, et al.
Pubblicazione: (2026)
TrajectoryCrafter: Redirecting Camera Trajectory for Monocular Videos via Diffusion Models
di: YU, Mark, et al.
Pubblicazione: (2025)
di: YU, Mark, et al.
Pubblicazione: (2025)
Red Teaming Visual Language Models
di: Li, Mukai, et al.
Pubblicazione: (2024)
di: Li, Mukai, et al.
Pubblicazione: (2024)
Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation
di: Du, Jie, et al.
Pubblicazione: (2025)
di: Du, Jie, et al.
Pubblicazione: (2025)
GaussianBody: Clothed Human Reconstruction via 3d Gaussian Splatting
di: Li, Mengtian, et al.
Pubblicazione: (2024)
di: Li, Mengtian, et al.
Pubblicazione: (2024)
LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
CPO: Condition Preference Optimization for Controllable Image Generation
di: Lyu, Zonglin, et al.
Pubblicazione: (2025)
di: Lyu, Zonglin, et al.
Pubblicazione: (2025)
Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
di: Liu, Xinxin, et al.
Pubblicazione: (2026)
MemCam: Memory-Augmented Camera Control for Consistent Video Generation
di: Gao, Xinhang, et al.
Pubblicazione: (2026)
di: Gao, Xinhang, et al.
Pubblicazione: (2026)
MCAD: Multi-teacher Cross-modal Alignment Distillation for efficient image-text retrieval
di: Lei, Youbo, et al.
Pubblicazione: (2023)
di: Lei, Youbo, et al.
Pubblicazione: (2023)
Learning Active Perception via Self-Evolving Preference Optimization for GUI Grounding
di: Wang, Wanfu, et al.
Pubblicazione: (2025)
di: Wang, Wanfu, et al.
Pubblicazione: (2025)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
di: Ding, Meiwen, et al.
Pubblicazione: (2026)
Walking the Schrödinger Bridge: A Direct Trajectory for Text-to-3D Generation
di: Li, Ziying, et al.
Pubblicazione: (2025)
di: Li, Ziying, et al.
Pubblicazione: (2025)
Visual Space Optimization for Zero-shot Learning
di: Wang, Xinsheng, et al.
Pubblicazione: (2019)
di: Wang, Xinsheng, et al.
Pubblicazione: (2019)
SplaTraj: Camera Trajectory Generation with Semantic Gaussian Splatting
di: Liu, Xinyi, et al.
Pubblicazione: (2024)
di: Liu, Xinyi, et al.
Pubblicazione: (2024)
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
di: Kim, Yeonju, et al.
Pubblicazione: (2024)
di: Kim, Yeonju, et al.
Pubblicazione: (2024)
CheXPO: Preference Optimization for Chest X-ray VLMs with Counterfactual Rationale
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space
di: Sun, Yuwei, et al.
Pubblicazione: (2023)
di: Sun, Yuwei, et al.
Pubblicazione: (2023)
MergeVQ: A Unified Framework for Visual Generation and Representation with Disentangled Token Merging and Quantization
di: Li, Siyuan, et al.
Pubblicazione: (2025)
di: Li, Siyuan, et al.
Pubblicazione: (2025)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
di: S, Sridhar, et al.
Pubblicazione: (2025)
di: S, Sridhar, et al.
Pubblicazione: (2025)
Documenti analoghi
-
HieraFashDiff: Hierarchical Fashion Design with Multi-stage Diffusion Models
di: Xie, Zhifeng, et al.
Pubblicazione: (2024) -
EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
di: Yang, Songlin, et al.
Pubblicazione: (2026) -
ViPO: Visual Preference Optimization at Scale
di: Li, Ming, et al.
Pubblicazione: (2026) -
Visual Preference Optimization with Rubric Rewards
di: Yu, Ya-Qi, et al.
Pubblicazione: (2026) -
PixelArena: A benchmark for Pixel-Precision Visual Intelligence
di: Liang, Feng, et al.
Pubblicazione: (2025)