PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cai, Yuanhao, Li, Kunpeng, Jia, Menglin, Wang, Jialiang, Sun, Junzhe, Liang, Feng, Chen, Weifeng, Juefei-Xu, Felix, Wang, Chu, Thabet, Ali, Dai, Xiaoliang, Ju, Xuan, Yuille, Alan, Hou, Ji |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization
par: Deng, Mengyi, et autres
Publié: (2026)
par: Deng, Mengyi, et autres
Publié: (2026)
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
par: Lin, Han, et autres
Publié: (2025)
par: Lin, Han, et autres
Publié: (2025)
GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution
par: Yi, Qiaosi, et autres
Publié: (2026)
par: Yi, Qiaosi, et autres
Publié: (2026)
MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization
par: Zhang, Lanxue, et autres
Publié: (2025)
par: Zhang, Lanxue, et autres
Publié: (2025)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
par: Zhang, Tiezheng, et autres
Publié: (2025)
par: Zhang, Tiezheng, et autres
Publié: (2025)
Llama Learns to Direct: DirectorLLM for Human-Centric Video Generation
par: Song, Kunpeng, et autres
Publié: (2024)
par: Song, Kunpeng, et autres
Publié: (2024)
Structure-Aware Sparse-View X-ray 3D Reconstruction
par: Cai, Yuanhao, et autres
Publié: (2023)
par: Cai, Yuanhao, et autres
Publié: (2023)
GDPO: Learning to Directly Align Language Models with Diversity Using GFlowNets
par: Kwon, Oh Joon, et autres
Publié: (2024)
par: Kwon, Oh Joon, et autres
Publié: (2024)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
par: Gu, Zeqi, et autres
Publié: (2025)
par: Gu, Zeqi, et autres
Publié: (2025)
RDPO: Real Data Preference Optimization for Physics Consistency Video Generation
par: Qian, Wenxu, et autres
Publié: (2025)
par: Qian, Wenxu, et autres
Publié: (2025)
PhiP-G: Physics-Guided Text-to-3D Compositional Scene Generation
par: Li, Qixuan, et autres
Publié: (2025)
par: Li, Qixuan, et autres
Publié: (2025)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity
par: Wang, Hongjie, et autres
Publié: (2024)
par: Wang, Hongjie, et autres
Publié: (2024)
PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation
par: Wu, Fan, et autres
Publié: (2025)
par: Wu, Fan, et autres
Publié: (2025)
PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation
par: Xie, Tianxin, et autres
Publié: (2025)
par: Xie, Tianxin, et autres
Publié: (2025)
"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models
par: Gu, Jing, et autres
Publié: (2025)
par: Gu, Jing, et autres
Publié: (2025)
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
par: Paul, Soumava, et autres
Publié: (2026)
par: Paul, Soumava, et autres
Publié: (2026)
DirectTriGS: Triplane-based Gaussian Splatting Field Representation for 3D Generation
par: Ju, Xiaoliang, et autres
Publié: (2025)
par: Ju, Xiaoliang, et autres
Publié: (2025)
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
par: Chen, Leon Liangyu, et autres
Publié: (2026)
par: Chen, Leon Liangyu, et autres
Publié: (2026)
PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
par: Wang, Yian, et autres
Publié: (2026)
par: Wang, Yian, et autres
Publié: (2026)
DIRECT-3D: Learning Direct Text-to-3D Generation on Massive Noisy 3D Data
par: Liu, Qihao, et autres
Publié: (2024)
par: Liu, Qihao, et autres
Publié: (2024)
Phy124: Fast Physics-Driven 4D Content Generation from a Single Image
par: Lin, Jiajing, et autres
Publié: (2024)
par: Lin, Jiajing, et autres
Publié: (2024)
PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation
par: Chen, Weixing, et autres
Publié: (2026)
par: Chen, Weixing, et autres
Publié: (2026)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
Groupwise Registration with Physics-Informed Test-Time Adaptation on Multi-parametric Cardiac MRI
par: Li, Xinqi, et autres
Publié: (2025)
par: Li, Xinqi, et autres
Publié: (2025)
Causal Inference with Groupwise Matching
par: Rincón, Ratzanyel, et autres
Publié: (2025)
par: Rincón, Ratzanyel, et autres
Publié: (2025)
PhyCritic: Multimodal Critic Models for Physical AI
par: Xiong, Tianyi, et autres
Publié: (2026)
par: Xiong, Tianyi, et autres
Publié: (2026)
Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering
par: Wang, Xingrui, et autres
Publié: (2024)
par: Wang, Xingrui, et autres
Publié: (2024)
Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning
par: Zhang, Lei, et autres
Publié: (2026)
par: Zhang, Lei, et autres
Publié: (2026)
Groupwise image registration with edge‐based loss for low‐SNR cardiac MRI
par: Xuan Lei, et autres
Publié: (2025)
par: Xuan Lei, et autres
Publié: (2025)
Groupwise Image Registration with Edge-Based Loss for Low-SNR Cardiac MRI
par: Lei, Xuan, et autres
Publié: (2024)
par: Lei, Xuan, et autres
Publié: (2024)
PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models
par: Wang, Zeqing, et autres
Publié: (2025)
par: Wang, Zeqing, et autres
Publié: (2025)
ProPhy: Progressive Physical Alignment for Dynamic World Simulation
par: Wang, Zijun, et autres
Publié: (2025)
par: Wang, Zijun, et autres
Publié: (2025)
PhyRecon: Physically Plausible Neural Scene Reconstruction
par: Ni, Junfeng, et autres
Publié: (2024)
par: Ni, Junfeng, et autres
Publié: (2024)
PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education
par: M, Megha Mariam K., et autres
Publié: (2026)
par: M, Megha Mariam K., et autres
Publié: (2026)
PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation
par: Wu, Shang, et autres
Publié: (2026)
par: Wu, Shang, et autres
Publié: (2026)
PhyWorld: Physics-Faithful World Model for Video Generation
par: Zhao, Pu, et autres
Publié: (2026)
par: Zhao, Pu, et autres
Publié: (2026)
PhySense: Sensor Placement Optimization for Accurate Physics Sensing
par: Ma, Yuezhou, et autres
Publié: (2025)
par: Ma, Yuezhou, et autres
Publié: (2025)
FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing
par: Zhang, Youyuan, et autres
Publié: (2024)
par: Zhang, Youyuan, et autres
Publié: (2024)
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
par: Liu, Shih-Yang, et autres
Publié: (2026)
par: Liu, Shih-Yang, et autres
Publié: (2026)
Documents similaires
-
DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization
par: Deng, Mengyi, et autres
Publié: (2026) -
Exploring MLLM-Diffusion Information Transfer with MetaCanvas
par: Lin, Han, et autres
Publié: (2025) -
GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution
par: Yi, Qiaosi, et autres
Publié: (2026) -
MetaGDPO: Alleviating Catastrophic Forgetting with Metacognitive Knowledge through Group Direct Preference Optimization
par: Zhang, Lanxue, et autres
Publié: (2025) -
Dictionary-based Framework for Interpretable and Consistent Object Parsing
par: Zhang, Tiezheng, et autres
Publié: (2025)