Geo-Align: Video Generation Alignment via Metric Geometry Reward
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Zizun, Guo, Haoyu, Teng, Runzhe, Shen, Chunhua, He, Tong |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
$π^3$: Permutation-Equivariant Visual Geometry Learning
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
by: Li, Zizun, et al.
Published: (2025)
by: Li, Zizun, et al.
Published: (2025)
GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry
by: He, Xiankang, et al.
Published: (2026)
by: He, Xiankang, et al.
Published: (2026)
ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
by: Weng, Wanjiang, et al.
Published: (2025)
by: Weng, Wanjiang, et al.
Published: (2025)
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
by: Yin, Tengjiao, et al.
Published: (2026)
by: Yin, Tengjiao, et al.
Published: (2026)
DeepVerse: 4D Autoregressive Video Generation as a World Model
by: Chen, Junyi, et al.
Published: (2025)
by: Chen, Junyi, et al.
Published: (2025)
ReAlign: Bilingual Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
by: Weng, Wanjiang, et al.
Published: (2025)
by: Weng, Wanjiang, et al.
Published: (2025)
Uniform Discrete Diffusion with Metric Path for Video Generation
by: Deng, Haoge, et al.
Published: (2025)
by: Deng, Haoge, et al.
Published: (2025)
RefAlign: Representation Alignment for Reference-to-Video Generation
by: Wang, Lei, et al.
Published: (2026)
by: Wang, Lei, et al.
Published: (2026)
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
by: Wang, Zhaoqing, et al.
Published: (2025)
by: Wang, Zhaoqing, et al.
Published: (2025)
Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization
by: Shen, Liao, et al.
Published: (2025)
by: Shen, Liao, et al.
Published: (2025)
MARBLE: Multi-Aspect Reward Balance for Diffusion RL
by: Zhao, Canyu, et al.
Published: (2026)
by: Zhao, Canyu, et al.
Published: (2026)
Monocular One-Shot Metric-Depth Alignment for RGB-Based Robot Grasping
by: Guo, Teng, et al.
Published: (2025)
by: Guo, Teng, et al.
Published: (2025)
Subjective-Aligned Dataset and Metric for Text-to-Video Quality Assessment
by: Kou, Tengchuan, et al.
Published: (2024)
by: Kou, Tengchuan, et al.
Published: (2024)
GeoBench: Benchmarking and Analyzing Monocular Geometry Estimation Models
by: Ge, Yongtao, et al.
Published: (2024)
by: Ge, Yongtao, et al.
Published: (2024)
OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling
by: Zhou, Yang, et al.
Published: (2025)
by: Zhou, Yang, et al.
Published: (2025)
Align and Aggregate: Compositional Reasoning with Video Alignment and Answer Aggregation for Video Question-Answering
by: Liao, Zhaohe, et al.
Published: (2024)
by: Liao, Zhaohe, et al.
Published: (2024)
PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment
by: Xiong, Zhexiao, et al.
Published: (2026)
by: Xiong, Zhexiao, et al.
Published: (2026)
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
by: Cui, Mingxuan, et al.
Published: (2026)
by: Cui, Mingxuan, et al.
Published: (2026)
RewardSDS: Aligning Score Distillation via Reward-Weighted Sampling
by: Chachy, Itay, et al.
Published: (2025)
by: Chachy, Itay, et al.
Published: (2025)
PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards
by: Le, Minh-Quan, et al.
Published: (2026)
by: Le, Minh-Quan, et al.
Published: (2026)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
by: Guo, Shasha, et al.
Published: (2025)
by: Guo, Shasha, et al.
Published: (2025)
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation
by: Lu, Yunhong, et al.
Published: (2025)
by: Lu, Yunhong, et al.
Published: (2025)
Generative Video Matting
by: Ge, Yongtao, et al.
Published: (2025)
by: Ge, Yongtao, et al.
Published: (2025)
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution
by: Song, Yushuai, et al.
Published: (2026)
by: Song, Yushuai, et al.
Published: (2026)
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation
by: Li, Liyang, et al.
Published: (2026)
by: Li, Liyang, et al.
Published: (2026)
GeoDiff: Geometry-Guided Diffusion for Metric Depth Estimation
by: Pham, Tuan, et al.
Published: (2025)
by: Pham, Tuan, et al.
Published: (2025)
The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment
by: Liu, Hongyuan, et al.
Published: (2026)
by: Liu, Hongyuan, et al.
Published: (2026)
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling
by: Shekhar, Shivanshu, et al.
Published: (2026)
by: Shekhar, Shivanshu, et al.
Published: (2026)
Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video
by: Wang, Yifan, et al.
Published: (2026)
by: Wang, Yifan, et al.
Published: (2026)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
by: Liu, Runtao, et al.
Published: (2024)
by: Liu, Runtao, et al.
Published: (2024)
MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
by: Tong, Haibo, et al.
Published: (2025)
by: Tong, Haibo, et al.
Published: (2025)
Aether: Geometric-Aware Unified World Modeling
by: Aether Team, et al.
Published: (2025)
by: Aether Team, et al.
Published: (2025)
RealCam-Vid: High-resolution Video Dataset with Dynamic Scenes and Metric-scale Camera Movements
by: Zheng, Guangcong, et al.
Published: (2025)
by: Zheng, Guangcong, et al.
Published: (2025)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
by: Bhowmik, Aritra, et al.
Published: (2025)
by: Bhowmik, Aritra, et al.
Published: (2025)
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model
by: Wang, Yuan, et al.
Published: (2026)
by: Wang, Yuan, et al.
Published: (2026)
PopAlign: Population-Level Alignment for Fair Text-to-Image Generation
by: Li, Shufan, et al.
Published: (2024)
by: Li, Shufan, et al.
Published: (2024)
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing
by: He, Runze, et al.
Published: (2026)
by: He, Runze, et al.
Published: (2026)
Align Beyond Prompts: Evaluating World Knowledge Alignment in Text-to-Image Generation
by: Zhang, Wenchao, et al.
Published: (2025)
by: Zhang, Wenchao, et al.
Published: (2025)
Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
by: Wu, Ruitao, et al.
Published: (2025)
by: Wu, Ruitao, et al.
Published: (2025)
Similar Items
-
$π^3$: Permutation-Equivariant Visual Geometry Learning
by: Wang, Yifan, et al.
Published: (2025) -
WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool
by: Li, Zizun, et al.
Published: (2025) -
GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry
by: He, Xiankang, et al.
Published: (2026) -
ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
by: Weng, Wanjiang, et al.
Published: (2025) -
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment
by: Yin, Tengjiao, et al.
Published: (2026)