Enregistré dans:
| Auteurs principaux: | Yin, Tengjiao, Shi, Jinglei, Guo, Heng, Wang, Xi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.16271 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Geo-Align: Video Generation Alignment via Metric Geometry Reward
par: Li, Zizun, et autres
Publié: (2026)
par: Li, Zizun, et autres
Publié: (2026)
ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models
par: Xia, Yingjie, et autres
Publié: (2025)
par: Xia, Yingjie, et autres
Publié: (2025)
ViLCo-Bench: VIdeo Language COntinual learning Benchmark
par: Tang, Tianqi, et autres
Publié: (2024)
par: Tang, Tianqi, et autres
Publié: (2024)
Seeing Through the Rain: Resolving High-Frequency Conflicts in Deraining and Super-Resolution via Diffusion Guidance
par: Li, Wenjie, et autres
Publié: (2025)
par: Li, Wenjie, et autres
Publié: (2025)
NRGS: Neural Regularization for Robust 3D Semantic Gaussian Splatting
par: Yang, Zaiyan, et autres
Publié: (2026)
par: Yang, Zaiyan, et autres
Publié: (2026)
MUSE: Manipulating Unified Framework for Synthesizing Emotions in Images via Test-Time Optimization
par: Xia, Yingjie, et autres
Publié: (2025)
par: Xia, Yingjie, et autres
Publié: (2025)
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward
par: Wang, Zhaoqing, et autres
Publié: (2025)
par: Wang, Zhaoqing, et autres
Publié: (2025)
ReAlign: Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
par: Weng, Wanjiang, et autres
Publié: (2025)
par: Weng, Wanjiang, et autres
Publié: (2025)
VTimeCoT: Thinking by Drawing for Video Temporal Grounding and Reasoning
par: Zhang, Jinglei, et autres
Publié: (2025)
par: Zhang, Jinglei, et autres
Publié: (2025)
Video-Language Alignment via Spatio-Temporal Graph Transformer
par: Zhang, Shi-Xue, et autres
Publié: (2024)
par: Zhang, Shi-Xue, et autres
Publié: (2024)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
par: Guo, Shasha, et autres
Publié: (2025)
par: Guo, Shasha, et autres
Publié: (2025)
ICFRNet: Image Complexity Prior Guided Feature Refinement for Real-time Semantic Segmentation
par: Zhang, Xin, et autres
Publié: (2024)
par: Zhang, Xin, et autres
Publié: (2024)
Straightforward Layer-wise Pruning for More Efficient Visual Adaptation
par: Han, Ruizi, et autres
Publié: (2024)
par: Han, Ruizi, et autres
Publié: (2024)
IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
par: Qiu, Tianheng, et autres
Publié: (2025)
par: Qiu, Tianheng, et autres
Publié: (2025)
TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards
par: Cui, Mingxuan, et autres
Publié: (2026)
par: Cui, Mingxuan, et autres
Publié: (2026)
Fast Prompt Alignment for Text-to-Image Generation
par: Mrini, Khalil, et autres
Publié: (2024)
par: Mrini, Khalil, et autres
Publié: (2024)
ReAlign: Bilingual Text-to-Motion Generation via Step-Aware Reward-Guided Alignment
par: Weng, Wanjiang, et autres
Publié: (2025)
par: Weng, Wanjiang, et autres
Publié: (2025)
DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision
par: Zou, Xiandong, et autres
Publié: (2025)
par: Zou, Xiandong, et autres
Publié: (2025)
Consistent-1-to-3: Consistent Image to 3D View Synthesis via Geometry-aware Diffusion Models
par: Ye, Jianglong, et autres
Publié: (2023)
par: Ye, Jianglong, et autres
Publié: (2023)
RewardDance: Reward Scaling in Visual Generation
par: Wu, Jie, et autres
Publié: (2025)
par: Wu, Jie, et autres
Publié: (2025)
MOGO: Residual Quantized Hierarchical Causal Transformer for High-Quality and Real-Time 3D Human Motion Generation
par: Fu, Dongjie, et autres
Publié: (2025)
par: Fu, Dongjie, et autres
Publié: (2025)
Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation
par: Cui, Xiao, et autres
Publié: (2025)
par: Cui, Xiao, et autres
Publié: (2025)
Tri-modal Confluence with Temporal Dynamics for Scene Graph Generation in Operating Rooms
par: Guo, Diandian, et autres
Publié: (2024)
par: Guo, Diandian, et autres
Publié: (2024)
The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment
par: Liu, Hongyuan, et autres
Publié: (2026)
par: Liu, Hongyuan, et autres
Publié: (2026)
Enhancing Reward Models for High-quality Image Generation: Beyond Text-Image Alignment
par: Ba, Ying, et autres
Publié: (2025)
par: Ba, Ying, et autres
Publié: (2025)
Unhackable Temporal Rewarding for Scalable Video MLLMs
par: Yu, En, et autres
Publié: (2025)
par: Yu, En, et autres
Publié: (2025)
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
par: Song, Quanjian, et autres
Publié: (2025)
par: Song, Quanjian, et autres
Publié: (2025)
Pareto-Guided Optimal Transport for Multi-Reward Alignment
par: Ba, Ying, et autres
Publié: (2026)
par: Ba, Ying, et autres
Publié: (2026)
Multi-dimensional Preference Alignment by Conditioning Reward Itself
par: Jang, Jiho, et autres
Publié: (2025)
par: Jang, Jiho, et autres
Publié: (2025)
Causality Matters: How Temporal Information Emerges in Video Language Models
par: Shi, Yumeng, et autres
Publié: (2025)
par: Shi, Yumeng, et autres
Publié: (2025)
ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards
par: Yan, Wentao, et autres
Publié: (2026)
par: Yan, Wentao, et autres
Publié: (2026)
Cross-modal Full-mode Fine-grained Alignment for Text-to-Image Person Retrieval
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
CHASM: Cross-frequency Harmonized Axis-Separable Mixing for Spectral Token Operators
par: Fang, Pengcheng, et autres
Publié: (2026)
par: Fang, Pengcheng, et autres
Publié: (2026)
Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
par: Wang, Zitian, et autres
Publié: (2025)
par: Wang, Zitian, et autres
Publié: (2025)
Gradient-Free Noise Optimization for Reward Alignment in Generative Models
par: Kim, Jeongsol, et autres
Publié: (2026)
par: Kim, Jeongsol, et autres
Publié: (2026)
Efficient Oriented Object Detection with Enhanced Small Object Recognition in Aerial Images
par: Shi, Zhifei, et autres
Publié: (2024)
par: Shi, Zhifei, et autres
Publié: (2024)
Fourier Angle Alignment for Oriented Object Detection in Remote Sensing
par: Gu, Changyu, et autres
Publié: (2026)
par: Gu, Changyu, et autres
Publié: (2026)
Spread Your Wings: A Radial Strip Transformer for Image Deblurring
par: Chen, Duosheng, et autres
Publié: (2024)
par: Chen, Duosheng, et autres
Publié: (2024)
Devil is in the Uniformity: Exploring Diverse Learners within Transformer for Image Restoration
par: Zhou, Shihao, et autres
Publié: (2025)
par: Zhou, Shihao, et autres
Publié: (2025)
Harmonizing Light and Darkness: A Symphony of Prior-guided Data Synthesis and Adaptive Focus for Nighttime Flare Removal
par: Qu, Lishen, et autres
Publié: (2024)
par: Qu, Lishen, et autres
Publié: (2024)
Documents similaires
-
Geo-Align: Video Generation Alignment via Metric Geometry Reward
par: Li, Zizun, et autres
Publié: (2026) -
ShaRP: SHAllow-LayeR Pruning for Efficient Video Large Language Models
par: Xia, Yingjie, et autres
Publié: (2025) -
ViLCo-Bench: VIdeo Language COntinual learning Benchmark
par: Tang, Tianqi, et autres
Publié: (2024) -
Seeing Through the Rain: Resolving High-Frequency Conflicts in Deraining and Super-Resolution via Diffusion Guidance
par: Li, Wenjie, et autres
Publié: (2025) -
NRGS: Neural Regularization for Robust 3D Semantic Gaussian Splatting
par: Yang, Zaiyan, et autres
Publié: (2026)