Enregistré dans:
| Auteurs principaux: | Zhang, Chongzhi, Zhang, Mingyuan, Teng, Zhiyang, Li, Jiayi, Zhu, Xizhou, Lu, Lewei, Liu, Ziwei, Sun, Aixin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2401.08232 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Flexible and Scalable Framework for Video Moment Search
par: Zhang, Chongzhi, et autres
Publié: (2025)
par: Zhang, Chongzhi, et autres
Publié: (2025)
TVR-Ranking: A Dataset for Ranked Video Moment Retrieval with Imprecise Queries
par: Liang, Renjie, et autres
Publié: (2024)
par: Liang, Renjie, et autres
Publié: (2024)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
par: Zhang, Mingyuan, et autres
Publié: (2024)
par: Zhang, Mingyuan, et autres
Publié: (2024)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
par: Cui, Erfei, et autres
Publié: (2023)
par: Cui, Erfei, et autres
Publié: (2023)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
par: Tao, Chenxin, et autres
Publié: (2024)
par: Tao, Chenxin, et autres
Publié: (2024)
CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
par: Zhang, Tianrui, et autres
Publié: (2025)
par: Zhang, Tianrui, et autres
Publié: (2025)
Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
par: Xu, Weiye, et autres
Publié: (2025)
par: Xu, Weiye, et autres
Publié: (2025)
UltrAvatar: A Realistic Animatable 3D Avatar Diffusion Model with Authenticity Guided Textures
par: Zhou, Mingyuan, et autres
Publié: (2024)
par: Zhou, Mingyuan, et autres
Publié: (2024)
ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process
par: Tian, Changyao, et autres
Publié: (2023)
par: Tian, Changyao, et autres
Publié: (2023)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
par: Wang, Weiyun, et autres
Publié: (2024)
par: Wang, Weiyun, et autres
Publié: (2024)
Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control
par: Gu, Zekai, et autres
Publié: (2025)
par: Gu, Zekai, et autres
Publié: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
par: Wu, Jiannan, et autres
Publié: (2024)
par: Wu, Jiannan, et autres
Publié: (2024)
NL2Contact: Natural Language Guided 3D Hand-Object Contact Modeling with Diffusion Model
par: Zhang, Zhongqun, et autres
Publié: (2024)
par: Zhang, Zhongqun, et autres
Publié: (2024)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
par: Wang, Jing, et autres
Publié: (2025)
par: Wang, Jing, et autres
Publié: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
par: Wang, Fengshun, et autres
Publié: (2026)
par: Wang, Fengshun, et autres
Publié: (2026)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
Learning 1D Causal Visual Representation with De-focus Attention Networks
par: Tao, Chenxin, et autres
Publié: (2024)
par: Tao, Chenxin, et autres
Publié: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
par: Liu, Yangzhou, et autres
Publié: (2024)
par: Liu, Yangzhou, et autres
Publié: (2024)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
par: Xu, Zhiyang, et autres
Publié: (2026)
par: Xu, Zhiyang, et autres
Publié: (2026)
Parameter-Inverted Image Pyramid Networks
par: Zhu, Xizhou, et autres
Publié: (2024)
par: Zhu, Xizhou, et autres
Publié: (2024)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
par: Tian, Changyao, et autres
Publié: (2025)
par: Tian, Changyao, et autres
Publié: (2025)
Visual Jigsaw Post-Training Improves MLLMs
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
par: Duan, Yuchen, et autres
Publié: (2024)
par: Duan, Yuchen, et autres
Publié: (2024)
WildRefer: 3D Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural Language
par: Lin, Zhenxiang, et autres
Publié: (2023)
par: Lin, Zhenxiang, et autres
Publié: (2023)
DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion
par: Lu, Zhiyang, et autres
Publié: (2026)
par: Lu, Zhiyang, et autres
Publié: (2026)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
par: Yang, Chenyu, et autres
Publié: (2024)
par: Yang, Chenyu, et autres
Publié: (2024)
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
par: Gu, Chenyang, et autres
Publié: (2026)
par: Gu, Chenyang, et autres
Publié: (2026)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
par: Fang, Xueji, et autres
Publié: (2025)
par: Fang, Xueji, et autres
Publié: (2025)
Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization
par: Tao, Zhuo, et autres
Publié: (2025)
par: Tao, Zhuo, et autres
Publié: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
par: Wu, Penghao, et autres
Publié: (2025)
par: Wu, Penghao, et autres
Publié: (2025)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
par: Ye, Zilyu, et autres
Publié: (2024)
par: Ye, Zilyu, et autres
Publié: (2024)
Weakly Supervised Monocular 3D Detection with a Single-View Image
par: Jiang, Xueying, et autres
Publié: (2024)
par: Jiang, Xueying, et autres
Publié: (2024)
Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation
par: Chen, Gordon, et autres
Publié: (2026)
par: Chen, Gordon, et autres
Publié: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
par: Meng, Jiahao, et autres
Publié: (2025)
par: Meng, Jiahao, et autres
Publié: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Documents similaires
-
A Flexible and Scalable Framework for Video Moment Search
par: Zhang, Chongzhi, et autres
Publié: (2025) -
TVR-Ranking: A Dataset for Ranked Video Moment Retrieval with Imprecise Queries
par: Liang, Renjie, et autres
Publié: (2024) -
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
par: Yang, Chenyu, et autres
Publié: (2024) -
Large Motion Model for Unified Multi-Modal Motion Generation
par: Zhang, Mingyuan, et autres
Publié: (2024) -
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
par: Cui, Erfei, et autres
Publié: (2023)