Guardado en:
| Autores principales: | Zhang, Chongzhi, Zhang, Mingyuan, Teng, Zhiyang, Li, Jiayi, Zhu, Xizhou, Lu, Lewei, Liu, Ziwei, Sun, Aixin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2401.08232 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Flexible and Scalable Framework for Video Moment Search
por: Zhang, Chongzhi, et al.
Publicado: (2025)
por: Zhang, Chongzhi, et al.
Publicado: (2025)
TVR-Ranking: A Dataset for Ranked Video Moment Retrieval with Imprecise Queries
por: Liang, Renjie, et al.
Publicado: (2024)
por: Liang, Renjie, et al.
Publicado: (2024)
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
Large Motion Model for Unified Multi-Modal Motion Generation
por: Zhang, Mingyuan, et al.
Publicado: (2024)
por: Zhang, Mingyuan, et al.
Publicado: (2024)
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
por: Cui, Erfei, et al.
Publicado: (2023)
por: Cui, Erfei, et al.
Publicado: (2023)
HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding
por: Tao, Chenxin, et al.
Publicado: (2024)
por: Tao, Chenxin, et al.
Publicado: (2024)
CVD-STORM: Cross-View Video Diffusion with Spatial-Temporal Reconstruction Model for Autonomous Driving
por: Zhang, Tianrui, et al.
Publicado: (2025)
por: Zhang, Tianrui, et al.
Publicado: (2025)
Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM
por: Wu, Penghao, et al.
Publicado: (2025)
por: Wu, Penghao, et al.
Publicado: (2025)
VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models
por: Xu, Weiye, et al.
Publicado: (2025)
por: Xu, Weiye, et al.
Publicado: (2025)
UltrAvatar: A Realistic Animatable 3D Avatar Diffusion Model with Authenticity Guided Textures
por: Zhou, Mingyuan, et al.
Publicado: (2024)
por: Zhou, Mingyuan, et al.
Publicado: (2024)
ADDP: Learning General Representations for Image Recognition and Generation with Alternating Denoising Diffusion Process
por: Tian, Changyao, et al.
Publicado: (2023)
por: Tian, Changyao, et al.
Publicado: (2023)
Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control
por: Gu, Zekai, et al.
Publicado: (2025)
por: Gu, Zekai, et al.
Publicado: (2025)
Auto MC-Reward: Automated Dense Reward Design with Large Language Models for Minecraft
por: Li, Hao, et al.
Publicado: (2023)
por: Li, Hao, et al.
Publicado: (2023)
VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks
por: Wu, Jiannan, et al.
Publicado: (2024)
por: Wu, Jiannan, et al.
Publicado: (2024)
NL2Contact: Natural Language Guided 3D Hand-Object Contact Modeling with Diffusion Model
por: Zhang, Zhongqun, et al.
Publicado: (2024)
por: Zhang, Zhongqun, et al.
Publicado: (2024)
Error Analyses of Auto-Regressive Video Diffusion Models: A Unified Framework
por: Wang, Jing, et al.
Publicado: (2025)
por: Wang, Jing, et al.
Publicado: (2025)
Masked Diffusion Vision-Language Models for Temporal Action Localization
por: Wang, Fengshun, et al.
Publicado: (2026)
por: Wang, Fengshun, et al.
Publicado: (2026)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
Learning 1D Causal Visual Representation with De-focus Attention Networks
por: Tao, Chenxin, et al.
Publicado: (2024)
por: Tao, Chenxin, et al.
Publicado: (2024)
MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
por: Liu, Yangzhou, et al.
Publicado: (2024)
por: Liu, Yangzhou, et al.
Publicado: (2024)
Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
por: Xu, Zhiyang, et al.
Publicado: (2026)
por: Xu, Zhiyang, et al.
Publicado: (2026)
Parameter-Inverted Image Pyramid Networks
por: Zhu, Xizhou, et al.
Publicado: (2024)
por: Zhu, Xizhou, et al.
Publicado: (2024)
NaViL: Rethinking Scaling Properties of Native Multimodal Large Language Models under Data Constraints
por: Tian, Changyao, et al.
Publicado: (2025)
por: Tian, Changyao, et al.
Publicado: (2025)
Visual Jigsaw Post-Training Improves MLLMs
por: Wu, Penghao, et al.
Publicado: (2025)
por: Wu, Penghao, et al.
Publicado: (2025)
Vision-RWKV: Efficient and Scalable Visual Perception with RWKV-Like Architectures
por: Duan, Yuchen, et al.
Publicado: (2024)
por: Duan, Yuchen, et al.
Publicado: (2024)
WildRefer: 3D Object Localization in Large-scale Dynamic Scenes with Multi-modal Visual Data and Natural Language
por: Lin, Zhenxiang, et al.
Publicado: (2023)
por: Lin, Zhenxiang, et al.
Publicado: (2023)
DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion
por: Lu, Zhiyang, et al.
Publicado: (2026)
por: Lu, Zhiyang, et al.
Publicado: (2026)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
por: Yang, Chenyu, et al.
Publicado: (2024)
por: Yang, Chenyu, et al.
Publicado: (2024)
Bridging Semantic and Kinematic Conditions with Diffusion-based Discrete Motion Tokenizer
por: Gu, Chenyang, et al.
Publicado: (2026)
por: Gu, Chenyang, et al.
Publicado: (2026)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
por: Li, Teng, et al.
Publicado: (2025)
por: Li, Teng, et al.
Publicado: (2025)
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
por: Fang, Xueji, et al.
Publicado: (2025)
por: Fang, Xueji, et al.
Publicado: (2025)
Collaborative Temporal Consistency Learning for Point-supervised Natural Language Video Localization
por: Tao, Zhuo, et al.
Publicado: (2025)
por: Tao, Zhuo, et al.
Publicado: (2025)
GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior
por: Wu, Penghao, et al.
Publicado: (2025)
por: Wu, Penghao, et al.
Publicado: (2025)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
por: Ye, Zilyu, et al.
Publicado: (2024)
por: Ye, Zilyu, et al.
Publicado: (2024)
Weakly Supervised Monocular 3D Detection with a Single-View Image
por: Jiang, Xueying, et al.
Publicado: (2024)
por: Jiang, Xueying, et al.
Publicado: (2024)
Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation
por: Chen, Gordon, et al.
Publicado: (2026)
por: Chen, Gordon, et al.
Publicado: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
por: Meng, Fanqing, et al.
Publicado: (2024)
por: Meng, Fanqing, et al.
Publicado: (2024)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Ejemplares similares
-
A Flexible and Scalable Framework for Video Moment Search
por: Zhang, Chongzhi, et al.
Publicado: (2025) -
TVR-Ranking: A Dataset for Ranked Video Moment Retrieval with Imprecise Queries
por: Liang, Renjie, et al.
Publicado: (2024) -
PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models
por: Yang, Chenyu, et al.
Publicado: (2024) -
Large Motion Model for Unified Multi-Modal Motion Generation
por: Zhang, Mingyuan, et al.
Publicado: (2024) -
DriveMLM: Aligning Multi-Modal Large Language Models with Behavioral Planning States for Autonomous Driving
por: Cui, Erfei, et al.
Publicado: (2023)