From Image to Video, what do we need in multimodal LLMs?
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Suyuan, Zhang, Haoxin, Zhong, Linqing, Chen, Honggu, Gao, Yan, Hu, Yao, Qin, Zengchang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Vript: A Video Is Worth Thousands of Words
por: Yang, Dongjie, et al.
Publicado: (2024)
por: Yang, Dongjie, et al.
Publicado: (2024)
Integrating MedCLIP and Cross-Modal Fusion for Automatic Radiology Report Generation
por: Han, Qianhao, et al.
Publicado: (2024)
por: Han, Qianhao, et al.
Publicado: (2024)
LogicalDefender: Discovering, Extracting, and Utilizing Common-Sense Knowledge
por: Liu, Yuhe, et al.
Publicado: (2024)
por: Liu, Yuhe, et al.
Publicado: (2024)
Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System
por: Wei, Wenbin, et al.
Publicado: (2026)
por: Wei, Wenbin, et al.
Publicado: (2026)
FAMSeC: A Few-shot-sample-based General AI-generated Image Detection Method
por: Xu, Juncong, et al.
Publicado: (2024)
por: Xu, Juncong, et al.
Publicado: (2024)
CLIP-driven Zero-shot Learning with Ambiguous Labels
por: Fan, Jinfu, et al.
Publicado: (2026)
por: Fan, Jinfu, et al.
Publicado: (2026)
Learning to Animate Images from A Few Videos to Portray Delicate Human Actions
por: Li, Haoxin, et al.
Publicado: (2025)
por: Li, Haoxin, et al.
Publicado: (2025)
Deepfakes: we need to re-think the concept of "real" images
por: Keuper, Janis, et al.
Publicado: (2025)
por: Keuper, Janis, et al.
Publicado: (2025)
Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning
por: Qin, Jialong, et al.
Publicado: (2025)
por: Qin, Jialong, et al.
Publicado: (2025)
VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models
por: Chen, Haoxin, et al.
Publicado: (2024)
por: Chen, Haoxin, et al.
Publicado: (2024)
Explaining multimodal LLMs via intra-modal token interactions
por: Liang, Jiawei, et al.
Publicado: (2025)
por: Liang, Jiawei, et al.
Publicado: (2025)
Refinement via Regeneration: Enlarging Modification Space Boosts Image Refinement in Unified Multimodal Models
por: Guo, Jiayi, et al.
Publicado: (2026)
por: Guo, Jiayi, et al.
Publicado: (2026)
Dynamic Visual-semantic Alignment for Zero-shot Learning with Ambiguous Labels
por: Li, Jiangnan, et al.
Publicado: (2026)
por: Li, Jiangnan, et al.
Publicado: (2026)
Giving each task what it needs -- leveraging structured sparsity for tailored multi-task learning
por: Upadhyay, Richa, et al.
Publicado: (2024)
por: Upadhyay, Richa, et al.
Publicado: (2024)
Where, Not What: Compelling Video LLMs to Learn Geometric Causality for 3D-Grounding
por: Zhong, Yutong
Publicado: (2025)
por: Zhong, Yutong
Publicado: (2025)
Similarity over Factuality: Are we making progress on multimodal out-of-context misinformation detection?
por: Papadopoulos, Stefanos-Iordanis, et al.
Publicado: (2024)
por: Papadopoulos, Stefanos-Iordanis, et al.
Publicado: (2024)
Enhancing Vision-Language Compositional Understanding with Multimodal Synthetic Data
por: Li, Haoxin, et al.
Publicado: (2025)
por: Li, Haoxin, et al.
Publicado: (2025)
Single Trajectory Distillation for Accelerating Image and Video Style Transfer
por: Xu, Sijie, et al.
Publicado: (2024)
por: Xu, Sijie, et al.
Publicado: (2024)
iGaussian: Real-Time Camera Pose Estimation via Feed-Forward 3D Gaussian Splatting Inversion
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
Adaptive Feature Fusion Neural Network for Glaucoma Segmentation on Unseen Fundus Images
por: Zhong, Jiyuan, et al.
Publicado: (2024)
por: Zhong, Jiyuan, et al.
Publicado: (2024)
SITA: Structurally Imperceptible and Transferable Adversarial Attacks for Stylized Image Generation
por: Kang, Jingdan, et al.
Publicado: (2025)
por: Kang, Jingdan, et al.
Publicado: (2025)
VideoLLM-MoD: Efficient Video-Language Streaming with Mixture-of-Depths Vision Computation
por: Wu, Shiwei, et al.
Publicado: (2024)
por: Wu, Shiwei, et al.
Publicado: (2024)
VideoQA in the Era of LLMs: An Empirical Study
por: Xiao, Junbin, et al.
Publicado: (2024)
por: Xiao, Junbin, et al.
Publicado: (2024)
Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency
por: Li, Hongyu, et al.
Publicado: (2025)
por: Li, Hongyu, et al.
Publicado: (2025)
RAVES-Calib: Robust, Accurate and Versatile Extrinsic Self Calibration Using Optimal Geometric Features
por: Zhang, Haoxin, et al.
Publicado: (2025)
por: Zhang, Haoxin, et al.
Publicado: (2025)
Benchmarking the Trustworthiness in Multimodal LLMs for Video Understanding
por: Wang, Youze, et al.
Publicado: (2025)
por: Wang, Youze, et al.
Publicado: (2025)
LDRFusion: A LiDAR-Dominant multimodal refinement framework for 3D object detection
por: Wang, Jijun, et al.
Publicado: (2025)
por: Wang, Jijun, et al.
Publicado: (2025)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
por: Chen, Yanyuan, et al.
Publicado: (2025)
por: Chen, Yanyuan, et al.
Publicado: (2025)
AnyAct: Towards Human Reenactment of Character Motion From Video
por: Chen, Liuhan, et al.
Publicado: (2026)
por: Chen, Liuhan, et al.
Publicado: (2026)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Animalbooth: multimodal feature enhancement for animal subject personalization
por: Liu, Chen, et al.
Publicado: (2025)
por: Liu, Chen, et al.
Publicado: (2025)
How far have we gone in Generative Image Restoration? A study on its capability, limitations and evaluation practices
por: Yin, Xiang, et al.
Publicado: (2026)
por: Yin, Xiang, et al.
Publicado: (2026)
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition
por: Huang, Ronggang, et al.
Publicado: (2025)
por: Huang, Ronggang, et al.
Publicado: (2025)
SOTA: Spike-Navigated Optimal TrAnsport Saliency Region Detection in Composite-bias Videos
por: Liu, Wenxuan, et al.
Publicado: (2025)
por: Liu, Wenxuan, et al.
Publicado: (2025)
From Priors to Perception: Grounding Video-LLMs in Physical Reality
por: Zhao, Zicheng, et al.
Publicado: (2026)
por: Zhao, Zicheng, et al.
Publicado: (2026)
Distill Video Datasets into Images
por: Zhao, Zhenghao, et al.
Publicado: (2025)
por: Zhao, Zhenghao, et al.
Publicado: (2025)
A benchmark multimodal oro-dental dataset for large vision-language models
por: Lv, Haoxin, et al.
Publicado: (2025)
por: Lv, Haoxin, et al.
Publicado: (2025)
Matten: Video Generation with Mamba-Attention
por: Gao, Yu, et al.
Publicado: (2024)
por: Gao, Yu, et al.
Publicado: (2024)
On the test-time zero-shot generalization of vision-language models: Do we really need prompt learning?
por: Zanella, Maxime, et al.
Publicado: (2024)
por: Zanella, Maxime, et al.
Publicado: (2024)
TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos
por: Zeng, Yan, et al.
Publicado: (2026)
por: Zeng, Yan, et al.
Publicado: (2026)
Ejemplares similares
-
Vript: A Video Is Worth Thousands of Words
por: Yang, Dongjie, et al.
Publicado: (2024) -
Integrating MedCLIP and Cross-Modal Fusion for Automatic Radiology Report Generation
por: Han, Qianhao, et al.
Publicado: (2024) -
LogicalDefender: Discovering, Extracting, and Utilizing Common-Sense Knowledge
por: Liu, Yuhe, et al.
Publicado: (2024) -
Fair-Eye Net: A Fair, Trustworthy, Multimodal Integrated Glaucoma Full Chain AI System
por: Wei, Wenbin, et al.
Publicado: (2026) -
FAMSeC: A Few-shot-sample-based General AI-generated Image Detection Method
por: Xu, Juncong, et al.
Publicado: (2024)