MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Hua, Hang, Tang, Yunlong, Zeng, Ziyun, Cao, Liangliang, Yang, Zhengyuan, He, Hangfeng, Xu, Chenliang, Luo, Jiebo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
di: Zeng, Ziyun, et al.
Pubblicazione: (2025)
MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
di: Hua, Hang, et al.
Pubblicazione: (2025)
di: Hua, Hang, et al.
Pubblicazione: (2025)
PromptFix: You Prompt and We Fix the Photo
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
di: Yu, Yongsheng, et al.
Pubblicazione: (2024)
GaussianStyle: Gaussian Head Avatar via StyleGAN
di: Liu, Pinxin, et al.
Pubblicazione: (2024)
di: Liu, Pinxin, et al.
Pubblicazione: (2024)
MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
di: Zeng, Ziyun, et al.
Pubblicazione: (2026)
di: Zeng, Ziyun, et al.
Pubblicazione: (2026)
Aurora: Unified Video Editing with a Tool-Using Agent
di: Yu, Yongsheng, et al.
Pubblicazione: (2026)
di: Yu, Yongsheng, et al.
Pubblicazione: (2026)
OmniPaint: Mastering Object-Oriented Editing via Disentangled Insertion-Removal Inpainting
di: Yu, Yongsheng, et al.
Pubblicazione: (2025)
di: Yu, Yongsheng, et al.
Pubblicazione: (2025)
How Vision-Language Tasks Benefit from Large Pre-trained Models: A Survey
di: Qi, Yayun, et al.
Pubblicazione: (2024)
di: Qi, Yayun, et al.
Pubblicazione: (2024)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Ye, Wei, et al.
Pubblicazione: (2024)
di: Ye, Wei, et al.
Pubblicazione: (2024)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
di: Liu, Haowei, et al.
Pubblicazione: (2024)
di: Liu, Haowei, et al.
Pubblicazione: (2024)
NEVLP: Noise-Robust Framework for Efficient Vision-Language Pre-training
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
di: Tao, Yiyi, et al.
Pubblicazione: (2024)
Revisiting Continual Semantic Segmentation with Pre-trained Vision Models
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
di: Zhang, Duzhen, et al.
Pubblicazione: (2025)
Do More Details Always Introduce More Hallucinations in LVLM-based Image Captioning?
di: Feng, Mingqian, et al.
Pubblicazione: (2024)
di: Feng, Mingqian, et al.
Pubblicazione: (2024)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
di: Jiang, Chaoya, et al.
Pubblicazione: (2023)
Omniview-Tuning: Boosting Viewpoint Invariance of Vision-Language Pre-training Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
di: Ruan, Shouwei, et al.
Pubblicazione: (2024)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
di: Tang, Yolo Yunlong, et al.
Pubblicazione: (2024)
EndoMatcher: Generalizable Endoscopic Image Matcher via Multi-Domain Pre-training for Robot-Assisted Surgery
di: Yang, Bingyu, et al.
Pubblicazione: (2025)
di: Yang, Bingyu, et al.
Pubblicazione: (2025)
Unveiling Visual Perception in Language Models: An Attention Head Analysis Approach
di: Bi, Jing, et al.
Pubblicazione: (2024)
di: Bi, Jing, et al.
Pubblicazione: (2024)
EAGLE: Egocentric AGgregated Language-video Engine
di: Bi, Jing, et al.
Pubblicazione: (2024)
di: Bi, Jing, et al.
Pubblicazione: (2024)
VLP: A Survey on Vision-Language Pre-training
di: Chen, Feilong, et al.
Pubblicazione: (2022)
di: Chen, Feilong, et al.
Pubblicazione: (2022)
3D Scene Graph Guided Vision-Language Pre-training
di: Liu, Hao, et al.
Pubblicazione: (2024)
di: Liu, Hao, et al.
Pubblicazione: (2024)
FINECAPTION: Compositional Image Captioning Focusing on Wherever You Want at Any Granularity
di: Hua, Hang, et al.
Pubblicazione: (2024)
di: Hua, Hang, et al.
Pubblicazione: (2024)
SocialFusion: Addressing Social Degradation in Pre-trained Vision-Language Models
di: Tahboub, Hamza, et al.
Pubblicazione: (2025)
di: Tahboub, Hamza, et al.
Pubblicazione: (2025)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
di: Zhou, Hantao, et al.
Pubblicazione: (2024)
Mind the Interference: Retaining Pre-trained Knowledge in Parameter Efficient Continual Learning of Vision-Language Models
di: Tang, Longxiang, et al.
Pubblicazione: (2024)
di: Tang, Longxiang, et al.
Pubblicazione: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
di: Wu, Shihan, et al.
Pubblicazione: (2024)
di: Wu, Shihan, et al.
Pubblicazione: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
di: Wei, Zihao, et al.
Pubblicazione: (2024)
di: Wei, Zihao, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Pre-training with Rich Supervisions
di: Gao, Yuan, et al.
Pubblicazione: (2024)
di: Gao, Yuan, et al.
Pubblicazione: (2024)
Bring Metric Functions into Diffusion Models
di: An, Jie, et al.
Pubblicazione: (2024)
di: An, Jie, et al.
Pubblicazione: (2024)
Unsupervised Pre-training with Language-Vision Prompts for Low-Data Instance Segmentation
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
di: Zhang, Dingwen, et al.
Pubblicazione: (2024)
ECAMP: Entity-centered Context-aware Medical Vision Language Pre-training
di: Wang, Rongsheng, et al.
Pubblicazione: (2023)
di: Wang, Rongsheng, et al.
Pubblicazione: (2023)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
di: Tang, Yunlong, et al.
Pubblicazione: (2025)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
di: Zhang, Ziyang, et al.
Pubblicazione: (2025)
Multilingual Vision-Language Pre-training for the Remote Sensing Domain
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
di: Silva, João Daniel, et al.
Pubblicazione: (2024)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
di: Zhou, Wenlve, et al.
Pubblicazione: (2024)
di: Zhou, Wenlve, et al.
Pubblicazione: (2024)
Anatomical Structure-Guided Medical Vision-Language Pre-training
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
di: Li, Qingqiu, et al.
Pubblicazione: (2024)
AutoTVG: A New Vision-language Pre-training Paradigm for Temporal Video Grounding
di: Zhang, Xing, et al.
Pubblicazione: (2024)
di: Zhang, Xing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
di: Hua, Hang, et al.
Pubblicazione: (2024) -
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
di: Zeng, Ziyun, et al.
Pubblicazione: (2025) -
MMIG-Bench: Towards Comprehensive and Explainable Evaluation of Multi-Modal Image Generation Models
di: Hua, Hang, et al.
Pubblicazione: (2025) -
PromptFix: You Prompt and We Fix the Photo
di: Yu, Yongsheng, et al.
Pubblicazione: (2024) -
GaussianStyle: Gaussian Head Avatar via StyleGAN
di: Liu, Pinxin, et al.
Pubblicazione: (2024)