BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Chaoya, Xu, Haiyang, Ye, Wei, Ye, Qinghao, Li, Chenliang, Yan, Ming, Bi, Bin, Zhang, Shikun, Huang, Fei, Huang, Songfang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Ye, Wei, et al.
Veröffentlicht: (2024)
von: Ye, Wei, et al.
Veröffentlicht: (2024)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
Exploiting Pseudo Image Captions for Multimodal Summarization
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
von: Jia, Hongrui, et al.
Veröffentlicht: (2024)
von: Jia, Hongrui, et al.
Veröffentlicht: (2024)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
von: Jiang, Chaoya, et al.
Veröffentlicht: (2025)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2025)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
Unifying Latent and Lexicon Representations for Effective Video-Text Retrieval
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
von: Heng, Yongrui, et al.
Veröffentlicht: (2026)
von: Heng, Yongrui, et al.
Veröffentlicht: (2026)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
von: Jia, Hongrui, et al.
Veröffentlicht: (2026)
von: Jia, Hongrui, et al.
Veröffentlicht: (2026)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
von: Hu, Anwen, et al.
Veröffentlicht: (2023)
von: Hu, Anwen, et al.
Veröffentlicht: (2023)
Classification Done Right for Vision-Language Pre-Training
von: Huang, Zilong, et al.
Veröffentlicht: (2024)
von: Huang, Zilong, et al.
Veröffentlicht: (2024)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
Enhancing In-Context Learning via Implicit Demonstration Augmentation
von: Zhou, Xiaoling, et al.
Veröffentlicht: (2024)
von: Zhou, Xiaoling, et al.
Veröffentlicht: (2024)
Efficient and Effective Universal Adversarial Attack against Vision-Language Pre-training Models
von: Yang, Fan, et al.
Veröffentlicht: (2024)
von: Yang, Fan, et al.
Veröffentlicht: (2024)
Universal Adversarial Perturbations for Vision-Language Pre-trained Models
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2024)
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2024)
Pre-training with Fractional Denoising to Enhance Molecular Property Prediction
von: Ni, Yuyan, et al.
Veröffentlicht: (2024)
von: Ni, Yuyan, et al.
Veröffentlicht: (2024)
Boosting Vision Semantic Density with Anatomy Normality Modeling for Medical Vision-language Pre-training
von: Cao, Weiwei, et al.
Veröffentlicht: (2025)
von: Cao, Weiwei, et al.
Veröffentlicht: (2025)
Semantic visually-guided acoustic highlighting with large vision-language models
von: Huang, Junhua, et al.
Veröffentlicht: (2026)
von: Huang, Junhua, et al.
Veröffentlicht: (2026)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
von: Kong, Dehong, et al.
Veröffentlicht: (2024)
von: Kong, Dehong, et al.
Veröffentlicht: (2024)
MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2025)
von: Zhang, Peng-Fei, et al.
Veröffentlicht: (2025)
Fractional Denoising for 3D Molecular Pre-training
von: Feng, Shikun, et al.
Veröffentlicht: (2023)
von: Feng, Shikun, et al.
Veröffentlicht: (2023)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
von: Hua, Hang, et al.
Veröffentlicht: (2024)
von: Hua, Hang, et al.
Veröffentlicht: (2024)
Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding
von: Shui, Zhongyi, et al.
Veröffentlicht: (2025)
von: Shui, Zhongyi, et al.
Veröffentlicht: (2025)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
von: Yao, Xin, et al.
Veröffentlicht: (2025)
von: Yao, Xin, et al.
Veröffentlicht: (2025)
Rediscovering Bottom-Up: Effective Forecasting in Temporal Hierarchies
von: Neubauer, Lukas, et al.
Veröffentlicht: (2024)
von: Neubauer, Lukas, et al.
Veröffentlicht: (2024)
Leveraging Bottom-Up and Top-Down Attention for Few-Shot Object Detection
von: Chen, Xianyu, et al.
Veröffentlicht: (2020)
von: Chen, Xianyu, et al.
Veröffentlicht: (2020)
Towards Effective and Efficient Continual Pre-training of Large Language Models
von: Chen, Jie, et al.
Veröffentlicht: (2024)
von: Chen, Jie, et al.
Veröffentlicht: (2024)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
von: Wu, Shihan, et al.
Veröffentlicht: (2024)
von: Wu, Shihan, et al.
Veröffentlicht: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
von: Shen, Hengyu, et al.
Veröffentlicht: (2026)
von: Shen, Hengyu, et al.
Veröffentlicht: (2026)
Watson-Callum/BUS-Tumour-Detection: BUS-Tumour-Detection release
von: Callum Watson
Veröffentlicht: (2025)
von: Callum Watson
Veröffentlicht: (2025)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2024)
Efficient and Effective In-context Demonstration Selection with Coreset
von: Wang, Zihua, et al.
Veröffentlicht: (2025)
von: Wang, Zihua, et al.
Veröffentlicht: (2025)
Low-Rank Adaptation of Pre-trained Vision Backbones for Energy-Efficient Image Coding for Machine
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
von: Zhang, Yichi, et al.
Veröffentlicht: (2025)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Ye, Wei, et al.
Veröffentlicht: (2024) -
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)