TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Jiang, Chaoya, Xu, Haiyang, Li, Chenliang, Yan, Miang, Ye, Wei, Zhang, Shikun, Bi, Bin, Huang, Songfang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Ye, Wei, et al.
Veröffentlicht: (2024)
von: Ye, Wei, et al.
Veröffentlicht: (2024)
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
Exploiting Pseudo Image Captions for Multimodal Summarization
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
Hallucination Augmented Contrastive Learning for Multimodal Large Language Model
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization
von: Jia, Hongrui, et al.
Veröffentlicht: (2024)
von: Jia, Hongrui, et al.
Veröffentlicht: (2024)
VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
von: Jiang, Chaoya, et al.
Veröffentlicht: (2025)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2025)
EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations
von: Heng, Yongrui, et al.
Veröffentlicht: (2026)
von: Heng, Yongrui, et al.
Veröffentlicht: (2026)
From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models
von: Jia, Hongrui, et al.
Veröffentlicht: (2026)
von: Jia, Hongrui, et al.
Veröffentlicht: (2026)
MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models
von: Hua, Hang, et al.
Veröffentlicht: (2024)
von: Hua, Hang, et al.
Veröffentlicht: (2024)
Patch is Enough: Naturalistic Adversarial Patch against Vision-Language Pre-training Models
von: Kong, Dehong, et al.
Veröffentlicht: (2024)
von: Kong, Dehong, et al.
Veröffentlicht: (2024)
Efficient and Long-Tailed Generalization for Pre-trained Vision-Language Model
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
von: Shi, Jiang-Xin, et al.
Veröffentlicht: (2024)
Efficient Vision-Language Pre-training by Cluster Masking
von: Wei, Zihao, et al.
Veröffentlicht: (2024)
von: Wei, Zihao, et al.
Veröffentlicht: (2024)
ERIC: Online, Offline & Without Line. A Summary and a Report on the Staff Interaction Seminar [at the Institute of Education Library] (Singapore, January 18, 1986).
von: Ho, Soo Miang
Veröffentlicht: (1986)
von: Ho, Soo Miang
Veröffentlicht: (1986)
Enhancing In-Context Learning via Implicit Demonstration Augmentation
von: Zhou, Xiaoling, et al.
Veröffentlicht: (2024)
von: Zhou, Xiaoling, et al.
Veröffentlicht: (2024)
MIBench: Evaluating Multimodal Large Language Models over Multiple Images
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
von: Yao, Xin, et al.
Veröffentlicht: (2025)
von: Yao, Xin, et al.
Veröffentlicht: (2025)
ELIP: Efficient Discriminative Language-Image Pre-training with Fewer Vision Tokens
von: Guo, Yangyang, et al.
Veröffentlicht: (2023)
von: Guo, Yangyang, et al.
Veröffentlicht: (2023)
Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?
von: Che, Chengan, et al.
Veröffentlicht: (2026)
von: Che, Chengan, et al.
Veröffentlicht: (2026)
VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine
von: Zhang, Ziyang, et al.
Veröffentlicht: (2025)
von: Zhang, Ziyang, et al.
Veröffentlicht: (2025)
LoTLIP: Improving Language-Image Pre-training for Long Text Understanding
von: Wu, Wei, et al.
Veröffentlicht: (2024)
von: Wu, Wei, et al.
Veröffentlicht: (2024)
FIELD TRIPS OF THE CLUB
von: Frazee, Vernon L, et al.
Veröffentlicht: (1935)
von: Frazee, Vernon L, et al.
Veröffentlicht: (1935)
FIELD TRIPS OF THE CLUB
von: Beals, A. T., et al.
Veröffentlicht: (1939)
von: Beals, A. T., et al.
Veröffentlicht: (1939)
TRIPS : ANIMAL KINGDOMS
von: STREN, OLIVIA
Veröffentlicht: (2006)
von: STREN, OLIVIA
Veröffentlicht: (2006)
Text Grouping Adapter: Adapting Pre-trained Text Detector for Layout Analysis
von: Bi, Tianci, et al.
Veröffentlicht: (2024)
von: Bi, Tianci, et al.
Veröffentlicht: (2024)
Vision Model Pre-training on Interleaved Image-Text Data via Latent Compression Learning
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
von: Yang, Chenyu, et al.
Veröffentlicht: (2024)
What to Do Next? Memorizing skills from Egocentric Instructional Video
von: Bi, Jing, et al.
Veröffentlicht: (2025)
von: Bi, Jing, et al.
Veröffentlicht: (2025)
OSWorld-MCP: Benchmarking MCP Tool Invocation In Computer-Use Agents
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
von: Jia, Hongrui, et al.
Veröffentlicht: (2025)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
von: Yan, Xin, et al.
Veröffentlicht: (2023)
von: Yan, Xin, et al.
Veröffentlicht: (2023)
Learning to Rank Pre-trained Vision-Language Models for Downstream Tasks
von: Ding, Yuhe, et al.
Veröffentlicht: (2024)
von: Ding, Yuhe, et al.
Veröffentlicht: (2024)
TRELM: Towards Robust and Efficient Pre-training for Knowledge-Enhanced Language Models
von: Yan, Junbing, et al.
Veröffentlicht: (2024)
von: Yan, Junbing, et al.
Veröffentlicht: (2024)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
von: Duan, Chen, et al.
Veröffentlicht: (2024)
von: Duan, Chen, et al.
Veröffentlicht: (2024)
Efficiently Leveraging Linguistic Priors for Scene Text Spotting
von: Nguyen, Nguyen, et al.
Veröffentlicht: (2024)
von: Nguyen, Nguyen, et al.
Veröffentlicht: (2024)
Pseudo-Prompt Generating in Pre-trained Vision-Language Models for Multi-Label Medical Image Classification
von: Ye, Yaoqin, et al.
Veröffentlicht: (2024)
von: Ye, Yaoqin, et al.
Veröffentlicht: (2024)
Towards Effective and Efficient Continual Pre-training of Large Language Models
von: Chen, Jie, et al.
Veröffentlicht: (2024)
von: Chen, Jie, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Ye, Wei, et al.
Veröffentlicht: (2024) -
BUS:Efficient and Effective Vision-language Pre-training with Bottom-Up Patch Summarization
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
TiMix: Text-aware Image Mixing for Effective Vision-Language Pre-training
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023) -
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
von: Jiang, Chaoya, et al.
Veröffentlicht: (2024)