SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Chuanhao, Li, Zhen, Jing, Chenchen, Liu, Shuo, Shao, Wenqi, Wu, Yuwei, Luo, Ping, Qiao, Yu, Zhang, Kaipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024)
par: Liu, Shuo, et autres
Publié: (2024)
IA-T2I: Internet-Augmented Text-to-Image Generation
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Composition-Incremental Learning for Compositional Generalization
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
Consistency of Compositional Generalization across Multiple Levels
par: Li, Chuanhao, et autres
Publié: (2024)
par: Li, Chuanhao, et autres
Publié: (2024)
MLLMs-Augmented Visual-Language Representation Learning
par: Liu, Yanqing, et autres
Publié: (2023)
par: Liu, Yanqing, et autres
Publié: (2023)
B-AVIBench: Towards Evaluating the Robustness of Large Vision-Language Model on Black-box Adversarial Visual-Instructions
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Generation-Augmented Generation: A Plug-and-Play Framework for Private Knowledge Injection in Large Language Models
par: Li, Rongji, et autres
Publié: (2026)
par: Li, Rongji, et autres
Publié: (2026)
Dynamic Multimodal Evaluation with Flexible Complexity by Vision-Language Bootstrapping
par: Yang, Yue, et autres
Publié: (2024)
par: Yang, Yue, et autres
Publié: (2024)
Self-Prophetic Decoding to Unlock Visual Search in LVLMs
par: He, Zhendong, et autres
Publié: (2026)
par: He, Zhendong, et autres
Publié: (2026)
WildWorld: A Large-Scale Dataset for Dynamic World Modeling with Actions and Explicit State toward Generative ARPG
par: Li, Zhen, et autres
Publié: (2026)
par: Li, Zhen, et autres
Publié: (2026)
PAS: Data-Efficient Plug-and-Play Prompt Augmentation System
par: Zheng, Miao, et autres
Publié: (2024)
par: Zheng, Miao, et autres
Publié: (2024)
Plug-and-Play Training Framework for Preference Optimization
par: Ma, Jingyuan, et autres
Publié: (2024)
par: Ma, Jingyuan, et autres
Publié: (2024)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
par: Li, MingSheng, et autres
Publié: (2025)
par: Li, MingSheng, et autres
Publié: (2025)
ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
Self-supervised Deep Hyperspectral Inpainting with the Plug and Play and Deep Image Prior Models
par: Li, Shuo, et autres
Publié: (2025)
par: Li, Shuo, et autres
Publié: (2025)
TinyLVLM-eHub: Towards Comprehensive and Efficient Evaluation for Large Vision-Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
par: Xie, Yuxuan, et autres
Publié: (2024)
par: Xie, Yuxuan, et autres
Publié: (2024)
Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation
par: Zhang, Hao, et autres
Publié: (2024)
par: Zhang, Hao, et autres
Publié: (2024)
Multi-Sourced Compositional Generalization in Visual Question Answering
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
Leveraging Data to Say No: Memory Augmented Plug-and-Play Selective Prediction
par: Sarkar, Aditya, et autres
Publié: (2026)
par: Sarkar, Aditya, et autres
Publié: (2026)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
par: Zhang, Hao, et autres
Publié: (2023)
par: Zhang, Hao, et autres
Publié: (2023)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
BESA: Pruning Large Language Models with Blockwise Parameter-Efficient Sparsity Allocation
par: Xu, Peng, et autres
Publié: (2024)
par: Xu, Peng, et autres
Publié: (2024)
Plug-and-Play Label Map Diffusion for Universal Goal-Oriented Navigation
par: Shen, Zhixuan, et autres
Publié: (2026)
par: Shen, Zhixuan, et autres
Publié: (2026)
FKA-Owl: Advancing Multimodal Fake News Detection through Knowledge-Augmented LVLMs
par: Liu, Xuannan, et autres
Publié: (2024)
par: Liu, Xuannan, et autres
Publié: (2024)
Decoupled Alignment for Robust Plug-and-Play Adaptation
par: Luo, Haozheng, et autres
Publié: (2024)
par: Luo, Haozheng, et autres
Publié: (2024)
Yume-1.5: A Text-Controlled Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
Adapting LLaMA Decoder to Vision Transformer
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
DSAS: A Universal Plug-and-Play Framework for Attention Optimization in Multi-Document Question Answering
par: Li, Jiakai, et autres
Publié: (2025)
par: Li, Jiakai, et autres
Publié: (2025)
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
par: Lin, Yuqi, et autres
Publié: (2025)
par: Lin, Yuqi, et autres
Publié: (2025)
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
par: Dai, Yuekun, et autres
Publié: (2025)
par: Dai, Yuekun, et autres
Publié: (2025)
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
Zero-Indexing Internet Search Augmented Generation for Large Language Models
par: He, Guangxin, et autres
Publié: (2024)
par: He, Guangxin, et autres
Publié: (2024)
A Knowledge Plug-and-Play Test Bed for Open-domain Dialogue Generation
par: Li, Xiangci, et autres
Publié: (2024)
par: Li, Xiangci, et autres
Publié: (2024)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
par: Xiong, Minhao, et autres
Publié: (2025)
par: Xiong, Minhao, et autres
Publié: (2025)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
par: Chen, Mengzhao, et autres
Publié: (2024)
par: Chen, Mengzhao, et autres
Publié: (2024)
Documents similaires
-
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024) -
IA-T2I: Internet-Augmented Text-to-Image Generation
par: Li, Chuanhao, et autres
Publié: (2025) -
Composition-Incremental Learning for Compositional Generalization
par: Li, Zhen, et autres
Publié: (2025) -
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024) -
Consistency of Compositional Generalization across Multiple Levels
par: Li, Chuanhao, et autres
Publié: (2024)