AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yuan, Fan, Chun-Kai, Yu, Sicheng, Pan, Junwen, Huang, Tao, Lu, Ming, Cheng, Kuan, She, Qi, Zhang, Shanghang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
par: Zhang, Yuan, et autres
Publié: (2025)
par: Zhang, Yuan, et autres
Publié: (2025)
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025)
par: Zhang, Qizhe, et autres
Publié: (2025)
FreeKD: Knowledge Distillation via Semantic Frequency Prompt
par: Zhang, Yuan, et autres
Publié: (2023)
par: Zhang, Yuan, et autres
Publié: (2023)
On the Faithfulness of Visual Thinking: Measurement and Enhancement
par: Liu, Zujing, et autres
Publié: (2025)
par: Liu, Zujing, et autres
Publié: (2025)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
SEED: Targeted Data Selection by Weighted Independent Set
par: Zhang, Yuan, et autres
Publié: (2026)
par: Zhang, Yuan, et autres
Publié: (2026)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
par: Zhang, Qizhe, et autres
Publié: (2024)
par: Zhang, Qizhe, et autres
Publié: (2024)
MammothModa: Multi-Modal Large Language Model
par: She, Qi, et autres
Publié: (2024)
par: She, Qi, et autres
Publié: (2024)
TimeSearch-R: Adaptive Temporal Search for Long-Form Video Understanding via Self-Verification Reinforcement Learning
par: Pan, Junwen, et autres
Publié: (2025)
par: Pan, Junwen, et autres
Publié: (2025)
Unveiling the Tapestry of Consistency in Large Vision-Language Models
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs
par: Lu, Hongyu, et autres
Publié: (2026)
par: Lu, Hongyu, et autres
Publié: (2026)
MoVE-KD: Knowledge Distillation for VLMs with Mixture of Visual Encoders
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning
par: Luo, Tianci, et autres
Publié: (2026)
par: Luo, Tianci, et autres
Publié: (2026)
Enhancing Logits Distillation with Plug\&Play Kendall's $τ$ Ranking Loss
par: Guan, Yuchen, et autres
Publié: (2024)
par: Guan, Yuchen, et autres
Publié: (2024)
Enhancing the Reliability of Segment Anything Model for Auto-Prompting Medical Image Segmentation with Uncertainty Rectification
par: Zhang, Yichi, et autres
Publié: (2023)
par: Zhang, Yichi, et autres
Publié: (2023)
Exploring Sparse Visual Prompt for Domain Adaptive Dense Prediction
par: Yang, Senqiao, et autres
Publié: (2023)
par: Yang, Senqiao, et autres
Publié: (2023)
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying
par: Bai, Chengyu, et autres
Publié: (2025)
par: Bai, Chengyu, et autres
Publié: (2025)
BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models
par: Li, Yuming, et autres
Publié: (2025)
par: Li, Yuming, et autres
Publié: (2025)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs
par: Khayatan, Pegah, et autres
Publié: (2026)
par: Khayatan, Pegah, et autres
Publié: (2026)
Logic-Oriented Retriever Enhancement via Contrastive Learning
par: Zhang, Wenxuan, et autres
Publié: (2026)
par: Zhang, Wenxuan, et autres
Publié: (2026)
RepCaM++: Exploring Transparent Visual Prompt With Inference-Time Re-Parameterization for Neural Video Delivery
par: Zhang, Rongyu, et autres
Publié: (2025)
par: Zhang, Rongyu, et autres
Publié: (2025)
Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs
par: Zhu, Xiangyang, et autres
Publié: (2026)
par: Zhu, Xiangyang, et autres
Publié: (2026)
SHIELD: Classifier-Guided Prompting for Robust and Safer LVLMs
par: Ren, Juan, et autres
Publié: (2025)
par: Ren, Juan, et autres
Publié: (2025)
Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence
par: He, Jinghan, et autres
Publié: (2024)
par: He, Jinghan, et autres
Publié: (2024)
FastInit: Fast Noise Initialization for Temporally Consistent Video Generation
par: Bai, Chengyu, et autres
Publié: (2025)
par: Bai, Chengyu, et autres
Publié: (2025)
ASGDiffusion: Parallel High-Resolution Generation with Asynchronous Structure Guidance
par: Li, Yuming, et autres
Publié: (2024)
par: Li, Yuming, et autres
Publié: (2024)
Rare‐Species Loss Reduces Gannan Grassland Ecosystem Functional Redundancy and Stability
par: Jing Yuan, et autres
Publié: (2026)
par: Jing Yuan, et autres
Publié: (2026)
AutoCast++: Enhancing World Event Prediction with Zero-shot Ranking-based Context Retrieval
par: Yan, Qi, et autres
Publié: (2023)
par: Yan, Qi, et autres
Publié: (2023)
Unifying Ranking and Generation in Query Auto-Completion via Retrieval-Augmented Generation and Multi-Objective Alignment
par: Yuan, Kai, et autres
Publié: (2026)
par: Yuan, Kai, et autres
Publié: (2026)
See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs
par: Dai, Ziyun, et autres
Publié: (2025)
par: Dai, Ziyun, et autres
Publié: (2025)
Revealing and Enhancing Core Visual Regions: Harnessing Internal Attention Dynamics for Hallucination Mitigation in LVLMs
par: Lyu, Guangtao, et autres
Publié: (2026)
par: Lyu, Guangtao, et autres
Publié: (2026)
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
par: Huang, Siyuan, et autres
Publié: (2026)
par: Huang, Siyuan, et autres
Publié: (2026)
DiffDub: Person-generic Visual Dubbing Using Inpainting Renderer with Diffusion Auto-encoder
par: Liu, Tao, et autres
Publié: (2023)
par: Liu, Tao, et autres
Publié: (2023)
Auto-Prompting with Retrieval Guidance for Frame Detection in Logistics
par: Duc, Do Minh, et autres
Publié: (2025)
par: Duc, Do Minh, et autres
Publié: (2025)
SAN: Hypothesizing Long-Term Synaptic Development and Neural Engram Mechanism in Scalable Model's Parameter-Efficient Fine-Tuning
par: Dai, Gaole, et autres
Publié: (2024)
par: Dai, Gaole, et autres
Publié: (2024)
Binary Expansion Group Intersection Network
par: Zhou, Sicheng, et autres
Publié: (2026)
par: Zhou, Sicheng, et autres
Publié: (2026)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
Fusion rules of V_{L_2}^{S_4}
par: Liao, Junwen
Publié: (2026)
par: Liao, Junwen
Publié: (2026)
Documents similaires
-
ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better
par: Zhang, Yuan, et autres
Publié: (2025) -
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
par: Zhang, Qizhe, et autres
Publié: (2025) -
FreeKD: Knowledge Distillation via Semantic Frequency Prompt
par: Zhang, Yuan, et autres
Publié: (2023) -
On the Faithfulness of Visual Thinking: Measurement and Enhancement
par: Liu, Zujing, et autres
Publié: (2025) -
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
par: Pan, Junwen, et autres
Publié: (2025)