MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Ruoxiang, Yuan, Zhen |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
von: Huang, Ruoxiang, et al.
Veröffentlicht: (2025)
von: Huang, Ruoxiang, et al.
Veröffentlicht: (2025)
Training-Free Unsupervised Prompt for Vision-Language Models
von: Long, Sifan, et al.
Veröffentlicht: (2024)
von: Long, Sifan, et al.
Veröffentlicht: (2024)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
von: Zhang, Jieyu, et al.
Veröffentlicht: (2024)
von: Zhang, Jieyu, et al.
Veröffentlicht: (2024)
Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
von: Ong, Brandon, et al.
Veröffentlicht: (2025)
von: Ong, Brandon, et al.
Veröffentlicht: (2025)
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
von: Haller, Patrick, et al.
Veröffentlicht: (2025)
von: Haller, Patrick, et al.
Veröffentlicht: (2025)
See&Trek: Training-Free Spatial Prompting for Multimodal Large Language Model
von: Li, Pengteng, et al.
Veröffentlicht: (2025)
von: Li, Pengteng, et al.
Veröffentlicht: (2025)
ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving
von: Sha, Lin, et al.
Veröffentlicht: (2026)
von: Sha, Lin, et al.
Veröffentlicht: (2026)
Xmodel-VLM: A Simple Baseline for Multimodal Vision Language Model
von: Xu, Wanting, et al.
Veröffentlicht: (2024)
von: Xu, Wanting, et al.
Veröffentlicht: (2024)
DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion
von: Guo, Yuchen, et al.
Veröffentlicht: (2024)
von: Guo, Yuchen, et al.
Veröffentlicht: (2024)
Stitch: Training-Free Position Control in Multimodal Diffusion Transformers
von: Bader, Jessica, et al.
Veröffentlicht: (2025)
von: Bader, Jessica, et al.
Veröffentlicht: (2025)
MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
von: Liu, Shengyuan, et al.
Veröffentlicht: (2026)
ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning
von: Xi, Gongli, et al.
Veröffentlicht: (2026)
von: Xi, Gongli, et al.
Veröffentlicht: (2026)
Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models
von: Morini, Marco, et al.
Veröffentlicht: (2026)
von: Morini, Marco, et al.
Veröffentlicht: (2026)
Training-Free Mitigation of Language Reasoning Degradation After Multimodal Instruction Tuning
von: Ratzlaff, Neale, et al.
Veröffentlicht: (2024)
von: Ratzlaff, Neale, et al.
Veröffentlicht: (2024)
Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models
von: Huang, Wenxuan, et al.
Veröffentlicht: (2026)
von: Huang, Wenxuan, et al.
Veröffentlicht: (2026)
Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
von: Zhong, Weihong, et al.
Veröffentlicht: (2024)
von: Zhong, Weihong, et al.
Veröffentlicht: (2024)
AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models
von: Rao, Zhifeng, et al.
Veröffentlicht: (2026)
von: Rao, Zhifeng, et al.
Veröffentlicht: (2026)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
von: Hao, Chao, et al.
Veröffentlicht: (2026)
von: Hao, Chao, et al.
Veröffentlicht: (2026)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
von: Yu, Xiaomin, et al.
Veröffentlicht: (2026)
von: Yu, Xiaomin, et al.
Veröffentlicht: (2026)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
von: Jiang, Ziyan, et al.
Veröffentlicht: (2024)
von: Jiang, Ziyan, et al.
Veröffentlicht: (2024)
PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models
von: Zhang, Ruizhi, et al.
Veröffentlicht: (2026)
von: Zhang, Ruizhi, et al.
Veröffentlicht: (2026)
Jailbreaks on Vision Language Model via Multimodal Reasoning
von: Noheria, Aarush, et al.
Veröffentlicht: (2026)
von: Noheria, Aarush, et al.
Veröffentlicht: (2026)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
von: Li, Muyao, et al.
Veröffentlicht: (2025)
von: Li, Muyao, et al.
Veröffentlicht: (2025)
Pre-Trained Vision-Language Models as Partial Annotators
von: Wang, Qian-Wei, et al.
Veröffentlicht: (2024)
von: Wang, Qian-Wei, et al.
Veröffentlicht: (2024)
Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning
von: Liu, Junming, et al.
Veröffentlicht: (2025)
von: Liu, Junming, et al.
Veröffentlicht: (2025)
Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training
von: Sarto, Sara, et al.
Veröffentlicht: (2024)
von: Sarto, Sara, et al.
Veröffentlicht: (2024)
VLMQ: Token Saliency-Driven Post-Training Quantization for Vision-language Models
von: Xue, Yufei, et al.
Veröffentlicht: (2025)
von: Xue, Yufei, et al.
Veröffentlicht: (2025)
Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer
von: Lee, Dong In, et al.
Veröffentlicht: (2025)
von: Lee, Dong In, et al.
Veröffentlicht: (2025)
Exploring Curriculum Learning for Vision-Language Tasks: A Study on Small-Scale Multimodal Training
von: Saha, Rohan, et al.
Veröffentlicht: (2024)
von: Saha, Rohan, et al.
Veröffentlicht: (2024)
TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
von: Yang, Cheng, et al.
Veröffentlicht: (2025)
A Multimodal Vision Foundation Model for Clinical Dermatology
von: Yan, Siyuan, et al.
Veröffentlicht: (2024)
von: Yan, Siyuan, et al.
Veröffentlicht: (2024)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
von: Ye, Zhipeng, et al.
Veröffentlicht: (2026)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
von: Zhang, Xinsong, et al.
Veröffentlicht: (2025)
von: Zhang, Xinsong, et al.
Veröffentlicht: (2025)
UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
von: Guo, Hongyu, et al.
Veröffentlicht: (2025)
von: Guo, Hongyu, et al.
Veröffentlicht: (2025)
Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion
von: Chen, Zhuokun, et al.
Veröffentlicht: (2024)
von: Chen, Zhuokun, et al.
Veröffentlicht: (2024)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
von: Yasunaga, Michihiro, et al.
Veröffentlicht: (2025)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
von: Deniz, Omer Faruk, et al.
Veröffentlicht: (2026)
von: Deniz, Omer Faruk, et al.
Veröffentlicht: (2026)
Adapting Vision-Language Models for E-commerce Understanding at Scale
von: Nulli, Matteo, et al.
Veröffentlicht: (2026)
von: Nulli, Matteo, et al.
Veröffentlicht: (2026)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
von: Wang, Ruofan, et al.
Veröffentlicht: (2024)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
von: Wang, Yizhou, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
von: Huang, Ruoxiang, et al.
Veröffentlicht: (2025) -
Training-Free Unsupervised Prompt for Vision-Language Models
von: Long, Sifan, et al.
Veröffentlicht: (2024) -
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
von: Zhang, Jieyu, et al.
Veröffentlicht: (2024) -
Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
von: Ong, Brandon, et al.
Veröffentlicht: (2025) -
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
von: Haller, Patrick, et al.
Veröffentlicht: (2025)