FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Huang, Chenyu, Ye, Peng, Tan, Xudong, Mu, Jinhan, Zheng, Shenghe, Shen, Li, Chen, Tao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
FREE-Merging: Fourier Transform for Efficient Model Merging
von: Zheng, Shenghe, et al.
Veröffentlicht: (2024)
von: Zheng, Shenghe, et al.
Veröffentlicht: (2024)
Decouple and Orthogonalize: A Data-Free Framework for LoRA Merging
von: Zheng, Shenghe, et al.
Veröffentlicht: (2025)
von: Zheng, Shenghe, et al.
Veröffentlicht: (2025)
EMR-Merging: Tuning-Free High-Performance Model Merging
von: Huang, Chenyu, et al.
Veröffentlicht: (2024)
von: Huang, Chenyu, et al.
Veröffentlicht: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025)
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025)
Dynamic Base model Shift for Delta Compression
von: Huang, Chenyu, et al.
Veröffentlicht: (2025)
von: Huang, Chenyu, et al.
Veröffentlicht: (2025)
FILA: Fine-Grained Vision Language Models
von: Zhu, Shiding, et al.
Veröffentlicht: (2024)
von: Zhu, Shiding, et al.
Veröffentlicht: (2024)
Think Twice, Act Once: Token-Aware Compression and Action Reuse for Efficient Inference in Vision-Language-Action Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
Subspace-Boosted Model Merging
von: Skorobogat, Ronald, et al.
Veröffentlicht: (2025)
von: Skorobogat, Ronald, et al.
Veröffentlicht: (2025)
Breaking the Compression Ceiling: Data-Free Pipeline for Ultra-Efficient Delta Compression
von: Wang, Xiaohui, et al.
Veröffentlicht: (2025)
von: Wang, Xiaohui, et al.
Veröffentlicht: (2025)
Seeing Delta Parameters as JPEG Images: Data-Free Delta Compression with Discrete Cosine Transform
von: Huang, Chenyu, et al.
Veröffentlicht: (2025)
von: Huang, Chenyu, et al.
Veröffentlicht: (2025)
Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models
von: Li, Xudong, et al.
Veröffentlicht: (2024)
von: Li, Xudong, et al.
Veröffentlicht: (2024)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
von: Tan, Huajie, et al.
Veröffentlicht: (2025)
von: Tan, Huajie, et al.
Veröffentlicht: (2025)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
von: Qian, Long, et al.
Veröffentlicht: (2024)
von: Qian, Long, et al.
Veröffentlicht: (2024)
SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models
von: Reza, Md Kaykobad, et al.
Veröffentlicht: (2026)
von: Reza, Md Kaykobad, et al.
Veröffentlicht: (2026)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
von: Wei, Canshi
Veröffentlicht: (2024)
von: Wei, Canshi
Veröffentlicht: (2024)
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
von: Sayem, MD Khalequzzaman Chowdhury, et al.
Veröffentlicht: (2026)
von: Sayem, MD Khalequzzaman Chowdhury, et al.
Veröffentlicht: (2026)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
von: Hai, Jia-Wei, et al.
Veröffentlicht: (2026)
von: Hai, Jia-Wei, et al.
Veröffentlicht: (2026)
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
von: Chen, Honghao, et al.
Veröffentlicht: (2025)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
von: Lan, Long, et al.
Veröffentlicht: (2024)
von: Lan, Long, et al.
Veröffentlicht: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
von: Jiang, Jiachen, et al.
Veröffentlicht: (2025)
Continual Learning in Vision-Language Models via Aligned Model Merging
von: Sokar, Ghada, et al.
Veröffentlicht: (2025)
von: Sokar, Ghada, et al.
Veröffentlicht: (2025)
Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
von: Zou, Shu, et al.
Veröffentlicht: (2025)
von: Zou, Shu, et al.
Veröffentlicht: (2025)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
von: Liu, Peng, et al.
Veröffentlicht: (2025)
von: Liu, Peng, et al.
Veröffentlicht: (2025)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
von: Liu, Yaohua, et al.
Veröffentlicht: (2025)
von: Liu, Yaohua, et al.
Veröffentlicht: (2025)
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
von: Wang, Chun, et al.
Veröffentlicht: (2025)
von: Wang, Chun, et al.
Veröffentlicht: (2025)
Perceptual Taxonomy: Evaluating and Guiding Hierarchical Scene Reasoning in Vision-Language Models
von: Lee, Jonathan, et al.
Veröffentlicht: (2025)
von: Lee, Jonathan, et al.
Veröffentlicht: (2025)
Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback
von: Xiao, Wenyi, et al.
Veröffentlicht: (2024)
von: Xiao, Wenyi, et al.
Veröffentlicht: (2024)
Bridging Domains through Subspace-Aware Model Merging
von: Chaves, Levy, et al.
Veröffentlicht: (2026)
von: Chaves, Levy, et al.
Veröffentlicht: (2026)
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
von: Lu, Hui, et al.
Veröffentlicht: (2025)
von: Lu, Hui, et al.
Veröffentlicht: (2025)
Adversarial Prompt Injection Attack on Multimodal Large Language Models
von: Ding, Meiwen, et al.
Veröffentlicht: (2026)
von: Ding, Meiwen, et al.
Veröffentlicht: (2026)
MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models
von: Sun, Xiongtao, et al.
Veröffentlicht: (2025)
von: Sun, Xiongtao, et al.
Veröffentlicht: (2025)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
von: Ghosh, Dhruba, et al.
Veröffentlicht: (2026)
von: Ghosh, Dhruba, et al.
Veröffentlicht: (2026)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
von: Shen, Yuxiang, et al.
Veröffentlicht: (2026)
3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Models
von: Zhan, Shaoxiong, et al.
Veröffentlicht: (2026)
von: Zhan, Shaoxiong, et al.
Veröffentlicht: (2026)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
von: Li, Yue, et al.
Veröffentlicht: (2025)
von: Li, Yue, et al.
Veröffentlicht: (2025)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
von: Cai, Hengxing, et al.
Veröffentlicht: (2025)
von: Cai, Hengxing, et al.
Veröffentlicht: (2025)
Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
von: Peng, Wujian, et al.
Veröffentlicht: (2023)
von: Peng, Wujian, et al.
Veröffentlicht: (2023)
TokenCarve: Information-Preserving Visual Token Compression in Multimodal Large Language Models
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
von: Tan, Xudong, et al.
Veröffentlicht: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
von: Yan, Siming, et al.
Veröffentlicht: (2024)
von: Yan, Siming, et al.
Veröffentlicht: (2024)
Text Prompt Injection of Vision Language Models
von: Zhu, Ruizhe
Veröffentlicht: (2025)
von: Zhu, Ruizhe
Veröffentlicht: (2025)
Ähnliche Einträge
-
FREE-Merging: Fourier Transform for Efficient Model Merging
von: Zheng, Shenghe, et al.
Veröffentlicht: (2024) -
Decouple and Orthogonalize: A Data-Free Framework for LoRA Merging
von: Zheng, Shenghe, et al.
Veröffentlicht: (2025) -
EMR-Merging: Tuning-Free High-Performance Model Merging
von: Huang, Chenyu, et al.
Veröffentlicht: (2024) -
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025) -
Dynamic Base model Shift for Delta Compression
von: Huang, Chenyu, et al.
Veröffentlicht: (2025)