Vision Function Layer in Multimodal LLMs
Fuente:
arXiv
Saved in:
| Main Authors: | Shi, Cheng, Yu, Yizhou, Yang, Sibei |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026)
by: Shi, Cheng, et al.
Published: (2026)
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
by: Zhang, Yulin, et al.
Published: (2026)
by: Zhang, Yulin, et al.
Published: (2026)
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
by: Shi, Cheng, et al.
Published: (2024)
by: Shi, Cheng, et al.
Published: (2024)
Plain-Det: A Plain Multi-Dataset Object Detector
by: Shi, Cheng, et al.
Published: (2024)
by: Shi, Cheng, et al.
Published: (2024)
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
by: Zhang, Yulin, et al.
Published: (2025)
by: Zhang, Yulin, et al.
Published: (2025)
TransXNet: Learning Both Global and Local Dynamics with a Dual Dynamic Token Mixer for Visual Recognition
by: Lou, Meng, et al.
Published: (2023)
by: Lou, Meng, et al.
Published: (2023)
SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks
by: Lou, Meng, et al.
Published: (2024)
by: Lou, Meng, et al.
Published: (2024)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
by: Pan, Yu, et al.
Published: (2026)
by: Pan, Yu, et al.
Published: (2026)
Free on the Fly: Enhancing Flexibility in Test-Time Adaptation with Online EM
by: Dai, Qiyuan, et al.
Published: (2025)
by: Dai, Qiyuan, et al.
Published: (2025)
Curriculum Point Prompting for Weakly-Supervised Referring Image Segmentation
by: Dai, Qiyuan, et al.
Published: (2024)
by: Dai, Qiyuan, et al.
Published: (2024)
Part2Object: Hierarchical Unsupervised 3D Instance Segmentation
by: Shi, Cheng, et al.
Published: (2024)
by: Shi, Cheng, et al.
Published: (2024)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
by: Yu, Chunlin, et al.
Published: (2024)
by: Yu, Chunlin, et al.
Published: (2024)
Adaptive Part Learning for Fine-Grained Generalized Category Discovery: A Plug-and-Play Enhancement
by: Dai, Qiyuan, et al.
Published: (2025)
by: Dai, Qiyuan, et al.
Published: (2025)
Parameters as Experts: Adapting Vision Models with Dynamic Parameter Routing
by: Lou, Meng, et al.
Published: (2026)
by: Lou, Meng, et al.
Published: (2026)
No More Sibling Rivalry: Debiasing Human-Object Interaction Detection
by: Yang, Bin, et al.
Published: (2025)
by: Yang, Bin, et al.
Published: (2025)
A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
by: Chen, Chaoqi, et al.
Published: (2022)
by: Chen, Chaoqi, et al.
Published: (2022)
Augmenting Moment Retrieval: Zero-Dependency Two-Stage Learning
by: Wei, Zhengxuan, et al.
Published: (2025)
by: Wei, Zhengxuan, et al.
Published: (2025)
Mitigating Hallucination in Multimodal LLMs with Layer Contrastive Decoding
by: Tong, Bingkui, et al.
Published: (2025)
by: Tong, Bingkui, et al.
Published: (2025)
Rethinking Query-based Transformer for Continual Image Segmentation
by: Zhu, Yuchen, et al.
Published: (2025)
by: Zhu, Yuchen, et al.
Published: (2025)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
by: Cao, Yue, et al.
Published: (2024)
by: Cao, Yue, et al.
Published: (2024)
Sim-DETR: Unlock DETR for Temporal Sentence Grounding
by: Tang, Jiajin, et al.
Published: (2025)
by: Tang, Jiajin, et al.
Published: (2025)
VLDrive: Vision-Augmented Lightweight MLLMs for Efficient Language-grounded Autonomous Driving
by: Zhang, Ruifei, et al.
Published: (2025)
by: Zhang, Ruifei, et al.
Published: (2025)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
by: Cheng, Zhili, et al.
Published: (2025)
by: Cheng, Zhili, et al.
Published: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
by: Wang, Yizhou, et al.
Published: (2025)
by: Wang, Yizhou, et al.
Published: (2025)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
by: Jain, Jitesh, et al.
Published: (2024)
by: Jain, Jitesh, et al.
Published: (2024)
Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs
by: Tong, Shengbang, et al.
Published: (2024)
by: Tong, Shengbang, et al.
Published: (2024)
Closed-Loop Transfer for Weakly-supervised Affordance Grounding
by: Tang, Jiajin, et al.
Published: (2025)
by: Tang, Jiajin, et al.
Published: (2025)
Penalizing Boundary Activation for Object Completeness in Diffusion Models
by: Xu, Haoyang, et al.
Published: (2025)
by: Xu, Haoyang, et al.
Published: (2025)
FoSS: Modeling Long Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier State Space Integration
by: Huang, Yizhou, et al.
Published: (2026)
by: Huang, Yizhou, et al.
Published: (2026)
From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs
by: Zhang, Le, et al.
Published: (2026)
by: Zhang, Le, et al.
Published: (2026)
Aerial Vision-and-Language Navigation with Grid-based View Selection and Map Construction
by: Zhao, Ganlong, et al.
Published: (2025)
by: Zhao, Ganlong, et al.
Published: (2025)
Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models
by: Lian, Chenyu, et al.
Published: (2024)
by: Lian, Chenyu, et al.
Published: (2024)
Discovering Influential Neuron Path in Vision Transformers
by: Wang, Yifan, et al.
Published: (2025)
by: Wang, Yifan, et al.
Published: (2025)
Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs
by: Wang, Chongyu, et al.
Published: (2026)
by: Wang, Chongyu, et al.
Published: (2026)
OVER-NAV: Elevating Iterative Vision-and-Language Navigation with Open-Vocabulary Detection and StructurEd Representation
by: Zhao, Ganlong, et al.
Published: (2024)
by: Zhao, Ganlong, et al.
Published: (2024)
MAC: A Benchmark for Multiple Attributes Compositional Zero-Shot Learning
by: Xu, Shuo, et al.
Published: (2024)
by: Xu, Shuo, et al.
Published: (2024)
VisionGPT: Vision-Language Understanding Agent Using Generalized Multimodal Framework
by: Kelly, Chris, et al.
Published: (2024)
by: Kelly, Chris, et al.
Published: (2024)
Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices
by: Lin, Junyan, et al.
Published: (2025)
by: Lin, Junyan, et al.
Published: (2025)
Customized Visual Storytelling with Unified Multimodal LLMs
by: Li, Wei-Hua, et al.
Published: (2026)
by: Li, Wei-Hua, et al.
Published: (2026)
VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning
by: Qi, Zhangyang, et al.
Published: (2025)
by: Qi, Zhangyang, et al.
Published: (2025)
Similar Items
-
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026) -
WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs
by: Zhang, Yulin, et al.
Published: (2026) -
The devil is in the object boundary: towards annotation-free instance segmentation using Foundation Models
by: Shi, Cheng, et al.
Published: (2024) -
Plain-Det: A Plain Multi-Dataset Object Detector
by: Shi, Cheng, et al.
Published: (2024) -
Eyes Wide Open: Ego Proactive Video-LLM for Streaming Video
by: Zhang, Yulin, et al.
Published: (2025)