Saved in:
| Main Authors: | Wang, Yifan, Liu, Yifei, Shi, Yingdong, Li, Changming, Pang, Anqi, Yang, Sibei, Yu, Jingyi, Ren, Kan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2503.09046 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Dissecting and Mitigating Diffusion Bias via Mechanistic Interpretability
by: Shi, Yingdong, et al.
Published: (2025)
by: Shi, Yingdong, et al.
Published: (2025)
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
by: Yu, Chunlin, et al.
Published: (2024)
by: Yu, Chunlin, et al.
Published: (2024)
Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
by: Qian, Jiaye, et al.
Published: (2025)
by: Qian, Jiaye, et al.
Published: (2025)
A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
by: Chen, Chaoqi, et al.
Published: (2022)
by: Chen, Chaoqi, et al.
Published: (2022)
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026)
by: Shi, Cheng, et al.
Published: (2026)
SAC-ViT: Semantic-Aware Clustering Vision Transformer with Early Exit
by: Hu, Youbing, et al.
Published: (2025)
by: Hu, Youbing, et al.
Published: (2025)
LF-ViT: Reducing Spatial Redundancy in Vision Transformer for Efficient Image Recognition
by: Hu, Youbing, et al.
Published: (2024)
by: Hu, Youbing, et al.
Published: (2024)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
by: Shi, Xinrui, et al.
Published: (2026)
by: Shi, Xinrui, et al.
Published: (2026)
Efficient Partitioning Vision Transformer on Edge Devices for Distributed Inference
by: Liu, Xiang, et al.
Published: (2024)
by: Liu, Xiang, et al.
Published: (2024)
Discovering Failure Modes in Vision-Language Models using RL
by: Jain, Kanishk, et al.
Published: (2026)
by: Jain, Kanishk, et al.
Published: (2026)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
by: Li, Shaotian, et al.
Published: (2026)
by: Li, Shaotian, et al.
Published: (2026)
RealDex: Towards Human-like Grasping for Robotic Dexterous Hand
by: Liu, Yumeng, et al.
Published: (2024)
by: Liu, Yumeng, et al.
Published: (2024)
Boosting 3D Neuron Segmentation with 2D Vision Transformer Pre-trained on Natural Images
by: Cheng, Yik San, et al.
Published: (2024)
by: Cheng, Yik San, et al.
Published: (2024)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
by: Wu, Rining, et al.
Published: (2024)
by: Wu, Rining, et al.
Published: (2024)
Vision Bridge Transformer at Scale
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models
by: Dang, Yunkai, et al.
Published: (2026)
by: Dang, Yunkai, et al.
Published: (2026)
Why LVLMs Are More Prone to Hallucinations in Longer Responses: The Role of Context
by: Zheng, Ge, et al.
Published: (2025)
by: Zheng, Ge, et al.
Published: (2025)
TokenUnify: Scaling Up Autoregressive Pretraining for Neuron Segmentation
by: Chen, Yinda, et al.
Published: (2024)
by: Chen, Yinda, et al.
Published: (2024)
Spiking Vision Transformer with Saccadic Attention
by: Wang, Shuai, et al.
Published: (2025)
by: Wang, Shuai, et al.
Published: (2025)
AUFormer: Vision Transformers are Parameter-Efficient Facial Action Unit Detectors
by: Yuan, Kaishen, et al.
Published: (2024)
by: Yuan, Kaishen, et al.
Published: (2024)
Vision Function Layer in Multimodal LLMs
by: Shi, Cheng, et al.
Published: (2025)
by: Shi, Cheng, et al.
Published: (2025)
TransNeXt: Robust Foveal Visual Perception for Vision Transformers
by: Shi, Dai
Published: (2023)
by: Shi, Dai
Published: (2023)
Region-Adaptive Sampling for Diffusion Transformers
by: Liu, Ziming, et al.
Published: (2025)
by: Liu, Ziming, et al.
Published: (2025)
Chart Deep Research in LVLMs via Parallel Relative Policy Optimization
by: Tang, Jiajin, et al.
Published: (2026)
by: Tang, Jiajin, et al.
Published: (2026)
BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoning
by: Ke, Jingyang, et al.
Published: (2026)
by: Ke, Jingyang, et al.
Published: (2026)
Socratic Questioning: Learn to Self-guide Multimodal Reasoning in the Wild
by: Hu, Wanpeng, et al.
Published: (2025)
by: Hu, Wanpeng, et al.
Published: (2025)
Efficient Adaptation of Pre-trained Vision Transformer via Householder Transformation
by: Dong, Wei, et al.
Published: (2024)
by: Dong, Wei, et al.
Published: (2024)
RaVL: Discovering and Mitigating Spurious Correlations in Fine-Tuned Vision-Language Models
by: Varma, Maya, et al.
Published: (2024)
by: Varma, Maya, et al.
Published: (2024)
An archaeological Catalog Collection Method Based on Large Vision-Language Models
by: Pang, Honglin, et al.
Published: (2024)
by: Pang, Honglin, et al.
Published: (2024)
Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models
by: Yang, Yifan, et al.
Published: (2026)
by: Yang, Yifan, et al.
Published: (2026)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
by: Wu, Xiangyang, et al.
Published: (2025)
by: Wu, Xiangyang, et al.
Published: (2025)
Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models
by: Wang, Jiayu, et al.
Published: (2024)
by: Wang, Jiayu, et al.
Published: (2024)
Representation Separation for Semantic Segmentation with Vision Transformers
by: Hong, Yuanduo, et al.
Published: (2022)
by: Hong, Yuanduo, et al.
Published: (2022)
Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
by: Pu, Yifan, et al.
Published: (2025)
by: Pu, Yifan, et al.
Published: (2025)
Detecting Contextual Anomalies by Discovering Consistent Spatial Regions
by: Yang, Zhengye, et al.
Published: (2025)
by: Yang, Zhengye, et al.
Published: (2025)
Mon3tr: Monocular 3D Telepresence with Pre-built Gaussian Avatars as Amortization
by: Lin, Fangyu, et al.
Published: (2026)
by: Lin, Fangyu, et al.
Published: (2026)
LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
by: Wang, Jingyi, et al.
Published: (2024)
by: Wang, Jingyi, et al.
Published: (2024)
A 2D Semantic-Aware Position Encoding for Vision Transformers
by: Chen, Xi, et al.
Published: (2025)
by: Chen, Xi, et al.
Published: (2025)
V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization
by: Xie, Yuxi, et al.
Published: (2024)
by: Xie, Yuxi, et al.
Published: (2024)
Frequency-Aware Token Reduction for Efficient Vision Transformer
by: Lee, Dong-Jae, et al.
Published: (2025)
by: Lee, Dong-Jae, et al.
Published: (2025)
Similar Items
-
Dissecting and Mitigating Diffusion Bias via Mechanistic Interpretability
by: Shi, Yingdong, et al.
Published: (2025) -
SeqAfford: Sequential 3D Affordance Reasoning via Multimodal Large Language Model
by: Yu, Chunlin, et al.
Published: (2024) -
Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
by: Qian, Jiaye, et al.
Published: (2025) -
A Survey on Graph Neural Networks and Graph Transformers in Computer Vision: A Task-Oriented Perspective
by: Chen, Chaoqi, et al.
Published: (2022) -
Vision Transformers Need More Than Registers
by: Shi, Cheng, et al.
Published: (2026)