Guardado en:
| Autores principales: | Ma, Yiming, Yang, Hongkun, Wang, Lionel Z., Chen, Bin, Xian, Weizhi, Teng, Jianzhi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2603.01111 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
por: Ma, Xueqi, et al.
Publicado: (2026)
por: Ma, Xueqi, et al.
Publicado: (2026)
Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning
por: Zhao, Yumiao, et al.
Publicado: (2025)
por: Zhao, Yumiao, et al.
Publicado: (2025)
HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation
por: Lei, Qinqian, et al.
Publicado: (2025)
por: Lei, Qinqian, et al.
Publicado: (2025)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
por: Zhang, Qintong, et al.
Publicado: (2025)
por: Zhang, Qintong, et al.
Publicado: (2025)
Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation
por: Shi, Hanlei, et al.
Publicado: (2025)
por: Shi, Hanlei, et al.
Publicado: (2025)
Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage
por: Xie, Junfei, et al.
Publicado: (2026)
por: Xie, Junfei, et al.
Publicado: (2026)
FacialFlowNet: Advancing Facial Optical Flow Estimation with a Diverse Dataset and a Decomposed Model
por: Lu, Jianzhi, et al.
Publicado: (2024)
por: Lu, Jianzhi, et al.
Publicado: (2024)
HieroAction: Hierarchically Guided VLM for Fine-Grained Action Analysis
por: Wu, Junhao, et al.
Publicado: (2025)
por: Wu, Junhao, et al.
Publicado: (2025)
XR-VLM: Cross-Relationship Modeling with Multi-part Prompts and Visual Features for Fine-Grained Recognition
por: Wang, Chuanming, et al.
Publicado: (2025)
por: Wang, Chuanming, et al.
Publicado: (2025)
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2025)
por: Galougah, Siminfar Samakoush, et al.
Publicado: (2025)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
por: Wang, Chenhao, et al.
Publicado: (2026)
por: Wang, Chenhao, et al.
Publicado: (2026)
A Large-Scale Remote Sensing Dataset and VLM-based Algorithm for Fine-Grained Road Hierarchy Classification
por: Han, Ting, et al.
Publicado: (2026)
por: Han, Ting, et al.
Publicado: (2026)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
por: Long, Jianzhi, et al.
Publicado: (2025)
por: Long, Jianzhi, et al.
Publicado: (2025)
Domain Adaptation of Attention Heads for Zero-shot Anomaly Detection
por: Jeong, Kiyoon, et al.
Publicado: (2025)
por: Jeong, Kiyoon, et al.
Publicado: (2025)
Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention
por: Ma, Yiming, et al.
Publicado: (2023)
por: Ma, Yiming, et al.
Publicado: (2023)
Synchronized and Fine-Grained Head for Skeleton-Based Ambiguous Action Recognition
por: Huang, Hao, et al.
Publicado: (2024)
por: Huang, Hao, et al.
Publicado: (2024)
Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter
por: Jiang, Bo, et al.
Publicado: (2025)
por: Jiang, Bo, et al.
Publicado: (2025)
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
por: Hu, Teng, et al.
Publicado: (2024)
por: Hu, Teng, et al.
Publicado: (2024)
From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception
por: Zhu, Jilong, et al.
Publicado: (2026)
por: Zhu, Jilong, et al.
Publicado: (2026)
Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
por: Li, Jiaye, et al.
Publicado: (2025)
por: Li, Jiaye, et al.
Publicado: (2025)
Toward Fine-Grained Facial Control in 3D Talking Head Generation
por: Xie, Shaoyang, et al.
Publicado: (2026)
por: Xie, Shaoyang, et al.
Publicado: (2026)
Toward Reliable VLM: A Fine-Grained Benchmark and Framework for Exposure, Bias, and Inference in Korean Street Views
por: Wang, Xiaonan, et al.
Publicado: (2025)
por: Wang, Xiaonan, et al.
Publicado: (2025)
DoRA: Weight-Decomposed Low-Rank Adaptation
por: Liu, Shih-Yang, et al.
Publicado: (2024)
por: Liu, Shih-Yang, et al.
Publicado: (2024)
LoLDU: Low-Rank Adaptation via Lower-Diag-Upper Decomposition for Parameter-Efficient Fine-Tuning
por: Shi, Yiming, et al.
Publicado: (2024)
por: Shi, Yiming, et al.
Publicado: (2024)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
por: Yu, Yongcan, et al.
Publicado: (2025)
por: Yu, Yongcan, et al.
Publicado: (2025)
Mask-Guided Attention Regulation for Anatomically Consistent Counterfactual CXR Synthesis
por: Zhang, Zichun, et al.
Publicado: (2026)
por: Zhang, Zichun, et al.
Publicado: (2026)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
por: Kuo, Chia-Wen, et al.
Publicado: (2025)
por: Kuo, Chia-Wen, et al.
Publicado: (2025)
Fine-Grained Open-Vocabulary Object Detection with Fined-Grained Prompts: Task, Dataset and Benchmark
por: Liu, Ying, et al.
Publicado: (2025)
por: Liu, Ying, et al.
Publicado: (2025)
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
por: Xing, Jiazheng, et al.
Publicado: (2024)
por: Xing, Jiazheng, et al.
Publicado: (2024)
DePT: Decomposed Prompt Tuning for Parameter-Efficient Fine-tuning
por: Shi, Zhengxiang, et al.
Publicado: (2023)
por: Shi, Zhengxiang, et al.
Publicado: (2023)
Fine-Grained Prototypes Distillation for Few-Shot Object Detection
por: Wang, Zichen, et al.
Publicado: (2024)
por: Wang, Zichen, et al.
Publicado: (2024)
ORION: ORthonormal Text Encoding for Universal VLM AdaptatION
por: Chakraborty, Omprakash, et al.
Publicado: (2026)
por: Chakraborty, Omprakash, et al.
Publicado: (2026)
DA-HFNet: Progressive Fine-Grained Forgery Image Detection and Localization Based on Dual Attention
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Knowledge Transfer and Domain Adaptation for Fine-Grained Remote Sensing Image Segmentation
por: Zhang, Shun, et al.
Publicado: (2024)
por: Zhang, Shun, et al.
Publicado: (2024)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
por: Liu, Peng, et al.
Publicado: (2025)
por: Liu, Peng, et al.
Publicado: (2025)
De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
por: Gao, Minghe, et al.
Publicado: (2023)
por: Gao, Minghe, et al.
Publicado: (2023)
LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space
por: Feng, Guanwen, et al.
Publicado: (2024)
por: Feng, Guanwen, et al.
Publicado: (2024)
Domain Adaptation of VLM for Soccer Video Understanding
por: Jiang, Tiancheng, et al.
Publicado: (2025)
por: Jiang, Tiancheng, et al.
Publicado: (2025)
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
por: Carvalho, Miguel, et al.
Publicado: (2025)
por: Carvalho, Miguel, et al.
Publicado: (2025)
Modality-Collaborative Low-Rank Decomposers for Few-Shot Video Domain Adaptation
por: Wanyan, Yuyang, et al.
Publicado: (2025)
por: Wanyan, Yuyang, et al.
Publicado: (2025)
Ejemplares similares
-
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
por: Ma, Xueqi, et al.
Publicado: (2026) -
Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning
por: Zhao, Yumiao, et al.
Publicado: (2025) -
HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation
por: Lei, Qinqian, et al.
Publicado: (2025) -
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
por: Zhang, Qintong, et al.
Publicado: (2025) -
Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation
por: Shi, Hanlei, et al.
Publicado: (2025)