Enregistré dans:
| Auteurs principaux: | Ma, Yiming, Yang, Hongkun, Wang, Lionel Z., Chen, Bin, Xian, Weizhi, Teng, Jianzhi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2603.01111 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
par: Ma, Xueqi, et autres
Publié: (2026)
par: Ma, Xueqi, et autres
Publié: (2026)
Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning
par: Zhao, Yumiao, et autres
Publié: (2025)
par: Zhao, Yumiao, et autres
Publié: (2025)
HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation
par: Lei, Qinqian, et autres
Publié: (2025)
par: Lei, Qinqian, et autres
Publié: (2025)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025)
par: Zhang, Qintong, et autres
Publié: (2025)
Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation
par: Shi, Hanlei, et autres
Publié: (2025)
par: Shi, Hanlei, et autres
Publié: (2025)
Head-Aware Visual Cropping: Enhancing Fine-Grained VQA with Attention-Guided Subimage
par: Xie, Junfei, et autres
Publié: (2026)
par: Xie, Junfei, et autres
Publié: (2026)
FacialFlowNet: Advancing Facial Optical Flow Estimation with a Diverse Dataset and a Decomposed Model
par: Lu, Jianzhi, et autres
Publié: (2024)
par: Lu, Jianzhi, et autres
Publié: (2024)
HieroAction: Hierarchically Guided VLM for Fine-Grained Action Analysis
par: Wu, Junhao, et autres
Publié: (2025)
par: Wu, Junhao, et autres
Publié: (2025)
XR-VLM: Cross-Relationship Modeling with Multi-part Prompts and Visual Features for Fine-Grained Recognition
par: Wang, Chuanming, et autres
Publié: (2025)
par: Wang, Chuanming, et autres
Publié: (2025)
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
par: Galougah, Siminfar Samakoush, et autres
Publié: (2025)
par: Galougah, Siminfar Samakoush, et autres
Publié: (2025)
Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation
par: Wang, Chenhao, et autres
Publié: (2026)
par: Wang, Chenhao, et autres
Publié: (2026)
A Large-Scale Remote Sensing Dataset and VLM-based Algorithm for Fine-Grained Road Hierarchy Classification
par: Han, Ting, et autres
Publié: (2026)
par: Han, Ting, et autres
Publié: (2026)
Lightning Fast Caching-based Parallel Denoising Prediction for Accelerating Talking Head Generation
par: Long, Jianzhi, et autres
Publié: (2025)
par: Long, Jianzhi, et autres
Publié: (2025)
Domain Adaptation of Attention Heads for Zero-shot Anomaly Detection
par: Jeong, Kiyoon, et autres
Publié: (2025)
par: Jeong, Kiyoon, et autres
Publié: (2025)
Robust Multiview Multimodal Driver Monitoring System Using Masked Multi-Head Self-Attention
par: Ma, Yiming, et autres
Publié: (2023)
par: Ma, Yiming, et autres
Publié: (2023)
Synchronized and Fine-Grained Head for Skeleton-Based Ambiguous Action Recognition
par: Huang, Hao, et autres
Publié: (2024)
par: Huang, Hao, et autres
Publié: (2024)
Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter
par: Jiang, Bo, et autres
Publié: (2025)
par: Jiang, Bo, et autres
Publié: (2025)
SaRA: High-Efficient Diffusion Model Fine-tuning with Progressive Sparse Low-Rank Adaptation
par: Hu, Teng, et autres
Publié: (2024)
par: Hu, Teng, et autres
Publié: (2024)
From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception
par: Zhu, Jilong, et autres
Publié: (2026)
par: Zhu, Jilong, et autres
Publié: (2026)
Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
par: Li, Jiaye, et autres
Publié: (2025)
par: Li, Jiaye, et autres
Publié: (2025)
Toward Fine-Grained Facial Control in 3D Talking Head Generation
par: Xie, Shaoyang, et autres
Publié: (2026)
par: Xie, Shaoyang, et autres
Publié: (2026)
Toward Reliable VLM: A Fine-Grained Benchmark and Framework for Exposure, Bias, and Inference in Korean Street Views
par: Wang, Xiaonan, et autres
Publié: (2025)
par: Wang, Xiaonan, et autres
Publié: (2025)
DoRA: Weight-Decomposed Low-Rank Adaptation
par: Liu, Shih-Yang, et autres
Publié: (2024)
par: Liu, Shih-Yang, et autres
Publié: (2024)
LoLDU: Low-Rank Adaptation via Lower-Diag-Upper Decomposition for Parameter-Efficient Fine-Tuning
par: Shi, Yiming, et autres
Publié: (2024)
par: Shi, Yiming, et autres
Publié: (2024)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
par: Yu, Yongcan, et autres
Publié: (2025)
par: Yu, Yongcan, et autres
Publié: (2025)
Mask-Guided Attention Regulation for Anatomically Consistent Counterfactual CXR Synthesis
par: Zhang, Zichun, et autres
Publié: (2026)
par: Zhang, Zichun, et autres
Publié: (2026)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
par: Kuo, Chia-Wen, et autres
Publié: (2025)
par: Kuo, Chia-Wen, et autres
Publié: (2025)
Fine-Grained Open-Vocabulary Object Detection with Fined-Grained Prompts: Task, Dataset and Benchmark
par: Liu, Ying, et autres
Publié: (2025)
par: Liu, Ying, et autres
Publié: (2025)
TryOn-Adapter: Efficient Fine-Grained Clothing Identity Adaptation for High-Fidelity Virtual Try-On
par: Xing, Jiazheng, et autres
Publié: (2024)
par: Xing, Jiazheng, et autres
Publié: (2024)
DePT: Decomposed Prompt Tuning for Parameter-Efficient Fine-tuning
par: Shi, Zhengxiang, et autres
Publié: (2023)
par: Shi, Zhengxiang, et autres
Publié: (2023)
Fine-Grained Prototypes Distillation for Few-Shot Object Detection
par: Wang, Zichen, et autres
Publié: (2024)
par: Wang, Zichen, et autres
Publié: (2024)
ORION: ORthonormal Text Encoding for Universal VLM AdaptatION
par: Chakraborty, Omprakash, et autres
Publié: (2026)
par: Chakraborty, Omprakash, et autres
Publié: (2026)
DA-HFNet: Progressive Fine-Grained Forgery Image Detection and Localization Based on Dual Attention
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
Knowledge Transfer and Domain Adaptation for Fine-Grained Remote Sensing Image Segmentation
par: Zhang, Shun, et autres
Publié: (2024)
par: Zhang, Shun, et autres
Publié: (2024)
VLM-FO1: Bridging the Gap Between High-Level Reasoning and Fine-Grained Perception in VLMs
par: Liu, Peng, et autres
Publié: (2025)
par: Liu, Peng, et autres
Publié: (2025)
De-fine: Decomposing and Refining Visual Programs with Auto-Feedback
par: Gao, Minghe, et autres
Publié: (2023)
par: Gao, Minghe, et autres
Publié: (2023)
LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space
par: Feng, Guanwen, et autres
Publié: (2024)
par: Feng, Guanwen, et autres
Publié: (2024)
Domain Adaptation of VLM for Soccer Video Understanding
par: Jiang, Tiancheng, et autres
Publié: (2025)
par: Jiang, Tiancheng, et autres
Publié: (2025)
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
par: Carvalho, Miguel, et autres
Publié: (2025)
par: Carvalho, Miguel, et autres
Publié: (2025)
Modality-Collaborative Low-Rank Decomposers for Few-Shot Video Domain Adaptation
par: Wanyan, Yuyang, et autres
Publié: (2025)
par: Wanyan, Yuyang, et autres
Publié: (2025)
Documents similaires
-
Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning
par: Ma, Xueqi, et autres
Publié: (2026) -
Fine-Grained VLM Fine-tuning via Latent Hierarchical Adapter Learning
par: Zhao, Yumiao, et autres
Publié: (2025) -
HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation
par: Lei, Qinqian, et autres
Publié: (2025) -
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
par: Zhang, Qintong, et autres
Publié: (2025) -
Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation
par: Shi, Hanlei, et autres
Publié: (2025)