GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Guanghao, Shi, Bowen, Xu, Mingxing, Sun, Ruoyu, Zhao, Peisen, Zhang, Zhibo, Dai, Wenrui, Zou, Junni, Xiong, Hongkai, Zhang, Xiaopeng, Tian, Qi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
di: Zhao, Peisen, et al.
Pubblicazione: (2026)
di: Zhao, Peisen, et al.
Pubblicazione: (2026)
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
di: Shi, Bowen, et al.
Pubblicazione: (2024)
di: Shi, Bowen, et al.
Pubblicazione: (2024)
Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
di: Huang, Yuyang, et al.
Pubblicazione: (2025)
di: Huang, Yuyang, et al.
Pubblicazione: (2025)
MimicNorm: Weight Mean and Last BN Layer Mimic the Dynamic of Batch Normalization
di: Fei, Wen, et al.
Pubblicazione: (2020)
di: Fei, Wen, et al.
Pubblicazione: (2020)
Point Cloud Denoising With Fine-Granularity Dynamic Graph Convolutional Networks
di: Xu, Wenqiang, et al.
Pubblicazione: (2024)
di: Xu, Wenqiang, et al.
Pubblicazione: (2024)
METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
di: Liu, Yuchen, et al.
Pubblicazione: (2025)
Frequency-Aware Transformer for Learned Image Compression
di: Li, Han, et al.
Pubblicazione: (2023)
di: Li, Han, et al.
Pubblicazione: (2023)
Image Compression for Machine and Human Vision with Spatial-Frequency Adaptation
di: Li, Han, et al.
Pubblicazione: (2024)
di: Li, Han, et al.
Pubblicazione: (2024)
Point Cloud Resampling with Learnable Heat Diffusion
di: Xu, Wenqiang, et al.
Pubblicazione: (2024)
di: Xu, Wenqiang, et al.
Pubblicazione: (2024)
HiPART: Hierarchical Pose AutoRegressive Transformer for Occluded 3D Human Pose Estimation
di: Zheng, Hongwei, et al.
Pubblicazione: (2025)
di: Zheng, Hongwei, et al.
Pubblicazione: (2025)
Improving Diffusion Models for Inverse Problems Using Optimal Posterior Covariance
di: Peng, Xinyu, et al.
Pubblicazione: (2024)
di: Peng, Xinyu, et al.
Pubblicazione: (2024)
FineEdit: Fine-Grained Image Edit with Bounding Box Guidance
di: Xu, Haohang, et al.
Pubblicazione: (2026)
di: Xu, Haohang, et al.
Pubblicazione: (2026)
Information-Theoretic Optimization for Task-Adapted Compressed Sensing Magnetic Resonance Imaging
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
3DGabSplat: 3D Gabor Splatting for Frequency-adaptive Radiance Field Rendering
di: Zhou, Junyu, et al.
Pubblicazione: (2025)
di: Zhou, Junyu, et al.
Pubblicazione: (2025)
On Disentangled Training for Nonlinear Transform in Learned Image Compression
di: Li, Han, et al.
Pubblicazione: (2025)
di: Li, Han, et al.
Pubblicazione: (2025)
Error-Propagation-Free Learned Video Compression With Dual-Domain Progressive Temporal Alignment
di: Li, Han, et al.
Pubblicazione: (2025)
di: Li, Han, et al.
Pubblicazione: (2025)
Noise Conditional Variational Score Distillation
di: Peng, Xinyu, et al.
Pubblicazione: (2025)
di: Peng, Xinyu, et al.
Pubblicazione: (2025)
LiftImage3D: Lifting Any Single Image to 3D Gaussians with Video Generation Priors
di: Chen, Yabo, et al.
Pubblicazione: (2024)
di: Chen, Yabo, et al.
Pubblicazione: (2024)
Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
di: Peng, Xinyu, et al.
Pubblicazione: (2026)
Cascade-Zero123: One Image to Highly Consistent 3D with Self-Prompted Nearby Views
di: Chen, Yabo, et al.
Pubblicazione: (2023)
di: Chen, Yabo, et al.
Pubblicazione: (2023)
HueManity: Probing Fine-Grained Visual Perception in MLLMs
di: Grover, Rynaa, et al.
Pubblicazione: (2025)
di: Grover, Rynaa, et al.
Pubblicazione: (2025)
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation
di: Chen, Ruoyu, et al.
Pubblicazione: (2025)
di: Chen, Ruoyu, et al.
Pubblicazione: (2025)
SpikeMba: Multi-Modal Spiking Saliency Mamba for Temporal Video Grounding
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
S2R-ViT for Multi-Agent Cooperative Perception: Bridging the Gap from Simulation to Reality
di: Li, Jinlong, et al.
Pubblicazione: (2023)
di: Li, Jinlong, et al.
Pubblicazione: (2023)
DFQ-ViT: Data-Free Quantization for Vision Transformers without Fine-tuning
di: Tong, Yujia, et al.
Pubblicazione: (2025)
di: Tong, Yujia, et al.
Pubblicazione: (2025)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
di: Yan, Siming, et al.
Pubblicazione: (2024)
di: Yan, Siming, et al.
Pubblicazione: (2024)
EV-NVC: Efficient Variable bitrate Neural Video Compression
di: Hu, Yongcun, et al.
Pubblicazione: (2025)
di: Hu, Yongcun, et al.
Pubblicazione: (2025)
CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing
di: Li, Yan, et al.
Pubblicazione: (2025)
di: Li, Yan, et al.
Pubblicazione: (2025)
A Low-Rank Method for Vision Language Model Hallucination Mitigation in Autonomous Driving
di: Long, Keke, et al.
Pubblicazione: (2025)
di: Long, Keke, et al.
Pubblicazione: (2025)
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
di: Tong, Jintao, et al.
Pubblicazione: (2026)
di: Tong, Jintao, et al.
Pubblicazione: (2026)
Unlocking Vision-Language Models for Video Anomaly Detection via Fine-Grained Prompting
di: Zou, Shu, et al.
Pubblicazione: (2025)
di: Zou, Shu, et al.
Pubblicazione: (2025)
OmniSparse: Training-Aware Fine-Grained Sparse Attention for Long-Video MLLMs
di: Chen, Feng, et al.
Pubblicazione: (2025)
di: Chen, Feng, et al.
Pubblicazione: (2025)
TAP-ViTs: Task-Adaptive Pruning for On-Device Deployment of Vision Transformers
di: Wang, Zhibo, et al.
Pubblicazione: (2026)
di: Wang, Zhibo, et al.
Pubblicazione: (2026)
CodePercept: Code-Grounded Visual STEM Perception for MLLMs
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
di: Guan, Tongkun, et al.
Pubblicazione: (2026)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
Fine-Grained Evaluation of Large Vision-Language Models in Autonomous Driving
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Students Seeking Information for Their Masters' Theses: The Effect of the Internet
di: Junni, Paulina
Pubblicazione: (2007)
di: Junni, Paulina
Pubblicazione: (2007)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
di: Qiu, Yansheng, et al.
Pubblicazione: (2025)
Spiking Tucker Fusion Transformer for Audio-Visual Zero-Shot Learning
di: Li, Wenrui, et al.
Pubblicazione: (2024)
di: Li, Wenrui, et al.
Pubblicazione: (2024)
Protocol to decipher complex spatial transcriptomics data using STMiner
di: Sun, Peisen
Pubblicazione: (2025)
di: Sun, Peisen
Pubblicazione: (2025)
Documenti analoghi
-
FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions
di: Zhao, Peisen, et al.
Pubblicazione: (2026) -
UMG-CLIP: A Unified Multi-Granularity Vision Generalist for Open-World Understanding
di: Shi, Bowen, et al.
Pubblicazione: (2024) -
Diffusion-Driven Progressive Target Manipulation for Source-Free Domain Adaptation
di: Huang, Yuyang, et al.
Pubblicazione: (2025) -
MimicNorm: Weight Mean and Last BN Layer Mimic the Dynamic of Batch Normalization
di: Fei, Wen, et al.
Pubblicazione: (2020) -
Point Cloud Denoising With Fine-Granularity Dynamic Graph Convolutional Networks
di: Xu, Wenqiang, et al.
Pubblicazione: (2024)