Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cho, Hyeonwoo, Baek, DongHyeon, Kim, Yewon, Ham, Bumsub |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FYI: Flip Your Images for Dataset Distillation
par: Son, Byunggwan, et autres
Publié: (2024)
par: Son, Byunggwan, et autres
Publié: (2024)
Efficient Few-Shot Neural Architecture Search by Counting the Number of Nonlinear Functions
par: Oh, Youngmin, et autres
Publié: (2024)
par: Oh, Youngmin, et autres
Publié: (2024)
GrowTAS: Progressive Expansion from Small to Large Subnets for Efficient ViT Architecture Search
par: Lee, Hyunju, et autres
Publié: (2025)
par: Lee, Hyunju, et autres
Publié: (2025)
AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture Search
par: Lee, Junghyup, et autres
Publié: (2024)
par: Lee, Junghyup, et autres
Publié: (2024)
Maximizing the Position Embedding for Vision Transformers with Global Average Pooling
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts
par: Jeon, Jeimin, et autres
Publié: (2026)
par: Jeon, Jeimin, et autres
Publié: (2026)
Scheduling Weight Transitions for Quantization-Aware Training
par: Lee, Junghyup, et autres
Publié: (2024)
par: Lee, Junghyup, et autres
Publié: (2024)
Toward INT4 Fixed-Point Training via Exploring Quantization Error for Gradients
par: Kim, Dohyung, et autres
Publié: (2024)
par: Kim, Dohyung, et autres
Publié: (2024)
Subnet-Aware Dynamic Supernet Training for Neural Architecture Search
par: Jeon, Jeimin, et autres
Publié: (2025)
par: Jeon, Jeimin, et autres
Publié: (2025)
Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM
par: Chi, Donghwan, et autres
Publié: (2025)
par: Chi, Donghwan, et autres
Publié: (2025)
Instance-Aware Group Quantization for Vision Transformers
par: Moon, Jaehyeon, et autres
Publié: (2024)
par: Moon, Jaehyeon, et autres
Publié: (2024)
Jailbreaking on Text-to-Video Models via Scene Splitting Strategy
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
par: Lee, Sanghoon, et autres
Publié: (2026)
par: Lee, Sanghoon, et autres
Publié: (2026)
3DPillars: Pillar-based two-stage 3D object detection
par: Noh, Jongyoun, et autres
Publié: (2025)
par: Noh, Jongyoun, et autres
Publié: (2025)
Cerberus: Attribute-based person re-identification using semantic IDs
par: Eom, Chanho, et autres
Publié: (2024)
par: Eom, Chanho, et autres
Publié: (2024)
TokenPacker: Efficient Visual Projector for Multimodal LLM
par: Li, Wentong, et autres
Publié: (2024)
par: Li, Wentong, et autres
Publié: (2024)
DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation
par: Kim, Hyeonwoo, et autres
Publié: (2026)
par: Kim, Hyeonwoo, et autres
Publié: (2026)
Disentangled Representations for Short-Term and Long-Term Person Re-Identification
par: Eom, Chanho, et autres
Publié: (2024)
par: Eom, Chanho, et autres
Publié: (2024)
Relational Feature Caching for Accelerating Diffusion Transformers
par: Son, Byunggwan, et autres
Publié: (2026)
par: Son, Byunggwan, et autres
Publié: (2026)
Joint-Embedding Predictive Architecture for Self-Supervised Learning of Mask Classification Architecture
par: Kim, Dong-Hee, et autres
Publié: (2024)
par: Kim, Dong-Hee, et autres
Publié: (2024)
CNG-SFDA:Clean-and-Noisy Region Guided Online-Offline Source-Free Domain Adaptation
par: Cho, Hyeonwoo, et autres
Publié: (2024)
par: Cho, Hyeonwoo, et autres
Publié: (2024)
TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models
par: Zhang, Haokui, et autres
Publié: (2026)
par: Zhang, Haokui, et autres
Publié: (2026)
AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
par: Lee, Seunghoon, et autres
Publié: (2025)
par: Lee, Seunghoon, et autres
Publié: (2025)
DisCoRD: Discrete Tokens to Continuous Motion via Rectified Flow Decoding
par: Cho, Jungbin, et autres
Publié: (2024)
par: Cho, Jungbin, et autres
Publié: (2024)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
par: Zhang, Ce, et autres
Publié: (2025)
par: Zhang, Ce, et autres
Publié: (2025)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
par: Zhu, Jiaying, et autres
Publié: (2025)
par: Zhu, Jiaying, et autres
Publié: (2025)
Frequency-Aware Token Reduction for Efficient Vision Transformer
par: Lee, Dong-Jae, et autres
Publié: (2025)
par: Lee, Dong-Jae, et autres
Publié: (2025)
Efficient Rectified Flow for Image Fusion
par: Wang, Zirui, et autres
Publié: (2025)
par: Wang, Zirui, et autres
Publié: (2025)
Understanding and Rectifying Safety Perception Distortion in VLMs
par: Zou, Xiaohan, et autres
Publié: (2025)
par: Zou, Xiaohan, et autres
Publié: (2025)
ELITE: Enhanced Language-Image Toxicity Evaluation for Safety
par: Lee, Wonjun, et autres
Publié: (2025)
par: Lee, Wonjun, et autres
Publié: (2025)
Robustness-Reinforced Knowledge Distillation with Correlation Distance and Network Pruning
par: Kim, Seonghak, et autres
Publié: (2023)
par: Kim, Seonghak, et autres
Publié: (2023)
MVFormer: Diversifying Feature Normalization and Token Mixing for Efficient Vision Transformers
par: Bae, Jongseong, et autres
Publié: (2024)
par: Bae, Jongseong, et autres
Publié: (2024)
SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
par: Gong, Chao, et autres
Publié: (2025)
par: Gong, Chao, et autres
Publié: (2025)
v1: Learning to Point Visual Tokens for Multimodal Grounded Reasoning
par: Chung, Jiwan, et autres
Publié: (2025)
par: Chung, Jiwan, et autres
Publié: (2025)
Embedding-Free Transformer with Inference Spatial Reduction for Efficient Semantic Segmentation
par: Yu, Hyunwoo, et autres
Publié: (2024)
par: Yu, Hyunwoo, et autres
Publié: (2024)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
par: Li, Junxian, et autres
Publié: (2026)
par: Li, Junxian, et autres
Publié: (2026)
GlocalCLIP: Object-agnostic Global-Local Prompt Learning for Zero-shot Anomaly Detection
par: Ham, Jiyul, et autres
Publié: (2024)
par: Ham, Jiyul, et autres
Publié: (2024)
Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection
par: Han, Yewon, et autres
Publié: (2026)
par: Han, Yewon, et autres
Publié: (2026)
Learning 3D Object Spatial Relationships from Pre-trained 2D Diffusion Models
par: Baik, Sangwon, et autres
Publié: (2025)
par: Baik, Sangwon, et autres
Publié: (2025)
Documents similaires
-
FYI: Flip Your Images for Dataset Distillation
par: Son, Byunggwan, et autres
Publié: (2024) -
Efficient Few-Shot Neural Architecture Search by Counting the Number of Nonlinear Functions
par: Oh, Youngmin, et autres
Publié: (2024) -
GrowTAS: Progressive Expansion from Small to Large Subnets for Efficient ViT Architecture Search
par: Lee, Hyunju, et autres
Publié: (2025) -
AZ-NAS: Assembling Zero-Cost Proxies for Network Architecture Search
par: Lee, Junghyup, et autres
Publié: (2024) -
Maximizing the Position Embedding for Vision Transformers with Global Average Pooling
par: Lee, Wonjun, et autres
Publié: (2025)