Representation Shift: Unifying Token Compression with FlashAttention
Fuente:
arXiv
Guardado en:
| Autores principales: | Choi, Joonmyung, Lee, Sanghyeok, Ko, Byungoh, Kim, Eunseo, Kil, Jihyung, Kim, Hyunwoo J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
por: Choi, Joonmyung, et al.
Publicado: (2026)
por: Choi, Joonmyung, et al.
Publicado: (2026)
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
por: Lee, Sanghyeok, et al.
Publicado: (2024)
por: Lee, Sanghyeok, et al.
Publicado: (2024)
EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality
por: Lee, Sanghyeok, et al.
Publicado: (2024)
por: Lee, Sanghyeok, et al.
Publicado: (2024)
vid-TLDR: Training Free Token merging for Light-weight Video Transformer
por: Choi, Joonmyung, et al.
Publicado: (2024)
por: Choi, Joonmyung, et al.
Publicado: (2024)
TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing
por: Kim, Jongha, et al.
Publicado: (2025)
por: Kim, Jongha, et al.
Publicado: (2025)
Relevance-aware Multi-context Contrastive Decoding for Retrieval-augmented Visual Question Answering
por: Kim, Jongha, et al.
Publicado: (2026)
por: Kim, Jongha, et al.
Publicado: (2026)
Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization
por: Lee, Ji Soo, et al.
Publicado: (2025)
por: Lee, Ji Soo, et al.
Publicado: (2025)
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
por: Ko, Dohwan, et al.
Publicado: (2026)
por: Ko, Dohwan, et al.
Publicado: (2026)
II-MMR: Identifying and Improving Multi-modal Multi-hop Reasoning in Visual Question Answering
por: Kil, Jihyung, et al.
Publicado: (2024)
por: Kil, Jihyung, et al.
Publicado: (2024)
Robust Multimodal 3D Object Detection via Modality-Agnostic Decoding and Proximity-based Modality Ensemble
por: Cha, Juhan, et al.
Publicado: (2024)
por: Cha, Juhan, et al.
Publicado: (2024)
Transferable Model-agnostic Vision-Language Model Adaptation for Efficient Weak-to-Strong Generalization
por: Park, Jihwan, et al.
Publicado: (2025)
por: Park, Jihwan, et al.
Publicado: (2025)
Probabilistic Vision-Language Representation for Weakly Supervised Temporal Action Localization
por: Lim, Geuntaek, et al.
Publicado: (2024)
por: Lim, Geuntaek, et al.
Publicado: (2024)
Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
por: Ko, Dohwan, et al.
Publicado: (2025)
por: Ko, Dohwan, et al.
Publicado: (2025)
Prompt Learning via Meta-Regularization
por: Park, Jinyoung, et al.
Publicado: (2024)
por: Park, Jinyoung, et al.
Publicado: (2024)
Efficient multi-view training for 3D Gaussian Splatting
por: Choi, Minhyuk, et al.
Publicado: (2025)
por: Choi, Minhyuk, et al.
Publicado: (2025)
OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models
por: Kang, Minseok, et al.
Publicado: (2026)
por: Kang, Minseok, et al.
Publicado: (2026)
Stochastic Conditional Diffusion Models for Robust Semantic Image Synthesis
por: Ko, Juyeon, et al.
Publicado: (2024)
por: Ko, Juyeon, et al.
Publicado: (2024)
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding
por: Kim, Jiwan, et al.
Publicado: (2026)
por: Kim, Jiwan, et al.
Publicado: (2026)
Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation
por: Ko, Jungmin, et al.
Publicado: (2026)
por: Ko, Jungmin, et al.
Publicado: (2026)
Retinal Layer Segmentation in OCT Images With 2.5D Cross-slice Feature Fusion Module for Glaucoma Assessment
por: Kim, Hyunwoo, et al.
Publicado: (2026)
por: Kim, Hyunwoo, et al.
Publicado: (2026)
FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention
por: Wang, Zipeng, et al.
Publicado: (2025)
por: Wang, Zipeng, et al.
Publicado: (2025)
Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers
por: Nam, Sanghyeok, et al.
Publicado: (2026)
por: Nam, Sanghyeok, et al.
Publicado: (2026)
When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models
por: Choi, Jiho, et al.
Publicado: (2026)
por: Choi, Jiho, et al.
Publicado: (2026)
When Model Knowledge meets Diffusion Model: Diffusion-assisted Data-free Image Synthesis with Alignment of Domain and Class
por: Kim, Yujin, et al.
Publicado: (2025)
por: Kim, Yujin, et al.
Publicado: (2025)
GaussianVideo: Efficient Video Representation and Compression by Gaussian Splatting
por: Lee, Inseo, et al.
Publicado: (2025)
por: Lee, Inseo, et al.
Publicado: (2025)
CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation
por: Ko, Jinwon, et al.
Publicado: (2026)
por: Ko, Jinwon, et al.
Publicado: (2026)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
por: Wang, Ziyao, et al.
Publicado: (2026)
por: Wang, Ziyao, et al.
Publicado: (2026)
ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation
por: Lee, Kwanyoung, et al.
Publicado: (2026)
por: Lee, Kwanyoung, et al.
Publicado: (2026)
Retrieval-Augmented Open-Vocabulary Object Detection
por: Kim, Jooyeon, et al.
Publicado: (2024)
por: Kim, Jooyeon, et al.
Publicado: (2024)
Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning
por: Ko, Jaekyun, et al.
Publicado: (2026)
por: Ko, Jaekyun, et al.
Publicado: (2026)
ReCo: Reminder Composition Mitigates Hallucinations in Vision-Language Models
por: Chytas, Sotirios Panagiotis, et al.
Publicado: (2025)
por: Chytas, Sotirios Panagiotis, et al.
Publicado: (2025)
Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition
por: Choi, Jae Young, et al.
Publicado: (2026)
por: Choi, Jae Young, et al.
Publicado: (2026)
Learning Equi-angular Representations for Online Continual Learning
por: Seo, Minhyuk, et al.
Publicado: (2024)
por: Seo, Minhyuk, et al.
Publicado: (2024)
MAIR++: Improving Multi-view Attention Inverse Rendering with Implicit Lighting Representation
por: Choi, JunYong, et al.
Publicado: (2024)
por: Choi, JunYong, et al.
Publicado: (2024)
Blockwise Flow Matching: Improving Flow Matching Models For Efficient High-Quality Generation
por: Park, Dogyun, et al.
Publicado: (2025)
por: Park, Dogyun, et al.
Publicado: (2025)
Diffusion Prior-Based Amortized Variational Inference for Noisy Inverse Problems
por: Lee, Sojin, et al.
Publicado: (2024)
por: Lee, Sojin, et al.
Publicado: (2024)
Text-Conditioned Background Generation for Editable Multi-Layer Documents
por: Kang, Taewon, et al.
Publicado: (2025)
por: Kang, Taewon, et al.
Publicado: (2025)
GPT-4V(ision) is a Generalist Web Agent, if Grounded
por: Zheng, Boyuan, et al.
Publicado: (2024)
por: Zheng, Boyuan, et al.
Publicado: (2024)
VidChain: Chain-of-Tasks with Metric-based Direct Preference Optimization for Dense Video Captioning
por: Lee, Ji Soo, et al.
Publicado: (2025)
por: Lee, Ji Soo, et al.
Publicado: (2025)
ODPG: Outfitting Diffusion with Pose Guided Condition
por: Lee, Seohyun, et al.
Publicado: (2025)
por: Lee, Seohyun, et al.
Publicado: (2025)
Ejemplares similares
-
DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
por: Choi, Joonmyung, et al.
Publicado: (2026) -
Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
por: Lee, Sanghyeok, et al.
Publicado: (2024) -
EfficientViM: Efficient Vision Mamba with Hidden State Mixer based State Space Duality
por: Lee, Sanghyeok, et al.
Publicado: (2024) -
vid-TLDR: Training Free Token merging for Light-weight Video Transformer
por: Choi, Joonmyung, et al.
Publicado: (2024) -
TabFlash: Efficient Table Understanding with Progressive Question Conditioning and Token Focusing
por: Kim, Jongha, et al.
Publicado: (2025)