LayerCache: Exploiting Layer-wise Velocity Heterogeneity for Efficient Flow Matching Inference
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Li, Guandong |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference
par: Gao, Huanlin, et autres
Publié: (2026)
par: Gao, Huanlin, et autres
Publié: (2026)
LP-DETR: Layer-wise Progressive Relations for Object Detection
par: Kang, Zhengjian, et autres
Publié: (2025)
par: Kang, Zhengjian, et autres
Publié: (2025)
Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
DeepIcon: A Hierarchical Network for Layer-wise Icon Vectorization
par: Bing, Qi, et autres
Publié: (2024)
par: Bing, Qi, et autres
Publié: (2024)
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026)
par: Qian, Chen, et autres
Publié: (2026)
Layer-wise Model Merging for Unsupervised Domain Adaptation in Segmentation Tasks
par: Alcover-Couso, Roberto, et autres
Publié: (2024)
par: Alcover-Couso, Roberto, et autres
Publié: (2024)
Layer-Wise Feature Metric of Semantic-Pixel Matching for Few-Shot Learning
par: Tang, Hao, et autres
Publié: (2024)
par: Tang, Hao, et autres
Publié: (2024)
Enhancing Out-of-Distribution Detection with Multitesting-based Layer-wise Feature Fusion
par: Li, Jiawei, et autres
Publié: (2024)
par: Li, Jiawei, et autres
Publié: (2024)
Intelligent Parsing: An Automated Parsing Framework for Extracting Design Semantics from E-commerce Creatives
par: Li, Guandong, et autres
Publié: (2023)
par: Li, Guandong, et autres
Publié: (2023)
Cross-Self KV Cache Pruning for Efficient Vision-Language Inference
par: Pei, Xiaohuan, et autres
Publié: (2024)
par: Pei, Xiaohuan, et autres
Publié: (2024)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
AirCache: Activating Inter-modal Relevancy KV Cache Compression for Efficient Large Vision-Language Model Inference
par: Huang, Kai, et autres
Publié: (2025)
par: Huang, Kai, et autres
Publié: (2025)
DIAMOND: Directed Inference for Artifact Mitigation in Flow Matching Models
par: Polowczyk, Alicja, et autres
Publié: (2026)
par: Polowczyk, Alicja, et autres
Publié: (2026)
VISA: Group-wise Visual Token Selection and Aggregation via Graph Summarization for Efficient MLLMs Inference
par: Jiang, Pengfei, et autres
Publié: (2025)
par: Jiang, Pengfei, et autres
Publié: (2025)
LARV: Data-Free Layer-wise Adaptive Rescaling Veneer for Model Merging
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Rethinking Token-wise Feature Caching: Accelerating Diffusion Transformers with Dual Feature Caching
par: Zou, Chang, et autres
Publié: (2024)
par: Zou, Chang, et autres
Publié: (2024)
Terminal Velocity Matching
par: Zhou, Linqi, et autres
Publié: (2025)
par: Zhou, Linqi, et autres
Publié: (2025)
Accelerating Diffusion Transformers with Token-wise Feature Caching
par: Zou, Chang, et autres
Publié: (2024)
par: Zou, Chang, et autres
Publié: (2024)
Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models
par: Li, Changlin, et autres
Publié: (2025)
par: Li, Changlin, et autres
Publié: (2025)
Adaptive Layer Selection for Efficient Vision Transformer Fine-Tuning
par: Devoto, Alessio, et autres
Publié: (2024)
par: Devoto, Alessio, et autres
Publié: (2024)
Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization
par: Zhu, Xuanyu, et autres
Publié: (2026)
par: Zhu, Xuanyu, et autres
Publié: (2026)
DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding
par: Choraria, Moulik, et autres
Publié: (2025)
par: Choraria, Moulik, et autres
Publié: (2025)
Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
PLPHP: Per-Layer Per-Head Vision Token Pruning for Efficient Large Vision-Language Models
par: Meng, Yu, et autres
Publié: (2025)
par: Meng, Yu, et autres
Publié: (2025)
InjectFlow: Weak Guides Strong via Orthogonal Injection for Flow Matching
par: Wang, Dayu, et autres
Publié: (2026)
par: Wang, Dayu, et autres
Publié: (2026)
Exploiting Style Latent Flows for Generalizing Deepfake Video Detection
par: Choi, Jongwook, et autres
Publié: (2024)
par: Choi, Jongwook, et autres
Publié: (2024)
Towards Deconfounded Image-Text Matching with Causal Inference
par: Li, Wenhui, et autres
Publié: (2024)
par: Li, Wenhui, et autres
Publié: (2024)
Rethinking Cross-Layer Information Routing in Diffusion Transformers
par: Xu, Chao, et autres
Publié: (2026)
par: Xu, Chao, et autres
Publié: (2026)
CAFlow: Adaptive-Depth Single-Step Flow Matching for Efficient Histopathology Super-Resolution
par: Yoshai, Elad, et autres
Publié: (2026)
par: Yoshai, Elad, et autres
Publié: (2026)
Flow-GRPO: Training Flow Matching Models via Online RL
par: Liu, Jie, et autres
Publié: (2025)
par: Liu, Jie, et autres
Publié: (2025)
Flow-OPD: On-Policy Distillation for Flow Matching Models
par: Fang, Zhen, et autres
Publié: (2026)
par: Fang, Zhen, et autres
Publié: (2026)
Motion-Aware Caching for Efficient Autoregressive Video Generation
par: Xu, Jing, et autres
Publié: (2026)
par: Xu, Jing, et autres
Publié: (2026)
EUGens: Efficient, Unified, and General Dense Layers
par: Kim, Sang Min, et autres
Publié: (2024)
par: Kim, Sang Min, et autres
Publié: (2024)
Efficient Flow Matching using Latent Variables
par: Samaddar, Anirban, et autres
Publié: (2025)
par: Samaddar, Anirban, et autres
Publié: (2025)
Restrictive Hierarchical Semantic Segmentation for Stratified Tooth Layer Detection
par: Banks, Ryan, et autres
Publié: (2025)
par: Banks, Ryan, et autres
Publié: (2025)
ReSpinQuant: Efficient Layer-Wise LLM Quantization via Subspace Residual Rotation Approximation
par: Kim, Suyoung, et autres
Publié: (2026)
par: Kim, Suyoung, et autres
Publié: (2026)
Enhancing Layer Attention Efficiency through Pruning Redundant Retrievals
par: Li, Hanze, et autres
Publié: (2025)
par: Li, Hanze, et autres
Publié: (2025)
Channel-wise Vector Quantization
par: Song, Wei, et autres
Publié: (2026)
par: Song, Wei, et autres
Publié: (2026)
TrajFlow: Multi-modal Motion Prediction via Flow Matching
par: Yan, Qi, et autres
Publié: (2025)
par: Yan, Qi, et autres
Publié: (2025)
SDAR-VL: Stable and Efficient Block-wise Diffusion for Vision-Language Understanding
par: Cheng, Shuang, et autres
Publié: (2025)
par: Cheng, Shuang, et autres
Publié: (2025)
Documents similaires
-
MeanCache: From Instantaneous to Average Velocity for Accelerating Flow Matching Inference
par: Gao, Huanlin, et autres
Publié: (2026) -
LP-DETR: Layer-wise Progressive Relations for Object Detection
par: Kang, Zhengjian, et autres
Publié: (2025) -
Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
par: Li, Guandong
Publié: (2026) -
DeepIcon: A Hierarchical Network for Layer-wise Icon Vectorization
par: Bing, Qi, et autres
Publié: (2024) -
SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass
par: Qian, Chen, et autres
Publié: (2026)