Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ke, Junlong, Wen, Zichen, Yang, Boxue, Yang, Yantai, Liu, Xuyang, Liao, Chenfei, Chen, Zhaorun, Wang, Shaobo, Zhang, Linfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
par: Wen, Zichen, et autres
Publié: (2026)
par: Wen, Zichen, et autres
Publié: (2026)
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
par: Yang, Yantai, et autres
Publié: (2025)
par: Yang, Yantai, et autres
Publié: (2025)
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
par: Wang, Yiyu, et autres
Publié: (2025)
par: Wang, Yiyu, et autres
Publié: (2025)
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
par: Yang, Min, et autres
Publié: (2024)
par: Yang, Min, et autres
Publié: (2024)
Not All Samples Should Be Utilized Equally: Towards Understanding and Improving Dataset Distillation
par: Wang, Shaobo, et autres
Publié: (2024)
par: Wang, Shaobo, et autres
Publié: (2024)
AI for Service: Proactive Assistance with AI Glasses
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
par: Lyu, Yuanhuiyi, et autres
Publié: (2025)
par: Lyu, Yuanhuiyi, et autres
Publié: (2025)
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving
par: Xiong, Minhao, et autres
Publié: (2025)
par: Xiong, Minhao, et autres
Publié: (2025)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Token Transforming: A Unified and Training-Free Token Compression Framework for Vision Transformer Acceleration
par: Zeng, Fanhu, et autres
Publié: (2025)
par: Zeng, Fanhu, et autres
Publié: (2025)
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models
par: Liu, Zhiheng, et autres
Publié: (2025)
par: Liu, Zhiheng, et autres
Publié: (2025)
Show-o2: Improved Native Unified Multimodal Models
par: Xie, Jinheng, et autres
Publié: (2025)
par: Xie, Jinheng, et autres
Publié: (2025)
Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
par: Li, Ruibin, et autres
Publié: (2025)
par: Li, Ruibin, et autres
Publié: (2025)
Unified Batch Normalization: Identifying and Alleviating the Feature Condensation in Batch Normalization and a Unified Framework
par: Wang, Shaobo, et autres
Publié: (2023)
par: Wang, Shaobo, et autres
Publié: (2023)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
par: Yu, Hanxun, et autres
Publié: (2026)
par: Yu, Hanxun, et autres
Publié: (2026)
Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception
par: Wu, Yuanchen, et autres
Publié: (2025)
par: Wu, Yuanchen, et autres
Publié: (2025)
Representation Shift: Unifying Token Compression with FlashAttention
par: Choi, Joonmyung, et autres
Publié: (2025)
par: Choi, Joonmyung, et autres
Publié: (2025)
One CT Unified Model Training Framework to Rule All Scanning Protocols
par: Xu, Fengzhi, et autres
Publié: (2026)
par: Xu, Fengzhi, et autres
Publié: (2026)
Shifting AI Efficiency From Model-Centric to Data-Centric Compression
par: Liu, Xuyang, et autres
Publié: (2025)
par: Liu, Xuyang, et autres
Publié: (2025)
InteractPro: A Unified Framework for Motion-Aware Image Composition
par: Tao, Weijing, et autres
Publié: (2024)
par: Tao, Weijing, et autres
Publié: (2024)
UniViTAR: Unified Vision Transformer with Native Resolution
par: Qiao, Limeng, et autres
Publié: (2025)
par: Qiao, Limeng, et autres
Publié: (2025)
Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts
par: Zhang, Jiaxing, et autres
Publié: (2025)
par: Zhang, Jiaxing, et autres
Publié: (2025)
Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods
par: Liao, Chenfei, et autres
Publié: (2025)
par: Liao, Chenfei, et autres
Publié: (2025)
VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction
par: Wang, Shaobo, et autres
Publié: (2025)
par: Wang, Shaobo, et autres
Publié: (2025)
Representation Forcing for Bottleneck-Free Unified Multimodal Models
par: Wang, Yuqing, et autres
Publié: (2026)
par: Wang, Yuqing, et autres
Publié: (2026)
UMIT: Unifying Medical Imaging Tasks via Vision-Language Models
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
Stop Looking for Important Tokens in Multimodal Language Models: Duplication Matters More
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
ViCO: A Training Strategy towards Semantic Aware Dynamic High-Resolution
par: Cui, Long, et autres
Publié: (2025)
par: Cui, Long, et autres
Publié: (2025)
Training for Identity, Inference for Controllability: A Unified Approach to Tuning-Free Face Personalization
par: Pang, Lianyu, et autres
Publié: (2025)
par: Pang, Lianyu, et autres
Publié: (2025)
FreeMotion: A Unified Framework for Number-free Text-to-Motion Synthesis
par: Fan, Ke, et autres
Publié: (2024)
par: Fan, Ke, et autres
Publié: (2024)
Compute Only 16 Tokens in One Timestep: Accelerating Diffusion Transformers with Cluster-Driven Feature Caching
par: Zheng, Zhixin, et autres
Publié: (2025)
par: Zheng, Zhixin, et autres
Publié: (2025)
PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation
par: Yan, Hongyu, et autres
Publié: (2025)
par: Yan, Hongyu, et autres
Publié: (2025)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
par: Li, Kunyang, et autres
Publié: (2026)
par: Li, Kunyang, et autres
Publié: (2026)
Filter, Correlate, Compress: Training-Free Token Reduction for MLLM Acceleration
par: Han, Yuhang, et autres
Publié: (2024)
par: Han, Yuhang, et autres
Publié: (2024)
HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer
par: Cai, Qi, et autres
Publié: (2026)
par: Cai, Qi, et autres
Publié: (2026)
RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
par: Wang, Jiuniu, et autres
Publié: (2025)
par: Wang, Jiuniu, et autres
Publié: (2025)
Differential Vector Erasure: Unified Training-Free Concept Erasure for Flow Matching Models
par: Zhang, Zhiqi, et autres
Publié: (2026)
par: Zhang, Zhiqi, et autres
Publié: (2026)
FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation
par: Zhou, Junkang, et autres
Publié: (2026)
par: Zhou, Junkang, et autres
Publié: (2026)
FlashMix: Fast Map-Free LiDAR Localization via Feature Mixing and Contrastive-Constrained Accelerated Training
par: Goswami, Raktim Gautam, et autres
Publié: (2024)
par: Goswami, Raktim Gautam, et autres
Publié: (2024)
Documents similaires
-
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
par: Wen, Zichen, et autres
Publié: (2026) -
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
par: Yang, Yantai, et autres
Publié: (2025) -
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
par: Wang, Yiyu, et autres
Publié: (2025) -
Temporal2Seq: A Unified Framework for Temporal Video Understanding Tasks
par: Yang, Min, et autres
Publié: (2024) -
Not All Samples Should Be Utilized Equally: Towards Understanding and Improving Dataset Distillation
par: Wang, Shaobo, et autres
Publié: (2024)