Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Pengxiang, Tsai, Joey, Xue, Hongwei, Shi, Kunyu, Yan, Shilin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms
par: Yan, Shilin, et autres
Publié: (2025)
par: Yan, Shilin, et autres
Publié: (2025)
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
par: Tong, Jintao, et autres
Publié: (2026)
par: Tong, Jintao, et autres
Publié: (2026)
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
par: Yan, Shilin, et autres
Publié: (2026)
par: Yan, Shilin, et autres
Publié: (2026)
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026)
par: Shen, Haozhan, et autres
Publié: (2026)
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
par: Wang, Ao, et autres
Publié: (2024)
par: Wang, Ao, et autres
Publié: (2024)
FaceGCD: Generalized Face Discovery via Dynamic Prefix Generation
par: Oh, Yunseok, et autres
Publié: (2025)
par: Oh, Yunseok, et autres
Publié: (2025)
MS-CustomNet: Controllable Multi-Subject Customization with Hierarchical Relational Semantics
par: Cai, Pengxiang, et autres
Publié: (2026)
par: Cai, Pengxiang, et autres
Publié: (2026)
Semantic-Aware Prefix Learning for Token-Efficient Image Generation
par: Li, Qingfeng, et autres
Publié: (2026)
par: Li, Qingfeng, et autres
Publié: (2026)
Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting
par: Jang, Hyeonseo, et autres
Publié: (2026)
par: Jang, Hyeonseo, et autres
Publié: (2026)
RTFDNet: Fusion-Decoupling for Robust RGB-T Segmentation
par: Tan, Kunyu, et autres
Publié: (2026)
par: Tan, Kunyu, et autres
Publié: (2026)
VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation
par: Liao, Xinyao, et autres
Publié: (2026)
par: Liao, Xinyao, et autres
Publié: (2026)
FastVMT: Eliminating Redundancy in Video Motion Transfer
par: Ma, Yue, et autres
Publié: (2026)
par: Ma, Yue, et autres
Publié: (2026)
Beyond Reconstruction: Reconstruction-to-Vector Diffusion for Hyperspectral Anomaly Detection
par: Xiang, Jijun, et autres
Publié: (2026)
par: Xiang, Jijun, et autres
Publié: (2026)
Visual Perception by Large Language Model's Weights
par: Ma, Feipeng, et autres
Publié: (2024)
par: Ma, Feipeng, et autres
Publié: (2024)
Multi-Modal Generative Embedding Model
par: Ma, Feipeng, et autres
Publié: (2024)
par: Ma, Feipeng, et autres
Publié: (2024)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
par: Zhao, Han, et autres
Publié: (2024)
par: Zhao, Han, et autres
Publié: (2024)
Towards more realistic human motion prediction with attention to motion coordination
par: Ding, Pengxiang, et autres
Publié: (2024)
par: Ding, Pengxiang, et autres
Publié: (2024)
DreamLayer: Simultaneous Multi-Layer Generation via Diffusion Mode
par: Huang, Junjia, et autres
Publié: (2025)
par: Huang, Junjia, et autres
Publié: (2025)
Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments
par: Wen, Di, et autres
Publié: (2025)
par: Wen, Di, et autres
Publié: (2025)
PVP: Polar Representation Boost for 3D Semantic Occupancy Prediction
par: Xue, Yujing, et autres
Publié: (2024)
par: Xue, Yujing, et autres
Publié: (2024)
Fast and Stable Diffusion Inverse Solver with History Gradient Update
par: He, Linchao, et autres
Publié: (2023)
par: He, Linchao, et autres
Publié: (2023)
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance
par: Song, Wenxuan, et autres
Publié: (2026)
par: Song, Wenxuan, et autres
Publié: (2026)
Hybrid SD: Edge-Cloud Collaborative Inference for Stable Diffusion Models
par: Yan, Chenqian, et autres
Publié: (2024)
par: Yan, Chenqian, et autres
Publié: (2024)
VISA: Reasoning Video Object Segmentation via Large Language Models
par: Yan, Cilin, et autres
Publié: (2024)
par: Yan, Cilin, et autres
Publié: (2024)
FIN: Fast Inference Network for Map Segmentation
par: Bispo, Ruan, et autres
Publié: (2025)
par: Bispo, Ruan, et autres
Publié: (2025)
Enhancing Adversarial Transferability via Component-Wise Transformation
par: Liu, Hangyu, et autres
Publié: (2025)
par: Liu, Hangyu, et autres
Publié: (2025)
User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
par: Wang, Xuan, et autres
Publié: (2023)
par: Wang, Xuan, et autres
Publié: (2023)
Beyond the Textual: Generating Coherent Visual Options for MCQs
par: Wang, Wanqiang, et autres
Publié: (2025)
par: Wang, Wanqiang, et autres
Publié: (2025)
Proteus-ID: ID-Consistent and Motion-Coherent Video Customization
par: Zhang, Guiyu, et autres
Publié: (2025)
par: Zhang, Guiyu, et autres
Publié: (2025)
Explainable AI (XAI) in Image Segmentation in Medicine, Industry, and Beyond: A Survey
par: Gipiškis, Rokas, et autres
Publié: (2024)
par: Gipiškis, Rokas, et autres
Publié: (2024)
Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
par: Yang, Haoxin, et autres
Publié: (2025)
par: Yang, Haoxin, et autres
Publié: (2025)
T-MASK: Temporal Masking for Probing Foundation Models across Camera Views in Driver Monitoring
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2025)
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024)
par: Ponbagavathi, Thinesh Thiyakesan, et autres
Publié: (2024)
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
par: Yang, Lei, et autres
Publié: (2026)
par: Yang, Lei, et autres
Publié: (2026)
Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation
par: Fang, Hongwei, et autres
Publié: (2026)
par: Fang, Hongwei, et autres
Publié: (2026)
FastUSP: A Multi-Level Collaborative Acceleration Framework for Distributed Diffusion Model Inference
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning
par: Shi, Fan, et autres
Publié: (2025)
par: Shi, Fan, et autres
Publié: (2025)
A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model
par: Zheng, Qi, et autres
Publié: (2026)
par: Zheng, Qi, et autres
Publié: (2026)
Towards Effective and Sparse Adversarial Attack on Spiking Neural Networks via Breaking Invisible Surrogate Gradients
par: Lun, Li, et autres
Publié: (2025)
par: Lun, Li, et autres
Publié: (2025)
Consistent text-to-image generation via scene de-contextualization
par: Tang, Song, et autres
Publié: (2025)
par: Tang, Song, et autres
Publié: (2025)
Documents similaires
-
CrossLMM: Decoupling Long Video Sequences from LMMs via Dual Cross-Attention Mechanisms
par: Yan, Shilin, et autres
Publié: (2025) -
SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs
par: Tong, Jintao, et autres
Publié: (2026) -
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
par: Yan, Shilin, et autres
Publié: (2026) -
MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning
par: Shen, Haozhan, et autres
Publié: (2026) -
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
par: Wang, Ao, et autres
Publié: (2024)