Hierarchical Skip Decoding for Efficient Autoregressive Text Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Yunqi, Yang, Xuebing, Wu, Yuanyuan, Zhang, Wensheng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Potential of LLMs in Medical Education: Generating Questions and Answers for Qualification Exams
par: Zhu, Yunqi, et autres
Publié: (2024)
par: Zhu, Yunqi, et autres
Publié: (2024)
Pipelined Decoder for Efficient Context-Aware Text Generation
par: Huang, Zixian, et autres
Publié: (2025)
par: Huang, Zixian, et autres
Publié: (2025)
Differences in Text Generated by Diffusion and Autoregressive Language Models
par: Zhang, Zeyang, et autres
Publié: (2026)
par: Zhang, Zeyang, et autres
Publié: (2026)
Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction
par: Glavas, Theodore, et autres
Publié: (2026)
par: Glavas, Theodore, et autres
Publié: (2026)
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
par: Lu, Wensheng, et autres
Publié: (2025)
par: Lu, Wensheng, et autres
Publié: (2025)
AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference
par: He, Zhuomin, et autres
Publié: (2025)
par: He, Zhuomin, et autres
Publié: (2025)
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
par: Elhoushi, Mostafa, et autres
Publié: (2024)
par: Elhoushi, Mostafa, et autres
Publié: (2024)
Trustful LLMs: Customizing and Grounding Text Generation with Knowledge Bases and Dual Decoders
par: Zhu, Xiaofeng, et autres
Publié: (2024)
par: Zhu, Xiaofeng, et autres
Publié: (2024)
WAND: Windowed Attention and Knowledge Distillation for Efficient Autoregressive Text-to-Speech Models
par: Lee, Hanna, et autres
Publié: (2026)
par: Lee, Hanna, et autres
Publié: (2026)
Generating Diverse and High-Quality Texts by Minimum Bayes Risk Decoding
par: Jinnai, Yuu, et autres
Publié: (2024)
par: Jinnai, Yuu, et autres
Publié: (2024)
PHOTON: Hierarchical Autoregressive Modeling for Lightspeed and Memory-Efficient Language Generation
par: Ichikawa, Yuma, et autres
Publié: (2025)
par: Ichikawa, Yuma, et autres
Publié: (2025)
SkipCat: Rank-Maximized Low-Rank Compression of Large Language Models via Shared Projection and Block Skipping
par: Lu, Yu-Chen, et autres
Publié: (2025)
par: Lu, Yu-Chen, et autres
Publié: (2025)
Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding
par: Bergner, Benjamin, et autres
Publié: (2024)
par: Bergner, Benjamin, et autres
Publié: (2024)
Model-Based Minimum Bayes Risk Decoding for Text Generation
par: Jinnai, Yuu, et autres
Publié: (2023)
par: Jinnai, Yuu, et autres
Publié: (2023)
A Comparative Study of Decoding Strategies in Medical Text Generation
par: Presacan, Oriana, et autres
Publié: (2025)
par: Presacan, Oriana, et autres
Publié: (2025)
DiffScore: Text Evaluation Beyond Autoregressive Likelihood
par: Lai, Wen, et autres
Publié: (2026)
par: Lai, Wen, et autres
Publié: (2026)
Why Diffusion Language Models Struggle with Truly Parallel (Non-Autoregressive) Decoding?
par: Li, Pengxiang, et autres
Publié: (2026)
par: Li, Pengxiang, et autres
Publié: (2026)
Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation
par: Du, Tianqi, et autres
Publié: (2026)
par: Du, Tianqi, et autres
Publié: (2026)
Avoiding Knowledge Edit Skipping in Multi-hop Question Answering with Guided Decomposition
par: Liu, Yi, et autres
Publié: (2025)
par: Liu, Yi, et autres
Publié: (2025)
Adaptive GoGI-Skip: Coupling Goal-Gradient Importance with Dynamic Uncertainty for Efficient Reasoning
par: Zhuang, Ren
Publié: (2025)
par: Zhuang, Ren
Publié: (2025)
Enhancing Retrieval Augmented Generation with Hierarchical Text Segmentation Chunking
par: Nguyen, Hai Toan, et autres
Publié: (2025)
par: Nguyen, Hai Toan, et autres
Publié: (2025)
VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping
par: Dong, Haotian, et autres
Publié: (2025)
par: Dong, Haotian, et autres
Publié: (2025)
Federated Learning with Layer Skipping: Efficient Training of Large Language Models for Healthcare NLP
par: Zhang, Lihong, et autres
Publié: (2025)
par: Zhang, Lihong, et autres
Publié: (2025)
ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding
par: Li, Jia-Nan, et autres
Publié: (2025)
par: Li, Jia-Nan, et autres
Publié: (2025)
Reflection-Window Decoding: Text Generation with Selective Refinement
par: Tang, Zeyu, et autres
Publié: (2025)
par: Tang, Zeyu, et autres
Publié: (2025)
Exploiting Text Semantics for Few and Zero Shot Node Classification on Text-attributed Graph
par: Wang, Yuxiang, et autres
Publié: (2025)
par: Wang, Yuxiang, et autres
Publié: (2025)
Enhancing Text Authenticity: A Novel Hybrid Approach for AI-Generated Text Detection
par: Zhang, Ye, et autres
Publié: (2024)
par: Zhang, Ye, et autres
Publié: (2024)
Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression
par: Zhang, Yong, et autres
Publié: (2025)
par: Zhang, Yong, et autres
Publié: (2025)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
par: Xia, Heming, et autres
Publié: (2025)
par: Xia, Heming, et autres
Publié: (2025)
Document-Level Text Generation with Minimum Bayes Risk Decoding using Optimal Transport
par: Jinnai, Yuu
Publié: (2025)
par: Jinnai, Yuu
Publié: (2025)
Unlocking Anticipatory Text Generation: A Constrained Approach for Large Language Models Decoding
par: Tu, Lifu, et autres
Publié: (2023)
par: Tu, Lifu, et autres
Publié: (2023)
When Linear Attention Meets Autoregressive Decoding: Towards More Effective and Efficient Linearized Large Language Models
par: You, Haoran, et autres
Publié: (2024)
par: You, Haoran, et autres
Publié: (2024)
Speculative Decoding Meets Quantization: Compatibility Evaluation and Hierarchical Framework Design
par: Zhang, Yudi, et autres
Publié: (2025)
par: Zhang, Yudi, et autres
Publié: (2025)
Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads
par: Kou, Siqi, et autres
Publié: (2024)
par: Kou, Siqi, et autres
Publié: (2024)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
par: Xu, Yunqi, et autres
Publié: (2024)
par: Xu, Yunqi, et autres
Publié: (2024)
Hierarchical Memory Organization for Wikipedia Generation
par: Yu, Eugene J., et autres
Publié: (2025)
par: Yu, Eugene J., et autres
Publié: (2025)
Plato: Plan to Efficiently Decode for Large Language Model Inference
par: Jin, Shuowei, et autres
Publié: (2024)
par: Jin, Shuowei, et autres
Publié: (2024)
Not All Experts are Equal: Efficient Expert Pruning and Skipping for Mixture-of-Experts Large Language Models
par: Lu, Xudong, et autres
Publié: (2024)
par: Lu, Xudong, et autres
Publié: (2024)
Locality-aware Parallel Decoding for Efficient Autoregressive Image Generation
par: Zhang, Zhuoyang, et autres
Publié: (2025)
par: Zhang, Zhuoyang, et autres
Publié: (2025)
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
par: Zhao, Haozhe, et autres
Publié: (2025)
par: Zhao, Haozhe, et autres
Publié: (2025)
Documents similaires
-
The Potential of LLMs in Medical Education: Generating Questions and Answers for Qualification Exams
par: Zhu, Yunqi, et autres
Publié: (2024) -
Pipelined Decoder for Efficient Context-Aware Text Generation
par: Huang, Zixian, et autres
Publié: (2025) -
Differences in Text Generated by Diffusion and Autoregressive Language Models
par: Zhang, Zeyang, et autres
Publié: (2026) -
Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction
par: Glavas, Theodore, et autres
Publié: (2026) -
HiChunk: Evaluating and Enhancing Retrieval-Augmented Generation with Hierarchical Chunking
par: Lu, Wensheng, et autres
Publié: (2025)