Chimera: A Lossless Decoding Method for Accelerating Large Language Models Inference by Fusing all Tokens
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zeng, Ziqian, Yu, Jiahong, Pang, Qianshi, Wang, Zihao, Zhuang, Huiping, Shao, Hongen, Zou, Xiaofeng |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
von: Zeng, Ziqian, et al.
Veröffentlicht: (2023)
von: Zeng, Ziqian, et al.
Veröffentlicht: (2023)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
von: Shao, Wei, et al.
Veröffentlicht: (2025)
von: Shao, Wei, et al.
Veröffentlicht: (2025)
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
von: Lu, Weikai, et al.
Veröffentlicht: (2025)
von: Lu, Weikai, et al.
Veröffentlicht: (2025)
Subkv: Quantizing Long Context KV Cache for Sub‐Billion Parameter Language Models on Edge Devices
von: Ziqian Zeng, et al.
Veröffentlicht: (2025)
von: Ziqian Zeng, et al.
Veröffentlicht: (2025)
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)
Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
von: Lu, Weikai, et al.
Veröffentlicht: (2024)
von: Lu, Weikai, et al.
Veröffentlicht: (2024)
Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding
von: Zhang, Jun, et al.
Veröffentlicht: (2023)
von: Zhang, Jun, et al.
Veröffentlicht: (2023)
GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
von: Zhang, Tao, et al.
Veröffentlicht: (2024)
Accelerating LLM Inference with Lossless Speculative Decoding Algorithms for Heterogeneous Vocabularies
von: Timor, Nadav, et al.
Veröffentlicht: (2025)
von: Timor, Nadav, et al.
Veröffentlicht: (2025)
Lossless Acceleration of Large Language Model via Adaptive N-gram Parallel Decoding
von: Ou, Jie, et al.
Veröffentlicht: (2024)
von: Ou, Jie, et al.
Veröffentlicht: (2024)
Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative Decoding
von: Cho, Sukmin, et al.
Veröffentlicht: (2025)
von: Cho, Sukmin, et al.
Veröffentlicht: (2025)
RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior
von: Yang, Junyao, et al.
Veröffentlicht: (2025)
von: Yang, Junyao, et al.
Veröffentlicht: (2025)
TokenSwift: Lossless Acceleration of Ultra Long Sequence Generation
von: Wu, Tong, et al.
Veröffentlicht: (2025)
von: Wu, Tong, et al.
Veröffentlicht: (2025)
Lossless Compression of Large Language Model-Generated Text via Next-Token Prediction
von: Mao, Yu, et al.
Veröffentlicht: (2025)
von: Mao, Yu, et al.
Veröffentlicht: (2025)
Decompose, Plan in Parallel, and Merge: A Novel Paradigm for Large Language Models based Planning with Multiple Constraints
von: Lu, Zhengdong, et al.
Veröffentlicht: (2025)
von: Lu, Zhengdong, et al.
Veröffentlicht: (2025)
SDSAT: Accelerating LLM Inference through Speculative Decoding with Semantic Adaptive Tokens
von: Liu, Chengbo, et al.
Veröffentlicht: (2024)
von: Liu, Chengbo, et al.
Veröffentlicht: (2024)
BiTA: Bi-Directional Tuning for Lossless Acceleration in Large Language Models
von: Lin, Feng, et al.
Veröffentlicht: (2024)
von: Lin, Feng, et al.
Veröffentlicht: (2024)
Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
von: Xiong, Chen, et al.
Veröffentlicht: (2025)
von: Xiong, Chen, et al.
Veröffentlicht: (2025)
Chimera: Diagnosing Shortcut Learning in Visual-Language Understanding
von: Chi, Ziheng, et al.
Veröffentlicht: (2025)
von: Chi, Ziheng, et al.
Veröffentlicht: (2025)
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
von: Agrawal, Sudhanshu, et al.
Veröffentlicht: (2025)
von: Agrawal, Sudhanshu, et al.
Veröffentlicht: (2025)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
von: Sun, Hanshi, et al.
Veröffentlicht: (2024)
von: Sun, Hanshi, et al.
Veröffentlicht: (2024)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
von: Luo, Xianzhen, et al.
Veröffentlicht: (2024)
von: Luo, Xianzhen, et al.
Veröffentlicht: (2024)
Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference
von: Schelpe, Sietse
Veröffentlicht: (2026)
von: Schelpe, Sietse
Veröffentlicht: (2026)
Dissecting Fine-Tuning Unlearning in Large Language Models
von: Hong, Yihuai, et al.
Veröffentlicht: (2024)
von: Hong, Yihuai, et al.
Veröffentlicht: (2024)
Token-Efficient Leverage Learning in Large Language Models
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
CITER: Collaborative Inference for Efficient Large Language Model Decoding with Token-Level Routing
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
von: Zheng, Wenhao, et al.
Veröffentlicht: (2025)
Speculate Deep and Accurate: Lossless and Training-Free Acceleration for Offloaded LLMs via Substitute Speculative Decoding
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025)
von: Wang, Pei-Shuo, et al.
Veröffentlicht: (2025)
Lossless Token Sequence Compression via Meta-Tokens
von: Harvill, John, et al.
Veröffentlicht: (2025)
von: Harvill, John, et al.
Veröffentlicht: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
von: Liu, Dong, et al.
Veröffentlicht: (2025)
von: Liu, Dong, et al.
Veröffentlicht: (2025)
Generation Meets Verification: Accelerating Large Language Model Inference with Smart Parallel Auto-Correct Decoding
von: Yi, Hanling, et al.
Veröffentlicht: (2024)
von: Yi, Hanling, et al.
Veröffentlicht: (2024)
LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification
von: Yang, Penghui, et al.
Veröffentlicht: (2025)
von: Yang, Penghui, et al.
Veröffentlicht: (2025)
Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy
von: Zhao, Yao, et al.
Veröffentlicht: (2023)
von: Zhao, Yao, et al.
Veröffentlicht: (2023)
PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and Restoration
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
von: Zeng, Ziqian, et al.
Veröffentlicht: (2024)
DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling
von: Tuli, Shikhar, et al.
Veröffentlicht: (2024)
von: Tuli, Shikhar, et al.
Veröffentlicht: (2024)
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
von: Li, Zeping, et al.
Veröffentlicht: (2024)
von: Li, Zeping, et al.
Veröffentlicht: (2024)
FlashDecoding++: Faster Large Language Model Inference on GPUs
von: Hong, Ke, et al.
Veröffentlicht: (2023)
von: Hong, Ke, et al.
Veröffentlicht: (2023)
HAMburger: Accelerating LLM Inference via Token Smashing
von: Liu, Jingyu, et al.
Veröffentlicht: (2025)
von: Liu, Jingyu, et al.
Veröffentlicht: (2025)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
von: Liu, Peijie, et al.
Veröffentlicht: (2025)
von: Liu, Peijie, et al.
Veröffentlicht: (2025)
TASE: Token Awareness and Structured Evaluation for Multilingual Language Models
von: Zhao, Chenzhuo, et al.
Veröffentlicht: (2025)
von: Zhao, Chenzhuo, et al.
Veröffentlicht: (2025)
Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding
von: Luo, Xiangzhong, et al.
Veröffentlicht: (2026)
von: Luo, Xiangzhong, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
ConsistentEE: A Consistent and Hardness-Guided Early Exiting Method for Accelerating Language Models Inference
von: Zeng, Ziqian, et al.
Veröffentlicht: (2023) -
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
von: Shao, Wei, et al.
Veröffentlicht: (2025) -
SEA: Low-Resource Safety Alignment for Multimodal Large Language Models via Synthetic Embeddings
von: Lu, Weikai, et al.
Veröffentlicht: (2025) -
Subkv: Quantizing Long Context KV Cache for Sub‐Billion Parameter Language Models on Edge Devices
von: Ziqian Zeng, et al.
Veröffentlicht: (2025) -
Parallel Decoding via Hidden Transfer for Lossless Large Language Model Acceleration
von: Wu, Pengfei, et al.
Veröffentlicht: (2024)