PruneCD: Contrasting Pruned Self Model to Improve Decoding Factuality
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Byeongho, Lee, Changhun, Jin, Jungyu, Park, Eunhyeok |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
por: Lee, Sangjun, et al.
Publicado: (2025)
por: Lee, Sangjun, et al.
Publicado: (2025)
OWQ: Outlier-Aware Weight Quantization for Efficient Fine-Tuning and Inference of Large Language Models
por: Lee, Changhun, et al.
Publicado: (2023)
por: Lee, Changhun, et al.
Publicado: (2023)
SEAL: Scaling to Emphasize Attention for Long-Context Retrieval
por: Lee, Changhun, et al.
Publicado: (2025)
por: Lee, Changhun, et al.
Publicado: (2025)
Prompt-based Depth Pruning of Large Language Models
por: Wee, Juyun, et al.
Publicado: (2025)
por: Wee, Juyun, et al.
Publicado: (2025)
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
por: Chuang, Yung-Sung, et al.
Publicado: (2023)
por: Chuang, Yung-Sung, et al.
Publicado: (2023)
Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models
por: Wang, Ziyan, et al.
Publicado: (2025)
por: Wang, Ziyan, et al.
Publicado: (2025)
PDTrim: Targeted Pruning for Prefill-Decode Disaggregation in Inference
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
Fine-Grained Self-Endorsement Improves Factuality and Reasoning
por: Wang, Ante, et al.
Publicado: (2024)
por: Wang, Ante, et al.
Publicado: (2024)
Integrative Decoding: Improve Factuality via Implicit Self-consistency
por: Cheng, Yi, et al.
Publicado: (2024)
por: Cheng, Yi, et al.
Publicado: (2024)
SLED: Self Logits Evolution Decoding for Improving Factuality in Large Language Models
por: Zhang, Jianyi, et al.
Publicado: (2024)
por: Zhang, Jianyi, et al.
Publicado: (2024)
Towards Robust Pruning: An Adaptive Knowledge-Retention Pruning Strategy for Language Models
por: Li, Jianwei, et al.
Publicado: (2023)
por: Li, Jianwei, et al.
Publicado: (2023)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
por: Feng, Huawen, et al.
Publicado: (2023)
por: Feng, Huawen, et al.
Publicado: (2023)
Earley-Driven Dynamic Pruning for Efficient Structured Decoding
por: Sun, Xintong, et al.
Publicado: (2025)
por: Sun, Xintong, et al.
Publicado: (2025)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
por: Wu, Jialiang, et al.
Publicado: (2025)
por: Wu, Jialiang, et al.
Publicado: (2025)
REAM: Merging Improves Pruning of Experts in LLMs
por: Jha, Saurav, et al.
Publicado: (2026)
por: Jha, Saurav, et al.
Publicado: (2026)
M-Wanda: Improving One-Shot Pruning for Multilingual LLMs
por: Choenni, Rochelle, et al.
Publicado: (2025)
por: Choenni, Rochelle, et al.
Publicado: (2025)
Efficient Latent Semantic Clustering for Scaling Test-Time Computation of LLMs
por: Lee, Sungjae, et al.
Publicado: (2025)
por: Lee, Sungjae, et al.
Publicado: (2025)
IDEA Prune: An Integrated Enlarge-and-Prune Pipeline in Generative Language Model Pretraining
por: Li, Yixiao, et al.
Publicado: (2025)
por: Li, Yixiao, et al.
Publicado: (2025)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
por: Le, Qi, et al.
Publicado: (2025)
por: Le, Qi, et al.
Publicado: (2025)
Think Clearly: Improving Reasoning via Redundant Token Pruning
por: Choi, Daewon, et al.
Publicado: (2025)
por: Choi, Daewon, et al.
Publicado: (2025)
Leveraging KV Similarity for Online Structured Pruning in LLMs
por: Lee, Jungmin, et al.
Publicado: (2025)
por: Lee, Jungmin, et al.
Publicado: (2025)
LeanK: Learnable K Cache Channel Pruning for Efficient Decoding
por: Zhang, Yike, et al.
Publicado: (2025)
por: Zhang, Yike, et al.
Publicado: (2025)
Large Language Model Pruning
por: Huang, Hanjuan, et al.
Publicado: (2024)
por: Huang, Hanjuan, et al.
Publicado: (2024)
CATP: Cross-Attention Token Pruning for Accuracy Preserved Multimodal Model Inference
por: Liao, Ruqi, et al.
Publicado: (2024)
por: Liao, Ruqi, et al.
Publicado: (2024)
DLP: Dynamic Layerwise Pruning in Large Language Models
por: Chen, Yuli, et al.
Publicado: (2025)
por: Chen, Yuli, et al.
Publicado: (2025)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
por: Zhu, Hourun, et al.
Publicado: (2025)
por: Zhu, Hourun, et al.
Publicado: (2025)
Towards Threshold-Free KV Cache Pruning
por: Ni, Xuanfan, et al.
Publicado: (2025)
por: Ni, Xuanfan, et al.
Publicado: (2025)
Efficient Shapley Value-based Non-Uniform Pruning of Large Language Models
por: Sun, Chuan, et al.
Publicado: (2025)
por: Sun, Chuan, et al.
Publicado: (2025)
Pruning General Large Language Models into Customized Expert Models
por: Zhao, Yirao, et al.
Publicado: (2025)
por: Zhao, Yirao, et al.
Publicado: (2025)
DPPA: Pruning Method for Large Language Model to Model Merging
por: Zhu, Yaochen, et al.
Publicado: (2024)
por: Zhu, Yaochen, et al.
Publicado: (2024)
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
por: Zhang, Luan, et al.
Publicado: (2026)
por: Zhang, Luan, et al.
Publicado: (2026)
Sample-aware Adaptive Structured Pruning for Large Language Models
por: Kong, Jun, et al.
Publicado: (2025)
por: Kong, Jun, et al.
Publicado: (2025)
PGB: One-Shot Pruning for BERT via Weight Grouping and Permutation
por: Lim, Hyemin, et al.
Publicado: (2025)
por: Lim, Hyemin, et al.
Publicado: (2025)
Prune4Web: DOM Tree Pruning Programming for Web Agent
por: Zhang, Jiayuan, et al.
Publicado: (2025)
por: Zhang, Jiayuan, et al.
Publicado: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
por: Yang, Liangwei, et al.
Publicado: (2025)
por: Yang, Liangwei, et al.
Publicado: (2025)
Saliency-driven Dynamic Token Pruning for Large Language Models
por: Tao, Yao, et al.
Publicado: (2025)
por: Tao, Yao, et al.
Publicado: (2025)
Investigating Hallucinations in Pruned Large Language Models for Abstractive Summarization
por: Chrysostomou, George, et al.
Publicado: (2023)
por: Chrysostomou, George, et al.
Publicado: (2023)
PrunePath: Towards Highly Structured Sparse Language Models
por: Gu, Zhexuan, et al.
Publicado: (2026)
por: Gu, Zhexuan, et al.
Publicado: (2026)
Pruning Foundation Models for High Accuracy without Retraining
por: Zhao, Pu, et al.
Publicado: (2024)
por: Zhao, Pu, et al.
Publicado: (2024)
Distillation Contrastive Decoding: Improving LLMs Reasoning with Contrastive Decoding and Distillation
por: Phan, Phuc, et al.
Publicado: (2024)
por: Phan, Phuc, et al.
Publicado: (2024)
Ejemplares similares
-
AMQ: Enabling AutoML for Mixed-precision Weight-Only Quantization of Large Language Models
por: Lee, Sangjun, et al.
Publicado: (2025) -
OWQ: Outlier-Aware Weight Quantization for Efficient Fine-Tuning and Inference of Large Language Models
por: Lee, Changhun, et al.
Publicado: (2023) -
SEAL: Scaling to Emphasize Attention for Long-Context Retrieval
por: Lee, Changhun, et al.
Publicado: (2025) -
Prompt-based Depth Pruning of Large Language Models
por: Wee, Juyun, et al.
Publicado: (2025) -
DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models
por: Chuang, Yung-Sung, et al.
Publicado: (2023)