Path-Consistency with Prefix Enhancement for Efficient Inference in LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhu, Jiace, Huang, Yuanzhe, Shen, Yingtao, Zhao, Jie, Zou, An |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
por: Wan, Guangya, et al.
Publicado: (2024)
por: Wan, Guangya, et al.
Publicado: (2024)
The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus
por: Jindal, Ishan, et al.
Publicado: (2026)
por: Jindal, Ishan, et al.
Publicado: (2026)
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation
por: Wang, Jiahao, et al.
Publicado: (2026)
por: Wang, Jiahao, et al.
Publicado: (2026)
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
por: Liu, Jiaxu, et al.
Publicado: (2024)
por: Liu, Jiaxu, et al.
Publicado: (2024)
Tandem Transformers for Inference Efficient LLMs
por: S, Aishwarya P, et al.
Publicado: (2024)
por: S, Aishwarya P, et al.
Publicado: (2024)
Self-Control of LLM Behaviors by Compressing Suffix Gradient into Prefix Controller
por: Cai, Min, et al.
Publicado: (2024)
por: Cai, Min, et al.
Publicado: (2024)
L-TUNING: Synchronized Label Tuning for Prompt and Prefix in LLMs
por: Kowsher, Md., et al.
Publicado: (2023)
por: Kowsher, Md., et al.
Publicado: (2023)
Embedding-to-Prefix: Parameter-Efficient Personalization for Pre-Trained Large Language Models
por: Huber, Bernd, et al.
Publicado: (2025)
por: Huber, Bernd, et al.
Publicado: (2025)
Cerberus: Efficient Inference with Adaptive Parallel Decoding and Sequential Knowledge Enhancement
por: Liu, Yuxuan, et al.
Publicado: (2024)
por: Liu, Yuxuan, et al.
Publicado: (2024)
Unveiling the Lexical Sensitivity of LLMs: Combinatorial Optimization for Prompt Enhancement
por: Zhan, Pengwei, et al.
Publicado: (2024)
por: Zhan, Pengwei, et al.
Publicado: (2024)
GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs
por: Huang, Wei, et al.
Publicado: (2026)
por: Huang, Wei, et al.
Publicado: (2026)
Towards Infinite-Long Prefix in Transformer
por: Liang, Yingyu, et al.
Publicado: (2024)
por: Liang, Yingyu, et al.
Publicado: (2024)
Path Pooling: Training-Free Structure Enhancement for Efficient Knowledge Graph Retrieval-Augmented Generation
por: Wang, Hairu, et al.
Publicado: (2025)
por: Wang, Hairu, et al.
Publicado: (2025)
Well Begun, Half Done: Reinforcement Learning with Prefix Optimization for LLM Reasoning
por: Sun, Yiliu, et al.
Publicado: (2025)
por: Sun, Yiliu, et al.
Publicado: (2025)
Detecting Prefix Bias in LLM-based Reward Models
por: Kumar, Ashwin, et al.
Publicado: (2025)
por: Kumar, Ashwin, et al.
Publicado: (2025)
PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise
por: Harary, Sapir, et al.
Publicado: (2025)
por: Harary, Sapir, et al.
Publicado: (2025)
Do LLMs have Consistent Values?
por: Rozen, Naama, et al.
Publicado: (2024)
por: Rozen, Naama, et al.
Publicado: (2024)
Confidence Improves Self-Consistency in LLMs
por: Taubenfeld, Amir, et al.
Publicado: (2025)
por: Taubenfeld, Amir, et al.
Publicado: (2025)
CUDA-LLM: LLMs Can Write Efficient CUDA Kernels
por: Chen, Wentao, et al.
Publicado: (2025)
por: Chen, Wentao, et al.
Publicado: (2025)
Decoding fMRI Data into Captions using Prefix Language Modeling
por: Shen, Vyacheslav, et al.
Publicado: (2025)
por: Shen, Vyacheslav, et al.
Publicado: (2025)
Informed Routing in LLMs: Smarter Token-Level Computation for Faster Inference
por: Han, Chao, et al.
Publicado: (2025)
por: Han, Chao, et al.
Publicado: (2025)
Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling
por: Huang, Zeyu, et al.
Publicado: (2025)
por: Huang, Zeyu, et al.
Publicado: (2025)
Bounded Rationality for LLMs: Satisficing Alignment at Inference-Time
por: Chehade, Mohamad, et al.
Publicado: (2025)
por: Chehade, Mohamad, et al.
Publicado: (2025)
Evaluating Role-Consistency in LLMs for Counselor Training
por: Rudolph, Eric, et al.
Publicado: (2026)
por: Rudolph, Eric, et al.
Publicado: (2026)
Editing Knowledge Representation of Language Model via Rephrased Prefix Prompts
por: Cai, Yuchen, et al.
Publicado: (2024)
por: Cai, Yuchen, et al.
Publicado: (2024)
Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs
por: Cao, Jie, et al.
Publicado: (2026)
por: Cao, Jie, et al.
Publicado: (2026)
Regression-aware Inference with LLMs
por: Lukasik, Michal, et al.
Publicado: (2024)
por: Lukasik, Michal, et al.
Publicado: (2024)
Beyond Self-Consistency: Ensemble Reasoning Boosts Consistency and Accuracy of LLMs in Cancer Staging
por: Chang, Chia-Hsuan, et al.
Publicado: (2024)
por: Chang, Chia-Hsuan, et al.
Publicado: (2024)
Contextual Categorization Enhancement through LLMs Latent-Space
por: Bettouche, Zineddine, et al.
Publicado: (2024)
por: Bettouche, Zineddine, et al.
Publicado: (2024)
Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
por: Zhang, Kongcheng, et al.
Publicado: (2025)
por: Zhang, Kongcheng, et al.
Publicado: (2025)
Self-Consistency Preference Optimization
por: Prasad, Archiki, et al.
Publicado: (2024)
por: Prasad, Archiki, et al.
Publicado: (2024)
When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs
por: Khairi, Ammar, et al.
Publicado: (2025)
por: Khairi, Ammar, et al.
Publicado: (2025)
FedCoT: Communication-Efficient Federated Reasoning Enhancement for Large Language Models
por: Li, Chuan, et al.
Publicado: (2025)
por: Li, Chuan, et al.
Publicado: (2025)
AdvPrefix: An Objective for Nuanced LLM Jailbreaks
por: Zhu, Sicheng, et al.
Publicado: (2024)
por: Zhu, Sicheng, et al.
Publicado: (2024)
LLMs Are Prone to Fallacies in Causal Inference
por: Joshi, Nitish, et al.
Publicado: (2024)
por: Joshi, Nitish, et al.
Publicado: (2024)
Humans and LLMs Diverge on Probabilistic Inferences
por: Kamath, Gaurav, et al.
Publicado: (2026)
por: Kamath, Gaurav, et al.
Publicado: (2026)
Draft-based Approximate Inference for LLMs
por: Galim, Kevin, et al.
Publicado: (2025)
por: Galim, Kevin, et al.
Publicado: (2025)
Prefix Text as a Yarn: Eliciting Non-English Alignment in Foundation Language Model
por: Zhan, Runzhe, et al.
Publicado: (2024)
por: Zhan, Runzhe, et al.
Publicado: (2024)
Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization
por: Xiao, Quanjia, et al.
Publicado: (2026)
por: Xiao, Quanjia, et al.
Publicado: (2026)
Ejemplares similares
-
Reasoning Aware Self-Consistency: Leveraging Reasoning Paths for Efficient LLM Sampling
por: Wan, Guangya, et al.
Publicado: (2024) -
The Path of Least Resistance: Guiding LLM Reasoning Trajectories with Prefix Consensus
por: Jindal, Ishan, et al.
Publicado: (2026) -
PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention
por: Wang, Haonan, et al.
Publicado: (2025) -
From Prefix Cache to Fusion RAG Cache: Accelerating LLM Inference in Retrieval-Augmented Generation
por: Wang, Jiahao, et al.
Publicado: (2026) -
Tiny Refinements Elicit Resilience: Toward Efficient Prefix-Model Against LLM Red-Teaming
por: Liu, Jiaxu, et al.
Publicado: (2024)