PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Jin, Weisheng, Song, Maojia, Pala, Tej Deep, Chia, Yew Ken, Zadeh, Amir, Li, Chuan, Poria, Soujanya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions
por: Song, Maojia, et al.
Publicado: (2025)
por: Song, Maojia, et al.
Publicado: (2025)
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
por: Pala, Tej Deep, et al.
Publicado: (2025)
por: Pala, Tej Deep, et al.
Publicado: (2025)
DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling
por: Deep, Pala Tej, et al.
Publicado: (2024)
por: Deep, Pala Tej, et al.
Publicado: (2024)
Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique
por: Pala, Tej Deep, et al.
Publicado: (2024)
por: Pala, Tej Deep, et al.
Publicado: (2024)
Lessons from Training Grounded LLMs with Verifiable Rewards
por: Sim, Shang Hong, et al.
Publicado: (2025)
por: Sim, Shang Hong, et al.
Publicado: (2025)
Training Vision-Language Process Reward Models for Test-Time Scaling in Multimodal Reasoning: Key Insights and Lessons Learned
por: Ong, Brandon, et al.
Publicado: (2025)
por: Ong, Brandon, et al.
Publicado: (2025)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning
por: Sun, Qi, et al.
Publicado: (2024)
por: Sun, Qi, et al.
Publicado: (2024)
The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzles
por: Toh, Vernon Y. H., et al.
Publicado: (2025)
por: Toh, Vernon Y. H., et al.
Publicado: (2025)
Are Language Models Puzzle Prodigies? Algorithmic Puzzles Unveil Serious Challenges in Multimodal Reasoning
por: Ghosal, Deepanway, et al.
Publicado: (2024)
por: Ghosal, Deepanway, et al.
Publicado: (2024)
M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Inference Time Alignment with Reward-Guided Tree Search
por: Hung, Chia-Yu, et al.
Publicado: (2024)
por: Hung, Chia-Yu, et al.
Publicado: (2024)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
Chain-of-Knowledge: Grounding Large Language Models via Dynamic Knowledge Adapting over Heterogeneous Sources
por: Li, Xingxuan, et al.
Publicado: (2023)
por: Li, Xingxuan, et al.
Publicado: (2023)
OffTopicEval: When Large Language Models Enter the Wrong Chat, Almost Always!
por: Lei, Jingdi, et al.
Publicado: (2025)
por: Lei, Jingdi, et al.
Publicado: (2025)
Domain-Expanded ASTE: Rethinking Generalization in Aspect Sentiment Triplet Extraction
por: Chia, Yew Ken, et al.
Publicado: (2023)
por: Chia, Yew Ken, et al.
Publicado: (2023)
NORA-1.5: A Vision-Language-Action Model Trained using World Model- and Action-based Preference Rewards
por: Hung, Chia-Yu, et al.
Publicado: (2025)
por: Hung, Chia-Yu, et al.
Publicado: (2025)
Measuring and Enhancing Trustworthiness of LLMs in RAG through Grounded Attributions and Learning to Refuse
por: Song, Maojia, et al.
Publicado: (2024)
por: Song, Maojia, et al.
Publicado: (2024)
PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control
por: Zhang, Shaozuo, et al.
Publicado: (2025)
por: Zhang, Shaozuo, et al.
Publicado: (2025)
Adaptive Layer Selection for Layer-Wise Token Pruning in LLM Inference
por: Taniguchi, Rei, et al.
Publicado: (2026)
por: Taniguchi, Rei, et al.
Publicado: (2026)
Exact Flow Linear Attention: Exact Solution from Continuous-Time Dynamics
por: Lei, Jingdi, et al.
Publicado: (2025)
por: Lei, Jingdi, et al.
Publicado: (2025)
Towards Robust Instruction Tuning on Multimodal Large Language Models
por: Han, Wei, et al.
Publicado: (2024)
por: Han, Wei, et al.
Publicado: (2024)
PREMISE: Matching-based Prediction for Accurate Review Recommendation
por: Han, Wei, et al.
Publicado: (2025)
por: Han, Wei, et al.
Publicado: (2025)
Video2Music: Suitable Music Generation from Videos using an Affective Multimodal Transformer model
por: Kang, Jaeyong, et al.
Publicado: (2023)
por: Kang, Jaeyong, et al.
Publicado: (2023)
JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment
por: Liu, Renhang, et al.
Publicado: (2025)
por: Liu, Renhang, et al.
Publicado: (2025)
Self-Adaptive Sampling for Efficient Video Question-Answering on Image--Text Models
por: Han, Wei, et al.
Publicado: (2023)
por: Han, Wei, et al.
Publicado: (2023)
Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics
por: Song, Maojia, et al.
Publicado: (2025)
por: Song, Maojia, et al.
Publicado: (2025)
Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
HyperTTS: Parameter Efficient Adaptation in Text to Speech using Hypernetworks
por: Li, Yingting, et al.
Publicado: (2024)
por: Li, Yingting, et al.
Publicado: (2024)
TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization
por: Hung, Chia-Yu, et al.
Publicado: (2024)
por: Hung, Chia-Yu, et al.
Publicado: (2024)
Leveraging Parameter-Efficient Transfer Learning for Multi-Lingual Text-to-Speech Adaptation
por: Li, Yingting, et al.
Publicado: (2024)
por: Li, Yingting, et al.
Publicado: (2024)
Beyond What to Select: A Plug-and-play Oscillatory Data-Volume Scheduling for Efficient Model Training
por: Yang, Suorong, et al.
Publicado: (2026)
por: Yang, Suorong, et al.
Publicado: (2026)
Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning
por: Badhe, Sanket, et al.
Publicado: (2026)
por: Badhe, Sanket, et al.
Publicado: (2026)
Stacked from One: Multi-Scale Self-Injection for Context Window Extension
por: Han, Wei, et al.
Publicado: (2026)
por: Han, Wei, et al.
Publicado: (2026)
Ruby Teaming: Improving Quality Diversity Search with Memory for Automated Red Teaming
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
por: Han, Vernon Toh Yan, et al.
Publicado: (2024)
Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models
por: Hazra, Rima, et al.
Publicado: (2024)
por: Hazra, Rima, et al.
Publicado: (2024)
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
por: Hazra, Rima, et al.
Publicado: (2024)
por: Hazra, Rima, et al.
Publicado: (2024)
Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning
por: Toh, Vernon Y. H., et al.
Publicado: (2024)
por: Toh, Vernon Y. H., et al.
Publicado: (2024)
Ejemplares similares
-
LLMs Can't Handle Peer Pressure: Crumbling under Multi-Agent Social Interactions
por: Song, Maojia, et al.
Publicado: (2025) -
Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision
por: Pala, Tej Deep, et al.
Publicado: (2025) -
DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling
por: Deep, Pala Tej, et al.
Publicado: (2024) -
Ferret: Faster and Effective Automated Red Teaming with Reward-Based Scoring Technique
por: Pala, Tej Deep, et al.
Publicado: (2024) -
Lessons from Training Grounded LLMs with Verifiable Rewards
por: Sim, Shang Hong, et al.
Publicado: (2025)