A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Goel, Raghavv, Garrepalli, Risheek, Agrawal, Sudhanshu, Lott, Chris, Lee, Mingu, Porikli, Fatih |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
par: Agrawal, Sudhanshu, et autres
Publié: (2025)
par: Agrawal, Sudhanshu, et autres
Publié: (2025)
ConFu: Contemplate the Future for Better Speculative Sampling
par: Qin, Zongyue, et autres
Publié: (2026)
par: Qin, Zongyue, et autres
Publié: (2026)
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024)
par: Goel, Raghavv, et autres
Publié: (2024)
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
par: Goel, Raghavv, et autres
Publié: (2025)
par: Goel, Raghavv, et autres
Publié: (2025)
DDIL: Diversity Enhancing Diffusion Distillation With Imitation Learning
par: Garrepalli, Risheek, et autres
Publié: (2024)
par: Garrepalli, Risheek, et autres
Publié: (2024)
Efficient Training-Free Multi-Token Prediction via Embedding-Space Probing
par: Goel, Raghavv, et autres
Publié: (2026)
par: Goel, Raghavv, et autres
Publié: (2026)
On Speculative Decoding for Multimodal Large Language Models
par: Gagrani, Mukul, et autres
Publié: (2024)
par: Gagrani, Mukul, et autres
Publié: (2024)
MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing
par: Kadambi, Shreya, et autres
Publié: (2025)
par: Kadambi, Shreya, et autres
Publié: (2025)
AdaEDL: Early Draft Stopping for Speculative Decoding of Large Language Models via an Entropy-based Lower Bound on Token Acceptance Probability
par: Agrawal, Sudhanshu, et autres
Publié: (2024)
par: Agrawal, Sudhanshu, et autres
Publié: (2024)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
par: Jeon, Wonseok, et autres
Publié: (2024)
par: Jeon, Wonseok, et autres
Publié: (2024)
Layer-wise Representation Dynamics: An Empirical Investigation Across Embedders and Base LLMs
par: Jiang, Jingzhou, et autres
Publié: (2026)
par: Jiang, Jingzhou, et autres
Publié: (2026)
Internal Chain-of-Thought: Empirical Evidence for Layer-wise Subtask Scheduling in LLMs
par: Yang, Zhipeng, et autres
Publié: (2025)
par: Yang, Zhipeng, et autres
Publié: (2025)
On the Effect of Uncertainty on Layer-wise Inference Dynamics
par: Kim, Sunwoo, et autres
Publié: (2025)
par: Kim, Sunwoo, et autres
Publié: (2025)
Clockwork Diffusion: Efficient Generation With Model-Step Distillation
par: Habibian, Amirhossein, et autres
Publié: (2023)
par: Habibian, Amirhossein, et autres
Publié: (2023)
MAMo: Leveraging Memory and Attention for Monocular Video Depth Estimation
par: Yasarla, Rajeev, et autres
Publié: (2023)
par: Yasarla, Rajeev, et autres
Publié: (2023)
SoftLMs: Efficient Adaptive Low-Rank Approximation of Language Models using Soft-Thresholding Mechanism
par: Bhatnagar, Priyansh, et autres
Publié: (2024)
par: Bhatnagar, Priyansh, et autres
Publié: (2024)
Iterative Layer-wise Distillation for Efficient Compression of Large Language Models
par: Kovalev, Grigory, et autres
Publié: (2025)
par: Kovalev, Grigory, et autres
Publié: (2025)
Masks Can Be Distracting: On Context Comprehension in Diffusion Language Models
par: Piskorz, Julianna, et autres
Publié: (2025)
par: Piskorz, Julianna, et autres
Publié: (2025)
Relaxed Recursive Transformers: Effective Parameter Sharing with Layer-wise LoRA
par: Bae, Sangmin, et autres
Publié: (2024)
par: Bae, Sangmin, et autres
Publié: (2024)
Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate
par: Bochkov, A.
Publié: (2025)
par: Bochkov, A.
Publié: (2025)
On the Representational Capacity of Recurrent Neural Language Models
par: Nowak, Franz, et autres
Publié: (2023)
par: Nowak, Franz, et autres
Publié: (2023)
CoT-UQ: Improving Response-wise Uncertainty Quantification in LLMs with Chain-of-Thought
par: Zhang, Boxuan, et autres
Publié: (2025)
par: Zhang, Boxuan, et autres
Publié: (2025)
SciFlow: Empowering Lightweight Optical Flow Models with Self-Cleaning Iterations
par: Lin, Jamie Menjay, et autres
Publié: (2024)
par: Lin, Jamie Menjay, et autres
Publié: (2024)
OCAI: Improving Optical Flow Estimation by Occlusion and Consistency Aware Interpolation
par: Jeong, Jisoo, et autres
Publié: (2024)
par: Jeong, Jisoo, et autres
Publié: (2024)
MultiSiam: A Multiple Input Siamese Network For Social Media Text Classification And Duplicate Text Detection
par: Bhoi, Sudhanshu, et autres
Publié: (2024)
par: Bhoi, Sudhanshu, et autres
Publié: (2024)
Bridging the Dimensional Chasm: Uncover Layer-wise Dimensional Reduction in Transformers through Token Correlation
par: Song, Zhuo-Yang, et autres
Publié: (2025)
par: Song, Zhuo-Yang, et autres
Publié: (2025)
Paying Attention to Facts: Quantifying the Knowledge Capacity of Attention Layers
par: Wong, Liang Ze
Publié: (2025)
par: Wong, Liang Ze
Publié: (2025)
You Do Not Fully Utilize Transformer's Representation Capacity
par: Gerasimov, Gleb, et autres
Publié: (2025)
par: Gerasimov, Gleb, et autres
Publié: (2025)
PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training
par: Zhu, Dawei, et autres
Publié: (2023)
par: Zhu, Dawei, et autres
Publié: (2023)
LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs
par: Souibgui, Mohamed Ali, et autres
Publié: (2026)
par: Souibgui, Mohamed Ali, et autres
Publié: (2026)
SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget
par: Wang, Zihao, et autres
Publié: (2024)
par: Wang, Zihao, et autres
Publié: (2024)
LEAP: Layer-wise Exit-Aware Pretraining for Efficient Transformer Inference
par: Kapadia, Shashank, et autres
Publié: (2026)
par: Kapadia, Shashank, et autres
Publié: (2026)
Can Knowledge Graphs Reduce Hallucinations in LLMs? : A Survey
par: Agrawal, Garima, et autres
Publié: (2023)
par: Agrawal, Garima, et autres
Publié: (2023)
GRASS: Gradient-based Adaptive Layer-wise Importance Sampling for Memory-efficient Large Language Model Fine-tuning
par: Tian, Kaiyuan, et autres
Publié: (2026)
par: Tian, Kaiyuan, et autres
Publié: (2026)
Layer-wise Importance Matters: Less Memory for Better Performance in Parameter-efficient Fine-tuning of Large Language Models
par: Yao, Kai, et autres
Publié: (2024)
par: Yao, Kai, et autres
Publié: (2024)
MaskPrune: Mask-based LLM Pruning for Layer-wise Uniform Structures
par: Qin, Jiayu, et autres
Publié: (2025)
par: Qin, Jiayu, et autres
Publié: (2025)
SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration
par: Wen, Zhuofan, et autres
Publié: (2026)
par: Wen, Zhuofan, et autres
Publié: (2026)
The Effectiveness of LLMs as Annotators: A Comparative Overview and Empirical Analysis of Direct Representation
par: Pavlovic, Maja, et autres
Publié: (2024)
par: Pavlovic, Maja, et autres
Publié: (2024)
Beyond Outliers: A Data-Free Layer-wise Mixed-Precision Quantization Approach Driven by Numerical and Structural Dual-Sensitivity
par: Zhang, Hengyuan, et autres
Publié: (2026)
par: Zhang, Hengyuan, et autres
Publié: (2026)
Documents similaires
-
Spiffy: Multiplying Diffusion LLM Acceleration via Lossless Speculative Decoding
par: Agrawal, Sudhanshu, et autres
Publié: (2025) -
ConFu: Contemplate the Future for Better Speculative Sampling
par: Qin, Zongyue, et autres
Publié: (2026) -
VOCABTRIM: Vocabulary Pruning for Efficient Speculative Decoding in LLMs
par: Goel, Raghavv, et autres
Publié: (2025) -
Direct Alignment of Draft Model for Speculative Decoding with Chat-Fine-Tuned LLMs
par: Goel, Raghavv, et autres
Publié: (2024) -
CAOTE: KV Cache Selection for LLMs via Attention Output Error-Based Token Eviction
par: Goel, Raghavv, et autres
Publié: (2025)