Enregistré dans:
| Auteurs principaux: | Sadhukhan, Ranajoy, Cao, Sheng, Dong, Harry, Zhao, Changsheng, Purpura-Pontoniere, Attiano, Tian, Yuandong, Liu, Zechun, Chen, Beidi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.10639 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Kinetics: Rethinking Test-Time Scaling Laws
par: Sadhukhan, Ranajoy, et autres
Publié: (2025)
par: Sadhukhan, Ranajoy, et autres
Publié: (2025)
Memory Mosaics
par: Zhang, Jianyu, et autres
Publié: (2024)
par: Zhang, Jianyu, et autres
Publié: (2024)
MagicPIG: LSH Sampling for Efficient LLM Generation
par: Chen, Zhuoming, et autres
Publié: (2024)
par: Chen, Zhuoming, et autres
Publié: (2024)
Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost
par: Cao, Sheng, et autres
Publié: (2025)
par: Cao, Sheng, et autres
Publié: (2025)
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
par: Tian, Yuandong, et autres
Publié: (2023)
par: Tian, Yuandong, et autres
Publié: (2023)
LoCoCo: Dropping In Convolutions for Long Context Compression
par: Cai, Ruisi, et autres
Publié: (2024)
par: Cai, Ruisi, et autres
Publié: (2024)
On the Surprising Effectiveness of Attention Transfer for Vision Transformers
par: Li, Alexander C., et autres
Publié: (2024)
par: Li, Alexander C., et autres
Publié: (2024)
GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection
par: Zhao, Jiawei, et autres
Publié: (2024)
par: Zhao, Jiawei, et autres
Publié: (2024)
TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference
par: Zhang, Zhenyu, et autres
Publié: (2025)
par: Zhang, Zhenyu, et autres
Publié: (2025)
Prompt-prompted Adaptive Structured Pruning for Efficient LLM Generation
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
SpinQuant: LLM quantization with learned rotations
par: Liu, Zechun, et autres
Publié: (2024)
par: Liu, Zechun, et autres
Publié: (2024)
Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokking
par: Tian, Yuandong
Publié: (2025)
par: Tian, Yuandong
Publié: (2025)
Scalable LLM Reasoning Acceleration with Low-rank Distillation
par: Dong, Harry, et autres
Publié: (2025)
par: Dong, Harry, et autres
Publié: (2025)
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
par: Liu, Zechun, et autres
Publié: (2024)
par: Liu, Zechun, et autres
Publié: (2024)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
par: Liu, Zechun, et autres
Publié: (2025)
par: Liu, Zechun, et autres
Publié: (2025)
Mini-Sequence Transformer: Optimizing Intermediate Memory for Long Sequences Training
par: Luo, Cheng, et autres
Publié: (2024)
par: Luo, Cheng, et autres
Publié: (2024)
Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference
par: Dong, Harry, et autres
Publié: (2024)
par: Dong, Harry, et autres
Publié: (2024)
Spectral Journey: How Transformers Predict the Shortest Path
par: Cohen, Andrew, et autres
Publié: (2025)
par: Cohen, Andrew, et autres
Publié: (2025)
Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?
par: Zheng, Haizhong, et autres
Publié: (2025)
par: Zheng, Haizhong, et autres
Publié: (2025)
Composing Global Solutions to Reasoning Tasks via Algebraic Objects in Neural Nets
par: Tian, Yuandong
Publié: (2024)
par: Tian, Yuandong
Publié: (2024)
GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection
par: Su, DiJia, et autres
Publié: (2025)
par: Su, DiJia, et autres
Publié: (2025)
Deep Think with Confidence
par: Fu, Yichao, et autres
Publié: (2025)
par: Fu, Yichao, et autres
Publié: (2025)
LLM-Assisted Content Conditional Debiasing for Fair Text Embedding
par: Deng, Wenlong, et autres
Publié: (2024)
par: Deng, Wenlong, et autres
Publié: (2024)
Learnable Community-Aware Transformer for Brain Connectome Analysis with Token Clustering
par: Yang, Yanting, et autres
Publié: (2024)
par: Yang, Yanting, et autres
Publié: (2024)
Neural Computers
par: Zhuge, Mingchen, et autres
Publié: (2026)
par: Zhuge, Mingchen, et autres
Publié: (2026)
The Path Not Taken: RLVR Provably Learns Off the Principals
par: Zhu, Hanqing, et autres
Publié: (2025)
par: Zhu, Hanqing, et autres
Publié: (2025)
Multiverse: Your Language Models Secretly Decide How to Parallelize and Merge Generation
par: Yang, Xinyu, et autres
Publié: (2025)
par: Yang, Xinyu, et autres
Publié: (2025)
APE: Faster and Longer Context-Augmented Generation via Adaptive Parallel Encoding
par: Yang, Xinyu, et autres
Publié: (2025)
par: Yang, Xinyu, et autres
Publié: (2025)
Sail into the Headwind: Alignment via Robust Rewards and Dynamic Labels against Reward Hacking
par: Rashidinejad, Paria, et autres
Publié: (2024)
par: Rashidinejad, Paria, et autres
Publié: (2024)
STEM: Unleashing the Power of Embeddings for Multi-task Recommendation
par: Su, Liangcai, et autres
Publié: (2023)
par: Su, Liangcai, et autres
Publié: (2023)
ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference
par: Sun, Hanshi, et autres
Publié: (2024)
par: Sun, Hanshi, et autres
Publié: (2024)
InRank: Incremental Low-Rank Learning
par: Zhao, Jiawei, et autres
Publié: (2023)
par: Zhao, Jiawei, et autres
Publié: (2023)
Few-shot Neural Architecture Search
par: Zhao, Yiyang, et autres
Publié: (2020)
par: Zhao, Yiyang, et autres
Publié: (2020)
WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points
par: Li, Dongyue, et autres
Publié: (2026)
par: Li, Dongyue, et autres
Publié: (2026)
A Principled Loss Function for Direct Language Model Alignment
par: Tan, Yuandong
Publié: (2025)
par: Tan, Yuandong
Publié: (2025)
Quantized Reasoning Models Think They Need to Think Longer, but They Do Not
par: Lotfi, Sanae, et autres
Publié: (2026)
par: Lotfi, Sanae, et autres
Publié: (2026)
TimeFormer: Transformer with Attention Modulation Empowered by Temporal Characteristics for Time Series Forecasting
par: Liu, Zhipeng, et autres
Publié: (2025)
par: Liu, Zhipeng, et autres
Publié: (2025)
Golden Ratio Search: A Low-Power Adversarial Attack for Deep Learning based Modulation Classification
par: Sadhukhan, Deepsayan, et autres
Publié: (2024)
par: Sadhukhan, Deepsayan, et autres
Publié: (2024)
Multi-objective Optimization by Learning Space Partitions
par: Zhao, Yiyang, et autres
Publié: (2021)
par: Zhao, Yiyang, et autres
Publié: (2021)
Documents similaires
-
Kinetics: Rethinking Test-Time Scaling Laws
par: Sadhukhan, Ranajoy, et autres
Publié: (2025) -
Memory Mosaics
par: Zhang, Jianyu, et autres
Publié: (2024) -
MagicPIG: LSH Sampling for Efficient LLM Generation
par: Chen, Zhuoming, et autres
Publié: (2024) -
Param$Δ$ for Direct Weight Mixing: Post-Train Large Language Model at Zero Cost
par: Cao, Sheng, et autres
Publié: (2025) -
JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention
par: Tian, Yuandong, et autres
Publié: (2023)