POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Zeju, Liu, Lixin, Weller, Adrian, Shi, Han, Liu, Weiyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Orthogonal Finetuning Made Scalable
di: Qiu, Zeju, et al.
Pubblicazione: (2025)
di: Qiu, Zeju, et al.
Pubblicazione: (2025)
Reparameterized LLM Training via Orthogonal Equivalence Transformation
di: Qiu, Zeju, et al.
Pubblicazione: (2025)
di: Qiu, Zeju, et al.
Pubblicazione: (2025)
Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization
di: Liu, Weiyang, et al.
Pubblicazione: (2023)
di: Liu, Weiyang, et al.
Pubblicazione: (2023)
Controlling Text-to-Image Diffusion by Orthogonal Finetuning
di: Qiu, Zeju, et al.
Pubblicazione: (2023)
di: Qiu, Zeju, et al.
Pubblicazione: (2023)
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
di: Li, Zeju, et al.
Pubblicazione: (2026)
di: Li, Zeju, et al.
Pubblicazione: (2026)
Can Large Language Models Understand Symbolic Graphics Programs?
di: Qiu, Zeju, et al.
Pubblicazione: (2024)
di: Qiu, Zeju, et al.
Pubblicazione: (2024)
Memory-Efficient LLM Training with Online Subspace Descent
di: Liang, Kaizhao, et al.
Pubblicazione: (2024)
di: Liang, Kaizhao, et al.
Pubblicazione: (2024)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
di: Xiao, Chaojun, et al.
Pubblicazione: (2024)
di: Xiao, Chaojun, et al.
Pubblicazione: (2024)
SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator
di: Chen, Guoxuan, et al.
Pubblicazione: (2024)
di: Chen, Guoxuan, et al.
Pubblicazione: (2024)
Harmony in Divergence: Towards Fast, Accurate, and Memory-efficient Zeroth-order LLM Fine-tuning
di: Tan, Qitao, et al.
Pubblicazione: (2025)
di: Tan, Qitao, et al.
Pubblicazione: (2025)
Mixture of Chapters: Scaling Learnt Memory in Transformers
di: Tibrewal, Tasmay Pankaj, et al.
Pubblicazione: (2026)
di: Tibrewal, Tasmay Pankaj, et al.
Pubblicazione: (2026)
MeKi: Memory-based Expert Knowledge Injection for Efficient LLM Scaling
di: Ding, Ning, et al.
Pubblicazione: (2026)
di: Ding, Ning, et al.
Pubblicazione: (2026)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
di: Nguyen, Dang, et al.
Pubblicazione: (2024)
ButterflyQuant: Ultra-low-bit LLM Quantization through Learnable Orthogonal Butterfly Transforms
di: Xu, Bingxin, et al.
Pubblicazione: (2025)
di: Xu, Bingxin, et al.
Pubblicazione: (2025)
KV Cache Transform Coding for Compact Storage in LLM Inference
di: Staniszewski, Konrad, et al.
Pubblicazione: (2025)
di: Staniszewski, Konrad, et al.
Pubblicazione: (2025)
Memory-efficient Energy-adaptive Inference of Pre-Trained Models on Batteryless Embedded Systems
di: Farina, Pietro, et al.
Pubblicazione: (2024)
di: Farina, Pietro, et al.
Pubblicazione: (2024)
Scaling with Collapse: Efficient and Predictable Training of LLM Families
di: Bergsma, Shane, et al.
Pubblicazione: (2025)
di: Bergsma, Shane, et al.
Pubblicazione: (2025)
Muon is Scalable for LLM Training
di: Liu, Jingyuan, et al.
Pubblicazione: (2025)
di: Liu, Jingyuan, et al.
Pubblicazione: (2025)
Training-Free Tokenizer Transplantation via Orthogonal Matching Pursuit
di: Goddard, Charles, et al.
Pubblicazione: (2025)
di: Goddard, Charles, et al.
Pubblicazione: (2025)
Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing
di: Lai, Kunfeng, et al.
Pubblicazione: (2025)
di: Lai, Kunfeng, et al.
Pubblicazione: (2025)
Selection of LLM Fine-Tuning Data based on Orthogonal Rules
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
di: Li, Xiaomin, et al.
Pubblicazione: (2024)
Think Before You Act: Decision Transformers with Working Memory
di: Kang, Jikun, et al.
Pubblicazione: (2023)
di: Kang, Jikun, et al.
Pubblicazione: (2023)
SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM Training
di: Huang, Tianjin, et al.
Pubblicazione: (2025)
di: Huang, Tianjin, et al.
Pubblicazione: (2025)
Emergence of Episodic Memory in Transformers: Characterizing Changes in Temporal Structure of Attention Scores During Training
di: Mistry, Deven Mahesh, et al.
Pubblicazione: (2025)
di: Mistry, Deven Mahesh, et al.
Pubblicazione: (2025)
BiLLM: Pushing the Limit of Post-Training Quantization for LLMs
di: Huang, Wei, et al.
Pubblicazione: (2024)
di: Huang, Wei, et al.
Pubblicazione: (2024)
TSO: Self-Training with Scaled Preference Optimization
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
di: Chen, Kaihui, et al.
Pubblicazione: (2024)
Your Finetuned Large Language Model is Already a Powerful Out-of-distribution Detector
di: Zhang, Andi, et al.
Pubblicazione: (2024)
di: Zhang, Andi, et al.
Pubblicazione: (2024)
CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
di: Weng, Yepeng, et al.
Pubblicazione: (2025)
ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory
di: Ho, Matthew, et al.
Pubblicazione: (2025)
di: Ho, Matthew, et al.
Pubblicazione: (2025)
An Evolved Universal Transformer Memory
di: Cetin, Edoardo, et al.
Pubblicazione: (2024)
di: Cetin, Edoardo, et al.
Pubblicazione: (2024)
Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
di: Cheng, Ruoxi, et al.
Pubblicazione: (2025)
FedEval-LLM: Federated Evaluation of Large Language Models on Downstream Tasks with Collective Wisdom
di: He, Yuanqin, et al.
Pubblicazione: (2024)
di: He, Yuanqin, et al.
Pubblicazione: (2024)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
di: Liu, Yixin, et al.
Pubblicazione: (2026)
di: Liu, Yixin, et al.
Pubblicazione: (2026)
OrthoRank: Token Selection via Sink Token Orthogonality for Efficient LLM inference
di: Shin, Seungjun, et al.
Pubblicazione: (2025)
di: Shin, Seungjun, et al.
Pubblicazione: (2025)
Transformer Copilot: Learning from The Mistake Log in LLM Fine-tuning
di: Zou, Jiaru, et al.
Pubblicazione: (2025)
di: Zou, Jiaru, et al.
Pubblicazione: (2025)
Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective
di: Gan, Zeyu, et al.
Pubblicazione: (2024)
di: Gan, Zeyu, et al.
Pubblicazione: (2024)
DINT Transformer
di: Cang, Yueyang, et al.
Pubblicazione: (2025)
di: Cang, Yueyang, et al.
Pubblicazione: (2025)
Rigidity-Aware Geometric Pretraining for Protein Design and Conformational Ensembles
di: Ni, Zhanghan, et al.
Pubblicazione: (2026)
di: Ni, Zhanghan, et al.
Pubblicazione: (2026)
Atom of Thoughts for Markov LLM Test-Time Scaling
di: Teng, Fengwei, et al.
Pubblicazione: (2025)
di: Teng, Fengwei, et al.
Pubblicazione: (2025)
Agentic Design of Compositional Machines
di: Zhang, Wenqian, et al.
Pubblicazione: (2025)
di: Zhang, Wenqian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Orthogonal Finetuning Made Scalable
di: Qiu, Zeju, et al.
Pubblicazione: (2025) -
Reparameterized LLM Training via Orthogonal Equivalence Transformation
di: Qiu, Zeju, et al.
Pubblicazione: (2025) -
Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization
di: Liu, Weiyang, et al.
Pubblicazione: (2023) -
Controlling Text-to-Image Diffusion by Orthogonal Finetuning
di: Qiu, Zeju, et al.
Pubblicazione: (2023) -
Latent Context Compilation: Distilling Long Context into Compact Portable Memory
di: Li, Zeju, et al.
Pubblicazione: (2026)