Sigma: Differential Rescaling of Query, Key and Value for Efficient Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zhenghao, Tang, Zihao, Liu, Xiao, Gong, Yeyun, Cheng, Yi, Chen, Qi, Li, Hang, Xin, Ying, Yang, Ziyue, Yang, Kailai, Yan, Yu, Liang, Xiao, Lu, Shuai, Huang, Yiming, Luo, Zheheng, Qu, Lei, Feng, Xuan, Wang, Yaoxiang, Xia, Yuqing, Chen, Feiyang, Jiang, Yuting, Hu, Yasen, Ni, Hao, Li, Binyang, Zhao, Guoshuai, Chiang, Jui-Hao, Guo, Zhongxin, Lin, Chen, Kuang, Kun, Li, Wenjie, Shen, Yelong, Jiao, Jian, Cheng, Peng, Yang, Mao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sigma-MoE-Tiny Technical Report
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
di: Hu, Qingguo, et al.
Pubblicazione: (2025)
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
di: Yang, Kailai, et al.
Pubblicazione: (2025)
di: Yang, Kailai, et al.
Pubblicazione: (2025)
Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
Optimizing Large Language Model Training Using FP4 Quantization
di: Wang, Ruizhe, et al.
Pubblicazione: (2025)
di: Wang, Ruizhe, et al.
Pubblicazione: (2025)
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
di: Chen, Zijie, et al.
Pubblicazione: (2026)
di: Chen, Zijie, et al.
Pubblicazione: (2026)
Rho-1: Not All Tokens Are What You Need
di: Lin, Zhenghao, et al.
Pubblicazione: (2024)
di: Lin, Zhenghao, et al.
Pubblicazione: (2024)
SIGMA: An AI-Empowered Training Stack on Early-Life Hardware
di: Qu, Lei, et al.
Pubblicazione: (2025)
di: Qu, Lei, et al.
Pubblicazione: (2025)
Gold-Medal-Level Olympiad Geometry Solving with Efficient Heuristic Auxiliary Constructions
di: Duan, Boyan, et al.
Pubblicazione: (2025)
di: Duan, Boyan, et al.
Pubblicazione: (2025)
Competition-Level Problems are Effective LLM Evaluators
di: Huang, Yiming, et al.
Pubblicazione: (2023)
di: Huang, Yiming, et al.
Pubblicazione: (2023)
Training Matryoshka Mixture-of-Experts for Elastic Inference-Time Expert Utilization
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Effect of vertical stiffeners on the seismic performance of T‐shaped CFST column to steel beam joint
di: Binyang Li, et al.
Pubblicazione: (2024)
di: Binyang Li, et al.
Pubblicazione: (2024)
Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection
di: He, Hongyi, et al.
Pubblicazione: (2025)
di: He, Hongyi, et al.
Pubblicazione: (2025)
Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
di: Liang, Xiao, et al.
Pubblicazione: (2026)
di: Liang, Xiao, et al.
Pubblicazione: (2026)
Ensuring Safe and High-Quality Outputs: A Guideline Library Approach for Language Models
di: Luo, Yi, et al.
Pubblicazione: (2024)
di: Luo, Yi, et al.
Pubblicazione: (2024)
Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts
di: Wang, Ruizhe, et al.
Pubblicazione: (2025)
di: Wang, Ruizhe, et al.
Pubblicazione: (2025)
Beyond Prompt Content: Enhancing LLM Performance via Content-Format Integrated Prompt Optimization
di: Liu, Yuanye, et al.
Pubblicazione: (2025)
di: Liu, Yuanye, et al.
Pubblicazione: (2025)
ResVR: Joint Rescaling and Viewport Rendering of Omnidirectional Images
di: Li, Weiqi, et al.
Pubblicazione: (2024)
di: Li, Weiqi, et al.
Pubblicazione: (2024)
Generalized Mazur Patterns and Immersed Heegaard Floer Homology
di: Patwardhan, Jay, et al.
Pubblicazione: (2024)
di: Patwardhan, Jay, et al.
Pubblicazione: (2024)
CIBM: A Clustering Algorithm for Multi‐Layer Network via Rescaled Interlacing Balance Measure
di: Xiyue Zhu, et al.
Pubblicazione: (2026)
di: Xiyue Zhu, et al.
Pubblicazione: (2026)
Experiences of Returning to Work Among Nurses With a Diagnosis of Cancer: A Qualitative Descriptive Study
di: Xiao‐Chen Lyu, et al.
Pubblicazione: (2025)
di: Xiao‐Chen Lyu, et al.
Pubblicazione: (2025)
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2024)
di: Huang, Yiming, et al.
Pubblicazione: (2024)
Exploring the Mystery of Influential Data for Mathematical Reasoning
di: Ni, Xinzhe, et al.
Pubblicazione: (2024)
di: Ni, Xinzhe, et al.
Pubblicazione: (2024)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Enhancing Chain-of-Thoughts Prompting with Iterative Bootstrapping in Large Language Models
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
LayerNorm Induces Recency Bias in Transformer Decoders
di: Kim, Junu, et al.
Pubblicazione: (2025)
di: Kim, Junu, et al.
Pubblicazione: (2025)
Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
di: Deng, Haoran, et al.
Pubblicazione: (2025)
di: Deng, Haoran, et al.
Pubblicazione: (2025)
SPFresh: Incremental In-Place Update for Billion-Scale Vector Search
di: Xu, Yuming, et al.
Pubblicazione: (2024)
di: Xu, Yuming, et al.
Pubblicazione: (2024)
Process-based Self-Rewarding Language Models
di: Zhang, Shimao, et al.
Pubblicazione: (2025)
di: Zhang, Shimao, et al.
Pubblicazione: (2025)
EpiCoder: Encompassing Diversity and Complexity in Code Generation
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
Low-Rank Rescaled Vision Transformer Fine-Tuning: A Residual Design Approach
di: Dong, Wei, et al.
Pubblicazione: (2024)
di: Dong, Wei, et al.
Pubblicazione: (2024)
Rescaled expansive measures for flows
di: Yang, Yun
Pubblicazione: (2025)
di: Yang, Yun
Pubblicazione: (2025)
Enhancing Large Language Model Performance with Gradient-Based Parameter Selection
di: Li, Haoling, et al.
Pubblicazione: (2024)
di: Li, Haoling, et al.
Pubblicazione: (2024)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing
di: Yang, Hao, et al.
Pubblicazione: (2026)
di: Yang, Hao, et al.
Pubblicazione: (2026)
Iterative Online Image Synthesis via Diffusion Model for Imbalanced Classification
di: Li, Shuhan, et al.
Pubblicazione: (2024)
di: Li, Shuhan, et al.
Pubblicazione: (2024)
Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models
di: Zhang, Xin, et al.
Pubblicazione: (2026)
di: Zhang, Xin, et al.
Pubblicazione: (2026)
DeepThink: Aligning Language Models with Domain-Specific User Intents
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
Score $\times$ Decoder: A Unified View of Unsupervised Inference-Time Scaling for Hallucination Mitigation
di: Cheng, Yun-Chen, et al.
Pubblicazione: (2026)
di: Cheng, Yun-Chen, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Sigma-MoE-Tiny Technical Report
di: Hu, Qingguo, et al.
Pubblicazione: (2025) -
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
di: Yang, Kailai, et al.
Pubblicazione: (2025) -
Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training
di: Luo, Zheheng, et al.
Pubblicazione: (2024) -
Optimizing Large Language Model Training Using FP4 Quantization
di: Wang, Ruizhe, et al.
Pubblicazione: (2025) -
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
di: Chen, Zijie, et al.
Pubblicazione: (2026)