Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Mingze, Zhu, Shuchen, Fang, Yuxin, Li, Binghui, Shen, Kai, Zhong, Shu |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations
by: Wang, Mingze, et al.
Published: (2026)
by: Wang, Mingze, et al.
Published: (2026)
Graph Neural Network Causal Explanation via Neural Causal Models
by: Behnam, Arman, et al.
Published: (2024)
by: Behnam, Arman, et al.
Published: (2024)
On the Non-Identifiability of Steering Vectors in Large Language Models
by: Venkatesh, Sohan, et al.
Published: (2026)
by: Venkatesh, Sohan, et al.
Published: (2026)
RealTCD: Temporal Causal Discovery from Interventional Data with Large Language Model
by: Li, Peiwen, et al.
Published: (2024)
by: Li, Peiwen, et al.
Published: (2024)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
by: Shu, Yao, et al.
Published: (2024)
by: Shu, Yao, et al.
Published: (2024)
Scaling and Transferability of Annealing Strategies in Large Language Model Training
by: Wang, Siqi, et al.
Published: (2025)
by: Wang, Siqi, et al.
Published: (2025)
PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models
by: Meng, Fanxu, et al.
Published: (2024)
by: Meng, Fanxu, et al.
Published: (2024)
Measure-Theoretic Anti-Causal Representation Learning
by: Behnam, Arman, et al.
Published: (2025)
by: Behnam, Arman, et al.
Published: (2025)
Identifying Backdoored Graphs in Graph Neural Network Training: An Explanation-Based Approach with Novel Metrics
by: Downer, Jane, et al.
Published: (2024)
by: Downer, Jane, et al.
Published: (2024)
Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models
by: Das, Rocktim Jyoti, et al.
Published: (2023)
by: Das, Rocktim Jyoti, et al.
Published: (2023)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
by: Shen, Wei, et al.
Published: (2025)
by: Shen, Wei, et al.
Published: (2025)
When AI Levels the Playing Field: Skill Homogenization, Asset Concentration, and Two Regimes of Inequality
by: Chen, Xupeng, et al.
Published: (2026)
by: Chen, Xupeng, et al.
Published: (2026)
Doubly Robust Alignment for Large Language Models
by: Xu, Erhan, et al.
Published: (2025)
by: Xu, Erhan, et al.
Published: (2025)
Symmetric Pruning of Large Language Models
by: Yi, Kai, et al.
Published: (2025)
by: Yi, Kai, et al.
Published: (2025)
Enhancing Large Language Models for Time-Series Forecasting via Vector-Injected In-Context Learning
by: Zhang, Jianqi, et al.
Published: (2026)
by: Zhang, Jianqi, et al.
Published: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
by: Wang, Chaoqi, et al.
Published: (2025)
by: Wang, Chaoqi, et al.
Published: (2025)
Hierarchical Federated Unlearning for Large Language Models
by: Zhong, Yisheng, et al.
Published: (2025)
by: Zhong, Yisheng, et al.
Published: (2025)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
by: Zhou, Runlong, et al.
Published: (2025)
by: Zhou, Runlong, et al.
Published: (2025)
Graffe: Graph Representation Learning via Diffusion Probabilistic Models
by: Chen, Dingshuo, et al.
Published: (2025)
by: Chen, Dingshuo, et al.
Published: (2025)
Wukong: Towards a Scaling Law for Large-Scale Recommendation
by: Zhang, Buyun, et al.
Published: (2024)
by: Zhang, Buyun, et al.
Published: (2024)
LLM4XCE: Large Language Models for Extremely Large-Scale Massive MIMO Channel Estimation
by: Li, Renbin, et al.
Published: (2025)
by: Li, Renbin, et al.
Published: (2025)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
by: Wang, Siqi, et al.
Published: (2024)
by: Wang, Siqi, et al.
Published: (2024)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
by: Li, Tenghui, et al.
Published: (2024)
by: Li, Tenghui, et al.
Published: (2024)
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling
by: Yue, Yuxuan, et al.
Published: (2025)
by: Yue, Yuxuan, et al.
Published: (2025)
Revealing Multimodal Causality with Large Language Models
by: Li, Jin, et al.
Published: (2025)
by: Li, Jin, et al.
Published: (2025)
Taming the Real-world Complexities in CPT E/M Coding with Large Language Models
by: Nassar, Islam, et al.
Published: (2025)
by: Nassar, Islam, et al.
Published: (2025)
Memory-Efficient Gradient Unrolling for Large-Scale Bi-level Optimization
by: Shen, Qianli, et al.
Published: (2024)
by: Shen, Qianli, et al.
Published: (2024)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
by: Wang, Jian, et al.
Published: (2025)
by: Wang, Jian, et al.
Published: (2025)
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
by: Li, Xiaozhe, et al.
Published: (2025)
by: Li, Xiaozhe, et al.
Published: (2025)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
by: Zhu, Hourun, et al.
Published: (2025)
by: Zhu, Hourun, et al.
Published: (2025)
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
by: Fu, Wei, et al.
Published: (2025)
by: Fu, Wei, et al.
Published: (2025)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
by: Jin, Haoran, et al.
Published: (2025)
by: Jin, Haoran, et al.
Published: (2025)
The sample complexity of multi-distribution learning
by: Peng, Binghui
Published: (2023)
by: Peng, Binghui
Published: (2023)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
by: Ye, Kai, et al.
Published: (2025)
by: Ye, Kai, et al.
Published: (2025)
Beam Prediction based on Large Language Models
by: Sheng, Yucheng, et al.
Published: (2024)
by: Sheng, Yucheng, et al.
Published: (2024)
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
by: Wang, Weida, et al.
Published: (2025)
by: Wang, Weida, et al.
Published: (2025)
Tequila: Trapping-free Ternary Quantization for Large Language Models
by: Huang, Hong, et al.
Published: (2025)
by: Huang, Hong, et al.
Published: (2025)
Large Language Model Compression with Global Rank and Sparsity Optimization
by: Zhou, Changhai, et al.
Published: (2025)
by: Zhou, Changhai, et al.
Published: (2025)
Recurrent Diffusion for Large-Scale Parameter Generation
by: Wang, Kai, et al.
Published: (2025)
by: Wang, Kai, et al.
Published: (2025)
S$^2$ALM: Sequence-Structure Pre-trained Large Language Model for Comprehensive Antibody Representation Learning
by: Yin, Mingze, et al.
Published: (2024)
by: Yin, Mingze, et al.
Published: (2024)
Similar Items
-
More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations
by: Wang, Mingze, et al.
Published: (2026) -
Graph Neural Network Causal Explanation via Neural Causal Models
by: Behnam, Arman, et al.
Published: (2024) -
On the Non-Identifiability of Steering Vectors in Large Language Models
by: Venkatesh, Sohan, et al.
Published: (2026) -
RealTCD: Temporal Causal Discovery from Interventional Data with Large Language Model
by: Li, Peiwen, et al.
Published: (2024) -
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
by: Shu, Yao, et al.
Published: (2024)