Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Mingze, Zhu, Shuchen, Fang, Yuxin, Li, Binghui, Shen, Kai, Zhong, Shu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations
von: Wang, Mingze, et al.
Veröffentlicht: (2026)
von: Wang, Mingze, et al.
Veröffentlicht: (2026)
Graph Neural Network Causal Explanation via Neural Causal Models
von: Behnam, Arman, et al.
Veröffentlicht: (2024)
von: Behnam, Arman, et al.
Veröffentlicht: (2024)
On the Non-Identifiability of Steering Vectors in Large Language Models
von: Venkatesh, Sohan, et al.
Veröffentlicht: (2026)
von: Venkatesh, Sohan, et al.
Veröffentlicht: (2026)
RealTCD: Temporal Causal Discovery from Interventional Data with Large Language Model
von: Li, Peiwen, et al.
Veröffentlicht: (2024)
von: Li, Peiwen, et al.
Veröffentlicht: (2024)
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
von: Shu, Yao, et al.
Veröffentlicht: (2024)
von: Shu, Yao, et al.
Veröffentlicht: (2024)
Scaling and Transferability of Annealing Strategies in Large Language Model Training
von: Wang, Siqi, et al.
Veröffentlicht: (2025)
von: Wang, Siqi, et al.
Veröffentlicht: (2025)
PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models
von: Meng, Fanxu, et al.
Veröffentlicht: (2024)
von: Meng, Fanxu, et al.
Veröffentlicht: (2024)
Measure-Theoretic Anti-Causal Representation Learning
von: Behnam, Arman, et al.
Veröffentlicht: (2025)
von: Behnam, Arman, et al.
Veröffentlicht: (2025)
Identifying Backdoored Graphs in Graph Neural Network Training: An Explanation-Based Approach with Novel Metrics
von: Downer, Jane, et al.
Veröffentlicht: (2024)
von: Downer, Jane, et al.
Veröffentlicht: (2024)
Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models
von: Das, Rocktim Jyoti, et al.
Veröffentlicht: (2023)
von: Das, Rocktim Jyoti, et al.
Veröffentlicht: (2023)
DecepChain: Inducing Deceptive Reasoning in Large Language Models
von: Shen, Wei, et al.
Veröffentlicht: (2025)
von: Shen, Wei, et al.
Veröffentlicht: (2025)
When AI Levels the Playing Field: Skill Homogenization, Asset Concentration, and Two Regimes of Inequality
von: Chen, Xupeng, et al.
Veröffentlicht: (2026)
von: Chen, Xupeng, et al.
Veröffentlicht: (2026)
Doubly Robust Alignment for Large Language Models
von: Xu, Erhan, et al.
Veröffentlicht: (2025)
von: Xu, Erhan, et al.
Veröffentlicht: (2025)
Symmetric Pruning of Large Language Models
von: Yi, Kai, et al.
Veröffentlicht: (2025)
von: Yi, Kai, et al.
Veröffentlicht: (2025)
Enhancing Large Language Models for Time-Series Forecasting via Vector-Injected In-Context Learning
von: Zhang, Jianqi, et al.
Veröffentlicht: (2026)
von: Zhang, Jianqi, et al.
Veröffentlicht: (2026)
Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
von: Wang, Chaoqi, et al.
Veröffentlicht: (2025)
Hierarchical Federated Unlearning for Large Language Models
von: Zhong, Yisheng, et al.
Veröffentlicht: (2025)
von: Zhong, Yisheng, et al.
Veröffentlicht: (2025)
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
von: Zhou, Runlong, et al.
Veröffentlicht: (2025)
von: Zhou, Runlong, et al.
Veröffentlicht: (2025)
Graffe: Graph Representation Learning via Diffusion Probabilistic Models
von: Chen, Dingshuo, et al.
Veröffentlicht: (2025)
von: Chen, Dingshuo, et al.
Veröffentlicht: (2025)
Wukong: Towards a Scaling Law for Large-Scale Recommendation
von: Zhang, Buyun, et al.
Veröffentlicht: (2024)
von: Zhang, Buyun, et al.
Veröffentlicht: (2024)
LLM4XCE: Large Language Models for Extremely Large-Scale Massive MIMO Channel Estimation
von: Li, Renbin, et al.
Veröffentlicht: (2025)
von: Li, Renbin, et al.
Veröffentlicht: (2025)
Scaling Laws Across Model Architectures: A Comparative Analysis of Dense and MoE Models in Large Language Models
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
von: Wang, Siqi, et al.
Veröffentlicht: (2024)
Scaling Capability in Token Space: An Analysis of Large Vision Language Model
von: Li, Tenghui, et al.
Veröffentlicht: (2024)
von: Li, Tenghui, et al.
Veröffentlicht: (2024)
PCDVQ: Enhancing Vector Quantization for Large Language Models via Polar Coordinate Decoupling
von: Yue, Yuxuan, et al.
Veröffentlicht: (2025)
von: Yue, Yuxuan, et al.
Veröffentlicht: (2025)
Revealing Multimodal Causality with Large Language Models
von: Li, Jin, et al.
Veröffentlicht: (2025)
von: Li, Jin, et al.
Veröffentlicht: (2025)
Taming the Real-world Complexities in CPT E/M Coding with Large Language Models
von: Nassar, Islam, et al.
Veröffentlicht: (2025)
von: Nassar, Islam, et al.
Veröffentlicht: (2025)
Memory-Efficient Gradient Unrolling for Large-Scale Bi-level Optimization
von: Shen, Qianli, et al.
Veröffentlicht: (2024)
von: Shen, Qianli, et al.
Veröffentlicht: (2024)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
von: Wang, Jian, et al.
Veröffentlicht: (2025)
von: Wang, Jian, et al.
Veröffentlicht: (2025)
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
von: Li, Xiaozhe, et al.
Veröffentlicht: (2025)
von: Li, Xiaozhe, et al.
Veröffentlicht: (2025)
SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models
von: Zhu, Hourun, et al.
Veröffentlicht: (2025)
von: Zhu, Hourun, et al.
Veröffentlicht: (2025)
AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning
von: Fu, Wei, et al.
Veröffentlicht: (2025)
von: Fu, Wei, et al.
Veröffentlicht: (2025)
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
von: Jin, Haoran, et al.
Veröffentlicht: (2025)
The sample complexity of multi-distribution learning
von: Peng, Binghui
Veröffentlicht: (2023)
von: Peng, Binghui
Veröffentlicht: (2023)
Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning
von: Ye, Kai, et al.
Veröffentlicht: (2025)
von: Ye, Kai, et al.
Veröffentlicht: (2025)
Beam Prediction based on Large Language Models
von: Sheng, Yucheng, et al.
Veröffentlicht: (2024)
von: Sheng, Yucheng, et al.
Veröffentlicht: (2024)
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
von: Wang, Weida, et al.
Veröffentlicht: (2025)
von: Wang, Weida, et al.
Veröffentlicht: (2025)
Tequila: Trapping-free Ternary Quantization for Large Language Models
von: Huang, Hong, et al.
Veröffentlicht: (2025)
von: Huang, Hong, et al.
Veröffentlicht: (2025)
Large Language Model Compression with Global Rank and Sparsity Optimization
von: Zhou, Changhai, et al.
Veröffentlicht: (2025)
von: Zhou, Changhai, et al.
Veröffentlicht: (2025)
Recurrent Diffusion for Large-Scale Parameter Generation
von: Wang, Kai, et al.
Veröffentlicht: (2025)
von: Wang, Kai, et al.
Veröffentlicht: (2025)
S$^2$ALM: Sequence-Structure Pre-trained Large Language Model for Comprehensive Antibody Representation Learning
von: Yin, Mingze, et al.
Veröffentlicht: (2024)
von: Yin, Mingze, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations
von: Wang, Mingze, et al.
Veröffentlicht: (2026) -
Graph Neural Network Causal Explanation via Neural Causal Models
von: Behnam, Arman, et al.
Veröffentlicht: (2024) -
On the Non-Identifiability of Steering Vectors in Large Language Models
von: Venkatesh, Sohan, et al.
Veröffentlicht: (2026) -
RealTCD: Temporal Causal Discovery from Interventional Data with Large Language Model
von: Li, Peiwen, et al.
Veröffentlicht: (2024) -
Ferret: Federated Full-Parameter Tuning at Scale for Large Language Models
von: Shu, Yao, et al.
Veröffentlicht: (2024)