Linear Representation Transferability Hypothesis: Leveraging Small Models to Steer Large Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Bello, Femi, Das, Anubrata, Zeng, Fanzhi, Yin, Fangcong, Leqi, Liu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Curriculum Learning-Guided Progressive Distillation in Large Language Models
von: Cao, Jincheng, et al.
Veröffentlicht: (2026)
von: Cao, Jincheng, et al.
Veröffentlicht: (2026)
The Linear Representation Hypothesis and the Geometry of Large Language Models
von: Park, Kiho, et al.
Veröffentlicht: (2023)
von: Park, Kiho, et al.
Veröffentlicht: (2023)
Compositional Steering of Large Language Models with Steering Tokens
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026)
Prompting Fairness: Integrating Causality to Debias Large Language Models
von: Li, Jingling, et al.
Veröffentlicht: (2024)
von: Li, Jingling, et al.
Veröffentlicht: (2024)
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
von: Yuan, Hui, et al.
Veröffentlicht: (2024)
von: Yuan, Hui, et al.
Veröffentlicht: (2024)
Hypothesis Generation with Large Language Models
von: Zhou, Yangqiaoyu, et al.
Veröffentlicht: (2024)
von: Zhou, Yangqiaoyu, et al.
Veröffentlicht: (2024)
Token-Efficient Leverage Learning in Large Language Models
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
von: Zeng, Yuanhao, et al.
Veröffentlicht: (2024)
CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
von: Li, Shuozhe, et al.
Veröffentlicht: (2026)
Personalized Language Modeling from Personalized Human Feedback
von: Li, Xinyu, et al.
Veröffentlicht: (2024)
von: Li, Xinyu, et al.
Veröffentlicht: (2024)
Beyond Linear Steering: Unified Multi-Attribute Control for Language Models
von: Oozeer, Narmeen, et al.
Veröffentlicht: (2025)
von: Oozeer, Narmeen, et al.
Veröffentlicht: (2025)
The Consistency Hypothesis in Uncertainty Quantification for Large Language Models
von: Xiao, Quan, et al.
Veröffentlicht: (2025)
von: Xiao, Quan, et al.
Veröffentlicht: (2025)
Steering Large Language Models for Machine Translation Personalization
von: Scalena, Daniel, et al.
Veröffentlicht: (2025)
von: Scalena, Daniel, et al.
Veröffentlicht: (2025)
COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics
von: Sharma, Kartik, et al.
Veröffentlicht: (2026)
von: Sharma, Kartik, et al.
Veröffentlicht: (2026)
Learning Composable Chains-of-Thought
von: Yin, Fangcong, et al.
Veröffentlicht: (2025)
von: Yin, Fangcong, et al.
Veröffentlicht: (2025)
SteeringSafety: A Systematic Safety Evaluation Framework of Representation Steering in LLMs
von: Siu, Vincent, et al.
Veröffentlicht: (2025)
von: Siu, Vincent, et al.
Veröffentlicht: (2025)
FineSteer: A Unified Framework for Fine-Grained Inference-Time Steering in Large Language Models
von: Weng, Zixuan, et al.
Veröffentlicht: (2026)
von: Weng, Zixuan, et al.
Veröffentlicht: (2026)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
von: Huang, Yao, et al.
Veröffentlicht: (2025)
von: Huang, Yao, et al.
Veröffentlicht: (2025)
Extracting and Encoding: Leveraging Large Language Models and Medical Knowledge to Enhance Radiological Text Representation
von: Messina, Pablo, et al.
Veröffentlicht: (2024)
von: Messina, Pablo, et al.
Veröffentlicht: (2024)
Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations
von: Braun, Joschka
Veröffentlicht: (2026)
von: Braun, Joschka
Veröffentlicht: (2026)
Multi-property Steering of Large Language Models with Dynamic Activation Composition
von: Scalena, Daniel, et al.
Veröffentlicht: (2024)
von: Scalena, Daniel, et al.
Veröffentlicht: (2024)
Interpretable Steering of Large Language Models with Feature Guided Activation Additions
von: Soo, Samuel, et al.
Veröffentlicht: (2025)
von: Soo, Samuel, et al.
Veröffentlicht: (2025)
ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models
von: Anand, Nikhil, et al.
Veröffentlicht: (2026)
von: Anand, Nikhil, et al.
Veröffentlicht: (2026)
What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
von: Cheng, Stephen, et al.
Veröffentlicht: (2026)
von: Cheng, Stephen, et al.
Veröffentlicht: (2026)
How Many Features Can a Language Model Store Under the Linear Representation Hypothesis?
von: Garg, Nikhil, et al.
Veröffentlicht: (2026)
von: Garg, Nikhil, et al.
Veröffentlicht: (2026)
Leveraging Group Relative Policy Optimization to Advance Large Language Models in Traditional Chinese Medicine
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
von: Xie, Jiacheng, et al.
Veröffentlicht: (2025)
Leveraging Large Language Models for Web Scraping
von: Ahluwalia, Aman, et al.
Veröffentlicht: (2024)
von: Ahluwalia, Aman, et al.
Veröffentlicht: (2024)
Steering Large Reasoning Models towards Concise Reasoning via Flow Matching
von: Li, Yawei, et al.
Veröffentlicht: (2026)
von: Li, Yawei, et al.
Veröffentlicht: (2026)
All Language Models Large and Small
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
von: Chen, Zhixun, et al.
Veröffentlicht: (2024)
Linear Chain Transformation: Expanding Optimization Dynamics for Fine-Tuning Large Language Models
von: Wang, Yulong, et al.
Veröffentlicht: (2024)
von: Wang, Yulong, et al.
Veröffentlicht: (2024)
Word Embeddings Are Steers for Language Models
von: Han, Chi, et al.
Veröffentlicht: (2023)
von: Han, Chi, et al.
Veröffentlicht: (2023)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
von: Zhou, Zhanhui, et al.
Veröffentlicht: (2024)
Hypothesis Search: Inductive Reasoning with Language Models
von: Wang, Ruocheng, et al.
Veröffentlicht: (2023)
von: Wang, Ruocheng, et al.
Veröffentlicht: (2023)
PMPO: Probabilistic Metric Prompt Optimization for Small and Large Language Models
von: Zhao, Chenzhuo, et al.
Veröffentlicht: (2025)
von: Zhao, Chenzhuo, et al.
Veröffentlicht: (2025)
Equivalent Linear Mappings of Large Language Models
von: Golden, James R.
Veröffentlicht: (2025)
von: Golden, James R.
Veröffentlicht: (2025)
Endogenous Resistance to Activation Steering in Language Models
von: McKenzie, Alex, et al.
Veröffentlicht: (2026)
von: McKenzie, Alex, et al.
Veröffentlicht: (2026)
Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry
von: Li, Zhuochun, et al.
Veröffentlicht: (2026)
von: Li, Zhuochun, et al.
Veröffentlicht: (2026)
SmallToLarge (S2L): Scalable Data Selection for Fine-tuning Large Language Models by Summarizing Training Trajectories of Small Models
von: Yang, Yu, et al.
Veröffentlicht: (2024)
von: Yang, Yu, et al.
Veröffentlicht: (2024)
Improving Large Models with Small models: Lower Costs and Better Performance
von: Chen, Dong, et al.
Veröffentlicht: (2024)
von: Chen, Dong, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models for Solving Rare MIP Challenges
von: Wang, Teng, et al.
Veröffentlicht: (2024)
von: Wang, Teng, et al.
Veröffentlicht: (2024)
Analyzing the Role of Semantic Representations in the Era of Large Language Models
von: Jin, Zhijing, et al.
Veröffentlicht: (2024)
von: Jin, Zhijing, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Curriculum Learning-Guided Progressive Distillation in Large Language Models
von: Cao, Jincheng, et al.
Veröffentlicht: (2026) -
The Linear Representation Hypothesis and the Geometry of Large Language Models
von: Park, Kiho, et al.
Veröffentlicht: (2023) -
Compositional Steering of Large Language Models with Steering Tokens
von: Radevski, Gorjan, et al.
Veröffentlicht: (2026) -
Prompting Fairness: Integrating Causality to Debias Large Language Models
von: Li, Jingling, et al.
Veröffentlicht: (2024) -
A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement
von: Yuan, Hui, et al.
Veröffentlicht: (2024)