Faithful Bi-Directional Model Steering via Distribution Matching and Distributed Interchange Interventions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bao, Yuntai, Zhang, Xuhong, Chen, Jintao, Su, Ge, Cai, Yuxiang, Peng, Hao, Sun, Bing, Weng, Haiqin, Yan, Liu, Yin, Jianwei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Towards Steering without Sacrifice: Principled Training of Steering Vectors for Prompt-only Interventions
par: Bao, Yuntai, et autres
Publié: (2026)
par: Bao, Yuntai, et autres
Publié: (2026)
Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasks
par: Bao, Yuntai, et autres
Publié: (2025)
par: Bao, Yuntai, et autres
Publié: (2025)
Scalable Multi-Stage Influence Function for Large Language Models via Eigenvalue-Corrected Kronecker-Factored Parameterization
par: Bao, Yuntai, et autres
Publié: (2025)
par: Bao, Yuntai, et autres
Publié: (2025)
PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts
par: Li, Qinfeng, et autres
Publié: (2026)
par: Li, Qinfeng, et autres
Publié: (2026)
Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization
par: Pan, Miao, et autres
Publié: (2026)
par: Pan, Miao, et autres
Publié: (2026)
Neural Quantum States in Variational Monte Carlo Method: A Brief Summary
par: Song, Yuntai
Publié: (2024)
par: Song, Yuntai
Publié: (2024)
Steer2Edit: From Activation Steering to Component-Level Editing
par: Sun, Chung-En, et autres
Publié: (2026)
par: Sun, Chung-En, et autres
Publié: (2026)
VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs
par: Li, Qiaoru, et autres
Publié: (2026)
par: Li, Qiaoru, et autres
Publié: (2026)
Faithful and Stable Neuron Explanations for Trustworthy Mechanistic Interpretability
par: Yan, Ge, et autres
Publié: (2025)
par: Yan, Ge, et autres
Publié: (2025)
Do Not Merge My Model! Safeguarding Open-Source LLMs Against Unauthorized Model Merging
par: Li, Qinfeng, et autres
Publié: (2025)
par: Li, Qinfeng, et autres
Publié: (2025)
ReFIne: A Framework for Trustworthy Large Reasoning Models with Reliability, Faithfulness, and Interpretability
par: Sun, Chung-En, et autres
Publié: (2025)
par: Sun, Chung-En, et autres
Publié: (2025)
ToolGate: Contract-Grounded and Verified Tool Execution for LLMs
par: Liu, Yanming, et autres
Publié: (2026)
par: Liu, Yanming, et autres
Publié: (2026)
RAGFort: Dual-Path Defense Against Proprietary Knowledge Base Extraction in Retrieval-Augmented Generation
par: Li, Qinfeng, et autres
Publié: (2025)
par: Li, Qinfeng, et autres
Publié: (2025)
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation
par: Jiang, Yankai, et autres
Publié: (2026)
par: Jiang, Yankai, et autres
Publié: (2026)
GFT: From Imitation to Reward Fine-Tuning with Unbiased Group Advantages and Dynamic Coefficient Rectification
par: Gan, Wangjie, et autres
Publié: (2026)
par: Gan, Wangjie, et autres
Publié: (2026)
Emerging Trends and Research Hotspots of Remote Ischemic Preconditioning in Cardiac Surgery: A Bibliometric Analysis
par: Linlin Chen, et autres
Publié: (2025)
par: Linlin Chen, et autres
Publié: (2025)
Graph Out-of-Distribution Generalization via Causal Intervention
par: Wu, Qitian, et autres
Publié: (2024)
par: Wu, Qitian, et autres
Publié: (2024)
Interchange.
Publié: (1983)
Publié: (1983)
Interchange.
Publié: (1982)
Publié: (1982)
Interchange.
Publié: (1980)
Publié: (1980)
Interchange.
Publié: (1982)
Publié: (1982)
TK-Mamba: Marrying KAN With Mamba for Text-Driven 3D Medical Image Segmentation
par: Yang, Haoyu, et autres
Publié: (2025)
par: Yang, Haoyu, et autres
Publié: (2025)
Distributed fault estimation observer design for nonlinear multi‐agent systems with directed graphs
par: Yuhui Weng, et autres
Publié: (2024)
par: Yuhui Weng, et autres
Publié: (2024)
Data-Locality-Aware Task Assignment and Scheduling for Distributed Job Executions
par: Zhao, Hailiang, et autres
Publié: (2024)
par: Zhao, Hailiang, et autres
Publié: (2024)
Learning Few-Step Diffusion Models by Trajectory Distribution Matching
par: Luo, Yihong, et autres
Publié: (2025)
par: Luo, Yihong, et autres
Publié: (2025)
ERA-CoT: Improving Chain-of-Thought through Entity Relationship Analysis
par: Liu, Yanming, et autres
Publié: (2024)
par: Liu, Yanming, et autres
Publié: (2024)
CIRR: Causal-Invariant Retrieval-Augmented Recommendation with Faithful Explanations under Distribution Shift
par: Sun, Sebastian
Publié: (2025)
par: Sun, Sebastian
Publié: (2025)
SteerFlow: Steering Rectified Flows for Faithful Inversion-Based Image Editing
par: Dao, Thinh, et autres
Publié: (2026)
par: Dao, Thinh, et autres
Publié: (2026)
GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients
par: Kazama, Kentaro, et autres
Publié: (2026)
par: Kazama, Kentaro, et autres
Publié: (2026)
First Extraction of Transverse Momentum Dependent Helicity Distributions
par: Yang, Ke, et autres
Publié: (2024)
par: Yang, Ke, et autres
Publié: (2024)
Influence of Macrocracks Extending along the Propagation Direction of Detonation Wave on the Detonation Velocity of Explosives
par: Jun Liu, et autres
Publié: (2025)
par: Jun Liu, et autres
Publié: (2025)
Distributed Model Predictive Covariance Steering
par: Saravanos, Augustinos D., et autres
Publié: (2022)
par: Saravanos, Augustinos D., et autres
Publié: (2022)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
par: Fayyaz, Mohsen, et autres
Publié: (2024)
par: Fayyaz, Mohsen, et autres
Publié: (2024)
A Wideband Distributed Massive MIMO Channel Sounder for Communication and Sensing
par: Sandra, Michiel, et autres
Publié: (2024)
par: Sandra, Michiel, et autres
Publié: (2024)
Phase Matching for Out-of-Distribution Generalization
par: Hu, Chengming, et autres
Publié: (2023)
par: Hu, Chengming, et autres
Publié: (2023)
Digital Wireless Image Transmission via Distribution Matching
par: Yang, Pujing, et autres
Publié: (2024)
par: Yang, Pujing, et autres
Publié: (2024)
Disentangling Long-Short Term State Under Unknown Interventions for Online Time Series Forecasting
par: Cai, Ruichu, et autres
Publié: (2025)
par: Cai, Ruichu, et autres
Publié: (2025)
Nonstationary Time Series Forecasting via Unknown Distribution Adaptation
par: Li, Zijian, et autres
Publié: (2024)
par: Li, Zijian, et autres
Publié: (2024)
LANCET: Neural Intervention via Structural Entropy for Mitigating Faithfulness Hallucinations in LLMs
par: Wang, Chenxu, et autres
Publié: (2026)
par: Wang, Chenxu, et autres
Publié: (2026)
SenseFlow: Scaling Distribution Matching for Flow-based Text-to-Image Distillation
par: Ge, Xingtong, et autres
Publié: (2025)
par: Ge, Xingtong, et autres
Publié: (2025)
Documents similaires
-
Towards Steering without Sacrifice: Principled Training of Steering Vectors for Prompt-only Interventions
par: Bao, Yuntai, et autres
Publié: (2026) -
Probing the Geometry of Truth: Consistency and Generalization of Truth Directions in LLMs Across Logical Transformations and Question Answering Tasks
par: Bao, Yuntai, et autres
Publié: (2025) -
Scalable Multi-Stage Influence Function for Large Language Models via Eigenvalue-Corrected Kronecker-Factored Parameterization
par: Bao, Yuntai, et autres
Publié: (2025) -
PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts
par: Li, Qinfeng, et autres
Publié: (2026) -
Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization
par: Pan, Miao, et autres
Publié: (2026)