Steered Generation via Gradient Descent on Sparse Features
Fuente:
arXiv
Salvato in:
| Autori principali: | Bhattacharyya, Sumanta, Rooshenas, Pedram |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Steered Generation via Gradient-Based Optimization on Sparse Query Features
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2026)
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2026)
Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2025)
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2025)
TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers
di: Wesego, Daniel, et al.
Pubblicazione: (2026)
di: Wesego, Daniel, et al.
Pubblicazione: (2026)
Multimodal ELBO with Diffusion Decoders
di: Wesego, Daniel, et al.
Pubblicazione: (2024)
di: Wesego, Daniel, et al.
Pubblicazione: (2024)
Score-Based Multimodal Autoencoder
di: Wesego, Daniel, et al.
Pubblicazione: (2023)
di: Wesego, Daniel, et al.
Pubblicazione: (2023)
Causal Language Control in Multilingual Transformers via Sparse Feature Steering
di: Chou, Cheng-Ting, et al.
Pubblicazione: (2025)
di: Chou, Cheng-Ting, et al.
Pubblicazione: (2025)
CorrSteer: Generation-Time LLM Steering via Correlated Sparse Autoencoder Features
di: Cho, Seonglae, et al.
Pubblicazione: (2025)
di: Cho, Seonglae, et al.
Pubblicazione: (2025)
GeoSteer: Faithful Chain-of-Thought Steering via Latent Manifold Gradients
di: Kazama, Kentaro, et al.
Pubblicazione: (2026)
di: Kazama, Kentaro, et al.
Pubblicazione: (2026)
Improving Steering Vectors by Targeting Sparse Autoencoder Features
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
di: Chalnev, Sviatoslav, et al.
Pubblicazione: (2024)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
di: Zhang, Ruikang, et al.
Pubblicazione: (2026)
di: Zhang, Ruikang, et al.
Pubblicazione: (2026)
SteerRM: Debiasing Reward Models via Sparse Autoencoders
di: Sun, Mengyuan, et al.
Pubblicazione: (2026)
di: Sun, Mengyuan, et al.
Pubblicazione: (2026)
Interpretable LLM Guardrails via Sparse Representation Steering
di: He, Zeqing, et al.
Pubblicazione: (2025)
di: He, Zeqing, et al.
Pubblicazione: (2025)
Inference-time Alignment via Sparse Junction Steering
di: Hu, Runyi, et al.
Pubblicazione: (2026)
di: Hu, Runyi, et al.
Pubblicazione: (2026)
In-Context Optimization for Retrieval-Augmented Generation: A Gradient-Descent Perspective
di: Li, Mingchen, et al.
Pubblicazione: (2026)
di: Li, Mingchen, et al.
Pubblicazione: (2026)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
di: Fang, Yi, et al.
Pubblicazione: (2026)
di: Fang, Yi, et al.
Pubblicazione: (2026)
LLM-Driven Feedback for Enhancing Conceptual Design Learning in Database Systems Courses
di: Riazi, Sara, et al.
Pubblicazione: (2024)
di: Riazi, Sara, et al.
Pubblicazione: (2024)
Can Gradient Descent Simulate Prompting?
di: Zhang, Eric, et al.
Pubblicazione: (2025)
di: Zhang, Eric, et al.
Pubblicazione: (2025)
In-context Learning and Gradient Descent Revisited
di: Deutch, Gilad, et al.
Pubblicazione: (2023)
di: Deutch, Gilad, et al.
Pubblicazione: (2023)
Reversed Attention: On The Gradient Descent Of Attention Layers In GPT
di: Katz, Shahar, et al.
Pubblicazione: (2024)
di: Katz, Shahar, et al.
Pubblicazione: (2024)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
di: Hua, Zhenglin, et al.
Pubblicazione: (2025)
di: Hua, Zhenglin, et al.
Pubblicazione: (2025)
SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs
di: Härle, Ruben, et al.
Pubblicazione: (2024)
di: Härle, Ruben, et al.
Pubblicazione: (2024)
Introducing MAPO: Momentum-Aided Gradient Descent Prompt Optimization
di: Cui, Anthony, et al.
Pubblicazione: (2024)
di: Cui, Anthony, et al.
Pubblicazione: (2024)
Optimizing Multi-Agent Weather Captioning via Text Gradient Descent: A Training-Free Approach with Consensus-Aware Gradient Fusion
di: Liu, Shixu
Pubblicazione: (2026)
di: Liu, Shixu
Pubblicazione: (2026)
LF-Steering: Latent Feature Activation Steering for Enhancing Semantic Consistency in Large Language Models
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
di: Yang, Jingyuan, et al.
Pubblicazione: (2025)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
di: Wong, Sing Hieng, et al.
Pubblicazione: (2026)
di: Wong, Sing Hieng, et al.
Pubblicazione: (2026)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
di: Wu, Xuansheng, et al.
Pubblicazione: (2025)
Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection
di: Ghussin, Yusser Al, et al.
Pubblicazione: (2026)
di: Ghussin, Yusser Al, et al.
Pubblicazione: (2026)
Optimize Weight Rounding via Signed Gradient Descent for the Quantization of LLMs
di: Cheng, Wenhua, et al.
Pubblicazione: (2023)
di: Cheng, Wenhua, et al.
Pubblicazione: (2023)
Control Reinforcement Learning: Interpretable Token-Level Steering of LLMs via Sparse Autoencoder Features
di: Cho, Seonglae, et al.
Pubblicazione: (2026)
di: Cho, Seonglae, et al.
Pubblicazione: (2026)
Ta-G-T: Subjectivity Capture in Table to Text Generation via RDF Graphs
di: Upasham, Ronak, et al.
Pubblicazione: (2025)
di: Upasham, Ronak, et al.
Pubblicazione: (2025)
A Comparative Analysis of Sparse Autoencoder and Activation Difference in Language Model Steering
di: Xie, Jiaqing
Pubblicazione: (2025)
di: Xie, Jiaqing
Pubblicazione: (2025)
Gradient-Controlled Decoding: A Safety Guardrail for LLMs with Dual-Anchor Steering
di: Chiniya, Purva, et al.
Pubblicazione: (2026)
di: Chiniya, Purva, et al.
Pubblicazione: (2026)
Generating Place-Based Compromises Between Two Points of View
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2026)
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2026)
Activation Steering via Generative Causal Mediation
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
di: Sankaranarayanan, Aruna, et al.
Pubblicazione: (2026)
SAE-SSV: Supervised Steering in Sparse Representation Spaces for Reliable Control of Language Models
di: He, Zirui, et al.
Pubblicazione: (2025)
di: He, Zirui, et al.
Pubblicazione: (2025)
SSA: Sparse Sparse Attention by Aligning Full and Sparse Attention Outputs in Feature Space
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
di: Shen, Zhenyi, et al.
Pubblicazione: (2025)
Steering LLMs for Culturally Localized Generation
di: Khanuja, Simran, et al.
Pubblicazione: (2026)
di: Khanuja, Simran, et al.
Pubblicazione: (2026)
Denoising Concept Vectors with Sparse Autoencoders for Improved Language Model Steering
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
di: Zhao, Haiyan, et al.
Pubblicazione: (2025)
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
di: Deng, Boyi, et al.
Pubblicazione: (2025)
di: Deng, Boyi, et al.
Pubblicazione: (2025)
Do pretrained Transformers Learn In-Context by Gradient Descent?
di: Shen, Lingfeng, et al.
Pubblicazione: (2023)
di: Shen, Lingfeng, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Steered Generation via Gradient-Based Optimization on Sparse Query Features
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2026) -
Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction
di: Bhattacharyya, Sumanta, et al.
Pubblicazione: (2025) -
TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers
di: Wesego, Daniel, et al.
Pubblicazione: (2026) -
Multimodal ELBO with Diffusion Decoders
di: Wesego, Daniel, et al.
Pubblicazione: (2024) -
Score-Based Multimodal Autoencoder
di: Wesego, Daniel, et al.
Pubblicazione: (2023)