Constrain Alignment with Sparse Autoencoders
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Qingyu, Leong, Chak Tou, Zhu, Minjun, Yan, Hanqi, Zhang, Qiang, He, Yulan, Li, Wenjie, Wang, Jun, Zhang, Yue, Yang, Linyi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
por: Wang, Shuxun, et al.
Publicado: (2025)
por: Wang, Shuxun, et al.
Publicado: (2025)
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
por: Leong, Chak Tou, et al.
Publicado: (2025)
por: Leong, Chak Tou, et al.
Publicado: (2025)
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
por: Leong, Chak Tou, et al.
Publicado: (2026)
por: Leong, Chak Tou, et al.
Publicado: (2026)
E2CL: Exploration-based Error Correction Learning for Embodied Agents
por: Wang, Hanlin, et al.
Publicado: (2024)
por: Wang, Hanlin, et al.
Publicado: (2024)
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
por: Xia, Heming, et al.
Publicado: (2025)
por: Xia, Heming, et al.
Publicado: (2025)
Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents
por: Wang, Hanlin, et al.
Publicado: (2026)
por: Wang, Hanlin, et al.
Publicado: (2026)
STeCa: Step-level Trajectory Calibration for LLM Agent Learning
por: Wang, Hanlin, et al.
Publicado: (2025)
por: Wang, Hanlin, et al.
Publicado: (2025)
Probing the Difficulty Perception Mechanism of Large Language Models
por: Lee, Sunbowen, et al.
Publicado: (2025)
por: Lee, Sunbowen, et al.
Publicado: (2025)
Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models
por: Wang, Jian, et al.
Publicado: (2025)
por: Wang, Jian, et al.
Publicado: (2025)
Refusal Falls off a Cliff: How Safety Alignment Fails in Reasoning?
por: Yin, Qingyu, et al.
Publicado: (2025)
por: Yin, Qingyu, et al.
Publicado: (2025)
Instruct Once, Chat Consistently in Multiple Rounds: An Efficient Tuning Framework for Dialogue
por: Wang, Jian, et al.
Publicado: (2024)
por: Wang, Jian, et al.
Publicado: (2024)
Mirror: A Multiple-perspective Self-Reflection Method for Knowledge-rich Reasoning
por: Yan, Hanqi, et al.
Publicado: (2024)
por: Yan, Hanqi, et al.
Publicado: (2024)
AI Scientists Fail Without Strong Implementation Capability
por: Zhu, Minjun, et al.
Publicado: (2025)
por: Zhu, Minjun, et al.
Publicado: (2025)
AutoPal: Autonomous Adaptation to Users for Personal AI Companionship
por: Cheng, Yi, et al.
Publicado: (2024)
por: Cheng, Yi, et al.
Publicado: (2024)
CycleResearcher: Improving Automated Research via Automated Review
por: Weng, Yixuan, et al.
Publicado: (2024)
por: Weng, Yixuan, et al.
Publicado: (2024)
Personality Alignment of Large Language Models
por: Zhu, Minjun, et al.
Publicado: (2024)
por: Zhu, Minjun, et al.
Publicado: (2024)
Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing
por: Xu, Kaishuai, et al.
Publicado: (2024)
por: Xu, Kaishuai, et al.
Publicado: (2024)
Beyond RAG for Agent Memory: Retrieval by Decoupling and Aggregation
por: Hu, Zhanghao, et al.
Publicado: (2026)
por: Hu, Zhanghao, et al.
Publicado: (2026)
Encourage or Inhibit Monosemanticity? Revisit Monosemanticity from a Feature Decorrelation Perspective
por: Yan, Hanqi, et al.
Publicado: (2024)
por: Yan, Hanqi, et al.
Publicado: (2024)
Toward Faithful Retrieval-Augmented Generation with Sparse Autoencoders
por: Xiong, Guangzhi, et al.
Publicado: (2025)
por: Xiong, Guangzhi, et al.
Publicado: (2025)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
por: Zhang, Hongbo, et al.
Publicado: (2025)
por: Zhang, Hongbo, et al.
Publicado: (2025)
Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question Answering
por: Hu, Zhanghao, et al.
Publicado: (2025)
por: Hu, Zhanghao, et al.
Publicado: (2025)
SciReplicate-Bench: Benchmarking LLMs in Agent-driven Algorithmic Reproduction from Research Papers
por: Xiang, Yanzheng, et al.
Publicado: (2025)
por: Xiang, Yanzheng, et al.
Publicado: (2025)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
por: Fang, Yi, et al.
Publicado: (2026)
por: Fang, Yi, et al.
Publicado: (2026)
Uncovering Cross-Linguistic Disparities in LLMs using Sparse Autoencoders
por: Xuan, Richmond Sin Jing, et al.
Publicado: (2025)
por: Xuan, Richmond Sin Jing, et al.
Publicado: (2025)
Enabling Precise Topic Alignment in Large Language Models Via Sparse Autoencoders
por: Joshi, Ananya, et al.
Publicado: (2025)
por: Joshi, Ananya, et al.
Publicado: (2025)
Deeper Insights Without Updates: The Power of In-Context Learning Over Fine-Tuning
por: Yin, Qingyu, et al.
Publicado: (2024)
por: Yin, Qingyu, et al.
Publicado: (2024)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
por: Liu, Dengcan, et al.
Publicado: (2025)
por: Liu, Dengcan, et al.
Publicado: (2025)
An Empirical Analysis of Uncertainty in Large Language Model Evaluations
por: Xie, Qiujie, et al.
Publicado: (2025)
por: Xie, Qiujie, et al.
Publicado: (2025)
Imitate Before Detect: Aligning Machine Stylistic Preference for Machine-Revised Text Detection
por: Chen, Jiaqi, et al.
Publicado: (2024)
por: Chen, Jiaqi, et al.
Publicado: (2024)
Stop the Flip-Flop: Context-Preserving Verification for Fast Revocable Diffusion Decoding
por: Xiang, Yanzheng, et al.
Publicado: (2026)
por: Xiang, Yanzheng, et al.
Publicado: (2026)
StableMask: Refining Causal Masking in Decoder-only Transformer
por: Yin, Qingyu, et al.
Publicado: (2024)
por: Yin, Qingyu, et al.
Publicado: (2024)
Rehearse With User: Personalized Opinion Summarization via Role-Playing based on Large Language Models
por: Zhang, Yanyue, et al.
Publicado: (2025)
por: Zhang, Yanyue, et al.
Publicado: (2025)
How Likely Do LLMs with CoT Mimic Human Reasoning?
por: Bao, Guangsheng, et al.
Publicado: (2024)
por: Bao, Guangsheng, et al.
Publicado: (2024)
Abduct, Act, Predict: Scaffolding Causal Inference for Automated Failure Attribution in Multi-Agent Systems
por: West, Alva, et al.
Publicado: (2025)
por: West, Alva, et al.
Publicado: (2025)
AbsTopK: Rethinking Sparse Autoencoders For Bidirectional Features
por: Zhu, Xudong, et al.
Publicado: (2025)
por: Zhu, Xudong, et al.
Publicado: (2025)
MiSS: Revisiting the Trade-off in LoRA with an Efficient Shard-Sharing Structure
por: Kang, Jiale, et al.
Publicado: (2024)
por: Kang, Jiale, et al.
Publicado: (2024)
Sparse Autoencoders, Again?
por: Lu, Yin, et al.
Publicado: (2025)
por: Lu, Yin, et al.
Publicado: (2025)
Mechanistic Knobs in LLMs: Retrieving and Steering High-Order Semantic Features via Sparse Autoencoders
por: Zhang, Ruikang, et al.
Publicado: (2026)
por: Zhang, Ruikang, et al.
Publicado: (2026)
Inference-time Alignment via Sparse Junction Steering
por: Hu, Runyi, et al.
Publicado: (2026)
por: Hu, Runyi, et al.
Publicado: (2026)
Ejemplares similares
-
Induction Head Toxicity Mechanistically Explains Repetition Curse in Large Language Models
por: Wang, Shuxun, et al.
Publicado: (2025) -
Why Safeguarded Ships Run Aground? Aligned Large Language Models' Safety Mechanisms Tend to Be Anchored in The Template Region
por: Leong, Chak Tou, et al.
Publicado: (2025) -
Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering
por: Leong, Chak Tou, et al.
Publicado: (2026) -
E2CL: Exploration-based Error Correction Learning for Embodied Agents
por: Wang, Hanlin, et al.
Publicado: (2024) -
TokenSkip: Controllable Chain-of-Thought Compression in LLMs
por: Xia, Heming, et al.
Publicado: (2025)