HH-SAE: Discovering and Steering Hierarchical Knowledge of Complex Manifolds
Fuente:
arXiv
Guardado en:
| Autores principales: | Wu, Honghan, Wang, Tianyan, Mi, Jiacong, Jiang, Zhoyang, Kim, Yunsoo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Regime Theory of Controller Class Selection for LLM Action Decisions
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts
por: Bhargav, Samaksh, et al.
Publicado: (2025)
por: Bhargav, Samaksh, et al.
Publicado: (2025)
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
por: Wedgwood, James, et al.
Publicado: (2026)
por: Wedgwood, James, et al.
Publicado: (2026)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
MedExQA: Medical Question Answering Benchmark with Multiple Explanations
por: Kim, Yunsoo, et al.
Publicado: (2024)
por: Kim, Yunsoo, et al.
Publicado: (2024)
Discovering Data Manifold Geometry via Non-Contracting Flows
por: Vigouroux, David, et al.
Publicado: (2026)
por: Vigouroux, David, et al.
Publicado: (2026)
MultiModal-Learning for Predicting Molecular Properties: A Framework Based on Image and Graph Structures
por: Wang, Zhuoyuan, et al.
Publicado: (2023)
por: Wang, Zhuoyuan, et al.
Publicado: (2023)
Circuit Complexity of Hierarchical Knowledge Tracing and Implications for Log-Precision Transformers
por: Liu, Naiming, et al.
Publicado: (2026)
por: Liu, Naiming, et al.
Publicado: (2026)
Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency
por: Jiang, Xinyan, et al.
Publicado: (2026)
por: Jiang, Xinyan, et al.
Publicado: (2026)
BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
por: Xu, Iris, et al.
Publicado: (2025)
por: Xu, Iris, et al.
Publicado: (2025)
MOE-Enhanced Explanable Deep Manifold Transformation for Complex Data Embedding and Visualization
por: Zang, Zelin, et al.
Publicado: (2024)
por: Zang, Zelin, et al.
Publicado: (2024)
Dense SAE Latents Are Features, Not Bugs
por: Sun, Xiaoqing, et al.
Publicado: (2025)
por: Sun, Xiaoqing, et al.
Publicado: (2025)
Mitigating Overthinking in Large Reasoning Models via Manifold Steering
por: Huang, Yao, et al.
Publicado: (2025)
por: Huang, Yao, et al.
Publicado: (2025)
Hierarchical Planning for Complex Tasks with Knowledge Graph-RAG and Symbolic Verification
por: Cornelio, Cristina, et al.
Publicado: (2025)
por: Cornelio, Cristina, et al.
Publicado: (2025)
SAKE: Steering Activations for Knowledge Editing
por: Scialanga, Marco, et al.
Publicado: (2025)
por: Scialanga, Marco, et al.
Publicado: (2025)
LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering
por: Wong, Sing Hieng, et al.
Publicado: (2026)
por: Wong, Sing Hieng, et al.
Publicado: (2026)
LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
por: Jiang, Zhaoyang, et al.
Publicado: (2026)
ReSAE: Residualized Sparse Autoencoders for Multi-Layer Transformer Interventions
por: Poduval, Prathyush, et al.
Publicado: (2026)
por: Poduval, Prathyush, et al.
Publicado: (2026)
Beyond Linear Superposition: Discovering Climate Features in AI Weather Models with KAN-SAE
por: Cheon, Minjong
Publicado: (2026)
por: Cheon, Minjong
Publicado: (2026)
Discovering Chunks in Neural Embeddings for Interpretability
por: Wu, Shuchen, et al.
Publicado: (2025)
por: Wu, Shuchen, et al.
Publicado: (2025)
Interpretable Safety Alignment via SAE-Constructed Low-Rank Subspace Adaptation
por: Wang, Dianyun, et al.
Publicado: (2025)
por: Wang, Dianyun, et al.
Publicado: (2025)
ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs
por: Zhang, Zhengyan, et al.
Publicado: (2024)
por: Zhang, Zhengyan, et al.
Publicado: (2024)
Discovering the Representation Bottleneck of Graph Neural Networks
por: Wu, Fang, et al.
Publicado: (2022)
por: Wu, Fang, et al.
Publicado: (2022)
Enhancing Instruction Following of LLMs via Activation Steering with Dynamic Rejection
por: Kang, Minjae, et al.
Publicado: (2026)
por: Kang, Minjae, et al.
Publicado: (2026)
General and Efficient Steering of Unconditional Diffusion
por: Wang, Qingsong, et al.
Publicado: (2026)
por: Wang, Qingsong, et al.
Publicado: (2026)
Discovering Latent Knowledge in Language Models Without Supervision
por: Burns, Collin, et al.
Publicado: (2022)
por: Burns, Collin, et al.
Publicado: (2022)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
por: Bayazit, Deniz, et al.
Publicado: (2023)
por: Bayazit, Deniz, et al.
Publicado: (2023)
Semantic Level of Detail for Knowledge Graphs: Discovering Abstraction Boundaries via Spectral Heat Diffusion
por: Izgorodin, Edward
Publicado: (2026)
por: Izgorodin, Edward
Publicado: (2026)
Concept Heterogeneity-aware Representation Steering
por: Abdullaev, Laziz U., et al.
Publicado: (2026)
por: Abdullaev, Laziz U., et al.
Publicado: (2026)
Hyperbolic Hierarchical Knowledge Graph Embeddings for Link Prediction in Low Dimensions
por: Zheng, Wenjie, et al.
Publicado: (2022)
por: Zheng, Wenjie, et al.
Publicado: (2022)
Enhancing LLM Steering through Sparse Autoencoder-Based Vector Refinement
por: Wang, Anyi, et al.
Publicado: (2025)
por: Wang, Anyi, et al.
Publicado: (2025)
Learning to Discover at Test Time
por: Yuksekgonul, Mert, et al.
Publicado: (2026)
por: Yuksekgonul, Mert, et al.
Publicado: (2026)
HyperSteer: Activation Steering at Scale with Hypernetworks
por: Sun, Jiuding, et al.
Publicado: (2025)
por: Sun, Jiuding, et al.
Publicado: (2025)
BarrierSteer: LLM Safety via Learning Barrier Steering
por: Tran, Thanh Q., et al.
Publicado: (2026)
por: Tran, Thanh Q., et al.
Publicado: (2026)
MidSteer: Optimal Affine Framework for Steering Generative Models
por: Gaintseva, Tatiana, et al.
Publicado: (2026)
por: Gaintseva, Tatiana, et al.
Publicado: (2026)
To Steer or Not to Steer? Mechanistic Error Reduction with Abstention for Language Models
por: Hedström, Anna, et al.
Publicado: (2025)
por: Hedström, Anna, et al.
Publicado: (2025)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
por: Kim, Yunsoo, et al.
Publicado: (2024)
por: Kim, Yunsoo, et al.
Publicado: (2024)
KG4Diagnosis: A Hierarchical Multi-Agent LLM Framework with Knowledge Graph Enhancement for Medical Diagnosis
por: Zuo, Kaiwen, et al.
Publicado: (2024)
por: Zuo, Kaiwen, et al.
Publicado: (2024)
Ejemplares similares
-
A Regime Theory of Controller Class Selection for LLM Action Decisions
por: Jiang, Zhaoyang, et al.
Publicado: (2026) -
Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation
por: Jiang, Zhaoyang, et al.
Publicado: (2026) -
SLaVA-CXR: Small Language and Vision Assistant for Chest X-ray Report Automation
por: Wu, Jinge, et al.
Publicado: (2024) -
Feature-Guided SAE Steering for Refusal-Rate Control using Contrasting Prompts
por: Bhargav, Samaksh, et al.
Publicado: (2025) -
DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment
por: Wedgwood, James, et al.
Publicado: (2026)