Navigating by Old Maps: The Pitfalls of Static Mechanistic Localization in LLM Post-Training
Fuente:
arXiv
Guardado en:
| Autores principales: | Chen, Hang, Zhu, Jiaying, Chen, Hongyang, Liu, Hongxu, Yang, Xinyu, Wang, Wenya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CLUE: Conflict-guided Localization for LLM Unlearning Framework
por: Chen, Hang, et al.
Publicado: (2025)
por: Chen, Hang, et al.
Publicado: (2025)
Quantifying Semantic Emergence in Language Models
por: Chen, Hang, et al.
Publicado: (2024)
por: Chen, Hang, et al.
Publicado: (2024)
Skill Path: Unveiling Language Skills from Circuit Graphs
por: Chen, Hang, et al.
Publicado: (2024)
por: Chen, Hang, et al.
Publicado: (2024)
From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection
por: Zhou, Hongxu
Publicado: (2026)
por: Zhou, Hongxu
Publicado: (2026)
Rethinking Circuit Completeness in Language Models: AND, OR, and ADDER Gates
por: Chen, Hang, et al.
Publicado: (2025)
por: Chen, Hang, et al.
Publicado: (2025)
Tracking the Feature Dynamics in LLM Training: A Mechanistic Study
por: Xu, Yang, et al.
Publicado: (2024)
por: Xu, Yang, et al.
Publicado: (2024)
Rethinking Local Learning: A Cheaper and Faster Recipe for LLM Post-Training
por: Shi, Hengyu, et al.
Publicado: (2026)
por: Shi, Hengyu, et al.
Publicado: (2026)
Task-Aware LLM Routing with Multi-Level Task-Profile-Guided Data Synthesis for Cold-Start Scenarios
por: Liu, Hui, et al.
Publicado: (2026)
por: Liu, Hui, et al.
Publicado: (2026)
Mechanistic Data Attribution: Tracing the Training Origins of Interpretable LLM Units
por: Chen, Jianhui, et al.
Publicado: (2026)
por: Chen, Jianhui, et al.
Publicado: (2026)
Reinforcement Learning for LLM Post-Training: A Survey
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning
por: Guo, Jiaxing, et al.
Publicado: (2025)
por: Guo, Jiaxing, et al.
Publicado: (2025)
Consolidating Rewarded Perturbations for LLM Post-Training
por: Zhang, Zheyu, et al.
Publicado: (2026)
por: Zhang, Zheyu, et al.
Publicado: (2026)
Learning a Structural Causal Model for Intuition Reasoning in Conversation
por: Chen, Hang, et al.
Publicado: (2023)
por: Chen, Hang, et al.
Publicado: (2023)
Training Language Models to Generate Text with Citations via Fine-grained Rewards
por: Huang, Chengyu, et al.
Publicado: (2024)
por: Huang, Chengyu, et al.
Publicado: (2024)
Pitfalls and Outlooks in Using COMET
por: Zouhar, Vilém, et al.
Publicado: (2024)
por: Zouhar, Vilém, et al.
Publicado: (2024)
Can LLMs Learn to Map the World from Local Descriptions?
por: Xia, Sirui, et al.
Publicado: (2025)
por: Xia, Sirui, et al.
Publicado: (2025)
Can Post-Training Quantization Benefit from an Additional QLoRA Integration?
por: Zhu, Xiliang, et al.
Publicado: (2025)
por: Zhu, Xiliang, et al.
Publicado: (2025)
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
por: Liu, Yixin, et al.
Publicado: (2026)
por: Liu, Yixin, et al.
Publicado: (2026)
Mind the Gap: Pitfalls of LLM Alignment with Asian Public Opinion
por: Shankar, Hari, et al.
Publicado: (2026)
por: Shankar, Hari, et al.
Publicado: (2026)
Joint Effects of Argumentation Theory, Audio Modality and Data Enrichment on LLM-Based Fallacy Classification
por: Zhou, Hongxu, et al.
Publicado: (2025)
por: Zhou, Hongxu, et al.
Publicado: (2025)
AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism
por: Wei, Zhepei, et al.
Publicado: (2025)
por: Wei, Zhepei, et al.
Publicado: (2025)
Prompt Curriculum Learning for Efficient LLM Post-Training
por: Gao, Zhaolin, et al.
Publicado: (2025)
por: Gao, Zhaolin, et al.
Publicado: (2025)
Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction
por: Li, Zehan, et al.
Publicado: (2026)
por: Li, Zehan, et al.
Publicado: (2026)
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
por: Shi, Dan, et al.
Publicado: (2026)
por: Shi, Dan, et al.
Publicado: (2026)
Large Language Models Know What Makes Exemplary Contexts
por: Long, Quanyu, et al.
Publicado: (2024)
por: Long, Quanyu, et al.
Publicado: (2024)
Post-training an LLM for RAG? Train on Self-Generated Demonstrations
por: Finlayson, Matthew, et al.
Publicado: (2025)
por: Finlayson, Matthew, et al.
Publicado: (2025)
LLM-based Human Simulations Have Not Yet Been Reliable
por: Wang, Qian, et al.
Publicado: (2025)
por: Wang, Qian, et al.
Publicado: (2025)
The UNDO Flip-Flop: A Controlled Probe for Reversible Semantic State Management in State Space Model
por: Zhou, Hongxu
Publicado: (2026)
por: Zhou, Hongxu
Publicado: (2026)
Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training
por: Xu, Ran, et al.
Publicado: (2026)
por: Xu, Ran, et al.
Publicado: (2026)
Don't Get Lost in the Trees: Streamlining LLM Reasoning by Overcoming Tree Search Exploration Pitfalls
por: Wang, Ante, et al.
Publicado: (2025)
por: Wang, Ante, et al.
Publicado: (2025)
The Pitfalls of Defining Hallucination
por: van Deemter, Kees
Publicado: (2024)
por: van Deemter, Kees
Publicado: (2024)
Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks
por: Guan, Jiannan, et al.
Publicado: (2025)
por: Guan, Jiannan, et al.
Publicado: (2025)
A Survey on LLM Mid-Training
por: Tu, Chengying, et al.
Publicado: (2025)
por: Tu, Chengying, et al.
Publicado: (2025)
Towards a Mechanistic Understanding of Large Reasoning Models: A Survey of Training, Inference, and Failures
por: Hu, Yi, et al.
Publicado: (2026)
por: Hu, Yi, et al.
Publicado: (2026)
Can Language Models Act as Knowledge Bases at Scale?
por: He, Qiyuan, et al.
Publicado: (2024)
por: He, Qiyuan, et al.
Publicado: (2024)
SASQ: Static Activation Scaling for Quantization-Aware Training in Large Language Models
por: Mao, Shizhuo, et al.
Publicado: (2025)
por: Mao, Shizhuo, et al.
Publicado: (2025)
Do LLM Evaluators Prefer Themselves for a Reason?
por: Chen, Wei-Lin, et al.
Publicado: (2025)
por: Chen, Wei-Lin, et al.
Publicado: (2025)
Reinforcing Compositional Retrieval: Retrieving Step-by-Step for Composing Informative Contexts
por: Long, Quanyu, et al.
Publicado: (2025)
por: Long, Quanyu, et al.
Publicado: (2025)
Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement
por: Zhu, Zipeng, et al.
Publicado: (2026)
por: Zhu, Zipeng, et al.
Publicado: (2026)
PPA-Plan: Proactive Pitfall Avoidance for Reliable Planning in Long-Context LLM Reasoning
por: Kim, Byeongjin, et al.
Publicado: (2026)
por: Kim, Byeongjin, et al.
Publicado: (2026)
Ejemplares similares
-
CLUE: Conflict-guided Localization for LLM Unlearning Framework
por: Chen, Hang, et al.
Publicado: (2025) -
Quantifying Semantic Emergence in Language Models
por: Chen, Hang, et al.
Publicado: (2024) -
Skill Path: Unveiling Language Skills from Circuit Graphs
por: Chen, Hang, et al.
Publicado: (2024) -
From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection
por: Zhou, Hongxu
Publicado: (2026) -
Rethinking Circuit Completeness in Language Models: AND, OR, and ADDER Gates
por: Chen, Hang, et al.
Publicado: (2025)