Boundary Suppression Asymmetry in Post-trained Assistants: Over-expansion as a Controllability Cost
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Han, Jiarui |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Auditing Stance Asymmetry in Generative Explanations
par: Han, Jiarui
Publié: (2026)
par: Han, Jiarui
Publié: (2026)
Retention Consequence in Lifecycle Memory Control
par: Han, Jiarui
Publié: (2026)
par: Han, Jiarui
Publié: (2026)
Supposedly Equivalent Facts That Aren't? Entity Frequency in Pre-training Induces Asymmetry in LLMs
par: He, Yuan, et autres
Publié: (2025)
par: He, Yuan, et autres
Publié: (2025)
On Predicting the Post-training Potential of Pre-trained LLMs
par: Li, Xiaoyuan, et autres
Publié: (2026)
par: Li, Xiaoyuan, et autres
Publié: (2026)
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
par: Zhang, Jiazheng, et autres
Publié: (2026)
par: Zhang, Jiazheng, et autres
Publié: (2026)
Transferable Post-training via Inverse Value Learning
par: Lu, Xinyu, et autres
Publié: (2024)
par: Lu, Xinyu, et autres
Publié: (2024)
UniAttn: Reducing Inference Costs via Softmax Unification for Post-Training LLMs
par: Xiong, Yizhe, et autres
Publié: (2025)
par: Xiong, Yizhe, et autres
Publié: (2025)
On the Impact of Calibration Data in Post-training Quantization and Pruning
par: Williams, Miles, et autres
Publié: (2023)
par: Williams, Miles, et autres
Publié: (2023)
Progress or Regress? Self-Improvement Reversal in Post-training
par: Wu, Ting, et autres
Publié: (2024)
par: Wu, Ting, et autres
Publié: (2024)
Beyond No: Quantifying AI Over-Refusal and Emotional Attachment Boundaries
par: Noever, David, et autres
Publié: (2025)
par: Noever, David, et autres
Publié: (2025)
Prompt-Based Cost-Effective Evaluation and Operation of ChatGPT as a Computer Programming Teaching Assistant
par: Ballestero-Ribó, Marc, et autres
Publié: (2025)
par: Ballestero-Ribó, Marc, et autres
Publié: (2025)
Got Compute, but No Data: Lessons From Post-training a Finnish LLM
par: Zosa, Elaine, et autres
Publié: (2025)
par: Zosa, Elaine, et autres
Publié: (2025)
Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training
par: Zhang, Longhui, et autres
Publié: (2024)
par: Zhang, Longhui, et autres
Publié: (2024)
Correcting Suppressed Log-Probabilities in Language Models with Post-Transformer Adapters
par: Sanchez, Bryan
Publié: (2026)
par: Sanchez, Bryan
Publié: (2026)
Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding
par: Dong, Yijiang River, et autres
Publié: (2026)
par: Dong, Yijiang River, et autres
Publié: (2026)
Beyond Over-Refusal: Scenario-Based Diagnostics and Post-Hoc Mitigation for Exaggerated Refusals in LLMs
par: Yuan, Shuzhou, et autres
Publié: (2025)
par: Yuan, Shuzhou, et autres
Publié: (2025)
A Survey on Post-training of Large Language Models
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
Asymmetric Conflict and Synergy in Post-training for LLM-based Multilingual Machine Translation
par: Zheng, Tong, et autres
Publié: (2025)
par: Zheng, Tong, et autres
Publié: (2025)
AIR: Post-training Data Selection for Reasoning via Attention Head Influence
par: Liu, Jinrui, et autres
Publié: (2025)
par: Liu, Jinrui, et autres
Publié: (2025)
Prioritized Replay for RL Post-training
par: Fatemi, Mehdi
Publié: (2026)
par: Fatemi, Mehdi
Publié: (2026)
LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control
par: Jeong, Seogyeong, et autres
Publié: (2026)
par: Jeong, Seogyeong, et autres
Publié: (2026)
ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation
par: Kim, Jiho, et autres
Publié: (2025)
par: Kim, Jiho, et autres
Publié: (2025)
StateX: Enhancing RNN Recall via Post-training State Expansion
par: Shen, Xingyu, et autres
Publié: (2025)
par: Shen, Xingyu, et autres
Publié: (2025)
Over-Reasoning and Redundant Calculation of Large Language Models
par: Chiang, Cheng-Han, et autres
Publié: (2024)
par: Chiang, Cheng-Han, et autres
Publié: (2024)
OAC: Output-adaptive Calibration for Accurate Post-training Quantization
par: Edalati, Ali, et autres
Publié: (2024)
par: Edalati, Ali, et autres
Publié: (2024)
Automatic Pair Construction for Contrastive Post-training
par: Xu, Canwen, et autres
Publié: (2023)
par: Xu, Canwen, et autres
Publié: (2023)
A RAG-Based Institutional Assistant
par: Kuratomi, Gustavo, et autres
Publié: (2025)
par: Kuratomi, Gustavo, et autres
Publié: (2025)
Derailing Non-Answers via Logit Suppression at Output Subspace Boundaries in RLHF-Aligned Language Models
par: Dam, Harvey, et autres
Publié: (2025)
par: Dam, Harvey, et autres
Publié: (2025)
Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training
par: Peng, Jiahui, et autres
Publié: (2025)
par: Peng, Jiahui, et autres
Publié: (2025)
On Data Synthesis and Post-training for Visual Abstract Reasoning
par: Zhu, Ke, et autres
Publié: (2025)
par: Zhu, Ke, et autres
Publié: (2025)
Support-Contra Asymmetry in LLM Explanations
par: Patil, Avinash
Publié: (2025)
par: Patil, Avinash
Publié: (2025)
Guided Profile Generation Improves Personalization with LLMs
par: Zhang, Jiarui
Publié: (2024)
par: Zhang, Jiarui
Publié: (2024)
Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages
par: Samuel, David, et autres
Publié: (2025)
par: Samuel, David, et autres
Publié: (2025)
Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
par: Ding, Bowen, et autres
Publié: (2025)
par: Ding, Bowen, et autres
Publié: (2025)
Post-training Large Language Models for Diverse High-Quality Responses
par: Chen, Yilei, et autres
Publié: (2025)
par: Chen, Yilei, et autres
Publié: (2025)
Beyond Static Evaluation: A Dynamic Approach to Assessing AI Assistants' API Invocation Capabilities
par: Mu, Honglin, et autres
Publié: (2024)
par: Mu, Honglin, et autres
Publié: (2024)
Psy-Chronicle:A Structured Pipeline for Synthesizing Long-Horizon Campus Psychological Counseling Dialogues
par: Gou, Chaogui, et autres
Publié: (2026)
par: Gou, Chaogui, et autres
Publié: (2026)
Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training
par: Lacombe, Valentin, et autres
Publié: (2026)
par: Lacombe, Valentin, et autres
Publié: (2026)
Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text
par: Huang, Chengyu, et autres
Publié: (2026)
par: Huang, Chengyu, et autres
Publié: (2026)
Don't Start Over: A Cost-Effective Framework for Migrating Personalized Prompts Between LLMs
par: Zhao, Ziyi, et autres
Publié: (2026)
par: Zhao, Ziyi, et autres
Publié: (2026)
Documents similaires
-
Auditing Stance Asymmetry in Generative Explanations
par: Han, Jiarui
Publié: (2026) -
Retention Consequence in Lifecycle Memory Control
par: Han, Jiarui
Publié: (2026) -
Supposedly Equivalent Facts That Aren't? Entity Frequency in Pre-training Induces Asymmetry in LLMs
par: He, Yuan, et autres
Publié: (2025) -
On Predicting the Post-training Potential of Pre-trained LLMs
par: Li, Xiaoyuan, et autres
Publié: (2026) -
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control
par: Zhang, Jiazheng, et autres
Publié: (2026)