SASFT: Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Boyi, Wan, Yu, Yang, Baosong, Huang, Fei, Wang, Wenjie, Feng, Fuli |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
par: Deng, Boyi, et autres
Publié: (2025)
par: Deng, Boyi, et autres
Publié: (2025)
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
par: Fang, Yi, et autres
Publié: (2026)
par: Fang, Yi, et autres
Publié: (2026)
CrAM: Credibility-Aware Attention Modification in LLMs for Combating Misinformation in RAG
par: Deng, Boyi, et autres
Publié: (2024)
par: Deng, Boyi, et autres
Publié: (2024)
P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs
par: Zhang, Yidan, et autres
Publié: (2024)
par: Zhang, Yidan, et autres
Publié: (2024)
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)
par: Wang, Xu, et autres
Publié: (2026)
Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective
par: Chen, Yukun, et autres
Publié: (2026)
par: Chen, Yukun, et autres
Publié: (2026)
Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models
par: Deng, Boyi, et autres
Publié: (2026)
par: Deng, Boyi, et autres
Publié: (2026)
Counterfactual Debating with Preset Stances for Hallucination Elimination of LLMs
par: Fang, Yi, et autres
Publié: (2024)
par: Fang, Yi, et autres
Publié: (2024)
Assistant-Guided Mitigation of Teacher Preference Bias in LLM-as-a-Judge
par: Liu, Zhuo, et autres
Publié: (2025)
par: Liu, Zhuo, et autres
Publié: (2025)
SAFE: A Sparse Autoencoder-Based Framework for Robust Query Enrichment and Hallucination Mitigation in LLMs
par: Abdaljalil, Samir, et autres
Publié: (2025)
par: Abdaljalil, Samir, et autres
Publié: (2025)
PART: Progressive Alignment Representation Training for Multilingual Speech-To-Text with LLMs
par: Zhang, Pei, et autres
Publié: (2025)
par: Zhang, Pei, et autres
Publié: (2025)
Constrain Alignment with Sparse Autoencoders
par: Yin, Qingyu, et autres
Publié: (2024)
par: Yin, Qingyu, et autres
Publié: (2024)
Understanding the Effects of Domain Finetuning on LLMs
par: Tanwar, Eshaan, et autres
Publié: (2025)
par: Tanwar, Eshaan, et autres
Publié: (2025)
Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders
par: Goyal, Agam, et autres
Publié: (2025)
par: Goyal, Agam, et autres
Publié: (2025)
CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
par: Zhang, Xinyu, et autres
Publié: (2025)
par: Zhang, Xinyu, et autres
Publié: (2025)
Improving Task Diversity in Label Efficient Supervised Finetuning of LLMs
par: Arabelly, Abhinav, et autres
Publié: (2025)
par: Arabelly, Abhinav, et autres
Publié: (2025)
Sparse Autoencoders are Capable LLM Jailbreak Mitigators
par: Assogba, Yannick, et autres
Publié: (2026)
par: Assogba, Yannick, et autres
Publié: (2026)
Uncovering Cross-Linguistic Disparities in LLMs using Sparse Autoencoders
par: Xuan, Richmond Sin Jing, et autres
Publié: (2025)
par: Xuan, Richmond Sin Jing, et autres
Publié: (2025)
Locking Down the Finetuned LLMs Safety
par: Zhu, Minjun, et autres
Publié: (2024)
par: Zhu, Minjun, et autres
Publié: (2024)
SCAR: Sparse Conditioned Autoencoders for Concept Detection and Steering in LLMs
par: Härle, Ruben, et autres
Publié: (2024)
par: Härle, Ruben, et autres
Publié: (2024)
Self-Improvement Towards Pareto Optimality: Mitigating Preference Conflicts in Multi-Objective Alignment
par: Li, Moxin, et autres
Publié: (2025)
par: Li, Moxin, et autres
Publié: (2025)
Investigating and Scaling up Code-Switching for Multilingual Language Model Pre-Training
par: Wang, Zhijun, et autres
Publié: (2025)
par: Wang, Zhijun, et autres
Publié: (2025)
Improving Sparse Memory Finetuning
par: Goyal, Satyam, et autres
Publié: (2026)
par: Goyal, Satyam, et autres
Publié: (2026)
CultureForest: Understanding and Evaluating Cultural Norm Grounded Reasoning in LLMs
par: Ye, Yangfan, et autres
Publié: (2026)
par: Ye, Yangfan, et autres
Publié: (2026)
Mitigating Large Language Model Hallucination with Faithful Finetuning
par: Hu, Minda, et autres
Publié: (2024)
par: Hu, Minda, et autres
Publié: (2024)
Sparse Autoencoder Insights on Voice Embeddings
par: Pluth, Daniel, et autres
Publié: (2025)
par: Pluth, Daniel, et autres
Publié: (2025)
Interpreting and Steering LLMs with Mutual Information-based Explanations on Sparse Autoencoders
par: Wu, Xuansheng, et autres
Publié: (2025)
par: Wu, Xuansheng, et autres
Publié: (2025)
Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning
par: Guo, Jiaxing, et autres
Publié: (2025)
par: Guo, Jiaxing, et autres
Publié: (2025)
Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching
par: Kim, Seoyeon, et autres
Publié: (2024)
par: Kim, Seoyeon, et autres
Publié: (2024)
Randomized Masked Finetuning: An Efficient Way to Mitigate Memorization of PIIs in LLMs
par: Joshi, Kunj, et autres
Publié: (2025)
par: Joshi, Kunj, et autres
Publié: (2025)
One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment
par: Cai, Hongru, et autres
Publié: (2026)
par: Cai, Hongru, et autres
Publié: (2026)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
par: Hua, Zhenglin, et autres
Publié: (2025)
par: Hua, Zhenglin, et autres
Publié: (2025)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
Sparse Upcycling: Inference Inefficient Finetuning
par: Doubov, Sasha, et autres
Publié: (2024)
par: Doubov, Sasha, et autres
Publié: (2024)
Finetuning LLMs for Comparative Assessment Tasks
par: Raina, Vatsal, et autres
Publié: (2024)
par: Raina, Vatsal, et autres
Publié: (2024)
Robo-Instruct: Simulator-Augmented Instruction Alignment For Finetuning Code LLMs
par: Hu, Zichao, et autres
Publié: (2024)
par: Hu, Zichao, et autres
Publié: (2024)
Unveiling Over-Memorization in Finetuning LLMs for Reasoning Tasks
par: Ruan, Zhiwen, et autres
Publié: (2025)
par: Ruan, Zhiwen, et autres
Publié: (2025)
Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
par: Wang, Yiming, et autres
Publié: (2025)
par: Wang, Yiming, et autres
Publié: (2025)
HellaSwag-Pro: A Large-Scale Bilingual Benchmark for Evaluating the Robustness of LLMs in Commonsense Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
EAVE: Efficient Product Attribute Value Extraction via Lightweight Sparse-layer Interaction
par: Yang, Li, et autres
Publié: (2024)
par: Yang, Li, et autres
Publié: (2024)
Documents similaires
-
Unveiling Language-Specific Features in Large Language Models via Sparse Autoencoders
par: Deng, Boyi, et autres
Publié: (2025) -
Controllable LLM Reasoning via Sparse Autoencoder-Based Steering
par: Fang, Yi, et autres
Publié: (2026) -
CrAM: Credibility-Aware Attention Modification in LLMs for Combating Misinformation in RAG
par: Deng, Boyi, et autres
Publié: (2024) -
P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs
par: Zhang, Yidan, et autres
Publié: (2024) -
DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders
par: Wang, Xu, et autres
Publié: (2026)