Language Confusion Gate: Language-Aware Decoding Through Model Self-Distillation
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhang, Collin, Huang, Fei, Yuan, Chenhan, Lin, Junyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
Finding Challenging Metaphors that Confuse Pretrained Language Models
di: Li, Yucheng, et al.
Pubblicazione: (2024)
di: Li, Yucheng, et al.
Pubblicazione: (2024)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
di: Yuan, Chenhan, et al.
Pubblicazione: (2024)
di: Yuan, Chenhan, et al.
Pubblicazione: (2024)
Vision Language Models are Confused Tourists
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
di: Zhao, Siyan, et al.
Pubblicazione: (2026)
Are Large Language Models True Healthcare Jacks-of-All-Trades? Benchmarking Across Health Professions Beyond Physician Exams
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
di: Luo, Zheheng, et al.
Pubblicazione: (2024)
Controlling Language Confusion in Multilingual LLMs
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
Understanding and Mitigating Language Confusion in LLMs
di: Marchisio, Kelly, et al.
Pubblicazione: (2024)
di: Marchisio, Kelly, et al.
Pubblicazione: (2024)
CAST: Corpus-Aware Self-similarity Enhanced Topic modelling
di: Ma, Yanan, et al.
Pubblicazione: (2024)
di: Ma, Yanan, et al.
Pubblicazione: (2024)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2025)
di: Nie, Ercong, et al.
Pubblicazione: (2025)
Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models
di: Chen, Kecheng, et al.
Pubblicazione: (2026)
di: Chen, Kecheng, et al.
Pubblicazione: (2026)
Self Speculative Decoding for Diffusion Large Language Models
di: Gao, Yifeng, et al.
Pubblicazione: (2025)
di: Gao, Yifeng, et al.
Pubblicazione: (2025)
Self-Evolving Critique Abilities in Large Language Models
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
Language Models can Self-Lengthen to Generate Long Texts
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
di: Quan, Shanghaoran, et al.
Pubblicazione: (2024)
RAD: Redundancy-Aware Distillation for Hybrid Models via Self-Speculative Decoding
di: Hoshino, Yuichiro, et al.
Pubblicazione: (2025)
di: Hoshino, Yuichiro, et al.
Pubblicazione: (2025)
Semantic Self-Distillation for Language Model Uncertainty
di: Phillips, Edward, et al.
Pubblicazione: (2026)
di: Phillips, Edward, et al.
Pubblicazione: (2026)
MASSV: Multimodal Adaptation and Self-Data Distillation for Speculative Decoding of Vision-Language Models
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025)
di: Ganesan, Mugilan, et al.
Pubblicazione: (2025)
Adversarial Confusion Attack: Disrupting Multimodal Large Language Models
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2025)
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2025)
Component-Aware Self-Speculative Decoding in Hybrid Language Models
di: Borobia, Hector, et al.
Pubblicazione: (2026)
di: Borobia, Hector, et al.
Pubblicazione: (2026)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
di: Xiang, Hao, et al.
Pubblicazione: (2024)
di: Xiang, Hao, et al.
Pubblicazione: (2024)
DSCD: Large Language Model Detoxification with Self-Constrained Decoding
di: Dong, Ming, et al.
Pubblicazione: (2025)
di: Dong, Ming, et al.
Pubblicazione: (2025)
AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models
di: Zhu, Qin, et al.
Pubblicazione: (2025)
di: Zhu, Qin, et al.
Pubblicazione: (2025)
Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning
di: Ye, Ziang, et al.
Pubblicazione: (2024)
di: Ye, Ziang, et al.
Pubblicazione: (2024)
Steering Multimodal Large Language Models Decoding for Context-Aware Safety
di: Liu, Zheyuan, et al.
Pubblicazione: (2025)
di: Liu, Zheyuan, et al.
Pubblicazione: (2025)
Skill-Conditioned Gated Self-Distillation for LLM Reasoning
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
di: Huang, Jiazhen, et al.
Pubblicazione: (2026)
GATES: Self-Distillation under Privileged Context with Consensus Gating
di: Stein, Alex, et al.
Pubblicazione: (2026)
di: Stein, Alex, et al.
Pubblicazione: (2026)
Fast-Decoding Diffusion Language Models via Progress-Aware Confidence Schedules
di: Mohamed, Amr, et al.
Pubblicazione: (2025)
di: Mohamed, Amr, et al.
Pubblicazione: (2025)
Towards ASR Robust Spoken Language Understanding Through In-Context Learning With Word Confusion Networks
di: Everson, Kevin, et al.
Pubblicazione: (2024)
di: Everson, Kevin, et al.
Pubblicazione: (2024)
DAST: Difficulty-Aware Self-Training on Large Language Models
di: Xue, Boyang, et al.
Pubblicazione: (2025)
di: Xue, Boyang, et al.
Pubblicazione: (2025)
PLPP: Prompt Learning with Perplexity Is Self-Distillation for Vision-Language Models
di: Liu, Biao, et al.
Pubblicazione: (2024)
di: Liu, Biao, et al.
Pubblicazione: (2024)
No Language is an Island: Unifying Chinese and English in Financial Large Language Models, Instruction Data, and Benchmarks
di: Hu, Gang, et al.
Pubblicazione: (2024)
di: Hu, Gang, et al.
Pubblicazione: (2024)
Privacy-Aware Decoding: Mitigating Privacy Leakage of Large Language Models in Retrieval-Augmented Generation
di: Wang, Haoran, et al.
Pubblicazione: (2025)
di: Wang, Haoran, et al.
Pubblicazione: (2025)
FIRST: Teach A Reliable Large Language Model Through Efficient Trustworthy Distillation
di: Shum, KaShun, et al.
Pubblicazione: (2024)
di: Shum, KaShun, et al.
Pubblicazione: (2024)
Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
di: Zhang, Yanzhao, et al.
Pubblicazione: (2025)
di: Zhang, Yanzhao, et al.
Pubblicazione: (2025)
Unsupervised Distractor Generation via Large Language Model Distilling and Counterfactual Contrastive Decoding
di: Qu, Fanyi, et al.
Pubblicazione: (2024)
di: Qu, Fanyi, et al.
Pubblicazione: (2024)
CD4LM: Consistency Distillation and aDaptive Decoding for Diffusion Language Models
di: Liang, Yihao, et al.
Pubblicazione: (2026)
di: Liang, Yihao, et al.
Pubblicazione: (2026)
On-Policy Context Distillation for Language Models
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
di: Ye, Tianzhu, et al.
Pubblicazione: (2026)
Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models
di: Huang, Cheng Peng, et al.
Pubblicazione: (2025)
di: Huang, Cheng Peng, et al.
Pubblicazione: (2025)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
di: Sun, Yutao, et al.
Pubblicazione: (2024)
di: Sun, Yutao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention
di: Hu, Xiaomeng, et al.
Pubblicazione: (2025) -
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
di: Qiu, Zihan, et al.
Pubblicazione: (2025) -
Finding Challenging Metaphors that Confuse Pretrained Language Models
di: Li, Yucheng, et al.
Pubblicazione: (2024) -
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
di: Yuan, Chenhan, et al.
Pubblicazione: (2024) -
Vision Language Models are Confused Tourists
di: Irawan, Patrick Amadeus, et al.
Pubblicazione: (2025)