TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Choo, Jinho, Lee, JunSeung, Kim, Jimyeong, Song, Yeeho, Hong, S. K., Kwon, Yeong-Dae |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reinforcement learning to learn quantum states for Heisenberg scaling accuracy
di: Jae, Jeongwoo, et al.
Pubblicazione: (2024)
di: Jae, Jeongwoo, et al.
Pubblicazione: (2024)
Reinforcement Learning to Learn Quantum States for Heisenberg Scaling Accuracy
di: Jeongwoo Jae, et al.
Pubblicazione: (2025)
di: Jeongwoo Jae, et al.
Pubblicazione: (2025)
Understanding and Mitigating Language Confusion in LLMs
di: Marchisio, Kelly, et al.
Pubblicazione: (2024)
di: Marchisio, Kelly, et al.
Pubblicazione: (2024)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2025)
di: Nie, Ercong, et al.
Pubblicazione: (2025)
Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal Transport
di: Choi, Minseok, et al.
Pubblicazione: (2024)
di: Choi, Minseok, et al.
Pubblicazione: (2024)
Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
di: Xu, Mufan, et al.
Pubblicazione: (2026)
di: Xu, Mufan, et al.
Pubblicazione: (2026)
Preference Consistency Matters: Enhancing Preference Learning in Language Models with Automated Self-Curation of Training Corpora
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
di: Lee, JoonHo, et al.
Pubblicazione: (2024)
Controlling Language Confusion in Multilingual LLMs
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
di: Lin, Zihan, et al.
Pubblicazione: (2025)
di: Lin, Zihan, et al.
Pubblicazione: (2025)
SCALE: Upscaled Continual Learning of Large Language Models
di: Lee, Jin-woo, et al.
Pubblicazione: (2025)
di: Lee, Jin-woo, et al.
Pubblicazione: (2025)
When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models
di: Park, Jungwon, et al.
Pubblicazione: (2026)
di: Park, Jungwon, et al.
Pubblicazione: (2026)
CAAP: Context-Aware Action Planning Prompting to Solve Computer Tasks with Front-End UI Only
di: Cho, Junhee, et al.
Pubblicazione: (2024)
di: Cho, Junhee, et al.
Pubblicazione: (2024)
CPR: Mitigating Large Language Model Hallucinations with Curative Prompt Refinement
di: Shim, Jung-Woo, et al.
Pubblicazione: (2025)
di: Shim, Jung-Woo, et al.
Pubblicazione: (2025)
Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
di: Shim, Jung-Woo, et al.
Pubblicazione: (2025)
di: Shim, Jung-Woo, et al.
Pubblicazione: (2025)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
di: Lee, Hong kyu, et al.
Pubblicazione: (2025)
di: Lee, Hong kyu, et al.
Pubblicazione: (2025)
Token-Level Privacy in Large Language Models
di: Harel, Re'em, et al.
Pubblicazione: (2025)
di: Harel, Re'em, et al.
Pubblicazione: (2025)
Rethinking Personalization in Large Language Models at the Token Level
di: Zhang, Chenheng, et al.
Pubblicazione: (2026)
di: Zhang, Chenheng, et al.
Pubblicazione: (2026)
Adversarial Confusion Attack: Disrupting Multimodal Large Language Models
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2025)
di: Hoscilowicz, Jakub, et al.
Pubblicazione: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
di: Lin, Xingyu, et al.
Pubblicazione: (2026)
di: Lin, Xingyu, et al.
Pubblicazione: (2026)
Discriminative Policy Optimization for Token-Level Reward Models
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
di: Chen, Hongzhan, et al.
Pubblicazione: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
di: Lin, Xingyu, et al.
Pubblicazione: (2025)
di: Lin, Xingyu, et al.
Pubblicazione: (2025)
Cross-Lingual Optimization for Language Transfer in Large Language Models
di: Lee, Jungseob, et al.
Pubblicazione: (2025)
di: Lee, Jungseob, et al.
Pubblicazione: (2025)
Accelerating Multilingual Language Model for Excessively Tokenized Languages
di: Hong, Jimin, et al.
Pubblicazione: (2024)
di: Hong, Jimin, et al.
Pubblicazione: (2024)
Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support Conversation
di: Kang, Dongjin, et al.
Pubblicazione: (2024)
di: Kang, Dongjin, et al.
Pubblicazione: (2024)
GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
di: Kim, Jieyong, et al.
Pubblicazione: (2025)
di: Kim, Jieyong, et al.
Pubblicazione: (2025)
Mitigating Entity-Level Hallucination in Large Language Models
di: Su, Weihang, et al.
Pubblicazione: (2024)
di: Su, Weihang, et al.
Pubblicazione: (2024)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
di: Park, Cheonbok, et al.
Pubblicazione: (2025)
di: Park, Cheonbok, et al.
Pubblicazione: (2025)
StablePrompt: Automatic Prompt Tuning using Reinforcement Learning for Large Language Models
di: Kwon, Minchan, et al.
Pubblicazione: (2024)
di: Kwon, Minchan, et al.
Pubblicazione: (2024)
Can Tool-augmented Large Language Models be Aware of Incomplete Conditions?
di: Yang, Seungbin, et al.
Pubblicazione: (2024)
di: Yang, Seungbin, et al.
Pubblicazione: (2024)
CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model
di: Go, Dongyoung, et al.
Pubblicazione: (2024)
di: Go, Dongyoung, et al.
Pubblicazione: (2024)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
di: Kim, June-Woo, et al.
Pubblicazione: (2025)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
di: Hong, Jiseung, et al.
Pubblicazione: (2025)
di: Hong, Jiseung, et al.
Pubblicazione: (2025)
Keep Security! Benchmarking Security Policy Preservation in Large Language Model Contexts Against Indirect Attacks in Question Answering
di: Chang, Hwan, et al.
Pubblicazione: (2025)
di: Chang, Hwan, et al.
Pubblicazione: (2025)
Large Language Model as Token Compressor and Decompressor
di: Li, Wenbing, et al.
Pubblicazione: (2026)
di: Li, Wenbing, et al.
Pubblicazione: (2026)
Soft Head Selection for Injecting ICL-Derived Task Embeddings
di: Park, Jungwon, et al.
Pubblicazione: (2025)
di: Park, Jungwon, et al.
Pubblicazione: (2025)
Token-Level Entropy Reveals Demographic Disparities in Language Models
di: Lee, Messi H. J.
Pubblicazione: (2025)
di: Lee, Messi H. J.
Pubblicazione: (2025)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
di: Hong, Haitao, et al.
Pubblicazione: (2025)
di: Hong, Haitao, et al.
Pubblicazione: (2025)
Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
di: Yang, Zhipeng, et al.
Pubblicazione: (2026)
di: Yang, Zhipeng, et al.
Pubblicazione: (2026)
Scalable Token-Level Hallucination Detection in Large Language Models
di: Min, Rui, et al.
Pubblicazione: (2026)
di: Min, Rui, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Reinforcement learning to learn quantum states for Heisenberg scaling accuracy
di: Jae, Jeongwoo, et al.
Pubblicazione: (2024) -
Reinforcement Learning to Learn Quantum States for Heisenberg Scaling Accuracy
di: Jeongwoo Jae, et al.
Pubblicazione: (2025) -
Understanding and Mitigating Language Confusion in LLMs
di: Marchisio, Kelly, et al.
Pubblicazione: (2024) -
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
di: Nie, Ercong, et al.
Pubblicazione: (2025) -
Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal Transport
di: Choi, Minseok, et al.
Pubblicazione: (2024)