TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Choo, Jinho, Lee, JunSeung, Kim, Jimyeong, Song, Yeeho, Hong, S. K., Kwon, Yeong-Dae |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reinforcement learning to learn quantum states for Heisenberg scaling accuracy
par: Jae, Jeongwoo, et autres
Publié: (2024)
par: Jae, Jeongwoo, et autres
Publié: (2024)
Reinforcement Learning to Learn Quantum States for Heisenberg Scaling Accuracy
par: Jeongwoo Jae, et autres
Publié: (2025)
par: Jeongwoo Jae, et autres
Publié: (2025)
Understanding and Mitigating Language Confusion in LLMs
par: Marchisio, Kelly, et autres
Publié: (2024)
par: Marchisio, Kelly, et autres
Publié: (2024)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
par: Nie, Ercong, et autres
Publié: (2025)
par: Nie, Ercong, et autres
Publié: (2025)
Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal Transport
par: Choi, Minseok, et autres
Publié: (2024)
par: Choi, Minseok, et autres
Publié: (2024)
Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models
par: Xu, Mufan, et autres
Publié: (2026)
par: Xu, Mufan, et autres
Publié: (2026)
Preference Consistency Matters: Enhancing Preference Learning in Language Models with Automated Self-Curation of Training Corpora
par: Lee, JoonHo, et autres
Publié: (2024)
par: Lee, JoonHo, et autres
Publié: (2024)
Controlling Language Confusion in Multilingual LLMs
par: Lee, Nahyun, et autres
Publié: (2025)
par: Lee, Nahyun, et autres
Publié: (2025)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
par: Lin, Zihan, et autres
Publié: (2025)
par: Lin, Zihan, et autres
Publié: (2025)
SCALE: Upscaled Continual Learning of Large Language Models
par: Lee, Jin-woo, et autres
Publié: (2025)
par: Lee, Jin-woo, et autres
Publié: (2025)
When Confidence Misleads: Suffix Anchoring and Anchor-Proximity Confidence Modulation for Diffusion Language Models
par: Park, Jungwon, et autres
Publié: (2026)
par: Park, Jungwon, et autres
Publié: (2026)
CAAP: Context-Aware Action Planning Prompting to Solve Computer Tasks with Front-End UI Only
par: Cho, Junhee, et autres
Publié: (2024)
par: Cho, Junhee, et autres
Publié: (2024)
CPR: Mitigating Large Language Model Hallucinations with Curative Prompt Refinement
par: Shim, Jung-Woo, et autres
Publié: (2025)
par: Shim, Jung-Woo, et autres
Publié: (2025)
Multi-stage Prompt Refinement for Mitigating Hallucinations in Large Language Models
par: Shim, Jung-Woo, et autres
Publié: (2025)
par: Shim, Jung-Woo, et autres
Publié: (2025)
Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning
par: Lee, Hong kyu, et autres
Publié: (2025)
par: Lee, Hong kyu, et autres
Publié: (2025)
Token-Level Privacy in Large Language Models
par: Harel, Re'em, et autres
Publié: (2025)
par: Harel, Re'em, et autres
Publié: (2025)
Rethinking Personalization in Large Language Models at the Token Level
par: Zhang, Chenheng, et autres
Publié: (2026)
par: Zhang, Chenheng, et autres
Publié: (2026)
Adversarial Confusion Attack: Disrupting Multimodal Large Language Models
par: Hoscilowicz, Jakub, et autres
Publié: (2025)
par: Hoscilowicz, Jakub, et autres
Publié: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
par: Lin, Xingyu, et autres
Publié: (2026)
par: Lin, Xingyu, et autres
Publié: (2026)
Discriminative Policy Optimization for Token-Level Reward Models
par: Chen, Hongzhan, et autres
Publié: (2025)
par: Chen, Hongzhan, et autres
Publié: (2025)
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
par: Lin, Xingyu, et autres
Publié: (2025)
par: Lin, Xingyu, et autres
Publié: (2025)
Cross-Lingual Optimization for Language Transfer in Large Language Models
par: Lee, Jungseob, et autres
Publié: (2025)
par: Lee, Jungseob, et autres
Publié: (2025)
Accelerating Multilingual Language Model for Excessively Tokenized Languages
par: Hong, Jimin, et autres
Publié: (2024)
par: Hong, Jimin, et autres
Publié: (2024)
Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support Conversation
par: Kang, Dongjin, et autres
Publié: (2024)
par: Kang, Dongjin, et autres
Publié: (2024)
GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
par: Zhang, Zhibo, et autres
Publié: (2024)
par: Zhang, Zhibo, et autres
Publié: (2024)
RPM: Reasoning-Level Personalization for Black-Box Large Language Models
par: Kim, Jieyong, et autres
Publié: (2025)
par: Kim, Jieyong, et autres
Publié: (2025)
Mitigating Entity-Level Hallucination in Large Language Models
par: Su, Weihang, et autres
Publié: (2024)
par: Su, Weihang, et autres
Publié: (2024)
Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models
par: Park, Cheonbok, et autres
Publié: (2025)
par: Park, Cheonbok, et autres
Publié: (2025)
StablePrompt: Automatic Prompt Tuning using Reinforcement Learning for Large Language Models
par: Kwon, Minchan, et autres
Publié: (2024)
par: Kwon, Minchan, et autres
Publié: (2024)
Can Tool-augmented Large Language Models be Aware of Incomplete Conditions?
par: Yang, Seungbin, et autres
Publié: (2024)
par: Yang, Seungbin, et autres
Publié: (2024)
CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model
par: Go, Dongyoung, et autres
Publié: (2024)
par: Go, Dongyoung, et autres
Publié: (2024)
Language-Agnostic Suicidal Risk Detection Using Large Language Models
par: Kim, June-Woo, et autres
Publié: (2025)
par: Kim, June-Woo, et autres
Publié: (2025)
Measuring Sycophancy of Language Models in Multi-turn Dialogues
par: Hong, Jiseung, et autres
Publié: (2025)
par: Hong, Jiseung, et autres
Publié: (2025)
Keep Security! Benchmarking Security Policy Preservation in Large Language Model Contexts Against Indirect Attacks in Question Answering
par: Chang, Hwan, et autres
Publié: (2025)
par: Chang, Hwan, et autres
Publié: (2025)
Large Language Model as Token Compressor and Decompressor
par: Li, Wenbing, et autres
Publié: (2026)
par: Li, Wenbing, et autres
Publié: (2026)
Soft Head Selection for Injecting ICL-Derived Task Embeddings
par: Park, Jungwon, et autres
Publié: (2025)
par: Park, Jungwon, et autres
Publié: (2025)
Token-Level Entropy Reveals Demographic Disparities in Language Models
par: Lee, Messi H. J.
Publié: (2025)
par: Lee, Messi H. J.
Publié: (2025)
Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models
par: Hong, Haitao, et autres
Publié: (2025)
par: Hong, Haitao, et autres
Publié: (2025)
Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness
par: Yang, Zhipeng, et autres
Publié: (2026)
par: Yang, Zhipeng, et autres
Publié: (2026)
Scalable Token-Level Hallucination Detection in Large Language Models
par: Min, Rui, et autres
Publié: (2026)
par: Min, Rui, et autres
Publié: (2026)
Documents similaires
-
Reinforcement learning to learn quantum states for Heisenberg scaling accuracy
par: Jae, Jeongwoo, et autres
Publié: (2024) -
Reinforcement Learning to Learn Quantum States for Heisenberg Scaling Accuracy
par: Jeongwoo Jae, et autres
Publié: (2025) -
Understanding and Mitigating Language Confusion in LLMs
par: Marchisio, Kelly, et autres
Publié: (2024) -
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
par: Nie, Ercong, et autres
Publié: (2025) -
Opt-Out: Investigating Entity-Level Unlearning for Large Language Models via Optimal Transport
par: Choi, Minseok, et autres
Publié: (2024)