Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood
Fuente:
arXiv
Guardado en:
| Autores principales: | Lin, Xingyu, Wen, Yilin, Su, Du, Hou, Jinchang, Wang, En, Liu, Wenbin, Bao, Chenfu, Lv, Zhonghou |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
por: Lin, Xingyu, et al.
Publicado: (2025)
por: Lin, Xingyu, et al.
Publicado: (2025)
Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
por: Cai, Wang, et al.
Publicado: (2026)
por: Cai, Wang, et al.
Publicado: (2026)
Discriminative Policy Optimization for Token-Level Reward Models
por: Chen, Hongzhan, et al.
Publicado: (2025)
por: Chen, Hongzhan, et al.
Publicado: (2025)
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
por: Tan, Hongze, et al.
Publicado: (2025)
por: Tan, Hongze, et al.
Publicado: (2025)
HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark
por: Wang, Jiacheng, et al.
Publicado: (2026)
por: Wang, Jiacheng, et al.
Publicado: (2026)
Learning to Generate Secure Code via Token-Level Rewards
por: Quan, Jiazheng, et al.
Publicado: (2026)
por: Quan, Jiazheng, et al.
Publicado: (2026)
Design Conditions for Intra-Group Learning of Sequence-Level Rewards: Token Gradient Cancellation
por: Ding, Fei, et al.
Publicado: (2026)
por: Ding, Fei, et al.
Publicado: (2026)
T-REG: Preference Optimization with Token-Level Reward Regularization
por: Zhou, Wenxuan, et al.
Publicado: (2024)
por: Zhou, Wenxuan, et al.
Publicado: (2024)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
por: Li, Yunheng, et al.
Publicado: (2026)
por: Li, Yunheng, et al.
Publicado: (2026)
Selective Preference Optimization via Token-Level Reward Function Estimation
por: Yang, Kailai, et al.
Publicado: (2024)
por: Yang, Kailai, et al.
Publicado: (2024)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Resisting Contextual Interference in RAG via Parametric-Knowledge Reinforcement
por: Lin, Chenyu, et al.
Publicado: (2025)
por: Lin, Chenyu, et al.
Publicado: (2025)
RED: Unleashing Token-Level Rewards from Holistic Feedback via Reward Redistribution
por: Li, Jiahui, et al.
Publicado: (2024)
por: Li, Jiahui, et al.
Publicado: (2024)
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
por: Nguyen, Truong, et al.
Publicado: (2026)
por: Nguyen, Truong, et al.
Publicado: (2026)
TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization
por: Zhu, Mingkang, et al.
Publicado: (2025)
por: Zhu, Mingkang, et al.
Publicado: (2025)
TokenShapley: Token Level Context Attribution with Shapley Value
por: Xiao, Yingtai, et al.
Publicado: (2025)
por: Xiao, Yingtai, et al.
Publicado: (2025)
Architecting AgentOS: From Token-Level Context to Emergent System-Level Intelligence
por: Li, ChengYou, et al.
Publicado: (2026)
por: Li, ChengYou, et al.
Publicado: (2026)
Distilling Token-Trained Models into Byte-Level Models
por: Bao, Zishuo, et al.
Publicado: (2026)
por: Bao, Zishuo, et al.
Publicado: (2026)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
por: Yu, Song, et al.
Publicado: (2026)
por: Yu, Song, et al.
Publicado: (2026)
Evolutionary Token-Level Prompt Optimization for Diffusion Models
por: Neto, Domício Pereira, et al.
Publicado: (2026)
por: Neto, Domício Pereira, et al.
Publicado: (2026)
Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
por: Wei, Jingxuan, et al.
Publicado: (2024)
por: Wei, Jingxuan, et al.
Publicado: (2024)
Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level
por: Jia, Nan, et al.
Publicado: (2026)
por: Jia, Nan, et al.
Publicado: (2026)
Token-Level LLM Collaboration via FusionRoute
por: Xiong, Nuoya, et al.
Publicado: (2026)
por: Xiong, Nuoya, et al.
Publicado: (2026)
TLDR: Token-Level Detective Reward Model for Large Vision Language Models
por: Fu, Deqing, et al.
Publicado: (2024)
por: Fu, Deqing, et al.
Publicado: (2024)
TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models
por: Choo, Jinho, et al.
Publicado: (2026)
por: Choo, Jinho, et al.
Publicado: (2026)
Rethinking Personalization in Large Language Models at the Token Level
por: Zhang, Chenheng, et al.
Publicado: (2026)
por: Zhang, Chenheng, et al.
Publicado: (2026)
Beyond BEV: Optimizing Point-Level Tokens for Collaborative Perception
por: Li, Yang, et al.
Publicado: (2025)
por: Li, Yang, et al.
Publicado: (2025)
Bi-Level Optimization for Generative Recommendation: Bridging Tokenization and Generation
por: Bai, Yimeng, et al.
Publicado: (2025)
por: Bai, Yimeng, et al.
Publicado: (2025)
ResT: Reshaping Token-Level Policy Gradients for Tool-Use Large Language Models
por: Lin, Zihan, et al.
Publicado: (2025)
por: Lin, Zihan, et al.
Publicado: (2025)
Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models
por: Zhang, Xiang, et al.
Publicado: (2025)
por: Zhang, Xiang, et al.
Publicado: (2025)
Scalable Token-Level Hallucination Detection in Large Language Models
por: Min, Rui, et al.
Publicado: (2026)
por: Min, Rui, et al.
Publicado: (2026)
Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability
por: Lin, Zicheng, et al.
Publicado: (2024)
por: Lin, Zicheng, et al.
Publicado: (2024)
Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding
por: Zhu, Yifan, et al.
Publicado: (2026)
por: Zhu, Yifan, et al.
Publicado: (2026)
Token-Level Graphs for Short Text Classification
por: Donabauer, Gregor, et al.
Publicado: (2024)
por: Donabauer, Gregor, et al.
Publicado: (2024)
Towards Token-Level Text Anomaly Detection
por: Cao, Yang, et al.
Publicado: (2026)
por: Cao, Yang, et al.
Publicado: (2026)
Token-Level Privacy in Large Language Models
por: Harel, Re'em, et al.
Publicado: (2025)
por: Harel, Re'em, et al.
Publicado: (2025)
Improbable Bigrams Expose Vulnerabilities of Incomplete Tokens in Byte-Level Tokenizers
por: Jang, Eugene, et al.
Publicado: (2024)
por: Jang, Eugene, et al.
Publicado: (2024)
ProToken: Token-Level Attribution for Federated Large Language Models
por: Gill, Waris, et al.
Publicado: (2026)
por: Gill, Waris, et al.
Publicado: (2026)
Pretraining with Token-Level Adaptive Latent Chain-of-Thought
por: Zeng, Boyi, et al.
Publicado: (2026)
por: Zeng, Boyi, et al.
Publicado: (2026)
Group Think: Multiple Concurrent Reasoning Agents Collaborating at Token Level Granularity
por: Hsu, Chan-Jan, et al.
Publicado: (2025)
por: Hsu, Chan-Jan, et al.
Publicado: (2025)
Ejemplares similares
-
Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood
por: Lin, Xingyu, et al.
Publicado: (2025) -
Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis
por: Cai, Wang, et al.
Publicado: (2026) -
Discriminative Policy Optimization for Token-Level Reward Models
por: Chen, Hongzhan, et al.
Publicado: (2025) -
GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy
por: Tan, Hongze, et al.
Publicado: (2025) -
HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark
por: Wang, Jiacheng, et al.
Publicado: (2026)