Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Ye, Jing, Zhao, Xinpei, Xiang, Lu, Zhang, Yaping, Zong, Chengqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation
di: Duan, Yiwen, et al.
Pubblicazione: (2026)
di: Duan, Yiwen, et al.
Pubblicazione: (2026)
MapGuide: A Simple yet Effective Method to Reconstruct Continuous Language from Brain Activities
di: Zhao, Xinpei, et al.
Pubblicazione: (2024)
di: Zhao, Xinpei, et al.
Pubblicazione: (2024)
EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World
di: Ye, Jing, et al.
Pubblicazione: (2026)
di: Ye, Jing, et al.
Pubblicazione: (2026)
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
di: Ye, Jing, et al.
Pubblicazione: (2025)
di: Ye, Jing, et al.
Pubblicazione: (2025)
PromptDLA: A Domain-aware Prompt Document Layout Analysis Framework with Descriptive Knowledge as a Cue
di: Zhang, Zirui, et al.
Pubblicazione: (2026)
di: Zhang, Zirui, et al.
Pubblicazione: (2026)
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency
di: Liang, Yupu, et al.
Pubblicazione: (2025)
di: Liang, Yupu, et al.
Pubblicazione: (2025)
ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts
di: Zhang, Yaping, et al.
Pubblicazione: (2026)
di: Zhang, Yaping, et al.
Pubblicazione: (2026)
EchoRL: Reinforcement Learning via Rollout Echoing
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
di: Bi, Jinhe, et al.
Pubblicazione: (2026)
SweetieChat: A Strategy-Enhanced Role-playing Framework for Diverse Scenarios Handling Emotional Support Agent
di: Ye, Jing, et al.
Pubblicazione: (2024)
di: Ye, Jing, et al.
Pubblicazione: (2024)
Verbal Werewolf: Engage Users with Verbalized Agentic Werewolf Game Framework
di: Fan, Qihui, et al.
Pubblicazione: (2025)
di: Fan, Qihui, et al.
Pubblicazione: (2025)
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
di: Zhang, Yaping, et al.
Pubblicazione: (2025)
di: Zhang, Yaping, et al.
Pubblicazione: (2025)
Verco: Learning Coordinated Verbal Communication for Multi-agent Reinforcement Learning
di: Li, Dapeng, et al.
Pubblicazione: (2024)
di: Li, Dapeng, et al.
Pubblicazione: (2024)
Echo: Learning from Experience Data via User-Driven Refinement
di: Dong, Hande, et al.
Pubblicazione: (2026)
di: Dong, Hande, et al.
Pubblicazione: (2026)
Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model
di: Li, Chong, et al.
Pubblicazione: (2025)
di: Li, Chong, et al.
Pubblicazione: (2025)
Diffusion-Modeled Reinforcement Learning for Carbon and Risk-Aware Microgrid Optimization
di: Zhao, Yunyi, et al.
Pubblicazione: (2025)
di: Zhao, Yunyi, et al.
Pubblicazione: (2025)
Language Models Can Learn from Verbal Feedback Without Scalar Rewards
di: Luo, Renjie, et al.
Pubblicazione: (2025)
di: Luo, Renjie, et al.
Pubblicazione: (2025)
OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
di: Bi, Zhenyu, et al.
Pubblicazione: (2025)
di: Bi, Zhenyu, et al.
Pubblicazione: (2025)
A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities
di: Xiang, Lu, et al.
Pubblicazione: (2025)
di: Xiang, Lu, et al.
Pubblicazione: (2025)
X-Instruction: Aligning Language Model in Low-resource Languages with Self-curated Cross-lingual Instructions
di: Li, Chong, et al.
Pubblicazione: (2024)
di: Li, Chong, et al.
Pubblicazione: (2024)
UCPO: Uncertainty-Aware Policy Optimization
di: Zeng, Xianzhou, et al.
Pubblicazione: (2026)
di: Zeng, Xianzhou, et al.
Pubblicazione: (2026)
Parallel Scaling Law: Unveiling Reasoning Generalization through A Cross-Linguistic Perspective
di: Yang, Wen, et al.
Pubblicazione: (2025)
di: Yang, Wen, et al.
Pubblicazione: (2025)
Language Imbalance Driven Rewarding for Multilingual Self-improving
di: Yang, Wen, et al.
Pubblicazione: (2024)
di: Yang, Wen, et al.
Pubblicazione: (2024)
Implicit Cross-Lingual Rewarding for Efficient Multilingual Preference Alignment
di: Yang, Wen, et al.
Pubblicazione: (2025)
di: Yang, Wen, et al.
Pubblicazione: (2025)
GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning
di: Zhang, Han, et al.
Pubblicazione: (2025)
di: Zhang, Han, et al.
Pubblicazione: (2025)
Human-Aware Robot Navigation via Reinforcement Learning with Hindsight Experience Replay and Curriculum Learning
di: Li, Keyu, et al.
Pubblicazione: (2021)
di: Li, Keyu, et al.
Pubblicazione: (2021)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
di: Yao, Yihang, et al.
Pubblicazione: (2023)
di: Yao, Yihang, et al.
Pubblicazione: (2023)
PaVeRL-SQL: Text-to-SQL via Partial-Match Rewards and Verbal Reinforcement Learning
di: Hao, Heng, et al.
Pubblicazione: (2025)
di: Hao, Heng, et al.
Pubblicazione: (2025)
Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization
di: Hua, Xingyuan, et al.
Pubblicazione: (2026)
di: Hua, Xingyuan, et al.
Pubblicazione: (2026)
CHDP: Cooperative Hybrid Diffusion Policies for Reinforcement Learning in Parameterized Action Space
di: Liu, Bingyi, et al.
Pubblicazione: (2026)
di: Liu, Bingyi, et al.
Pubblicazione: (2026)
ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning
di: Zhao, Chu, et al.
Pubblicazione: (2026)
di: Zhao, Chu, et al.
Pubblicazione: (2026)
SimulPL: Aligning Human Preferences in Simultaneous Machine Translation
di: Yu, Donglei, et al.
Pubblicazione: (2025)
di: Yu, Donglei, et al.
Pubblicazione: (2025)
Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
di: Zhang, Tianle, et al.
Pubblicazione: (2024)
User-Aware Conditional Generative Total Correlation Learning for Multi-Modal Recommendation
di: Du, Jing, et al.
Pubblicazione: (2026)
di: Du, Jing, et al.
Pubblicazione: (2026)
CLPO: Curriculum Learning meets Policy Optimization for LLM Reasoning
di: Zhang, Shijie, et al.
Pubblicazione: (2025)
di: Zhang, Shijie, et al.
Pubblicazione: (2025)
Dependency-Aware CAV Task Scheduling via Diffusion-Based Reinforcement Learning
di: Cheng, Xiang, et al.
Pubblicazione: (2024)
di: Cheng, Xiang, et al.
Pubblicazione: (2024)
LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations
di: Zhang, Caiqi, et al.
Pubblicazione: (2025)
di: Zhang, Caiqi, et al.
Pubblicazione: (2025)
ShipTraj-R1: Reinforcing Ship Trajectory Prediction in Large Language Models via Group Relative Policy Optimization
di: Zhan, Yang, et al.
Pubblicazione: (2026)
di: Zhan, Yang, et al.
Pubblicazione: (2026)
Reinforcing Language Agents via Policy Optimization with Action Decomposition
di: Wen, Muning, et al.
Pubblicazione: (2024)
di: Wen, Muning, et al.
Pubblicazione: (2024)
Salience-Invariant Consistent Policy Learning for Generalization in Visual Reinforcement Learning
di: Sun, Jingbo, et al.
Pubblicazione: (2025)
di: Sun, Jingbo, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation
di: Duan, Yiwen, et al.
Pubblicazione: (2026) -
MapGuide: A Simple yet Effective Method to Reconstruct Continuous Language from Brain Activities
di: Zhao, Xinpei, et al.
Pubblicazione: (2024) -
EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World
di: Ye, Jing, et al.
Pubblicazione: (2026) -
From Generic Empathy to Personalized Emotional Support: A Self-Evolution Framework for User Preference Alignment
di: Ye, Jing, et al.
Pubblicazione: (2025) -
PromptDLA: A Domain-aware Prompt Document Layout Analysis Framework with Descriptive Knowledge as a Cue
di: Zhang, Zirui, et al.
Pubblicazione: (2026)