ECHO: Entropy-Confidence Hybrid Optimization for Test-Time Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhao, Chu, Yang, Enneng, Liu, Yuting, Zhao, Jianzhe, Guo, Guibing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Symmetric Graph Contrastive Learning against Noisy Views for Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2024)
di: Zhao, Chu, et al.
Pubblicazione: (2024)
Distributionally Robust Graph Out-of-Distribution Recommendation via Diffusion Model
di: Zhao, Chu, et al.
Pubblicazione: (2025)
di: Zhao, Chu, et al.
Pubblicazione: (2025)
Efficient Prompt Tuning by Multi-Space Projection and Prompt Fusion
di: Lan, Pengxiang, et al.
Pubblicazione: (2024)
di: Lan, Pengxiang, et al.
Pubblicazione: (2024)
Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2026)
di: Zhao, Chu, et al.
Pubblicazione: (2026)
Graph Representation Learning via Causal Diffusion for Out-of-Distribution Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2024)
di: Zhao, Chu, et al.
Pubblicazione: (2024)
Causal Negative Sampling via Diffusion Model for Out-of-Distribution Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2025)
di: Zhao, Chu, et al.
Pubblicazione: (2025)
Hard Negative Sampling via Large Language Models for Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2025)
di: Zhao, Chu, et al.
Pubblicazione: (2025)
ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism
di: Liu, Jia, et al.
Pubblicazione: (2025)
di: Liu, Jia, et al.
Pubblicazione: (2025)
Efficient and Effective Prompt Tuning via Prompt Decomposition and Compressed Outer Product
di: Lan, Pengxiang, et al.
Pubblicazione: (2025)
di: Lan, Pengxiang, et al.
Pubblicazione: (2025)
SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
Representation Surgery for Multi-Task Model Merging
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
Reinforcement Learning Teachers of Test Time Scaling
di: Cetin, Edoardo, et al.
Pubblicazione: (2025)
di: Cetin, Edoardo, et al.
Pubblicazione: (2025)
Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities
di: Yang, Enneng, et al.
Pubblicazione: (2024)
di: Yang, Enneng, et al.
Pubblicazione: (2024)
CAdam: Confidence-Based Optimization for Online Learning
di: Wang, Shaowen, et al.
Pubblicazione: (2024)
di: Wang, Shaowen, et al.
Pubblicazione: (2024)
FedLoRA-Optimizer: Federated LoRA Fine-Tuning with Global and Local Optimization in Heterogeneous Data Scenarios
di: Zhao, Jianzhe, et al.
Pubblicazione: (2025)
di: Zhao, Jianzhe, et al.
Pubblicazione: (2025)
Test-driven Reinforcement Learning in Continuous Control
di: Yu, Zhao, et al.
Pubblicazione: (2025)
di: Yu, Zhao, et al.
Pubblicazione: (2025)
Data Augmentation as Free Lunch: Exploring the Test-Time Augmentation for Sequential Recommendation
di: Dang, Yizhou, et al.
Pubblicazione: (2025)
di: Dang, Yizhou, et al.
Pubblicazione: (2025)
Multi-Scenario Combination Based on Multi-Agent Reinforcement Learning to Optimize the Advertising Recommendation System
di: Zhao, Yang, et al.
Pubblicazione: (2024)
di: Zhao, Yang, et al.
Pubblicazione: (2024)
Offline Trajectory Optimization for Offline Reinforcement Learning
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
di: Zhao, Ziqi, et al.
Pubblicazione: (2024)
Entropy Centroids as Intrinsic Rewards for Test-Time Scaling
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
di: Zhao, Wenshuo, et al.
Pubblicazione: (2026)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
di: Xu, Huimin, et al.
Pubblicazione: (2026)
di: Xu, Huimin, et al.
Pubblicazione: (2026)
Entropy-Preserving Reinforcement Learning
di: Petrenko, Aleksei, et al.
Pubblicazione: (2026)
di: Petrenko, Aleksei, et al.
Pubblicazione: (2026)
Learning on the Job: Test-Time Curricula for Targeted Reinforcement Learning
di: Hübotter, Jonas, et al.
Pubblicazione: (2025)
di: Hübotter, Jonas, et al.
Pubblicazione: (2025)
ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
ECHO: Encoding Communities via High-order Operators
di: Ferrara, Emilio
Pubblicazione: (2026)
di: Ferrara, Emilio
Pubblicazione: (2026)
GraphRARE: Reinforcement Learning Enhanced Graph Neural Network with Relative Entropy
di: Peng, Tianhao, et al.
Pubblicazione: (2023)
di: Peng, Tianhao, et al.
Pubblicazione: (2023)
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning
di: Yao, Yihang, et al.
Pubblicazione: (2023)
di: Yao, Yihang, et al.
Pubblicazione: (2023)
Sample and Computationally Efficient Continuous-Time Reinforcement Learning with General Function Approximation
di: Zhao, Runze, et al.
Pubblicazione: (2025)
di: Zhao, Runze, et al.
Pubblicazione: (2025)
MobileRL: Online Agentic Reinforcement Learning for Mobile GUI Agents
di: Xu, Yifan, et al.
Pubblicazione: (2025)
di: Xu, Yifan, et al.
Pubblicazione: (2025)
EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance
di: Yu, Song, et al.
Pubblicazione: (2026)
di: Yu, Song, et al.
Pubblicazione: (2026)
A Comprehensive Survey of Forgetting in Deep Learning Beyond Continual Learning
di: Wang, Zhenyi, et al.
Pubblicazione: (2023)
di: Wang, Zhenyi, et al.
Pubblicazione: (2023)
Generalized Embedding Machines for Recommender Systems
di: Yang, Enneng, et al.
Pubblicazione: (2020)
di: Yang, Enneng, et al.
Pubblicazione: (2020)
C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions
di: Kubo, Kenji, et al.
Pubblicazione: (2026)
di: Kubo, Kenji, et al.
Pubblicazione: (2026)
Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
di: Qu, Yuxiao, et al.
Pubblicazione: (2025)
What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time
di: Yan, Dong, et al.
Pubblicazione: (2026)
di: Yan, Dong, et al.
Pubblicazione: (2026)
Maximum Entropy Reinforcement Learning with Diffusion Policy
di: Dong, Xiaoyi, et al.
Pubblicazione: (2025)
di: Dong, Xiaoyi, et al.
Pubblicazione: (2025)
A New Error Temporal Difference Algorithm for Deep Reinforcement Learning in Microgrid Optimization
di: Yao, Fulong, et al.
Pubblicazione: (2025)
di: Yao, Fulong, et al.
Pubblicazione: (2025)
DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards
di: Hu, Haoyu, et al.
Pubblicazione: (2026)
di: Hu, Haoyu, et al.
Pubblicazione: (2026)
Learning Future Representation with Synthetic Observations for Sample-efficient Reinforcement Learning
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis
di: Bai, Sikai, et al.
Pubblicazione: (2026)
di: Bai, Sikai, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Symmetric Graph Contrastive Learning against Noisy Views for Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2024) -
Distributionally Robust Graph Out-of-Distribution Recommendation via Diffusion Model
di: Zhao, Chu, et al.
Pubblicazione: (2025) -
Efficient Prompt Tuning by Multi-Space Projection and Prompt Fusion
di: Lan, Pengxiang, et al.
Pubblicazione: (2024) -
Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2026) -
Graph Representation Learning via Causal Diffusion for Out-of-Distribution Recommendation
di: Zhao, Chu, et al.
Pubblicazione: (2024)