SERM: Self-Evolving Relevance Model with Agent-Driven Learning from Massive Query Streams
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Chenglong, Li, Canjia, Zhu, Xingzhao, Huo, Yifu, Wang, Huiyu, Lin, Weixiong, Yang, Yun, He, Qiaozhi, Zhou, Tianhua, Chang, Xiaojia, Zhu, Jingbo, Xiao, Tong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
von: Huo, Yifu, et al.
Veröffentlicht: (2026)
von: Huo, Yifu, et al.
Veröffentlicht: (2026)
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
von: Wang, Chenglong, et al.
Veröffentlicht: (2026)
von: Wang, Chenglong, et al.
Veröffentlicht: (2026)
APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
von: Chang, Kaiyan, et al.
Veröffentlicht: (2026)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2026)
LRHP: Learning Representations for Human Preferences via Preference Pairs
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
GRAM: A Generative Foundation Reward Model for Reward Generalization
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
LaTeXTrans: Structured LaTeX Translation with Multi-Agent Coordination
von: Zhu, Ziming, et al.
Veröffentlicht: (2025)
von: Zhu, Ziming, et al.
Veröffentlicht: (2025)
When Scaling Fails: Mitigating Audio Perception Decay of LALMs via Multi-Step Perception-Aware Reasoning
von: Mao, Ruixiang, et al.
Veröffentlicht: (2026)
von: Mao, Ruixiang, et al.
Veröffentlicht: (2026)
Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
GRAM-R$^2$: Self-Training Generative Foundation Reward Models for Reward Reasoning
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)
HEAL: A Hypothesis-Based Preference-Aware Analysis Framework
von: Huo, Yifu, et al.
Veröffentlicht: (2025)
von: Huo, Yifu, et al.
Veröffentlicht: (2025)
Boosting Text-To-Image Generation via Multilingual Prompting in Large Multimodal Models
von: Mu, Yongyu, et al.
Veröffentlicht: (2025)
von: Mu, Yongyu, et al.
Veröffentlicht: (2025)
DaPT: A Dual-Path Framework for Multilingual Multi-hop Question Answering
von: Wang, Yilin, et al.
Veröffentlicht: (2026)
von: Wang, Yilin, et al.
Veröffentlicht: (2026)
Self-Consolidation for Self-Evolving Agents
von: Yu, Hongzhuo, et al.
Veröffentlicht: (2026)
von: Yu, Hongzhuo, et al.
Veröffentlicht: (2026)
Efficient Prompting Methods for Large Language Models: A Survey
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
von: Chang, Kaiyan, et al.
Veröffentlicht: (2024)
EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle
von: Wu, Rong, et al.
Veröffentlicht: (2025)
von: Wu, Rong, et al.
Veröffentlicht: (2025)
Prior Constraints-based Reward Model Training for Aligning Large Language Models
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
von: Zhou, Hang, et al.
Veröffentlicht: (2024)
Robust Wideband Channel Estimation for mmWave Massive MIMO Systems With Beam Squint
von: Ge, Li, et al.
Veröffentlicht: (2022)
von: Ge, Li, et al.
Veröffentlicht: (2022)
On Safety Risks in Experience-Driven Self-Evolving Agents
von: Zhao, Weixiang, et al.
Veröffentlicht: (2026)
von: Zhao, Weixiang, et al.
Veröffentlicht: (2026)
Cross-layer Attention Sharing for Pre-trained Large Language Models
von: Mu, Yongyu, et al.
Veröffentlicht: (2024)
von: Mu, Yongyu, et al.
Veröffentlicht: (2024)
Hybrid Alignment Training for Large Language Models
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
von: Wang, Chenglong, et al.
Veröffentlicht: (2024)
Foundations of Large Language Models
von: Xiao, Tong, et al.
Veröffentlicht: (2025)
von: Xiao, Tong, et al.
Veröffentlicht: (2025)
Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization
von: He, Shan, et al.
Veröffentlicht: (2026)
von: He, Shan, et al.
Veröffentlicht: (2026)
Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
von: Cheng, Zihao, et al.
Veröffentlicht: (2026)
von: Cheng, Zihao, et al.
Veröffentlicht: (2026)
SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking
von: Li, Jindong, et al.
Veröffentlicht: (2026)
von: Li, Jindong, et al.
Veröffentlicht: (2026)
EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks
von: Feng, Tongtong, et al.
Veröffentlicht: (2025)
von: Feng, Tongtong, et al.
Veröffentlicht: (2025)
Ratchet: A Minimal Hygiene Recipe for Self-Evolving LLM Agents
von: Zhang, Xing, et al.
Veröffentlicht: (2026)
von: Zhang, Xing, et al.
Veröffentlicht: (2026)
Randomized Neural Networks for Partial Differential Equation on Static and Evolving Surfaces
von: Sun, Jingbo, et al.
Veröffentlicht: (2026)
von: Sun, Jingbo, et al.
Veröffentlicht: (2026)
WISE-Flow: Workflow-Induced Structured Experience for Self-Evolving Conversational Service Agents
von: Zhou, Yuqing, et al.
Veröffentlicht: (2026)
von: Zhou, Yuqing, et al.
Veröffentlicht: (2026)
MineEvolve: Self-Evolution with Accumulated Knowledge for Long-Horizon Embodied Minecraft Agents
von: Xie, Zhengwei, et al.
Veröffentlicht: (2026)
von: Xie, Zhengwei, et al.
Veröffentlicht: (2026)
RouteLMT: Learned Sample Routing for Hybrid LLM Translation Deployment
von: Luo, Yingfeng, et al.
Veröffentlicht: (2026)
von: Luo, Yingfeng, et al.
Veröffentlicht: (2026)
Learning Evaluation Models from Large Language Models for Sequence Generation
von: Wang, Chenglong, et al.
Veröffentlicht: (2023)
von: Wang, Chenglong, et al.
Veröffentlicht: (2023)
Multi-Agent Evolve: LLM Self-Improve through Co-evolution
von: Chen, Yixing, et al.
Veröffentlicht: (2025)
von: Chen, Yixing, et al.
Veröffentlicht: (2025)
Multi-Satellite Multi-Stream Beamspace Massive MIMO Transmission
von: Wang, Yafei, et al.
Veröffentlicht: (2025)
von: Wang, Yafei, et al.
Veröffentlicht: (2025)
Agents of Change: Self-Evolving LLM Agents for Strategic Planning
von: Belle, Nikolas, et al.
Veröffentlicht: (2025)
von: Belle, Nikolas, et al.
Veröffentlicht: (2025)
Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents
von: Fan, Zhiyuan, et al.
Veröffentlicht: (2026)
von: Fan, Zhiyuan, et al.
Veröffentlicht: (2026)
Alita-G: Self-Evolving Generative Agent for Agent Generation
von: Qiu, Jiahao, et al.
Veröffentlicht: (2025)
von: Qiu, Jiahao, et al.
Veröffentlicht: (2025)
Smoothed Score Queries and the Complexity of Sampling
von: Liu, Jingbo
Veröffentlicht: (2026)
von: Liu, Jingbo
Veröffentlicht: (2026)
Proteoform Identification Using Multiplexed Top‐Down Mass Spectra
von: Zhige Wang, et al.
Veröffentlicht: (2025)
von: Zhige Wang, et al.
Veröffentlicht: (2025)
Aligning Query Representation with Rewritten Query and Relevance Judgments in Conversational Search
von: Mo, Fengran, et al.
Veröffentlicht: (2024)
von: Mo, Fengran, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models
von: Huo, Yifu, et al.
Veröffentlicht: (2026) -
MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning
von: Wang, Chenglong, et al.
Veröffentlicht: (2026) -
APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards
von: Chang, Kaiyan, et al.
Veröffentlicht: (2026) -
LRHP: Learning Representations for Human Preferences via Preference Pairs
von: Wang, Chenglong, et al.
Veröffentlicht: (2024) -
GRAM: A Generative Foundation Reward Model for Reward Generalization
von: Wang, Chenglong, et al.
Veröffentlicht: (2025)