EchoRL: Reinforcement Learning via Rollout Echoing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bi, Jinhe, Aniri, Yang, Minglai, Zhou, Xingcheng, Huang, Wenke, Yan, Sikuan, Wang, Yujun, Cao, Zixuan, Färber, Michael, Xiao, Xun, Tresp, Volker, Ma, Yunpu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection
par: Bi, Jinhe, et autres
Publié: (2025)
par: Bi, Jinhe, et autres
Publié: (2025)
ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM
par: Wang, Yujun, et autres
Publié: (2025)
par: Wang, Yujun, et autres
Publié: (2025)
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
par: Bi, Jinhe, et autres
Publié: (2024)
par: Bi, Jinhe, et autres
Publié: (2024)
Routing-Free Mixture-of-Experts
par: Liu, Yilun, et autres
Publié: (2026)
par: Liu, Yilun, et autres
Publié: (2026)
CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process
par: Bi, Jinhe, et autres
Publié: (2025)
par: Bi, Jinhe, et autres
Publié: (2025)
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning
par: Yan, Sikuan, et autres
Publié: (2025)
par: Yan, Sikuan, et autres
Publié: (2025)
PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning
par: Yan, Sikuan, et autres
Publié: (2026)
par: Yan, Sikuan, et autres
Publié: (2026)
Memory-R2: Fair Credit Assignment for Long-Horizon Memory-Augmented LLM Agents
par: Yan, Sikuan, et autres
Publié: (2026)
par: Yan, Sikuan, et autres
Publié: (2026)
OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model
par: Zhou, Xingcheng, et autres
Publié: (2025)
par: Zhou, Xingcheng, et autres
Publié: (2025)
Differentiable Quantum Architecture Search For Job Shop Scheduling Problem
par: Sun, Yize, et autres
Publié: (2024)
par: Sun, Yize, et autres
Publié: (2024)
Quantum Architecture Search with Unsupervised Representation Learning
par: Sun, Yize, et autres
Publié: (2024)
par: Sun, Yize, et autres
Publié: (2024)
Bayes or Heisenberg: Who(se) Rules?
par: Tresp, Volker, et autres
Publié: (2025)
par: Tresp, Volker, et autres
Publié: (2025)
Echo-N1: Affective RL Frontier
par: Zhang, Naifan, et autres
Publié: (2025)
par: Zhang, Naifan, et autres
Publié: (2025)
Agentic Neural Networks: Self-Evolving Multi-Agent Systems via Textual Backpropagation
par: Ma, Xiaowen, et autres
Publié: (2025)
par: Ma, Xiaowen, et autres
Publié: (2025)
SA-DQAS: Self-attention Enhanced Differentiable Quantum Architecture Search
par: Sun, Yize, et autres
Publié: (2024)
par: Sun, Yize, et autres
Publié: (2024)
GenTKG: Generative Forecasting on Temporal Knowledge Graph with Large Language Models
par: Liao, Ruotong, et autres
Publié: (2023)
par: Liao, Ruotong, et autres
Publié: (2023)
METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding
par: Wang, Mengyue, et autres
Publié: (2025)
par: Wang, Mengyue, et autres
Publié: (2025)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
par: Chen, Haokun, et autres
Publié: (2025)
par: Chen, Haokun, et autres
Publié: (2025)
MV-Debate: Multi-view Agent Debate with Dynamic Reflection Gating for Multimodal Harmful Content Detection in Social Media
par: Lu, Rui, et autres
Publié: (2025)
par: Lu, Rui, et autres
Publié: (2025)
WebPilot: A Versatile and Autonomous Multi-Agent System for Web Task Execution with Strategic Exploration
par: Zhang, Yao, et autres
Publié: (2024)
par: Zhang, Yao, et autres
Publié: (2024)
Parameter-Efficient Routed Fine-Tuning: Mixture-of-Experts Demands Mixture of Adaptation Modules
par: Liu, Yilun, et autres
Publié: (2025)
par: Liu, Yilun, et autres
Publié: (2025)
FedNano: Toward Lightweight Federated Tuning for Pretrained Multimodal Large Language Models
par: Zhang, Yao, et autres
Publié: (2025)
par: Zhang, Yao, et autres
Publié: (2025)
Echo: Decoupling Inference and Training for Large-Scale RL Alignment on Heterogeneous Swarms
par: Xiao, Jie, et autres
Publié: (2025)
par: Xiao, Jie, et autres
Publié: (2025)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
par: Liu, Rui, et autres
Publié: (2025)
par: Liu, Rui, et autres
Publié: (2025)
Echo-Path: Pathology-Conditioned Echo Video Generation
par: Muhammad, Kabir Hamzah, et autres
Publié: (2025)
par: Muhammad, Kabir Hamzah, et autres
Publié: (2025)
Backdoor Cleaning without External Guidance in MLLM Fine-tuning
par: Rong, Xuankun, et autres
Publié: (2025)
par: Rong, Xuankun, et autres
Publié: (2025)
Modeling Biological Multifunctionality with Echo State Networks
par: Leventi-Peetz, Anastasia-Maria, et autres
Publié: (2025)
par: Leventi-Peetz, Anastasia-Maria, et autres
Publié: (2025)
SwarmAgentic: Towards Fully Automated Agentic System Generation via Swarm Intelligence
par: Zhang, Yao, et autres
Publié: (2025)
par: Zhang, Yao, et autres
Publié: (2025)
EchoGéo
Publié: (2010)
Publié: (2010)
The Echo Chamber
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
The Echo Chamber
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
The Echo Chamber
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
The Echo Chamber
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
par: VENUGOPAL, RAJESHKUMAR
Publié: (2026)
Echoing Events
par: van der Vlies, Tina
Publié: (2023)
par: van der Vlies, Tina
Publié: (2023)
Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining
par: Zhao, Rosie, et autres
Publié: (2025)
par: Zhao, Rosie, et autres
Publié: (2025)
Quantitative Comparison of Multi‐Echo Spin Echo and Multi‐Echo Gradient Echo Myelin Water Imaging in a Panel of Mbp Enhancer‐Edited Mouse Lines
par: Vladimir Grouza, et autres
Publié: (2026)
par: Vladimir Grouza, et autres
Publié: (2026)
LLM Echo Chamber: personalized and automated disinformation
par: Ma, Tony
Publié: (2024)
par: Ma, Tony
Publié: (2024)
EchoScene: Indoor Scene Generation via Information Echo over Scene Graph Diffusion
par: Zhai, Guangyao, et autres
Publié: (2024)
par: Zhai, Guangyao, et autres
Publié: (2024)
EchoX: Towards Mitigating Acoustic-Semantic Gap via Echo Training for Speech-to-Speech LLMs
par: Zhang, Yuhao, et autres
Publié: (2025)
par: Zhang, Yuhao, et autres
Publié: (2025)
QuRL: Efficient Reinforcement Learning with Quantized Rollout
par: Li, Yuhang, et autres
Publié: (2026)
par: Li, Yuhang, et autres
Publié: (2026)
Documents similaires
-
PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection
par: Bi, Jinhe, et autres
Publié: (2025) -
ASCD: Attention-Steerable Contrastive Decoding for Reducing Hallucination in MLLM
par: Wang, Yujun, et autres
Publié: (2025) -
LLaVA Steering: Visual Instruction Tuning with 500x Fewer Parameters through Modality Linear Representation-Steering
par: Bi, Jinhe, et autres
Publié: (2024) -
Routing-Free Mixture-of-Experts
par: Liu, Yilun, et autres
Publié: (2026) -
CoT-Kinetics: A Theoretical Modeling Assessing LRM Reasoning Process
par: Bi, Jinhe, et autres
Publié: (2025)