Zero Reinforcement Learning Towards General Domains
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zeng, Yuyuan, Huang, Yufei, Xu, Can, Sun, Qingfeng, Yan, Jianfeng, Xu, Guanghui, Yang, Tao, Lian, Fengzong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward
von: Liu, Yile, et al.
Veröffentlicht: (2026)
von: Liu, Yile, et al.
Veröffentlicht: (2026)
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
von: Chen, Zhongzhi, et al.
Veröffentlicht: (2023)
von: Chen, Zhongzhi, et al.
Veröffentlicht: (2023)
Learning to Optimize for Reinforcement Learning
von: Lan, Qingfeng, et al.
Veröffentlicht: (2023)
von: Lan, Qingfeng, et al.
Veröffentlicht: (2023)
Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026)
OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents
von: Zhou, Yuhang, et al.
Veröffentlicht: (2026)
von: Zhou, Yuhang, et al.
Veröffentlicht: (2026)
Towards a Unified Paradigm: Integrating Recommendation Systems as a New Language in Large Models
von: Zheng, Kai, et al.
Veröffentlicht: (2024)
von: Zheng, Kai, et al.
Veröffentlicht: (2024)
More Efficient Randomized Exploration for Reinforcement Learning via Approximate Sampling
von: Ishfaq, Haque, et al.
Veröffentlicht: (2024)
von: Ishfaq, Haque, et al.
Veröffentlicht: (2024)
Diverse and Fine-Grained Instruction-Following Ability Exploration with Synthetic Data
von: Gu, Zihui, et al.
Veröffentlicht: (2024)
von: Gu, Zihui, et al.
Veröffentlicht: (2024)
WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
von: Xu, Ke, et al.
Veröffentlicht: (2026)
von: Xu, Ke, et al.
Veröffentlicht: (2026)
AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
von: Luo, Haipeng, et al.
Veröffentlicht: (2025)
von: Luo, Haipeng, et al.
Veröffentlicht: (2025)
RubricBench: Aligning Model-Generated Rubrics with Human Standards
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026)
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026)
To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models
von: Wang, Haoqing, et al.
Veröffentlicht: (2026)
von: Wang, Haoqing, et al.
Veröffentlicht: (2026)
Reinforcement Learning on Pre-Training Data
von: Li, Siheng, et al.
Veröffentlicht: (2025)
von: Li, Siheng, et al.
Veröffentlicht: (2025)
Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
von: Yang, Yu, et al.
Veröffentlicht: (2026)
von: Yang, Yu, et al.
Veröffentlicht: (2026)
Pseudo-label Based Domain Adaptation for Zero-Shot Text Steganalysis
von: Luo, Yufei, et al.
Veröffentlicht: (2024)
von: Luo, Yufei, et al.
Veröffentlicht: (2024)
Provable Zero-Shot Generalization in Offline Reinforcement Learning
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
von: Wang, Zhiyong, et al.
Veröffentlicht: (2025)
Information Science Principles of Machine Learning: A Causal Chain Meta-Framework Based on Formalized Information Mapping
von: Xu, Jianfeng
Veröffentlicht: (2025)
von: Xu, Jianfeng
Veröffentlicht: (2025)
Towards Robust Zero-Shot Reinforcement Learning
von: Zheng, Kexin, et al.
Veröffentlicht: (2025)
von: Zheng, Kexin, et al.
Veröffentlicht: (2025)
Localized Dynamics-Aware Domain Adaption for Off-Dynamics Offline Reinforcement Learning
von: Xia, Zhangjie, et al.
Veröffentlicht: (2026)
von: Xia, Zhangjie, et al.
Veröffentlicht: (2026)
Map2Traj: Street Map Piloted Zero-shot Trajectory Generation with Diffusion Model
von: Tao, Zhenyu, et al.
Veröffentlicht: (2024)
von: Tao, Zhenyu, et al.
Veröffentlicht: (2024)
Reinforcement Learning in hyperbolic space for multi-step reasoning
von: Xu, Tao, et al.
Veröffentlicht: (2025)
von: Xu, Tao, et al.
Veröffentlicht: (2025)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
von: Luo, Haipeng, et al.
Veröffentlicht: (2023)
von: Luo, Haipeng, et al.
Veröffentlicht: (2023)
Playing 20 Question Game with Policy-Based Reinforcement Learning
von: Hu, Huang, et al.
Veröffentlicht: (2018)
von: Hu, Huang, et al.
Veröffentlicht: (2018)
CRAFT-GUI: Curriculum-Reinforced Agent For GUI Tasks
von: Nong, Songqin, et al.
Veröffentlicht: (2025)
von: Nong, Songqin, et al.
Veröffentlicht: (2025)
TimeDP: Learning to Generate Multi-Domain Time Series with Domain Prompts
von: Huang, Yu-Hao, et al.
Veröffentlicht: (2025)
von: Huang, Yu-Hao, et al.
Veröffentlicht: (2025)
Towards Efficient Online Tuning of VLM Agents via Counterfactual Soft Reinforcement Learning
von: Feng, Lang, et al.
Veröffentlicht: (2025)
von: Feng, Lang, et al.
Veröffentlicht: (2025)
Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning
von: Wan, Xu, et al.
Veröffentlicht: (2026)
von: Wan, Xu, et al.
Veröffentlicht: (2026)
Weight Clipping for Deep Continual and Reinforcement Learning
von: Elsayed, Mohamed, et al.
Veröffentlicht: (2024)
von: Elsayed, Mohamed, et al.
Veröffentlicht: (2024)
WizardLM: Empowering large pre-trained language models to follow complex instructions
von: Xu, Can, et al.
Veröffentlicht: (2023)
von: Xu, Can, et al.
Veröffentlicht: (2023)
Unsupervised Industrial Anomaly Detection via Pattern Generative and Contrastive Networks
von: Huang, Jianfeng, et al.
Veröffentlicht: (2022)
von: Huang, Jianfeng, et al.
Veröffentlicht: (2022)
Absolute Zero: Reinforced Self-play Reasoning with Zero Data
von: Zhao, Andrew, et al.
Veröffentlicht: (2025)
von: Zhao, Andrew, et al.
Veröffentlicht: (2025)
ZeroS: Zero-Sum Linear Attention for Efficient Transformers
von: Lu, Jiecheng, et al.
Veröffentlicht: (2026)
von: Lu, Jiecheng, et al.
Veröffentlicht: (2026)
PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
von: Liu, Jiazhen, et al.
Veröffentlicht: (2024)
von: Liu, Jiazhen, et al.
Veröffentlicht: (2024)
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Wen, Xiaoyu, et al.
Veröffentlicht: (2024)
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
Towards a Domain-Specific Modelling Environment for Reinforcement Learning
von: Sinani, Natalie, et al.
Veröffentlicht: (2024)
von: Sinani, Natalie, et al.
Veröffentlicht: (2024)
Digital Twin-Driven Zero-Shot Fault Diagnosis of Axial Piston Pumps Using Fluid-Borne Noise Signals
von: Dong, Chang, et al.
Veröffentlicht: (2025)
von: Dong, Chang, et al.
Veröffentlicht: (2025)
NID-SLAM: Neural Implicit Representation-based RGB-D SLAM in dynamic environments
von: Xu, Ziheng, et al.
Veröffentlicht: (2024)
von: Xu, Ziheng, et al.
Veröffentlicht: (2024)
Molecular De Novo Design through Transformer-based Reinforcement Learning
von: Xu, Pengcheng, et al.
Veröffentlicht: (2023)
von: Xu, Pengcheng, et al.
Veröffentlicht: (2023)
Learning by Doing: An Online Causal Reinforcement Learning Framework with Causal-Aware Policy
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
von: Cai, Ruichu, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward
von: Liu, Yile, et al.
Veröffentlicht: (2026) -
Truth Forest: Toward Multi-Scale Truthfulness in Large Language Models through Intervention without Tuning
von: Chen, Zhongzhi, et al.
Veröffentlicht: (2023) -
Learning to Optimize for Reinforcement Learning
von: Lan, Qingfeng, et al.
Veröffentlicht: (2023) -
Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models
von: Zhang, Qiyuan, et al.
Veröffentlicht: (2026) -
OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents
von: Zhou, Yuhang, et al.
Veröffentlicht: (2026)