Can One Domain Help Others? A Data-Centric Study on Multi-Domain Reasoning via Reinforcement Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yu, Pan, Zhuoshi, Lin, Honglin, Sun, Mengyuan, He, Conghui, Wu, Lijun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
di: Lin, Honglin, et al.
Pubblicazione: (2025)
di: Lin, Honglin, et al.
Pubblicazione: (2025)
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
di: Tang, Zinan, et al.
Pubblicazione: (2025)
di: Tang, Zinan, et al.
Pubblicazione: (2025)
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
di: Pei, Qizhi, et al.
Pubblicazione: (2025)
LEMMA: Learning from Errors for MatheMatical Advancement in LLMs
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)
CipherBank: Exploring the Boundary of LLM Reasoning Capabilities through Cryptography Challenges
di: Li, Yu, et al.
Pubblicazione: (2025)
di: Li, Yu, et al.
Pubblicazione: (2025)
IDEAL: Data Equilibrium Adaptation for Multi-Capability Language Model Alignment
di: Ming, Chenlin, et al.
Pubblicazione: (2025)
di: Ming, Chenlin, et al.
Pubblicazione: (2025)
Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning
di: Lin, Honglin, et al.
Pubblicazione: (2025)
di: Lin, Honglin, et al.
Pubblicazione: (2025)
Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
OpenDataArena: A Fair and Open Arena for Benchmarking Post-Training Dataset Value
di: Cai, Mengzhang, et al.
Pubblicazione: (2025)
di: Cai, Mengzhang, et al.
Pubblicazione: (2025)
MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
di: Lin, Honglin, et al.
Pubblicazione: (2026)
di: Lin, Honglin, et al.
Pubblicazione: (2026)
A Strategic Coordination Framework of Small LLMs Matches Large LLMs in Data Synthesis
di: Gao, Xin, et al.
Pubblicazione: (2025)
di: Gao, Xin, et al.
Pubblicazione: (2025)
Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
di: Li, Tingyu, et al.
Pubblicazione: (2025)
di: Li, Tingyu, et al.
Pubblicazione: (2025)
REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)
One for All: A Non-Linear Transformer can Enable Cross-Domain Generalization for In-Context Reinforcement Learning
di: He, Bowen, et al.
Pubblicazione: (2026)
di: He, Bowen, et al.
Pubblicazione: (2026)
Data-Centric Interpretability for LLM-based Multi-Agent Reinforcement Learning
di: Yan, John, et al.
Pubblicazione: (2026)
di: Yan, John, et al.
Pubblicazione: (2026)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning
di: Lin, Juekai, et al.
Pubblicazione: (2026)
di: Lin, Juekai, et al.
Pubblicazione: (2026)
Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
TimeDP: Learning to Generate Multi-Domain Time Series with Domain Prompts
di: Huang, Yu-Hao, et al.
Pubblicazione: (2025)
di: Huang, Yu-Hao, et al.
Pubblicazione: (2025)
Localized Dynamics-Aware Domain Adaption for Off-Dynamics Offline Reinforcement Learning
di: Xia, Zhangjie, et al.
Pubblicazione: (2026)
di: Xia, Zhangjie, et al.
Pubblicazione: (2026)
How Much Can RAG Help the Reasoning of LLM?
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets
di: Gao, Xin, et al.
Pubblicazione: (2025)
di: Gao, Xin, et al.
Pubblicazione: (2025)
When Domains Interact: Asymmetric and Order-Sensitive Cross-Domain Effects in Reinforcement Learning for Reasoning
di: Yang, Wang, et al.
Pubblicazione: (2026)
di: Yang, Wang, et al.
Pubblicazione: (2026)
LRAS: Advanced Legal Reasoning with Agentic Search
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
di: Zhou, Yujin, et al.
Pubblicazione: (2026)
Zero Reinforcement Learning Towards General Domains
di: Zeng, Yuyuan, et al.
Pubblicazione: (2025)
di: Zeng, Yuyuan, et al.
Pubblicazione: (2025)
Off-Dynamics Reinforcement Learning via Domain Adaptation and Reward Augmented Imitation
di: Guo, Yihong, et al.
Pubblicazione: (2024)
di: Guo, Yihong, et al.
Pubblicazione: (2024)
CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts
di: Lin, Jiuheng, et al.
Pubblicazione: (2025)
di: Lin, Jiuheng, et al.
Pubblicazione: (2025)
Reinforcement Learning for Chain of Thought Compression with One-Domain-to-All Generalization
di: Li, Hanyu, et al.
Pubblicazione: (2025)
di: Li, Hanyu, et al.
Pubblicazione: (2025)
Contrastive Representation for Data Filtering in Cross-Domain Offline Reinforcement Learning
di: Wen, Xiaoyu, et al.
Pubblicazione: (2024)
di: Wen, Xiaoyu, et al.
Pubblicazione: (2024)
GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
di: Wei, Jingxuan, et al.
Pubblicazione: (2025)
Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility
di: Lin, Honglin, et al.
Pubblicazione: (2026)
di: Lin, Honglin, et al.
Pubblicazione: (2026)
ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch
di: Liu, Zheng, et al.
Pubblicazione: (2026)
di: Liu, Zheng, et al.
Pubblicazione: (2026)
Cross-Domain Energy-Guided Diffusion Generation for Off-Dynamics Reinforcement Learning
di: Yang, Yu, et al.
Pubblicazione: (2026)
di: Yang, Yu, et al.
Pubblicazione: (2026)
RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
Incrementally Learning Multiple Diverse Data Domains via Multi-Source Dynamic Expansion Model
di: Wu, Runqing, et al.
Pubblicazione: (2025)
di: Wu, Runqing, et al.
Pubblicazione: (2025)
Mitigating Domain Shift in Federated Learning via Intra- and Inter-Domain Prototypes
di: Le, Huy Q., et al.
Pubblicazione: (2025)
di: Le, Huy Q., et al.
Pubblicazione: (2025)
Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures
di: He, Yu, et al.
Pubblicazione: (2025)
di: He, Yu, et al.
Pubblicazione: (2025)
Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training
di: Cao, Chuxue, et al.
Pubblicazione: (2026)
di: Cao, Chuxue, et al.
Pubblicazione: (2026)
Task and Domain Adaptive Reinforcement Learning for Robot Control
di: Liu, Yu Tang, et al.
Pubblicazione: (2024)
di: Liu, Yu Tang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer
di: Lin, Honglin, et al.
Pubblicazione: (2025) -
ScaleDiff: Scaling Difficult Problems for Advanced Mathematical Reasoning
di: Pei, Qizhi, et al.
Pubblicazione: (2025) -
Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning
di: Tang, Zinan, et al.
Pubblicazione: (2025) -
MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion
di: Pei, Qizhi, et al.
Pubblicazione: (2025) -
LEMMA: Learning from Errors for MatheMatical Advancement in LLMs
di: Pan, Zhuoshi, et al.
Pubblicazione: (2025)