Interactive Learning for LLM Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lin, Hehai, Cao, Shilei, Wang, Sudong, Wu, Haotian, Li, Minzhi, Yang, Linyi, Zheng, Juepeng, Qin, Chengwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems
par: Lin, Hehai, et autres
Publié: (2026)
par: Lin, Hehai, et autres
Publié: (2026)
AMA: Adaptive Memory via Multi-Agent Collaboration
par: Huang, Weiquan, et autres
Publié: (2026)
par: Huang, Weiquan, et autres
Publié: (2026)
Unveiling Modality Bias: Automated Sample-Specific Analysis for Multimodal Misinformation Benchmarks
par: Lin, Hehai, et autres
Publié: (2025)
par: Lin, Hehai, et autres
Publié: (2025)
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
par: Wang, Sudong, et autres
Publié: (2026)
par: Wang, Sudong, et autres
Publié: (2026)
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
par: Wu, Haotian, et autres
Publié: (2025)
par: Wu, Haotian, et autres
Publié: (2025)
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
par: Ke, Zixuan, et autres
Publié: (2025)
par: Ke, Zixuan, et autres
Publié: (2025)
Data Overvaluation Attack and Truthful Data Valuation in Federated Learning
par: Zheng, Shuyuan, et autres
Publié: (2025)
par: Zheng, Shuyuan, et autres
Publié: (2025)
CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges
par: Wang, Zi-Han, et autres
Publié: (2026)
par: Wang, Zi-Han, et autres
Publié: (2026)
RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning
par: Chen, Ziye, et autres
Publié: (2025)
par: Chen, Ziye, et autres
Publié: (2025)
Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement
par: Zhang, Yunjian, et autres
Publié: (2026)
par: Zhang, Yunjian, et autres
Publié: (2026)
COLEP: Certifiably Robust Learning-Reasoning Conformal Prediction via Probabilistic Circuits
par: Kang, Mintong, et autres
Publié: (2024)
par: Kang, Mintong, et autres
Publié: (2024)
Task-Adaptive Parameter-Efficient Fine-Tuning for Weather Foundation Models
par: Cao, Shilei, et autres
Publié: (2025)
par: Cao, Shilei, et autres
Publié: (2025)
Unearthing Gems from Stones: Policy Optimization with Negative Sample Augmentation for LLM Reasoning
par: Yang, Zhaohui, et autres
Publié: (2025)
par: Yang, Zhaohui, et autres
Publié: (2025)
ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents
par: Yang, Linyi, et autres
Publié: (2025)
par: Yang, Linyi, et autres
Publié: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
par: Dai, Chengwei, et autres
Publié: (2024)
par: Dai, Chengwei, et autres
Publié: (2024)
Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing
par: Jiao, Fangkai, et autres
Publié: (2024)
par: Jiao, Fangkai, et autres
Publié: (2024)
Efficient Reinforcement Learning with Semantic and Token Entropy for LLM Reasoning
par: Cao, Hongye, et autres
Publié: (2025)
par: Cao, Hongye, et autres
Publié: (2025)
Beyond IID: Optimizing Instruction Learning from the Perspective of Instruction Interaction and Dependency
par: Zhao, Hanyu, et autres
Publié: (2024)
par: Zhao, Hanyu, et autres
Publié: (2024)
Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat
par: Li, Chengwei, et autres
Publié: (2026)
par: Li, Chengwei, et autres
Publié: (2026)
Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems
par: Li, Mingwei, et autres
Publié: (2025)
par: Li, Mingwei, et autres
Publié: (2025)
Probing the "Psyche'' of Large Reasoning Models: Understanding Through a Human Lens
par: Chen, Yuxiang, et autres
Publié: (2025)
par: Chen, Yuxiang, et autres
Publié: (2025)
AGCD: Agent-Guided Cross-Modal Decoding for Weather Forecasting
par: Wu, Jing, et autres
Publié: (2026)
par: Wu, Jing, et autres
Publié: (2026)
OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning
par: Bi, Zhenyu, et autres
Publié: (2025)
par: Bi, Zhenyu, et autres
Publié: (2025)
AgentEscapeBench: Evaluating Out-of-Domain Tool-Grounded Reasoning in LLM Agents
par: Guo, Zhengkang, et autres
Publié: (2026)
par: Guo, Zhengkang, et autres
Publié: (2026)
CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation
par: Cao, Shilei, et autres
Publié: (2025)
par: Cao, Shilei, et autres
Publié: (2025)
How Likely Do LLMs with CoT Mimic Human Reasoning?
par: Bao, Guangsheng, et autres
Publié: (2024)
par: Bao, Guangsheng, et autres
Publié: (2024)
One Request, Multiple Experts: LLM Orchestrates Domain Specific Models via Adaptive Task Routing
par: Yang, Xu, et autres
Publié: (2025)
par: Yang, Xu, et autres
Publié: (2025)
CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation
par: Wu, Bingzhe, et autres
Publié: (2026)
par: Wu, Bingzhe, et autres
Publié: (2026)
CHAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs
par: Lu, Haotian, et autres
Publié: (2026)
par: Lu, Haotian, et autres
Publié: (2026)
Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values
par: Zhang, Hongbo, et autres
Publié: (2025)
par: Zhang, Hongbo, et autres
Publié: (2025)
Learning From Mistakes Makes LLM Better Reasoner
par: An, Shengnan, et autres
Publié: (2023)
par: An, Shengnan, et autres
Publié: (2023)
GRAIL:Learning to Interact with Large Knowledge Graphs for Retrieval Augmented Reasoning
par: Chang, Ge, et autres
Publié: (2025)
par: Chang, Ge, et autres
Publié: (2025)
Accelerate Scaling of LLM Finetuning via Quantifying the Coverage and Depth of Instruction Set
par: Wu, Chengwei, et autres
Publié: (2025)
par: Wu, Chengwei, et autres
Publié: (2025)
Learn to Think: Bootstrapping LLM Reasoning Capability Through Graph Representation Learning
par: Gao, Hang, et autres
Publié: (2025)
par: Gao, Hang, et autres
Publié: (2025)
Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs
par: Li, Jianan, et autres
Publié: (2026)
par: Li, Jianan, et autres
Publié: (2026)
Hypergraph-based Motion Generation with Multi-modal Interaction Relational Reasoning
par: Wu, Keshu, et autres
Publié: (2024)
par: Wu, Keshu, et autres
Publié: (2024)
SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition
par: Xu, Peiran, et autres
Publié: (2025)
par: Xu, Peiran, et autres
Publié: (2025)
Reason-to-Recommend: Using Interaction-of-Thought Reasoning to Enhance LLM Recommendation
par: Zhao, Keyu, et autres
Publié: (2025)
par: Zhao, Keyu, et autres
Publié: (2025)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
par: Li, Jindong, et autres
Publié: (2025)
par: Li, Jindong, et autres
Publié: (2025)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
par: Wang, Hong, et autres
Publié: (2025)
par: Wang, Hong, et autres
Publié: (2025)
Documents similaires
-
Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems
par: Lin, Hehai, et autres
Publié: (2026) -
AMA: Adaptive Memory via Multi-Agent Collaboration
par: Huang, Weiquan, et autres
Publié: (2026) -
Unveiling Modality Bias: Automated Sample-Specific Analysis for Multimodal Misinformation Benchmarks
par: Lin, Hehai, et autres
Publié: (2025) -
Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL
par: Wang, Sudong, et autres
Publié: (2026) -
FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline
par: Wu, Haotian, et autres
Publié: (2025)