Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiao, Fangkai, Qin, Chengwei, Liu, Zhengyuan, Chen, Nancy F., Joty, Shafiq |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning
di: Wang, Bin, et al.
Pubblicazione: (2023)
di: Wang, Bin, et al.
Pubblicazione: (2023)
Exploring Self-supervised Logic-enhanced Training for Large Language Models
di: Jiao, Fangkai, et al.
Pubblicazione: (2023)
di: Jiao, Fangkai, et al.
Pubblicazione: (2023)
InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
di: Wei, Chengwei, et al.
Pubblicazione: (2026)
di: Wei, Chengwei, et al.
Pubblicazione: (2026)
Preference Optimization for Reasoning with Pseudo Feedback
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)
Relevant or Random: Can LLMs Truly Perform Analogical Reasoning?
di: Qin, Chengwei, et al.
Pubblicazione: (2024)
di: Qin, Chengwei, et al.
Pubblicazione: (2024)
Beyond Output Matching: Bidirectional Alignment for Enhanced In-Context Learning
di: Qin, Chengwei, et al.
Pubblicazione: (2023)
di: Qin, Chengwei, et al.
Pubblicazione: (2023)
NAACL2025 Tutorial: Adaptation of Large Language Models
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
di: Ke, Zixuan, et al.
Pubblicazione: (2025)
Can We Further Elicit Reasoning in LLMs? Critic-Guided Planning with Retrieval-Augmentation for Solving Challenging Tasks
di: Li, Xingxuan, et al.
Pubblicazione: (2024)
di: Li, Xingxuan, et al.
Pubblicazione: (2024)
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
di: Pandit, Shrey, et al.
Pubblicazione: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges
di: Ding, Bosheng, et al.
Pubblicazione: (2024)
di: Ding, Bosheng, et al.
Pubblicazione: (2024)
Learning from Contrasts: Synthesizing Reasoning Paths from Diverse Search Trajectories
di: Liu, Peiyang, et al.
Pubblicazione: (2026)
di: Liu, Peiyang, et al.
Pubblicazione: (2026)
ChatGPT's One-year Anniversary: Are Open-Source Large Language Models Catching up?
di: Chen, Hailin, et al.
Pubblicazione: (2023)
di: Chen, Hailin, et al.
Pubblicazione: (2023)
SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2025)
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2025)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse Prompts
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2023)
di: Nguyen, Xuan-Phi, et al.
Pubblicazione: (2023)
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
di: Masry, Ahmed, et al.
Pubblicazione: (2024)
di: Masry, Ahmed, et al.
Pubblicazione: (2024)
CodeChain: Towards Modular Code Generation Through Chain of Self-revisions with Representative Sub-modules
di: Le, Hung, et al.
Pubblicazione: (2023)
di: Le, Hung, et al.
Pubblicazione: (2023)
CrossIn: An Efficient Instruction Tuning Approach for Cross-Lingual Knowledge Alignment
di: Lin, Geyu, et al.
Pubblicazione: (2024)
di: Lin, Geyu, et al.
Pubblicazione: (2024)
A Comprehensive Survey of Contamination Detection Methods in Large Language Models
di: Ravaut, Mathieu, et al.
Pubblicazione: (2024)
di: Ravaut, Mathieu, et al.
Pubblicazione: (2024)
Self-Evolved Reward Learning for LLMs
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
di: Huang, Chenghua, et al.
Pubblicazione: (2024)
Evaluating Psychological Safety of Large Language Models
di: Li, Xingxuan, et al.
Pubblicazione: (2022)
di: Li, Xingxuan, et al.
Pubblicazione: (2022)
StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs
di: Chen, Hailin, et al.
Pubblicazione: (2024)
di: Chen, Hailin, et al.
Pubblicazione: (2024)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
di: Sun, Zhouhao, et al.
Pubblicazione: (2026)
di: Sun, Zhouhao, et al.
Pubblicazione: (2026)
The Imperfect Learner: Incorporating Developmental Trajectories in Memory-based Student Simulation
di: Liu, Zhengyuan, et al.
Pubblicazione: (2025)
di: Liu, Zhengyuan, et al.
Pubblicazione: (2025)
Process-based Self-Rewarding Language Models
di: Zhang, Shimao, et al.
Pubblicazione: (2025)
di: Zhang, Shimao, et al.
Pubblicazione: (2025)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
di: Liu, Junteng, et al.
Pubblicazione: (2025)
di: Liu, Junteng, et al.
Pubblicazione: (2025)
PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
di: Parmar, Mihir, et al.
Pubblicazione: (2025)
di: Parmar, Mihir, et al.
Pubblicazione: (2025)
Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation
di: Dai, Chengwei, et al.
Pubblicazione: (2024)
di: Dai, Chengwei, et al.
Pubblicazione: (2024)
In-Context Learning with Iterative Demonstration Selection
di: Qin, Chengwei, et al.
Pubblicazione: (2023)
di: Qin, Chengwei, et al.
Pubblicazione: (2023)
COGENT: A Curriculum-oriented Framework for Generating Grade-appropriate Educational Content
di: Liu, Zhengyuan, et al.
Pubblicazione: (2025)
di: Liu, Zhengyuan, et al.
Pubblicazione: (2025)
Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns
di: Li, Xiang, et al.
Pubblicazione: (2025)
di: Li, Xiang, et al.
Pubblicazione: (2025)
Open-RAG: Enhanced Retrieval-Augmented Reasoning with Open-Source Large Language Models
di: Islam, Shayekh Bin, et al.
Pubblicazione: (2024)
di: Islam, Shayekh Bin, et al.
Pubblicazione: (2024)
Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
di: Shi, Zhenmei, et al.
Pubblicazione: (2024)
Lifelong Event Detection with Embedding Space Separation and Compaction
di: Qin, Chengwei, et al.
Pubblicazione: (2024)
di: Qin, Chengwei, et al.
Pubblicazione: (2024)
Rewarding Graph Reasoning Process makes LLMs more Generalized Reasoners
di: Peng, Miao, et al.
Pubblicazione: (2025)
di: Peng, Miao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
di: Ke, Zixuan, et al.
Pubblicazione: (2025) -
SeaEval for Multilingual Foundation Models: From Cross-Lingual Alignment to Cultural Reasoning
di: Wang, Bin, et al.
Pubblicazione: (2023) -
Exploring Self-supervised Logic-enhanced Training for Large Language Models
di: Jiao, Fangkai, et al.
Pubblicazione: (2023) -
InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoning
di: Wei, Chengwei, et al.
Pubblicazione: (2026) -
Preference Optimization for Reasoning with Pseudo Feedback
di: Jiao, Fangkai, et al.
Pubblicazione: (2024)