SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Xuan-Phi, Pandit, Shrey, Reddy, Revanth Gangi, Xu, Austin, Savarese, Silvio, Xiong, Caiming, Joty, Shafiq |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SFR-RAG: Towards Contextually Faithful LLMs
par: Nguyen, Xuan-Phi, et autres
Publié: (2024)
par: Nguyen, Xuan-Phi, et autres
Publié: (2024)
Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
par: Nguyen, Xuan-Phi, et autres
Publié: (2026)
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
par: Pandit, Shrey, et autres
Publié: (2025)
par: Pandit, Shrey, et autres
Publié: (2025)
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
par: Ming, Yifei, et autres
Publié: (2024)
par: Ming, Yifei, et autres
Publié: (2024)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
par: Xu, Austin, et autres
Publié: (2025)
par: Xu, Austin, et autres
Publié: (2025)
MAS-ZERO: Designing Multi-Agent Systems with Zero Supervision
par: Ke, Zixuan, et autres
Publié: (2025)
par: Ke, Zixuan, et autres
Publié: (2025)
SweRank: Software Issue Localization with Code Ranking
par: Reddy, Revanth Gangi, et autres
Publié: (2025)
par: Reddy, Revanth Gangi, et autres
Publié: (2025)
Demystifying Domain-adaptive Post-training for Financial LLMs
par: Ke, Zixuan, et autres
Publié: (2025)
par: Ke, Zixuan, et autres
Publié: (2025)
A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
par: Ke, Zixuan, et autres
Publié: (2025)
par: Ke, Zixuan, et autres
Publié: (2025)
MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks
par: Ke, Zixuan, et autres
Publié: (2026)
par: Ke, Zixuan, et autres
Publié: (2026)
ParaICL: Towards Parallel In-Context Learning
par: Li, Xingxuan, et autres
Publié: (2024)
par: Li, Xingxuan, et autres
Publié: (2024)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
par: Liu, Ye, et autres
Publié: (2024)
par: Liu, Ye, et autres
Publié: (2024)
Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows
par: Ming, Yifei, et autres
Publié: (2025)
par: Ming, Yifei, et autres
Publié: (2025)
SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization
par: Reddy, Revanth Gangi, et autres
Publié: (2025)
par: Reddy, Revanth Gangi, et autres
Publié: (2025)
Direct Judgement Preference Optimization
par: Wang, Peifeng, et autres
Publié: (2024)
par: Wang, Peifeng, et autres
Publié: (2024)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
par: Zhou, Yilun, et autres
Publié: (2025)
par: Zhou, Yilun, et autres
Publié: (2025)
Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse Prompts
par: Nguyen, Xuan-Phi, et autres
Publié: (2023)
par: Nguyen, Xuan-Phi, et autres
Publié: (2023)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
Discovering the Gems in Early Layers: Accelerating Long-Context LLMs with 1000x Input Token Reduction
par: Shi, Zhenmei, et autres
Publié: (2024)
par: Shi, Zhenmei, et autres
Publié: (2024)
Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research
par: Lan, Tian, et autres
Publié: (2024)
par: Lan, Tian, et autres
Publié: (2024)
StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs
par: Chen, Hailin, et autres
Publié: (2024)
par: Chen, Hailin, et autres
Publié: (2024)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
par: Panagopoulou, Artemis, et autres
Publié: (2023)
par: Panagopoulou, Artemis, et autres
Publié: (2023)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
par: Pang, Bo, et autres
Publié: (2025)
par: Pang, Bo, et autres
Publié: (2025)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
par: Niu, Tong, et autres
Publié: (2024)
par: Niu, Tong, et autres
Publié: (2024)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
par: Li, Chuyuan, et autres
Publié: (2025)
par: Li, Chuyuan, et autres
Publié: (2025)
Enterprise Deep Research: Steerable Multi-Agent Deep Research for Enterprise Analytics
par: Prabhakar, Akshara, et autres
Publié: (2025)
par: Prabhakar, Akshara, et autres
Publié: (2025)
Towards Better Generalization in Open-Domain Question Answering by Mitigating Context Memorization
par: Zhang, Zixuan, et autres
Publié: (2024)
par: Zhang, Zixuan, et autres
Publié: (2024)
Shared Imagination: LLMs Hallucinate Alike
par: Zhou, Yilun, et autres
Publié: (2024)
par: Zhou, Yilun, et autres
Publié: (2024)
CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models
par: Li, Jierui, et autres
Publié: (2024)
par: Li, Jierui, et autres
Publié: (2024)
Asynchronous Tool Usage for Real-Time Agents
par: Ginart, Antonio A., et autres
Publié: (2024)
par: Ginart, Antonio A., et autres
Publié: (2024)
LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
par: Wang, Jiayu, et autres
Publié: (2025)
par: Wang, Jiayu, et autres
Publié: (2025)
INDICT: Code Generation with Internal Dialogues of Critiques for Both Security and Helpfulness
par: Le, Hung, et autres
Publié: (2024)
par: Le, Hung, et autres
Publié: (2024)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
Infogent: An Agent-Based Framework for Web Information Aggregation
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
Modeling Uncertainty and Using Post-fusion as Fallback Improves Retrieval Augmented Generation with LLMs
par: Liu, Ye, et autres
Publié: (2023)
par: Liu, Ye, et autres
Publié: (2023)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
par: Tu, Lifu, et autres
Publié: (2023)
par: Tu, Lifu, et autres
Publié: (2023)
AGRaME: Any-Granularity Ranking with Multi-Vector Embeddings
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
par: Reddy, Revanth Gangi, et autres
Publié: (2024)
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
par: Zhou, Honglu, et autres
Publié: (2025)
par: Zhou, Honglu, et autres
Publié: (2025)
Documents similaires
-
SFR-RAG: Towards Contextually Faithful LLMs
par: Nguyen, Xuan-Phi, et autres
Publié: (2024) -
Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts
par: Nguyen, Xuan-Phi, et autres
Publié: (2026) -
Hard2Verify: A Step-Level Verification Benchmark for Open-Ended Frontier Math
par: Pandit, Shrey, et autres
Publié: (2025) -
Synthesizing Agentic Data for Web Agents with Progressive Difficulty Enhancement Mechanisms
par: Pandit, Shrey, et autres
Publié: (2025) -
FaithEval: Can Your Language Model Stay Faithful to Context, Even If "The Moon is Made of Marshmallows"
par: Ming, Yifei, et autres
Publié: (2024)